Exploring the Impact of Language Switching on Personality Traits in LLMs

Evaluación y validez psicométrica2025ACL AnthologyRevisión editorial aprobada

Autores: Jacopo Amidei, Jose Gregorio Ferreira De Sá, Rubén Nieto Luna, Andreas Kaltenbrunner

Palabras clave: Large Language Models, Personality Traits, Language Switching, GPT-4o, Eysenck Personality Questionnaire-Revised (EPQR-A), Cross-language analysis

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
27
Hallazgos
82
Limitaciones
14
Evidencias

Resumen editorial

Español

Este trabajo de COLING 2025 estudia patrones de respuesta multilingües de una única versión reproducible, gpt-4o-2024-05-13, con temperatura=1 y top-p=1. En cada condición el modelo completa cien veces el EPQR-A: 24 preguntas binarias que producen puntuaciones de 0 a 6 en Extraversión (E), Neuroticismo (N), Psicoticismo (P) y Mentira o deseabilidad social (L). El primer experimento usa adaptaciones publicadas en inglés, hebreo, portugués brasileño, eslovaco, español y turco, siempre con instrucciones en inglés. Las repeticiones permiten describir la distribución de salidas condicionadas por esos prompts, pero no son personas ni cien modelos independientes.

En las versiones originales, las medias difieren poco en escala absoluta pero varias comparaciones por pares son significativas. E va de 3,05 en inglés a 4,45 en eslovaco; N, de 1,19 en turco a 3,11 en inglés; P, de 0,57 en turco a 1,59 en eslovaco; y L, de 4,79 en español a 5,54 en portugués brasileño. El artículo interpreta estas diferencias como un posible efecto de cambio de idioma. La evidencia directa, sin embargo, solo establece que el mismo snapshot genera distribuciones EPQR-A distintas bajo cuestionarios y lenguas distintas; no identifica una personalidad interna ni reproduce Cultural Frame Switching humano.

El segundo experimento intenta separar idioma y traducción comparando las adaptaciones publicadas con traducciones automáticas desde inglés mediante Google Translate. La conclusión del texto es que las diferencias son mínimas y que E y N apuntan más al idioma que a la traducción. La propia Table 1 exige más cautela: 10 de los 20 contrastes original-traducción están marcados como significativos a p≤0,01. Incluyen tres escalas en hebreo, P en portugués brasileño, P y L en eslovaco, E, N y L en español y P en turco. Sin validación humana de las traducciones, equivalencia de medida o corrección por la gran cantidad de pruebas, el diseño no permite descartar la traducción ni separar con firmeza lengua, redacción e instrumento.

El tercer experimento usa el EPQR-A inglés y ordena a GPT-4o personificar a un nativo “típico” de Estados Unidos, Australia, Reino Unido, Canadá o Irlanda, reflejar normas culturales y explicar sus decisiones. Frente al inglés genérico, E sube de 3,05 a entre 4,75 y 5,97; N va de 1,05 en Australia a 3,70 en Reino Unido; P, de 0,70 en Reino Unido a 1,83 en Irlanda; y Canadá alcanza el mayor L, 5,22. Las explicaciones recurren a clichés sobre individualismo estadounidense, el fair go australiano, cortesía británica, armonía canadiense o sociabilidad irlandesa. El hallazgo sólido es sensibilidad al rol nacional explícitamente inducido; las comparaciones descriptivas con estudios humanos históricos no demuestran alineamiento entre personalidades humanas y del modelo.

La consistencia interna es desigual. En las condiciones de idioma, E y N suelen superar alfa 0,70, pero P nunca lo hace y llega a -0,049 en inglés y -0,258 en eslovaco; L oscila entre 0,073 y 0,861. En los roles nacionales, N supera 0,70 en los cinco países, mientras P queda entre 0,323 y 0,380 y L llega a -0,100 en Canadá. El artículo no publica datos, código, efectos, intervalos, p exactas ni corrección por comparaciones múltiples, y no prueba estructura factorial, invariancia o comportamiento externo. Su aportación útil es mostrar que idioma, versión traducida y persona cultural alteran los perfiles de salida de GPT-4o; “personalidad” debe entenderse aquí como puntuación psicométrica dependiente del prompt.

English

This COLING 2025 paper studies multilingual response patterns from one reproducible version, gpt-4o-2024-05-13, with temperature=1 and top-p=1. In each condition the model completes the EPQR-A one hundred times: 24 binary questions yielding 0–6 scores for Extraversion (E), Neuroticism (N), Psychoticism (P), and Lie/social desirability (L). The first experiment uses published English, Hebrew, Brazilian Portuguese, Slovak, Spanish, and Turkish adaptations, always with English instructions. Repetitions describe prompt-conditioned output distributions, but they are neither people nor one hundred independent models.

Across the original versions, means differ modestly in absolute scale but several pairwise comparisons are significant. E ranges from 3.05 in English to 4.45 in Slovak; N from 1.19 in Turkish to 3.11 in English; P from .57 in Turkish to 1.59 in Slovak; and L from 4.79 in Spanish to 5.54 in Brazilian Portuguese. The paper interprets these differences as a possible language-switching effect. Direct evidence, however, establishes only that the same snapshot produces different EPQR-A distributions under different questionnaires and languages; it identifies no internal personality and does not reproduce human Cultural Frame Switching.

The second experiment tries to separate language from translation by comparing published adaptations with Google Translate versions produced from English. The prose concludes that differences are minimal and that E and N point more to language than translation. Table 1 itself requires more caution: 10 of 20 original-versus-translation contrasts are marked significant at p≤.01. They cover three Hebrew scales, P in Brazilian Portuguese, P and L in Slovak, E, N, and L in Spanish, and P in Turkish. Without human translation validation, measurement equivalence, or correction for the large number of tests, the design cannot rule out translation or firmly separate language, wording, and instrument effects.

The third experiment uses the English EPQR-A and directs GPT-4o to impersonate a “typical” native of the United States, Australia, the United Kingdom, Canada, or Ireland, reflect cultural norms, and explain its choices. Relative to generic English, E rises from 3.05 to between 4.75 and 5.97; N ranges from 1.05 in Australia to 3.70 in the UK; P from .70 in the UK to 1.83 in Ireland; and Canada has the highest L score, 5.22. Explanations draw on clichés about American individualism, Australian fair go, British politeness, Canadian harmony, or Irish sociability. The robust finding is sensitivity to an explicitly induced national role; descriptive comparisons with historical human studies do not establish alignment between human and model personalities.

Internal consistency is uneven. In language conditions, E and N usually exceed alpha .70, but P never does and reaches -.049 in English and -.258 in Slovak; L ranges from .073 to .861. Under national roles, N exceeds .70 in all five countries, while P lies between .323 and .380 and L reaches -.100 in Canada. The paper publishes no data, code, effect sizes, intervals, exact p-values, or multiple-comparison correction, and tests no factor structure, invariance, or external behavior. Its useful contribution is showing that language, translated version, and cultural persona alter GPT-4o output profiles; “personality” here should mean a prompt-dependent psychometric score.

Pregunta de investigación

¿Cambian las distribuciones de puntuaciones EPQR-A de GPT-4o al cambiar el idioma, cuánto de esa diferencia puede atribuirse a traducción y qué ocurre cuando se induce un rol nacional dentro de un mismo idioma?

Método

Tres experimentos con gpt-4o-2024-05-13, temperatura 1 y top-p 1. El modelo produjo cien cuestionarios completos por condición. SRQ1 comparó adaptaciones EPQR-A publicadas en seis idiomas; SRQ2 comparó cinco de esas adaptaciones con traducciones de Google Translate desde inglés; SRQ3 comparó el inglés genérico con cinco roles nacionales anglófonos inducidos mediante un system role y pidió explicaciones. Se calcularon medias, desviaciones, pruebas Mann–Whitney U bilaterales por pares y alfa de Cronbach. La auditoría leyó y renderizó las nueve páginas, verificó Tables 1–2, prompts completos, Tables A1–A2, notas y bibliografía, y contrastó metadatos y abstract con ACL Anthology.

Muestra: No hay participantes humanos. La muestra está formada por cien generaciones estocásticas del mismo snapshot por cada condición de idioma, traducción o rol nacional: seis condiciones originales, cinco traducidas y cinco nacionales, aproximadamente 1.600 perfiles completos y 38.400 respuestas binarias. Estas generaciones pueden caracterizar la distribución de salida bajo el protocolo fijado, pero no representan una población de personas ni una muestra de modelos entrenados independientemente.

Hallazgos

  • El paper se publicó en las actas principales de COLING 2025, páginas 2370–2378, con licencia CC BY 4.0.
  • El estudio identifica exactamente gpt-4o-2024-05-13 y fija temperatura y top-p en 1.
  • Cada condición se repitió cien veces con el EPQR-A de 24 ítems.
  • SRQ1 utilizó seis adaptaciones publicadas y mantuvo las instrucciones en inglés.
  • En cuestionarios originales, E varió de 3,05±2,26 en inglés a 4,45±2,04 en eslovaco.
  • En cuestionarios originales, N varió de 1,19±1,41 en turco a 3,11±2,37 en inglés.
  • En cuestionarios originales, P varió de 0,57±0,73 en turco a 1,59±0,74 en eslovaco.
  • En cuestionarios originales, L varió de 4,79±0,82 en español a 5,54±0,95 en portugués brasileño.
  • Table 1 marca numerosas diferencias por pares entre idiomas en las cuatro escalas.
  • SRQ2 comparó cinco adaptaciones publicadas con traducciones automáticas desde el inglés.
  • Diez de veinte contrastes original-traducción están marcados como significativos a p≤0,01.
  • La traducción hebrea difirió del original en N, P y L.
  • La traducción española difirió del original en E, N y L.
  • La traducción eslovaca difirió del original en P y L.
  • Las traducciones brasileña y turca difirieron de sus originales en P.
  • La afirmación de diferencias mínimas por traducción es más fuerte que la evidencia de Table 1.
  • SRQ3 indujo explícitamente cinco personajes nacionales anglófonos y pidió explicar las respuestas.
  • La Extraversión de los roles nacionales quedó entre 4,75 y 5,97 frente a 3,05 en inglés genérico.
  • Australia tuvo N=1,05±1,62 y Reino Unido N=3,70±1,72.
  • Reino Unido tuvo P=0,70±0,66 e Irlanda P=1,83±0,47.
  • Canadá alcanzó el L más alto, 5,22±0,61.
  • Las explicaciones generadas utilizan estereotipos nacionales, hecho reconocido por los autores.
  • En condiciones originales, alfa de E fue 0,798–0,909 y alfa de N 0,711–0,893.
  • P mostró baja consistencia en todas las condiciones y alfa negativo en inglés (-0,049) y eslovaco (-0,258).
  • En los roles nacionales, alfa de N fue 0,757–0,862, P fue 0,323–0,380 y L llegó a -0,100 en Canadá.
  • Table A1 muestra alfas aceptables de L en algunas condiciones y de E en Reino Unido y Canadá que el resumen de fiabilidad del texto no menciona.
  • El estudio demuestra sensibilidad del perfil de salida al idioma, traducción y persona inducida, no una personalidad interna estable.

Limitaciones

  • Solo se evalúa un proveedor y un modelo.
  • Solo se evalúa el snapshot gpt-4o-2024-05-13.
  • No se replica con otras versiones de GPT-4o.
  • No se replica con modelos de otras familias.
  • No se usan modelos abiertos que permitan inspeccionar pesos o entrenamiento.
  • No se informan las fechas exactas de las llamadas a la API.
  • No se informa región, cuenta o endpoint de servicio.
  • No se informa versión de SDK o código de ejecución.
  • No se registran semillas de generación.
  • Los placeholders de arquitectura, cutoff y fecha del prompt no se rellenan en el apéndice publicado.
  • No se publica el código.
  • No se publican las respuestas crudas.
  • No se publica una tabla con p-valores exactos.
  • No se publican tamaños de efecto para las comparaciones.
  • No se publican intervalos de confianza.
  • No se informa prerregistro.
  • No se formula una hipótesis direccional previa para cada idioma y escala.
  • No se justifica por potencia el uso de cien repeticiones.
  • Los perfiles son repeticiones de un mismo modelo y no modelos entrenados independientemente.
  • La inferencia solo puede referirse a la distribución condicional de esta configuración.
  • No se comprueba independencia técnica entre llamadas o efectos de caché y rate limiting.
  • Las puntuaciones están acotadas entre 0 y 6 y contienen numerosos empates.
  • No se explica cómo se trataron los empates en Mann–Whitney U.
  • No se aplican modelos jerárquicos que separen ítem, idioma y repetición.
  • Se realizan decenas de comparaciones por pares en cada tabla.
  • No se declara corrección por comparaciones múltiples.
  • A p≤0,05 cabe esperar falsos positivos incluso bajo ausencia de efecto.
  • La significación se codifica mediante muchas banderas y subrayados sin estadísticos completos.
  • No se informa un criterio global multivariante antes de los contrastes por pares.
  • Las diferencias significativas pueden ser pequeñas en una escala de seis puntos.
  • El EPQR-A fue validado para autoinforme humano, no para modelos generativos.
  • No se valida la estructura factorial de cuatro escalas en las respuestas del modelo.
  • No se comprueba invariancia de medida entre idiomas.
  • No se comprueba invariancia entre cuestionarios originales y traducciones automáticas.
  • No se estudia test-retest temporal con fechas separadas.
  • Alfa mide covariación entre ítems, no estabilidad de personalidad del modelo.
  • Alfa se estima sobre salidas estocásticas condicionadas por el mismo prompt.
  • P presenta alfa muy bajo o negativo en todas las familias de condiciones.
  • L presenta alfa muy variable y llega a ser negativo.
  • La prosa de fiabilidad omite algunos alfas mayores de 0,70 presentes en Table A1.
  • No se evalúa validez convergente con otro inventario.
  • No se evalúa validez discriminante.
  • No se usa conducta externa como criterio.
  • No se prueba si los perfiles predicen respuestas en conversación libre.
  • La escala L no equivale directamente a honestidad o integridad.
  • La interpretación cualitativa trata L como honestidad y conformidad de forma simplificada.
  • Las adaptaciones publicadas pueden diferir en redacción y propiedades psicométricas.
  • Idioma y versión concreta del cuestionario están confundidos en SRQ1.
  • SRQ2 utiliza únicamente Google Translate.
  • No intervienen traductores humanos en la evaluación de las versiones automáticas.
  • No se hace traducción inversa ni puntuación de calidad.
  • Diez de veinte contrastes original-traducción son significativos, en tensión con la descripción de variación mínima.
  • Las instrucciones permanecen en inglés aunque el cuestionario cambia de idioma.
  • No se prueba si traducir también las instrucciones altera los resultados.
  • No se controla tokenización, longitud o frecuencia léxica entre idiomas.
  • No se prueba robustez a paráfrasis de los ítems.
  • No se prueba robustez al orden de preguntas.
  • No se prueba robustez a temperatura o top-p distintos.
  • No se descarta memorización o exposición previa a EPQR-A y sus adaptaciones.
  • SRQ3 instruye explícitamente al modelo para producir conducta nacional típica.
  • Las diferencias nacionales están inducidas por el rol y no son espontáneas.
  • El prompt pide coherencia con normas y expresiones culturales, favoreciendo estereotipos.
  • El prompt combina país, cultura, personalidad y expectativas del usuario.
  • No existe una condición nacional neutral con la misma longitud de prompt.
  • Los países completos se tratan como culturas homogéneas.
  • No se modelan regiones, clases, etnias, edades o variación individual.
  • Solo se incluyen cinco países anglófonos occidentales.
  • No se prueban dialectos o variedades regionales del inglés.
  • Las explicaciones se generan después de las respuestas y pueden ser racionalizaciones post hoc.
  • La evaluación cualitativa de explicaciones no describe un esquema de codificación.
  • No se informan evaluadores, cegamiento o acuerdo interevaluador.
  • Table A2 publica solo dos ejemplos por país.
  • Las comparaciones con humanos son descriptivas y proceden de estudios históricos distintos.
  • No participa una muestra humana contemporánea bajo el mismo protocolo.
  • No se aplican pruebas directas de equivalencia entre salidas del modelo y datos humanos.
  • Las similitudes humanas destacadas son parciales y también existen discrepancias no formalizadas.
  • Cultural Frame Switching es una teoría sobre cognición humana y su transferencia al LLM no se valida.
  • El estudio no identifica mecanismos internos que expliquen las diferencias.
  • No separa entrenamiento multilingüe, alineamiento, tokenización y obediencia al prompt.
  • Los resultados son una instantánea de 2024 y no describen GPT-4o actual.
  • No hay replicación independiente.
  • El artículo se presenta como preliminar y reconoce necesidad de más idiomas, países, tests y modelos.

Qué no demuestra

  • No demuestra que GPT-4o tenga una personalidad interna humana.
  • No demuestra Cultural Frame Switching cognitivo en un modelo.
  • No demuestra que cambiar de idioma cause un cambio psicológico interno.
  • No descarta que las diferencias procedan de traducción o redacción.
  • No demuestra equivalencia del EPQR-A entre idiomas para LLM.
  • No valida EPQR-A como medida de personalidad artificial.
  • No demuestra fiabilidad adecuada en las cuatro escalas.
  • No demuestra alineamiento estadístico con poblaciones humanas.
  • No demuestra que los roles nacionales representen personas de esos países.
  • No demuestra que los estereotipos aparezcan sin una instrucción que los solicite.
  • No demuestra estabilidad entre snapshots, fechas o configuraciones.
  • No demuestra que los perfiles predigan conducta conversacional.
  • No identifica si el efecto procede de entrenamiento, tokenización o alineamiento.
  • No permite generalizar a otros modelos, cuestionarios o culturas.
  • No justifica interpretar cada perfil puntuado como una identidad persistente.

Trazabilidad

Alcance: Texto completo

Versión: COLING 2025 main conference paper, ACL Anthology 2025.coling-main.162, pp. 2370–2378; CC BY 4.0

Fuente consultada: https://aclanthology.org/2025.coling-main.162/

Revisión: Codex full-text, visual, bilingual-fidelity, multilingual-method, psychometric-validity, multiple-testing, prompt-induction, stereotype-claim and source-transparency audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI gpt-4o-2024-05-13 with temperature 1 and top-p 1

Instrumentos y métricas

  • Eysenck Personality Questionnaire-Revised Abbreviated, EPQR-A: 24 binary items
  • EPQR-A Extraversion scale: six items, score 0–6
  • EPQR-A Neuroticism scale: six items, score 0–6
  • EPQR-A Psychoticism scale: six items, score 0–6
  • EPQR-A Lie or social-desirability scale: six items, score 0–6
  • Published English, Hebrew, Brazilian Portuguese, Slovak, Spanish and Turkish EPQR-A adaptations
  • Google Translate versions from English into five languages
  • Five country-persona prompts for USA, Australia, UK, Canada and Ireland
  • Two-sided Mann–Whitney U pairwise comparisons
  • Cronbach alpha across 100 generated response profiles per condition
  • Qualitative inspection of generated country explanations

Datos utilizados

  • Six original-language conditions with 100 generated EPQR-A profiles per condition
  • Five Google-translated conditions with 100 generated EPQR-A profiles per condition
  • Five English-speaking country-persona conditions with 100 generated EPQR-A profiles per condition
  • Approximately 1,600 generated 24-item profiles across the 16 reported conditions
  • Aggregate means and standard deviations in Tables 1–2
  • Condition-level Cronbach alpha values in Table A1
  • Two selected generated explanations per country in Table A2
  • No public raw-response or analysis dataset identified

Evidencia y localización

  • Identidad bibliográfica y licencia: ACL Anthology 2025.coling-main.162; COLING 2025; pp. 2370–2378; CC BY 4.0
  • PDF completo inspeccionado: .cache/editorial-sources/article-081/source.pdf; ACL Anthology; sha256 ef29b16f278ad051e4600d806b2062c9fda8beb1f3fcf3e733b9b6c0dbdbf90f
  • Modelo y parámetros de generación: Footnote 1, paper p. 2370: gpt-4o-2024-05-13, temperature=1, top-p=1
  • Diseño de tres experimentos y cien ensayos: Methods, Experimental Setups, paper p. 2372
  • Medias, desviaciones y diferencias de idiomas y traducciones: Table 1 and SRQ1–SRQ2 Results, paper pp. 2372–2373
  • Diez contrastes original-traducción significativos: Table 1 dagger markers, paper p. 2372; arithmetic audit 15 Jul 2026
  • Resultados de cinco roles nacionales: Table 2 and SRQ3 Results, paper p. 2373
  • Uso reconocido de estereotipos: SRQ3 qualitative discussion, paper p. 2373; Abstract and Conclusions
  • Prompts de idiomas y rol nacional: Appendix A, paper p. 2377
  • Valores completos de alfa: Table A1, paper p. 2377
  • Ejemplos de explicaciones nacionales: Table A2, paper p. 2378
  • Límites reconocidos y futuras extensiones: Limitations and future work, paper pp. 2374–2375
  • Ausencia de artefactos reproducibles publicados: ACL Anthology record and complete paper inspected 15 Jul 2026; no code or data link reported
  • Lectura y comprobación visual integral: All 9 PDF pages rendered and inspected, including Tables 1–2 and Appendices A–C; checked 15 Jul 2026