Is persona enough for personality? Using ChatGPT to reconstruct an agent's latent personality from simple descriptions

Evaluación y validez psicométrica2024arXivRevisión editorial aprobada

Autores: Yongyi Ji, Zhisheng Tang, Mayank Kejriwal

Palabras clave: HEXACO personality framework, personality reconstruction, persona modeling, socio-demographic factors, personality consistency, latent dimensions, agent simulation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
24
Hallazgos
40
Limitaciones
19
Evidencias

Resumen editorial

Español

El trabajo pregunta si GPT-3.5-Turbo y GPT-4-Turbo pueden recuperar un perfil HEXACO a partir de una persona textual. Cada persona combina una frase sociodemográfica, edad, género binario, estado civil, ingresos y número de hijos, con diez frases de personalidad: se eligen cinco de las seis dimensiones HEXACO, se asigna a cada una un polo alto o bajo y se omite deliberadamente la sexta. GPT-3.5 genera previamente dos frases para cada polo a partir de descripciones HEXACO y también reordena las once frases. Después el modelo evaluado responde los 60 ítems HEXACO en escala 1-5 con temperatura 0; la media de cada dimensión se dicotomiza como alta si es mayor que 2,5 y baja en caso contrario. Se prueban 1.000 personas con GPT-3.5 y una submuestra de 100 con GPT-4, lo que produce 5.000 y 500 comparaciones en dimensiones descritas, respectivamente. GPT-3.5 coincide con el polo asignado en 3.594 de 5.000 casos, 71,88 %, pero el agregado oculta diferencias extremas: 78,51 % en honestidad-humildad, 97,81 % en emocionalidad, 47,96 % en extraversión, 94,88 % en amabilidad, 60,87 % en responsabilidad y 51,92 % en apertura. De sus 1.406 errores, 1.393, 99,08 %, convierten un polo bajo en alto. GPT-4 alcanza 381 de 500, 76,20 %, con 92,68 %, 100 %, 79,22 %, 60,49 %, 55,06 % y 71,26 % por dimensión; 87 de sus 119 errores son bajo→alto y 32 alto→bajo, todos estos últimos en amabilidad. Cuando la dimensión no aparece en la persona, GPT-3.5 la clasifica alta en 986 de 1.000 casos, 98,6 %, y GPT-4 en 89 de 100. Esto documenta un fuerte valor por defecto del protocolo, no una reconstrucción fiable de información latente. El propio diseño favorece “alto”: el prompt obliga a responder aun con incertidumbre y el umbral >2,5 clasifica una respuesta neutral de 3 como alta. Además, la manipulación está contaminada antes del test: las descripciones supuestamente altas de emocionalidad, extraversión y amabilidad incluyen una segunda frase propia del polo bajo. La de extraversión alta, por ejemplo, combina disfrute social con incomodidad al ser el centro de atención y preferencia por ser reservado; la de amabilidad alta combina cooperación con rencor, crítica e ira. Por tanto, parte de la inconsistencia mide contradicciones generadas por GPT-3.5, no incapacidad para inferir un rasgo bien especificado. Las 77 pruebas ANOVA de la Tabla 2 informan solo p-valores, sin tamaños de efecto ni corrección por multiplicidad; aplican ANOVA univariante a resultados dicotómicos y el agregado concatena seis dimensiones sin explicar la dependencia. Edad y número de hijos son significativos en el agregado, pero las variables demográficas no fueron aleatorizadas de forma independiente: las reglas de construcción vinculan edad, matrimonio e hijos. No hay personas reales, validación humana de las personas, repetición, análisis psicométrico de HEXACO en LLM, código, datos ni instantáneas exactas de los modelos. La conclusión defendible es que modelos de 2024 siguen instrucciones conductuales explícitas de forma desigual y tienden a contestar el HEXACO hacia polos altos; no que reconstruyan una personalidad humana latente ni que las asociaciones demográficas sean psicológicamente válidas.

English

The paper asks whether GPT-3.5-Turbo and GPT-4-Turbo can recover a HEXACO profile from a textual persona. Each persona combines one demographic sentence, age, binary gender, marital status, income, and number of children, with ten personality sentences: five of the six HEXACO dimensions are selected, each is assigned a high or low pole, and the sixth is deliberately omitted. GPT-3.5 first generates two sentences for each pole from HEXACO descriptions and also reorders the resulting eleven sentences. The evaluated model then answers all 60 HEXACO items on a 1-5 scale at temperature 0; each dimension's mean is dichotomized as high when above 2.5 and low otherwise. The study tests 1,000 personas with GPT-3.5 and a 100-person subset with GPT-4, yielding 5,000 and 500 comparisons on described dimensions. GPT-3.5 matches the assigned pole in 3,594 of 5,000 cases, 71.88%, but the aggregate conceals extreme variation: 78.51% for Honesty-Humility, 97.81% for Emotionality, 47.96% for Extraversion, 94.88% for Agreeableness, 60.87% for Conscientiousness, and 51.92% for Openness. Of 1,406 errors, 1,393-99.08%, change a low assignment to high. GPT-4 reaches 381 of 500-76.20%, with per-dimension rates of 92.68%, 100%, 79.22%, 60.49%, 55.06%, and 71.26%; 87 of its 119 errors are low-to-high, while 32 are high-to-low, all for Agreeableness. When a dimension is absent from the persona, GPT-3.5 classifies it as high in 986 of 1,000 cases, 98.6%, and GPT-4 in 89 of 100. This documents a strong protocol default rather than reliable reconstruction of latent information. The design itself favors high: the prompt forces an answer despite uncertainty, and the >2.5 cutoff classifies a neutral response of 3 as high. The manipulation is also contaminated before testing: supposedly high descriptions for Emotionality, Extraversion, and Agreeableness contain a second sentence characteristic of the low pole. High Extraversion, for example, combines social enjoyment with awkwardness under attention and a preference for being reserved; high Agreeableness combines cooperation with grudges, criticism, and anger. Some inconsistency therefore measures GPT-3.5-generated contradictions, not failure to infer a well-specified trait. The 77 ANOVA tests in Table 2 report only p-values, without effect sizes or multiplicity correction; they apply univariate ANOVA to dichotomized outcomes, and the aggregate concatenates six dimensions without explaining dependence. Age and number of children are significant in the aggregate, but demographic variables were not randomized independently: construction rules couple age, marriage, and children. There are no real participants, human validation of personas, repetitions, psychometric validation of HEXACO for LLMs, code, data, or exact model snapshots. The defensible conclusion is that 2024 models follow explicit behavioral instructions unevenly and tend to answer HEXACO toward high poles, not that they reconstruct latent human personality or psychologically valid demographic associations.

Pregunta de investigación

¿Con qué consistencia GPT-3.5-Turbo y GPT-4-Turbo reproducen polos HEXACO explícitos desde descripciones de persona, qué valor asignan a una dimensión omitida y qué variables sociodemográficas o de personalidad se asocian con las dimensiones reconstruidas?

Método

Se generan aleatoriamente personas sintéticas con cinco atributos sociodemográficos sujetos a tres restricciones y cinco de seis dimensiones HEXACO en polos binarios. GPT-3.5-Turbo convierte descripciones oficiales de cada polo en dos frases y reordena una frase demográfica más diez frases de personalidad. Con esa persona como system message, el modelo responde los 60 ítems HEXACO con valores 1-5 a temperatura 0. Tras invertir los ítems correspondientes, se promedian diez ítems por dimensión y se clasifica como alto si la media es >2,5. Se evalúan 1.000 personas en GPT-3.5 y 100 de ellas en GPT-4. Se comparan polos asignados y reconstruidos, se estudia la dimensión omitida y se ejecutan ANOVA univariantes para relacionar once variables de entrada con seis salidas y una salida agregada.

Muestra: El experimento no incluye personas. Cada una de las 1.000 personas sintéticas aporta cinco dimensiones descritas, para 5.000 comparaciones en GPT-3.5; GPT-4 usa 100 personas y 500 comparaciones. La dimensión omitida produce otras 1.000 y 100 clasificaciones. Los intervalos de edad son 18-29, 30-49, 50-64 y 65-80; género se limita a male/female; estado civil a single/married/divorced; ingresos a tres intervalos; e hijos a cero, uno o más de uno.

Hallazgos

  • GPT-3.5 coincide con el polo descrito en 3.594 de 5.000 dimensiones, 71,88 %.
  • Su consistencia varía de 97,81 % en emocionalidad y 94,88 % en amabilidad a 47,96 % en extraversión.
  • Las tasas GPT-3.5 restantes son 78,51 % en honestidad-humildad, 60,87 % en responsabilidad y 51,92 % en apertura.
  • De 1.406 errores GPT-3.5, 1.393 son bajo→alto y solo 13 alto→bajo; estos trece ocurren en amabilidad.
  • Para extraversión baja, GPT-3.5 reconstruye 433 como alta y solo 3 como baja; la exactitud del polo bajo es 0,69 %.
  • Para responsabilidad baja, GPT-3.5 acierta 95 de 426; para apertura baja, 39 de 439.
  • GPT-4 coincide en 381 de 500 dimensiones, 76,20 %, solo 4,32 puntos por encima del agregado GPT-3.5.
  • GPT-4 alcanza 100 % en emocionalidad, 92,68 % en honestidad-humildad y 79,22 % en extraversión.
  • GPT-4 baja a 60,49 % en amabilidad, 55,06 % en responsabilidad y 71,26 % en apertura.
  • En GPT-4, 87 errores son bajo→alto y 32 alto→bajo; los 32 alto→bajo pertenecen a amabilidad.
  • Con la dimensión omitida, GPT-3.5 responde alta en 986 de 1.000 casos y GPT-4 en 89 de 100.
  • El default alto aparece en las seis dimensiones y solo produce 14 polos bajos omitidos en GPT-3.5 y 11 en GPT-4.
  • El umbral >2,5 clasifica la respuesta neutral 3 como alta y el prompt prohíbe abstenerse, dos decisiones que empujan el resultado hacia alto.
  • Las descripciones altas de emocionalidad, extraversión y amabilidad contienen frases semánticamente propias del polo bajo.
  • La descripción alta de amabilidad mezcla perdón y cooperación con rencor, crítica y enfado; GPT-4 reconstruye 32 de 51 casos altos como bajos.
  • La descripción alta de extraversión mezcla sociabilidad con incomodidad bajo atención y preferencia por reserva.
  • La descripción alta de emocionalidad mezcla búsqueda de apoyo con ausencia de miedo y desapego emocional.
  • La Tabla 2 informa 77 p-valores correspondientes a once variables de entrada por siete salidas.
  • En el agregado, edad tiene p=0,00842 y número de hijos p=9,96e-06; las demás variables demográficas no son significativas en esa columna.
  • Ingresos y género se asocian con emocionalidad; género también con responsabilidad; estado civil y número de hijos con algunos rasgos individuales.
  • Todas las dimensiones de personalidad de entrada salvo extraversión muestran asociación con la salida agregada.
  • La celda edad→honestidad-humildad muestra p=0,03009 pero carece del asterisco que la leyenda asignaría a p<0,05.
  • El registro arXiv confirma una única versión, aceptada en el ICML 2024 Workshop on Large Language Models and Cognition.
  • No se identificó una publicación oficial de código, personas, respuestas, resultados o semillas.

Limitaciones

  • El experimento mide seguimiento de instrucciones que describen conductas HEXACO explícitas, no inferencia desde una persona mínima o indirecta.
  • Las frases de entrada y los ítems de salida comparten contenido semántico estrecho, por lo que existe circularidad conceptual.
  • GPT-3.5 genera las manipulaciones que luego GPT-3.5 evalúa, sin revisión humana de claridad, polaridad o contradicción.
  • Tres de seis descripciones altas contienen contenido del polo bajo, invalidando una manipulación limpia.
  • La inconsistencia por dimensión mezcla capacidad del modelo con errores de construcción del estímulo.
  • Los rasgos continuos HEXACO se reducen a alto/bajo y se pierde intensidad, facetas e incertidumbre.
  • El punto de corte 2,5 no se justifica psicométricamente y sitúa neutral=3 en el polo alto.
  • Forzar una respuesta incluso cuando el modelo no está seguro impide medir ausencia de información o calibración.
  • Llamar hallucination a completar una dimensión omitida confunde una respuesta forzada a un cuestionario con una afirmación factual inventada.
  • No hay una condición sin descripción de personalidad que estime el baseline del modelo bajo el mismo cuestionario.
  • No se compara el umbral con alternativas como 3, intervalos neutrales o puntuaciones continuas.
  • No se evalúa fiabilidad interna, estructura factorial, invariancia, validez convergente ni test-retest del HEXACO aplicado al LLM.
  • Temperatura 0 no garantiza reproducibilidad de una API remota ni sustituye repeticiones.
  • No se publican instantáneas exactas de GPT-3.5-Turbo y GPT-4-Turbo.
  • No hay repeticiones por persona, intervalos de confianza ni análisis de sensibilidad a orden y formulación.
  • La reordenación con GPT-3.5 añade una transformación no auditada y puede modificar asociaciones contextuales pese a conservar frases.
  • La selección aleatoria de dimensiones, polos, edades e ingresos no incluye semillas ni código.
  • GPT-4 usa solo una décima parte de las personas y el artículo no demuestra que sea una muestra estratificada por polos y demografía.
  • Las tasas agregadas ponderan dimensiones con tamaños distintos debido a la dimensión omitida aleatoriamente.
  • El 71,88 % oculta rendimiento cercano o inferior al azar en tres dimensiones y casi nulo para algunos polos bajos.
  • El sesgo alto puede provenir conjuntamente del modelo, el cutoff, los ítems, la respuesta forzada y las frases contaminadas; el diseño no los separa.
  • Las matrices no incluyen intervalos ni pruebas de diferencia entre modelos o dimensiones.
  • Las 77 pruebas ANOVA no aplican corrección por comparaciones múltiples.
  • Solo se publican p-valores, sin tamaños de efecto, medias, varianzas, grados de libertad o supuestos.
  • ANOVA con salida dicotómica puede violar normalidad y homocedasticidad; un modelo binomial habría sido más apropiado.
  • La salida agregada concatena seis dimensiones correlacionadas y múltiples observaciones por persona, violando independencia si se trata como una sola variable.
  • Las pruebas son univariantes y no controlan simultáneamente las demás variables.
  • Edad, estado civil e hijos están vinculados por reglas explícitas, por lo que sus asociaciones están confundidas por construcción.
  • Ingresos se generan en tres intervalos sin región, moneda contextualizada o distribución poblacional representativa.
  • Género se restringe a male/female y la estructura familiar a categorías normativas simples.
  • Las variables sociodemográficas son ficticias y no existe evidencia humana que permita interpretar sus asociaciones como psicología real.
  • No se estudia interacción entre demografía y frase de personalidad, pese a que el artículo recomienda información sociodemográfica completa.
  • La inconsistencia de asterisco para p=0,03009 muestra un error editorial en la tabla de significación.
  • El artículo no incluye sección específica de limitaciones, evaluación de sesgo demográfico o análisis de daño.
  • No se evalúan idiomas, culturas, modelos abiertos, modelos no GPT ni versiones posteriores.
  • No hay conversaciones, memoria, acciones o decisiones que prueben estabilidad conductual de los agentes.
  • No se compara con evaluación humana de las mismas personas ni con perfiles humanos HEXACO conocidos.
  • No se publican código, datos, personas, respuestas, logs o resultados ANOVA para auditoría independiente.
  • La única versión arXiv no documenta revisiones posteriores o correcciones de las contradicciones de Table 1.
  • El Impact Statement se limita a describir la relevancia para agentes y no aborda personificación, estereotipos o usos de perfilado.

Qué no demuestra

  • No demuestra que GPT-3.5 o GPT-4 tengan una personalidad latente.
  • No demuestra que reconstruyan personalidad humana desde descripciones sociodemográficas simples.
  • No demuestra validez psicométrica de HEXACO para agentes LLM.
  • No demuestra consistencia alta en todas las dimensiones o ambos polos.
  • No demuestra que GPT-4 supere de forma robusta a GPT-3.5; no hay prueba estadística y varias dimensiones siguen débiles.
  • No demuestra que la dimensión omitida se infiera; muestra principalmente un default alto bajo respuesta obligatoria.
  • No demuestra que el default alto sea únicamente un sesgo del modelo y no un artefacto del cutoff.
  • No demuestra que una persona textual bien construida cause los errores, porque tres manipulaciones altas son contradictorias.
  • No demuestra efectos causales independientes de edad o número de hijos.
  • No demuestra asociaciones demográficas válidas en personas reales.
  • No demuestra que los p-valores sobrevivan corrección por 77 comparaciones.
  • No demuestra estabilidad entre repeticiones, versiones de API, órdenes o prompts.
  • No demuestra generalización a otras culturas, idiomas, modelos o instrumentos de personalidad.
  • No demuestra que estos perfiles produzcan comportamiento consistente en conversaciones o tareas externas.
  • No permite reproducir los resultados desde artefactos oficiales publicados.
  • No establece que agentes construidos así sean realistas, seguros o adecuados para simulación social.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2406.12216v1, submitted 18 Jun 2024, 9 pages; accepted to the ICML 2024 Workshop on Large Language Models and Cognition; no official code or data release identified in the paper, arXiv/OpenReview records, or targeted author/project search

Fuente consultada: https://arxiv.org/pdf/2406.12216

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, HEXACO, prompt-contamination, dichotomization, per-pole consistency, omitted-dimension, ANOVA, demographic-confounding, reproducibility, release, bias and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-3.5-Turbo, instantánea no especificada, como generador, reordenador y modelo evaluado
  • GPT-4-Turbo, instantánea no especificada, como modelo evaluado en 100 personas
  • OpenAI API a temperatura 0

Instrumentos y métricas

  • HEXACO-60, diez ítems por dimensión y escala 1-5
  • Seis dimensiones HEXACO: honestidad-humildad, emocionalidad, extraversión, amabilidad, responsabilidad y apertura
  • Descripciones binarias alto/bajo generadas por GPT-3.5 desde definiciones oficiales
  • Umbral de dicotomización: media >2,5 alta; media <=2,5 baja
  • Matrices de consistencia por dimensión
  • ANOVA de una vía y p-valores sin tamaños de efecto

Datos utilizados

  • 1.000 personas sintéticas para GPT-3.5-Turbo
  • Submuestra de 100 de esas personas para GPT-4-Turbo
  • 60.000 respuestas HEXACO de GPT-3.5 y 6.000 de GPT-4 implícitas por el protocolo, no publicadas
  • Cinco atributos sociodemográficos sintéticos por persona
  • Diez frases de cinco polos HEXACO por persona y una dimensión omitida

Evidencia y localización

  • Registro, versión y aceptación: arXiv:2406.12216v1, submitted 18 Jun 2024; accepted to ICML 2024 Workshop on Large Language Models and Cognition
  • Fuente completa auditada: .cache/editorial-sources/article-101/source.pdf; official arXiv PDF; 9 pages; sha256 3030a6e640dadbc7ead0f4d5425e459f552cea5584a3617fb0250ca59a9af469
  • Objetivo y claims: Full text pp. 1-2, Abstract and Introduction
  • Variables sociodemográficas y restricciones: Full text p. 2, section 2
  • Construcción de frases HEXACO y contradicciones: Full text pp. 2-3, section 2 and Table 1
  • HEXACO-60, prompt y muestras: Full text p. 3, section 3
  • Consistencia agregada y sesgo bajo-alto: Full text p. 3 and appendix p. 6, section 4 and Figure 1
  • ANOVA y asociaciones: Full text p. 4, Table 2 and section 4
  • Interpretación de los autores: Full text p. 4, Discussion and Impact Statement
  • Punto de corte y scoring: Appendix p. 6 and p. 9, section A.1 and Table 8
  • Prompt de generación de frases: Appendix p. 6, Table 3
  • Dimensiones omitidas GPT-3.5: Appendix p. 7, Figure 2: 986 high and 14 low across 1,000 omitted dimensions
  • Prompt de reordenación: Appendix p. 7, Table 4
  • Ítems completos y matrices por dimensión: Appendix p. 8, Tables 5-7
  • Dimensiones omitidas GPT-4: Appendix p. 9, Figure 3: 89 high and 11 low across 100 omitted dimensions
  • Recálculo independiente GPT-3.5: Table 6 cross-check: per-dimension consistency 78.51%, 97.81%, 47.96%, 94.88%, 60.87%, 51.92%; total 3,594/5,000
  • Recálculo independiente GPT-4: Table 7 cross-check: per-dimension consistency 92.68%, 100%, 79.22%, 60.49%, 55.06%, 71.26%; total 381/500
  • Artefactos no identificados: Paper, arXiv/OpenReview records and targeted official author/project search checked 15 Jul 2026; no official code or data release located
  • Comprobación visual integral: All 9 PDF pages rendered and visually inspected, including eight tables, three figures, all prompts, HEXACO items, scoring rules, matrices, ANOVA and Impact Statement; checked 15 Jul 2026