Evaluating the ability of large language models to emulate personality

Evaluación y validez psicométrica2026Scientific ReportsRevisión editorial aprobada

Autores: Yilei Wang, Jiabao Zhao, Deniz S. Ones, Liang He, Xin Xu

Palabras clave: Large Language Models, Personality emulation, GPT-4, Big Five personality profiles, Role-playing

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
8
Hallazgos
12
Limitaciones
11
Evidencias

Resumen editorial

Español

Este artículo de Scientific Reports evalúa si GPT-4 puede reconstruir respuestas al IPIP-BFM-50 al representar perfiles humanos definidos por sus cinco puntuaciones Big Five. En la simulación 1 se filtra la base OpenPsychometrics hasta 603.322 casos completos sin IP duplicada y se muestrean 400 con semilla 42. Para cada persona, el prompt entrega explícitamente a la versión de marzo de 2023 de GPT-4 las puntuaciones de extraversión, amabilidad, responsabilidad, estabilidad emocional y apertura, cada una entre 0 y 40; en el turno siguiente se le pide contestar los mismos 50 ítems que originaron esas puntuaciones. Este diseño prueba si el modelo convierte cinco objetivos agregados en respuestas coherentes con la clave del inventario, no si infiere personalidad ni si emula a una persona desde datos independientes. La propia respuesta cualitativa de GPT-4 explicita el mecanismo: asigna cada ítem a su dimensión y responde de acuerdo con el score predeterminado. Por ello, los resultados altos son esperables y parcialmente circulares. Los alfas de las respuestas generadas son 0,97–0,99 frente a 0,79–0,89 en humanos; las correlaciones entre puntuación humana proporcionada y reconstruida son 0,90–0,94. Las medias no se preservan por completo: GPT-4 baja responsabilidad d=−0,40, estabilidad emocional d=−0,66, extraversión d=−0,20 y apertura d=−0,33; amabilidad difiere solo d=0,03. La EFA humana y la generada se fuerzan a cinco factores con minres y rotación oblimin. El análisis paralelo recomienda seis factores para humanos, el sexto marginal, y cinco para GPT-4. Las cargas objetivo generadas promedian 0,87–0,95 frente a 0,52–0,65 humanas y casi no tienen cargas cruzadas. Esto muestra una codificación estereotipada y ortogonal de la clave: una estructura más «pura» que la humana no es superior realismo, porque elimina covariación, ambigüedad, facetas y error que forman parte de los datos humanos. En la simulación 2 se muestrean 400 británicos de 50 años con IPIP completo de NCDS y se reparten, 100 perfiles distintos por grupo, entre cuatro prompts: solo puntuaciones, edad 50, país Reino Unido, o ambos. De nuevo se entregan las cinco puntuaciones y se solicita el mismo IPIP-50. Los alfas generados son 0,92–0,99 y la convergencia cae a un rango 0,75–0,95; amabilidad es la más baja. Las medias cambian d=0,22 en responsabilidad, 0,41 en amabilidad, −0,35 en estabilidad, 0,07 en extraversión y 0,37 en apertura. El suplemento contradice la narrativa de réplica factorial: sus Figuras S3 y S4 recomiendan seis factores tanto en humanos como en GPT-4, pero las tablas resumen una solución impuesta de cinco. En regresiones que controlan las cinco puntuaciones humanas, incluir edad eleva responsabilidad β=0,16, estabilidad β=0,12 y apertura β=0,14; incluir país reduce estabilidad β=−0,09 y extraversión β=−0,14. La interacción edad×amabilidad es −0,15 y país×extraversión 0,18; el texto atribuye erróneamente este segundo efecto a edad. Los incrementos de R² ajustado por interacciones son de −0,001 a 0,008: estadísticamente pequeños. Para la llamada validez criterial, se correlacionan los scores humanos o reconstruidos con salud, implicación laboral, calidad de vida y bienestar que ya pertenecen a los humanos de NCDS. GPT-4 no genera esos resultados ni comportamiento externo. Como los scores emulados son transformaciones de los scores humanos suministrados, conservar parte de sus correlaciones no es predicción independiente. Además, cada condición contiene personas distintas, n≈100, por lo que comparar correlaciones entre condiciones mezcla el prompt demográfico con variación muestral; los intervalos son amplios y el paper no documenta pruebas directas o corrección por multiplicidad. Sin perturbación, por ejemplo, responsabilidad humana correlaciona 0,33/0,45/0,51 con salud/calidad/bienestar y su reconstrucción 0,24/0,40/0,41; estabilidad humana 0,32/0,51/0,53 y reconstruida 0,21/0,42/0,42. El país produce algunas aproximaciones mayores, pero no un patrón uniforme. La Figura 1 principal duplica visualmente los cuatro paneles de «Age Setting» bajo «Age & Country Setting», aunque las Tablas S15 y S17 contienen valores diferentes. No se especifican snapshot exacto de GPT-4, temperatura, seed del modelo, reintentos, fallos de formato, variabilidad temporal o replicación en otro modelo. En conclusión, el artículo demuestra steerability para expandir scores Big Five explícitos en respuestas IPIP altamente consistentes. No demuestra agentes realistas, emulación de individuos, personalidad persistente ni conducta predictiva; la perfección factorial es precisamente evidencia de que GPT-4 simplifica la estructura humana.

English

This Scientific Reports paper tests whether GPT-4 can reconstruct IPIP-BFM-50 responses while role-playing profiles defined by five human Big Five scores. Simulation 1 filters OpenPsychometrics to 603,322 complete cases without duplicate IP submissions and samples 400 using seed 42. For each person, the prompt explicitly gives the March 2023 version of GPT-4 their Extraversion, Agreeableness, Conscientiousness, Emotional Stability, and Openness scores, each from 0 to 40; the next turn asks it to answer the same 50 items from which those scores were computed. This tests whether the model can expand five aggregate targets into scoring-key-consistent responses, not whether it infers personality or emulates a person from independent information. GPT-4's own qualitative explanation states the mechanism: it maps each item to a dimension and answers according to the predetermined score. The high results are therefore expected and partly circular. Generated responses have alpha=.97–.99 versus .79–.89 for humans, and correlations between the supplied human score and reconstructed score are .90–.94. Means are not fully preserved: GPT-4 lowers Conscientiousness by d=−.40, Emotional Stability by d=−.66, Extraversion by d=−.20, and Openness by d=−.33; Agreeableness differs by only d=.03. Human and generated EFAs are forced to five factors with minres and oblimin rotation. Parallel analysis recommends six human factors, the sixth marginal, and five GPT-4 factors. Generated target loadings average .87–.95 versus .52–.65 for humans, with almost no cross-loadings. This shows stereotyped, orthogonal reconstruction of the scoring key rather than superior human realism: a structure “purer” than human data removes covariance, ambiguity, facets, and error present in people. Simulation 2 samples 400 50-year-old British NCDS participants with complete IPIP data and assigns 100 different profiles to each of four prompts: scores only, age 50, Britain, or both. The five scores are again supplied before asking for the same IPIP-50. Generated alpha is .92–.99 and convergence falls to .75–.95, lowest for Agreeableness. Mean differences are d=.22 for Conscientiousness, .41 for Agreeableness, −.35 for Emotional Stability, .07 for Extraversion, and .37 for Openness. The supplement contradicts the factorial-replication narrative: Figures S3 and S4 recommend six factors for both human and GPT-4 data, while tables summarize a forced five-factor solution. In regressions controlling all five human scores, including age raises Conscientiousness β=.16, Emotional Stability β=.12, and Openness β=.14; including country lowers Emotional Stability β=−.09 and Extraversion β=−.14. The age×Agreeableness interaction is −.15 and country×Extraversion .18; the prose incorrectly attributes the latter to age. Interaction terms change adjusted R² by only −.001 to .008. For so-called criterion validity, human or reconstructed scores are correlated with health, job involvement, quality of life, and well-being outcomes already observed for the NCDS humans. GPT-4 generates neither these outcomes nor external behavior. Because emulated scores are transformations of the supplied human scores, retaining some of their outcome correlations is not independent prediction. Each prompt condition also contains different individuals, n≈100, so comparisons of correlations across conditions mix demographic prompting with subgroup sampling variation; intervals are wide and no direct tests or multiplicity correction are documented. With no perturbation, for example, human Conscientiousness correlates .33/.45/.51 with health/quality/well-being and its reconstruction .24/.40/.41; human Emotional Stability correlates .32/.51/.53 and its reconstruction .21/.42/.42. Country prompting produces some closer results but no uniform pattern. Main Figure 1 visually duplicates all four Age Setting panels under Age & Country Setting even though Tables S15 and S17 report different values. The exact GPT-4 snapshot, temperature, model seed, retries, format failures, temporal variation, and replication in another model are not reported. The paper therefore demonstrates steerability in expanding explicit Big Five scores into highly consistent IPIP responses. It does not demonstrate realistic agents, individual emulation, persistent personality, or predictive behavior; factorial perfection is itself evidence that GPT-4 simplifies human structure.

Pregunta de investigación

¿Puede GPT-4 transformar perfiles Big Five humanos proporcionados explícitamente en respuestas IPIP-50 con fiabilidad, estructura, convergencia y correlaciones externas similares a las humanas, y cómo cambia al añadir edad o país?

Método

Dos simulaciones con GPT-4 de marzo de 2023. En ambas se insertan las cinco puntuaciones IPIP-BFM-50 de cada humano en un prompt de personaje y luego se pide al modelo contestar el mismo inventario. La simulación 1 usa 400 perfiles OpenPsychometrics y analiza alfa, medias, correlaciones humanas-generadas y EFA minres/oblimin. La simulación 2 usa 400 británicos de 50 años de NCDS, repartidos en cuatro grupos de 100 con ninguna, edad, país o ambas indicaciones; replica los análisis, ajusta regresiones con interacciones y correlaciona scores humanos/generados con cuatro resultados humanos.

Muestra: Simulación 1: 400 perfiles humanos muestreados con semilla 42 de 603.322 casos OpenPsychometrics filtrados. Simulación 2: 400 perfiles de británicos de 50 años muestreados de 7.954 casos NCDS completos, 100 personas distintas por condición. Para los criterios hay n=400 en salud, 396 en bienestar, 344 en implicación laboral y 397 en calidad de vida, repartidos aproximadamente en cuartos. Cada perfil parece tener una sola generación; no se reportan repeticiones ni variabilidad del modelo.

Hallazgos

  • En simulación 1, alfa sube de 0,79–0,89 en humanos a 0,97–0,99 en GPT-4 y las correlaciones target-reconstrucción son 0,90–0,94.
  • GPT-4 no conserva todas las medias: la mayor diferencia es estabilidad emocional d=−0,66; responsabilidad, apertura y extraversión también bajan.
  • Las cargas generadas promedian 0,87–0,95 y casi no cruzan factores, frente a 0,52–0,65 humanas; el análisis paralelo de simulación 1 recomienda cinco factores para GPT y seis para humanos.
  • En simulación 2, alfa generado es 0,92–0,99 y la convergencia 0,75–0,95, con menor reproducción de amabilidad.
  • Incluir edad o país desplaza algunas puntuaciones generadas e interactúa con amabilidad/extraversión, pero añade como máximo 0,008 al R² ajustado.
  • Las Figuras S3 y S4 recomiendan seis factores para humanos y GPT-4 en simulación 2, aunque el estudio resume una solución de cinco.
  • Las correlaciones de scores reconstruidos con resultados humanos suelen ser algo menores que las de los scores originales; algunas se acercan bajo country prompting.
  • La Figura 1 repite erróneamente los paneles de edad bajo edad+país y no coincide con las tablas suplementarias.

Limitaciones

  • El prompt contiene las cinco puntuaciones objetivo y el criterio es el mismo cuestionario que las generó; convergencia, alfa y pureza factorial evalúan reconstrucción circular de una clave conocida.
  • No se proporciona historia personal, lenguaje, decisiones o conducta de cada individuo, por lo que los 400 perfiles no contienen información individual más allá de cinco números.
  • La ausencia de cargas cruzadas e interdependencias hace los perfiles menos humanos, aunque el artículo presenta parte de esa simplificación como propiedad psicométrica superior.
  • Se fuerzan cinco factores incluso cuando el análisis paralelo recomienda seis; no se informa ajuste confirmatorio, invariancia o comparación formal de matrices.
  • La simulación 2 asigna personas distintas a cada condición; las diferencias de correlaciones criteriales pueden reflejar composición muestral con n cercano a 100.
  • Los criterios pertenecen a los humanos originales y no son conductas o resultados generados por GPT-4; la transformación hereda relaciones del score suministrado.
  • No se reportan tests directos para muchas diferencias de correlaciones, corrección por multiplicidad ni análisis de sensibilidad entre particiones.
  • El snapshot, temperatura, parámetros, seed, reintentos, fallos, parsing y coste no están documentados; no hay test-retest del modelo.
  • Solo se evalúa un GPT-4 temprano, un inventario en inglés y dos bases occidentales; no hay otros modelos, idiomas o instrumentos.
  • El texto confunde la interacción país×extraversión con edad, las tablas suplementarias reutilizan rótulos de interacción y la Figura 1 duplica una condición.
  • La robustez se limita a añadir dos datos demográficos constantes; no prueba paráfrasis, orden, contextos, conversaciones largas o persistencia temporal.
  • No intervienen evaluadores humanos que juzguen realismo, identidad, fidelidad de persona o comportamiento en interacción.

Qué no demuestra

  • No demuestra que GPT-4 emule individuos reales; reconstruye un perfil de cinco puntuaciones sin datos biográficos individuales.
  • No demuestra que un alfa o una estructura factorial más perfectos sean más humanos, realistas o válidos.
  • No demuestra validez predictiva sobre conducta generada, decisiones futuras o interacciones sociales.
  • No demuestra que edad o nacionalidad mejoren de forma general la emulación; prueba solo presencia/ausencia de dos etiquetas constantes en submuestras distintas.
  • No valida el uso de agentes GPT-4 como sustitutos de participantes, confederados, terapeutas o poblaciones humanas.
  • No establece personalidad interna, memoria autobiográfica, coherencia longitudinal, integración de rasgos o causalidad psicológica.

Trazabilidad

Alcance: Texto completo

Versión: Scientific Reports 15, 519 (2025), DOI 10.1038/s41598-024-84109-5; official supplementary information reviewed

Fuente consultada: https://www.nature.com/articles/s41598-024-84109-5.pdf

Revisión: Codex editorial review, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4, March 2023 version (exact snapshot not reported)

Instrumentos y métricas

  • International Personality Item Pool Big-Five Factor Markers, 50 items (IPIP-BFM-50)
  • Cronbach's alpha
  • Cohen's d and standard-deviation ratios
  • Convergent and discriminant Pearson correlations
  • Parallel analysis using PCA
  • Exploratory factor analysis with minimum residual extraction and oblimin rotation
  • Regression with age/country prompt dummies and trait interactions
  • SF-36 General Health subscale
  • Four-item job involvement scale
  • CASP-12 quality-of-life scale
  • Warwick-Edinburgh Mental Well-Being Scale

Datos utilizados

  • OpenPsychometrics IPIP-FFM data: 603,322 filtered cases, 400 sampled
  • National Child Development Study Sweep 8: 7,954 complete IPIP cases, 400 sampled
  • GPT-4-generated IPIP-BFM-50 item responses for 800 prompted profiles
  • Human NCDS health, job involvement, quality-of-life and mental-well-being outcomes

Evidencia y localización

  • Objetivos, diseño general y resultados de simulación 1: Scientific Reports 15:519, pp. 1–3, Abstract, Results and Tables 1–2
  • Regresiones de edad/país y efectos de interacción: Scientific Reports 15:519, pp. 3–4, Table 3
  • Validez criterial y duplicación visual de condiciones: Scientific Reports 15:519, pp. 4–5, Figure 1
  • Mecanismo explícito de mapeo del score al ítem e interpretación: Scientific Reports 15:519, pp. 5–7, Discussion
  • Muestras, fuentes de datos, criterios y tamaños disponibles: Scientific Reports 15:519, pp. 7–8, Materials and Methods
  • Filtro OpenPsychometrics, semilla, prompts exactos y EFA: Official Supplementary Information, pp. 3–5, Detailed Methodology for Simulation 1
  • NCDS, asignación a cuatro grupos y análisis: Official Supplementary Information, pp. 5–7, Detailed Methodology for Simulation 2
  • Número de factores recomendado: Official Supplementary Information, pp. 8–11, Figures S1–S4
  • Fiabilidad, convergencia y cargas en simulación 2: Official Supplementary Information, pp. 17–19, Tables S4–S6
  • Resultados completos de robustez y errores de rótulo: Official Supplementary Information, pp. 24–28, Tables S9–S13
  • Correlaciones criteriales por condición: Official Supplementary Information, pp. 29–32, Tables S14–S17