Applying Psychometrics to Large Language Model Simulated Populations: Recreating the HEXACO Personality Inventory Experiment with Generative Agents

Sociedad, cultura y comportamiento colectivo2025arXivRevisión editorial aprobada

Autores: Sarah Mercer, Daniel P. Martin, Phil Swatton

Palabras clave: Computation and Language, Machine Learning, Generative Agents, Personality Inventory, Psychometrics, HEXACO

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
7
Hallazgos
9
Limitaciones
9
Evidencias

Resumen editorial

Español

El trabajo pregunta si una población de agentes generativos condicionados por biografías puede producir una estructura léxica de personalidad comparable con HEXACO. GPT-4 crea 310 biografías y hace que cada agente valore 1.710 adjetivos en una escala de nueve puntos; las respuestas se ipsatizan y se someten a análisis de componentes principales con rotación promax. La población PopCensus reproduce la distribución de ocupaciones de Inglaterra y Gales de 2021, pero no representa su distribución de edad, género, etnia, educación o geografía. El scree plot sugiere cinco factores. Esa solución explica el 19,54 % de la varianza y la de seis factores el 19,71 %, mientras que los autores eligen diez factores, con un 22,51 %, porque obtiene el mayor alfa de Cronbach medio sin invertir los ítems cuyas cargas tienen signo opuesto. La auditoría del código y los datos abiertos reproduce los alfas publicados, pero muestra que esa implementación mezcla polaridades: al orientar los 30 ítems de cada factor según el signo de su carga, el alfa medio pasa de 0,219 a 0,973 en cinco factores, de 0,287 a 0,972 en seis y de 0,728 a 0,959 en diez. Por tanto, los alfas negativos publicados son en gran medida artefactos de codificación y el criterio usado para preferir diez factores no es robusto; los alfas corregidos tampoco prueban validez, porque los ítems se seleccionan y evalúan en la misma muestra. Los solapamientos léxicos exactos con HEXACO son muy pequeños, aunque una comparación semántica con FastText encuentra asociaciones mayores. Una segunda prueba hace responder el HEXACO-PI-R-100 a las mismas biografías: las correlaciones absolutas medias con los factores léxicos son 0,765 para GPT-4, 0,751 para Claude 3.7 Sonnet, 0,712 para Phi-4 y 0,217 para Llama 3.2. Esto indica que los modelos grandes reutilizan de manera consistente las señales de una persona sintética, pero no demuestra equivalencia con rasgos humanos, pues las dos mediciones parten de las mismas biografías y de estereotipos aprendidos. Una segunda población profesional no recupera Honesty-Humility, lo que evidencia sensibilidad a la redacción y composición de las personas. El artículo es prudente al interpretar los factores como asociaciones lingüísticas, no como personalidad interna. La publicación de respuestas, datos procesados y notebooks es una fortaleza importante, aunque faltan el pipeline que generó personas y respuestas, versiones exactas de dependencias y la instantánea precisa de GPT-4.

English

The paper asks whether a population of biography-conditioned generative agents can produce a lexical personality structure comparable to HEXACO. GPT-4 creates 310 biographies and each agent rates 1,710 adjectives on a nine-point scale; responses are ipsatized and analyzed with principal components and promax rotation. The PopCensus population matches the 2021 occupational distribution of England and Wales, but it does not represent that population's age, gender, ethnicity, education, or geography. The scree plot suggests five factors. The five-factor solution explains 19.54% of variance and the six-factor solution 19.71%, whereas the authors select ten factors, explaining 22.51%, because that solution has the highest mean Cronbach's alpha without reversing items whose loadings have opposite signs. Auditing the open code and data reproduces the reported alphas but shows that the implementation mixes item polarities: orienting each factor's 30 selected items by loading sign changes mean alpha from 0.219 to 0.973 for five factors, from 0.287 to 0.972 for six, and from 0.728 to 0.959 for ten. The published negative alphas are therefore largely coding artifacts, and the criterion used to prefer ten factors is not robust; the corrected high alphas do not themselves establish validity because item selection and evaluation use the same sample. Exact lexical overlap with HEXACO is very small, although a FastText comparison finds greater semantic association. A second test administers the HEXACO-PI-R-100 to the same biographies: mean absolute correlations with the lexical factors are 0.765 for GPT-4, 0.751 for Claude 3.7 Sonnet, 0.712 for Phi-4, and 0.217 for Llama 3.2. This indicates that larger models reuse signals from a synthetic persona consistently, but it does not establish equivalence with human traits because both measurements derive from the same biographies and learned stereotypes. A second professional population fails to recover Honesty-Humility, showing sensitivity to persona wording and composition. The paper appropriately interprets its factors as linguistic associations rather than internal personality. Releasing responses, processed data, and notebooks is a major strength, although the persona- and response-generation pipeline, exact dependency versions, and precise GPT-4 snapshot are absent.

Pregunta de investigación

¿Puede una población sintética de agentes GPT-4 condicionados por biografías reproducir una estructura léxica de personalidad comparable con HEXACO, mantener consistencia interna y converger con respuestas a un inventario HEXACO entre distintos modelos?

Método

Estudio psicométrico computacional en tres bloques. Primero, GPT-4 genera PopCensus y cada uno de sus 310 agentes califica 1.710 adjetivos con explicación; tras parseo, ipsatización y eliminación de ítems sin varianza se aplican PCA y rotación promax, se inspeccionan soluciones de cinco a doce factores y se calculan alfa, solapamiento léxico y similitud FastText. Segundo, GPT-4, Claude 3.7 Sonnet, Phi-4 14B y Llama 3.2 3B responden HEXACO-PI-R-100 para las mismas personas y sus dominios se correlacionan con las puntuaciones factoriales léxicas. Tercero, el procedimiento se replica con PopProfessional para estudiar sensibilidad a otra composición de personas. La revisión editorial reprodujo los resultados desde los datos y notebooks del repositorio y recalculó la fiabilidad orientando los ítems por el signo de su carga.

Muestra: PopCensus contiene 310 biografías, 272 ocupaciones únicas y edades de 18 a 60 años; solo la distribución ocupacional se alinea con el censo de Inglaterra y Gales. El texto informa de 200 agentes masculinos y 102 femeninos, por lo que ocho no quedan explicados en ese recuento. Cada agente produce 1.710 valoraciones. La réplica PopProfessional contiene 313 personas y 83 ocupaciones únicas, pese a que partes del artículo la describen como una población de 310.

Hallazgos

  • El scree plot favorece cinco factores; las soluciones de cinco, seis y diez factores explican respectivamente el 19,54 %, 19,71 % y 22,51 % de la varianza. Los diez factores reciben etiquetas post hoc como Dishonesty, Disagreeableness, Introversion y Unconscientiousness.
  • Los alfas publicados se obtienen seleccionando los 30 ítems con mayor carga absoluta y calculando alfa sobre sus valores sin orientar los signos. Esto reproduce alfas medios de 0,219, 0,287 y 0,728 para cinco, seis y diez factores; tras invertir la polaridad indicada por las cargas, ascienden a 0,973, 0,972 y 0,959.
  • La corrección demuestra que los alfas negativos no evidencian factores internamente incoherentes, pero también elimina el fundamento para elegir diez factores por su mayor alfa bruto. La selección de ítems y la estimación de fiabilidad en la misma muestra hacen que los alfas corregidos sean optimistas.
  • El mayor solapamiento exacto de cada factor sintético con un factor HEXACO solo oscila entre 0,024 y 0,166. La métrica denominada weighted Jaccard usa pertenencia y signo, no la magnitud de las cargas; la comparación FastText ignora el signo y puede tratar antónimos como cercanos semánticamente.
  • Las correlaciones absolutas medias entre factores léxicos GPT-4 y dominios HEXACO-PI-R-100 son 0,765 con GPT-4, 0,751 con Claude 3.7 Sonnet, 0,712 con Phi-4 y 0,217 con Llama 3.2; los tres modelos mayores reutilizan mejor las señales biográficas que el modelo de 3B.
  • PopProfessional obtiene ocho factores y un alfa bruto medio de 0,660, pero no recupera Honesty-Humility. Su composición ocupacional y el uso de hechos negativos menos intensos cambian la estructura, mostrando dependencia del diseño de personas y prompts.
  • La consistencia basada en 342 pares derivados de prefijos alcanza una media por agente de 0,812 y el 83,04 % de los pares supera 0,75. La longitud parcial de la biografía correlaciona r = 0,395 con esa consistencia, una asociación moderada que no identifica un efecto causal.

Limitaciones

  • La población es sintética y solo está calibrada por ocupación; su edad no se alinea con el censo y no se controlan etnia, educación, geografía ni una distribución de género completa. Llamarla representativa sin ese matiz exageraría el diseño.
  • GPT-4 genera las biografías y también las respuestas léxicas, por lo que la estructura puede reflejar dependencias del mismo generador, convenciones narrativas, estereotipos y restricciones de seguridad.
  • Hay unas 310 observaciones frente a alrededor de 1.700 variables, sin análisis paralelo, bootstrap, holdout o validación cruzada; inspeccionar de cinco a doce factores y elegir por alfa en la misma muestra favorece el sobreajuste.
  • La comparación de varianza entre diez factores sintéticos y seis factores humanos no es equivalente, porque añadir componentes aumenta necesariamente la varianza explicada.
  • Las correlaciones convergentes reutilizan las mismas biografías en ambos instrumentos. Pueden medir consistencia al extraer hechos o estereotipos de la persona, no un constructo latente independiente.
  • El parser sustituye por 5 las respuestas no interpretables. En PopCensus hay 291 errores, 225 asociados a niggardly y 66 repartidos entre otros adjetivos; esta imputación neutral no queda descrita con claridad en el artículo.
  • La similitud semántica ignora polaridad, el baseline aleatorio usa solo diez muestras sin semilla y su media publicada, 0,363, no coincide con la salida actual del repositorio, 0,378.
  • El repositorio aporta datos y análisis, pero no el código que generó biografías o consultó los modelos, ni lockfile, versiones exactas de dependencias, semillas completas o identificador de la instantánea GPT-4; la reproducción de la recogida es incompleta.
  • Los nombres de factores son interpretaciones humanas post hoc sin evaluadores independientes, y no existe una prueba conductual o longitudinal externa que valide esos significados.

Qué no demuestra

  • No demuestra que GPT-4, Claude, Phi o Llama posean personalidad, rasgos internos, identidad, emociones o motivaciones humanas.
  • No demuestra que PopCensus represente a la población de Inglaterra y Gales más allá de su distribución ocupacional aproximada.
  • No recupera de forma inequívoca la estructura HEXACO: el número de factores, las etiquetas, el solapamiento léxico y la desaparición de Honesty-Humility en PopProfessional dependen del diseño analítico y de las personas.
  • No valida el uso directo de instrumentos psicométricos humanos con LLM ni establece invariancia de medida o equivalencia de constructo entre agentes y personas.
  • No prueba que las correlaciones entre el inventario léxico y HEXACO sean independientes de la biografía compartida, el modelo generador o estereotipos aprendidos.
  • No establece que diez factores sean la solución correcta o más fiable, debido al error de orientación de ítems y a la ausencia de validación fuera de muestra.
  • No evalúa seguridad, manipulación, bienestar de usuarios, discriminación ni comportamiento de agentes en aplicaciones reales.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2508.00742v2 (22 Sep 2025); linked repository commit e6a25d2b720f87825bfa57cdad425e12d288909a also audited

Fuente consultada: https://arxiv.org/pdf/2508.00742

Revisión: Codex editorial review and reproducibility audit, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • GPT-4 (deployment or snapshot not specified)
  • Claude 3.7 Sonnet
  • Phi-4 14B
  • Llama 3.2 3B

Instrumentos y métricas

  • 1,710-adjective lexical personality inventory
  • HEXACO-PI-R-100
  • Principal component analysis with promax rotation
  • Cronbach's alpha
  • Exact and sign-sensitive weighted Jaccard comparisons
  • FastText semantic similarity
  • Prefix-derived antonym-pair consistency measure

Datos utilizados

  • PopCensus synthetic biographies and adjective ratings
  • PopProfessional synthetic biographies and adjective ratings
  • 2021 England and Wales census occupational distribution
  • HEXACO lexical adjective data reconstructed from the available Harvard Dataverse substitute
  • Released HEXACO questionnaire responses from four LLMs

Evidencia y localización

  • Diseño, construcción de PopCensus, prompts, muestra e inventario de 1.710 adjetivos: Paper, pp. 3–6, sections 2.1–2.4 and Appendix A
  • Scree plot, soluciones factoriales, varianza, alfas y selección de diez factores: Paper, pp. 6–9, section 3.1, Figures 2–3 and Tables 2–4
  • Solapamiento con HEXACO, similitud FastText y baseline aleatorio: Paper, pp. 9–11, sections 3.2–3.3 and Figures 4–5
  • Convergencia entre modelos mediante HEXACO-PI-R-100: Paper, pp. 11–13, section 3.4 and Table 1; repository notebooks and released response data at commit e6a25d2b720f87825bfa57cdad425e12d288909a
  • Consistencia, pares derivados por prefijos y asociación con longitud biográfica: Paper, pp. 13–14, section 3.5 and Figure 6; repository analysis helpers at audited commit
  • Réplica PopProfessional y sensibilidad de Honesty-Humility: Paper, pp. 14–16, section 3.6 and Figure 7; released PopProfessional data at audited commit
  • Interpretación, limitaciones y cautela contra atribuir personalidad humana: Paper, pp. 16–19, sections 4–6
  • Error de orientación en alfa y resultados recalculados: Linked repository commit e6a25d2b720f87825bfa57cdad425e12d288909a, results_template.py and support/solution_support.py; independent reproduction from released PopCensus and PopProfessional matrices
  • Errores de parseo, imputación neutral y carencias del pipeline reproducible: Linked repository commit e6a25d2b720f87825bfa57cdad425e12d288909a, raw response files, parser defaults, README and full git history