Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset designed for LLMs with Psychometrics

Evaluación y validez psicométrica2024arXivRevisión editorial aprobada

Título original: Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset Designed for LLMs with Psychometrics

Autores: Seungbeen Lee, Seungwon Lim, Seungju Han, Giyeong Oh, Hyungjoo Chae, Jiwan Chung, Minju Kim, Beong-woo Kwak, Yeonsoo Lee, Dongha Lee, Jinyoung Yeo, Youngjae Yu

Palabras clave: Computation and Language, Artificial Intelligence, Large Language Models, Personality Assessment, Psychometrics

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

12
Autores
9
Hallazgos
11
Limitaciones
10
Evidencias

Resumen editorial

Español

Este preprint presenta TRAIT, un benchmark en inglés de 8.000 preguntas de elección múltiple para estudiar patrones de respuesta asociados a cinco rasgos Big Five y tres rasgos de la Tríada Oscura. Parte de 44 ítems BFI y 27 SD-3: GPT-4 los expande a 1.600 descripciones, para cada descripción selecciona cinco de veinte situaciones muestreadas de ATOMIC10X y construye una situación, pregunta y cuatro recomendaciones, dos etiquetadas high y dos low. El resultado es unas 112 veces mayor que las 71 semillas; la cifra de 225× que aparece en el diagrama no coincide con el cómputo por ítems. Dos estudiantes de posgrado con formación en psicología etiquetan solo 200 ítems y alcanzan 97,5 % al distinguir high/low. Esta comprobación respalda que una muestra de opciones expresa la polaridad pretendida, pero no valida los 8.000 ítems, su especificidad de rasgo, estructura factorial, invariancia o relación con conducta. El paper denomina «validez de contenido» a la diversidad y uniformidad de facetas asignadas por GPT-4; «validez interna» a la diferencia de puntuación al instruir niveles altos o bajos; y «fiabilidad» a la sensibilidad a tres prompts, al orden de opciones y a paráfrasis. Son operaciones útiles para auditar cobertura, seguimiento de instrucciones y robustez, pero no equivalen por sí solas a esos constructos psicométricos. Promediado sobre ocho modelos, TRAIT obtiene diversidad 71,9 y diferencia 77,5 en Big Five, y 51,0/83,3 en Tríada Oscura; su sensibilidad media es 29,8 % y 24,4 %, respectivamente. Aunque mejora los baselines, que entre una cuarta y una tercera parte de las respuestas cambie muestra consistencia relativa, no estabilidad fuerte. La tasa de rechazo es casi cero en elección múltiple y 3,1–3,3 % en generación, frente a valores mucho mayores en tests de autoinforme; el detector se limita a frases iniciales predefinidas y puede confundir formato con rechazo. La puntuación TRAIT promedia probabilidades de tokens A–D bajo dos disposiciones de opciones y calcula el porcentaje de elecciones high. No es una escala factorial y dos permutaciones no agotan los 24 órdenes posibles. En nueve modelos, GPT-4 y Claude-Sonnet puntúan 86–87 en amabilidad y 0–11 en Tríada Oscura. Al agrupar modelos alineados y base, los primeros promedian más amabilidad (78,3 frente a 66,7) y responsabilidad (91,0 frente a 81,7), menos apertura (56,3 frente a 67,8), extraversión (32,8 frente a 46,9) y Tríada Oscura (9,3 frente a 27,0). Esta comparación mezcla familias y tamaños, de modo que no identifica causalmente el efecto del alineamiento. La secuencia controlada Llama2-7B→Tulu2-SFT→Tulu2-DPO sí sugiere que SFT desplaza con fuerza las elecciones, por ejemplo +22,9 en amabilidad, −22,9 en extraversión y −49,8 en psicopatía, mientras DPO cambia poco; sin embargo, el pie de la Tabla 7 describe la resta en sentido contrario a la interpretación y el clasificador usado para etiquetar los datos de entrenamiento, T-EVALUATOR, se entrena con TRAIT sintético. La correlación 0,7893 entre balance del corpus y cambio de rasgo excluye apertura post hoc, usa solo siete rasgos y no demuestra causalidad. Tres prompts de persona producen una puntuación direccional media de 85,2, pero los resultados finos varían mucho por plantilla y modelo: en GPT-4, por ejemplo, psicopatía alta va de 37,3 a 99,7. Las correlaciones inducidas entre rasgos oscuros llegan a 0,90–0,97, muy por encima de las humanas; reflejan al menos en parte el contenido compartido del prompt y del generador, no una estructura psicológica natural. Las cinco situaciones derivadas de una misma descripción también cambian la elección, algo compatible tanto con sensibilidad contextual como con ruido o diferencias entre escenarios. Finalmente, correlaciones entre TRAIT y benchmarks generales se calculan con ocho modelos y sin ajustar familia, tamaño o alineamiento; no establecen poder predictivo de la personalidad. El aporte defendible es un banco de escenarios amplio y una auditoría multifactor de respuestas, no una prueba de personalidad interna, psicometría humana equivalente ni validez conductual.

English

This preprint introduces TRAIT, an English-language benchmark of 8,000 multiple-choice questions for studying response patterns associated with the Big Five and Dark Triad. It starts from 44 BFI and 27 SD-3 items: GPT-4 expands them into 1,600 descriptions, selects five of twenty ATOMIC10X situations for each description, and constructs a situation, question, and four recommendations, two labeled high and two low. The result is about 112 times the 71 seeds; the 225× claim in the pipeline figure does not match the item count. Two graduate students with psychology training label only 200 items and reach 97.5% high/low accuracy. This supports the intended polarity in a sample, but does not validate all 8,000 items, trait specificity, factor structure, invariance, or behavioral relevance. The paper calls GPT-4-assigned facet diversity and evenness “content validity,” score change after high/low instructions “internal validity,” and sensitivity to three prompts, option order, and paraphrases “reliability.” These are useful audits of coverage, instruction following, and robustness, but are not by themselves equivalent to those psychometric constructs. Averaged across eight models, TRAIT scores 71.9 for diversity and 77.5 for score difference on the Big Five, and 51.0/83.3 on the Dark Triad; mean sensitivity is 29.8% and 24.4%, respectively. It improves on the baselines, yet changing roughly one quarter to one third of answers shows relative rather than strong consistency. Refusal rates are near zero in multiple choice and 3.1–3.3% in generation, much lower than self-report tests; however, the detector only checks predefined opening phrases and may conflate response format with refusal. TRAIT scoring averages A–D token probabilities under two option layouts and reports the proportion of high choices. It is not a factor score, and two permutations do not exhaust the 24 possible orders. Across nine models, GPT-4 and Claude-Sonnet score 86–87 on Agreeableness and 0–11 on Dark Triad traits. Grouping aligned and base models yields higher Agreeableness (78.3 vs 66.7) and Conscientiousness (91.0 vs 81.7), and lower Openness (56.3 vs 67.8), Extraversion (32.8 vs 46.9), and Dark Triad scores (9.3 vs 27.0). Because this comparison mixes model families and sizes, it does not identify a causal alignment effect. The more controlled Llama2-7B→Tulu2-SFT→Tulu2-DPO sequence suggests that SFT strongly shifts choices, for example +22.9 Agreeableness, −22.9 Extraversion, and −49.8 Psychopathy, while DPO changes little. Yet Table 7's caption describes the subtraction opposite to the interpretation, and T-EVALUATOR, used to label the training data, is itself trained on synthetic TRAIT. The reported .7893 correlation between corpus balance and trait change excludes Openness post hoc, uses only seven traits, and does not establish causality. Three persona prompts yield an average directional score of 85.2, but fine-grained results vary sharply by template and model: GPT-4 high-Psychopathy scores, for example, range from 37.3 to 99.7. Induced correlations among Dark Triad traits reach .90–.97, far above human values; they reflect at least partly shared prompt and generator semantics rather than a natural psychological structure. Five scenarios derived from the same description also alter choices, which is compatible with context sensitivity but also with scenario differences or measurement noise. Finally, correlations between TRAIT and general benchmarks use eight models without controlling model family, size, or alignment and do not establish predictive power of personality. The defensible contribution is a large scenario bank and multifactor response audit, not evidence of internal personality, human-equivalent psychometrics, or behavioral validity.

Pregunta de investigación

¿Puede un benchmark de escenarios construido específicamente para LLM medir patrones de respuesta diferenciados y relativamente consistentes, y qué muestran esos patrones sobre prompting, alineamiento y composición de datos de entrenamiento?

Método

Construcción sintética de 8.000 MCQ a partir de 71 ítems BFI/SD-3, 1.600 descripciones generadas por GPT-4 y situaciones ATOMIC10X. Se auditan 200 ítems con dos anotadores, cobertura de facetas con GPT-4, respuesta a prompts high/low, rechazos y sensibilidad a tres plantillas, dos órdenes y paráfrasis. La evaluación principal usa probabilidades de tokens para puntuar nueve LLM; se añaden comparaciones base/alineado, la secuencia Llama2→Tulu2-SFT→Tulu2-DPO, prompts de persona, correlaciones entre rasgos, clasificación de datos mediante T-EVALUATOR y correlaciones exploratorias con benchmarks.

Muestra: El benchmark contiene 1.000 preguntas por cada uno de ocho rasgos. La validación humana cubre 200/8.000 ítems con dos anotadores. La comparación principal presenta nueve modelos y las tablas de robustez promedian ocho; varios apéndices amplían el conjunto a 19. Los experimentos de prompting usan GPT-4, GPT-3.5, Llama2-7B-chat y Mistral-7B-Instruct; la correlación con benchmarks usa ocho modelos. No hay participantes humanos que respondan el test ni datos conductuales humanos emparejados.

Hallazgos

  • Dos anotadores alcanzan 97,5 % al clasificar high/low en una muestra de 200 ítems, sin evaluar la validez del rasgo o de la escala completa.
  • TRAIT supera baselines en las métricas definidas por los autores, pero mantiene 29,8 % de sensibilidad media en Big Five y 24,4 % en Tríada Oscura.
  • GPT-4 y Claude-Sonnet eligen muchas opciones de amabilidad y pocas de Tríada Oscura; los perfiles varían entre modelos.
  • El grupo alineado puntúa más alto en amabilidad/responsabilidad y más bajo en extraversión, apertura y Tríada Oscura que el grupo base, aunque las familias comparadas no están controladas.
  • En la secuencia Llama2→Tulu2, SFT produce cambios grandes y DPO pequeños; la composición etiquetada del corpus se asocia con la dirección de siete rasgos.
  • Los prompts high/low alcanzan una puntuación direccional media de 85,2, con variabilidad considerable entre modelos, rasgos y plantillas.
  • Las correlaciones inducidas entre Tríada Oscura son 0,90–0,97 y más extremas que las humanas, lo que contradice una equivalencia estructural simple.
  • Cambiar el escenario derivado de una misma descripción cambia con frecuencia la elección, mostrando dependencia contextual pero no distinguiendo sensibilidad válida de ruido de medición.
  • Las correlaciones exploratorias con benchmarks son altas para algunos rasgos, pero se basan en ocho puntos-modelo y están confundidas por capacidad, familia y alineamiento.

Limitaciones

  • La generación de descripciones, escenarios, opciones y facetas depende de modelos GPT, por lo que comparte sesgos semánticos y culturales del generador y evaluador.
  • Solo 200 de 8.000 ítems reciben validación humana; dos anotadores evalúan polaridad binaria, no acuerdo interjueces, especificidad de rasgo, dificultad, ambigüedad o validez conductual.
  • Las etiquetas de validez y fiabilidad no siguen por completo su significado psicométrico: faltan estructura factorial, consistencia interna, test–retest, invariancia, convergencia, discriminación y criterio externo.
  • La puntuación es proporción de opciones high basada en probabilidades de tokens; no es una medida latente y puede depender de tokenización, acceso a logprobs y formato de cada proveedor.
  • Solo se prueban dos disposiciones de opciones; la sensibilidad residual sigue siendo elevada y las paráfrasis también son sintéticas.
  • La detección de rechazo usa una lista de comienzos de frase y no valida recall, precision o rechazos semánticamente equivalentes.
  • La comparación alineado/base mezcla familias y escalas; incluso las comparaciones pareadas son pocas y heterogéneas.
  • T-EVALUATOR se entrena en TRAIT y se usa para explicar los datos que entrenan los modelos; esta circularidad no demuestra que sus etiquetas representen rasgos reales del corpus.
  • La correlación 0,7893 excluye apertura post hoc y usa siete observaciones de rasgo; las correlaciones con benchmarks usan solo ocho modelos y no controlan confusores.
  • La evidencia está en inglés, usa marcos occidentales, MCQ y turnos aislados; no cubre conversación abierta, persistencia, otros idiomas/culturas o comportamiento real.
  • El propio artículo alterna cifras 112×/225× y contiene pies de tabla cuya dirección de resta no coincide con la narrativa.

Qué no demuestra

  • No demuestra que los LLM posean personalidad humana, conciencia, emociones o rasgos internos persistentes.
  • No valida TRAIT como instrumento psicométrico equivalente a BFI o SD-3 para personas o modelos.
  • No demuestra que los perfiles de elección predigan conducta fuera de los ítems, conversaciones multi-turno o decisiones reales.
  • No identifica causalmente el alineamiento como origen de las diferencias entre modelos ni el balance de rasgos del corpus como mecanismo de cambio.
  • No prueba que prompting cree un rasgo estable; muestra seguimiento direccional de instrucciones con marcada dependencia de plantilla.
  • No justifica interpretar correlaciones entre puntuaciones de rasgo y benchmarks como poder predictivo de personalidad.
  • No establece validez intercultural, clínica, diagnóstica, criterial o de sustitución de evaluación humana.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2406.14703v3 (19 March 2025)

Fuente consultada: https://arxiv.org/pdf/2406.14703

Revisión: Codex editorial review, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4 Turbo (gpt-4-turbo-2024-04-09)
  • GPT-3.5 Turbo (gpt-3.5-turbo-0125)
  • Claude Sonnet
  • Llama-2-7B and Llama-2-7B-chat
  • Llama-3-8B and Llama-3-8B-Instruct
  • Mistral-7B and Mistral-7B-Instruct
  • Gemma-2B and Gemma-2B-it
  • Tulu2-7B-SFT and Tulu2-7B-DPO
  • OLMo-7B and OLMo-7B-SFT
  • Additional appendix models: Gemini, Claude Opus, Qwen, Zephyr and others
  • T-EVALUATOR: Mistral-7B-v0.1 with LoRA
  • GPT-4o-2024-08-06 (facet evaluator)
  • GPT-3.5 and Gemini-Pro (paraphrase generation)

Instrumentos y métricas

  • TRAIT 8,000-item multiple-choice benchmark
  • 44-item Big Five Inventory (BFI)
  • 27-item Short Dark Triad (SD-3)
  • 300-item IPIP-NEO-PI and 120-item subset
  • Anthropic personality evaluation set
  • T-EVALUATOR trait and level classifier
  • Facet diversity and evenness metrics
  • High/low prompt score difference
  • Prompt, option-order and paraphrase sensitivity
  • Keyword-based refusal detector
  • Pearson correlations among traits and with capability benchmarks

Datos utilizados

  • TRAIT: 8,000 synthetic scenarios, questions and four-option answers
  • ATOMIC10X commonsense knowledge graph
  • 71 seed items from BFI and SD-3
  • 200-item human-validation subsample
  • Tulu2Mix and UltraFeedback alignment datasets
  • HH-RLHF harmlessness and helpfulness splits
  • UltraChat
  • General capability benchmark leaderboard results for eight models

Evidencia y localización

  • Objetivo, construcción de 8.000 ítems y comparación con semillas: arXiv v3, pp. 1–4, Abstract, sections 1–3.1 and Figures 1–2
  • Validación humana, T-EVALUATOR y variación entre escenarios: arXiv v3, pp. 5–6, sections 3.2–3.4 and Tables 5–6
  • Perfiles de modelos y efecto atribuido a alineamiento: arXiv v3, pp. 6–7, sections 4.1–4.2, Figures 3–4 and Table 7
  • Elicitación por prompting e intercorrelaciones: arXiv v3, pp. 7–8, sections 4.3–4.4 and Figures 5–6
  • Definición de diversidad, diferencia, sensibilidad, scoring y rechazo: arXiv v3, pp. 13–16 and 24–27, Appendices C–D, G.2 and Tables 15–20
  • Balance de datos de alineamiento y correlación post hoc: arXiv v3, pp. 17–19 and 31, Appendix E.2, Tables 7 and 14, Figure 13
  • Resultados finos de prompts y correlaciones humanas/LLM: arXiv v3, pp. 20‐24, Appendix F–G.3, Tables 11‐13 and 21‐23
  • Correlaciones con benchmarks y tamaño de modelo: arXiv v3, pp. 25 and 28–29, Appendix H, Figure 12 and Table 22
  • Anotadores, interfaz y prompts exactos: arXiv v3, pp. 25 and 35–38, Appendix I–K, Figure 14 and Tables 27–30
  • Límites culturales, MCQ, antropomorfismo y uso indebido: arXiv v3, pp. 9–10, Limitations and Ethical Considerations