Rediscovering the Latent Dimensions of Personality with Large Language Models as Trait Descriptors

Evaluación y validez psicométrica2024NeurIPS WorkshopRevisión editorial aprobada

Autores: Joseph Suh, Suhong Moon, Minwoo Kang, David M. Chan

Palabras clave: personality assessment, Big Five traits, singular value decomposition, latent dimensions, trait descriptors, personality probing, LLM evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
26
Hallazgos
29
Limitaciones
28
Evidencias

Resumen editorial

Español

El trabajo estudia si las probabilidades de siguiente token de un LLM, al completar con adjetivos una descripción de una historia personal, contienen ejes que se correspondan con los Big Five sin administrar un cuestionario. Construye una matriz de 208 historias por 100 adjetivos descriptivos de rasgos, centra las log-probabilidades y aplica SVD; después usa el signo de cinco componentes para clasificación binaria y, en una variante supervisada, ajusta una regresión Lasso. Las historias proceden de PersonaLLM: GPT-4-0613 generó diez relatos para cada una de las 32 combinaciones binarias Big Five y, tras filtrar relatos con léxico explícito de rasgo, quedaron 208. Los cinco primeros componentes explican el 74,3 % de la varianza. El mejor SVD obtiene 0,793 de exactitud media, por debajo del DeBERTaV3 ajustado (0,867); el mejor Lasso llega a 0,912, una mejora absoluta de 4,5 puntos sobre DeBERTaV3 y de 21,4 sobre el 0,698 publicado para el prompting GPT-4 de PersonaLLM. La conclusión defendible es que las log-probabilidades de una lista cerrada de adjetivos pueden servir como representación predictiva en este benchmark sintético. No es un redescubrimiento independiente de personalidad: el Big Five está inyectado tanto en las instrucciones que generaron los relatos como en los 100 adjetivos de Goldberg, ya clasificados por dimensión y polo. Además, los componentes se nombran inspeccionando esas etiquetas y se emparejan con rasgos mediante etiquetas del conjunto de entrenamiento; el signo de una SVD es matemáticamente arbitrario. No hay validación con personas, corpus externos, intervalos de confianza, pruebas de significación, semillas, análisis de estabilidad ni código o resultados abiertos. Dos filas completas de SVD y Lasso para Mixtral coinciden exactamente con Llama-3.1-70B-Instruct sin explicación. El estudio aporta una sonda léxica prometedora y una demostración controlada, pero no demuestra personalidad psicológica del modelo, estructura latente interna ni validez psicométrica en poblaciones reales.

English

The paper asks whether an LLM's next-token probabilities, when completing a personal-story description with adjectives, contain axes corresponding to the Big Five without administering a questionnaire. It builds a 208-story by 100-trait-adjective matrix, centers the log-probabilities, and applies SVD; it then uses the signs of five components for binary classification and, in a supervised variant, fits Lasso regression. The stories come from PersonaLLM: GPT-4-0613 generated ten narratives for each of the 32 binary Big Five combinations, and 208 remained after filtering stories with explicit trait lexicons. The first five components explain 74.3% of variance. The best SVD result has 0.793 mean accuracy, below fine-tuned DeBERTaV3 at 0.867; the best Lasso reaches 0.912, an absolute gain of 4.5 points over DeBERTaV3 and 21.4 over the published 0.698 GPT-4 prompting result from PersonaLLM. The defensible conclusion is that log-probabilities over a closed adjective list can provide a useful predictive representation on this synthetic benchmark. This is not an independent rediscovery of personality: the Big Five is injected both into the instructions used to generate the stories and into Goldberg's 100 adjectives, which are already assigned to dimensions and poles. Components are also named by inspecting those labels and matched to traits with training-set labels, while an SVD component's sign is mathematically arbitrary. There is no validation with people, external corpora, confidence intervals, significance testing, random seeds, stability analysis, or open code and results. The complete Mixtral SVD and Lasso rows exactly duplicate the Llama-3.1-70B-Instruct rows without explanation. The study offers a promising lexical probe and a controlled demonstration, but it does not establish psychological personality in the model, an internal latent personality structure, or psychometric validity in real populations.

Pregunta de investigación

¿Las correlaciones entre las log-probabilidades que distintos LLM asignan a 100 adjetivos descriptivos al evaluar historias personales producen cinco componentes principales alineables con los Big Five y permiten predecir las etiquetas binarias de personalidad mejor que el prompting directo o un clasificador de texto ajustado?

Método

Se toman 208 relatos sintéticos de PersonaLLM, generados por GPT-4-0613 a partir de las 32 configuraciones binarias de los Big Five. Para cada relato y cada uno de los 100 adjetivos unipolares de Goldberg, cinco familias de LLM calculan la suma de log-probabilidades de los tokens del adjetivo bajo un prompt fijo en inglés. Se centra por columnas la matriz X de 208 por 100 y se aplica SVD con k=5. Las cargas extremas y las etiquetas Big Five conocidas de los adjetivos se usan para interpretar los componentes; una matriz de exactitud del conjunto de entrenamiento empareja componentes y rasgos. El signo de U se evalúa como predictor binario. Una regresión Lasso supervisada usa las 100 log-probabilidades como variables. Las comparaciones son un DeBERTaV3 Large ajustado con BCE y un resultado de prompting GPT-4-0613 tomado del artículo PersonaLLM.

Muestra: PersonaLLM intentó generar 320 relatos en inglés: diez para cada una de las 32 combinaciones de cinco rasgos binarios. Tras eliminar relatos que contenían léxico explícito relacionado con rasgos quedaron 208 (65 %; se excluyeron 112, el 35 %). El artículo no informa el balance final por rasgo o combinación ni aporta relatos de personas reales.

Hallazgos

  • La matriz analizada tiene 208 filas de relatos y 100 columnas de adjetivos descriptivos de rasgo.
  • Los cinco primeros componentes de la SVD explican conjuntamente el 74,3 % de la varianza de las log-probabilidades centradas.
  • Los autores describen un descenso entre el quinto y el sexto valor singular, pero no aplican análisis paralelo, bootstrap ni otro criterio estadístico de retención de factores.
  • La correspondencia declarada es componente 1-extraversión, 2-apertura, 3-amabilidad, 4-neuroticismo y 5-responsabilidad.
  • En la matriz de entrenamiento de la Tabla 5, las exactitudes máximas por componente son 0,899 para extraversión, 0,798 para apertura, 0,817 para amabilidad, 0,726 para neuroticismo y 0,803 para responsabilidad.
  • El mejor resultado SVD es 0,793 de exactitud media con Llama-3-70B-Instruct; los resultados SVD abarcan de 0,667 a 0,793.
  • El mejor resultado Lasso es 0,912 con Llama-3.1-70B; los resultados Lasso abarcan de 0,860 a 0,912.
  • DeBERTaV3 Large ajustado alcanza 0,867 de exactitud media, por lo que supera a todas las variantes SVD sin supervisión reportadas.
  • El baseline directo PersonaLLM con GPT-4-0613 tiene 0,698 de exactitud media, cifra importada del trabajo anterior y no reestimada bajo un protocolo común.
  • La mejora máxima de Lasso sobre DeBERTaV3 es 0,045, es decir, 4,5 puntos porcentuales absolutos; sobre el baseline GPT-4 es 0,214, o 21,4 puntos.
  • Las mejores exactitudes por rasgo en las filas Lasso son 1,000 en extraversión, 0,964 en amabilidad, 0,881 en responsabilidad, 0,893 en neuroticismo y 0,905 en apertura.
  • El rendimiento no mejora de forma monotónica con el tamaño del modelo ni con el ajuste de instrucciones; algunas versiones Instruct empeoran con claridad frente al modelo base.
  • Las cinco cifras SVD de Mixtral-8x22B coinciden exactamente con las de Llama-3.1-70B-Instruct.
  • Las cinco cifras Lasso de Mixtral-8x22B también coinciden exactamente con las de Llama-3.1-70B-Instruct; el manuscrito no comenta esta doble duplicación.
  • La media de log-probabilidad varía mucho entre adjetivos: el texto da -5,7 para 'introverted' y -20,0 para 'unenvious'.
  • El método suma log-probabilidades de todos los tokens de cada adjetivo; por ejemplo, 'sophisticated' se divide en cuatro tokens con el tokenizer Llama 3.
  • La primera dimensión no es puramente extraversión: entre sus mayores cargas aparecen 'careless', 'disorganized', 'haphazard' y 'unsystematic', todos marcadores de responsabilidad negativa.
  • La segunda dimensión tampoco muestra una apertura limpia: sus mayores cargas incluyen 'anxious', 'introverted', 'withdrawn', 'distrustful', 'inhibited' y 'reserved'.
  • La Tabla 4 reconoce cuatro excepciones de signo en apertura: 'complex', 'introspective', 'deep' e 'intellectual'.
  • La quinta dimensión mezcla marcadores de responsabilidad con 'shy', 'relaxed', 'introverted', 'unadventurous', 'bashful', 'harsh', 'unemotional' y 'assertive'.
  • La Tabla 5 establece la correspondencia componente-rasgo comparando signos con etiquetas Big Five en el conjunto de entrenamiento.
  • La sección de direcciones futuras reconoce que faltan validez convergente, efectos del grado de conocimiento y fiabilidad test-retest.
  • El artículo fue publicado como póster del Workshop on Behavioral Machine Learning de NeurIPS 2024, no como artículo de la conferencia principal.
  • El registro oficial de OpenReview contiene cuatro autores; el PDF identifica a David M. Chan y no incluye a John Canny como autor.
  • La fuente no enlaza repositorio, dataset derivado, matrices de log-probabilidad, splits, modelos ajustados ni archivos de resultados.
  • El trabajo prueba una sonda sobre probabilidades de salida condicionadas por un prompt; no inspecciona activaciones internas ni representaciones ocultas del LLM.

Limitaciones

  • Circularidad del diseño: los relatos se generan explícitamente desde las cinco variables binarias Big Five y después se celebra recuperar cinco ejes.
  • Circularidad del vocabulario: las 100 variables de entrada son marcadores Big Five de Goldberg ya agrupados por rasgo y polo, no descriptores libres descubiertos por el modelo.
  • La frase 'sin imponer taxonomías predefinidas' no describe fielmente el protocolo, que fija una taxonomía Big Five tanto en el dataset como en el conjunto de adjetivos.
  • Los textos son sintéticos y sus etiquetas son condiciones de generación, no evaluaciones psicológicas verificadas de autores humanos.
  • No se valida que cada relato exprese realmente los cinco rasgos prescritos después del filtrado.
  • De los 320 relatos previstos se eliminan 112, pero no se publican criterios operativos completos, ejemplos, conteos por regla ni auditoría del filtro.
  • No se informa el balance por rasgo ni por las 32 combinaciones tras retirar el 35 % de los relatos; el filtrado puede romper el diseño factorial.
  • Solo se prueba un corpus de relatos en inglés generado por un único modelo y una única plantilla de personalidad.
  • No hay corpus externo, autobiografías reales, juicios de observadores, autoinformes ni réplica intercultural.
  • La selección de k=5 está guiada por la hipótesis Big Five; un 74,3 % de varianza acumulada no demuestra por sí mismo que existan exactamente cinco constructos.
  • El nombre de cada componente se asigna mediante inspección de adjetivos previamente etiquetados; no hay métrica independiente de congruencia factorial ni rotación y confirmación en otra muestra.
  • Para la predicción SVD, la correspondencia componente-rasgo usa una matriz de exactitud con etiquetas de entrenamiento, lo que matiza la afirmación de que el procedimiento completo no necesita etiquetas.
  • El signo de los vectores singulares es indeterminado; el artículo no especifica una regla reproducible para orientar cada componente antes de medir exactitud.
  • No se explica con suficiente detalle cómo se proyectan relatos de test en la base SVD aprendida ni qué datos se usan para centrar, ajustar y emparejar componentes.
  • La división 80/10/10 se describe solo para DeBERTaV3; no se documentan claramente los splits de SVD y Lasso.
  • No se reportan semillas, número de repeticiones, desviaciones, intervalos de confianza ni pruebas de significación.
  • Muchas exactitudes no son compatibles con un único test de aproximadamente 21 relatos, lo que sugiere promediado o múltiples splits que el texto no documenta.
  • Las filas idénticas de Mixtral y Llama-3.1-70B-Instruct en dos métodos completos pueden ser una coincidencia o un error de tabla; sin artefactos no puede resolverse.
  • La suma de log-probabilidades penaliza adjetivos con más tokens; no se ensaya normalización por longitud ni robustez a tokenizadores alternativos.
  • El centrado elimina medias por adjetivo, pero no iguala varianzas ni corrige otros sesgos léxicos, de frecuencia, longitud o tokenización.
  • Solo se usa un prompt de evaluación y temperatura 1,0; no hay sensibilidad a redacción, idioma, formato o temperatura.
  • Lasso es supervisado y usa las mismas 100 variables semánticamente Big Five; su superioridad no valida el descubrimiento no supervisado de factores.
  • La comparación con el 0,698 de PersonaLLM mezcla un resultado publicado de GPT-4 con modelos, variables y posiblemente splits distintos.
  • El barrido de DeBERTaV3 comprende 128 configuraciones sobre un conjunto de validación muy pequeño y no se acompaña de validación cruzada.
  • El texto llama '5-way classifier' a una salida entrenada con BCE para cinco etiquetas binarias, una descripción ambigua entre clasificación multiclase y multietiqueta.
  • No hay análisis de fiabilidad, validez convergente, discriminante, criterial o incremental, ni invariancia de medida.
  • No se publican código, entorno, dependencias, versiones exactas de checkpoints, hardware, coste, matrices, splits, predicciones ni modelos ajustados.
  • No existe una sección sustantiva de limitaciones o ética sobre privacidad, inferencia no consentida, discriminación o uso de etiquetas de personalidad.
  • El cierre extrapola hacia valores éticos, normas culturales y conductas sociales sin experimentos sobre esos dominios.

Qué no demuestra

  • No demuestra que un LLM posea personalidad psicológica, identidad, rasgos estables ni experiencia subjetiva.
  • No demuestra que los componentes obtenidos residan en el espacio latente interno del modelo; son componentes de una matriz externa de probabilidades de salida.
  • No demuestra un redescubrimiento de Big Five independiente de la taxonomía, porque el diseño usa historias y adjetivos construidos desde Big Five.
  • No demuestra que cinco sea el número intrínseco de dimensiones de personalidad en los modelos.
  • No demuestra equivalencia entre percepción del LLM y percepción humana.
  • No establece validez psicométrica, diagnóstica, clínica o laboral de la sonda.
  • No establece exactitud para personas reales, conversaciones espontáneas, textos de redes sociales ni contextos de despliegue.
  • No establece generalización fuera de PersonaLLM, de GPT-4-0613 como generador o del inglés.
  • No establece invariancia entre culturas, idiomas, géneros, grupos demográficos o estilos de escritura.
  • No establece estabilidad temporal, fiabilidad test-retest ni robustez entre prompts.
  • No establece que las diferencias de exactitud entre modelos o baselines sean estadísticamente significativas.
  • No establece que Lasso supere en general a modelos de texto ajustados o a prompting directo bajo protocolos equiparables.
  • No establece que el método SVD no necesite etiquetas para producir predicciones nombradas, pues el emparejamiento evaluado usa etiquetas de entrenamiento.
  • No establece que las cargas reflejen semántica de personalidad y no regularidades de tokenización, frecuencia, plantilla o generación sintética.
  • No permite atribuir causalmente resultados al tamaño del modelo, al ajuste de instrucciones ni a una arquitectura concreta.
  • No demuestra que las etiquetas de generación sean ground truth de los relatos conservados.
  • No demuestra seguridad, equidad, privacidad ni aceptabilidad de inferir personalidad sin consentimiento.
  • No aporta evidencia empírica sobre normas éticas, culturales o comportamientos sociales pese a mencionarlos como extensión potencial.
  • No prueba que los resultados sean reproducibles a partir de los materiales publicados.

Trazabilidad

Alcance: Texto completo

Versión: arXiv 2409.09905v1, 16 Sep 2024, 18 pages; publication metadata cross-checked against OpenReview forum HmtCakUGHj and the official NeurIPS 2024 Behavioral ML workshop record

Fuente consultada: https://arxiv.org/pdf/2409.09905v1

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, venue-status, psychometric-validity, factor-analysis, metric, internal-consistency, reproducibility and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4-0613 como generador del dataset y baseline publicado de prompting
  • Llama-3.1-70B
  • Llama-3.1-70B-Instruct
  • Llama-3-70B
  • Llama-3-70B-Instruct
  • Llama-3.1-8B
  • Llama-3.1-8B-Instruct
  • Llama-3-8B
  • Llama-3-8B-Instruct
  • Mixtral-8x22B
  • DeBERTaV3 Large

Instrumentos y métricas

  • Goldberg 100 unipolar trait-descriptive adjectives
  • Big Five binary trait labels
  • Log-probability matrix of adjective completions
  • Column mean centering
  • Singular value decomposition with k=5
  • Lasso regression
  • Binary accuracy
  • Explained variance ratio
  • Five-output DeBERTaV3 classifier with binary cross-entropy

Datos utilizados

  • PersonaLLM synthetic personal stories
  • Goldberg 1992 100-adjective Big Five marker set

Evidencia y localización

  • Publicación y tipo de venue: Official NeurIPS 2024 virtual record 102146: poster in Workshop on Behavioral Machine Learning; title and four authors
  • Registro editorial final: OpenReview forum HmtCakUGHj: published 10 Oct 2024, modified 18 Oct 2024, submission 42, CC BY 4.0
  • Fuente completa auditada: .cache/editorial-sources/article-089/source.pdf; arXiv 2409.09905v1; 18 pages; sha256 134f67be18e14ad51a4e36f26398dcf13141439aeaa32baa188639a683ebfa8f
  • Pregunta y promesa principal: Full text pp. 1-2, Abstract and Introduction
  • Prompt y matriz de log-probabilidades: Full text pp. 2-3, Figure 2 and Section 2
  • Centrado, SVD y uso de U y V: Full text p. 3, Sections 2.1-2.2
  • Modelos evaluados: Full text p. 3, Section 3; p. 4, Table 1
  • Muestra sintética y filtrado: Full text p. 12, Appendix B: 10 stories x 32 combinations, 208 retained
  • Cinco componentes y 74,3 %: Full text p. 3, Section 3.1; p. 13, Figure 5 and Appendix C.1
  • Resultados completos SVD, Lasso y baselines: Full text p. 4, Table 1
  • Duplicación de filas entre modelos: Full text p. 4, Table 1: Mixtral-8x22B exactly matches Llama-3.1-70B-Instruct for all five SVD and all five Lasso trait accuracies
  • Emparejamiento con etiquetas de entrenamiento: Full text p. 17, Appendix C.3 and Table 5
  • Cargas extremas y mezcla entre rasgos: Full text pp. 13-16, Appendix C.2 and Tables 3-4
  • Excepciones en apertura: Full text p. 16, Table 4 caption and Openness loadings
  • Sesgo de frecuencia de adjetivos: Full text pp. 8-10, Appendix A.1 and Figures 3-4
  • Tokenización y suma de probabilidades: Full text p. 12, Appendix A.3
  • Temperatura única: Full text p. 12, Appendix A.4: main results at T=1.0
  • Lista Big Five predefinida: Full text pp. 8 and 11, Appendix A.2 and Table 2: Goldberg 100 unipolar adjectives grouped by trait and pole
  • Diseño del baseline DeBERTa: Full text p. 17, Appendix D.1: 80/10/10 split and 128 hyperparameter combinations
  • Baseline de prompting importado: Full text p. 18, Appendix D.2: published PersonaLLM accuracy used as baseline
  • Validez y fiabilidad pendientes: Full text p. 4, Section 4: convergent validity, acquaintance and test-retest reliability listed as future directions
  • Extrapolación final: Full text pp. 4-5, Conclusion: potential extension to ethical and cultural norms and social behaviors
  • Ausencia de personas reales: Full text pp. 3 and 12: all 208 evaluated stories originate from GPT-4-0613 PersonaLLM generation
  • Ausencia de inferencia interna: Full text pp. 2-3, Figure 1 and Section 2: X consists of output adjective log-probabilities, not hidden activations
  • Ausencia de incertidumbre estadística: Full text pp. 3-4 and 13-18: point accuracies and loadings only; no seeds, error bars for accuracy, confidence intervals or significance tests
  • Ausencia de artefactos reproducibles: Full text pp. 1-18 and official author/publication pages checked 15 Jul 2026: no code, result archive or study repository linked; focused GitHub repository search returned no project
  • Ausencia de evaluación ética: Full text pp. 1-18: no ethics, privacy, consent, fairness or misuse analysis
  • Lectura y comprobación visual integral: All 18 pages rendered and inspected, including Figures 1-5, Tables 1-5, equations, appendices and references; checked 15 Jul 2026