Evaluating LLM Alignment on Personality Inference from Real-World Interview Data

Evaluación y validez psicométrica2026arXivRevisión editorial aprobada

Autores: Jianfeng Zhu, Julina Maharjan, Xinyu Li, Karin G. Coifman, Ruoming Jin

Palabras clave: Computation and Language, Large Language Models, Personality Inference, Big Five Personality Traits, Machine Learning

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
7
Hallazgos
12
Limitaciones
8
Evidencias

Resumen editorial

Español

Este preprint evalúa si varios métodos basados en modelos de lenguaje pueden predecir las puntuaciones continuas del Big Five a partir de entrevistas semiestructuradas. El manuscrito declara 518 adultos, unos 15 minutos de habla por participante y autoinforme BFI-10 como objetivo. La cifra de muestra no cuadra con sus propios datos demográficos: 275 hombres + 278 mujeres y 431 personas blancas + 122 no blancas/otras suman 553 en ambos casos. Tampoco informa medias, desviaciones, rango, fiabilidad de las escalas de dos ítems, datos faltantes ni cómo pasa de 553 a 518 si ambas cifras fueran correctas. El BFI-10 es una medida humana validada, pero una puntuación breve autoinformada no es «ground truth» observable de la personalidad y el paper no demuestra que el contenido de una entrevista de quince minutos contenga información suficiente para recuperar cada rasgo. Se comparan cuatro configuraciones. GPT-4.1 Mini recibe la transcripción completa y devuelve simultáneamente cinco valores entre 1 y 5, en pasos de 0,5, mediante zero-shot o un prompt que pide resumir tono, identificar indicios y justificar la puntuación. El texto llama determinista a temperatura 0,2, aunque 0,2 permite muestreo y no se reportan repeticiones. La segunda familia adapta Llama-3.1-8B-Instruct por separado para cada rasgo mediante LoRA de rango 8, 16 o 32. Para RoBERTa-base se trocean las transcripciones con solapamiento, se promedian representaciones y se entrena una cabeza de regresión; sin embargo, método, Tabla 4 y Figura 3 alternan los nombres RoBERTa, BERT, «embedding+LoRA» y «LoRA-based» sin especificar con precisión qué parámetros se adaptan. Finalmente, embeddings all-MiniLM-L6-v2 y text-embedding-3-small alimentan una regresión Ridge multi-output con split 80/20. Para estos dos se dice que se incrusta la transcripción completa, sin aclarar truncamiento o agregación pese al límite de contexto de MiniLM. No se publican particiones para LoRA/RoBERTa, semillas, estratificación, conjunto de validación, selección de hiperparámetros, regularización, epochs, batch size, intervalos o pruebas entre modelos. El hallazgo más sólido es negativo: ninguna correlación de Pearson supera 0,255. En GPT-4.1 Mini zero-shot, responsabilidad alcanza r=0,250 y amabilidad 0,132; neuroticismo, apertura y extraversión quedan en 0,065, 0,020 y 0,041. CoT no mejora el conjunto: 0,236, 0,133, −0,009, 0,051 y 0,005, respectivamente. En la tabla de la variante encoder/«BERT», los mejores valores por rasgo son 0,197 en extraversión, 0,173 en amabilidad, 0,219 en responsabilidad, 0,236 en neuroticismo y 0,255 en apertura. Llama-LoRA llega como máximo a 0,164 en responsabilidad y arroja varias correlaciones negativas. La regresión con embeddings estáticos tampoco supera 0,119: MiniLM va de −0,069 a 0,112 y OpenAI de −0,050 a 0,119. Las MAE cuentan una historia distinta porque algunos modelos predicen cerca del centro de la escala. GPT-4 tiene MAE inferior a 0,6 solo en apertura y superior a 1,2 en responsabilidad y amabilidad. OpenAI embeddings logra 0,776 en apertura y 0,916 en amabilidad, pero 1,080 en responsabilidad y más de 1,2 en extraversión y neuroticismo. En la Figura 3, valores bajos como 0,431 en apertura coexisten con r nulo o negativo; eso es compatible con regresión a la media y no con ordenación válida de personas. El propio texto atribuye 0,431 en rango 8 y 0,493 en rango 16 tanto al grupo Llama como al grupo embedding+LoRA de formas incompatibles con las curvas, de modo que esas cifras no permiten una comparación fiable de arquitectura. El artículo tampoco incluye un baseline de predecir la media, necesario para juzgar si una MAE central aporta valor, ni incertidumbre para las correlaciones de un test de aproximadamente cien casos. Su interpretación de diferencias entre rasgos, por ejemplo atribuir responsabilidad a RLHF, apertura a imaginación o extraversión a falta de interacción, es especulativa y no se contrasta. En conjunto, el trabajo ofrece una comparación útil y prudente en su conclusión principal: estos métodos no recuperan bien las puntuaciones BFI-10 desde las entrevistas. No demuestra, sin embargo, que el fallo sea una carencia general de «comprensión psicológica» o alineamiento del LLM en lugar de baja señal del texto, ruido del BFI-10, muestra pequeña, protocolo incompleto o mala calibración.

English

This preprint evaluates whether several language-model-based methods can predict continuous Big Five scores from semi-structured interviews. The manuscript reports 518 adults, approximately 15 minutes of speech per participant, and BFI-10 self-reports as targets. Its sample size conflicts with its own demographics: 275 male + 278 female and 431 White + 122 non-White/other both total 553. It reports no trait means, standard deviations, ranges, two-item-scale reliability, missingness, or explanation of how 553 becomes 518 if both counts are meaningful. The BFI-10 is a validated human measure, but a brief self-report score is not observable personality “ground truth,” and the paper does not establish that a fifteen-minute interview contains enough signal to recover each trait. Four configurations are compared. GPT-4.1 Mini receives the transcript and simultaneously returns five 1–5 scores in half-point steps through either zero-shot prompting or a prompt asking it to summarize tone, identify cues, and justify scores. The paper calls temperature .2 deterministic, although .2 still samples and no repeated runs are reported. A second family adapts Llama-3.1-8B-Instruct separately for each trait using LoRA ranks 8, 16, and 32. For RoBERTa-base, overlapping transcript chunks are encoded, mean-pooled, and passed to a regression head; however, the method, Table 4, and Figure 3 alternate among RoBERTa, BERT, “embedding+LoRA,” and “LoRA-based” without clearly specifying which parameters are adapted. Finally, all-MiniLM-L6-v2 and text-embedding-3-small embeddings feed a multi-output Ridge regression with an 80/20 split. These are said to embed full transcripts without explaining truncation or aggregation despite MiniLM's context limit. The paper does not report LoRA/RoBERTa splits, seeds, stratification, validation selection, regularization, epochs, batch size, confidence intervals, or statistical comparisons. The strongest finding is negative: no Pearson correlation exceeds .255. For GPT-4.1 Mini zero-shot, Conscientiousness reaches r=.250 and Agreeableness .132; Neuroticism, Openness, and Extraversion are .065, .020, and .041. Chain-of-thought does not improve the set: .236, .133, −.009, .051, and .005, respectively. In the encoder/“BERT” table, the best values by trait are .197 for Extraversion, .173 for Agreeableness, .219 for Conscientiousness, .236 for Neuroticism, and .255 for Openness. Llama-LoRA peaks at .164 for Conscientiousness and produces several negative correlations. Static embedding regression also remains at or below .119: MiniLM ranges from −.069 to .112 and OpenAI from −.050 to .119. MAE tells a different story because some models predict near the scale center. GPT-4 has MAE below .6 only for Openness and above 1.2 for Conscientiousness and Agreeableness. OpenAI embeddings achieve .776 for Openness and .916 for Agreeableness, but 1.080 for Conscientiousness and above 1.2 for Extraversion and Neuroticism. In Figure 3, low values such as .431 on Openness coexist with null or negative r, which is compatible with regression to the mean rather than valid ranking of individuals. The text also attributes .431 at rank 8 and .493 at rank 16 to Llama and embedding+LoRA in ways inconsistent with the plotted curves, preventing a clean architecture comparison. No mean-prediction baseline is provided, although it is essential for deciding whether central MAE adds value, and no uncertainty is shown for correlations from a test set of roughly one hundred cases. Trait-level stories, such as attributing Conscientiousness to RLHF, Openness to imagination, or poor Extraversion to absent interaction, are speculative rather than tested. Overall, the paper offers a useful comparison and a defensible main conclusion: these methods recover BFI-10 scores poorly from the interviews. It does not show that the failure reflects a general lack of LLM psychological understanding or alignment rather than weak textual signal, BFI-10 noise, small samples, incomplete protocols, or calibration problems.

Pregunta de investigación

¿Hasta qué punto GPT-4.1 Mini, modelos adaptados con LoRA y regresores sobre embeddings pueden recuperar puntuaciones continuas BFI-10 desde entrevistas semiestructuradas reales?

Método

Se comparan correlación de Pearson y MAE por rasgo en cuatro configuraciones: GPT-4.1 Mini zero-shot y con justificación CoT; Llama-3.1-8B-Instruct adaptado por rasgo con LoRA de rangos 8/16/32; un encoder RoBERTa/BERT con chunks, mean pooling y cabeza de regresión presentado como embedding+LoRA; y regresión Ridge multi-output sobre embeddings MiniLM u OpenAI con split 80/20. Los objetivos son autoinformes BFI-10 de participantes entrevistados; el protocolo no documenta de forma suficiente las particiones y el entrenamiento de todas las variantes.

Muestra: El texto declara 518 adultos y aproximadamente 15 minutos de entrevista por persona. Los recuentos publicados por sexo y raza suman 553, sin reconciliación. La edad indicada es M=39,39, SD=16,33. No se publican distribuciones BFI-10, exclusiones, missingness o tamaños exactos de train/validation/test para cada paradigma. Solo la regresión Ridge especifica 80/20, que implicaría unos 104 casos de test si n=518. No hay muestra externa de validación.

Hallazgos

  • Todas las correlaciones están por debajo de 0,26; la máxima es apertura r=0,255 en la variante encoder de rango 32.
  • GPT-4.1 Mini zero-shot alcanza r=0,250 en responsabilidad y 0,132 en amabilidad, pero solo 0,020–0,065 en los otros tres rasgos.
  • El prompt CoT no mejora globalmente: reduce responsabilidad, neuroticismo y extraversión, apenas eleva apertura y deja amabilidad prácticamente igual.
  • La variante encoder reporta mejores correlaciones que Llama-LoRA en la mayoría de celdas; Llama alcanza como máximo 0,164 y tiene varios valores negativos.
  • MiniLM y text-embedding-3-small con Ridge no superan r=0,119 y presentan signos distintos para amabilidad y neuroticismo.
  • Algunas MAE de apertura son bajas pese a correlaciones cercanas a cero o negativas, patrón compatible con predicciones centrales que no ordenan correctamente a las personas.
  • La narrativa y la Figura 3 no concuerdan al asignar MAE de 0,431 y 0,493 a las variantes Llama o embedding+LoRA.

Limitaciones

  • El tamaño declarado n=518 contradice dos desgloses demográficos independientes que suman 553; no se explican exclusiones ni datos faltantes.
  • El BFI-10 tiene solo dos ítems por rasgo; el estudio no publica fiabilidad, distribuciones o error de medida y lo trata de forma excesiva como ground truth.
  • No existe un baseline de media, regresión lineal con rasgos lingüísticos simples o techo de fiabilidad para contextualizar MAE y r.
  • No se publican intervalos, p-valores, bootstraps ni comparaciones emparejadas; con un test cercano a cien casos, diferencias pequeñas entre r son inestables.
  • El protocolo omite particiones de LoRA/RoBERTa, validación, seeds, epochs, batch size, optimizador, learning rate, regularización y criterio de selección.
  • La nomenclatura BERT/RoBERTa/embedding+LoRA es inconsistente y la atribución de varias MAE contradice la figura.
  • Temperatura 0,2 se denomina determinista sin repetir ejecuciones; no se mide sensibilidad a sampling ni a prompt.
  • MiniLM recibe supuestamente transcripciones completas sin explicación de truncamiento, chunking o longitud efectiva.
  • El split 80/20 único no se repite ni estratifica y no hay evaluación externa, entre cohortes o de generalización demográfica.
  • El paper no detalla reclutamiento, consentimiento/IRB, distribución por entrevista, manejo de intervenciones del entrevistador o transcripción.
  • Los umbrales cualitativos de r y MAE se presentan sin justificación específica para BFI-10 o para decisiones de alto riesgo.
  • Las explicaciones psicológicas y arquitectónicas de las diferencias por rasgo son post hoc y no se someten a pruebas.

Qué no demuestra

  • No demuestra que GPT-4.1, Llama, RoBERTa o los embeddings infieran personalidad con validez individual.
  • No demuestra que una MAE baja aislada corresponda a buena predicción; puede surgir al aproximarse a la media de la escala.
  • No demuestra que CoT sea innecesario para toda inferencia de personalidad; prueba una sola plantilla y un modelo.
  • No permite atribuir el bajo rendimiento a falta de alineamiento o comprensión psicológica en lugar de baja señal, etiqueta ruidosa o diseño insuficiente.
  • No valida screening de salud mental, consejo, marketing o decisiones sobre personas y advierte contra usos de alto riesgo sin supervisión.
  • No establece generalización a otras entrevistas, idiomas, poblaciones, modalidades, instrumentos largos o resultados conductuales.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2509.13244v1 (16 September 2025)

Fuente consultada: https://arxiv.org/pdf/2509.13244

Revisión: Codex editorial review, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4.1 Mini (gpt-4.1-mini-2025-04-14)
  • Meta-Llama-3.1-8B-Instruct with trait-specific LoRA
  • RoBERTa-base / BERT encoder reported inconsistently
  • all-MiniLM-L6-v2
  • OpenAI text-embedding-3-small (2024-04-15)
  • Multi-output Ridge regression

Instrumentos y métricas

  • 10-item Big Five Inventory (BFI-10)
  • Semi-structured interview protocol
  • Zero-shot 1–5 Big Five prompt
  • Chain-of-thought-style cue and justification prompt
  • Pearson correlation
  • Mean Absolute Error
  • LoRA ranks 8, 16 and 32
  • Overlapping transcript chunks and mean pooling

Datos utilizados

  • Real-world semi-structured interview transcripts described as 518 participants
  • BFI-10 self-report scores paired to transcripts
  • Demographic table counts totaling 553 participants

Evidencia y localización

  • Objetivo, paradigmas y resultado global inferior a 0,26: arXiv v1, pp. 1–2, Abstract and Introduction
  • Muestra, entrevista, BFI-10 y contradicción demográfica: arXiv v1, p. 4, Ecologically Valid Interview Dataset and Table 2
  • Prompt GPT-4.1 Mini, temperatura y LoRA/encoder: arXiv v1, pp. 4–5, Experimental Design and Figure 1
  • Embeddings, split 80/20, Pearson y MAE: arXiv v1, p. 5, Embedding-based Regression and Evaluation Metrics
  • Correlaciones zero-shot y CoT y sus MAE: arXiv v1, p. 5, Table 3 and Figure 2
  • Correlaciones LoRA/encoder e inconsistencia de nombres: arXiv v1, pp. 5–6, Table 4 and Figure 3
  • Regresión de embeddings y calibración: arXiv v1, p. 6, Table 5 and Figure 4
  • Interpretación, límites declarados y usos de alto riesgo: arXiv v1, pp. 6–8, Discussion, Limitations, Conclusion and Ethical Considerations