From Five Dimensions to Many: Large Language Models as Precise and Interpretable Psychological Profilers

Evaluación y validez psicométrica2026OpenReviewRevisión editorial aprobada

Autores: Yi-Fei Liu, Yi-Long Lu, Di He, Hang Zhang

Palabras clave: Large Language Models, Psychological Profiling, Big Five, Psychometrics, Structural Correlation, LLM Evaluation, Reasoning Traces, Privacy and Reproducibility

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
10
Hallazgos
15
Limitaciones
12
Evidencias

Resumen editorial

Español

Este trabajo aceptado como póster en ICLR 2026 estudia si varios LLM pueden reconstruir la estructura de correlaciones entre rasgos psicológicos a partir de información mínima. Para 816 participantes chinos de un estudio realizado durante la pandemia, los autores proporcionaron a doce condiciones de modelo los 20 ítems del Big Five y les pidieron representar a cada persona al contestar nueve escalas adicionales. El resultado principal no es una medida de precisión individual: compara 105 correlaciones Big-Five–escala-objetivo generadas por los modelos con las correlaciones humanas. En Gemini 2.5, la regresión entre ambos vectores obtiene k = 1,42 y R² = 0,92; nuestra reproducción con los archivos publicados da k = 1,415 y R² = 0,917. Los doce modelos muestran k > 1, lo que el artículo denomina amplificación estructural. Este hallazgo agregado es sólido en los outputs liberados, pero no significa que el modelo explique más del 88 % de los rasgos de una persona. La tabla de predicción individual presenta correlaciones medias de 0,345 a 0,445. El análisis de trazas encuentra gran acuerdo entre modelos a nivel de factores (r = 0,981 frente a un baseline Bayesian Ridge), pero poco a nivel de ítems (r = 0,207), por lo que no valida el razonamiento interno. Los resúmenes narrativos mejoran modestamente el resultado al añadirse a los scores, aunque las comparaciones usan subconjuntos variables de 193 a 711 participantes y no están emparejadas limpiamente con el baseline de 816. El repositorio permite comprobar parcialmente el efecto estructural, pero carece de código, enlaces individuales entre escalas humanas, los 20 ítems Big Five usados como input, baselines ejecutables, tests, dependencias y licencia. Además, el archivo demográfico y Big Five conserva cuasi-identificadores muy específicos: 680 de 816 filas son únicas al combinar sexo, provincia, edad exacta, ocupación, educación y fecha, lo que contradice una interpretación fuerte de «totalmente anonimizado». La lectura defendible es que estos LLM reproducen y amplifican una estructura de covarianza psicológica en esta muestra y bajo estos prompts; no que realicen perfiles individuales precisos, válidos, explicables o seguros.

English

This ICLR 2026 poster asks whether LLMs can reconstruct the correlation structure among psychological traits from minimal inputs. For 816 Chinese participants from a pandemic-era study, the authors gave twelve model conditions the 20 Big Five items and asked them to role-play each participant's answers to nine additional instruments. The primary result is not individual accuracy: it compares 105 model-generated Big-Five-to-target correlations with the corresponding human correlations. For Gemini 2.5, the reported regression is k = 1.42 and R² = 0.92; our reproduction from the released outputs gives k = 1.415 and R² = 0.917. All twelve conditions have k > 1, which the paper calls structural amplification. This aggregate effect is well supported by the released outputs, but it does not mean that a model explains more than 88% of an individual's psychological traits. The individual-prediction table reports mean correlations from 0.345 to 0.445. Reasoning-trace analysis shows strong factor-level agreement with a Bayesian-ridge baseline (r = 0.981) but weak item-level agreement (r = 0.207), so it does not validate the model's internal reasoning. Adding a narrative summary to the scores yields modest improvements, but the summary comparisons use variable subsets of 193 to 711 participants and are not cleanly matched to the 816-person ScoreOnly baseline. The repository permits a partial check of the structural effect but releases no code, linked human-scale records, 20-item Big Five prompt inputs, executable baselines, tests, dependencies, or license. It also retains highly specific quasi-identifiers in the Big Five file: 680 of 816 rows are unique on gender, province, exact age, job, education, and survey date, which conflicts with a strong reading of fully anonymized. The defensible conclusion is that these LLMs reproduce and amplify an aggregate psychological covariance pattern in this sample and prompt setting; the paper does not establish precise, valid, interpretable, or safe individual profiling.

Pregunta de investigación

¿Pueden los LLM reconstruir, a partir de los 20 ítems del Big Five de una persona, la estructura agregada de correlaciones que conecta esos rasgos con nueve instrumentos psicológicos, y qué indican sus trazas y resúmenes sobre el mecanismo de esa simulación?

Método

Se usaron datos de 816 participantes y doce condiciones de LLM vía OpenRouter. Cada modelo recibió los 20 ítems del Big Five de cada participante y generó respuestas a los ítems de nueve instrumentos objetivo. Se puntuaron 21 subescalas objetivo, se construyeron matrices de correlación de 26 variables y se regresaron los 105 coeficientes Big-Five–objetivo del modelo sobre los humanos; la pendiente k mide amplificación y R² mide el ajuste entre coeficientes. Se añadieron un test de permutación de 1.000 iteraciones, variantes de orden y pregunta individual para Gemini, baselines de ML y similitud semántica, análisis de consistencia interna y atenuación, y un segundo experimento que hizo anotar trazas de cinco modelos de razonamiento por cuatro LLM y comparó ScoreOnly, SummaryOnly y Summary+Score. La auditoría reprodujo de forma independiente el efecto estructural con los outputs públicos y examinó cobertura, missingness, privacidad y completitud del repositorio.

Muestra: 816 participantes chinos de un estudio longitudinal online sobre percepciones de la pandemia. El artículo no aporta validación externa en otra cohorte, cultura, idioma o periodo. Un subgrupo de 309 participantes se define como más atento mediante tiempos de respuesta.

Hallazgos

  • Gemini 2.5 obtiene k = 1,42 y R² = 0,92 al comparar 105 correlaciones Big-Five–objetivo; la reproducción independiente obtiene k = 1,415 y R² = 0,917.
  • Las doce condiciones de LLM publicadas muestran k > 1 y reproducen una versión amplificada de la estructura de correlaciones humanas; el baseline semántico informa k = 0,99 y R² = 0,52.
  • El efecto persiste para Gemini con orden estándar, orden aleatorio y una pregunta cada vez, con k = 1,42, 1,41 y 1,42; el test de permutación de 1.000 iteraciones informa p < .001.
  • La precisión individual es mucho menor que el R² estructural: las correlaciones medias de Table 2 van de 0,345 a 0,445; el mejor valor es Claude Summary+Score con r = 0,445.
  • Los perfiles de atribución convergen entre modelos (r medio = 0,934; KL = 0,0475), pero se alinean débilmente con el baseline humano a nivel de ítem (r = 0,207) y fuertemente a nivel de factor (r = 0,981).
  • Summary+Score mejora modestamente frente a ScoreOnly en los cinco modelos de Table 2, mientras SummaryOnly rinde peor que ScoreOnly en los cinco.
  • La consistencia interna media es mayor en respuestas LLM (alfa = 0,87) que humanas (0,75), pero esto puede reflejar homogeneización o respuestas estereotipadas y no equivale a validez.
  • La corrección unilateral por atenuación acerca k a 1, el subgrupo atento de 309 participantes produce k = 1,08 y añadir ruido gaussiano a una regresión reduce k de 1,55 a 1,12; son resultados compatibles con atenuación, no una demostración causal del mecanismo LLM.
  • El repositorio permite reproducir aproximadamente la amplificación estructural, pero no la predicción individual, los baselines entrenados ni la canalización completa.
  • El archivo público basic_info_BF.csv tiene 680 de 816 filas únicas al combinar seis cuasi-identificadores, un riesgo alto de singling out para datos psicológicos sensibles.

Limitaciones

  • El R² principal opera sobre coeficientes de correlación agregados y no debe presentarse como R² de perfiles individuales.
  • Una sola muestra china en contexto COVID-19 limita la validez externa; no hay cohorte, cultura, idioma ni periodo independientes.
  • No se publican MAE, RMSE, calibración, intervalos predictivos ni umbrales útiles a nivel de persona.
  • Las trazas de razonamiento no se validan como explicaciones fieles; LLM anotan textos producidos por otros LLM y pueden compartir sesgos.
  • Los subconjuntos SummaryOnly y Summary+Score varían entre 193 y 711 casos; Gemini promedia solo 35,8 % de cobertura, mientras ScoreOnly usa 816.
  • Los quince puntos usados para relacionar k con r incluyen tres medidas dependientes por modelo y ambas métricas comparten la misma estructura de covarianza.
  • Mayor alfa puede deberse a respuestas más homogéneas o redundantes, no a mayor validez psicológica.
  • La corrección por atenuación depende de supuestos clásicos, la selección de participantes atentos es observacional y añadir ruido a un modelo lineal atenúa correlaciones de forma esperable.
  • El baseline BGE no descarta priors psicológicos aprendidos, estereotipos de rasgos ni consistencia inducida por el prompt.
  • El repositorio no incluye código, notebooks, dependencias, tests, baselines ejecutables, outputs de tablas ni licencia.
  • Los archivos humanos se barajaron de forma independiente y no permiten reproducir vínculos individuales; el archivo Big Five publica cinco scores agregados, no los 20 ítems usados en prompts.
  • Falta un output Experiment 1 de DeepSeek Chat; los 144 mapas de ítems contienen 77.435 celdas ausentes y algunas filas completas bajan a 304.
  • OpenRouter, modelos propietarios y parámetros de generación no quedan congelados; faltan temperatura, top-p, seeds, repeticiones, fechas y trazas de petición.
  • La afirmación de anonimización total no está respaldada por un análisis de disclosure risk; los cuasi-identificadores permiten singularizar la mayoría de filas.
  • No se documentan permisos de redistribución para los seis PDFs de cuestionarios ni una licencia del repositorio.

Qué no demuestra

  • No demuestra que los LLM expliquen más del 88 % de los rasgos psicológicos de una persona.
  • No valida uso individual para diagnóstico, selección, intervención, recomendación o decisiones de alto impacto.
  • No demuestra validez de constructo, calibración ni equivalencia psicométrica entre respuestas humanas y simuladas.
  • No prueba que las trazas de cadena de pensamiento revelen el mecanismo causal interno del modelo.
  • No separa completamente razonamiento psicológico de priors aprendidos, estereotipos o consistencia inducida por el prompt.
  • No demuestra que un resumen contenga información observada nueva sobre el participante ni un estadístico suficiente en sentido formal.
  • No prueba que mayor consistencia interna implique mayor exactitud o validez.
  • No prueba causalmente que los LLM filtren ruido humano para recuperar true scores.
  • No establece generalización a otras poblaciones, culturas, idiomas, instrumentos, proveedores o versiones de modelo.
  • No demuestra que el dataset público esté totalmente anonimizado ni que la publicación sea de bajo riesgo.
  • No permite reproducir de extremo a extremo todas las tablas, baselines, análisis individuales y conclusiones mecanísticas.

Trazabilidad

Alcance: Texto completo

Versión: ICLR 2026 Poster; accepted 29-page paper mirrored as arXiv:2511.03235v2, revised 23 March 2026

Fuente consultada: https://openreview.net/forum?id=JXFnCpXcnY

Revisión: Codex complete bilingual full-text fidelity pass using the accepted ICLR 2026 paper, all-page visual inspection, official repository and data audit, independent structural-regression reproduction, aggregate-versus-individual metric reconciliation, reasoning-trace and summary-condition assessment, missingness and privacy measurement, and reproducibility and licensing review; summaries written from paper and artifact evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • DeepSeek V3.1 Chat
  • DeepSeek V3.1 Thinking
  • GPT-5 Chat
  • Claude 3.7 Sonnet Chat
  • Claude 3.7 Sonnet Thinking
  • Gemini 2.5 Flash Chat
  • Gemini 2.5 Flash Thinking
  • GLM-4.5 Chat
  • GLM-4.5 Thinking
  • Kimi K2 Chat
  • Qwen3-235B Chat
  • Qwen3-235B Thinking
  • BAAI bge-reranker-large semantic baseline
  • KNN, SVM, Linear Regression and Bayesian Ridge baselines

Instrumentos y métricas

  • Short IPIP-BFM-20 Big Five inventory
  • Perceived Stress Scale
  • Simplified Coping Style Questionnaire
  • State-Trait Anxiety Inventory, trait subscale
  • Self-Compassion Scale
  • Connor-Davidson Resilience Scale
  • Intolerance of Uncertainty Scale
  • Emotion Regulation Questionnaire
  • Risk Perception and Behavior Questionnaire
  • Future Time Perspective Scale

Datos utilizados

  • Psychological responses from an 816-participant Chinese longitudinal diary study during COVID-19
  • Official From-Five-Dimensions-to-Many repository outputs at commit 16058c7f85c01a3dd42c3ee73fae0b2b4eebe03d
  • Released 26-by-26 true human correlation matrix
  • Experiment 1 LLM item-response outputs
  • Experiment 2 reasoning traces, extracted summaries, item mappings and summary-condition outputs

Evidencia y localización

  • Pregunta, muestra, procedimiento y métrica estructural: Accepted PDF pages 1-5, Abstract and Sections 1-3.3
  • Amplificación, robustez, fiabilidad, atenuación y ruido: Accepted PDF pages 5-7 and 23-28, Sections 3.2-3.4 and Appendix C.1/C.4
  • Trazas, atribución por ítem y factor: Accepted PDF pages 7-8 and 18-24, Sections 4.1, Appendix A.3 and C.2
  • Condiciones de resumen y resultados individuales: Accepted PDF pages 9 and 24-25, Section 4.2, Figure 5 and Table 2
  • Limitaciones, ética y reproducibilidad declaradas: Accepted PDF pages 10-11, Discussion, Ethics Statement and Reproducibility Statement
  • Prompts y modelos OpenRouter: Accepted PDF pages 16-19, Appendix A and Table 1
  • Reproducción independiente de k y R²: Official repository commit 16058c7 with released Experiment 1 outputs and True_correlation_matrix.csv, audited 15 July 2026
  • Missingness, cobertura de resúmenes y archivo ausente: Official repository commit 16058c7, 107 Experiment 1 CSVs, 90 summary-condition CSVs and 144 item-mapping CSVs audited 15 July 2026
  • Destrucción de linkage humano y ausencia de inputs/código: Official repository README, data tree and complete 449-file inventory at commit 16058c7
  • Riesgo de singularización por cuasi-identificadores: Official repository data/basic_info_BF.csv: 680/816 singleton rows on gender+province+age+job+education+date
  • Auditoría integral de estructura versus individuo, privacidad y artefacto: reports/verification/article-195-structural-vs-individual-and-artifact-audit.json
  • Inspección visual completa: All 29 accepted ICLR 2026 PDF pages rendered and visually inspected on 15 July 2026