Investigating Large Language Models in Inferring Personality Traits from User Conversations

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Jianfeng Zhu, Ruoming Jin, Karin G. Coifman

Palabras clave: Large Language Models, Personality, Big Five, Persona, Personality Control

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
14
Hallazgos
38
Limitaciones
10
Evidencias

Resumen editorial

Español

Este preprint evalúa si GPT-4o y GPT-4o mini pueden inferir Big Five desde transcripciones de entrevistas semiestructuradas de 102 participantes. Cada persona respondió cinco preguntas sobre el día anterior, una experiencia difícil, afrontamiento, un evento desagradable y uno positivo; las respuestas se unieron a autoinformes BFI-10 y a información sobre síntomas depresivos. El estudio compara dos rutas zero-shot: pedir directamente cinco scores de rasgo entre 1 y 5, o pedir primero los diez ítems BFI-10 y calcular después los rasgos. La muestra está muy desequilibrada: 96 hombres y 6 mujeres, edades 24–56, media 36,63. Antes de enviarlo al modelo, el texto se pasa a minúsculas y se eliminan stopwords y puntuación. Los resultados directos son débiles. Las correlaciones de Pearson con el BFI-10 humano van de −0,090 a 0,185; GPT-4o obtiene 0,098 en extraversión, 0,184 en amabilidad, −0,058 en responsabilidad, 0,025 en neuroticismo y 0,142 en apertura. GPT-4o mini obtiene 0,151, −0,063, −0,019, −0,090 y 0,185. En los diez ítems BFI, ninguna correlación llega a 0,3: el rango conjunto es −0,216 a 0,259. GPT-4o presenta menor sesgo medio absoluto en cuatro ítems y mini en seis, pero esto no es error individual. El paper llama “accuracy” a la diferencia media firmada entre referencia y predicción. Como errores positivos y negativos pueden cancelarse, un promedio cercano a cero no implica predicciones cercanas persona a persona. No se reportan MAE, RMSE, correlación de concordancia, calibración, intervalos, tests ni dispersión de errores. Al reconstruir la Tabla 3, la ruta BFI-10 reduce el valor absoluto de ese sesgo en 7 de 10 combinaciones modelo-rasgo y lo empeora en 3: GPT-4o/extraversión pasa de |−0,514| a |0,598|; mini/responsabilidad de |0,157| a |0,475|; y mini/apertura de |0,162| a |−0,294|. La media no ponderada baja de 0,446 a 0,371, pero sigue siendo sesgo agregado, no MAE. Por ello, las afirmaciones de mejora “significativa” y mayor exactitud no están demostradas. La sección de síntomas divide entre ninguno y al menos uno. El método primero atribuye etiquetas a entrevistas SCID/SCID-5 y después dice que se empleó “una encuesta como PHQ-9”, sin identificar el instrumento exacto ni el criterio. No publica tamaños de grupo; los incrementos de las tablas implican 79 sin síntomas y 23 con síntomas, inferencia aritmética no declarada. Comparar el sesgo medio por grupo no prueba sensibilidad a un cambio depresivo: las distribuciones de referencia pueden diferir y no se contrastan los deltas predichos con los deltas observados, ni hay incertidumbre. “Alineación perfecta” de mini en BFI-4 significa únicamente sesgo medio 0, no igualdad individual. Además, para BFI-9 con síntomas la Tabla 5 muestra menor sesgo en GPT-4o, 1,000 frente a 1,087, pero el texto afirma que mini fue mejor. No se identifican snapshots de los modelos, fecha de ejecución, parámetros de API, seeds, número de repeticiones, parser, fórmula exacta de scoring BFI-10, código ni datos. La conclusión fiel es que, en esta muestra pequeña y sesgada, ambos modelos muestran correlaciones muy bajas con la referencia y sesgos sistemáticos. Imponer el formato BFI-10 modifica y a veces reduce el sesgo de grupo, pero no demuestra exactitud individual, fiabilidad, sensibilidad clínica ni capacidad para evaluar personalidad o depresión.

English

This preprint evaluates whether GPT-4o and GPT-4o mini can infer Big Five traits from semi-structured interview transcripts for 102 participants. Each person answered five prompts about the previous day, a challenging experience, coping, an unpleasant event, and a positive event; responses were paired with BFI-10 self-reports and depressive-symptom information. The study compares two zero-shot routes: directly request five trait scores from 1 to 5, or first request all ten BFI-10 item scores and then calculate traits. The sample is highly imbalanced: 96 men and 6 women, ages 24–56, mean 36.63. Text is lowercased and stripped of stopwords and punctuation before model input. Direct results are weak. Pearson correlations with human BFI-10 scores range from −0.090 to 0.185; GPT-4o obtains 0.098 for Extraversion, 0.184 for Agreeableness, −0.058 for Conscientiousness, 0.025 for Neuroticism, and 0.142 for Openness. GPT-4o mini obtains 0.151, −0.063, −0.019, −0.090, and 0.185. Across the ten BFI items no correlation reaches 0.3; the joint range is −0.216 to 0.259. GPT-4o has the smaller absolute mean bias on four items and mini on six, but this is not individual error. The paper calls the signed mean difference between reference and prediction “accuracy.” Positive and negative errors can cancel, so a near-zero mean does not imply participant-level predictions are close. The paper reports no MAE, RMSE, concordance correlation, calibration, intervals, tests, or error dispersion. Reconstructing Table 3, the BFI-10 route reduces absolute mean bias in 7 of 10 model-trait combinations and worsens it in 3: GPT-4o/Extraversion moves from |−0.514| to |0.598|; mini/Conscientiousness from |0.157| to |0.475|; and mini/Openness from |0.162| to |−0.294|. The unweighted mean falls from 0.446 to 0.371, but it remains aggregate bias rather than MAE. Claims of a significant improvement and greater accuracy are therefore not established. The symptom analysis splits participants between none and at least one symptom. The method first attributes labels to SCID/SCID-5 interviews and later says that “a survey like PHQ-9” was used, without identifying the exact instrument or rule. Group sizes are not stated; table increments imply 79 without symptoms and 23 with symptoms, an arithmetic inference rather than a reported fact. Comparing mean bias within each group does not demonstrate sensitivity to a depression-related shift: reference distributions may differ, predicted and observed group deltas are not directly compared, and no uncertainty is reported. Mini’s “perfect alignment” on BFI-4 means only zero mean bias, not participant-level equality. Moreover, for BFI-9 in the symptom-present group Table 5 favors GPT-4o, 1.000 versus 1.087 absolute bias, while the prose says mini is better. Exact model snapshots, execution date, API parameters, seeds, repeat count, parser, exact BFI-10 scoring formula, code, and data are not reported. The faithful conclusion is that both models have very low correlations with the reference and systematic bias in this small, skewed sample. Imposing BFI-10 structure changes and sometimes reduces group-level bias, but it does not establish individual accuracy, reliability, clinical sensitivity, or an ability to assess personality or depression.

Pregunta de investigación

¿Con qué fidelidad GPT-4o y GPT-4o mini asignan rasgos Big Five e ítems BFI-10 a partir de cinco respuestas de entrevista, si calcular rasgos desde ítems predichos mejora la comparación con el autoinforme y si el sesgo de las predicciones difiere entre grupos con y sin síntomas depresivos?

Método

Evaluación zero-shot de dos modelos sobre 102 transcripciones. Un prompt produce directamente cinco scores Big Five; otro produce diez scores BFI-10 que después se convierten a rasgos mediante una fórmula no publicada. Se comparan predicciones con BFI-10 humano mediante Pearson y diferencia media firmada. Se repite descriptivamente por grupos de cero frente a al menos un síntoma depresivo, sin tests, intervalos ni métricas de error individual.

Muestra: 102 participantes: 96 hombres y 6 mujeres; 24–56 años, media 36,63. Cada uno responde las mismas cinco preguntas y aporta BFI-10. El paper no informa tamaños de los grupos de síntomas; las fracciones de Tablas 4–5 son compatibles con 79 sin síntomas y 23 con al menos uno. No se describe reclutamiento, composición clínica, raza, educación, idioma, consentimiento o protocolo ético.

Hallazgos

  • La fuente vigente es arXiv:2501.07532v1, enviada el 13 de enero de 2025, con 13 páginas.
  • Las 13 páginas se renderizaron e inspeccionaron visualmente.
  • El PDF vigente coincide byte a byte con la caché y tiene SHA-256 897fa2ad6837ececb2191d4bc5beda628e9a6748fcc2096a5f2ad4be88a12fd8.
  • Las correlaciones directas modelo-BFI por rasgo abarcan −0,090 a 0,185; ninguna alcanza 0,2.
  • Las correlaciones por ítem BFI abarcan −0,216 a 0,259; ninguna alcanza 0,3.
  • GPT-4o tiene menor valor absoluto de diferencia media en 4 de 10 ítems y GPT-4o mini en 6 de 10.
  • La ruta BFI-10 reduce el valor absoluto del sesgo medio en 7 de 10 combinaciones modelo-rasgo y lo aumenta en 3.
  • El promedio no ponderado del sesgo medio absoluto pasa de 0,4464 en predicción directa a 0,3711 en la ruta BFI-10.
  • GPT-4o/extraversión empeora de 0,514 a 0,598 de sesgo absoluto con la ruta BFI-10.
  • GPT-4o mini/responsabilidad empeora de 0,157 a 0,475 y mini/apertura de 0,162 a 0,294.
  • La diferencia media de mini en BFI-4 para el grupo con síntomas es 0, pero esto solo indica cancelación neta o ausencia de sesgo medio.
  • Para BFI-9 con síntomas, Tabla 5 favorece GPT-4o con 1,000 frente a 1,087 de mini, en contra del texto.
  • Los denominadores de las tablas implican probablemente 79 participantes sin síntomas y 23 con síntomas, aunque el paper no los declara.
  • No se localizaron código, datos, predicciones, respuestas crudas, configuración reproducible o publicación revisada por pares.

Limitaciones

  • La diferencia media es firmada y permite cancelación de errores individuales.
  • El paper la describe incorrectamente como medida de precisión absoluta.
  • No se reportan MAE, error mediano absoluto, RMSE, distribución de residuales o porcentaje dentro de una tolerancia.
  • Un sesgo medio cero no significa alineación perfecta persona a persona.
  • Las correlaciones de Pearson son muy bajas y no se acompañan de intervalos o p-valores.
  • No se corrige multiplicidad pese a comparar cinco rasgos, diez ítems, dos modelos, dos rutas y dos grupos.
  • “Significativamente” se usa sin prueba de hipótesis ni estimación de incertidumbre.
  • La mejora BFI-10 no es uniforme: tres de diez combinaciones empeoran en sesgo absoluto.
  • La comparación agregada no ponderada trata rasgos y modelos como equivalentes y no usa error por participante.
  • No se publica la fórmula exacta usada para convertir los diez ítems predichos a cinco rasgos.
  • No se aclara el reverse scoring de los cinco ítems negativos ni el rango final del rasgo.
  • El prompt BFI pide primero explicación detallada y después prohíbe cualquier explicación, una instrucción contradictoria.
  • No se describe parser, tratamiento de salidas inválidas, decimales o valores fuera de rango.
  • No se identifica el snapshot exacto de GPT-4o o GPT-4o mini.
  • No se reportan fecha de ejecución, temperatura, top-p, seed, token limit, system prompt o versión del API.
  • No se repiten las consultas, por lo que se desconoce variabilidad estocástica.
  • La muestra de 102 es pequeña para diferencias por grupo y cinco correlaciones de rasgo.
  • La muestra tiene 94% de hombres y solo seis mujeres, lo que limita generalización.
  • No se reportan raza, etnia, educación, idioma, país, reclutamiento o contexto clínico completo.
  • Eliminar stopwords puede borrar negaciones y palabras funcionales relevantes para personalidad.
  • Eliminar puntuación borra pausas, énfasis y señales discursivas de las entrevistas.
  • Convertir a minúsculas y filtrar texto reduce la pretendida validez de conversación real.
  • No hay comparación con baselines simples como media del entrenamiento, regresión léxica o embeddings.
  • No hay partición de desarrollo porque el estudio es zero-shot, pero tampoco validación externa en otra muestra.
  • El BFI-10 tiene solo dos ítems por rasgo y es una referencia breve con error de medición no cuantificado aquí.
  • La inferencia desde entrevista y el autoinforme BFI-10 no son el mismo modo de medición.
  • El prompt directo entrega descriptores del constructo y puede inducir coincidencia léxica.
  • SCID/SCID-5 y una encuesta como PHQ-9 se mencionan como fuente de síntomas sin reconciliación.
  • El umbral de al menos un síntoma no equivale a diagnóstico de depresión, hecho reconocido parcialmente por el paper.
  • No se informan explícitamente tamaños ni distribución de severidad de los grupos.
  • La inferencia 79/23 procede de los denominadores decimales de las tablas y no sustituye el reporte metodológico.
  • Comparar sesgo por grupo no prueba que el modelo capture la diferencia entre grupos.
  • No se comparan directamente deltas predichos contra deltas BFI observados.
  • No se controlan edad, género u otros confundidores entre grupos.
  • La contradicción BFI-9 muestra que al menos una interpretación narrativa no sigue la tabla.
  • No se reportan consentimiento, IRB, manejo de privacidad o condiciones de reutilización de entrevistas sensibles.
  • No hay código, datos anonimizados, hashes de entradas o resultados por participante para reproducir el análisis.
  • El trabajo es un preprint v1 sin evidencia localizada de revisión por pares.

Qué no demuestra

  • No establece predicción exacta de Big Five a nivel individual.
  • No demuestra una mejora estadísticamente significativa con el paso BFI-10.
  • No demuestra que sesgo medio bajo implique error individual bajo.
  • No demuestra fiabilidad entre ejecuciones o versiones del modelo.
  • No demuestra sensibilidad a depresión o a cambios clínicos.
  • No demuestra diagnóstico de depresión ni de ningún trastorno.
  • No demuestra generalización a mujeres, otras edades, idiomas o poblaciones.
  • No demuestra que GPT-4o mini sea globalmente superior a GPT-4o.
  • No justifica evaluación psicológica automatizada, personalización persuasiva o intervención clínica.
  • No permite reproducir resultados sin configuración, código y datos.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2501.07532v1, submitted 13 January 2025, 13 pages

Fuente consultada: https://arxiv.org/abs/2501.07532

Revisión: Codex complete bilingual full-text fidelity pass, current arXiv-version and byte-level PDF check, all-page visual inspection, signed-bias reconstruction, table-versus-prose consistency audit, psychometric scoring audit, depressive-group denominator and validity audit, reproducibility and artifact-availability assessment; summaries written from the full paper and tables rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o through an unspecified OpenAI ChatGPT/API snapshot
  • GPT-4o mini through an unspecified OpenAI ChatGPT/API snapshot

Instrumentos y métricas

  • Big Five Inventory-10 self-report as personality reference
  • Direct five-trait 1–5 prompt with one-decimal scores
  • Ten-item BFI-10 scoring prompt
  • Pearson correlation
  • Signed mean difference mislabeled as absolute prediction accuracy
  • Depressive-symptom grouping attributed inconsistently to SCID/SCID-5 and a survey like PHQ-9

Datos utilizados

  • Previously collected recorded semi-structured interviews from 102 participants
  • Five interview responses per participant, approximately 15 minutes of speech in total
  • Participant BFI-10 scores
  • Depressive symptom information from an incompletely specified clinical or survey source
  • No public dataset, code repository, predictions, model responses or analysis scripts located

Evidencia y localización

  • Versión, autores, fecha, extensión y abstract: arXiv:2501.07532v1 metadata and title page checked 15 July 2026
  • Muestra, entrevista, BFI-10, síntomas y preprocesado: Materials and Methods, pages 2–3
  • Prompts directo y BFI-10: Methods, pages 3–5
  • Definición de métricas: Performance Evaluation Approach, pages 5–6
  • Correlaciones y sesgos directos: Table 1 and Figure 1, page 6
  • Resultados por ítem: Table 2 and Figure 2, page 7
  • Comparación directa frente a ruta BFI-10: Table 3 and Figure 3, pages 7–8; arithmetic reconstruction in reports/verification/article-183-bias-and-reporting-audit.json
  • Resultados por grupo y contradicción BFI-9: Tables 4–5 and Figures 4–5, pages 8–10
  • Inspección visual completa: All 13 pages of arXiv:2501.07532v1 rendered and visually inspected on 15 July 2026
  • Ausencia de artefactos: Paper, exact-title, arXiv-ID, GitHub, Hugging Face and Papers With Code checks on 15 July 2026