Predicting the Big Five Personality Traits in Chinese Counselling Dialogues Using Large Language Models

Evaluación y validez psicométrica2024arXivRevisión editorial aprobada

Autores: Yang Yan, Lizhi Ma, Anqi Li, Jingsong Ma, Zhenzhong Lan

Palabras clave: Computation and Language, Artificial Intelligence, Computational Psychometrics, Personality Trait Prediction

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
8
Hallazgos
17
Limitaciones
21
Evidencias

Resumen editorial

Español

Yan y colaboradores preguntan si un LLM puede estimar Big Five a partir de diálogos chinos de orientación psicológica. Su procedimiento no predice directamente cinco números: inserta cada sesión en un rol de cliente, consejero u observador, administra al modelo los 60 ítems BFI-2, extrae por regex las opciones Likert y calcula OCEAN con el scoring del inventario. El criterio es el BFI-2 que cada cliente completó antes de su primera sesión. El corpus contiene 853 sesiones y 65.347 intervenciones de 82 adultos y nueve consejeros, aunque resumen e introducción dicen 83 clientes. Se asignan 611 sesiones a entrenamiento y 242 a validación; el artículo no indica que la separación sea por cliente, pese a que cada persona aporta en promedio unas diez sesiones y comparte la misma etiqueta de rasgo. En zero-shot, combinar rol de cliente y cuestionario mejora mucho frente a pedir una predicción directa: Qwen1.5-110B pasa de PCC medio 0,172 a 0,426 y DeepSeek-Chat de 0,080 a 0,395. El cuestionario sin rol ya explica la mayor parte de la mejora (0,319 y 0,284); el rol solo no ayuda. Entre 21 modelos, Qwen1.5-110B y Gemini-1.5-Pro alcanzan 0,425 de media, mientras varios modelos pequeños quedan cerca de cero. Los roles próximos al diálogo funcionan mejor: cliente supera a consejero, observador y sin rol en promedio, aunque no en cada rasgo. Con 30% del texto, las correlaciones ya son significativas para el modelo afinado (PCC medio 0,510), pero continúan creciendo hasta 0,631 al 90%; para Qwen, 30% obtiene 0,331 frente a 0,425 con todo el contexto. Por ello, 30% es un umbral de significación, no evidencia de equivalencia o suficiencia práctica. Para alinear Llama-3-8B, los autores eligen como preferidas las respuestas generadas con menor error y como rechazadas las de mayor error, y aplican DPO con una restricción SFT. Llama-3-8b-BFI alcanza PCC 0,692, 0,554, 0,569, 0,448 y 0,648 para O, C, E, A y N, media 0,582. El aumento relativo de 130,95% frente a su base (0,252) y 36,94% frente a Qwen (0,425) es aritméticamente correcto, aunque la mejora absoluta es 0,330 y 0,157. La matriz completa muestra correlaciones cruzadas grandes, por ejemplo, la O predicha correlaciona 0,522 con E real y -0,455 con A real, lo que limita la validez discriminante. El análisis de errores aporta ejemplos plausibles de extracción de estados y también de malinterpretación, estereotipado y rechazos de seguridad; llamarlo “validez de contenido” no sustituye una evaluación psicométrica por expertos. La fiabilidad también queda ambigua: se informa alfa por modelo, kappas por rasgo en una tabla y PCC de diez ejecuciones en otra, sin describir suficientemente unidades y cálculo. El consentimiento, remuneración, aprobación ética y uso offline están documentados. La evidencia respalda que convertir el problema en respuestas BFI y afinar con etiquetas de error produce correlaciones moderadas dentro de este corpus; no prueba una evaluación automática imparcial ni segura para uso clínico.

English

Yan and colleagues ask whether an LLM can estimate Big Five traits from Chinese counselling dialogues. Their procedure does not directly predict five numbers: it places each session into a client, counsellor, or observer role, administers all 60 BFI-2 items to the model, extracts Likert choices with a regex, and computes OCEAN using the inventory scoring rules. The criterion is the BFI-2 completed by each client before their first session. The corpus contains 853 sessions and 65,347 utterances from 82 adults and nine counsellors, although the abstract and introduction say 83 clients. The authors allocate 611 sessions to training and 242 to validation but do not say that the split is client-disjoint, even though each person contributes roughly ten sessions sharing one trait label. In zero-shot evaluation, combining the client role with the questionnaire greatly improves over direct prediction: Qwen1.5-110B rises from mean PCC 0.172 to 0.426 and DeepSeek-Chat from 0.080 to 0.395. The questionnaire without a role already accounts for most of the gain (0.319 and 0.284); role-play alone does not help. Across 21 models, Qwen1.5-110B and Gemini-1.5-Pro reach mean 0.425, while several smaller models are near zero. Roles closer to the dialogue perform better on average: client exceeds counsellor, observer, and no-role, though not for every trait. With 30% of the dialogue, correlations are already significant for the tuned model (mean PCC 0.510), but they continue to rise to 0.631 at 90%; Qwen obtains 0.331 at 30% versus 0.425 with the full context. Thus, 30% is a significance threshold, not evidence of equivalent or practically sufficient performance. To align Llama-3-8B, the authors choose generated responses with the lowest error as preferred and the highest-error responses as rejected, then apply DPO with an SFT constraint. Llama-3-8b-BFI reaches PCC 0.692, 0.554, 0.569, 0.448, and 0.648 for O, C, E, A, and N, averaging 0.582. The reported relative gains of 130.95% over its base (0.252) and 36.94% over Qwen (0.425) are arithmetically correct, while the absolute gains are 0.330 and 0.157. The full matrix contains large cross-trait correlations, for example, predicted O correlates 0.522 with actual E and -0.455 with actual A, limiting discriminant validity. Error analysis provides plausible examples of extracting states and also of misunderstanding, stereotyping, and safety refusal; calling this “content validity” does not replace expert psychometric assessment. Reliability is also ambiguous: the paper reports one alpha per model, trait-level kappas in one table, and PCC across ten runs in another without sufficiently defining units and calculations. Consent, compensation, ethics approval, and offline-only use are documented. The evidence supports that decomposing the task into BFI responses and tuning on error-labelled preferences yields moderate correlations within this corpus; it does not establish an unbiased or safe automated assessment for clinical use.

Pregunta de investigación

¿Pueden los LLM estimar OCEAN desde sesiones reales de orientación psicológica en chino, qué papel desempeñan el role-play, la descomposición mediante BFI, la cantidad de contexto y la capacidad del modelo, y cuánto mejora una alineación DPO más SFT?

Método

Cada sesión se transforma en historial de chat y el LLM adopta el papel de cliente, consejero, observador o ninguno. Contesta con opción y razón los 60 ítems BFI-2; una regex extrae la opción y el scoring produce cinco rasgos. Se comparan predicciones con el BFI-2 previo del cliente mediante PCC y MAE, se estudian roles, 10–100% de contexto, 21 modelos, alfa y repetición, y se afina Llama-3-8B mediante preferencias elegidas por error mínimo/máximo, DPO y una pérdida SFT.

Muestra: 853 sesiones de 82 adultos, 55 mujeres, 19–54 años, M=27,62, SD=5,94, y nueve consejeros, siete mujeres, 25–45 años, M=34,67, SD=7,45. El texto también afirma 83 clientes en otros pasajes. Cada cliente completó BFI-2 una vez antes de la primera sesión. Se usan 611 sesiones para entrenamiento y 242 para validación, sin indicar separación por persona. Los participantes consintieron, recibieron 300 RMB y el protocolo fue aprobado con referencia 20220519LZZ001.

Hallazgos

  • La combinación de cuestionario y rol de cliente eleva el PCC medio de Qwen1.5-110B de 0,172 a 0,426 y de DeepSeek-Chat de 0,080 a 0,395; el rol solo aporta poco o empeora.
  • Llama-3-8b-BFI obtiene PCC medio 0,582 frente a 0,252 del modelo base y 0,425 de Qwen1.5-110B.
  • El rol cliente suele ser mejor que consejero, observador y sin rol, aunque las diferencias no son uniformes por dimensión.
  • A 30% de contexto el modelo afinado alcanza 0,510, pero la mejora continúa hasta 0,631 a 90%; el contexto parcial no es equivalente al completo.
  • Los modelos más capaces suelen rendir mejor, pero el patrón por tamaño no es uniforme y solo algunos miembros grandes de Qwen muestran significación.
  • La matriz del modelo afinado conserva correlaciones diagonales moderadas-altas y correlaciones cruzadas sustanciales, señal de separación imperfecta de rasgos.
  • DPO con restricción SFT mejora la media de 0,563 a 0,582 frente a DPO sin SFT; la ganancia es 0,019.
  • La anonimización reduce el promedio en varias condiciones, aunque algunas dimensiones suben, por lo que no produce una caída uniforme del 6%.

Limitaciones

  • La unidad de muestreo es la sesión, pero el criterio BFI es único por cliente; tratar hasta unas diez sesiones por persona como observaciones independientes puede inflar significación y precisión.
  • No se afirma que entrenamiento y validación estén separados por cliente. Si una persona aparece en ambos, existe fuga de identidad, estilo y etiqueta, especialmente relevante para el modelo afinado.
  • Los recuentos de clientes son inconsistentes: 83 en resumen/introducción y 82 en métodos; tampoco cuadran perfectamente algunos promedios de sesiones de la Tabla 5.
  • Solo el conjunto de validación de 242 sesiones se describe como anonimizado; esto introduce cambio de distribución y deja ambiguo el tratamiento de datos identificables usados para entrenar y liberar el modelo.
  • Las correlaciones se presentan con asteriscos sin modelo multinivel, intervalos ni corrección por los numerosos tests; la dependencia intracliente viola el supuesto de observaciones independientes.
  • Una correlación con un autoinforme único no demuestra exactitud clínica ni ausencia de sesgo; el BFI-2 es un criterio con error de medida, contexto y deseabilidad propios.
  • Administrar el mismo BFI-2 al LLM convierte la tarea en imitación de respuestas de cuestionario y puede explotar estereotipos o asociaciones de ítems, no inferencia psicológica general.
  • El análisis cualitativo de aciertos y errores se etiqueta como validez de contenido sin jueces expertos, rúbrica, muestreo sistemático ni acuerdo entre evaluadores.
  • La fiabilidad no está suficientemente definida: alfa parece agregado por modelo, la Tabla 4 informa kappa y la Tabla 6 informa PCC de diez ejecuciones, sin reconciliar las medidas ni dar estabilidad individual.
  • La afirmación de que 30% del contexto es suficiente confunde significación con equivalencia; los resultados mejoran materialmente al usar 80–100% y no hay margen de no inferioridad.
  • El umbral MAE<1 se denomina significativo sin justificación estadística y los boxplots no sustituyen una tabla de errores por rasgo, persona y sesión.
  • Las matrices muestran correlaciones off-diagonal fuertes y negativas que cuestionan validez discriminante, pero el artículo enfatiza solo la diagonal.
  • Las ganancias de 130,95% y 36,94% son porcentajes relativos sobre medias PCC; su formulación magnifica cambios absolutos de 0,330 y 0,157.
  • Los pares DPO se eligen usando error contra la etiqueta, pero no se describe cuántos hay, su distribución, posibles duplicados por cliente o evaluación independiente del razonamiento generado.
  • El corpus procede de una sola plataforma, idioma y región, con adultos relativamente jóvenes; no hay validación externa, longitudinal, intercultural o en decisiones clínicas reales.
  • Comparar 21 APIs y checkpoints sin fechas, parámetros de muestreo, número de reintentos, manejo completo de fallos y coste limita la reproducibilidad del ranking.
  • Aunque el código y el modelo se enlazan, los diálogos sensibles no se publican, por lo que terceros no pueden auditar plenamente splits, etiquetas, fuga, anonimización o resultados.

Qué no demuestra

  • No demuestra que los LLM midan la personalidad verdadera de una persona ni que superen una evaluación psicométrica profesional.
  • No demuestra que el sistema sea imparcial; la conclusión de método 'unbiased' no se apoya en análisis por género, edad, cliente, consejero o subgrupo.
  • No demuestra generalización a nuevos clientes si los splits no son explícitamente disjuntos por persona.
  • No demuestra que 30% de una sesión conserve rendimiento equivalente al texto completo.
  • No demuestra validez discriminante completa, pues existen correlaciones fuertes con rasgos no objetivo.
  • No valida despliegue clínico, diagnóstico, selección de tratamiento, vigilancia de pacientes ni sustitución del consentimiento o juicio profesional.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2406.17287v1 (25 June 2024)

Fuente consultada: https://arxiv.org/pdf/2406.17287

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • Llama-3-8b-BFI
  • Meta-Llama-3-8B-Instruct
  • Meta-Llama-3-70B-Instruct
  • Qwen1.5-110B-Chat
  • Qwen-72B-Chat
  • Qwen1.5-7B-Chat
  • Qwen2-7B-Instruct
  • GPT-4-turbo
  • DeepSeek-Chat
  • deepseek-llm-67b-chat
  • Gemini 1.5 Pro and Flash
  • Gemini 1.0 Ultra and Pro
  • Qwen Long and Turbo
  • ERNIE Speed and Lite
  • Yi-34B-Chat
  • AquilaChat2-34B
  • InternLM2-Chat-20B
  • Baichuan2-13B-Chat
  • GLM-4-9B-Chat
  • Gemma-1.1-7B-it
  • ChatGLM3-6B-128K

Instrumentos y métricas

  • Chinese Big Five Inventory-2, 60 items
  • Pearson correlation coefficient
  • Mean absolute error
  • Cronbach alpha
  • Kappa reported for test-retest reliability
  • Ten-run PCC stability analysis
  • Interquartile-range outlier rule
  • Direct Preference Optimization with supervised fine-tuning constraint

Datos utilizados

  • 853 Chinese counselling sessions from the authors' platform
  • 65,347 counsellor and client utterances
  • Pre-session BFI-2 profiles from 82 reported adult clients
  • 611-session training split
  • 242-session manually anonymized validation split
  • Model-generated BFI rationales selected by minimum and maximum prediction error

Evidencia y localización

  • Pregunta, marco, recuento de sesiones y afirmaciones principales: arXiv v1, pp. 1–2, Abstract and Introduction
  • Ablation de role-play y cuestionario: arXiv v1, p. 3, Table 1
  • Prompt, roles, 60 ítems y extracción regex: arXiv v1, pp. 3–5, sections 3.1–3.2
  • PCC, MAE y definición no convencional de validez de contenido: arXiv v1, p. 5, section 3.3
  • 82 clientes, nueve consejeros y split por sesiones: arXiv v1, p. 5, section 4.1
  • Resultados por rol: arXiv v1, pp. 4 and 6, Table 2 and section 4.2
  • Comparación de 21 modelos: arXiv v1, pp. 5–6, Table 3 and section 4.2
  • Umbral narrativo de 30% de contexto: arXiv v1, p. 6, Figure 2 and section 4.2
  • Errores, rechazos y discrepancias con autoinforme: arXiv v1, pp. 6–8, section 4.3 and Figure 4
  • Construcción de preferencias, DPO y SFT: arXiv v1, p. 8, section 4.4 and Figure 5
  • Ganancias relativas y eficiencia declarada: arXiv v1, p. 8, Model Proximity subsection
  • Consentimiento, remuneración, ética y uso offline: arXiv v1, p. 9, Ethical Considerations
  • Limitaciones reconocidas, privacidad y ausencia de benchmark: arXiv v1, p. 9, Limitations
  • BFI-2 completo y scoring: arXiv v1, p. 14, Appendix A.1.1
  • Fiabilidad alfa, kappa y diez ejecuciones: arXiv v1, pp. 15–16, Table 4, Appendix A.4 and Table 6
  • Estadísticas del diálogo y anonimización de 242 sesiones: arXiv v1, pp. 15–16, Appendix A.2 and Table 5
  • Resultados completos por 10–100% de contexto: arXiv v1, p. 17, Table 8
  • Efecto DPO+SFT y roles con nombres: arXiv v1, p. 18, Tables 9–10
  • Splits invertidos y ablation de modelos afinados: arXiv v1, p. 19, Table 11
  • Correlaciones diagonales y cruzadas: arXiv v1, pp. 19–20, Figures 6–11
  • Hiperparámetros de entrenamiento: arXiv v1, p. 21, Table 12