Yan y colaboradores preguntan si un LLM puede estimar Big Five a partir de diálogos chinos de orientación psicológica. Su procedimiento no predice directamente cinco números: inserta cada sesión en un rol de cliente, consejero u observador, administra al modelo los 60 ítems BFI-2, extrae por regex las opciones Likert y calcula OCEAN con el scoring del inventario. El criterio es el BFI-2 que cada cliente completó antes de su primera sesión. El corpus contiene 853 sesiones y 65.347 intervenciones de 82 adultos y nueve consejeros, aunque resumen e introducción dicen 83 clientes. Se asignan 611 sesiones a entrenamiento y 242 a validación; el artículo no indica que la separación sea por cliente, pese a que cada persona aporta en promedio unas diez sesiones y comparte la misma etiqueta de rasgo. En zero-shot, combinar rol de cliente y cuestionario mejora mucho frente a pedir una predicción directa: Qwen1.5-110B pasa de PCC medio 0,172 a 0,426 y DeepSeek-Chat de 0,080 a 0,395. El cuestionario sin rol ya explica la mayor parte de la mejora (0,319 y 0,284); el rol solo no ayuda. Entre 21 modelos, Qwen1.5-110B y Gemini-1.5-Pro alcanzan 0,425 de media, mientras varios modelos pequeños quedan cerca de cero. Los roles próximos al diálogo funcionan mejor: cliente supera a consejero, observador y sin rol en promedio, aunque no en cada rasgo. Con 30% del texto, las correlaciones ya son significativas para el modelo afinado (PCC medio 0,510), pero continúan creciendo hasta 0,631 al 90%; para Qwen, 30% obtiene 0,331 frente a 0,425 con todo el contexto. Por ello, 30% es un umbral de significación, no evidencia de equivalencia o suficiencia práctica. Para alinear Llama-3-8B, los autores eligen como preferidas las respuestas generadas con menor error y como rechazadas las de mayor error, y aplican DPO con una restricción SFT. Llama-3-8b-BFI alcanza PCC 0,692, 0,554, 0,569, 0,448 y 0,648 para O, C, E, A y N, media 0,582. El aumento relativo de 130,95% frente a su base (0,252) y 36,94% frente a Qwen (0,425) es aritméticamente correcto, aunque la mejora absoluta es 0,330 y 0,157. La matriz completa muestra correlaciones cruzadas grandes, por ejemplo, la O predicha correlaciona 0,522 con E real y -0,455 con A real, lo que limita la validez discriminante. El análisis de errores aporta ejemplos plausibles de extracción de estados y también de malinterpretación, estereotipado y rechazos de seguridad; llamarlo “validez de contenido” no sustituye una evaluación psicométrica por expertos. La fiabilidad también queda ambigua: se informa alfa por modelo, kappas por rasgo en una tabla y PCC de diez ejecuciones en otra, sin describir suficientemente unidades y cálculo. El consentimiento, remuneración, aprobación ética y uso offline están documentados. La evidencia respalda que convertir el problema en respuestas BFI y afinar con etiquetas de error produce correlaciones moderadas dentro de este corpus; no prueba una evaluación automática imparcial ni segura para uso clínico.
Pregunta de investigación
¿Pueden los LLM estimar OCEAN desde sesiones reales de orientación psicológica en chino, qué papel desempeñan el role-play, la descomposición mediante BFI, la cantidad de contexto y la capacidad del modelo, y cuánto mejora una alineación DPO más SFT?