El artículo publicado evalúa si cuatro LLM pueden inferir puntuaciones BFI-10 y rasgos Big Five a partir de entrevistas semiestructuradas. La revisión usa el artículo definitivo de 25 páginas, su suplemento oficial de 6 páginas y conserva la prepublicación arXiv v1 solo como antecedente. La versión de revista amplía el estudio original: añade GPT-5-Mini, incorpora a Xinyu Li y Julina Maharjan a la autoría, reorganiza los autores y publica resultados suplementarios con intervalos de confianza. No hay código ni datos de participantes disponibles.
El conjunto parte de 555 adultos de Estados Unidos reclutados en varios estudios sobre adaptación a acontecimientos adversos o de transición; 518 con BFI-10 completo y válido entran en los análisis. Las conversaciones no son diálogos cotidianos espontáneos: son entrevistas de investigación guionizadas sobre actividades diarias, una dificultad personal, regulación emocional y acontecimientos positivos y negativos recientes. El texto se pasa a minúsculas, se elimina puntuación y stopwords en inglés, y se truncan repeticiones o muletillas mediante un procedimiento no especificado. Ese preprocesamiento elimina precisamente parte de las señales de estilo, función gramatical, negación y dinámica conversacional que podrían ser pertinentes para personalidad, y no se compara con el texto sin procesar.
GPT-4.1-Mini, GPT-5-Mini, Meta-LLaMA-3.3-70B-Instruct-Turbo y DeepSeek-R1-Distill-70B predicen diez ítems BFI con prompt directo y cinco rasgos mediante prompt directo o chain-of-thought. El referente es el autoinforme BFI-10 de la misma sesión, no una observación objetiva de la personalidad. En los 518 casos analizados, la relación con el referente es débil: las correlaciones por ítem van de −0,18 a 0,27 y las de rasgo permanecen por debajo de 0,30. El mejor resultado de rasgo es Conscientiousness con GPT-4.1-Mini en zero-shot, r=0,25 (IC95% 0,167–0,329). Muchos intervalos incluyen cero, y algunos efectos significativos son negativos. Los errores MAE/RMSE suelen superar un punto en la escala 1–5 salvo varias condiciones de Openness. Los modelos desplazan las predicciones hacia valores moderados o altos y casi no concuerdan por categorías con el autoinforme: κ va aproximadamente de −0,07 a 0,11.
Las tasas “off-by-one” de 0,57 a 1,00 no contradicen ese fracaso. Con solo tres categorías ordenadas, una predicción Moderate está a como máximo una categoría tanto de Low como de High; la métrica solo penaliza el salto entre extremos. Meta-LLaMA con CoT logra 1,00 en tres rasgos al concentrar predicciones en el centro, mientras κ sigue cerca de cero. Por eso el resumen no interpreta off-by-one como precisión clínica o psicométrica. Tampoco hay comparación con un predictor de la media, humanos que lean las mismas entrevistas, modelos estadísticos sencillos o baselines demográficos; MAE bajo puede reflejar regresión al centro sin inferencia individual válida.
La repetibilidad se estudia únicamente con GPT-4.1-Mini, 50 participantes y tres ejecuciones, y además se aleatoriza el orden de segmentos: no justifica decir que los cuatro modelos tienen alta estabilidad ni equivale a validez. El tipo exacto de ICC de esta prueba no se declara en la versión publicada y el suplemento solo lista los coeficientes. La concordancia entre modelos excluye GPT-5-Mini y es baja por ítem (ICC 0,02–0,26); a nivel de rasgo es 0,54–0,76 en zero-shot y cae a 0,11–0,34 con CoT. El análisis de longitud usa los primeros 100, los primeros 1.000 y el texto completo, por lo que confunde longitud con posición y contenido de las preguntas; además, el método dice “palabras” y resultados dice “tokens”. El contexto medio maximiza las correlaciones observadas, mientras el contexto largo aumenta varios RMSE.
El trabajo documenta con utilidad una limitación real de los LLM actuales, pero no aísla su causa ni valida un sistema de evaluación de personalidad. El BFI-10 tiene solo dos ítems por rasgo; no se informa su fiabilidad en esta muestra, el algoritmo de agregación/reverse scoring, la corrección por comparaciones múltiples ni tests directos entre modelos o prompts. La limpieza, exclusiones, modelos/API, fechas, parsing de respuestas y prueba χ² de longitud no están suficientemente especificados para reproducir los resultados. Las explicaciones CoT se muestran como ejemplos pero no se evalúa su fidelidad, por lo que no son evidencia interpretable. La conclusión defendible es estrecha: bajo estas entrevistas, prompts, modelos y autoinforme breve, las predicciones son repetibles en una prueba limitada pero tienen poca alineación individual y mala concordancia categórica. No demuestra inferencia fiable de personalidad, superioridad sobre baselines, generalización a conversaciones cotidianas ni aptitud para decisiones sobre personas.