Este preprint evalúa si varios métodos basados en modelos de lenguaje pueden predecir las puntuaciones continuas del Big Five a partir de entrevistas semiestructuradas. El manuscrito declara 518 adultos, unos 15 minutos de habla por participante y autoinforme BFI-10 como objetivo. La cifra de muestra no cuadra con sus propios datos demográficos: 275 hombres + 278 mujeres y 431 personas blancas + 122 no blancas/otras suman 553 en ambos casos. Tampoco informa medias, desviaciones, rango, fiabilidad de las escalas de dos ítems, datos faltantes ni cómo pasa de 553 a 518 si ambas cifras fueran correctas. El BFI-10 es una medida humana validada, pero una puntuación breve autoinformada no es «ground truth» observable de la personalidad y el paper no demuestra que el contenido de una entrevista de quince minutos contenga información suficiente para recuperar cada rasgo. Se comparan cuatro configuraciones. GPT-4.1 Mini recibe la transcripción completa y devuelve simultáneamente cinco valores entre 1 y 5, en pasos de 0,5, mediante zero-shot o un prompt que pide resumir tono, identificar indicios y justificar la puntuación. El texto llama determinista a temperatura 0,2, aunque 0,2 permite muestreo y no se reportan repeticiones. La segunda familia adapta Llama-3.1-8B-Instruct por separado para cada rasgo mediante LoRA de rango 8, 16 o 32. Para RoBERTa-base se trocean las transcripciones con solapamiento, se promedian representaciones y se entrena una cabeza de regresión; sin embargo, método, Tabla 4 y Figura 3 alternan los nombres RoBERTa, BERT, «embedding+LoRA» y «LoRA-based» sin especificar con precisión qué parámetros se adaptan. Finalmente, embeddings all-MiniLM-L6-v2 y text-embedding-3-small alimentan una regresión Ridge multi-output con split 80/20. Para estos dos se dice que se incrusta la transcripción completa, sin aclarar truncamiento o agregación pese al límite de contexto de MiniLM. No se publican particiones para LoRA/RoBERTa, semillas, estratificación, conjunto de validación, selección de hiperparámetros, regularización, epochs, batch size, intervalos o pruebas entre modelos. El hallazgo más sólido es negativo: ninguna correlación de Pearson supera 0,255. En GPT-4.1 Mini zero-shot, responsabilidad alcanza r=0,250 y amabilidad 0,132; neuroticismo, apertura y extraversión quedan en 0,065, 0,020 y 0,041. CoT no mejora el conjunto: 0,236, 0,133, −0,009, 0,051 y 0,005, respectivamente. En la tabla de la variante encoder/«BERT», los mejores valores por rasgo son 0,197 en extraversión, 0,173 en amabilidad, 0,219 en responsabilidad, 0,236 en neuroticismo y 0,255 en apertura. Llama-LoRA llega como máximo a 0,164 en responsabilidad y arroja varias correlaciones negativas. La regresión con embeddings estáticos tampoco supera 0,119: MiniLM va de −0,069 a 0,112 y OpenAI de −0,050 a 0,119. Las MAE cuentan una historia distinta porque algunos modelos predicen cerca del centro de la escala. GPT-4 tiene MAE inferior a 0,6 solo en apertura y superior a 1,2 en responsabilidad y amabilidad. OpenAI embeddings logra 0,776 en apertura y 0,916 en amabilidad, pero 1,080 en responsabilidad y más de 1,2 en extraversión y neuroticismo. En la Figura 3, valores bajos como 0,431 en apertura coexisten con r nulo o negativo; eso es compatible con regresión a la media y no con ordenación válida de personas. El propio texto atribuye 0,431 en rango 8 y 0,493 en rango 16 tanto al grupo Llama como al grupo embedding+LoRA de formas incompatibles con las curvas, de modo que esas cifras no permiten una comparación fiable de arquitectura. El artículo tampoco incluye un baseline de predecir la media, necesario para juzgar si una MAE central aporta valor, ni incertidumbre para las correlaciones de un test de aproximadamente cien casos. Su interpretación de diferencias entre rasgos, por ejemplo atribuir responsabilidad a RLHF, apertura a imaginación o extraversión a falta de interacción, es especulativa y no se contrasta. En conjunto, el trabajo ofrece una comparación útil y prudente en su conclusión principal: estos métodos no recuperan bien las puntuaciones BFI-10 desde las entrevistas. No demuestra, sin embargo, que el fallo sea una carencia general de «comprensión psicológica» o alineamiento del LLM en lugar de baja señal del texto, ruido del BFI-10, muestra pequeña, protocolo incompleto o mala calibración.
Pregunta de investigación
¿Hasta qué punto GPT-4.1 Mini, modelos adaptados con LoRA y regresores sobre embeddings pueden recuperar puntuaciones continuas BFI-10 desde entrevistas semiestructuradas reales?