El trabajo estudia si las probabilidades de siguiente token de un LLM, al completar con adjetivos una descripción de una historia personal, contienen ejes que se correspondan con los Big Five sin administrar un cuestionario. Construye una matriz de 208 historias por 100 adjetivos descriptivos de rasgos, centra las log-probabilidades y aplica SVD; después usa el signo de cinco componentes para clasificación binaria y, en una variante supervisada, ajusta una regresión Lasso. Las historias proceden de PersonaLLM: GPT-4-0613 generó diez relatos para cada una de las 32 combinaciones binarias Big Five y, tras filtrar relatos con léxico explícito de rasgo, quedaron 208. Los cinco primeros componentes explican el 74,3 % de la varianza. El mejor SVD obtiene 0,793 de exactitud media, por debajo del DeBERTaV3 ajustado (0,867); el mejor Lasso llega a 0,912, una mejora absoluta de 4,5 puntos sobre DeBERTaV3 y de 21,4 sobre el 0,698 publicado para el prompting GPT-4 de PersonaLLM. La conclusión defendible es que las log-probabilidades de una lista cerrada de adjetivos pueden servir como representación predictiva en este benchmark sintético. No es un redescubrimiento independiente de personalidad: el Big Five está inyectado tanto en las instrucciones que generaron los relatos como en los 100 adjetivos de Goldberg, ya clasificados por dimensión y polo. Además, los componentes se nombran inspeccionando esas etiquetas y se emparejan con rasgos mediante etiquetas del conjunto de entrenamiento; el signo de una SVD es matemáticamente arbitrario. No hay validación con personas, corpus externos, intervalos de confianza, pruebas de significación, semillas, análisis de estabilidad ni código o resultados abiertos. Dos filas completas de SVD y Lasso para Mixtral coinciden exactamente con Llama-3.1-70B-Instruct sin explicación. El estudio aporta una sonda léxica prometedora y una demostración controlada, pero no demuestra personalidad psicológica del modelo, estructura latente interna ni validez psicométrica en poblaciones reales.
Pregunta de investigación
¿Las correlaciones entre las log-probabilidades que distintos LLM asignan a 100 adjetivos descriptivos al evaluar historias personales producen cinco componentes principales alineables con los Big Five y permiten predecir las etiquetas binarias de personalidad mejor que el prompting directo o un clasificador de texto ajustado?