Este preprint v2 propone puntuar como Cinco Grandes el texto de cuatro corpus y las continuaciones de seis modelos: GPT-2, GPT-3, GPT-3.5-Turbo, LLaMA 7B cuantizado a 4 bits, Transformer-XL y XLNet. No pregunta a los modelos por una opción Likert. Usa las 50 frases del cuestionario como prompts, genera 30 continuaciones independientes por frase y modelo y pasa cada texto a un clasificador zero-shot basado en inferencia natural. Para cada rasgo, la llamada “Approach 3” compara dos etiquetas opuestas, por ejemplo, extraversion/introversion, y transforma la probabilidad de entailment a una escala 1–5. El paper no identifica el checkpoint NLI, no valida sus puntuaciones contra juicios humanos o un instrumento psicométrico y no prueba empíricamente que Approach 3 supere a las otras dos. Por tanto, los números describen las asociaciones léxicas de un clasificador auxiliar con textos condicionados por el cuestionario, no rasgos psicológicos internos. Los corpus se analizan por frases o párrafos cortos con submuestras: 10% de BookCorpus, 2% de una Wikipedia inglesa de mayo de 2020, 20% del WebText Test Set y 100% de WikiText-103. Estas sustituciones no son necesariamente los datos exactos de entrenamiento. En los modelos, la tabla principal informa medianas (con una dispersión no definida): GPT-3.5-Turbo es mayor en amabilidad, 4,41, y extraversión, 4,06; LLaMA en responsabilidad, 4,01, y estabilidad emocional, 3,76; Transformer-XL en apertura, 4,02. GPT-2 queda cerca de 3 en los cinco rasgos. Las comparaciones están confundidas por tamaño, entrenamiento, alineamiento, versión de API y decodificación. Además, la puntuación de GPT-2 cambia mucho según se clasifique toda la respuesta, solo la primera frase o la mediana de sus frases; las distancias Wasserstein llegan a 0,610 en apertura. Al comparar WebText Test con GPT-2, las distancias son pequeñas sin prompt, 0,025 a 0,102, y mucho mayores al incluir las frases Big Five, hasta 0,630 en extraversión. Esto demuestra principalmente que el prompt altera el contenido que ve el clasificador; no valida que el cuestionario revele una personalidad inherente ni que GPT-2 “herede” psicológicamente la personalidad del corpus. El trabajo también afina GPT-2 con respuestas SIOP etiquetadas. Method 1 conserva textos con score >4 y entrena 20 épocas; cambia muchas puntuaciones a la vez y no siempre eleva el rasgo objetivo. Method 2 convierte cada rasgo en clasificación binaria con cinco umbrales y entrena 10 épocas. Para extraversión, el baseline 3,07 pasa a 2,89, 3,19, 3,24, 2,90 y 3,25: baja en dos de cinco configuraciones, aunque el texto lo presenta como mejora. No hay seeds, réplicas de fine-tuning, tests estadísticos, intervalos de confianza, evaluación de calidad lingüística, conducta, persistencia ni jueces humanos. La recomendación de usar LLaMA en salud mental por su mediana de “estabilidad emocional” no está respaldada por ninguna evaluación clínica, de empatía o seguridad. La evidencia útil es más modesta: distintos modelos, prompts, segmentos de texto y fine-tunings producen distribuciones distintas bajo un clasificador NLI concreto pero no especificado.
Pregunta de investigación
¿Puede un clasificador zero-shot basado en NLI convertir texto de corpus y continuaciones provocadas por un cuestionario Big Five en perfiles comparables entre modelos, y pueden esos perfiles modificarse al afinar GPT-2 con datos etiquetados?