Este preprint evalúa predicción automática binaria de los cinco rasgos Big Five desde texto mediante GPT-4 y cuatro modelos locales, Phi-3, Gemma 7B, Llama 3.1 8B y Mistral 7B, sobre Essays, MyPersonality y Pandora. Realiza 135 configuraciones: 75 con prompt simple para los cinco modelos y 60 con prompt enriquecido solo para los cuatro modelos abiertos. Cada modelo clasifica por separado cada rasgo con 0 o 1; temperatura 0 y 20 tokens máximos. El prompt enriquecido incorpora definiciones de Costa y McCrae, frases IPIP positivas y negativas y largas listas de adjetivos de Goldberg. Se reportan accuracy, macro-F1 y precision, recall y F1 por clase, además de salidas inválidas. El hallazgo más útil es diagnóstico, no de rendimiento. Solo 13 de 135 configuraciones, 9,6%, alcanzan F1 de al menos 0,5 en ambas clases. La mejor fila equilibrada es Mistral con Agreeableness en MyPersonality y prompt complejo: accuracy 0,608, F1 negativa 0,600, F1 positiva 0,620 y macro-F1 0,610, apenas 7,2 puntos de accuracy sobre la clase mayoritaria. GPT-4 con Agreeableness en Essays obtiene 0,593 de accuracy y macro-F1 0,585; Mistral con Openness en Essays, 0,584 y 0,575. Muchos resultados con accuracy aparentemente aceptable predicen casi siempre la clase positiva. Los prompts enriquecidos suelen eliminar fallos de formato y aumentar recall positivo, pero a menudo reducen recall negativo; no mejoran de forma uniforme accuracy o equilibrio. Extraversion y Neuroticism son las dimensiones más débiles en estas condiciones. La interpretación requiere cautela adicional. Las salidas inválidas se eliminan antes de calcular métricas, por lo que el rendimiento es condicional a que el modelo obedezca. Phi-3 pierde aproximadamente 80–85% de Essays con el prompt simple; sus métricas restantes describen una submuestra muy seleccionada. El corte F1 ≥ 0,5 se denomina repetidamente umbral de significación aunque no hay test, distribución nula, intervalo o corrección múltiple, y los propios autores admiten que 0,5 no equivale a azar bajo desbalance. GPT-4 usa un prompt distinto, solo se prueba en la condición simple y no se identifica su snapshot; afirmar que modelos abiertos con prompt complejo lo igualan mezcla modelo y prompt. Además, GPT-4 recibe la regla 1 para rasgo alto o moderado, mientras los otros reciben presencia o expresión del rasgo. Los Big Five son continuos, no propiedades presentes o ausentes, y las etiquetas de autor no garantizan que un texto concreto exprese el rasgo. Pandora añade otra transformación no validada: sus scores 1–100 se interpolan a 1–5 y se cortan con el mayor valor de MyPersonality aún etiquetado 0; no se publican los cinco umbrales. Sus 14.221 textos proceden de 1.608 usuarios, pero las métricas tratan textos como unidades sin incertidumbre agrupada por autor. Hay también inconsistencias internas. En GPT-4/Openness/Pandora, Tabla 2 reporta 679 inválidos, mientras la diagonal de Tabla 3 y los soportes 7.532+6.209 de Tabla 4 implican exactamente 480; una unión de inválidos no puede ser menor que los 679 de un rasgo. MyPersonality declara 255 textos, pero las clases de cada rasgo suman 250 sin explicar cinco etiquetas ausentes. Tabla 1 rotula mediana y SD, aunque el texto dice media y SD. No se localizaron código, predicciones, etiquetas procesadas o logs. Las tags Ollama son mutables y carecen de digest, fecha, cuantización y versión; GPT-4 carece de snapshot y fecha. Por tanto, la conclusión defendible es que, en estos prompts y datasets, la clasificación zero-shot suele ser débil o asimétrica y el enriquecimiento cambia cumplimiento y sesgo de clase. El trabajo aporta una buena advertencia sobre métricas por clase y abstenciones, pero no demuestra predicción fiable, significación estadística, paridad controlada con GPT-4 ni validez para perfilar personas.
Pregunta de investigación
¿Con qué fiabilidad cinco LLM clasifican presencia o ausencia binaria de rasgos Big Five a partir de textos de tres dominios, y cómo cambia su cumplimiento, equilibrio por clase y rendimiento al enriquecer el prompt con descriptores psicológicos?