Este estudio evalúa si GPT-3.5 Turbo, GPT-4o, Claude 3 Haiku y Mixtral 8x22B obedecen instrucciones de personalidad Big Five en dos tareas: responder los ítems del BFI-44 como si tuvieran un rasgo alto o bajo y redactar respuestas breves condicionadas por un rasgo y una puntuación de 1 a 5. La evaluación de texto combina 288 muestras revisadas por ocho anotadores, un clasificador GPT-4o calibrado contra esas etiquetas y análisis léxico con TF-IDF y spaCy. Los resultados respaldan una conclusión limitada: los modelos suelen obedecer mejor los extremos que el nivel medio, Openness es el rasgo más reconocible y Neuroticism el más difícil; además aparecen sesgos hacia alta Agreeableness y baja Neuroticism. El clasificador alcanza F1 ponderado de 0,87 a 0,63 al detectar presencia de rasgo y de 0,78 a 0,50 al clasificar nivel, con MAE de 0,44 a 1,77. Esto muestra control lingüístico parcial y desigual, no personalidad psicológica. La afirmación de que alfas superiores a 0,85 hacen respuestas reales y plausibles confunde consistencia interna con validez. El protocolo filtra los casos no distinguibles de sus matrices de confusión, edita manualmente respuestas de Claude y usa las mismas definiciones de rasgo para generar y clasificar. El repositorio abierto aporta parte del código, pero no contiene el dataset, las anotaciones ni los resultados prometidos, y su configuración no reproduce las cuatro temperaturas del artículo. El trabajo fue aceptado bajo el apartado archival de CustomNLP4U 2024, pero no tiene ficha individual ni DOI en los proceedings de ACL; la fuente citable comprobable es arXiv v1.
Pregunta de investigación
¿Hasta qué punto cuatro LLM comerciales pueden obedecer instrucciones de rasgos Big Five de nivel alto, medio o bajo de forma consistente tanto en un cuestionario como en texto libre, y qué evaluación humana, automática y léxica permite medirlo?