PersonaLLM estudia si GPT-3.5-turbo-0613, GPT-4-0613 y, en apéndices, LLaMA 2 70B expresan cinco rasgos Big Five impuestos por prompt. Los autores construyen las 32 combinaciones binarias de extroversión/introversión, amabilidad/antagonismo, responsabilidad/falta de responsabilidad, neuroticismo/estabilidad emocional y apertura/cierre a la experiencia. Para cada combinación generan diez personas por modelo: cada una recibe los adjetivos explícitos en el system prompt, completa el BFI de 44 ítems y, conservando ese intercambio en el contexto, escribe una historia personal de unas 800 palabras sin nombrar los rasgos. Los BFI de GPT-3.5 y GPT-4 separan todos los polos con p<.001 y tamaños de efecto muy grandes; en GPT-4, d va de 4,22 a 6,30. Esto demuestra fuerte cumplimiento del prompt y del autoinforme esperado, no personalidad interna ni validez psicométrica en LLM. El análisis LIWC-22 correlaciona 81 categorías con las etiquetas binarias y compara los signos significativos con 2.467 ensayos humanos del corpus Essays. GPT-4 comparte más asociaciones con humanos que GPT-3.5 en responsabilidad y apertura, pero las tareas humanas y sintéticas no usan el mismo prompt y se ejecutan cientos de pruebas sin corrección por multiplicidad publicada. Para la evaluación humana se descartan historias que contienen lexemas explícitos de personalidad: el filtro elimina el 96,56 % de las historias GPT-3.5 y el 31,87 % de las GPT-4, por lo que solo se estudian 32 historias GPT-4 seleccionadas, una por perfil. Treinta y nueve trabajadores estadounidenses de Prolific, anglófonos y pagados a 15 dólares/hora, valoran historias en condiciones informada y no informada sobre la autoría de IA. Cada historia recibe cinco valoraciones por condición sobre seis cualidades y cinco rasgos. Al agregar por mayoría, el grupo no informado acierta extroversión en 0,84 y amabilidad en 0,69; las demás quedan entre 0,56 y 0,59. Informar de la autoría reduce esas cifras a 0,72, 0,53, 0,53, 0,41 y 0,53, respectivamente. Sin embargo, el acuerdo entre anotadores es casi nulo: los alfa de Krippendorff de personalidad van aproximadamente de -0,03 a 0,12, de modo que la mayoría estabiliza votos muy discordantes. GPT-4 como evaluador muestra además preferencia extrema por historias GPT-4, con puntuaciones casi perfectas y varianza mínima. El trabajo aporta evidencia valiosa de que prompts binarios extremos dejan señales lingüísticas reconocibles, sobre todo para extroversión, y de que revelar autoría cambia la atribución humana; no prueba que todas las personalidades sean perceptibles de forma robusta ni que las historias modelen personas humanas. El repositorio oficial conserva 320 BFI y 320 historias por modelo, textos y resultados LIWC, pero la auditoría de la rama v2.0 no encontró las anotaciones humanas prometidas ni un manifiesto de dependencias. También detectó discrepancias entre método y código: el paper dice paired t-tests, mientras el script elige ANOVA o Mann–Whitney; y el generador publicado recorre las combinaciones desde el índice 14, por lo que no reconstruye una ejecución completa sin modificación.
Pregunta de investigación
¿Hasta qué punto LLM condicionados con las 32 combinaciones binarias del Big Five producen autoinformes BFI y relatos coherentes con el perfil asignado; qué patrones LIWC aparecen frente a escritura humana; cómo valoran humanos y LLM esos relatos; y pueden inferir sus rasgos, con o sin conocer la autoría de IA?