Este trabajo desarrolla uno de los marcos empíricos más completos disponibles para evaluar personalidad sintética en salidas de LLM. En lugar de interpretar un cuestionario aislado como prueba de personalidad, administra dos inventarios Big Five, IPIP-NEO de 300 ítems y BFI de 44, a 18 variantes de PaLM, Llama 2, Mistral, Mixtral y GPT. Para cada modelo cruza 50 biografías ficticias de PersonaChat con cinco instrucciones de ítem y cinco postámbulos, creando 1.250 perfiles de prompt emparejados. Evalúa consistencia interna con alfa de Cronbach, lambda-6 de Guttman y omega de McDonald; convergencia entre ambos inventarios; discriminación entre rasgos; relaciones con once escalas criterio; y, de forma exploratoria, estructura factorial. El resultado central es condicional: varios modelos base fallan, mientras las variantes grandes e instruction-tuned, especialmente Flan-PaLM 540B y GPT-4o, muestran patrones mucho más fiables y convergentes. El estudio también induce nueve niveles de rasgo mediante 104 adjetivos y observa que once modelos previamente seleccionados por su fiabilidad siguen bien las instrucciones de rasgo. En cuatro modelos grandes, el nivel indicado también se refleja en textos sintéticos de redes sociales puntuados por Apply Magic Sauce. Es una contribución importante porque aplica estándares psicométricos más exigentes, explicita limitaciones y publica código y datos. Pero su alcance debe expresarse con precisión. Las 1.250 filas no son personas independientes: son el cruce determinista de solo 50 biografías reutilizadas con variantes fijas del prompt, aunque los p-valores usan n=1.250 sin corrección por clúster o factores cruzados. Toda medición ordena seguir una biografía, por lo que valida una distribución condicionada por el prompt, no una personalidad autónoma o persistente del modelo. El shaping nombra directamente rasgos Big Five y tanto el cuestionario como el clasificador textual premian lenguaje semánticamente alineado; además, encuesta y posts comparten la misma manipulación. Por eso las correlaciones prueban instrucción y transferencia léxica fuertes, pero no que un estado latente de personalidad cause conducta real. La estructura factorial solo es parcial, no hay test-retest, invariancia cultural, usuarios reales ni evaluación cuantitativa de seguridad. La auditoría del artefacto reprodujo 17 de las 18 filas de convergencia y discriminación publicadas. Llama-2-Chat 70B no coincide: el pickle actual produce aproximadamente 0,82/0,43/0,39, frente a 0,80/0,39/0,42 en la tabla. El repositorio permite comprobar análisis agregados, pero carece de entorno bloqueado, CI y una ejecución integral; el bucket ocupa unos 43,74 GiB en grandes pickles sin checksums. La conclusión defendible es que algunos LLM instruction-tuned producen respuestas Big Five coherentes y dirigibles bajo configuraciones de prompt concretas. No demuestra que posean personalidades humanas estables ni que los textos sintéticos sean comportamiento real.
Pregunta de investigación
¿Pueden medirse rasgos Big Five sintéticos en salidas de LLM con fiabilidad y validez psicométricas, qué propiedades del modelo favorecen esa medición y hasta qué punto pueden moldearse los rasgos expresados y trasladarse a otra tarea textual?