El trabajo pregunta si una población de agentes generativos condicionados por biografías puede producir una estructura léxica de personalidad comparable con HEXACO. GPT-4 crea 310 biografías y hace que cada agente valore 1.710 adjetivos en una escala de nueve puntos; las respuestas se ipsatizan y se someten a análisis de componentes principales con rotación promax. La población PopCensus reproduce la distribución de ocupaciones de Inglaterra y Gales de 2021, pero no representa su distribución de edad, género, etnia, educación o geografía. El scree plot sugiere cinco factores. Esa solución explica el 19,54 % de la varianza y la de seis factores el 19,71 %, mientras que los autores eligen diez factores, con un 22,51 %, porque obtiene el mayor alfa de Cronbach medio sin invertir los ítems cuyas cargas tienen signo opuesto. La auditoría del código y los datos abiertos reproduce los alfas publicados, pero muestra que esa implementación mezcla polaridades: al orientar los 30 ítems de cada factor según el signo de su carga, el alfa medio pasa de 0,219 a 0,973 en cinco factores, de 0,287 a 0,972 en seis y de 0,728 a 0,959 en diez. Por tanto, los alfas negativos publicados son en gran medida artefactos de codificación y el criterio usado para preferir diez factores no es robusto; los alfas corregidos tampoco prueban validez, porque los ítems se seleccionan y evalúan en la misma muestra. Los solapamientos léxicos exactos con HEXACO son muy pequeños, aunque una comparación semántica con FastText encuentra asociaciones mayores. Una segunda prueba hace responder el HEXACO-PI-R-100 a las mismas biografías: las correlaciones absolutas medias con los factores léxicos son 0,765 para GPT-4, 0,751 para Claude 3.7 Sonnet, 0,712 para Phi-4 y 0,217 para Llama 3.2. Esto indica que los modelos grandes reutilizan de manera consistente las señales de una persona sintética, pero no demuestra equivalencia con rasgos humanos, pues las dos mediciones parten de las mismas biografías y de estereotipos aprendidos. Una segunda población profesional no recupera Honesty-Humility, lo que evidencia sensibilidad a la redacción y composición de las personas. El artículo es prudente al interpretar los factores como asociaciones lingüísticas, no como personalidad interna. La publicación de respuestas, datos procesados y notebooks es una fortaleza importante, aunque faltan el pipeline que generó personas y respuestas, versiones exactas de dependencias y la instantánea precisa de GPT-4.
Pregunta de investigación
¿Puede una población sintética de agentes GPT-4 condicionados por biografías reproducir una estructura léxica de personalidad comparable con HEXACO, mantener consistencia interna y converger con respuestas a un inventario HEXACO entre distintos modelos?