El trabajo pregunta si GPT-3.5-Turbo y GPT-4-Turbo pueden recuperar un perfil HEXACO a partir de una persona textual. Cada persona combina una frase sociodemográfica, edad, género binario, estado civil, ingresos y número de hijos, con diez frases de personalidad: se eligen cinco de las seis dimensiones HEXACO, se asigna a cada una un polo alto o bajo y se omite deliberadamente la sexta. GPT-3.5 genera previamente dos frases para cada polo a partir de descripciones HEXACO y también reordena las once frases. Después el modelo evaluado responde los 60 ítems HEXACO en escala 1-5 con temperatura 0; la media de cada dimensión se dicotomiza como alta si es mayor que 2,5 y baja en caso contrario. Se prueban 1.000 personas con GPT-3.5 y una submuestra de 100 con GPT-4, lo que produce 5.000 y 500 comparaciones en dimensiones descritas, respectivamente. GPT-3.5 coincide con el polo asignado en 3.594 de 5.000 casos, 71,88 %, pero el agregado oculta diferencias extremas: 78,51 % en honestidad-humildad, 97,81 % en emocionalidad, 47,96 % en extraversión, 94,88 % en amabilidad, 60,87 % en responsabilidad y 51,92 % en apertura. De sus 1.406 errores, 1.393, 99,08 %, convierten un polo bajo en alto. GPT-4 alcanza 381 de 500, 76,20 %, con 92,68 %, 100 %, 79,22 %, 60,49 %, 55,06 % y 71,26 % por dimensión; 87 de sus 119 errores son bajo→alto y 32 alto→bajo, todos estos últimos en amabilidad. Cuando la dimensión no aparece en la persona, GPT-3.5 la clasifica alta en 986 de 1.000 casos, 98,6 %, y GPT-4 en 89 de 100. Esto documenta un fuerte valor por defecto del protocolo, no una reconstrucción fiable de información latente. El propio diseño favorece “alto”: el prompt obliga a responder aun con incertidumbre y el umbral >2,5 clasifica una respuesta neutral de 3 como alta. Además, la manipulación está contaminada antes del test: las descripciones supuestamente altas de emocionalidad, extraversión y amabilidad incluyen una segunda frase propia del polo bajo. La de extraversión alta, por ejemplo, combina disfrute social con incomodidad al ser el centro de atención y preferencia por ser reservado; la de amabilidad alta combina cooperación con rencor, crítica e ira. Por tanto, parte de la inconsistencia mide contradicciones generadas por GPT-3.5, no incapacidad para inferir un rasgo bien especificado. Las 77 pruebas ANOVA de la Tabla 2 informan solo p-valores, sin tamaños de efecto ni corrección por multiplicidad; aplican ANOVA univariante a resultados dicotómicos y el agregado concatena seis dimensiones sin explicar la dependencia. Edad y número de hijos son significativos en el agregado, pero las variables demográficas no fueron aleatorizadas de forma independiente: las reglas de construcción vinculan edad, matrimonio e hijos. No hay personas reales, validación humana de las personas, repetición, análisis psicométrico de HEXACO en LLM, código, datos ni instantáneas exactas de los modelos. La conclusión defendible es que modelos de 2024 siguen instrucciones conductuales explícitas de forma desigual y tienden a contestar el HEXACO hacia polos altos; no que reconstruyan una personalidad humana latente ni que las asociaciones demográficas sean psicológicamente válidas.
Pregunta de investigación
¿Con qué consistencia GPT-3.5-Turbo y GPT-4-Turbo reproducen polos HEXACO explícitos desde descripciones de persona, qué valor asignan a una dimensión omitida y qué variables sociodemográficas o de personalidad se asocian con las dimensiones reconstruidas?