Este estudio exploratorio evalúa si ChatGPT 4.0 puede ayudar a crear y después mejorar un cuestionario breve de personalidad. Los autores proporcionaron definiciones de los seis dominios y 24 facetas HEXACO y reglas de redacción, generaron un ChatGPT HEXACO Inventory de 24 ítems y obtuvieron tres versiones: una base (CHI-B), otra instruida para aumentar consistencia interna (CHI-R) y otra para aumentar validez de contenido (CHI-V). Los ítems se generaron en inglés, se corrigieron mediante nuevas instrucciones cuando los autores detectaron dos problemas, se tradujeron al neerlandés con el propio ChatGPT y se volvieron a corregir ante ocho problemas de traducción. Por tanto, el proceso incluye supervisión humana sustantiva y no es generación autónoma de una escala validada.
Los 682 participantes completaron HEXACO-60 y el Brief HEXACO Inventory humano, y fueron asignados aleatoriamente a CHI-B (n=228), CHI-R (n=242) o CHI-V (n=212). En el grupo CHI-B, el alfa medio fue 0,51 frente a 0,53 en BHI, sin diferencia, y la correlación convergente media con HEXACO-60 fue 0,68 frente a 0,72, también sin diferencia. La excepción corregida por FDR fue Honesty-Humility: CHI-B correlacionó 0,50 con HEXACO-60 frente a 0,65 para BHI (z=2,90; p=0,026). Las correlaciones discriminantes medias y las asociaciones con autoritarismo y orientación a la dominancia social tampoco difirieron significativamente. Estos resultados hacen al CHI-B parecido al BHI en las pruebas usadas, pero no demuestran equivalencia ni superioridad.
Las instrucciones de mejora no produjeron el efecto buscado. Los alfa medios fueron 0,56 para CHI-R y 0,50 para CHI-V frente a 0,51 en CHI-B; ninguna diferencia media fue significativa. Las correlaciones convergentes medias fueron 0,66 y 0,63 frente a 0,68, y tampoco mejoraron las correlaciones discriminantes. CHI-V incluso redujo significativamente la consistencia de Emotionality y Conscientiousness frente a CHI-B; su alfa de Emotionality fue 0,22. Al comparar las versiones modificadas con BHI, solo 2 de 35 contrastes para CHI-R y 3 de 35 para CHI-V fueron significativos tras FDR; los tres de CHI-V se concentraron en Emotionality y fueron desfavorables o divergentes respecto a BHI.
La lectura correcta es limitada. Las escalas tienen solo cuatro ítems por dominio y varios alfa bajos; autoritarismo alcanza apenas 0,48. No hay análisis factorial, IRT, invariancia, test-retest, entrevistas cognitivas, evaluación experta formal de contenido ni estudio de equivalencia o no inferioridad. “Validez de contenido” se aproxima principalmente mediante convergencia, discriminación y dos criterios externos, no mediante un procedimiento integral de validez de contenido. Tampoco se publican datos ni código, no se identifica el snapshot exacto de ChatGPT 4.0 y una sola generación por versión no representa la variabilidad del sistema. Dos errores de clave negativa pasaron la supervisión final: Honesty-Humility en las tres versiones y Agreeableness en CHI-V quedaron sin ítems invertidos.
La aportación defendible es que un flujo ChatGPT más revisión humana produjo una escala breve con algunas propiedades próximas a BHI en esta muestra neerlandesa, mientras instrucciones generales de “mejorar” fiabilidad o contenido no ofrecieron un atajo psicométrico. El trabajo no estudia la personalidad de ChatGPT, sino su uso como herramienta de redacción de ítems para medir personalidad humana. El suplemento oficial con prompts e ítems fue localizado en Taylor & Francis, pero el editor devolvió 403 al intentar congelarlo fuera de la página y Chrome no estaba abierto; por transparencia, la auditoría no atribuye ningún detalle que dependa de ese DOCX. Las conclusiones aquí recogidas proceden del PDF editorial completo, sus tablas y notas.