Developing and Improving Personality Inventories Using Generative Artificial Intelligence: The Psychometric Properties of a Short HEXACO Scale Developed Using ChatGPT 4.0

Evaluación y validez psicométrica2025Taylor & FrancisRevisión editorial aprobada

Autores: Ard J. Barends, Reinout E. de Vries

Palabras clave: Artificial Intelligence, Generative AI, HEXACO personality inventory, ChatGPT 4.0, Psychometrics, Survey development, Content validity

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
26
Hallazgos
73
Limitaciones
15
Evidencias

Resumen editorial

Español

Este estudio exploratorio evalúa si ChatGPT 4.0 puede ayudar a crear y después mejorar un cuestionario breve de personalidad. Los autores proporcionaron definiciones de los seis dominios y 24 facetas HEXACO y reglas de redacción, generaron un ChatGPT HEXACO Inventory de 24 ítems y obtuvieron tres versiones: una base (CHI-B), otra instruida para aumentar consistencia interna (CHI-R) y otra para aumentar validez de contenido (CHI-V). Los ítems se generaron en inglés, se corrigieron mediante nuevas instrucciones cuando los autores detectaron dos problemas, se tradujeron al neerlandés con el propio ChatGPT y se volvieron a corregir ante ocho problemas de traducción. Por tanto, el proceso incluye supervisión humana sustantiva y no es generación autónoma de una escala validada.

Los 682 participantes completaron HEXACO-60 y el Brief HEXACO Inventory humano, y fueron asignados aleatoriamente a CHI-B (n=228), CHI-R (n=242) o CHI-V (n=212). En el grupo CHI-B, el alfa medio fue 0,51 frente a 0,53 en BHI, sin diferencia, y la correlación convergente media con HEXACO-60 fue 0,68 frente a 0,72, también sin diferencia. La excepción corregida por FDR fue Honesty-Humility: CHI-B correlacionó 0,50 con HEXACO-60 frente a 0,65 para BHI (z=2,90; p=0,026). Las correlaciones discriminantes medias y las asociaciones con autoritarismo y orientación a la dominancia social tampoco difirieron significativamente. Estos resultados hacen al CHI-B parecido al BHI en las pruebas usadas, pero no demuestran equivalencia ni superioridad.

Las instrucciones de mejora no produjeron el efecto buscado. Los alfa medios fueron 0,56 para CHI-R y 0,50 para CHI-V frente a 0,51 en CHI-B; ninguna diferencia media fue significativa. Las correlaciones convergentes medias fueron 0,66 y 0,63 frente a 0,68, y tampoco mejoraron las correlaciones discriminantes. CHI-V incluso redujo significativamente la consistencia de Emotionality y Conscientiousness frente a CHI-B; su alfa de Emotionality fue 0,22. Al comparar las versiones modificadas con BHI, solo 2 de 35 contrastes para CHI-R y 3 de 35 para CHI-V fueron significativos tras FDR; los tres de CHI-V se concentraron en Emotionality y fueron desfavorables o divergentes respecto a BHI.

La lectura correcta es limitada. Las escalas tienen solo cuatro ítems por dominio y varios alfa bajos; autoritarismo alcanza apenas 0,48. No hay análisis factorial, IRT, invariancia, test-retest, entrevistas cognitivas, evaluación experta formal de contenido ni estudio de equivalencia o no inferioridad. “Validez de contenido” se aproxima principalmente mediante convergencia, discriminación y dos criterios externos, no mediante un procedimiento integral de validez de contenido. Tampoco se publican datos ni código, no se identifica el snapshot exacto de ChatGPT 4.0 y una sola generación por versión no representa la variabilidad del sistema. Dos errores de clave negativa pasaron la supervisión final: Honesty-Humility en las tres versiones y Agreeableness en CHI-V quedaron sin ítems invertidos.

La aportación defendible es que un flujo ChatGPT más revisión humana produjo una escala breve con algunas propiedades próximas a BHI en esta muestra neerlandesa, mientras instrucciones generales de “mejorar” fiabilidad o contenido no ofrecieron un atajo psicométrico. El trabajo no estudia la personalidad de ChatGPT, sino su uso como herramienta de redacción de ítems para medir personalidad humana. El suplemento oficial con prompts e ítems fue localizado en Taylor & Francis, pero el editor devolvió 403 al intentar congelarlo fuera de la página y Chrome no estaba abierto; por transparencia, la auditoría no atribuye ningún detalle que dependa de ese DOCX. Las conclusiones aquí recogidas proceden del PDF editorial completo, sus tablas y notas.

English

This exploratory study evaluates whether ChatGPT 4.0 can help create and then improve a brief personality questionnaire. The authors supplied definitions of the six HEXACO domains and 24 facets plus item-writing rules, generated a 24-item ChatGPT HEXACO Inventory, and produced three versions: a baseline (CHI-B), one instructed to increase internal consistency (CHI-R), and one instructed to increase content validity (CHI-V). Items were generated in English, corrected through new instructions when the authors detected two problems, translated into Dutch by ChatGPT, and corrected again after eight translation problems. The workflow therefore includes substantive human oversight and is not autonomous generation of a validated scale.

All 682 participants completed the HEXACO-60 and the human-developed Brief HEXACO Inventory and were randomly assigned to CHI-B (n=228), CHI-R (n=242), or CHI-V (n=212). Within the CHI-B group, mean alpha was .51 versus .53 for the BHI, with no difference, and mean convergent correlation with the HEXACO-60 was .68 versus .72, also with no difference. The FDR-corrected exception was Honesty-Humility: CHI-B correlated .50 with the HEXACO-60 versus .65 for BHI (z=2.90, p=.026). Mean discriminant correlations and associations with authoritarianism and social dominance orientation did not differ significantly either. These results make CHI-B similar to BHI on the tests used, but do not establish equivalence or superiority.

The improvement instructions did not produce the intended effect. Mean alphas were .56 for CHI-R and .50 for CHI-V versus .51 for CHI-B; neither mean difference was significant. Mean convergent correlations were .66 and .63 versus .68, and discriminant correlations did not improve. CHI-V actually reduced the internal consistency of Emotionality and Conscientiousness significantly relative to CHI-B; its Emotionality alpha was .22. In comparisons with BHI, only 2 of 35 CHI-R contrasts and 3 of 35 CHI-V contrasts were significant after FDR correction; all three CHI-V results concerned Emotionality and were unfavorable or divergent relative to BHI.

The proper interpretation is narrow. The scales have only four items per domain and several low alphas; authoritarianism reaches only .48. There is no factor analysis, IRT, measurement invariance, test-retest assessment, cognitive interviewing, formal expert content review, or equivalence/noninferiority design. “Content validity” is approached mainly through convergence, discrimination, and two external criteria rather than a comprehensive content-validity procedure. Data and code are not public, the exact ChatGPT 4.0 snapshot is unidentified, and one generation per version cannot represent system variability. Two negative-keying errors survived final oversight: Honesty-Humility in all three versions and Agreeableness in CHI-V had no reverse-keyed items.

The defensible contribution is that a ChatGPT-plus-human-review workflow produced a short scale with some properties close to the BHI in this Dutch sample, while generic instructions to “improve” reliability or content offered no psychometric shortcut. The paper does not study ChatGPT's personality; it studies ChatGPT as an item-writing tool for measuring human personality. The official prompt-and-item supplement was located at Taylor & Francis, but the publisher returned 403 when the file was frozen outside the page and Chrome was not open; transparently, this audit makes no claim that depends on that DOCX. The conclusions reported here derive from the complete publisher PDF, its tables, and its notes.

Pregunta de investigación

¿Puede ChatGPT 4.0 generar un inventario HEXACO breve con propiedades psicométricas comparables a las del BHI humano y mejorar de forma dirigida su consistencia interna o validez de contenido cuando se le solicita?

Método

Estudio exploratorio de validación de tres inventarios CHI de 24 ítems en neerlandés. Todos los participantes completaron HEXACO-60 y BHI y fueron aleatorizados a CHI-B, CHI-R o CHI-V; después completaron autoritarismo y SDO. Se compararon alfa, correlaciones convergentes con HEXACO-60, correlaciones discriminantes y relaciones con dos criterios, con corrección False Discovery Rate. La auditoría leyó y renderizó las nueve páginas del archivo, cubiertas del repositorio y editor más las páginas 419–425, comprobó Tables 1–2, notas, discusión, disponibilidad de datos y bibliografía, y contrastó la página completa del editor. El DOCX suplementario oficial fue identificado por nombre y URL, pero no pudo congelarse por el control 403 del editor y no se usa como evidencia de detalles adicionales.

Muestra: Se reclutaron 693 personas mediante las redes personales de estudiantes de grado. Once fueron excluidas por patrones no conformes en HEXACO-60 o por tardar en promedio menos de un segundo por ítem, quedando N=682: 223 hombres, 457 mujeres y 2 personas de otra categoría, con edad media de 35,28 años y DE=17,66. Todos completaron HEXACO-60 y BHI; la asignación aleatoria distribuyó 228 a CHI-B, 242 a CHI-R y 212 a CHI-V. La unidad analítica es una persona, no una respuesta del modelo: ChatGPT solo generó los ítems.

Hallazgos

  • El artículo apareció online el 27 de diciembre de 2024 y se publicó en Journal of Personality Assessment 107(4), páginas 419–425, con licencia CC BY 4.0.
  • La muestra final fue de 682 participantes tras excluir 11 de 693 respuestas por controles de cumplimiento y velocidad.
  • La aleatorización asignó 228 participantes a CHI-B, 242 a CHI-R y 212 a CHI-V.
  • ChatGPT generó inicialmente 24 ítems, cuatro por cada dominio HEXACO y uno por faceta.
  • Los autores detectaron dos problemas en la generación inglesa y ocho en la traducción al neerlandés y pidieron nuevas versiones.
  • Las fiabilidades por dominio de CHI-B oscilaron entre 0,31 y 0,63.
  • El alfa medio de CHI-B fue 0,51 y el de BHI 0,53; chi-cuadrado(1)=0,09 y p=0,902.
  • La correlación convergente media con HEXACO-60 fue 0,68 para CHI-B y 0,72 para BHI; z=0,93 y p=0,492.
  • Honesty-Humility tuvo menor convergencia en CHI-B, r=0,50, que en BHI, r=0,65; z=2,90 y p=0,026 tras FDR.
  • La correlación discriminante absoluta media fue 0,12 para CHI-B y 0,09 para BHI, sin diferencia, z=0,43 y p=0,679.
  • Dieciocho de las treinta correlaciones de CHI-B con dominios HEXACO-60 no correspondientes no fueron significativas.
  • Las diferencias CHI-B frente a BHI en las asociaciones previstas con autoritarismo y SDO no fueron significativas.
  • Las fiabilidades por dominio oscilaron entre 0,45 y 0,65 para CHI-R y entre 0,22 y 0,62 para CHI-V.
  • El alfa medio de CHI-R fue 0,56 frente a 0,51 de CHI-B; chi-cuadrado(1)=0,41 y p=0,734.
  • El alfa medio de CHI-V fue 0,50 frente a 0,51 de CHI-B; chi-cuadrado(1)=0,01 y p=0,908.
  • CHI-V redujo significativamente el alfa de Emotionality y Conscientiousness frente a CHI-B.
  • La correlación convergente media fue 0,66 para CHI-R y 0,63 para CHI-V, sin mejora respecto al 0,68 de CHI-B.
  • Las correlaciones discriminantes absolutas medias fueron 0,10 para CHI-R y CHI-V y no mejoraron el 0,12 de CHI-B.
  • Solo 2 de 35 contrastes entre CHI-R y BHI fueron significativos tras FDR.
  • Solo 3 de 35 contrastes entre CHI-V y BHI fueron significativos y los tres correspondieron a Emotionality.
  • El alfa de Emotionality fue 0,22 en CHI-V frente a 0,50 en BHI; chi-cuadrado(1)=7,76 y p=0,037.
  • La convergencia de Emotionality fue 0,50 en CHI-V frente a 0,75 en BHI; z=4,96 y p<0,001.
  • La correlación Emotionality-autoritarismo fue -0,19 en CHI-V y 0,01 en BHI; z=2,81 y p=0,035.
  • Un error de clave negativa dejó Honesty-Humility sin ítems invertidos en las tres versiones y otro hizo lo mismo con Agreeableness en CHI-V.
  • Las instrucciones generales para optimizar fiabilidad o contenido no mejoraron de forma consistente las propiedades medidas.
  • El resultado se refiere a un cuestionario para personas generado con ayuda de ChatGPT, no a la personalidad de ChatGPT.

Limitaciones

  • El estudio se declara exploratorio.
  • No se informa prerregistro.
  • No se aporta un cálculo de potencia o justificación prospectiva del tamaño muestral.
  • El reclutamiento procede de redes personales de estudiantes de grado.
  • La muestra de conveniencia no representa necesariamente a la población neerlandesa.
  • La dependencia potencial entre participantes reclutados por los mismos estudiantes no se modela.
  • La distribución de género es desequilibrada y se limita a tres categorías agregadas.
  • La validación se realizó solo en neerlandés.
  • No se estudia equivalencia lingüística con los ítems originales en inglés.
  • No se describe un procedimiento formal de traducción inversa.
  • No se informa la fecha exacta en que se utilizó ChatGPT.
  • La etiqueta ChatGPT 4.0 no identifica un snapshot reproducible.
  • No se publican system prompt, temperatura, top-p, semilla ni configuración de sesión.
  • Solo se conserva una generación final por versión del cuestionario.
  • No se cuantifica la variabilidad entre múltiples generaciones del mismo prompt.
  • No se comparan otros modelos generativos.
  • No se repite el flujo en distintas fechas o cuentas.
  • Los autores tuvieron que corregir dos problemas de redacción inglesa.
  • Los autores tuvieron que corregir ocho problemas de traducción.
  • La necesidad de correcciones demuestra una contribución humana material.
  • Dos errores de clave negativa sobrevivieron a la revisión final.
  • Honesty-Humility quedó sin ítems negativos en las tres versiones.
  • Agreeableness quedó sin ítems negativos en CHI-V.
  • No se informa una revisión ciega e independiente de los ítems.
  • No se presenta un panel formal de expertos para validez de contenido.
  • No se calcula índice o razón de validez de contenido.
  • No se realizan entrevistas cognitivas con participantes.
  • No se informa pilotaje cualitativo previo a la administración definitiva.
  • No se realiza análisis factorial exploratorio.
  • No se realiza análisis factorial confirmatorio.
  • No se comprueba la estructura de seis factores.
  • No se evalúa invariancia por género, edad u otros grupos.
  • No se aplica teoría de respuesta al ítem.
  • No se estudia fiabilidad test-retest.
  • No se informa omega u otros estimadores distintos del alfa.
  • El alfa puede ser bajo por diseño en dominios amplios medidos con solo cuatro ítems.
  • Las bajas fiabilidades atenúan y vuelven más inciertas las correlaciones de validez.
  • El alfa de autoritarismo es solo 0,48.
  • Solo se usan autoritarismo y SDO como criterios externos.
  • No se incluyen criterios conductuales o resultados observables.
  • Todas las medidas son autoinformes completados en una misma sesión.
  • Las correlaciones concurrentes no prueban validez predictiva.
  • La operacionalización de validez de contenido depende principalmente de correlaciones, no de cobertura experta del constructo.
  • La instrucción de optimizar contenido no especifica un criterio cuantitativo verificable.
  • La instrucción de optimizar fiabilidad no fija un alfa objetivo, como 0,70.
  • No se usa un diseño de equivalencia o no inferioridad.
  • La ausencia de diferencia significativa no demuestra que CHI y BHI sean equivalentes.
  • Las muestras de CHI-R y CHI-V son distintas de la de CHI-B.
  • La aleatorización reduce confusión entre grupos, pero no se publica una tabla de equilibrio basal.
  • Los tamaños de los tres grupos son desiguales.
  • No se detalla la asignación aleatoria ni su ocultación.
  • No se informa el reparto por grupo de las once exclusiones.
  • No se describe el tratamiento de datos ausentes más allá de que los participantes completaron las medidas.
  • Se realizan numerosos contrastes y la corrección FDR no elimina el riesgo de resultados aislados.
  • Promediar los seis dominios puede ocultar deterioros importantes como Emotionality de CHI-V.
  • Las comparaciones se centran en significación y no publican intervalos de equivalencia.
  • No se publican los datos a nivel de participante.
  • Los datos solo están disponibles mediante solicitud a los autores.
  • No se publica código de análisis.
  • No se ofrece un flujo reproducible completo desde prompts hasta tablas.
  • La declaración del propio ChatGPT sobre sus datos de entrenamiento no es verificable.
  • No puede descartarse exposición previa del modelo a HEXACO, BHI, IPIP u otros bancos de ítems.
  • Que los ítems finales no se solapen literalmente con los cuestionarios usados no descarta influencia del material de entrenamiento.
  • El suplemento oficial contiene prompts e ítems, pero el editor impidió congelarlo fuera de la página durante esta auditoría.
  • La revisión no atribuye formulaciones exactas del prompt que no estén en el cuerpo principal.
  • No se cuantifican tiempo, coste o ahorro frente al desarrollo humano.
  • No se compara el proceso con equipos humanos bajo recursos equivalentes.
  • No hay replicación independiente del cuestionario.
  • No se valida CHI en una segunda muestra.
  • No se examina estabilidad ante actualizaciones posteriores de ChatGPT.
  • Los resultados de un producto de 2024 no pueden generalizarse automáticamente a modelos actuales.
  • El estudio no separa qué parte del resultado procede del modelo y cuál de las correcciones humanas.
  • La licencia abierta del artículo no implica que los datos subyacentes sean abiertos.

Qué no demuestra

  • No demuestra que ChatGPT tenga personalidad o rasgos HEXACO.
  • No mide respuestas de ChatGPT a un cuestionario de personalidad.
  • No demuestra que ChatGPT pueda crear una escala válida sin supervisión humana.
  • No demuestra equivalencia psicométrica entre CHI y BHI.
  • No demuestra superioridad de CHI sobre una escala humana.
  • No demuestra que pedir mayor fiabilidad aumente realmente la fiabilidad.
  • No demuestra que pedir mayor validez de contenido aumente realmente esa validez.
  • No valida la estructura factorial de ninguna versión CHI.
  • No demuestra invariancia entre grupos demográficos o idiomas.
  • No establece fiabilidad temporal de las puntuaciones CHI.
  • No demuestra validez predictiva respecto a conductas externas.
  • No demuestra que los resultados se repliquen con otra muestra o modelo generativo.
  • No descarta que ChatGPT conociera materiales de personalidad durante el entrenamiento.
  • No prueba que el flujo reduzca tiempo o coste frente al desarrollo experto.
  • No permite reproducir exactamente la generación sin snapshot, configuración y suplemento congelado.

Trazabilidad

Alcance: Texto completo

Versión: Journal of Personality Assessment 107(4):419–425; published online 27 Dec 2024; publisher version; CC BY 4.0

Fuente consultada: https://scholarlypublications.universiteitleiden.nl/access/item%3A4250852/view

Revisión: Codex full-text, visual, bilingual-fidelity, psychometric-validity, statistical-interpretation, item-generation, source-transparency and claim-boundary audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • ChatGPT 4.0 through the public ChatGPT product; exact model snapshot, date and generation configuration not reported

Instrumentos y métricas

  • Dutch HEXACO-60: 60 items, ten per domain, five-point response scale
  • Dutch Brief HEXACO Inventory (BHI): 24 human-written items, four per domain
  • ChatGPT HEXACO Inventory baseline (CHI-B): 24 generated items, four per domain
  • Reliability-enhanced ChatGPT HEXACO Inventory (CHI-R): 24 rewritten items
  • Content-validity-enhanced ChatGPT HEXACO Inventory (CHI-V): 24 rewritten items
  • Child-rearing values authoritarianism scale: four forced choices
  • Social Dominance Orientation SDO7 short scale: eight items on seven points
  • Cronbach alpha reliability comparisons using the Diedenhofen and Musch procedure
  • Convergent and discriminant correlations with HEXACO-60
  • Criterion-related correlations with authoritarianism and SDO
  • Benjamini-Hochberg False Discovery Rate correction
  • HEXACO-60 noncompliant-response and average response-speed exclusions

Datos utilizados

  • Final human sample of 682 participants
  • CHI-B randomized subgroup, n=228
  • CHI-R randomized subgroup, n=242
  • CHI-V randomized subgroup, n=212
  • Published aggregate results in Tables 1–2
  • Supplemental Tables S1–S5 referenced by the article but not frozen during this audit
  • Underlying participant data available from the authors only on request

Evidencia y localización

  • Identidad bibliográfica, fechas, licencia y paginación: Journal of Personality Assessment 107(4):419–425; DOI 10.1080/00223891.2024.2444454; online 27 Dec 2024; CC BY 4.0
  • PDF editorial completo inspeccionado: .cache/editorial-sources/article-080/source.pdf; Leiden University repository; sha256 f128f9133fc9160aa73791c631c2283527a5a3b1ae7423e8b88b56f257b8c1c8
  • Abstract oficial completo: Publisher article, abstract, journal p. 419
  • Muestra, exclusiones y demografía: Methods, Sample, journal p. 420
  • Procedimiento y asignación a versiones CHI: Methods, Procedure, journal p. 420
  • Generación, reglas, correcciones y traducción de CHI: Methods, CHI versions, journal pp. 420–421
  • Errores de clave negativa: Footnote 2, journal p. 419
  • Instrumentos y fiabilidades de referencia: Methods, Materials, journal pp. 420–421
  • Comparación CHI-B frente a BHI: Results and Table 1, journal pp. 421–422
  • Comparación de las tres versiones CHI: Table 2 and Comparing the CHI versions, journal pp. 422–423
  • Comparaciones CHI-R y CHI-V frente a BHI: Results, journal p. 423
  • Interpretación y límites reconocidos: Discussion, journal pp. 423–424
  • Datos no abiertos: Data availability statement, journal p. 424: Data is available on request
  • Suplemento oficial identificado pero no congelado: Taylor & Francis Supplemental tab: ChatGPT HEXACO supplemental files R2.docx, 88.7 KB; download returned HTTP 403 during audit on 15 Jul 2026
  • Lectura y comprobación visual integral: All 9 repository and publisher PDF pages rendered and inspected, including Tables 1–2, footnotes, Discussion and references; checked 15 Jul 2026