Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models

Evaluación y validez psicométrica2026ElsevierRevisión editorial aprobada

Autores: Chang-Jin Li, Jiyuan Zhang, Yun Tang, Jian Li

Palabras clave: Large Language Models, Personality Assessment, Situational Judgment Tests, Psychometrics, Big Five, Automatic Item Generation, Content Validity, Test-Retest Reliability, Prompt Engineering, Response Position Bias

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
16
Hallazgos
23
Limitaciones
12
Evidencias

Resumen editorial

Español

Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models estudia si un LLM puede ayudar a construir pruebas de juicio situacional (SJT) para medir personalidad en personas. No mide personalidad, identidad ni consciencia del modelo: su objeto es la generación automática de ítems psicométricos en chino. El programa contiene tres estudios. En el primero, siete doctorandos en psicología valoran 21 ítems humanos traducidos y grupos de siete ítems generados bajo cuatro temperaturas, tres variantes de prompt y dos momentos. Los indicadores son necesidad de la situación mediante CVR/CVI, racionalidad de opciones, racionalidad de puntuación y calidad global. Temperatura 1,0 y 1,1 empatan en CVI, 0,714; 1,0 obtiene mejores rangos en necesidad y opciones. Prompt v2 logra el CVI más alto, 0,755, pero Prompt v1 tiene mejor calidad global media, 6,57 frente a 6,00, y las mejoras v1→v2 no son significativas. La selección de v2/1,0 es por tanto una decisión exploratoria sobre siete ítems por condición y los mismos siete jueces, no una optimización confirmada en una muestra independiente. La comparación temporal tampoco demuestra estabilidad: que dos grupos de siete ítems generados con diez días de separación no difieran significativamente no es una prueba de equivalencia ni de reproducción de los mismos ítems. El segundo estudio genera 200 ítems con la interfaz web de ChatGPT en modo instant del 6 de noviembre de 2025, denominada ChatGPT-5: cinco facetas, cinco conversaciones/rondas y ocho ítems por celda. Su CVI global es 0,707; por faceta es 0,707 en autoconciencia, 0,657 en gregarismo, 0,843 en apertura a ideas, 0,600 en complacencia y 0,729 en autodisciplina. No se detecta efecto medio de ronda, pero eso no equivale a reproducibilidad. Cincuenta de 200 ítems quedan bajo el umbral CVR 0,71 y 59 reciben menos de 6/7 en calidad. Treinta y dos tienen racionalidad de puntuación media menor de 3,5/4. Algunos fallos son sustantivos: A_1_5 obtiene CVR -1, puntuación 1,86 y calidad 0/7; E_4_5 también CVR -1 y calidad 0/7. El propio paper concluye correctamente que el filtrado experto sigue siendo necesario. La afirmación de generalización entre modelos es más débil: compara descriptivamente siete ítems GPT-4 de una sola faceta con 200 ítems ChatGPT-5 de cinco facetas, fechas e interfaces distintas, sin un contraste emparejado de modelo. Además, el suplemento revela que los estudios 1 y 3 no llamaron directamente a OpenAI: usaron `ai.shanxl.com`, una pasarela de terceros que afirmaba exponer `gpt-4-1106-preview`. No hay código, recibos, request IDs ni logs que verifiquen el backend o sus parámetros. En Study 2 tampoco se publica un identificador inmutable del backend de ChatGPT-5, system prompt, seed o exportación de conversaciones. El tercer estudio crea otros 40 ítems GPT-4, ocho por una única faceta de cada dominio Big Five, y los administra junto con facetas NEO-PI-R. Hay 443 casos válidos, 130 con criterios y 80 con retest de dos semanas. Los datos abiertos reproducen los resultados: alpha 0,75/0,84/0,70/0,57/0,61, retest 0,58/0,77/0,41/0,52/0,65 y convergencia con NEO 0,68/0,67/0,48/0,36/0,44 para N/E/O/A/C. Por tanto hay evidencia razonable para autoconciencia, gregarismo y en parte apertura, pero complacencia y autodisciplina tienen consistencia baja, apertura tiene retest 0,41 y complacencia converge solo 0,36. El CFA WLSMV informa RMSEA 0,03, CFI/TLI 0,95 y SRMR 0,11; este último es débil. La comparación de correlaciones interfactoriales medias, 0,385 en LLM-SJT frente a 0,494 en NEO, no establece por sí sola validez discriminante: la complacencia LLM correlaciona 0,39 con gregarismo y apertura NEO, más que 0,36 con complacencia NEO. De 35 correlaciones LLM-SJT con criterios, ocho tienen p<0,05 sin corregir y solo cuatro sobreviven un Bonferroni simple; el paper no preespecifica ajuste por multiplicidad. Los archivos OSF constituyen una aportación importante: licencia CC-BY-4.0, banco completo de 310 ítems, prompts, suplemento, datos `.sav`, salidas `.spv` e inputs CFA. Las cinco bases no tienen valores ausentes, los IDs son únicos, los 130 criterios y 80 retests enlazan con los 443 casos, y la auditoría reproduce CVR, medias, sumas, alphas, correlaciones y ANOVA. No hay duplicados exactos de stems u opciones. Pero el manuscrito dice publicar analysis scripts y en realidad ofrece viewers `.spv`, no sintaxis SPSS, además de dos `.inp` Mplus sin `.out`; la pipeline exacta no es ejecutable de extremo a extremo. Tampoco hay logs de generación, tiempos, tokens o costes. La afirmación de generar 100 ítems por 0,02-1,00 dólares y en pocos minutos es una estimación, no una medición de la pasarela usada. Todos los ítems generados colocan las respuestas de rasgo alto en A/B y bajo en C/D, una clave posicional transparente no evaluada frente a coaching, faking o deseabilidad social. El trabajo cubre cinco facetas, no todas las dimensiones/facetas Big Five, y la adecuación cultural se limita a jueces y participantes chinos, sin invariancia intercultural. La conclusión fiel es que el estudio ofrece evidencia de factibilidad valiosa, datos abiertos de buena integridad y éxito psicométrico parcial. No prueba un generador universal, reproducible o uniformemente válido, ni personalidad sintética; requiere procedencia verificable del modelo, scripts ejecutables, logs, tests de equivalencia, posiciones de respuesta aleatorizadas, replicación independiente, cribado experto y validación cultural más amplia.

English

Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models asks whether an LLM can assist in building situational judgment tests (SJTs) that measure personality in people. It does not measure the model's personality, identity, or consciousness; its subject is automated generation of Chinese psychometric items. The program contains three studies. In Study 1, seven psychology doctoral students rate 21 translated human items and seven-item groups generated under four temperatures, three prompt variants, and two time points. Outcomes are situation necessity through CVR/CVI, option rationality, scoring rationality, and overall quality. Temperature 1.0 and 1.1 tie at CVI 0.714, with 1.0 obtaining stronger ranks for necessity and options. Prompt v2 reaches the highest CVI, 0.755, but Prompt v1 has higher mean overall quality, 6.57 versus 6.00, and v1-to-v2 gains are not significant. Selecting v2/1.0 is therefore an exploratory decision based on seven items per condition and the same seven judges, not confirmed optimization in an independent sample. The temporal comparison also does not establish stability: failure to detect differences between two seven-item groups generated ten days apart is neither an equivalence test nor regeneration of the same items. Study 2 generates 200 items through the consumer ChatGPT instant interface dated 6 November 2025 and labelled ChatGPT-5: five facets, five conversations/rounds, and eight items per cell. Overall CVI is 0.707; facet CVIs are 0.707 for self-consciousness, 0.657 gregariousness, 0.843 openness to ideas, 0.600 compliance, and 0.729 self-discipline. No mean round effect is detected, but this is not equivalent to reproducibility. Fifty of 200 items fall below CVR 0.71, 59 score below 6/7 overall quality, and 32 have mean scoring rationality below 3.5/4. Some failures are substantive: A_1_5 has CVR -1, scoring rationality 1.86, and quality 0/7; E_4_5 also has CVR -1 and quality 0/7. The paper appropriately concludes that expert screening remains necessary. Its cross-model claim is weaker: seven GPT-4 items from one facet are descriptively compared with 200 ChatGPT-5 items from five facets, different dates, and different interfaces, without a matched model contrast. The supplement also reveals that Studies 1 and 3 did not call OpenAI directly. They used `ai.shanxl.com`, a third-party gateway claiming to expose `gpt-4-1106-preview`. No code, provider receipt, request IDs, or logs verify the backend or effective parameters. Study 2 likewise lacks an immutable ChatGPT-5 backend ID, system prompt, seed, or conversation export. Study 3 creates a separate 40-item GPT-4 form, eight items for one selected facet from each Big Five domain, and administers it with corresponding NEO-PI-R facets. There are 443 valid cases, 130 with criteria, and 80 with a two-week retest. Open data reproduce the results: alpha 0.75/0.84/0.70/0.57/0.61, retest 0.58/0.77/0.41/0.52/0.65, and matched NEO convergence 0.68/0.67/0.48/0.36/0.44 for N/E/O/A/C. Evidence is therefore reasonable for self-consciousness, gregariousness, and partly openness, but compliance and self-discipline have low consistency, openness retest is 0.41, and compliance converges at only 0.36. WLSMV CFA reports RMSEA 0.03, CFI/TLI 0.95, and SRMR 0.11; the last is weak. Comparing mean inter-factor correlations, 0.385 for the LLM-SJT versus 0.494 for NEO, does not by itself establish discriminant validity: LLM compliance correlates 0.39 with NEO gregariousness and openness, above its 0.36 matched compliance correlation. Of 35 LLM-SJT criterion correlations, eight have unadjusted p<0.05 and only four survive a simple Bonferroni threshold; the paper does not pre-specify a multiplicity correction. The OSF release is a meaningful contribution: CC BY 4.0, the complete 310-item bank, prompts, supplement, `.sav` data, `.spv` outputs, and CFA inputs. All five datasets have no missing cells, IDs are unique, the 130 criterion and 80 retest IDs link to the 443 cases, and the audit reproduces CVR, means, sums, alphas, correlations, and ANOVA. No exact duplicate stems or option sets were found. Yet the manuscript says analysis scripts are public while OSF actually provides `.spv` viewers rather than SPSS syntax, plus two Mplus `.inp` files without `.out`; the exact pipeline is not executable end to end. Generation, timing, token, and cost logs are also absent. The claim of producing 100 items for $0.02-$1.00 and within minutes is an estimate, not a measurement of the gateway workflow used. Every generated item puts high-trait responses in A/B and low-trait responses in C/D, creating a transparent positional key that is not tested against coaching, faking, or social desirability. The work covers five selected facets rather than the complete Big Five, and cultural appropriateness is limited to Chinese judges and participants without cross-cultural invariance. The faithful conclusion is that the study offers valuable feasibility evidence, open data with good internal integrity, and partial psychometric success. It does not establish a universal, reproducible, or uniformly valid generator, and it does not establish synthetic personality. Verifiable model provenance, executable scripts, logs, equivalence testing, randomized response positions, independent replication, expert screening, and broader cultural validation are still needed.

Pregunta de investigación

¿Puede un procedimiento estructurado de prompting generar automáticamente ítems SJT chinos para cinco facetas de personalidad con validez de contenido, calidad media entre rondas y propiedades psicométricas suficientes para su uso como instrumento humano?

Método

Study 1 compara 21 ítems SJT humanos traducidos con grupos de siete ítems generados mediante una pasarela de terceros etiquetada `gpt-4-1106-preview`, cuatro temperaturas, tres prompts y dos momentos; siete doctorandos puntúan CVR/CVI, opciones, scoring y calidad. Study 2 usa la interfaz ChatGPT instant del 6-11-2025, denominada ChatGPT-5, para cinco rondas independientes de 40 ítems, ocho por cinco facetas, y siete expertos vuelven a valorar 200 ítems. Study 3 genera con la configuración elegida 40 ítems nuevos, los administra con cinco facetas NEO-PI-R a 443 personas, añade siete criterios en 130 y retest en 80, y analiza ítems, alpha, Pearson, CFA WLSMV y correlaciones. La auditoría revisó visualmente las 67 páginas del manuscrito y las 16 del suplemento, descargó todo OSF, recontó bancos y muestras, verificó enlaces, reprodujo indicadores y ANOVA, inspeccionó prompts/CFA/salidas y evaluó procedencia del modelo, multiplicidad, equivalencia, faking, cultura y reproducibilidad.

Muestra: Study 1 usa siete doctorandos familiarizados con desarrollo de personalidad/SJT y 70 ítems: 21 humanos traducidos más siete condiciones LLM de siete ítems. Study 2 usa otros siete doctorandos de Beijing Normal University y 200 ítems ChatGPT-5, 5 facetas × 5 rondas × 8 ítems. Study 3 recluta 468 personas en dos muestras; tras excluir 25 quedan 443 válidas, 264 mujeres (59,6 %), edad 18-58, media 28,25, y 97,5 % con grado universitario o superior. El subsample de criterios es 130 estudiantes, 67 mujeres, edad media 21,12; el retest incluye 80, 51 mujeres, media 31,60. Los datos confirman 233 main, 130 criterion y 80 retest dentro de los 443 IDs.

Hallazgos

  • Temperatura 1,0 y 1,1 empatan en CVI 0,714; 1,0 obtiene mejores rangos en necesidad/opciones, no un máximo único de CVI.
  • Prompt v2 alcanza CVI 0,755, pero v1 logra mejor calidad global media, 6,57 frente a 6,00, sin mejora v1→v2 significativa.
  • Los 200 ítems ChatGPT-5 tienen CVI global 0,707; por faceta 0,707/0,657/0,843/0,600/0,729 para N/E/O/A/C.
  • Cincuenta de 200 ítems fallan CVR 0,71 y 59 quedan bajo 6/7 en calidad; 32 tienen scoring racionality <3,5/4.
  • No se detecta efecto de ronda, pero la prueba no establece equivalencia ni reproducción de formas concretas.
  • El ANOVA de Study 2 se reproduce; solo scoring rationality tiene efecto nominal de faceta, F(4,175)=2,833, p=0,026.
  • Study 3 reproduce alpha 0,745/0,844/0,705/0,568/0,607 y retest 0,578/0,770/0,414/0,521/0,649.
  • Convergencia LLM-SJT/NEO es 0,675/0,665/0,478/0,357/0,440 para N/E/O/A/C.
  • El CFA reporta CFI/TLI 0,95 y RMSEA 0,03, pero SRMR 0,11.
  • Ocho de 35 correlaciones LLM con criterios son p<0,05; cuatro sobreviven 0,05/35.
  • Las cinco bases abiertas no tienen missing cells, los IDs son únicos y criterion/retest enlazan exactamente con pretest.
  • No hay duplicados exactos normalizados en stems u opciones dentro de las 310 entradas.
  • Los cálculos almacenados de CVR, promedios, sumas, alphas, correlaciones y ANOVA se reproducen desde datos crudos.
  • Study 1 y 3 usaron ai.shanxl.com, no una llamada oficial auditable de OpenAI; el backend exacto no puede verificarse.
  • OSF publica viewers SPSS, no sintaxis; inputs Mplus, no outputs; faltan logs de generación, tiempo, tokens y coste.
  • Todos los ítems generados fijan A/B=rasgo alto y C/D=rasgo bajo, una clave posicional no evaluada.

Limitaciones

  • El estudio genera instrumentos de personalidad para humanos; no estudia personalidad sintética del modelo.
  • Cada condición de optimización usa solo siete ítems y los mismos siete jueces que determinan la selección.
  • No hay preregistro, power analysis, holdout de optimización ni intervalos de equivalencia.
  • No significación se interpreta como estabilidad/reproducibilidad aunque el diseño no es un test de equivalencia.
  • El contraste GPT-4 versus ChatGPT-5 no está emparejado en faceta, número de ítems, fecha, interfaz o backend.
  • La pasarela GPT-4 de terceros impide confirmar identidad, system prompt y parámetros efectivos.
  • ChatGPT-5 se identifica por interfaz/fecha, no por model ID inmutable ni exportación de conversación.
  • Los expertos son siete doctorandos; ICC de varios indicadores es solo moderado.
  • Cincuenta ítems Study 2 fallan CVR y 59 fallan el corte de calidad, por lo que hace falta revisión experta.
  • Complacencia y autodisciplina tienen alpha 0,57/0,61; apertura retest 0,41; complacencia convergencia 0,36.
  • SRMR 0,11 contradice una lectura de ajuste uniformemente satisfactorio.
  • No se publican loadings, residuales ni outputs Mplus para auditar el CFA completo.
  • La media de correlaciones interfactoriales no es una prueba suficiente de discriminación.
  • Las 35 correlaciones criterio por instrumento se interpretan sin corrección preespecificada de multiplicidad.
  • Los criterios son todos autoinformes Likert y no incluyen conducta, rendimiento o informantes externos.
  • A/B siempre codifica alto y C/D bajo; no hay randomización, control de posición, coaching o faking.
  • Solo se mide una faceta por dominio, no el Big Five completo.
  • La muestra es china, muy educada y parcialmente estudiantil; no hay invariancia ni replicación intercultural.
  • No se compara directamente el nuevo SJT con un SJT experto chino equivalente en Study 3.
  • Los tiempos/costes son estimaciones no respaldadas por logs del flujo experimental real.
  • La release no contiene sintaxis SPSS, outputs Mplus ni pipeline ejecutable completa.
  • No se publican seeds, prompts de sistema, request IDs, fallos, retries o historial de generación.
  • Table S8 repite Self-discipline donde la primera fila corresponde a self-consciousness, un error menor de rotulación.

Qué no demuestra

  • No demuestra personalidad psicológica, identidad, consciencia o rasgos estables del LLM.
  • No confirma que cada respuesta procediera realmente de gpt-4-1106-preview.
  • No demuestra reproducibilidad entre versiones futuras de ChatGPT, proveedores o defaults.
  • No demuestra equivalencia temporal a partir de p>0,05.
  • No demuestra generalización causal entre modelos con el contraste descriptivo disponible.
  • No demuestra validez y fiabilidad satisfactorias en las cinco facetas.
  • No demuestra validez discriminante solo porque las correlaciones medias sean menores.
  • No demuestra superioridad o equivalencia frente a un SJT experto directamente comparable.
  • No demuestra cobertura completa de Big Five.
  • No demuestra resistencia a faking, coaching, deseabilidad social o sesgo de posición.
  • No demuestra adecuación cultural fuera de China ni invariancia entre grupos.
  • No demuestra el coste ni tiempo declarados en el flujo realmente usado.
  • No permite reproducir de extremo a extremo análisis SPSS/Mplus y generación desde OSF.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2412.12144v4, revised 8 February 2026, 67 pages; Computers in Human Behavior Reports 21 (March 2026), DOI 10.1016/j.chbr.2026.100964; official OSF project jbvq7

Fuente consultada: https://arxiv.org/abs/2412.12144v4

Revisión: Codex complete bilingual fidelity pass using all 67 pages of arXiv v4, all-page visual inspection, publisher/DOI verification, all 16 OSF supplement pages, complete OSF item-bank and file-tree audit, raw .sav linkage and integrity checks, independent CVR/alpha/item-total/correlation/criterion/ANOVA recomputation, CFA-input inspection, model-provenance and reproducibility analysis; summaries written from full evidence rather than abstract keywords, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Third-party gateway labelled gpt-4-1106-preview
  • Consumer ChatGPT instant mode labelled ChatGPT-5, 6 November 2025
  • DeepL for German-Chinese translation and back-translation

Instrumentos y métricas

  • Personality situational judgment tests
  • Content Validity Ratio and Content Validity Index
  • Option rationality, scoring rationality and overall item quality ratings
  • NEO-PI-R selected facets
  • Cronbach alpha and corrected item-total correlation
  • Two-week test-retest Pearson correlation
  • Five-factor WLSMV confirmatory factor analysis
  • Subjective well-being, depression, game addiction, aggression and Dark Triad criteria

Datos utilizados

  • OSF Study 1 expert-rating data, 70 items
  • OSF Study 2 expert-rating data, 200 items
  • OSF Study 3 pretest data, 443 participants
  • OSF Study 3 criterion data, 130 participants
  • OSF Study 3 retest data, 80 participants
  • OSF complete 310-item bank and CFA data

Evidencia y localización

  • Objetivos, diseño de tres estudios y alcance: arXiv v4 pages 1-14, abstract, introduction and Figure 1
  • Study 1 prompts, temperatures, judges, CVR/CVI and results: arXiv v4 pages 14-31 and Supplement pages 2-14
  • Study 2 ChatGPT-5 rounds, facets, ratings and factorial analyses: arXiv v4 pages 31-39 and Supplement pages 15-16
  • Study 3 sample, psychometrics, CFA and criterion validity: arXiv v4 pages 39-50, Tables 3-6
  • Interpretation, efficiency, cultural claims and limitations: arXiv v4 pages 50-57, Sections 7-8
  • Third-party GPT-4 access and effective parameter disclosure: Official OSF Supplementary Materials pages 12-13, Section 2 and Table S2
  • Item counts, duplicates and fixed scoring positions: Official OSF Item Bank.xlsx; independent audit of all Study1/Study2/Study3 sheets on 16 July 2026
  • Raw-data integrity and independent statistical recomputation: Official OSF Study1/Study2/Study3 .sav files; independent CVR, alpha, item-total, Pearson, criterion and balanced-ANOVA calculations
  • CFA and missing executable analysis artifacts: Official OSF CFA_data_443.dat, GPSJT.inp, NEO-PI-R.inp and complete OSF file-tree audit
  • Publication and version history: Computers in Human Behavior Reports DOI 10.1016/j.chbr.2026.100964 and arXiv:2412.12144v4 submission history
  • Auditoría integral psicométrica y del artefacto: reports/verification/article-204-sjt-generation-psychometrics-and-artifact-audit.json
  • Inspección visual completa: All 67 manuscript pages and all 16 OSF supplement pages rendered and visually inspected on 16 July 2026