Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models estudia si un LLM puede ayudar a construir pruebas de juicio situacional (SJT) para medir personalidad en personas. No mide personalidad, identidad ni consciencia del modelo: su objeto es la generación automática de ítems psicométricos en chino. El programa contiene tres estudios. En el primero, siete doctorandos en psicología valoran 21 ítems humanos traducidos y grupos de siete ítems generados bajo cuatro temperaturas, tres variantes de prompt y dos momentos. Los indicadores son necesidad de la situación mediante CVR/CVI, racionalidad de opciones, racionalidad de puntuación y calidad global. Temperatura 1,0 y 1,1 empatan en CVI, 0,714; 1,0 obtiene mejores rangos en necesidad y opciones. Prompt v2 logra el CVI más alto, 0,755, pero Prompt v1 tiene mejor calidad global media, 6,57 frente a 6,00, y las mejoras v1→v2 no son significativas. La selección de v2/1,0 es por tanto una decisión exploratoria sobre siete ítems por condición y los mismos siete jueces, no una optimización confirmada en una muestra independiente. La comparación temporal tampoco demuestra estabilidad: que dos grupos de siete ítems generados con diez días de separación no difieran significativamente no es una prueba de equivalencia ni de reproducción de los mismos ítems. El segundo estudio genera 200 ítems con la interfaz web de ChatGPT en modo instant del 6 de noviembre de 2025, denominada ChatGPT-5: cinco facetas, cinco conversaciones/rondas y ocho ítems por celda. Su CVI global es 0,707; por faceta es 0,707 en autoconciencia, 0,657 en gregarismo, 0,843 en apertura a ideas, 0,600 en complacencia y 0,729 en autodisciplina. No se detecta efecto medio de ronda, pero eso no equivale a reproducibilidad. Cincuenta de 200 ítems quedan bajo el umbral CVR 0,71 y 59 reciben menos de 6/7 en calidad. Treinta y dos tienen racionalidad de puntuación media menor de 3,5/4. Algunos fallos son sustantivos: A_1_5 obtiene CVR -1, puntuación 1,86 y calidad 0/7; E_4_5 también CVR -1 y calidad 0/7. El propio paper concluye correctamente que el filtrado experto sigue siendo necesario. La afirmación de generalización entre modelos es más débil: compara descriptivamente siete ítems GPT-4 de una sola faceta con 200 ítems ChatGPT-5 de cinco facetas, fechas e interfaces distintas, sin un contraste emparejado de modelo. Además, el suplemento revela que los estudios 1 y 3 no llamaron directamente a OpenAI: usaron `ai.shanxl.com`, una pasarela de terceros que afirmaba exponer `gpt-4-1106-preview`. No hay código, recibos, request IDs ni logs que verifiquen el backend o sus parámetros. En Study 2 tampoco se publica un identificador inmutable del backend de ChatGPT-5, system prompt, seed o exportación de conversaciones. El tercer estudio crea otros 40 ítems GPT-4, ocho por una única faceta de cada dominio Big Five, y los administra junto con facetas NEO-PI-R. Hay 443 casos válidos, 130 con criterios y 80 con retest de dos semanas. Los datos abiertos reproducen los resultados: alpha 0,75/0,84/0,70/0,57/0,61, retest 0,58/0,77/0,41/0,52/0,65 y convergencia con NEO 0,68/0,67/0,48/0,36/0,44 para N/E/O/A/C. Por tanto hay evidencia razonable para autoconciencia, gregarismo y en parte apertura, pero complacencia y autodisciplina tienen consistencia baja, apertura tiene retest 0,41 y complacencia converge solo 0,36. El CFA WLSMV informa RMSEA 0,03, CFI/TLI 0,95 y SRMR 0,11; este último es débil. La comparación de correlaciones interfactoriales medias, 0,385 en LLM-SJT frente a 0,494 en NEO, no establece por sí sola validez discriminante: la complacencia LLM correlaciona 0,39 con gregarismo y apertura NEO, más que 0,36 con complacencia NEO. De 35 correlaciones LLM-SJT con criterios, ocho tienen p<0,05 sin corregir y solo cuatro sobreviven un Bonferroni simple; el paper no preespecifica ajuste por multiplicidad. Los archivos OSF constituyen una aportación importante: licencia CC-BY-4.0, banco completo de 310 ítems, prompts, suplemento, datos `.sav`, salidas `.spv` e inputs CFA. Las cinco bases no tienen valores ausentes, los IDs son únicos, los 130 criterios y 80 retests enlazan con los 443 casos, y la auditoría reproduce CVR, medias, sumas, alphas, correlaciones y ANOVA. No hay duplicados exactos de stems u opciones. Pero el manuscrito dice publicar analysis scripts y en realidad ofrece viewers `.spv`, no sintaxis SPSS, además de dos `.inp` Mplus sin `.out`; la pipeline exacta no es ejecutable de extremo a extremo. Tampoco hay logs de generación, tiempos, tokens o costes. La afirmación de generar 100 ítems por 0,02-1,00 dólares y en pocos minutos es una estimación, no una medición de la pasarela usada. Todos los ítems generados colocan las respuestas de rasgo alto en A/B y bajo en C/D, una clave posicional transparente no evaluada frente a coaching, faking o deseabilidad social. El trabajo cubre cinco facetas, no todas las dimensiones/facetas Big Five, y la adecuación cultural se limita a jueces y participantes chinos, sin invariancia intercultural. La conclusión fiel es que el estudio ofrece evidencia de factibilidad valiosa, datos abiertos de buena integridad y éxito psicométrico parcial. No prueba un generador universal, reproducible o uniformemente válido, ni personalidad sintética; requiere procedencia verificable del modelo, scripts ejecutables, logs, tests de equivalencia, posiciones de respuesta aleatorizadas, replicación independiente, cribado experto y validación cultural más amplia.
Pregunta de investigación
¿Puede un procedimiento estructurado de prompting generar automáticamente ítems SJT chinos para cinco facetas de personalidad con validez de contenido, calidad media entre rondas y propiedades psicométricas suficientes para su uso como instrumento humano?