El artículo propone un benchmark para comprobar si siete LLM responden el IPIP-50 de forma compatible con uno de veinte perfiles Big Five objetivo, pensando en su uso posterior para personajes de videojuegos. Parte de 1.015.342 cuestionarios humanos del Open-Source Psychometrics Project; tras exigir respuestas completas, un tiempo mínimo y la primera participación por IP, el texto declara 596.956 casos. Normaliza los cinco rasgos, asigna cada persona por distancia euclídea al perfil más cercano y forma una referencia equilibrada de 50.500 personas, 2.525 por perfil. Los veinte prototipos no proceden de una taxonomía validada en el estudio, sino de una página web de 2018, e incluyen nombres tomados de trastornos y supuestos opuestos que aquí funcionan solo como etiquetas no diagnósticas. Para cada perfil, el prompt entrega al modelo el vector OCEAN exacto y pide responder por separado los 50 ítems con una escala Likert de 1 a 5. La tabla principal publica exactitudes de clasificación al centroide de 5,00 % para Flan-T5-XL, 5,00 % para Flan-T5-XXL, 15,10 % para text-davinci-003, 31,90 % para GPT-3.5, 74,00 % para GPT-4, 7,11 % para Dolphin-2.7-Mixtral y 6,33 % para Mixtral-8x7B-Instruct. El 100 % destacado en el abstract no es exactitud global: la Tabla 4 muestra que, en perfiles concretos, todas las respuestas de GPT-4 caen dentro de la envolvente convexa de la nube humana; es una métrica diferente. La auditoría del artefacto GitLab permite recomputar aproximadamente 5,00 %, 5,00 %, 15,08 %, 31,90 %, 71,64 %, 7,11 % y 5,16 %, por lo que las cifras públicas de GPT-4 y Mixtral no coinciden con el artículo. También aparecen tamaños de muestra de 3, 64 o 128 repeticiones por perfil, pese a que el texto afirma 64 para todos. La implementación filtra tiempos humanos por encima de 1.000 ms, no 300 ms como dice el paper, y calcula cinco distancias de Mahalanobis unidimensionales al cuadrado, no una única distancia en cinco dimensiones ni un promedio de desviaciones estándar. Además, los datos humanos completos y la referencia de 50.500 no están publicados: solo aparece un subconjunto de 4.500. La evidencia sí muestra que los modelos producen distribuciones de respuestas muy diferentes bajo estos prompts y que GPT-4 es el más cercano a los prototipos según las métricas elegidas. No demuestra personalidad humana, toma de decisiones realista, conducta estable ni NPC convincentes: el caso de juego es ilustrativo, sin jugadores, diálogo longitudinal ni evaluación conductual. La reproducibilidad queda debilitada por datos ausentes, rutas locales, resultados limpiados sin trazabilidad, un script que no compila, dependencias poco controladas y una credencial de API expuesta en el código, que debe revocarse y rotarse.
Pregunta de investigación
¿Hasta qué punto distintos LLM, condicionados con vectores Big Five de veinte perfiles objetivo, responden los 50 ítems IPIP de manera comparable a distribuciones humanas asignadas a esos mismos perfiles, y puede ese procedimiento servir como benchmark inicial para diseñar NPC con personalidad?