InCharacter evalúa si agentes que interpretan personajes reproducen etiquetas de personalidad atribuidas a esos personajes. En lugar de pedir al agente que marque directamente un cuestionario, transforma los ítems de 14 escalas en preguntas abiertas, formula cada una en un contexto aislado y usa otro LLM para convertir las respuestas a opciones o puntuar una dimensión como supuesto experto. La validación previa compara GPT-3.5, GPT-4 y Gemini con juicios humanos en 100 casos BFI. GPT-4 obtiene 89 % de aciertos en expert rating y correlaciones de 0,925, 0,927 y 0,837 para Pearson, Spearman y Kendall; todavía discrepa en cuatro casos por más de un punto. El benchmark principal contiene 32 personajes populares: 16 configuraciones de ChatHaruhi y 16 de RoleLLM, normalmente ejecutadas sobre gpt-3.5-turbo-1106. Para BFI y 16Personalities, el tipo positivo o negativo procede de porcentajes de Personality Database, mientras que la distancia continua usa puntuaciones de 2–3 anotadores invitados por personaje. Con expert rating por lotes y GPT-4, la Tabla 2 reporta para BFI 76,6 % de precisión por dimensión, 31,2 % de personajes con todas las dimensiones correctas y 18,2 % de error absoluto normalizado; para 16Personalities, 80,7 %, 44,8 % y 20,5 %. Por tanto, el 80,7 % del abstract no significa que el 80,7 % de los personajes tenga su personalidad completa correctamente reproducida. En 14 escalas, usando GPT-3.5 como evaluador, la media publicada es 78,9 % por dimensión, 58,5 % de acierto completo y 8,1 % de error, pero la fiabilidad entre anotadores promedia κ = 0,609 y cae a 0,438 en EPQ-R, 0,473 en ECR-R y 0,463 en CABIN. La entrevista supera generalmente al autoinforme en las métricas elegidas y produce mediciones más dispersas entre personajes, aunque la comparación no es completamente simétrica: las negativas o respuestas no conformes del autoinforme se convierten en neutral, mientras los fallos de evaluación se regeneran y Gemini puede ser sustituido por GPT-4. El anonimizado oculta nombres pero no referencias narrativas que pueden revelar el personaje al evaluador. No hay evaluación de personas reales, conducta longitudinal ni una prueba de que estas escalas conserven validez de constructo al aplicarse a agentes. El repositorio oficial publica código, 14 cuestionarios y etiquetas agregadas bajo MIT, y el código compila; sin embargo, no incluye los 18.304 diálogos, resultados ni anotaciones individuales anunciados, las dependencias no están fijadas y la reproducción requiere modelos retirados, servicios externos y una API no oficial de 16Personalities. La evidencia respalda que el procedimiento discrimina configuraciones y se acerca parcialmente a etiquetas humanas bajo este benchmark; no demuestra una personalidad interna ni fidelidad general del personaje.
Pregunta de investigación
¿Puede la personalidad de un agente de rol medirse con mayor fidelidad mediante preguntas abiertas derivadas de escalas psicológicas y valoración posterior por otro LLM que mediante autoinforme directo, y hasta qué punto las mediciones resultantes coinciden con etiquetas humanas de los personajes objetivo?