La versión publicada en Findings of EMNLP 2025 presenta LIFECHOICE como un benchmark de reconstrucción de decisiones narrativas: dado un personaje, el contexto anterior a una decisión, un escenario y cuatro opciones, un agente de role-playing debe elegir la acción que el personaje tomó en la novela. El paper declara 2.512 puntos de decisión de 470 libros. Usa contenido de Supersummary, descripciones de personajes, resúmenes de capítulos y análisis de libros, como material escrito por expertos literarios. GPT-4 selecciona decisiones, motivaciones y capítulos y, viendo la decisión correcta y su motivación, construye el escenario, la pregunta, una opción correcta y tres distractores. Diez estudiantes universitarios angloparlantes filtran los ítems; GPT-4o asigna una categoría motivacional por ejemplo. Para construir perfiles compara resúmenes recursivos y progresivos con GPT-3.5, descripciones expertas, memoria BM25 o embedding `text-embedding-ada-002`, concatenación directa y CHARMAP. CHARMAP localiza en la descripción episodios relevantes para la pregunta y los usa como consulta para recuperar memorias. En una sola ejecución por condición, la mejor precisión publicada es 65,28 % con o1+CHARMAP, frente a 61,12 % con o1+concatenación directa; la diferencia descriptiva es 4,16 puntos. El paper también informa 92,01 % humano leyendo texto original, pero ese resultado procede de tres estudiantes, seis novelas que no conocían y un protocolo pequeño cuya cantidad exacta de preguntas, asignación, acuerdo e intervalos no se publican; no es un techo emparejado sobre los 2.512 ítems. La auditoría del repositorio oficial cambia sustancialmente la lectura. Solo libera 1.576 registros de 383 libros, 62,74 % de los ítems y 81,49 % de los libros declarados, y omite libros, CHARMAP, construcción de perfiles, retrieval, salidas, análisis y entorno exacto. El único script prueba modelos antiguos o genéricos distintos de los del paper, coloca solo el nombre bajo Description, usa `input_text` como Memory, duplica las letras de opción y no guarda predicciones. El subconjunto público tiene diez filas inválidas y un sesgo de posición extremo: B es correcta 837 veces (53,11 %), C 618 (39,21 %), A 48 y D 63. Elegir siempre B logra 53,11 %, por encima o cerca de numerosos resultados de descripción o memoria y muy lejos del supuesto azar uniforme del 25 %. No puede saberse si el conjunto completo mantiene este sesgo porque no está publicado. Hay también fuga semántica directa: el primer escenario dice “Upon refusal, Leduc threatens to expel her” y después pregunta qué decide Amelia; la respuesta es rechazar a Leduc. Como GPT-4 recibió decisión y motivación al redactar las preguntas y no se publican controles question-only, de perfil aleatorio, personaje permutado, orden de opciones o reescritura ciega a la respuesta, la precisión puede medir claves del enunciado y del generador además de comprensión de persona. Las expresiones “significantly advances” y diferencias “insignificant” entre modelos carecen de pruebas, intervalos, repeticiones o varianza. El análisis de contaminación usa popularidad en Douban y 30 libros posteriores al cutoff como proxies; no demuestra ausencia de trama o de Supersummary en entrenamiento. La contribución defendible es un benchmark interesante de role-playing narrativo y un método de recuperación prometedor; la evidencia liberada no permite reproducir sus tablas ni establecer comprensión de personalidad, fidelidad humana, predicción de decisiones reales o superioridad estadísticamente fiable.
Pregunta de investigación
¿Hasta qué punto los LLM y agentes de role-playing pueden reconstruir la decisión original de un personaje de ficción a partir de su historia precedente, y mejora la precisión un perfil específico del escenario que combine descripción y memoria recuperada?