Character is Destiny: Can Role-Playing Language Agents Make Persona-Driven Decisions?

Personas, identidad y agentes2025ACL AnthologyRevisión editorial aprobada

Autores: Rui Xu, Xintao Wang, Jiangjie Chen, Siyu Yuan, Xinfeng Yuan, Jiaqing Liang, Zulong Chen, Xiaoqing Dong, Yanghua Xiao

Palabras clave: Large Language Models, Personality, Persona, Model Evaluation, LLM Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

9
Autores
13
Hallazgos
20
Limitaciones
10
Evidencias

Resumen editorial

Español

La versión publicada en Findings of EMNLP 2025 presenta LIFECHOICE como un benchmark de reconstrucción de decisiones narrativas: dado un personaje, el contexto anterior a una decisión, un escenario y cuatro opciones, un agente de role-playing debe elegir la acción que el personaje tomó en la novela. El paper declara 2.512 puntos de decisión de 470 libros. Usa contenido de Supersummary, descripciones de personajes, resúmenes de capítulos y análisis de libros, como material escrito por expertos literarios. GPT-4 selecciona decisiones, motivaciones y capítulos y, viendo la decisión correcta y su motivación, construye el escenario, la pregunta, una opción correcta y tres distractores. Diez estudiantes universitarios angloparlantes filtran los ítems; GPT-4o asigna una categoría motivacional por ejemplo. Para construir perfiles compara resúmenes recursivos y progresivos con GPT-3.5, descripciones expertas, memoria BM25 o embedding `text-embedding-ada-002`, concatenación directa y CHARMAP. CHARMAP localiza en la descripción episodios relevantes para la pregunta y los usa como consulta para recuperar memorias. En una sola ejecución por condición, la mejor precisión publicada es 65,28 % con o1+CHARMAP, frente a 61,12 % con o1+concatenación directa; la diferencia descriptiva es 4,16 puntos. El paper también informa 92,01 % humano leyendo texto original, pero ese resultado procede de tres estudiantes, seis novelas que no conocían y un protocolo pequeño cuya cantidad exacta de preguntas, asignación, acuerdo e intervalos no se publican; no es un techo emparejado sobre los 2.512 ítems. La auditoría del repositorio oficial cambia sustancialmente la lectura. Solo libera 1.576 registros de 383 libros, 62,74 % de los ítems y 81,49 % de los libros declarados, y omite libros, CHARMAP, construcción de perfiles, retrieval, salidas, análisis y entorno exacto. El único script prueba modelos antiguos o genéricos distintos de los del paper, coloca solo el nombre bajo Description, usa `input_text` como Memory, duplica las letras de opción y no guarda predicciones. El subconjunto público tiene diez filas inválidas y un sesgo de posición extremo: B es correcta 837 veces (53,11 %), C 618 (39,21 %), A 48 y D 63. Elegir siempre B logra 53,11 %, por encima o cerca de numerosos resultados de descripción o memoria y muy lejos del supuesto azar uniforme del 25 %. No puede saberse si el conjunto completo mantiene este sesgo porque no está publicado. Hay también fuga semántica directa: el primer escenario dice “Upon refusal, Leduc threatens to expel her” y después pregunta qué decide Amelia; la respuesta es rechazar a Leduc. Como GPT-4 recibió decisión y motivación al redactar las preguntas y no se publican controles question-only, de perfil aleatorio, personaje permutado, orden de opciones o reescritura ciega a la respuesta, la precisión puede medir claves del enunciado y del generador además de comprensión de persona. Las expresiones “significantly advances” y diferencias “insignificant” entre modelos carecen de pruebas, intervalos, repeticiones o varianza. El análisis de contaminación usa popularidad en Douban y 30 libros posteriores al cutoff como proxies; no demuestra ausencia de trama o de Supersummary en entrenamiento. La contribución defendible es un benchmark interesante de role-playing narrativo y un método de recuperación prometedor; la evidencia liberada no permite reproducir sus tablas ni establecer comprensión de personalidad, fidelidad humana, predicción de decisiones reales o superioridad estadísticamente fiable.

English

The Findings of EMNLP 2025 paper introduces LIFECHOICE as a narrative decision-reconstruction benchmark: given a character, context preceding a decision, a scenario, and four options, a role-playing agent must select the action the character took in the novel. The paper reports 2,512 decision points from 470 books. It uses Supersummary character descriptions, chapter summaries, and book analyses as expert-written material. GPT-4 selects decisions, motivations, and relevant chapters and, while seeing the gold decision and motivation, constructs the scenario, question, correct option, and three distractors. Ten English-speaking university students filter items, and GPT-4o assigns one motivation category per example. Profile methods include GPT-3.5 recursive and progressive summaries, expert descriptions, BM25 or `text-embedding-ada-002` memories, direct concatenation, and CHARMAP. CHARMAP locates question-relevant episodes in a description and uses them to retrieve memories. In a single run per condition, the best reported accuracy is 65.28% for o1+CHARMAP versus 61.12% for o1+direct concatenation, a descriptive 4.16-point difference. The paper also reports 92.01% human accuracy with raw text, but this comes from three students and six unfamiliar novels under a small protocol with no exact question count, assignment design, agreement, or uncertainty; it is not a matched benchmark-wide ceiling. Audit of the official repository materially changes the interpretation. It releases only 1,576 records from 383 books, 62.74% of reported items and 81.49% of books, and omits original books, CHARMAP, profile construction, retrieval, outputs, analysis, and the exact environment. Its only script tests older or generic models unlike those in the paper, puts only the name under Description, treats `input_text` as Memory, duplicates option letters, and saves no predictions. The public subset has ten invalid rows and extreme position imbalance: B is correct 837 times (53.11%), C 618 (39.21%), A 48, and D 63. Always choosing B scores 53.11%, above or near many description-only and memory-only results and far from a uniform 25% chance assumption. Whether the full set has the same imbalance cannot be checked because it is unreleased. Direct semantic leakage also appears: the first scenario says “Upon refusal, Leduc threatens to expel her” and then asks what Amelia decides; the gold answer is to reject Leduc. Because GPT-4 saw the decision and motivation while writing questions and the paper lacks question-only, random-profile, shuffled-character, option-order, or answer-blind rewrite controls, accuracy can measure wording and generator cues in addition to persona understanding. Claims that CHARMAP “significantly advances” performance and model gaps are “insignificant” have no statistical tests, intervals, repeated runs, or variance. The contamination analysis uses Douban popularity and 30 post-cutoff books as proxies; it cannot establish absence of plots or Supersummary text from training. The defensible contribution is an interesting narrative role-playing benchmark and a promising retrieval method; the released evidence cannot reproduce its tables or establish personality understanding, human fidelity, real-world choice prediction, or statistically reliable superiority.

Pregunta de investigación

¿Hasta qué punto los LLM y agentes de role-playing pueden reconstruir la decisión original de un personaje de ficción a partir de su historia precedente, y mejora la precisión un perfil específico del escenario que combine descripción y memoria recuperada?

Método

LIFECHOICE transforma decisiones de novelas en preguntas de cuatro opciones. GPT-4 selecciona puntos de decisión y motivaciones a partir de Supersummary, localiza capítulos y genera escenario, pregunta, opción correcta y distractores. Diez estudiantes filtran preguntas con una rúbrica 0-2 en cuatro dimensiones y umbral medio mayor que seis; GPT-4o clasifica motivaciones. Se comparan descripciones resumidas o expertas, memoria BM25/embedding, concatenación y CHARMAP con siete familias de modelos; se reporta una ejecución y accuracy, más BLEU, ROUGE-L y NLI en un apéndice. La auditoría independiente perfila los 1.576 registros públicos, calcula baselines de posición, inspecciona el único script y contrasta el alcance liberado con las tablas.

Muestra: El paper declara 2.512 puntos de decisión de 470 libros. El artefacto público contiene 1.576 pares libro-personaje únicos de 383 libros en 392 grupos; los textos de entrada tienen mediana de 24.993 caracteres, p95 de 53.174 y máximo de 71.086. Diez filas no son preguntas válidas A-D. El control de construcción usa diez estudiantes; la comparación humana usa tres estudiantes y seis novelas, sin n exacto de preguntas publicado.

Hallazgos

  • La fuente autoritativa es el PDF de Findings of EMNLP 2025, DOI 10.18653/v1/2025.findings-emnlp.813, páginas 15038-15059; sus 22 páginas se renderizaron e inspeccionaron visualmente.
  • El PDF se titula Character is Destiny: Can Role-Playing Language Agents Make Persona-Driven Decisions?, mientras el registro ACL usa Can Persona-assigned Language Models Make Personal Choices?.
  • La mejor precisión declarada es o1+CHARMAP 65,28 %, frente a o1+concatenación 61,12 %; no se publica prueba inferencial para los 4,16 puntos.
  • Las descripciones expertas alcanzan 53,04-56,90 %, mejor que los resúmenes automáticos 38,23-48,92 %; memoria sola logra 27,98-35,80 %.
  • CHARMAP supera descriptivamente a concatenación directa en los modelos reportados y obtiene 61,43-65,28 %.
  • La evaluación humana pequeña publica 92,01 % con texto original, 66,83 % con concatenación y 72,17 % con CHARMAP; GPT-4o da 60,07 % y 64,22 % en las dos últimas condiciones.
  • El repositorio oficial solo libera 1.576 de 2.512 registros y 383 de 470 libros, sin código CHARMAP ni resultados reproducibles.
  • En el subconjunto público, B es gold en 53,11 % y C en 39,21 %; always-B logra 53,11 %, mientras A y D suman solo 7,05 %.
  • Diez registros públicos son N/A o Not applicable, tienen una sola opción y no pueden puntuarse con el evaluador A-D.
  • El primer escenario público filtra la decisión mediante la frase Upon refusal antes de preguntar si Amelia rechaza la proposición.
  • El único runner público no implementa CHARMAP, no usa los modelos principales del paper, duplica etiquetas de opción y no conserva una traza por ítem.
  • Table 15 puntúa Poor como 1 en Comprehensiveness, igual que Average, aunque las otras dimensiones y el diseño declarado usan 0-2.
  • Los NLI de BM25 y embedding en Table 6 coinciden exactamente con sus accuracies MCQ, 27,98, 28,51, 35,19 y 35,80, sin artefacto que permita aclarar si es coincidencia o error.

Limitaciones

  • El conjunto completo de 2.512 ítems y 470 libros no está liberado; solo se audita el subconjunto público.
  • La liberación no incluye libros, CHARMAP, construcción de perfiles, retrieval, salidas, splits, análisis ni entorno exacto.
  • El always-B de 53,11 % del subconjunto invalida usar 25 % como baseline suficiente; la distribución completa es desconocida.
  • La construcción con GPT-4 conoce la respuesta y motivación; hay al menos una fuga directa en el escenario.
  • No hay baseline question-only, sin perfil, perfil aleatorio, personaje permutado, opciones permutadas ni control de longitud/posición.
  • No hay reescritura ciega a la respuesta ni auditoría sistemática de pistas semánticas o estilísticas.
  • GPT-4 participa en construcción y modelos de la misma familia participan en evaluación, con riesgo de circularidad de estilo/proveedor.
  • Se reporta una sola accuracy por condición, sin semillas, repeticiones, temperatura, intervalos o varianza.
  • Significantly advances e insignificant model gap no están respaldados por pruebas estadísticas.
  • La evaluación humana usa solo tres estudiantes y seis novelas; faltan n de preguntas, asignación, acuerdo e intervalos.
  • La rúbrica manual no publica ratings por ítem, conteos antes/después, adjudicación ni fiabilidad interevaluador; contiene un error de scoring.
  • El análisis de contaminación usa reviews de Douban como proxy y no prueba ausencia en pretraining ni en Supersummary.
  • Entity replacement puede conservar eventos identificables y alterar señales narrativas; no se cuantifica su eficacia.
  • El género y las motivaciones no reportan tamaños de celda, intervalos o corrección múltiple; las explicaciones causales son especulativas.
  • El análisis temporal incluye solo 40 personajes y cinco fracciones sin incertidumbre.
  • BLEU, ROUGE-L y entailment XNLI no están calibrados contra equivalencia conductual humana.
  • Las coincidencias exactas entre NLI y MCQ en cuatro filas de Table 6 no pueden auditarse sin salidas/código.
  • La decisión de un personaje ficticio es una elección de trama diseñada por un autor, no una observación de conducta humana real.
  • El título difiere entre PDF y registro ACL; ACL concatena Xiaoqing Dong como Xiaoqingdong.
  • La licencia Apache-2.0 del repo no aclara por sí sola los derechos del contenido derivado de terceros; no se formula una conclusión jurídica.

Qué no demuestra

  • No demuestra que los LLM posean personalidad, deseos, valores o una mente humana.
  • No demuestra fidelidad psicométrica ni estabilidad de rasgos.
  • No demuestra que los agentes predigan decisiones de personas reales.
  • No separa comprensión de persona de pistas en escenario, posición de respuesta, estilo del generador o conocimiento previo de la trama.
  • No establece que CHARMAP supere estadísticamente a concatenación o a otros modelos.
  • No establece un gap humano-modelo general sobre todo LIFECHOICE.
  • No demuestra ausencia de contaminación por novelas, resúmenes o Supersummary.
  • No reproduce las tablas principales desde el repositorio oficial.
  • No valida un baseline de azar del 25 % ante la distribución pública fuertemente desequilibrada.
  • No prueba que mayor accuracy corresponda a mejor seguridad, autonomía o utilidad en agentes personales reales.

Trazabilidad

Alcance: Texto completo

Versión: Findings of EMNLP 2025, Anthology ID 2025.findings-emnlp.813, DOI 10.18653/v1/2025.findings-emnlp.813, pages 15038-15059, 22 pages; PDF title is Character is Destiny: Can Role-Playing Language Agents Make Persona-Driven Decisions?

Fuente consultada: https://aclanthology.org/2025.findings-emnlp.813/

Revisión: Codex complete bilingual full-text fidelity pass using the published Findings version, all-page visual inspection, official repository commit audit, exact public-data profiling, option-position baseline calculation, malformed-row audit, scenario leakage inspection, released-runner review, title and author reconciliation, statistical-claim review, contamination-control review, human-evaluation review, and construct-boundary assessment; summaries written from the paper and artifact evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Llama-4-Maverick
  • qwen3-235b-a22b
  • Claude-3.5-Sonnet
  • DeepSeek-R1
  • gpt-4o
  • o1
  • gemini-2.5-pro
  • GPT-4 for decision selection, gold motivation extraction, chapter location, and multiple-choice construction
  • GPT-4o for motivation-category assignment and selected analyses
  • GPT-3.5 for recursive and progressive summary construction
  • Legacy public runner: gpt-3.5-turbo, generic gpt-4, claude-3-sonnet-20240229, and gemini-pro

Instrumentos y métricas

  • Four-option multiple-choice narrative decision reconstruction
  • CHARMAP scenario-specific description localization and memory retrieval
  • BM25 retrieval
  • OpenAI text-embedding-ada-002 retrieval
  • Manual four-dimension question rubric: comprehensiveness, logical consistency, challenge level, and alignment with character motivation
  • GPT-4o Aristophanes-inspired motivation taxonomy
  • Accuracy
  • BLEU and ROUGE-L for free behavior generation
  • mDeBERTa-v3-base-xnli entailment probability as NLI score
  • Independent public-subset option-distribution and always-B baseline audit

Datos utilizados

  • Reported LIFECHOICE: 2,512 fictional-character decision points from 470 books
  • Supersummary character descriptions, chapter summaries, and book analyses used under research authorization
  • Official GitHub public subset at commit 37266c38648cd56574b0cb2140857171a752cf38: 1,576 records, 383 books, 10 malformed records
  • Thirty popularity-stratified books and thirty post-August-6-2024 control books for reported leakage analysis
  • Small human-evaluation subset of six unfamiliar novels

Evidencia y localización

  • Título PDF, autores, abstract, DOI y alcance: Published page 15038 and ACL Anthology record 2025.findings-emnlp.813 checked 15 July 2026
  • Construcción de LIFECHOICE y control manual: Published pages 15040-15041 and 15052, Sections 3.1 and Appendix D
  • Métodos, modelos y resultados principales: Published pages 15042-15045, Sections 4-5 and Tables 3-5
  • Evaluación humana y fuga de entrenamiento declarada: Published pages 15043-15044, Table 4 and Analysis and Mitigation of Data Leakage
  • Evaluación generativa y valores repetidos: Published pages 15049-15050, Appendix A.1 and Table 6
  • Prompts de construcción, role-playing y CHARMAP: Published pages 15056-15058, Tables 10-14
  • Error de rúbrica manual: Published page 15059, Table 15
  • Cobertura pública, distribución de opciones, invalid rows, fuga del escenario y límites del runner: Official LifeChoice repository commit 37266c38648cd56574b0cb2140857171a752cf38 independently profiled 15 July 2026
  • Auditoría completa de artefacto y validez: reports/verification/article-191-lifechoice-leakage-and-artifact-audit.json
  • Inspección visual completa: All 22 published PDF pages rendered and visually inspected on 15 July 2026