Towards a Design Guideline for RPA Evaluation: A Survey of Large Language Model-Based Role-Playing Agents

Revisiones, teoría y gobernanza2025ACL AnthologyRevisión editorial aprobada

Autores: Chaoran Chen, Bingsheng Yao, Ruishi Zou, Wenyue Hua, Weimin Lyu, Toby Jia-Jun Li, Dakuo Wang

Palabras clave: Role-playing agents, Evaluation methodology, Systematic literature review, Evaluation metrics, Agent attributes, Task attributes, LLM agents

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
14
Hallazgos
20
Limitaciones
6
Evidencias

Resumen editorial

Español

Este artículo no evalúa una personalidad sintética concreta ni demuestra que un agente represente fielmente a una persona. Es una revisión de la literatura sobre cómo se evalúan los agentes de rol basados en LLM (RPA) y una propuesta para elegir familias de métricas según el diseño del agente y la tarea. Los autores recuperaron 1.676 registros publicados entre enero de 2021 y diciembre de 2024 en Google Scholar (1.490), ACM Digital Library (150), IEEE Xplore (19) y ACL Anthology (17). Tras eliminar duplicados quedaron 1.573; 163 pasaron el cribado de título y resumen y 122 fueron incluidos después de revisar el texto completo. Por tanto, la formulación del resumen, que habla de revisar sistemáticamente 1.676 artículos, debe leerse con precisión: 1.676 fueron registros recuperados y 122 constituyeron el corpus final codificado.

Tres coautores con experiencia en agentes LLM aplicaron codificación abierta inductiva. Dos codificaron de forma independiente el mismo 20% de los artículos, acordaron y refinaron categorías, dividieron el resto y validaron de forma cruzada el trabajo del otro; un tercer anotador revisó los datos y las discrepancias se resolvieron por discusión. El proceso produce seis atributos de agente (historial de actividad, creencias y valores, información demográfica, rasgos psicológicos, habilidades y experiencia, y relaciones sociales), siete atributos de tarea (individuos simulados, sociedad simulada, dinámica de opinión, toma de decisiones, experimentos psicológicos, formación educativa y escritura) y siete categorías de métricas (rendimiento, psicológicas, alineación externa, consistencia interna, sociales y de decisión, contenido y texto, y sesgo/equidad/ética). Son categorías que agrupan muchas medidas, no siete instrumentos individuales.

La guía tiene dos pasos: identificar los atributos relevantes del agente y de la tarea y consultar, para cada uno, las tres categorías de métricas más frecuentes en los 122 trabajos. Su valor es práctico y descriptivo: obliga a mirar más allá del rendimiento y muestra qué combinaciones han usado otros investigadores. Pero frecuencia no equivale a validez. El estudio no compara métricas por validez de constructo, fiabilidad, sensibilidad, calibración, sesgo, coste o utilidad; tampoco demuestra que las tres más usadas sean mejores que alternativas menos frecuentes. Para relaciones sociales, los propios autores dicen que no hay métricas orientadas al agente establecidas y proponen tres familias apoyándose en teoría del intercambio social, de modo que esa fila no procede de un top tres empírico equivalente. El mapa de calor muestra coocurrencias entre atributos y tareas, no causalidad ni necesidad universal de rasgos demográficos o psicológicos.

Los dos casos son retrospectivos e ilustrativos. Generative Agents se presenta como ejemplo alineado con las familias frecuentes; un trabajo de mundo social generativo se usa como caso desalineado junto con críticas de revisores. El artículo aclara que estos ejemplos no prueban superioridad. No hay aplicación prospectiva, grupo de comparación ni medida de mejora en fiabilidad o validez. Por ello, la afirmación de la web pública de que la alineación 'perfecta' confirma la robustez del trabajo original excede la evidencia.

La reproducibilidad es incompleta. El artículo publica una consulta genérica y recuentos agregados, pero no fechas de búsqueda por base, sintaxis adaptada, exportaciones, decisiones por registro, razones de exclusión a texto completo, matriz de los 122 trabajos, código de análisis, evaluación formal de calidad ni acuerdo numérico entre codificadores. El repositorio enlazado, en el commit auditado, solo contiene README, imágenes y un PDF: no permite reconstruir el flujo 1.676→122, las figuras ni los rankings. La web ofrece un glosario útil con 71 filas orientadas al agente y 261 a la tarea, pero sus CSV contienen cuatro duplicados exactos y etiquetas anteriores distintas de la taxonomía final ('social and economic' frente a 'social and decision-making'). La interfaz permite buscar, filtrar y ordenar, aunque conserva una cita de arXiv en vez del artículo ACL, carece de estados de carga/error y recuento de resultados, usa claves de fila inexistentes y presenta carencias de teclado, modal y contraste. En conjunto, el trabajo es una taxonomía y lista de comprobación valiosa para diseñar evaluaciones, con confianza alta sobre lo que el PDF afirma y confianza moderada sobre la reproducibilidad y generalización de sus recomendaciones.

English

This paper does not evaluate a particular synthetic personality or show that an agent faithfully represents a person. It is a literature review of how LLM-based role-playing agents (RPAs) are evaluated and a proposal for choosing metric families from agent and task design. The authors retrieved 1,676 records published from January 2021 through December 2024 from Google Scholar (1,490), the ACM Digital Library (150), IEEE Xplore (19), and ACL Anthology (17). Deduplication left 1,573 records; 163 passed title-and-abstract screening, and 122 were included after full-text review. The abstract's wording that 1,676 papers were systematically reviewed therefore needs a precise boundary: 1,676 were retrieved records, while 122 formed the final coded corpus.

Three coauthors experienced with LLM agents used inductive open coding. Two independently coded the same 20% of papers, discussed and refined the categories, split the remainder and cross-validated each other's work; a third annotator reviewed the coded data and discrepancies were resolved through discussion. The process yields six agent attributes (activity history, belief and value, demographic information, psychological traits, skill and expertise, and social relationships), seven task attributes (simulated individuals, simulated society, opinion dynamics, decision making, psychological experiments, educational training, and writing), and seven evaluation-metric categories (performance, psychological, external alignment, internal consistency, social and decision-making, content and textual, and bias/fairness/ethics). These are categories containing many concrete measures, not seven individual instruments.

The guideline has two steps: identify relevant agent and task attributes, then consult the three metric categories most frequently associated with each in the 122 papers. Its value is practical and descriptive: it encourages researchers to look beyond task performance and shows combinations used in prior work. Frequency, however, is not validity. The study does not compare metrics on construct validity, reliability, sensitivity, calibration, bias, cost, or decision utility, and it does not show that the three most common choices outperform less frequent alternatives. For social relationships, the authors state that no established agent-oriented metrics exist and propose three families from Social Exchange Theory, so this row is not derived from an equivalent empirical top-three count. The heatmap reports co-occurrences between agent and task attributes, not causal effects or a universal need for demographic or psychological traits.

The two cases are retrospective illustrations. Generative Agents is presented as aligned with common metric families; a generative social-world submission is presented as misaligned alongside reviewer criticism. The paper explicitly says these examples do not demonstrate superiority. There is no prospective use, comparison group, or measured gain in reliability or validity. The public website's stronger statement that 'perfect' alignment echoes the original work's robustness therefore exceeds the evidence.

Reproducibility is incomplete. The paper gives one generic query and aggregate flow counts but not database search dates, adapted syntax, raw exports, record-level decisions, full-text exclusion reasons, the 122-paper coding matrix, analysis code, formal study-quality appraisal, or numerical coder agreement. At the audited commit, the linked repository contains only a README, images, and a PDF, so it cannot reconstruct the 1,676-to-122 flow, central figures, or rankings. The public website offers a useful glossary with 71 agent-oriented and 261 task-oriented rows, but the CSVs contain four exact duplicates and pre-final taxonomy labels ('social and economic' rather than 'social and decision-making'). The interface supports search, filtering, and sorting, but still cites the arXiv misc item rather than the ACL article, lacks loading/error and result-count states, uses nonexistent row keys, and has keyboard, modal, and contrast shortcomings. Overall, this is a valuable taxonomy and evaluation-design checklist, with high confidence in what the full paper reports and moderate confidence in the reproducibility and generalizability of its recommendations.

Pregunta de investigación

¿Qué atributos de agente, atributos de tarea y familias de métricas aparecen en la literatura de agentes de rol basados en LLM, cómo se relacionan descriptivamente y cómo puede esa evidencia organizar una guía práctica para seleccionar evaluaciones?

Método

Revisión sistemática de literatura con búsqueda en cuatro fuentes, deduplicación, cribado independiente de título/resumen, revisión de texto completo y codificación abierta inductiva por tres coautores expertos. Dos anotadores compartieron un 20% inicial, consensuaron categorías, dividieron y validaron de forma cruzada el resto, y un tercero revisó discrepancias. La guía toma las tres categorías de métricas más frecuentes por atributo de agente y tarea y las ilustra retrospectivamente con dos casos.

Muestra: Corpus bibliográfico de 122 estudios incluidos a texto completo sobre agentes LLM que simulan comportamiento humano con actividad cognitiva, tareas generales o complejas y espacios de acción no finitos ni predefinidos. Los 1.676 son registros recuperados, no el tamaño del corpus finalmente codificado.

Hallazgos

  • La búsqueda recuperó 1.676 registros de cuatro fuentes; 1.573 quedaron tras deduplicar, 163 pasaron título/resumen y 122 se incluyeron a texto completo.
  • La revisión identifica seis atributos de agente: historial de actividad, creencias y valores, información demográfica, rasgos psicológicos, habilidades/experiencia y relaciones sociales.
  • Identifica siete atributos de tarea: individuos simulados, sociedad simulada, dinámica de opinión, toma de decisiones, experimentos psicológicos, formación educativa y escritura.
  • Agrupa las evaluaciones en siete categorías: rendimiento, psicológicas, alineación externa, consistencia interna, sociales y de decisión, contenido/texto, y sesgo/equidad/ética.
  • Las siete salidas son categorías con numerosos instrumentos concretos, no siete métricas individuales validadas.
  • La guía recomienda consultar las tres categorías más frecuentes para cada atributo de agente y de tarea y revisar la selección de forma iterativa.
  • La recomendación es descriptiva de prácticas observadas y no una comparación de calidad, fiabilidad o validez entre métricas.
  • Para relaciones sociales no hay métricas orientadas al agente establecidas en el corpus; la fila recomendada se apoya en teoría del intercambio social.
  • El mapa de calor de atributos y tareas contiene recuentos de coocurrencia y no identifica relaciones causales.
  • Los autores dicen que los dos casos muestran viabilidad/alineación y no superioridad.
  • La web pública permite explorar 332 filas de glosario, pero no publica la matriz necesaria para reproducir los resultados centrales.
  • El repositorio enlazado no contiene datos, código analítico, decisiones de cribado, pruebas ni CI.
  • Los CSV públicos presentan cuatro duplicados exactos y etiquetas que no coinciden con la taxonomía final de ACL.
  • El propio artículo limita la guía a un punto de partida, no a un estándar prescriptivo.

Limitaciones

  • La cobertura termina en diciembre de 2024 y excluye investigación posterior.
  • La revisión puede no cubrir todas las variantes de evaluación o dominios de aplicación.
  • No se publican las fechas exactas de búsqueda por base ni sintaxis y filtros adaptados a cada una.
  • No se publica una exportación bruta de los 1.676 registros ni el mapeo de 103 duplicados.
  • No se publican decisiones por registro, lista inequívoca de los 122 incluidos ni razones de exclusión a texto completo.
  • No consta protocolo preregistrado ni registro de desviaciones.
  • El acuerdo de cribado y codificación se resuelve por consenso, pero no se cuantifica con alfa, kappa, porcentaje de acuerdo o tasa de discrepancia.
  • No se publica el libro de códigos bloqueado ni la matriz de anotación de los 122 artículos.
  • No se realiza una evaluación formal de calidad o riesgo de sesgo de los estudios incluidos.
  • Las frecuencias tratan de forma equivalente prácticas procedentes de estudios potencialmente fuertes y débiles.
  • No se informan intervalos, incertidumbre, análisis de sensibilidad ni estabilidad temporal de los rankings.
  • La selección de top tres no compara validez de constructo, fiabilidad, calibración, sensibilidad, sesgo, coste o utilidad decisional.
  • Los dos casos se seleccionan retrospectivamente y no constituyen validación externa o prospectiva.
  • No se mide una mejora en fiabilidad, validez, interpretabilidad o robustez al seguir la guía.
  • El repositorio público enlazado solo contiene documentación e imágenes, no los artefactos de reproducción.
  • Los datos explorables de la web son un glosario y no la matriz de papel-categoría usada para figuras y rankings.
  • Los CSV de la web contienen cuatro filas duplicadas y diez títulos normalizados con más de una variante de URL.
  • La web conserva etiquetas anteriores a la taxonomía final y una cita de arXiv desactualizada.
  • La interfaz no expone cobertura, versión, procedencia, duplicados ni la diferencia entre frecuencia observada y recomendación validada.
  • La interfaz tiene carencias de estados de carga/error, identidad estable de filas, teclado, semántica del modal y contraste.

Qué no demuestra

  • Que los 1.676 registros fueran revisados a texto completo o codificados por expertos
  • Que el conjunto final de 122 estudios pueda reproducirse con los artefactos publicados
  • Que las siete categorías sean siete métricas individuales validadas
  • Que las tres categorías más frecuentes sean las mejores o más fiables
  • Que la popularidad de una métrica demuestre validez de constructo o utilidad científica
  • Que las coocurrencias entre atributos y tareas sean relaciones causales
  • Que toda RPA necesite atributos demográficos o psicológicos
  • Que las recomendaciones para relaciones sociales procedan de un top tres empírico establecido
  • Que seguir la guía aumente la fiabilidad, validez o robustez de una evaluación
  • Que el caso Generative Agents valide de forma independiente la guía
  • Que la desalineación de métricas cause las críticas del caso negativo
  • Que el marco sea un estándar prescriptivo y generalizable a todos los dominios
  • Que todos los estudios incluidos tengan calidad metodológica comparable
  • Que la web y sus CSV coincidan exactamente con el artículo final de ACL
  • Que el repositorio público reproduzca las figuras, frecuencias o decisiones de anotación
  • Que la evidencia cubra avances publicados después de diciembre de 2024

Trazabilidad

Alcance: Texto completo

Versión: Findings of ACL 2025 proceedings paper, pp. 18229-18268; arXiv:2502.13012v3; linked repository 141f2444f813489da0ad0e5640947c728c1d22d3; public website and CSV snapshot checked 2026-07-16

Fuente consultada: https://aclanthology.org/2025.findings-acl.938/

Revisión: Codex 40-page full-text visual, ACL/arXiv metadata, systematic-review flow, public repository, website bundle/source-map, CSV data-quality, code/UX and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Instrumentos y métricas

  • Revisión sistemática de literatura
  • Criterios explícitos de inclusión y exclusión
  • Codificación abierta inductiva
  • Anotación experta y consenso
  • Tablas de frecuencia y mapas de coocurrencia
  • Dos casos ilustrativos retrospectivos

Datos utilizados

  • 1.676 registros recuperados; 1.573 únicos; 163 seleccionados tras título/resumen; 122 estudios incluidos a texto completo (enero 2021-diciembre 2024)
  • Glosario web público auditado: 71 filas de métricas orientadas al agente y 261 orientadas a la tarea; no equivale a la matriz de codificación de 122 estudios

Evidencia y localización

  • Metadatos de publicación, autores finales, DOI, venue y paginación: ACL Anthology 2025.findings-acl.938
  • Método, flujo 1.676→1.573→163→122, taxonomía, guía, casos y límites: Findings of ACL 2025 proceedings PDF, 40 pages; every page rendered and visually inspected
  • Historial y deriva de la versión preprint: arXiv:2502.13012v3
  • Contenido y ausencia de artefactos de reproducción: CRChenND/LLM_roleplay_agent_eval_survey at 141f2444f813489da0ad0e5640947c728c1d22d3
  • Filas, duplicados, etiquetas, código reconstruible y UX de la web: agentsurvey.hailab.io public Vue bundle, source map and CSV snapshot checked 2026-07-16
  • Auditoría de reproducibilidad, validez y fronteras de afirmación: reports/verification/article-274-acl-rpa-evaluation-survey-systematic-review-artifact-data-guideline-and-claim-audit.json