Este artículo no evalúa una personalidad sintética concreta ni demuestra que un agente represente fielmente a una persona. Es una revisión de la literatura sobre cómo se evalúan los agentes de rol basados en LLM (RPA) y una propuesta para elegir familias de métricas según el diseño del agente y la tarea. Los autores recuperaron 1.676 registros publicados entre enero de 2021 y diciembre de 2024 en Google Scholar (1.490), ACM Digital Library (150), IEEE Xplore (19) y ACL Anthology (17). Tras eliminar duplicados quedaron 1.573; 163 pasaron el cribado de título y resumen y 122 fueron incluidos después de revisar el texto completo. Por tanto, la formulación del resumen, que habla de revisar sistemáticamente 1.676 artículos, debe leerse con precisión: 1.676 fueron registros recuperados y 122 constituyeron el corpus final codificado.
Tres coautores con experiencia en agentes LLM aplicaron codificación abierta inductiva. Dos codificaron de forma independiente el mismo 20% de los artículos, acordaron y refinaron categorías, dividieron el resto y validaron de forma cruzada el trabajo del otro; un tercer anotador revisó los datos y las discrepancias se resolvieron por discusión. El proceso produce seis atributos de agente (historial de actividad, creencias y valores, información demográfica, rasgos psicológicos, habilidades y experiencia, y relaciones sociales), siete atributos de tarea (individuos simulados, sociedad simulada, dinámica de opinión, toma de decisiones, experimentos psicológicos, formación educativa y escritura) y siete categorías de métricas (rendimiento, psicológicas, alineación externa, consistencia interna, sociales y de decisión, contenido y texto, y sesgo/equidad/ética). Son categorías que agrupan muchas medidas, no siete instrumentos individuales.
La guía tiene dos pasos: identificar los atributos relevantes del agente y de la tarea y consultar, para cada uno, las tres categorías de métricas más frecuentes en los 122 trabajos. Su valor es práctico y descriptivo: obliga a mirar más allá del rendimiento y muestra qué combinaciones han usado otros investigadores. Pero frecuencia no equivale a validez. El estudio no compara métricas por validez de constructo, fiabilidad, sensibilidad, calibración, sesgo, coste o utilidad; tampoco demuestra que las tres más usadas sean mejores que alternativas menos frecuentes. Para relaciones sociales, los propios autores dicen que no hay métricas orientadas al agente establecidas y proponen tres familias apoyándose en teoría del intercambio social, de modo que esa fila no procede de un top tres empírico equivalente. El mapa de calor muestra coocurrencias entre atributos y tareas, no causalidad ni necesidad universal de rasgos demográficos o psicológicos.
Los dos casos son retrospectivos e ilustrativos. Generative Agents se presenta como ejemplo alineado con las familias frecuentes; un trabajo de mundo social generativo se usa como caso desalineado junto con críticas de revisores. El artículo aclara que estos ejemplos no prueban superioridad. No hay aplicación prospectiva, grupo de comparación ni medida de mejora en fiabilidad o validez. Por ello, la afirmación de la web pública de que la alineación 'perfecta' confirma la robustez del trabajo original excede la evidencia.
La reproducibilidad es incompleta. El artículo publica una consulta genérica y recuentos agregados, pero no fechas de búsqueda por base, sintaxis adaptada, exportaciones, decisiones por registro, razones de exclusión a texto completo, matriz de los 122 trabajos, código de análisis, evaluación formal de calidad ni acuerdo numérico entre codificadores. El repositorio enlazado, en el commit auditado, solo contiene README, imágenes y un PDF: no permite reconstruir el flujo 1.676→122, las figuras ni los rankings. La web ofrece un glosario útil con 71 filas orientadas al agente y 261 a la tarea, pero sus CSV contienen cuatro duplicados exactos y etiquetas anteriores distintas de la taxonomía final ('social and economic' frente a 'social and decision-making'). La interfaz permite buscar, filtrar y ordenar, aunque conserva una cita de arXiv en vez del artículo ACL, carece de estados de carga/error y recuento de resultados, usa claves de fila inexistentes y presenta carencias de teclado, modal y contraste. En conjunto, el trabajo es una taxonomía y lista de comprobación valiosa para diseñar evaluaciones, con confianza alta sobre lo que el PDF afirma y confianza moderada sobre la reproducibilidad y generalización de sus recomendaciones.