InCharacter: Evaluating Personality Fidelity in Role-Playing Agents through Psychological Interviews

Personas, identidad y agentes2024ACL AnthologyRevisión editorial aprobada

Autores: Xintao Wang, Yunze Xiao, Jen-tse Huang, Siyu Yuan, Rui Xu, Haoran Guo, Quan Tu, Yaying Fei, Ziang Leng, Wei Wang, Jiangjie Chen, Cheng Li, Yanghua Xiao

Palabras clave: role-playing agents, personality assessment, psychological scales, character fidelity, LLM evaluation, Big Five personality traits, psychometric testing, 16Personalities, LLM-as-a-judge

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

13
Autores
38
Hallazgos
60
Limitaciones
35
Evidencias

Resumen editorial

Español

InCharacter evalúa si agentes que interpretan personajes reproducen etiquetas de personalidad atribuidas a esos personajes. En lugar de pedir al agente que marque directamente un cuestionario, transforma los ítems de 14 escalas en preguntas abiertas, formula cada una en un contexto aislado y usa otro LLM para convertir las respuestas a opciones o puntuar una dimensión como supuesto experto. La validación previa compara GPT-3.5, GPT-4 y Gemini con juicios humanos en 100 casos BFI. GPT-4 obtiene 89 % de aciertos en expert rating y correlaciones de 0,925, 0,927 y 0,837 para Pearson, Spearman y Kendall; todavía discrepa en cuatro casos por más de un punto. El benchmark principal contiene 32 personajes populares: 16 configuraciones de ChatHaruhi y 16 de RoleLLM, normalmente ejecutadas sobre gpt-3.5-turbo-1106. Para BFI y 16Personalities, el tipo positivo o negativo procede de porcentajes de Personality Database, mientras que la distancia continua usa puntuaciones de 2–3 anotadores invitados por personaje. Con expert rating por lotes y GPT-4, la Tabla 2 reporta para BFI 76,6 % de precisión por dimensión, 31,2 % de personajes con todas las dimensiones correctas y 18,2 % de error absoluto normalizado; para 16Personalities, 80,7 %, 44,8 % y 20,5 %. Por tanto, el 80,7 % del abstract no significa que el 80,7 % de los personajes tenga su personalidad completa correctamente reproducida. En 14 escalas, usando GPT-3.5 como evaluador, la media publicada es 78,9 % por dimensión, 58,5 % de acierto completo y 8,1 % de error, pero la fiabilidad entre anotadores promedia κ = 0,609 y cae a 0,438 en EPQ-R, 0,473 en ECR-R y 0,463 en CABIN. La entrevista supera generalmente al autoinforme en las métricas elegidas y produce mediciones más dispersas entre personajes, aunque la comparación no es completamente simétrica: las negativas o respuestas no conformes del autoinforme se convierten en neutral, mientras los fallos de evaluación se regeneran y Gemini puede ser sustituido por GPT-4. El anonimizado oculta nombres pero no referencias narrativas que pueden revelar el personaje al evaluador. No hay evaluación de personas reales, conducta longitudinal ni una prueba de que estas escalas conserven validez de constructo al aplicarse a agentes. El repositorio oficial publica código, 14 cuestionarios y etiquetas agregadas bajo MIT, y el código compila; sin embargo, no incluye los 18.304 diálogos, resultados ni anotaciones individuales anunciados, las dependencias no están fijadas y la reproducción requiere modelos retirados, servicios externos y una API no oficial de 16Personalities. La evidencia respalda que el procedimiento discrimina configuraciones y se acerca parcialmente a etiquetas humanas bajo este benchmark; no demuestra una personalidad interna ni fidelidad general del personaje.

English

InCharacter evaluates whether role-playing agents reproduce personality labels attributed to their target characters. Instead of asking an agent to complete a questionnaire directly, it rewrites items from 14 scales as open-ended questions, asks each in an isolated context, and uses another LLM either to convert the answer back to an option or to score a dimension as a simulated expert. A preliminary validation compares GPT-3.5, GPT-4, and Gemini with human judgments on 100 BFI cases. GPT-4 reaches 89% accuracy in expert rating and Pearson, Spearman, and Kendall correlations of 0.925, 0.927, and 0.837, while still differing by more than one point in four cases. The main benchmark covers 32 popular characters: 16 ChatHaruhi and 16 RoleLLM configurations, normally run on gpt-3.5-turbo-1106. For BFI and 16Personalities, positive or negative types come from Personality Database vote percentages, whereas continuous distances use scores from two or three invited annotators per character. With batched expert rating and GPT-4, Table 2 reports 76.6% dimension accuracy, 31.2% all-dimensions accuracy, and 18.2% normalized absolute error for BFI; corresponding 16Personalities results are 80.7%, 44.8%, and 20.5%. Thus, the abstract's 80.7% does not mean that 80.7% of characters have their entire personality reproduced correctly. Across 14 scales using GPT-3.5 as evaluator, published averages are 78.9% per dimension, 58.5% full accuracy, and 8.1% error, but mean inter-annotator reliability is κ = 0.609 and falls to 0.438 for EPQ-R, 0.473 for ECR-R, and 0.463 for CABIN. Interview methods generally outperform self-report on the selected metrics and yield more dispersed character measurements, although the comparison is asymmetric: refusals or non-compliant self-reports are mapped to neutral, while evaluator failures are regenerated and Gemini may be replaced by GPT-4. Name masking also leaves narrative clues that may reveal the character to the evaluator. The study contains no real-person assessment, longitudinal behavior, or test of whether the scales retain construct validity when applied to agents. The official repository publishes compilable code, 14 questionnaires, and aggregated labels under MIT, but it does not contain the announced 18,304 dialogues, result files, or individual annotations; dependencies are unpinned, and reproduction requires retired model snapshots, external services, and an unofficial 16Personalities API. The evidence supports partial agreement with human labels and discrimination among configurations within this benchmark; it does not establish internal personality or general character fidelity.

Pregunta de investigación

¿Puede la personalidad de un agente de rol medirse con mayor fidelidad mediante preguntas abiertas derivadas de escalas psicológicas y valoración posterior por otro LLM que mediante autoinforme directo, y hasta qué punto las mediciones resultantes coinciden con etiquetas humanas de los personajes objetivo?

Método

InCharacter consta de entrevista y evaluación. Un LLM reescribe y los autores verifican manualmente cada ítem como pregunta abierta; el RPA contesta cada pregunta en un contexto independiente. Después, un LLM evaluador aplica conversión de opción, conversión específica por dimensión o expert rating sobre lotes de 3–4 respuestas o todas las respuestas de una dimensión. La capacidad del evaluador se contrasta con 100 juicios humanos BFI. El estudio ejecuta tres repeticiones de varios métodos sobre 32 RPA de ChatHaruhi y RoleLLM, compara puntuaciones con tipos de Personality Database y anotaciones invitadas, y calcula precisión por dimensión, acierto completo, MAE normalizado y tres medidas de variación. Extiende el análisis a 14 escalas, modelos base, fuentes de datos de personaje, idiomas, adaptación de preguntas y autoinforme con ejemplos in-context.

Muestra: El benchmark principal usa 32 personajes seleccionados por disponibilidad de RPA y de al menos diez anotaciones en Personality Database, diversidad de tipos y comprobación manual de identidad; 16 proceden de ChatHaruhi y 16 de RoleLLM. Seis personajes ChatHaruhi usan datos e entrevista en chino y el resto en inglés. Cada método BFI/16P se repite tres veces. Para las etiquetas propias, entre dos y tres estudiantes familiarizados con cada personaje aportan 93 anotaciones completas en total, cada una con 73 dimensiones de 14 escalas. La validación del LLM entrevistador usa 100 casos BFI manualmente juzgados. No participan personas como sujetos evaluados ni se observan usuarios interactuando con los RPA.

Hallazgos

  • InCharacter mide la coincidencia entre salidas de agentes condicionados y etiquetas atribuidas a personajes; no administra un test a personas reales.
  • La entrevista convierte ítems cerrados en preguntas abiertas y mantiene cada pregunta en un contexto aislado para evitar interferencia entre ítems.
  • La fase de evaluación ofrece conversión de opción, conversión con opciones descriptivas por dimensión y expert rating directo.
  • El expert rating por lotes agrupa normalmente tres o cuatro pares pregunta-respuesta de una dimensión.
  • El anonimizado sustituye nombres del personaje y experimentador antes de la evaluación, pero conserva el resto del contenido narrativo.
  • En 100 casos BFI, la conversión de opción con GPT-4 alcanza 71,0 % de acierto y Pearson 0,600.
  • La conversión específica por dimensión con GPT-4 mejora a 82,0 % y Pearson 0,847.
  • El expert rating por lotes con GPT-4 obtiene 89,0 % y correlaciones Pearson 0,925, Spearman 0,927 y Kendall 0,837.
  • En el expert rating, 82 de 100 juicios GPT-4 son considerados correctos, 14 difieren exactamente un punto y 4 difieren más de un punto según el desglose del apéndice.
  • El benchmark principal usa tipos de PDb para exactitud y puntuaciones invitadas para error continuo en BFI y 16P.
  • Con ER por lotes y GPT-4, BFI obtiene 76,6 % de precisión por dimensión, 31,2 % completa y MAE 18,2 %.
  • Con la misma configuración, 16P obtiene 80,7 % por dimensión, 44,8 % completa y MAE 20,5 %.
  • La precisión completa de 16P es 36 puntos inferior a la precisión por dimensión destacada en el abstract.
  • En BFI, el mejor autoinforme de la tabla ronda 63,7 % por dimensión y 7,3 % completo, por debajo del ER.
  • En 16P, el autoinforme alcanza como máximo 66,1 % por dimensión y 22,9 % completo en la tabla principal.
  • d-OC con GPT-4 logra 80,2 % por dimensión y 45,8 % completo en 16P, mostrando que la mejor métrica completa no procede de ER.
  • Las mediciones ER presentan mayor dispersión entre personajes en la PCA que las de autoinforme.
  • La varianza estandarizada media de los perfiles BFI es 1,03 para ER por lotes, frente a 0,71 para SR y 0,68 para SR-CoT.
  • En las 14 escalas con ER por lotes y GPT-3.5, la media publicada es 78,9 % por dimensión, 58,5 % completa y MAE 8,1 %.
  • El promedio de 78,9 % combina escalas con números de dimensiones y dificultades muy diferentes.
  • La exactitud por dimensión varía desde 68,2 % en ECR-R hasta 93,1 % en GSE dentro de la Tabla 12.
  • CABIN obtiene 75,5 % por dimensión, pero solo 6,3 % de acierto completo debido a sus 41 dimensiones.
  • La concordancia media entre anotadores es κ = 0,609 en las 14 escalas.
  • BFI y 16P presentan kappas de 0,759 y 0,770, mientras EPQ-R, ECR-R y CABIN quedan por debajo de 0,48.
  • Con etiquetas PDb se obtiene mayor exactitud; con etiquetas invitadas se obtiene menor MSE, por lo que las dos fuentes no son intercambiables.
  • Las descripciones de personaje por sí solas logran resultados cercanos a combinar descripciones y memorias en varias condiciones.
  • Los RPA basados en GPT-3.5 y GPT-4 ofrecen la mayor fidelidad de personalidad entre las familias comparadas.
  • GPT-4 no supera consistentemente a GPT-3.5 en todas las métricas ni grupos de personajes.
  • Los modelos abiertos muestran diferencias importantes entre personajes ingleses y chinos; Llama-2-Chat 13B es competitivo en inglés y débil en chino.
  • El ajuste incremental de RP-Mistral-2 reduce algunos problemas de rol, pero aporta mejoras limitadas de fidelidad frente a bases ya fuertes.
  • Los RPA de character.ai quedan por debajo de configuraciones GPT-3.5 comparables en este benchmark.
  • En una muestra de respuestas character.ai convertidas por GPT-4, 65,8 % son agree o strongly agree y 17,1 % disagree o strongly disagree.
  • Adaptar siete preguntas 16P potencialmente anacrónicas por personaje mejora la precisión dimensional de 80,7 a 81,8 y la completa de 44,8 a 46,9.
  • Los ejemplos in-context generales empeoran SR y SR-CoT, algo que los autores atribuyen a interferencia de personalidades no personalizadas.
  • Los autores declaran consentimiento informado, compensación superior al salario mínimo local y protección de privacidad para los anotadores.
  • El repositorio actual tiene licencia MIT, incluye los 14 cuestionarios y etiquetas agregadas de los 32 personajes, y sus archivos Python compilan.
  • El repositorio no contiene resultados, diálogos de entrevista ni anotaciones individuales que permitan recalcular las tablas.
  • El artículo fue publicado en ACL 2024, páginas 1840-1873, DOI 10.18653/v1/2024.acl-long.102.

Limitaciones

  • La variable llamada personalidad es una concordancia con etiquetas externas del personaje, no una validación de personalidad interna del agente.
  • Los personajes son ficcionales y sus personalidades no tienen una verdad objetiva única.
  • Personality Database es una plataforma abierta; el estudio no controla quién vota, su conocimiento del personaje, duplicados o sesgos de fandom.
  • La selección exige disponibilidad y popularidad en PDb, lo que favorece personajes conocidos y con identidades estereotipadas.
  • Los 32 personajes se eligen para cubrir tipos PDb y no constituyen una muestra aleatoria de personajes o RPA.
  • El benchmark mezcla franquicias, versiones narrativas e instantáneas temporales; una etiqueta estática puede no representar toda la evolución del personaje.
  • Para BFI y 16P se usan tipos PDb para exactitud y puntuaciones invitadas para MAE, de modo que una fila se juzga contra dos referencias diferentes.
  • Los porcentajes PDb se convierten a alto por encima de 60 %, bajo por debajo de 40 % y marginal en medio; los umbrales son una decisión del estudio.
  • Las dimensiones marginales se excluyen de la exactitud y pueden retirar precisamente los casos más ambiguos.
  • Solo dos o tres anotadores invitados evalúan cada personaje; 93 anotaciones cubren 32 personajes.
  • Los anotadores puntúan 73 dimensiones, una carga extensa que puede introducir fatiga y respuestas superficiales.
  • No se publican las anotaciones individuales, desacuerdos, tiempos ni racionales; solo promedios agregados.
  • La concordancia media κ = 0,609 es moderada y tres escalas quedan por debajo de 0,48.
  • ECR-R evalúa relaciones románticas y CABIN intereses profesionales que rara vez se representan en las obras, como reconocen los autores.
  • La escala de mentira de EPQ-R es ambigua para personajes y contribuye a una concordancia baja.
  • 16Personalities es una herramienta propietaria inspirada en MBTI, no una equivalencia validada del MBTI ni una escala abierta reproducible.
  • El código envía las 60 respuestas a endpoints web de 16Personalities no documentados como API pública, que pueden cambiar o imponer condiciones externas.
  • Transformar ítems cerrados en preguntas abiertas cambia la administración y puede alterar el constructo que mide la escala.
  • Aunque las preguntas transformadas se revisan manualmente, no se informa un estudio de equivalencia semántica o psicométrica ítem a ítem.
  • Cada pregunta se realiza en un contexto aislado; el procedimiento no es una entrevista adaptativa con seguimiento, aclaraciones o historial compartido.
  • El expert rating simula a un evaluador mediante un LLM, no mediante un profesional clínico o psicometrista.
  • La validación del evaluador usa solo 100 casos BFI y no se repite en las otras trece escalas.
  • No se especifica un conjunto independiente de personajes para validar el evaluador y luego medir el benchmark principal.
  • Las correlaciones de la Tabla 1 carecen de intervalos de confianza, pruebas de hipótesis y análisis por personaje o dimensión.
  • El criterio de acierto de menos de un punto y medio acierto a exactamente un punto es una regla discreta cuya sensibilidad no se analiza.
  • GPT-4 aún produce cuatro errores mayores a un punto en 100 casos de expert rating.
  • El anonimizado sustituye nombres por texto, pero respuestas como Liyue, Geo Archon, Hogwarts o citas del personaje pueden revelar la identidad al evaluador.
  • Un evaluador preentrenado puede conocer tanto al personaje como estereotipos y etiquetas populares, produciendo acuerdo por memoria y no por evidencia de la entrevista.
  • La sustitución textual de alias es ingenua, sensible a mayúsculas y contexto y puede borrar o conservar fragmentos incorrectamente.
  • El código añade alias detectados a listas globales compartidas, lo que puede acumular sustituciones entre ejecuciones.
  • Las respuestas no conformes del autoinforme se asignan a neutral en vez de tratarse como datos ausentes o fallos del método.
  • Los resultados de entrevista se regeneran cuando falla el JSON y usan temperatura 0,2 en regeneraciones, un tratamiento más favorable que el neutral forzado del autoinforme.
  • Cuando Gemini falla repetidamente o bloquea una respuesta, el código recurre a GPT-4; una cifra etiquetada como Gemini puede incluir decisiones de otro modelo.
  • GPT-3.5 divide lotes que exceden el límite de tokens, por lo que el contexto del evaluador varía según modelo y escala.
  • Las tres repeticiones no se acompañan de intervalos de confianza ni pruebas estadísticas de diferencias entre métodos o modelos.
  • La afirmación de que GPT-4 no supera significativamente a GPT-3.5 no viene acompañada de una prueba de significación descrita.
  • AccDim pondera cada dimensión evaluable, AccFull exige acertarlas todas y MAE usa puntuaciones continuas; destacar solo una puede cambiar la conclusión.
  • El 80,7 % destacado es precisión dimensional de una única configuración 16P y no fidelidad completa de personajes.
  • El promedio de 78,9 % sobre 14 escalas asigna el mismo peso a instrumentos con una, dos, cinco o 41 dimensiones.
  • Algunas escalas de una dimensión tienen AccFull idéntica a AccDim, mientras CABIN sufre una penalización combinatoria, lo que limita la comparabilidad del promedio completo.
  • La PCA y la mayor dispersión muestran diferenciación entre salidas, pero una personalidad más dispersa no implica mayor validez.
  • Los RPA principales dependen de descripciones y recuerdos curados por ChatHaruhi o RoleLLM; no se separa completamente la calidad del dato, el modelo y el método de evaluación.
  • Seis personajes usan chino y el resto inglés; los tamaños por idioma y franquicia son pequeños para generalizar efectos lingüísticos.
  • Los modelos y snapshots de API son de finales de 2023 y pueden haber sido retirados o modificados.
  • El experimento de character.ai depende de un sistema cerrado, descripciones privadas y condiciones no controlables.
  • La adaptación de preguntas usa GPT-4 y conocimiento del personaje, introduciendo otra capa de juicio automático y posible fuga de información.
  • La mejora por adaptación de 1,1 puntos dimensionales y 2,1 puntos completos no incluye incertidumbre.
  • No se estudia si los agentes mantienen el perfil a lo largo de sesiones extensas, eventos nuevos, memoria cambiante o relaciones continuadas.
  • No hay evaluación humana de la calidad, naturalidad o fidelidad de las respuestas abiertas generadas en el benchmark principal.
  • No se vinculan las puntuaciones de escala con decisiones o conductas del personaje en tareas externas.
  • El análisis no cubre seguridad de los RPA, daño por estereotipos, suplantación, parasocialidad o efectos sobre usuarios.
  • El DTDD puede provocar contenido dañino y el artículo reconoce la necesidad de salvaguardas, pero no implementa ni evalúa controles.
  • La sección ética no informa aprobación institucional, procedimiento de exclusión, cuantía exacta ni características demográficas de anotadores.
  • El repositorio no contiene los 18.304 diálogos cuya liberación anuncia el artículo y la página del proyecto.
  • Tampoco contiene las salidas por repetición ni scripts que reconstruyan directamente todas las tablas y figuras publicadas.
  • requirements.txt no fija versiones de la mayoría de dependencias y no existe lockfile, entorno contenedorizado ni CI.
  • El archivo llamado test_rpa_methods.py ejecuta experimentos con servicios externos; no es una suite de pruebas automatizadas.
  • La reproducción requiere claves, descargas externas, servicios propietarios y endpoints que no se pueden congelar en el artefacto.
  • El código usa cachés pickle y rutas relativas dependientes de ejecutar desde code, sin validación de integridad ni procedencia de resultados.
  • Diversas rutas de error entran en pdb interactivo o sustituyen resultados por valores neutrales, lo que dificulta ejecuciones no supervisadas y auditables.

Qué no demuestra

  • No demuestra que los RPA posean personalidad, identidad, emociones, cognición o experiencia subjetiva.
  • No demuestra que las escalas psicológicas mantengan validez de constructo cuando sus sujetos son modelos generativos.
  • No establece una personalidad verdadera y única para cada personaje ficcional.
  • No demuestra que las etiquetas de Personality Database sean un patrón oro libre de sesgo.
  • No prueba que un 80,7 % de personajes esté completamente bien representado.
  • No prueba que el 80,7 % sea general a otras escalas, evaluadores, prompts o modelos.
  • No demuestra que expert rating sea equivalente a una entrevista realizada por psicólogos.
  • No elimina la dependencia de un LLM juez ni sus sesgos, conocimiento previo y errores.
  • No demuestra que el anonimizado impida identificar al personaje a partir de la respuesta.
  • No separa acuerdo basado en el contenido entrevistado de acuerdo basado en conocimiento memorizado del personaje.
  • No establece causalmente que las entrevistas abiertas sean superiores en condiciones iguales al autoinforme, dado el tratamiento asimétrico de fallos.
  • No demuestra que mayor dispersión PCA corresponda a mayor fidelidad psicológica.
  • No demuestra estabilidad temporal o consistencia multivuelta del perfil medido.
  • No demuestra transferencia desde puntuaciones de cuestionario a acciones, decisiones, diálogo prolongado o relaciones.
  • No demuestra validez para personajes menos populares, originales, históricos o personas reales.
  • No demuestra generalización robusta entre inglés, chino y otros idiomas o culturas.
  • No establece que GPT-4 sea siempre mejor que GPT-3.5 como agente o evaluador.
  • No valida 16Personalities como sustituto del MBTI ni sus etiquetas como diagnóstico.
  • No valida DTDD, EPQ-R, ECR-R o CABIN para inferencias clínicas sobre agentes o usuarios.
  • No demuestra que los RPA de character.ai sean globalmente peores; evalúa una muestra y una instantánea cerrada bajo este protocolo.
  • No demuestra que adaptar preguntas mejore materialmente todos los personajes o escalas.
  • No permite reproducir de forma exacta las tablas sin los diálogos, resultados, anotaciones individuales y servicios históricos ausentes.
  • No justifica usar el sistema para salud mental, evaluación de personas, educación, empleo o decisiones de alto impacto.
  • No demuestra que la fidelidad medida sea segura, deseable o beneficiosa para usuarios.

Trazabilidad

Alcance: Texto completo

Versión: ACL 2024 final proceedings paper, pp. 1840-1873, DOI 10.18653/v1/2024.acl-long.102, 34 pages; official code at paper-era commit cb2cfff96d6dd39c8b6fab2a470371c1f92ba25c and current commit f554202a94d4a83dc5407245bb18981899e872e6

Fuente consultada: https://aclanthology.org/2024.acl-long.102.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, psychometric, LLM-judge, annotation-quality, experimental-design, metric-interpretation, code, reproducibility, privacy and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • gpt-3.5-turbo-1106 como modelo base de los RPA principales y como evaluador
  • gpt-4-1106-preview como evaluador y modelo base
  • Gemini Pro como evaluador
  • Qwen1.5-110B-Chat como evaluador
  • Qwen 7B
  • OpenChat 3.5 7B
  • Mistral-2 7B
  • Llama-2-Chat 13B
  • Mixtral 8x7B
  • CharacterGLM 6B
  • RP-Qwen 7B
  • RP-Mistral-2 7B
  • character.ai RPAs
  • ChatHaruhi
  • RoleLLM

Instrumentos y métricas

  • Big Five Inventory (BFI)
  • 16Personalities / NERIS Type Explorer
  • Bem Sex Role Inventory (BSRI)
  • Dark Triad Dirty Dozen (DTDD)
  • Experiences in Close Relationships-Revised (ECR-R)
  • Emotional Intelligence Scale (EIS)
  • Empathy Scale
  • Eysenck Personality Questionnaire-Revised (EPQ-R)
  • General Self-Efficacy Scale (GSE)
  • Implicit Culture Belief (ICB)
  • Love of Money Scale (LMS)
  • Life Orientation Test-Revised (LOT-R)
  • Wong and Law Emotional Intelligence Scale (WLEIS)
  • Comprehensive Assessment of Basic Interests (CABIN)
  • Cohen's quadratic-weighted kappa
  • Pearson, Spearman and Kendall agreement
  • Dimension accuracy, full accuracy and normalized MAE
  • Item-, dimension- and score-level standard deviation

Datos utilizados

  • 32 selected fictional-character configurations: 16 from ChatHaruhi and 16 from RoleLLM
  • Personality Database crowd labels for BFI and 16Personalities
  • 93 invited annotation sets covering 73 dimensions and 14 scales for 32 characters
  • 100 manually judged BFI cases for interviewer-LLM validation
  • ChatHaruhi character descriptions and memories
  • RoleLLM character descriptions and memories
  • ChatHaruhi-English-62K used for RP-Mistral-2 fine-tuning
  • Official repository questionnaires and aggregated characters_labels.json
  • Announced collection of 18,304 interview dialogues, not found in the audited official release

Evidencia y localización

  • Registro bibliográfico oficial: ACL Anthology 2024.acl-long.102: 13 authors, ACL 2024, pp. 1840-1873, DOI 10.18653/v1/2024.acl-long.102
  • Fuente completa auditada: .cache/editorial-sources/article-094/source.pdf; official ACL PDF; 34 pages; sha256 85ba41b1a78e6b1f7e99b32757d63d96e9cf3b76eea33d821e3dd9d92b8ae098
  • Objetivo y contribuciones: Full text pp. 1840-1841, Abstract and Introduction
  • Dos fases de InCharacter: Full text pp. 1841-1843, sections 3.1-3.2 and Figure 2
  • Preguntas abiertas y contextos aislados: Full text p. 1842, Constructing Question List and Interviewing RPAs
  • Conversión de opción, d-OC y expert rating: Full text pp. 1842-1843, Assessment
  • Anonimización declarada: Full text p. 1843, paragraph before Experimental Setup
  • Validación humana del evaluador: Full text p. 1843, section 4.1 and Table 1; 100 BFI cases
  • Resultados del evaluador GPT-4: Full text p. 1843, Table 1; Appendix p. 1859, Table 8
  • Selección de 32 personajes: Full text p. 1844, RPAs and Characters; Appendix p. 1855, Character Selection
  • Modelos y snapshots: Full text p. 1844, Interviewer LLMs and footnote 8
  • Catorce escalas: Full text p. 1844, Psychological Scales; Appendix pp. 1852-1854
  • Fuentes de etiquetas: Full text p. 1844, Personality Labels; Appendix pp. 1857-1858, Human Annotations
  • Noventa y tres anotaciones: Full text p. 1844 and Appendix p. 1857: 2-3 annotators per character, 93 annotation sets, 73 dimensions
  • Concordancia entre anotadores: Appendix p. 1857, Table 6: mean quadratic-weighted kappa 60.9%
  • Métricas de alineación y consistencia: Full text pp. 1844-1845, Metrics
  • Comparación principal BFI y 16P: Full text pp. 1845-1846, Table 2
  • Diferencia entre AccDim y AccFull: Full text p. 1846, Table 2: ERbatch GPT-4 16P 80.7 versus 44.8
  • Diferenciación frente a autoinforme: Full text pp. 1845-1846, Figure 3; Appendix p. 1859, section F.2
  • Resultados en catorce escalas: Full text pp. 1846-1847, Figure 4; Appendix p. 1861, Table 12
  • Comparación de datos y modelos base: Full text p. 1847, Table 3; Appendix pp. 1859-1860, Tables 9-11
  • Sensibilidad al idioma: Appendix p. 1860, Table 10
  • Comportamiento complaciente de character.ai: Full text p. 1847; Appendix p. 1866, section H.2 and Table 20
  • Adaptación específica de preguntas: Appendix p. 1863, section F.7 and Table 16
  • ICL empeora autoinforme: Appendix pp. 1863-1864, section F.8 and Table 17
  • Tratamiento de rechazos y reintentos: Appendix p. 1858, Implementation Details; official code personality_tests.py and utils.py
  • Limitaciones reconocidas: Full text p. 1848, Limitations
  • Anotación, consentimiento y riesgos: Full text pp. 1848-1849, Ethical Statement
  • Prompts de evaluación: Appendix p. 1865, Table 19
  • Código oficial y commits auditados: GitHub Neph0s/InCharacter, paper-era cb2cfff96d6dd39c8b6fab2a470371c1f92ba25c and current f554202a94d4a83dc5407245bb18981899e872e6
  • Alcance del artefacto publicado: Official repository tree contains 14 questionnaire JSON files, characters metadata and aggregated labels; no results directory, interview dialogues or individual annotations
  • Reproducibilidad del entorno: Official repository requirements.txt is largely unpinned; no lockfile, CI or automated unit tests; compileall passes
  • Dependencia de 16Personalities: Official code api_16personality.py posts responses to 16personalities.com test-results and reads its session endpoint
  • Tratamiento asimétrico de errores: Official code personality_tests.py maps noncompliant self-reports to neutral; utils.py regenerates evaluator JSON and can fall back from Gemini to GPT-4
  • Lectura y comprobación visual integral: All 34 pages rendered and inspected, including Figures 1-7, Tables 1-28, ethical statement, prompts and example responses; checked 15 Jul 2026