El artículo propone CoPE, una cadena que enlaza contexto de diálogo, estados de personalidad momentáneos y rasgos de largo plazo, y la convierte en dos tareas: EPR-S predice para cada diálogo una etiqueta Big Five y las intervenciones que la sustentan; EPR-T infiere el rasgo de un personaje a partir de varios diálogos y señala los diálogos usados como evidencia. La «explicación» es una justificación textual supervisada, resúmenes y descriptores derivados de BFI-2 junto con identificadores de evidencia, no una explicación causal del modelo ni una medición directa del constructo psicológico.
PersonalityEvd parte de CPED, un corpus chino de series de televisión. Tras descartar diálogos cortos, los autores seleccionan 72 personajes y hasta 30 diálogos por personaje. El conjunto final contiene 1.924 diálogos y 32.673 intervenciones. GPT-4 Turbo preanota cada dimensión; doce estudiantes de Psicología corrigen estados, dos estudiantes de posgrado inspeccionan la calidad y los autores hacen una revisión final. Aproximadamente el 30 % de las muestras se reanota. Otros seis estudiantes producen los rasgos: tres anotan independientemente cada personaje, consensúan la decisión, pueden modificar estados y convierten la media de doce ítems BFI-2 en etiquetas mediante una división por la mediana. También se eliminan diálogos con las cinco dimensiones inciertas o con información contradictoria.
En EPR-S, Qwen1.5-7B-Chat obtiene la mayor exactitud Big Five media, 66,45 %, frente al 64,62 % de ChatGLM3-6B-32K y el 62,09 % de GPT-4 Turbo en zero-shot. Los F1 de identificadores de evidencia son 75,94, 75,42 y 71,20. En EPR-T, evaluado con tres pliegues, ChatGLM alcanza 77,78 % de exactitud y 40,28 de F1 de evidencia; Qwen obtiene 76,59 % y 44,39. Estas exactitudes deben leerse junto al desequilibrio de la versión publicada: de 72 personajes, las etiquetas altas son 62 en apertura, 62 en responsabilidad, 70 en extraversión, 49 en amabilidad y 45 en neuroticismo. Elegir siempre la clase mayoritaria de cada dimensión daría una media aproximada del 80 %, superior a ambos resultados EPR-T. La exactitud bruta no prueba buen reconocimiento de rasgos.
La evaluación combina BERTScore, puntuaciones de Claude 3 Sonnet y GPT-4 Turbo, y una evaluación humana de 50 muestras de diez personajes con cinco evaluadores por muestra. La referencia recibe 4,61/5 en fluidez, 4,38 en coherencia y 4,31 en plausibilidad; ChatGLM obtiene 3,82/2,51/2,59 y Qwen 3,90/2,68/2,65. No se informa acuerdo, intervalos ni estrategia de muestreo, por lo que estas cifras apoyan calidad percibida alta en una muestra pequeña, pero no «garantizan» todo el corpus.
Las ablaciones matizan la afirmación de que generar evidencia mejora el reconocimiento. En estados, el ajuste directo obtiene 64,84 % y CoT 64,62 %; los esquemas híbridos llegan a 66,94 % y 66,55 %. En rasgos, CoT mejora de 75,83 % a 77,78 %, pero los esquemas híbridos quedan en 75,53 % y 75,55 %. Añadir estados predichos solo eleva la exactitud de rasgos de 77,78 % a 77,99 %; usar estados de referencia la sube a 83,52 %, pero son anotaciones no disponibles en uso real y ligadas al mismo proceso que produjo los rasgos.
El repositorio permite comprobar personajes, diálogos, particiones, etiquetas y parte del código. No contiene la traducción inglesa anunciada, resultados completos, checkpoints, un flujo ejecutable de extremo a extremo para los jueces, licencia del código/datos derivados ni releases. Muchos scripts conservan rutas locales o marcadores xxx; las dependencias de Qwen no están versionadas y no hay variabilidad entre semillas. La contribución defendible es un benchmark novedoso de evidencias anotadas sobre personajes ficticios chinos y baselines iniciales. No valida personalidad humana, estabilidad psicológica, explicaciones causales, generalización intercultural ni un sistema listo para perfilar usuarios reales.