Revealing Personality Traits: A New Benchmark Dataset for Explainable Personality Recognition on Dialogues

Evaluación y validez psicométrica2024ACL AnthologyRevisión editorial aprobada

Autores: Lei Sun, Jinming Zhao, Qin Jin

Palabras clave: Personality recognition, Explainable AI, Dialogue analysis, Personality traits, Machine learning, Chain-of-Personality-Evidence (CoPE)

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
13
Hallazgos
32
Limitaciones
14
Evidencias

Resumen editorial

Español

El artículo propone CoPE, una cadena que enlaza contexto de diálogo, estados de personalidad momentáneos y rasgos de largo plazo, y la convierte en dos tareas: EPR-S predice para cada diálogo una etiqueta Big Five y las intervenciones que la sustentan; EPR-T infiere el rasgo de un personaje a partir de varios diálogos y señala los diálogos usados como evidencia. La «explicación» es una justificación textual supervisada, resúmenes y descriptores derivados de BFI-2 junto con identificadores de evidencia, no una explicación causal del modelo ni una medición directa del constructo psicológico.

PersonalityEvd parte de CPED, un corpus chino de series de televisión. Tras descartar diálogos cortos, los autores seleccionan 72 personajes y hasta 30 diálogos por personaje. El conjunto final contiene 1.924 diálogos y 32.673 intervenciones. GPT-4 Turbo preanota cada dimensión; doce estudiantes de Psicología corrigen estados, dos estudiantes de posgrado inspeccionan la calidad y los autores hacen una revisión final. Aproximadamente el 30 % de las muestras se reanota. Otros seis estudiantes producen los rasgos: tres anotan independientemente cada personaje, consensúan la decisión, pueden modificar estados y convierten la media de doce ítems BFI-2 en etiquetas mediante una división por la mediana. También se eliminan diálogos con las cinco dimensiones inciertas o con información contradictoria.

En EPR-S, Qwen1.5-7B-Chat obtiene la mayor exactitud Big Five media, 66,45 %, frente al 64,62 % de ChatGLM3-6B-32K y el 62,09 % de GPT-4 Turbo en zero-shot. Los F1 de identificadores de evidencia son 75,94, 75,42 y 71,20. En EPR-T, evaluado con tres pliegues, ChatGLM alcanza 77,78 % de exactitud y 40,28 de F1 de evidencia; Qwen obtiene 76,59 % y 44,39. Estas exactitudes deben leerse junto al desequilibrio de la versión publicada: de 72 personajes, las etiquetas altas son 62 en apertura, 62 en responsabilidad, 70 en extraversión, 49 en amabilidad y 45 en neuroticismo. Elegir siempre la clase mayoritaria de cada dimensión daría una media aproximada del 80 %, superior a ambos resultados EPR-T. La exactitud bruta no prueba buen reconocimiento de rasgos.

La evaluación combina BERTScore, puntuaciones de Claude 3 Sonnet y GPT-4 Turbo, y una evaluación humana de 50 muestras de diez personajes con cinco evaluadores por muestra. La referencia recibe 4,61/5 en fluidez, 4,38 en coherencia y 4,31 en plausibilidad; ChatGLM obtiene 3,82/2,51/2,59 y Qwen 3,90/2,68/2,65. No se informa acuerdo, intervalos ni estrategia de muestreo, por lo que estas cifras apoyan calidad percibida alta en una muestra pequeña, pero no «garantizan» todo el corpus.

Las ablaciones matizan la afirmación de que generar evidencia mejora el reconocimiento. En estados, el ajuste directo obtiene 64,84 % y CoT 64,62 %; los esquemas híbridos llegan a 66,94 % y 66,55 %. En rasgos, CoT mejora de 75,83 % a 77,78 %, pero los esquemas híbridos quedan en 75,53 % y 75,55 %. Añadir estados predichos solo eleva la exactitud de rasgos de 77,78 % a 77,99 %; usar estados de referencia la sube a 83,52 %, pero son anotaciones no disponibles en uso real y ligadas al mismo proceso que produjo los rasgos.

El repositorio permite comprobar personajes, diálogos, particiones, etiquetas y parte del código. No contiene la traducción inglesa anunciada, resultados completos, checkpoints, un flujo ejecutable de extremo a extremo para los jueces, licencia del código/datos derivados ni releases. Muchos scripts conservan rutas locales o marcadores xxx; las dependencias de Qwen no están versionadas y no hay variabilidad entre semillas. La contribución defendible es un benchmark novedoso de evidencias anotadas sobre personajes ficticios chinos y baselines iniciales. No valida personalidad humana, estabilidad psicológica, explicaciones causales, generalización intercultural ni un sistema listo para perfilar usuarios reales.

English

The paper proposes CoPE, a chain linking dialogue context, momentary personality states, and long-term traits, and turns it into two tasks. EPR-S predicts a Big Five label for each dialogue and the supporting utterances; EPR-T infers a character's trait from multiple dialogues and identifies supporting dialogues. The “explanation” is a supervised textual rationale, summaries and BFI-2-derived descriptors plus evidence identifiers, not a causal model explanation or a direct measurement of a psychological construct.

PersonalityEvd is built from CPED, a Chinese television-series dialogue corpus. After excluding short dialogues, the authors select 72 characters and up to 30 dialogues per character. The final dataset contains 1,924 dialogues and 32,673 utterances. GPT-4 Turbo pre-annotates each dimension; twelve psychology undergraduates correct states, two graduate students inspect quality, and the authors perform a final review. About 30% of samples are re-annotated. Six other undergraduates produce trait annotations: three independently annotate each character, reach consensus, may alter state labels, and convert the mean of twelve BFI-2 items into labels through a median split. Dialogues with all five dimensions uncertain or with contradictory information are removed.

For EPR-S, Qwen1.5-7B-Chat has the highest mean Big Five accuracy at 66.45%, versus 64.62% for ChatGLM3-6B-32K and 62.09% for zero-shot GPT-4 Turbo. Evidence-ID F1 scores are 75.94, 75.42, and 71.20. For three-fold EPR-T, ChatGLM reaches 77.78% accuracy and 40.28 evidence-ID F1, while Qwen reaches 76.59% and 44.39. These accuracies must be read against the imbalance in the released data: among 72 characters, high labels occur 62 times for Openness, 62 for Conscientiousness, 70 for Extraversion, 49 for Agreeableness, and 45 for Neuroticism. Always selecting each dimension's majority class would average about 80%, above both EPR-T results. Raw accuracy therefore does not demonstrate effective trait recognition.

Evaluation combines BERTScore, Claude 3 Sonnet and GPT-4 Turbo ratings, plus a human evaluation of 50 samples from ten characters with five evaluators per sample. References score 4.61/5 for fluency, 4.38 for coherence, and 4.31 for plausibility; ChatGLM scores 3.82/2.51/2.59 and Qwen 3.90/2.68/2.65. No inter-rater agreement, uncertainty, or sampling strategy is reported, so the figures support high perceived quality in a small sample but do not “guarantee” the entire corpus.

The ablations qualify the claim that generating evidence improves recognition. For states, direct fine-tuning reaches 64.84% and CoT 64.62%; hybrid settings reach 66.94% and 66.55%. For traits, CoT improves from 75.83% to 77.78%, but hybrid settings remain at 75.53% and 75.55%. Adding predicted states raises trait accuracy only from 77.78% to 77.99%; reference states raise it to 83.52%, but these annotations are unavailable in real use and tied to the same process that produced trait labels.

The repository allows inspection of the characters, dialogues, splits, labels, and part of the code. It lacks the announced English translation, complete outputs, checkpoints, an end-to-end judge pipeline, a code/derivative-data license, and releases. Many scripts retain local paths or xxx placeholders; Qwen dependencies are unpinned, and seed variability is absent. The defensible contribution is a novel evidence-annotated benchmark over fictional Chinese characters and initial baselines. It does not validate human personality, psychological stability, causal explanations, cross-cultural generalization, or a system ready to profile real users.

Pregunta de investigación

¿Puede representarse el reconocimiento explicable de personalidad como una cadena desde diálogos concretos a estados Big Five y de estos a rasgos, y qué capacidad tienen varios LLM para predecir las etiquetas y recuperar la evidencia anotada en ambos niveles?

Método

Construcción de benchmark y evaluación supervisada. Se filtra CPED, se seleccionan 72 personajes de series chinas y se anotan 1.924 diálogos en cinco dimensiones. GPT-4 Turbo realiza una preanotación; estudiantes de Psicología y dos inspectores corrigen estados, evidencias y justificaciones. Otro grupo anota rasgos a partir de unos 30 diálogos y BFI-2, con tres anotadores por personaje y consenso. EPR-S usa una partición por hablantes 51/7/14 y EPR-T validación cruzada de tres pliegues de 24 personajes. ChatGLM3-6B-32K y Qwen1.5-7B-Chat se ajustan con LoRA; GPT-4 Turbo se evalúa en zero-shot solo para EPR-S. Se miden exactitud, F1 de identificadores, BERTScore y valoraciones de LLM y humanas. La revisión editorial leyó y renderizó las 15 páginas, auditó datos y código del repositorio oficial y recalculó distribuciones y baselines mayoritarios.

Muestra: PersonalityEvd contiene 72 personajes ficticios y 1.924 diálogos, 26,72 por personaje de media, con 32.673 intervenciones. EPR-S se divide por personajes en 51 de entrenamiento, 7 de validación y 14 de prueba, con 1.380, 181 y 363 diálogos. EPR-T contiene 360 decisiones dimensión-personaje en tres pliegues de 24 personajes. Solo cuatro etiquetas de rasgo son inciertas; 288 de las 360 son altas. La evaluación humana cubre 50 muestras de diez personajes y cinco evaluadores por muestra.

Hallazgos

  • El corpus publicado coincide con las cifras principales: 72 personajes, 1.924 diálogos y particiones EPR-S de 51/7/14 personajes con 1.380/181/363 diálogos.
  • Qwen logra la mayor exactitud media EPR-S, 66,45 %, seguido de ChatGLM con 64,62 % y GPT-4 zero-shot con 62,09 %.
  • Los F1 de identificación de intervenciones en EPR-S son 75,94 para Qwen, 75,42 para ChatGLM y 71,20 para GPT-4.
  • En EPR-T, ChatGLM alcanza 77,78 % de exactitud y 40,28 F1 de evidencia; Qwen alcanza 76,59 % y 44,39.
  • El archivo publicado contiene 288 etiquetas altas, 68 bajas y 4 inciertas en 360 decisiones de rasgo; extraversión tiene 70 altas y solo 2 bajas.
  • Un baseline que elige la clase mayoritaria de cada dimensión promedia aproximadamente 80 % de exactitud EPR-T, por encima de ambos modelos.
  • En EPR-S, el baseline mayoritario por dimensión en test promedia aproximadamente 59,50 %, por debajo de los tres LLM.
  • Las referencias humanas reciben 4,61/5 en fluidez, 4,38 en coherencia y 4,31 en plausibilidad; las generaciones quedan en 3,82–3,90, 2,51–2,68 y 2,59–2,65.
  • En estados, el híbrido directo mejora de 64,84 % a 66,94 %, mientras CoT puro baja ligeramente a 64,62 %.
  • En rasgos, CoT mejora de 75,83 % a 77,78 %, pero los esquemas híbridos quedan alrededor de 75,5 %.
  • Usar estados predichos eleva la exactitud de rasgos solo 0,21 puntos; los estados de referencia la elevan de 77,78 % a 83,52 %.
  • El repositorio conserva diálogos chinos, anotaciones y pliegues, pero no la traducción inglesa anunciada.
  • El código compila sintácticamente, pero requiere adaptar rutas, dependencias, modelos y artefactos ausentes para reproducir los experimentos.

Limitaciones

  • Los personajes proceden de guiones de televisión: son diálogos escritos y orientados narrativamente, no conducta espontánea de personas.
  • No existe autoinforme, informe de observadores cercanos ni otra medida psicométrica validada como criterio externo.
  • Las etiquetas son impresiones de anotadores sobre personajes ficticios, no rasgos psicológicos observados de individuos reales.
  • GPT-4 Turbo preanota todo el corpus, por lo que sus asociaciones, estilo y sesgos pueden anclar las correcciones humanas.
  • Cada muestra de estado la revisa inicialmente un solo anotador y solo alrededor del 30 % se reanota; no hay doble anotación completa.
  • No se publica ningún indicador de acuerdo entre anotadores para estados, rasgos o evidencia.
  • Los desacuerdos se resuelven por consenso o eliminación y los anotadores de rasgos pueden modificar estados; ambos niveles no son independientes.
  • Eliminar diálogos contradictorios y aquellos con las cinco dimensiones inciertas sesga el corpus hacia casos consistentes y con evidencia.
  • La división por mediana convierte dimensiones continuas en categorías y pierde diferencias de magnitud.
  • La definición permite rasgos inciertos, pero el procedimiento se describe como binario; el archivo liberado contiene cuatro inciertos.
  • El desequilibrio EPR-T es extremo: 70 de 72 personajes son altos en extraversión y 62 de 72 en apertura y responsabilidad.
  • No se informan baselines mayoritarios, balanced accuracy, macro-F1, sensibilidad por clase ni matrices de confusión.
  • Los dos modelos EPR-T quedan por debajo del baseline mayoritario medio derivado de las etiquetas liberadas.
  • EPR-T solo dispone de 72 personajes y 360 etiquetas; cada pliegue de prueba contiene 24 personajes.
  • No se publican intervalos, dispersión entre semillas ni pruebas estadísticas para comparar modelos y ablaciones.
  • La partición es por personaje, pero no se documenta separación por serie; tramas, interlocutores y estilos compartidos podrían filtrar entre conjuntos.
  • BERTScore puede premiar fórmulas similares a la referencia sin verificar que cada afirmación esté sustentada por el diálogo.
  • GPT-4 participa en preanotación y evaluación; Claude reduce, pero no elimina, la dependencia de jueces LLM.
  • Que Claude puntúe algo más alto no demuestra ausencia de sesgo de autoevaluación; falta calibración frente a humanos.
  • La evaluación humana usa 50 muestras de diez personajes, sin estratificación, acuerdo, varianza ni intervalos informados.
  • Las puntuaciones humanas de una muestra pequeña no garantizan la calidad de todo el corpus.
  • La evidencia textual es una justificación anotada y templada; no revela el proceso interno ni una explicación causal.
  • Los estados de referencia no están disponibles en uso real y están ligados al mismo pipeline que genera los rasgos.
  • Los estados predichos solo mejoran 0,21 puntos la exactitud de rasgos y la evidencia no ayuda en todas las configuraciones.
  • GPT-4 solo se evalúa en EPR-S; no hay comparación zero-shot equivalente en rasgos.
  • El corpus se limita a chino y personajes de series chinas; no evalúa otros idiomas, culturas o dominios.
  • La traducción inglesa anunciada no figura en el repositorio auditado ni se evalúa su fidelidad.
  • El repositorio no incluye licencia explícita para el código o los datos derivados, checkpoints, outputs completos ni llamadas de evaluación.
  • Muchos scripts contienen rutas absolutas o marcadores xxx; las dependencias Qwen no fijan versiones.
  • El artículo no reporta semillas ni repeticiones; ChatGLM usa 1234 en scripts, pero no se muestra robustez entre ejecuciones.
  • El repositorio no tiene tests, CI, release versionada ni documentación para una reproducción limpia.
  • Privacidad, consentimiento y daño por perfilado quedan abiertos si la técnica se traslada de personajes ficticios a usuarios.

Qué no demuestra

  • No demuestra que personajes, LLM o personas posean los rasgos Big Five asignados.
  • No valida las etiquetas como equivalentes a BFI-2 administrado a personas reales.
  • No demuestra estabilidad longitudinal; agrega impresiones de escenas de ficción.
  • No demuestra que una justificación sea causal o fiel al proceso interno del modelo.
  • No establece que CoPE sea una teoría psicológica validada.
  • No prueba que los modelos superen baselines triviales en EPR-T.
  • No demuestra superioridad global de GPT-4 o de los modelos ajustados.
  • No establece una mejora material de rasgos mediante estados predichos.
  • No demuestra generalización a personas, conversación espontánea, otros idiomas o culturas.
  • No justifica inferir personalidad de usuarios ni decisiones automatizadas sobre ellos.
  • No valida usos clínicos, educativos, laborales, crediticios, policiales o de selección.
  • No demuestra que jueces LLM midan verdad, calidad humana o ausencia de alucinación.
  • No ofrece reproducción completa de las cifras con un entorno ejecutable sin reparación.

Trazabilidad

Alcance: Texto completo

Versión: Proceedings of EMNLP 2024, pp. 19988–20002; DOI 10.18653/v1/2024.emnlp-main.1115; ACL Anthology ID 2024.emnlp-main.1115; CC BY 4.0

Fuente consultada: https://aclanthology.org/2024.emnlp-main.1115.pdf

Revisión: Codex full-text, visual, dataset, code and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • ChatGLM3-6B-32K fine-tuned with LoRA
  • Qwen1.5-7B-Chat fine-tuned with LoRA
  • GPT-4 Turbo 2024-04-09 as zero-shot EPR-S baseline
  • GPT-4 Turbo as dataset pre-annotator and evidence evaluator
  • Claude 3 Sonnet 2024-02-29 as evidence evaluator
  • Chinese BERT used through BERTScore

Instrumentos y métricas

  • Big Five Inventory-2 with five dimensions, fifteen facets and sixty items
  • Chain-of-Personality-Evidence annotation framework
  • Personality state labels: high, low or uncertain
  • Personality trait labels derived through BFI-2 scoring and median split
  • Evidence utterance and dialogue identifiers
  • Natural-language evidence summaries and personality descriptors
  • Accuracy and binary evidence-ID F1
  • BERTScore F1
  • Claude 3 Sonnet and GPT-4 Turbo evidence ratings from one to five
  • Human fluency, coherence and plausibility ratings

Datos utilizados

  • CPED Chinese personalized and emotional dialogue corpus
  • PersonalityEvd with 72 fictional television characters, 1,924 dialogues and 32,673 utterances
  • PersonalityEvd EPR-S speaker-disjoint train, validation and test annotations
  • PersonalityEvd EPR-T trait annotations and three speaker folds
  • Official PersonalityEvd repository at commit 1f41e8de94ae712ff3e2d0d3c75265d97494ef3e

Evidencia y localización

  • Metadatos, resumen, DOI, páginas y licencia: ACL Anthology 2024.emnlp-main.1115; final paper p. 19988; CC BY 4.0
  • Marco CoPE, estados, rasgos y tareas: Final paper, Figure 1, sections 1 and 4, pp. 19988–19993
  • Origen CPED, 72 personajes y 2.160 candidatos: Final paper, section 3.1, pp. 19990–19991
  • GPT-4 preanotador y corrección humana: Final paper, sections 3.3.1–3.3.2, pp. 19990–19992
  • Consenso de rasgos, modificación de estados y mediana: Final paper, section 3.4, p. 19992
  • Filtrado de inciertos y contradicciones: Final paper, section 3.3.2, p. 19992
  • Tamaño, estadísticas y particiones: Final paper, Table 1 and section 3.5, pp. 19992–19993; released dataset commit 1f41e8d
  • Modelos, métricas y resultados principales: Final paper, sections 4–5.2 and Table 2, pp. 19993–19994
  • Evaluación humana: Final paper, section 5.3 and Table 3, pp. 19994–19995
  • Ablaciones y estados como pistas: Final paper, section 5.4 and Tables 4–5, p. 19995
  • Limitaciones y ética declaradas: Final paper, Limitations and Ethics Statements, pp. 19995–19996
  • Distribución real y baseline mayoritario: Official repository commit 1f41e8d, released state and trait annotation JSON; recomputed 15 Jul 2026
  • Traducción, licencia y artefactos ausentes: Official PersonalityEvd repository commit 1f41e8de94ae712ff3e2d0d3c75265d97494ef3e; audited 15 Jul 2026
  • Rutas, dependencias y semillas: Official repository commit 1f41e8d, state and trait code; audited 15 Jul 2026