Emotion Recognition in Conversation via Dynamic Personality

Aplicaciones, sesgos y seguridad2024ACL AnthologyRevisión editorial aprobada

Autores: Yan Wang, Bo Wang, Yachao Zhao, Dongming Zhao, Xiaojia Jin, Jijun Zhang, Ruifang He, Yuexian Hou

Palabras clave: Emotion Recognition, Dynamic Personality, Big Five Personality

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

8
Autores
6
Hallazgos
22
Limitaciones
10
Evidencias

Resumen editorial

Español

ERC-DP es un clasificador de emociones conversacionales que añade una representación binaria de Big Five inferida del texto; no es un LLM ni una validación psicométrica de estados de personalidad. Primero entrena un clasificador BERT sobre 2.468 ensayos etiquetados con cinco rasgos. Para cada intervención de MELD, EmoryNLP o IEMOCAP concatena la intervención actual con las anteriores del mismo hablante y predice cinco valores 0/1. Esos valores se convierten en una frase como “this person is open, not conscientious...”. Un codificador SimCSE procesa el prompt junto con contexto pasado, actual y futuro, y un MLP predice la emoción.

En weighted F1, ERC-DP obtiene 67,34 en MELD, 40,10 en EmoryNLP y 69,64 en IEMOCAP. Frente a la ablación sin personalidad, las diferencias son +0,64, +1,00 y +1,50 puntos; frente al perfil estático, +0,26, +0,63 y +0,62. El modelo supera el mejor valor listado en MELD por 0,23 puntos. En EmoryNLP, la tabla muestra 40,10 frente a 40,01, una ventaja de 0,09 puntos, aunque el texto afirma erróneamente 0,99. En IEMOCAP no alcanza el mejor resultado: BERT-ERC obtiene 71,70, 2,06 puntos más. La frase “improvement of 69.64%” confunde la puntuación del modelo con una mejora. No hay semillas, desviaciones, intervalos, tests o ejecuciones repetidas que permitan interpretar las diferencias pequeñas como estadísticamente significativas.

La interpretación psicológica es mucho más débil que la mejora de clasificación. Los ensayos tienen etiquetas de rasgo a nivel de autor, mientras ERC-DP aplica el clasificador a ventanas breves y llama “estado de personalidad” a su salida. No se administra una medida de estado, no hay seguimiento intraindividual ni se valida que cambiar la ventana corresponda a cambio psicológico. Además, el clasificador de rasgos ve la propia frase cuya emoción se quiere predecir y esa información vuelve a entrar como prompt: la ganancia puede proceder de recodificar indicios léxicos de emoción, no de personalidad. La comparación estática/dinámica también cambia el contexto temporal y su longitud.

La comprobación humana selecciona cien ejemplos de forma descrita ambiguamente y publica porcentajes de acuerdo por rasgo entre 63,4 % y 84,6 %. No informa número de evaluadores, entrenamiento, rúbrica, agregación, acuerdo interevaluador, incertidumbre ni revisión ética; solo indica anonimato y 5 dólares por hora. El código oficial auditado en 73da90f3770d5e8ef8c94a8c636a2bb346f8defd no reproduce el paper: faltan model.py, train.py, loaddata.py, vocab, datasets, checkpoints, configuración y resultados; todas las rutas están vacías y epochs no existe. Además, selecciona posiciones de token como si fueran capas ocultas y carga el mismo checkpoint vacío para los cinco rasgos. Por tanto, el trabajo aporta una hipótesis de ingeniería sobre prompts derivados del contexto, pero no demuestra que mida personalidad dinámica real.

English

ERC-DP is a conversational emotion classifier augmented with a text-inferred, binary Big Five representation; it is neither an LLM nor a psychometric validation of personality states. A BERT classifier is first trained on 2,468 essays labeled with five traits. For each MELD, EmoryNLP, or IEMOCAP utterance, the current utterance is concatenated with earlier utterances from the same speaker and five 0/1 values are predicted. These values become a sentence such as “this person is open, not conscientious...”. A SimCSE encoder processes that prompt with past, current, and future context, and an MLP predicts emotion.

ERC-DP reports weighted F1 of 67.34 on MELD, 40.10 on EmoryNLP, and 69.64 on IEMOCAP. Relative to the no-personality ablation, the gains are .64, 1.00, and 1.50 points; relative to the static profile, .26, .63, and .62. It exceeds the best listed MELD baseline by .23 points. On EmoryNLP, the table shows 40.10 versus 40.01, a .09-point advantage, although the text incorrectly claims .99. On IEMOCAP it is not best: BERT-ERC scores 71.70, 2.06 points higher. The phrase “improvement of 69.64%” mistakes the model score for an improvement. No seeds, deviations, intervals, tests, or repeated runs support treating the small differences as statistically significant.

The psychological interpretation is much weaker than the classification result. Essays supplies author-level trait labels, but ERC-DP applies that classifier to short conversational windows and calls its output a “personality state.” It administers no state measure, follows no person longitudinally, and does not validate that a changed text window represents psychological change. The trait classifier also sees the very utterance whose emotion is predicted, and its transformed output is fed back as a prompt. Gains may therefore come from recoding lexical emotion cues rather than personality. Static and dynamic conditions also differ in temporal window and length.

A human check ambiguously samples one hundred examples and reports per-trait agreement from 63.4% to 84.6%, but gives no evaluator count, training protocol, rubric, aggregation rule, inter-rater reliability, uncertainty, or ethics review; it only states anonymization and $5/hour compensation. The official code at 73da90f3770d5e8ef8c94a8c636a2bb346f8defd cannot reproduce the paper: model.py, train.py, loaddata.py, vocab, datasets, checkpoints, configuration, and results are absent; paths are blank and epochs is undefined. It also indexes token positions as though they were hidden layers and loads the same blank checkpoint for all five traits. The work is therefore an engineering hypothesis about context-derived prompts, not evidence that it measures real dynamic personality.

Pregunta de investigación

¿Puede mejorar el reconocimiento de emociones en conversaciones si se infiere para cada intervención un vector Big Five a partir de la intervención actual y el historial previo del mismo hablante, y se incorpora como prompt al clasificador?

Método

Se ajusta un clasificador BERT multietiqueta con los rasgos binarios del corpus Essays. Para cada intervención se concatena el turno actual con los turnos anteriores del mismo hablante y se infiere un vector Big Five binario. El vector se verbaliza con adjetivos positivos o negados y se inserta junto al contenido conversacional. SimCSE codifica contexto pasado, consulta y futuro; sus medias se concatenan y un MLP con focal loss clasifica la emoción. Se compara weighted F1 con resultados publicados y con ablaciones sin personalidad, personalidad estática y personalidad dinámica. Una comprobación manual compara predicciones Big Five con anotaciones humanas.

Muestra: El clasificador de rasgos se entrena con 2.468 ensayos anónimos. MELD aporta 1.038/114/280 conversaciones y 9.989/1.109/2.610 intervenciones en train/val/test. EmoryNLP aporta 713/99/85 conversaciones y 9.934/1.344/1.328 intervenciones. Para IEMOCAP la tabla informa 120 conversaciones y 5.810 intervenciones de train, y 31 conversaciones y 1.623 intervenciones de test, sin columna de validación cumplimentada. La comprobación humana dice seleccionar aleatoriamente cien intervenciones de los test de los tres datasets, pero no aclara inequívocamente si son cien en total o por dataset ni cuántos evaluadores participan.

Hallazgos

  • ERC-DP alcanza weighted F1 67,34 en MELD, 40,10 en EmoryNLP y 69,64 en IEMOCAP.
  • Frente a no usar personalidad, la mejora publicada es de 0,64, 1,00 y 1,50 puntos; frente a la variante estática, 0,26, 0,63 y 0,62. No se reporta variabilidad o significación estadística.
  • En MELD supera por 0,23 puntos el 67,11 de BERT-ERC. En EmoryNLP supera por 0,09 el 40,01 de EmotionIC, no por 0,99 como afirma el texto.
  • En IEMOCAP queda por debajo de BERT-ERC: 69,64 frente a 71,70. Por tanto, no establece un nuevo mejor resultado en los tres benchmarks.
  • La comparación humana publica acuerdos entre 63,4 % y 84,6 % según dataset y rasgo. Neuroticismo es bajo en MELD y EmoryNLP; apertura es especialmente baja en IEMOCAP.
  • El caso cualitativo atribuye una corrección de neutral a tristeza a que el perfil dinámico añade neuroticismo, pero es un único ejemplo seleccionado y no separa el rasgo de los indicios emocionales del texto.

Limitaciones

  • Las etiquetas del corpus Essays describen rasgos de autores a partir de ensayos completos; aplicarlas a ventanas breves no convierte automáticamente la salida en un estado momentáneo validado.
  • Los cinco rasgos se reducen a 0/1 y se verbalizan como adjetivo o “not” + adjetivo. Se pierde magnitud, incertidumbre y estructura continua del constructo.
  • La entrada del predictor de personalidad contiene la propia intervención objetivo. Al reinyectar su salida en el clasificador de emoción puede recodificar palabras emocionales, creando un confusor circular.
  • La variante estática usa todos los turnos del hablante y la dinámica solo pasado más presente. La diferencia mezcla personalidad, longitud, recencia y presencia de contexto futuro.
  • El clasificador final sí incorpora turnos futuros del mismo hablante. El sistema no es causal ni aplicable tal cual a reconocimiento online en tiempo real.
  • No existe una medida psicométrica de estado, muestreo de experiencia, seguimiento intraindividual, validez convergente/discriminante o análisis de fiabilidad de los supuestos cambios.
  • Las mejoras de 0,09 a 1,50 puntos se presentan sin semillas, repeticiones, desviaciones, intervalos, tests de hipótesis, corrección múltiple o análisis de potencia.
  • Las comparaciones con baselines parecen tomar valores publicados; no se documenta una reevaluación homogénea con los mismos splits, semillas y preprocesado.
  • La afirmación de 0,99 puntos en EmoryNLP contradice la resta de la Tabla 2, que da 0,09. El 69,64 de IEMOCAP se denomina mejora aunque es una puntuación y queda por debajo de 71,70.
  • La tabla de IEMOCAP omite validación, aunque el método selecciona el mejor modelo sobre validation. No se detalla un protocolo de folds o partición que resuelva esa discrepancia.
  • Faltan epochs, semilla, max_length, dropout, parámetros de focal loss, checkpoint exacto de BERT/SimCSE y protocolo completo de ajuste.
  • Los cuatro datasets están en inglés y dos benchmarks proceden de Friends. La afirmación de aplicabilidad intercultural del Big Five no se evalúa en el sistema.
  • La comprobación humana no especifica cantidad de evaluadores, independencia, formación, instrucciones, adjudicación, acuerdo interevaluador, distribución de etiquetas, incertidumbre o aprobación ética.
  • El paper afirma que los datasets no contienen información personal o lenguaje no ético sin aportar una auditoría de contenido, licencias o riesgos de los corpus originales.
  • El repositorio oficial solo tiene seis archivos de proyecto y un commit. Faltan el modelo de emoción, entrenamiento, carga de datos, vocabulario, dependencias, licencia, datos, pesos, resultados, tests, CI y comando reproducible.
  • run.py importa cuatro módulos inexistentes, deja todas las rutas vacías, usa epochs sin definir y fija meld/7 clases; no puede ejecutar ninguna tabla sin reconstrucción sustancial.
  • ann.py toma last_hidden_state[:, ii, :] para ii=0..11: selecciona posiciones de token, no las doce capas del modelo. Luego MLP_LM elige una de esas posiciones como si fuera layer 11.
  • El código no pasa attention_mask, no activa truncation y concatena intervenciones sin separadores ni nombres. Su preprocesado no coincide claramente con la arquitectura descrita en el paper.
  • MLP_LM carga un path vacío dentro del bucle de cinco rasgos; sin una ruta dependiente del rasgo, el código cargaría el mismo clasificador para O, C, E, A y N. Los checkpoints tampoco están publicados.
  • La función other_person crea person_dict pero nunca lo rellena, por lo que esa rama de memoria de hablante está muerta. También concatena texto sin delimitadores.
  • El orden devuelto por el código es EXT, NEU, AGR, CON, OPN, mientras el prompt del paper usa O, C, E, A, N; al faltar model.py no puede verificarse la remapificación.
  • La ecuación de binary cross-entropy impresa en el paper omite el signo negativo del segundo término. Como el entrenamiento del predictor no se publica, no puede distinguirse error tipográfico de implementación.

Qué no demuestra

  • No demuestra que ERC-DP mida estados reales de personalidad ni cambios intraindividuales de Big Five.
  • No separa el efecto de personalidad del efecto de volver a codificar el contenido emocional de la frase objetivo y de cambiar la ventana contextual.
  • No establece que las pequeñas diferencias de F1 sean robustas, estadísticamente significativas o generalizables a nuevas ejecuciones, dominios, idiomas o personas.
  • No logra el mejor resultado publicado en IEMOCAP ni respalda la afirmación de superioridad sobre todos los métodos en los tres datasets.
  • No valida un instrumento de personalidad para conversaciones ni ofrece puntuaciones comparables a cuestionarios Big Five establecidos.
  • No estudia LLMs, agentes con identidad persistente, personalidad sintética longitudinal, coherencia de personaje o experiencia real de usuarios.
  • No permite reproducir las tablas o entrenar ERC-DP desde el repositorio oficial actual.

Trazabilidad

Alcance: Texto completo

Versión: ACL Anthology 2024.lrec-main.507, LREC-COLING 2024, May 2024, pp. 5711–5722; 12 pages

Fuente consultada: https://aclanthology.org/2024.lrec-main.507.pdf

Revisión: Codex full-text, bilingual-fidelity, 12-page visual, ACL-Anthology, LREC-COLING-2024, official-repository, metadata-correction, construct-validity, psychometric-state, circular-feature, temporal-context, ablation, arithmetic-consistency, statistical-claim, human-annotation, code-completeness and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • BERT plus MLP binary Big Five classifier
  • SimCSE conversational encoder with first eight layers reported frozen
  • MLP emotion classifier
  • ERC-DP
  • No-personality and static-personality ablations

Instrumentos y métricas

  • Binary OCEAN labels from the Essays dataset
  • Prompt: The personality is [MASK]
  • Verbalized positive and negated Big Five adjectives
  • Binary cross-entropy for personality prediction
  • Focal loss for emotion classification
  • Weighted F1
  • Manual Big Five presence/absence judgments

Datos utilizados

  • Essays personality recognition dataset
  • MELD
  • EmoryNLP
  • IEMOCAP

Evidencia y localización

  • Metadatos, autores y abstract oficiales: ACL Anthology record 2024.lrec-main.507 and paper p. 1
  • Motivación y definición de personalidad dinámica: Paper, pp. 1–2, Introduction and Figure 1
  • Arquitectura y predictor Big Five: Paper, pp. 3–4, Sections 3.1–3.4 and Figure 2
  • Clasificación fina, algoritmo, configuración y muestras: Paper, pp. 4–6, Sections 3.5–4.3, Algorithm 1 and Table 1
  • Resultados y errores aritméticos: Paper, pp. 6–7, Sections 5.1–5.2 and Tables 2–3
  • Comprobación manual y caso cualitativo: Paper, pp. 7–8, Sections 5.3–5.4 and Tables/Figures 3–4
  • Conclusiones, limitaciones y ética declaradas: Paper, pp. 8–9, Sections 5.5–6, Limitations and Ethical Considerations
  • Inspección visual integral: Paper, all 12 rendered pages, including every figure, table and reference page
  • Completitud y capacidad de ejecución del código: Official ERC-DP repository commit 73da90f3770d5e8ef8c94a8c636a2bb346f8defd, repository tree, readme.md and run.py
  • Errores de extracción, rasgos y contexto: Official ERC-DP repository commit 73da90f3770d5e8ef8c94a8c636a2bb346f8defd, five_person/ann.py, MLP_LM.py, dataset_processors.py and other_person.py