ERC-DP es un clasificador de emociones conversacionales que añade una representación binaria de Big Five inferida del texto; no es un LLM ni una validación psicométrica de estados de personalidad. Primero entrena un clasificador BERT sobre 2.468 ensayos etiquetados con cinco rasgos. Para cada intervención de MELD, EmoryNLP o IEMOCAP concatena la intervención actual con las anteriores del mismo hablante y predice cinco valores 0/1. Esos valores se convierten en una frase como “this person is open, not conscientious...”. Un codificador SimCSE procesa el prompt junto con contexto pasado, actual y futuro, y un MLP predice la emoción.
En weighted F1, ERC-DP obtiene 67,34 en MELD, 40,10 en EmoryNLP y 69,64 en IEMOCAP. Frente a la ablación sin personalidad, las diferencias son +0,64, +1,00 y +1,50 puntos; frente al perfil estático, +0,26, +0,63 y +0,62. El modelo supera el mejor valor listado en MELD por 0,23 puntos. En EmoryNLP, la tabla muestra 40,10 frente a 40,01, una ventaja de 0,09 puntos, aunque el texto afirma erróneamente 0,99. En IEMOCAP no alcanza el mejor resultado: BERT-ERC obtiene 71,70, 2,06 puntos más. La frase “improvement of 69.64%” confunde la puntuación del modelo con una mejora. No hay semillas, desviaciones, intervalos, tests o ejecuciones repetidas que permitan interpretar las diferencias pequeñas como estadísticamente significativas.
La interpretación psicológica es mucho más débil que la mejora de clasificación. Los ensayos tienen etiquetas de rasgo a nivel de autor, mientras ERC-DP aplica el clasificador a ventanas breves y llama “estado de personalidad” a su salida. No se administra una medida de estado, no hay seguimiento intraindividual ni se valida que cambiar la ventana corresponda a cambio psicológico. Además, el clasificador de rasgos ve la propia frase cuya emoción se quiere predecir y esa información vuelve a entrar como prompt: la ganancia puede proceder de recodificar indicios léxicos de emoción, no de personalidad. La comparación estática/dinámica también cambia el contexto temporal y su longitud.
La comprobación humana selecciona cien ejemplos de forma descrita ambiguamente y publica porcentajes de acuerdo por rasgo entre 63,4 % y 84,6 %. No informa número de evaluadores, entrenamiento, rúbrica, agregación, acuerdo interevaluador, incertidumbre ni revisión ética; solo indica anonimato y 5 dólares por hora. El código oficial auditado en 73da90f3770d5e8ef8c94a8c636a2bb346f8defd no reproduce el paper: faltan model.py, train.py, loaddata.py, vocab, datasets, checkpoints, configuración y resultados; todas las rutas están vacías y epochs no existe. Además, selecciona posiciones de token como si fueran capas ocultas y carga el mismo checkpoint vacío para los cinco rasgos. Por tanto, el trabajo aporta una hipótesis de ingeniería sobre prompts derivados del contexto, pero no demuestra que mida personalidad dinámica real.