Pushing on Personality Detection from Verbal Behavior: A Transformer Meets Text Contours of Psycholinguistic Features

Evaluación y validez psicométrica2022ACL AnthologyRevisión editorial aprobada

Autores: Elma Kerz, Yu Qiao, Sourabh Zanwar, Daniel Wiechmann

Palabras clave: personality detection, psycholinguistic features, BERT transformers, text contours, Big Five, MBTI, verbal behavior analysis

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
16
Hallazgos
33
Limitaciones
18
Evidencias

Resumen editorial

Español

Este artículo de WASSA 2022 estudia la predicción de personalidad humana a partir de textos; no evalúa la personalidad de un LLM ni demuestra que BERT tenga rasgos propios. Usa dos benchmarks. Essays contiene 2.468 ensayos de estudiantes, de unas 672 palabras, con cinco etiquetas binarias derivadas de autoinforme Big Five. Kaggle MBTI agrega publicaciones de PersonalityCafe de 8.675 usuarios, unas 1.288 palabras por usuario, con cuatro dicotomías MBTI autodeclaradas. El sistema extrae por frase lo que denomina 437 características psicolingüísticas y conserva su secuencia o «contorno textual»: complejidad morfosintáctica, riqueza léxica, legibilidad y señales de sentimiento, emoción o afecto. Sin embargo, los cuatro grupos declarados suman 436 (19+77+14+326) y las ecuaciones también usan vectores de 436 dimensiones. Compara BLSTM con y sin atención, combinaciones de esas redes con `bert-base-uncased` mediante fusión tardía, BERT congelado frente a ajuste fino y un ensemble apilado de diez instancias. BERT solo recibe los primeros 512 tokens, mientras que los contornos representan las frases del documento. El artículo declara grid search y 10-fold cross-validation repetida diez veces, pero no documenta particiones, seeds, rejilla, selección de checkpoint ni una evaluación externa o anidada de la segunda etapa del stacking. La tabla principal informa solo exactitud. El ensemble obtiene 63,50% de promedio en Essays y 86,51% en MBTI. En Essays, la mejora frente al mejor promedio previo mostrado, 60,6%, es de 2,90 puntos porcentuales. En MBTI, 86,51 menos 77,1 equivale a 9,41 puntos, no al 8,28% repetido en el abstract y en resultados; 8,28 puntos corresponde a la mejor red individual ajustada, 85,38%, frente a 77,1. En los modelos sin BERT, ATTN-PSYLING alcanza 60,04% y 75,29%. El análisis SP-LIME pone en primer lugar el grupo de sentimiento/emoción/afecto en los nueve objetivos y el grupo léxico en segundo lugar salvo P/J. Esto es una explicación post hoc obtenida poniendo grupos a cero, no una ablación por reentrenamiento ni evidencia causal de que esos rasgos expresen personalidad. La exactitud en MBTI es especialmente difícil de interpretar porque la propia figura muestra clases desbalanceadas y no se publican balanced accuracy, macro-F1, intervalos ni variabilidad. Tampoco se controla que los textos del foro mencionen etiquetas o vocabulario MBTI. No hay validación en otro dominio, análisis demográfico, auditoría de sesgo o evaluación de consecuencias. ACL y el PDF no enlazan código; las búsquedas dirigidas no localizaron una implementación. Sin features, predicciones, folds y configuración completa, los resultados no se pueden reproducir de extremo a extremo. La conclusión defendible es limitada: en estos dos datasets y bajo este protocolo no plenamente auditable, combinar representaciones BERT con secuencias de medidas psicolingüísticas produce exactitudes mayores que las baselines citadas; no establece una medición general, justa o causal de la personalidad.

English

This WASSA 2022 paper studies human-personality prediction from text; it does not assess an LLM's personality or show that BERT has traits of its own. It uses two benchmarks. Essays contains 2,468 student essays averaging 672 words with five binary labels derived from Big Five self-report. Kaggle MBTI aggregates PersonalityCafe posts from 8,675 users, averaging 1,288 words per user, with four self-reported MBTI dichotomies. The system extracts what it calls 437 sentence-level psycholinguistic features and retains their sequence or 'text contour': morphosyntactic complexity, lexical richness, readability, and sentiment/emotion/affect signals. The four reported groups actually sum to 436 (19+77+14+326), and the equations likewise use 436-dimensional vectors. The paper compares BLSTMs with and without attention, late-fusion combinations with `bert-base-uncased`, frozen versus fine-tuned BERT, and a stacked ensemble of ten instances. BERT sees only the first 512 tokens, while the contours represent document sentences. The paper reports grid search and ten repetitions of 10-fold cross-validation, but it does not document folds, seeds, the search grid, checkpoint selection, or an outer/nested evaluation for the stacking stage. The main table reports accuracy only. The ensemble averages 63.50% on Essays and 86.51% on MBTI. On Essays, this is 2.90 percentage points above the best displayed prior average of 60.6%. On MBTI, 86.51 minus 77.1 equals 9.41 points, not the 8.28% repeated in the abstract and results; 8.28 points corresponds to the best single fine-tuned model, 85.38%, relative to 77.1. Without BERT, ATTN-PSYLING reaches 60.04% and 75.29%. SP-LIME ranks sentiment/emotion/affect first for all nine targets and lexical features second except for P/J. This is a post-hoc explanation created by zeroing feature groups, not a retraining ablation or causal evidence that the cues express personality. Accuracy is particularly hard to interpret for MBTI because the paper's own figure shows class imbalance and it reports no balanced accuracy, macro-F1, intervals, or variability. It also does not control whether forum texts mention MBTI labels or associated vocabulary. There is no cross-domain validation, demographic analysis, bias audit, or consequence evaluation. Neither ACL nor the paper links code, and targeted searches found no implementation. Without extracted features, predictions, folds, and complete configurations, the results cannot be reproduced end to end. The defensible conclusion is narrow: on these two datasets and under a protocol that is not fully auditable, combining BERT representations with sequences of psycholinguistic measurements yields higher accuracy than the cited baselines; it does not establish a general, fair, or causal measurement of personality.

Pregunta de investigación

¿Mejora la clasificación textual de etiquetas Big Five y MBTI al representar la distribución frase a frase de características psicolingüísticas y combinar esos contornos con BERT, y qué grupos de características contribuyen a las predicciones?

Método

Se extraen medidas psicolingüísticas por frase mediante Stanford CoreNLP, lexicones, normas léxicas y medidas de legibilidad; la secuencia estandarizada alimenta BLSTM con o sin atención. En los modelos híbridos, esa representación se concatena con el promedio de embeddings de `bert-base-uncased` sobre los primeros 512 tokens, con BERT congelado o ajustado. Un clasificador MLP produce cada etiqueta binaria. El artículo declara grid search, 10-fold CV repetida diez veces y un stacking de diez predicciones mediante regresión logística. SP-LIME pone a cero cuatro grupos de features para aproximar su importancia global.

Muestra: 2.468 ensayos de estudiantes, con una media declarada de 672 palabras y unos 1,6 millones de palabras en total; y textos de 8.675 usuarios de PersonalityCafe, con una media de 1.288 palabras y unos 11,2 millones de palabras. Cada documento o usuario aporta cinco objetivos binarios Big Five o cuatro objetivos binarios MBTI, respectivamente. No se publican los identificadores de los folds ni el número efectivo de ejemplos después del preprocesamiento.

Hallazgos

  • El ensemble BERT+PSYLING obtiene 63,50% de exactitud media en Essays y 86,51% en Kaggle MBTI.
  • En Essays, el ensemble alcanza O=71,95, C=61,38, E=63,01, A=60,16 y N=60,98.
  • En MBTI, el ensemble alcanza I/E=85,47, N/S=92,27, T/F=85,70 y P/J=82,58.
  • La mejora de Essays frente al mejor promedio previo mostrado, 60,6, es de 2,90 puntos porcentuales.
  • La mejora del ensemble MBTI frente al mejor promedio previo mostrado, 77,1, es de 9,41 puntos; el 8,28 declarado corresponde a 85,38 menos 77,1, es decir, al mejor modelo individual con atención y fine-tuning, no al ensemble de 86,51.
  • ATTN-PSYLING, sin BERT, promedia 60,04 en Essays y 75,29 en MBTI; BLSTM-PSYLING obtiene 58,68 y 74,38.
  • Los modelos híbridos con BERT ajustado superan a sus variantes con BERT congelado en los nueve objetivos de la tabla.
  • El mecanismo de atención mejora todas las comparaciones BLSTM correspondientes salvo N/S de MBTI en la variante puramente psicolingüística.
  • El grupo sentimiento/emoción/afecto recibe la mayor importancia SP-LIME en los cinco objetivos Big Five y los cuatro MBTI.
  • Las características léxicas ocupan el segundo lugar en todos los objetivos salvo P/J, donde queda segundo el grupo de legibilidad.
  • Los cuatro grupos declarados como 19, 77, 14 y 326 características suman 436, no 437; las ecuaciones del encoder usan 436 dimensiones.
  • BERT procesa solo los primeros 512 tokens de documentos que promedian 672 y 1.288 palabras, por lo que la representación Transformer trunca una parte no cuantificada del texto.
  • La Figura 3 muestra un fuerte desbalance en varias dicotomías MBTI; la exactitud agregada puede estar dominada por la clase mayoritaria.
  • Las diferencias descriptivas de features asocian mayor extraversión con menor complejidad morfosintáctica y más vocabulario positivo; mayor neuroticismo con autorreferencia y vocabulario de tristeza o ansiedad; y mayor responsabilidad con palabras más prevalentes, afiliación y n-gramas académicos.
  • Esas asociaciones se calculan como diferencias de medias estandarizadas entre etiquetas y no controlan covariables, dominio o causalidad.
  • El artículo no publica código, features, predicciones, folds ni resultados por repetición; no se localizó un repositorio mediante búsquedas dirigidas por título y nombres internos de los modelos.

Limitaciones

  • El trabajo llama 437 al conjunto de features, pero las cuatro categorías suman 436 y la arquitectura define vectores de 436 dimensiones.
  • No se publica el inventario completo de las 436/437 variables ni una versión ejecutable del sistema ATA.
  • Algunas fuentes, como LIWC, pueden requerir recursos con licencia; no se documenta una ruta reproducible para obtener exactamente las mismas features.
  • No hay repositorio, código, archivos de entorno, checkpoints, features extraídos, predicciones o artefactos de evaluación enlazados.
  • No se reportan seeds, versiones de PyTorch, Transformers, CoreNLP o recursos léxicos, hardware ni determinismo.
  • No se informa batch size, número de épocas, criterio de parada, scheduler ni selección de checkpoint.
  • La rejilla de hiperparámetros y el criterio usado para escoger la configuración óptima no se publican.
  • No se aclara si el grid search está anidado dentro de cada fold; seleccionar con los mismos datos usados para estimar rendimiento puede introducir optimismo.
  • La segunda etapa de stacking se describe con predicciones out-of-fold, pero no se especifica una evaluación externa o nested CV independiente para el meta-modelo.
  • No se publican los identificadores de folds ni se demuestra que todos los pasos de normalización y selección se ajusten exclusivamente con el train fold.
  • La tabla solo informa exactitud puntual: no hay desviaciones, intervalos de confianza, distribución de las diez repeticiones ni tests pareados.
  • Los resultados se comparan con números de otros artículos sin garantizar las mismas particiones, preprocesamiento o protocolo de validación.
  • El abstract usa porcentajes donde la tabla permite calcular puntos porcentuales; no distingue mejora absoluta de relativa.
  • El 8,28% de MBTI es incompatible con la fila del ensemble que el texto denomina mejor modelo: 86,51 frente a 77,1 son 9,41 puntos.
  • Kaggle MBTI está desbalanceado, pero no se informan balanced accuracy, macro-F1, sensibilidad, especificidad, matriz de confusión o baseline mayoritaria.
  • Las etiquetas MBTI son autodeclaradas en un foro temático y no se validan con administración supervisada del instrumento.
  • No se analiza si los posts contienen nombres de tipos, dicotomías o jerga MBTI que permita fuga directa o indirecta de la etiqueta.
  • El artículo trata MBTI junto con Big Five como uno de los dos modelos dominantes sin discutir sus diferencias psicométricas o la pérdida de información al binarizar rasgos.
  • Las cinco etiquetas de Essays se usan como binarias; no se estudia error de medida, fiabilidad ni sensibilidad al umbral de binarización.
  • Los dos datasets son de dominios y poblaciones muy concretos; no hay validación externa en otro corpus, idioma, género textual o contexto de aplicación.
  • No se informa la composición demográfica suficiente para evaluar representatividad o rendimiento por grupos.
  • BERT recibe solo los primeros 512 tokens y el artículo no cuantifica cuántos documentos se truncan ni compara estrategias de segmentación.
  • El texto denomina a los tokens BPE «word tokens»; la relación entre 510 subpalabras y la longitud declarada en palabras no queda cuantificada.
  • La fusión combina una vista truncada de BERT con contornos potencialmente completos, pero no aísla si la mejora procede de mayor cobertura, más parámetros o información complementaria.
  • SP-LIME pone grupos a cero sin reentrenar el modelo; describirlo como ablación puede sugerir una intervención más fuerte de la realizada.
  • Cero es el centro de una variable estandarizada, pero el paper no verifica que las combinaciones perturbadas formen textos o perfiles de features plausibles.
  • Las magnitudes SP-LIME son explicaciones locales agregadas del predictor y no validan que los grupos sean constructos psicológicos causales.
  • Las gráficas de diferencias high/low no controlan longitud, tema, edad, género, región u otras variables que pueden explicar las asociaciones.
  • No hay análisis de errores, ejemplos de falsos positivos/negativos ni evaluación cualitativa de decisiones del modelo.
  • No se evalúan calibración, robustez a paráfrasis, adversarios, cambios temporales o desplazamiento de dominio.
  • No hay sección de limitaciones, declaración de ética, privacidad, consentimiento, impacto o posibles usos indebidos de inferir personalidad.
  • No se auditan sesgos o disparidades por grupos, aunque el propio trabajo menciona aplicaciones sensibles como salud, justicia penal y noticias.
  • La conclusión propone estudiar metadatos demográficos en PANDORA, pero no evalúa si usarlos sería válido, justo o respetuoso con la privacidad.

Qué no demuestra

  • No demuestra que BERT, BLSTM o el ensemble posean personalidad propia.
  • No demuestra que la personalidad humana pueda inferirse con validez general a partir de cualquier texto.
  • No valida MBTI ni las etiquetas binarias Big Five como ground truth libre de error.
  • No demuestra que la mejora se generalice fuera de Essays y PersonalityCafe.
  • No establece rendimiento en idiomas distintos del inglés.
  • No demuestra que las comparaciones con trabajos previos sean estadísticamente significativas bajo folds idénticos.
  • No prueba que el ensemble alcance 8,28 puntos de mejora en MBTI; la tabla implica 9,41 frente al mejor promedio previo mostrado.
  • No permite saber cuánta variabilidad existe entre inicializaciones o folds.
  • No demuestra que el stacking haya sido evaluado sin fuga u optimismo de selección.
  • No establece que las señales de sentimiento o vocabulario causen ni revelen directamente rasgos psicológicos.
  • No demuestra que SP-LIME recupere importancias causales o estables.
  • No descarta que tema, longitud, demografía o jerga del foro expliquen parte de la predicción.
  • No descarta fuga de etiquetas MBTI dentro del contenido textual.
  • No demuestra equidad entre grupos demográficos ni seguridad en aplicaciones sensibles.
  • No ofrece una implementación reproducible de extremo a extremo.
  • No justifica desplegar el sistema para decisiones clínicas, laborales, educativas, judiciales o de personalización.

Trazabilidad

Alcance: Texto completo

Versión: WASSA 2022 final published version, ACL Anthology 2022.wassa-1.17; DOI 10.18653/v1/2022.wassa-1.17

Fuente consultada: https://aclanthology.org/2022.wassa-1.17.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, publication-version, arithmetic-consistency, feature-count, psychometric-label, class-imbalance, truncation, cross-validation, stacking, interpretability, leakage, reproducibility, fairness, ethics and evidence-level audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • BLSTM-PSYLING, 3-layer bidirectional LSTM contour encoder
  • ATTN-PSYLING, 3-layer BLSTM contour encoder with feature-level attention
  • BERT+BLSTM-PSYLING late-fusion model, feature-based/frozen and fine-tuned variants
  • BERT+ATTN-PSYLING late-fusion model, feature-based/frozen and fine-tuned variants
  • BERT+PSYLING stacked ensemble of ten fine-tuned BERT+ATTN-PSYLING instances
  • bert-base-uncased from Hugging Face Transformers
  • Three-layer feed-forward PReLU classifier
  • Logistic-regression stacking model

Instrumentos y métricas

  • Sentence-level automated text analysis with sliding windows
  • Morphosyntactic complexity features
  • Lexical richness, diversity and sophistication features
  • Readability features
  • Ten sentiment, emotion and affect lexicons including LIWC, NRC, SenticNet and DepecheMood++
  • Stanford CoreNLP tokenization, sentence splitting, POS tagging, lemmatization and PCFG parsing
  • 10-fold cross-validation repeated ten times
  • Classification accuracy
  • SP-LIME group perturbation explanations
  • Stacked generalization with logistic regression

Datos utilizados

  • Big Five Essays dataset: 2,468 stream-of-consciousness student essays with five binary self-report labels
  • Kaggle MBTI dataset: PersonalityCafe text from 8,675 users with four self-reported binary MBTI dimensions
  • COCA register subcorpora used to derive n-gram frequency features
  • External lexical norms and sentiment/emotion resources used in the feature extractor

Evidencia y localización

  • Identidad bibliográfica, publicación, DOI y abstract completo: ACL Anthology 2022.wassa-1.17; publisher PDF p. 1 (proceedings p. 182)
  • Definición del problema y alcance de los dos benchmarks: Publisher PDF pp. 1–3 (proceedings pp. 182–184), sections 1–3.1
  • Tamaño, origen y longitud de Essays y Kaggle MBTI: Publisher PDF p. 3 (proceedings p. 184), section 3.1
  • Cuatro grupos y discrepancia 437 frente a suma/vector 436: Publisher PDF pp. 3–5 (proceedings pp. 184–186), sections 3.2 and 4.1
  • Recursos lingüísticos y construcción de contornos: Publisher PDF pp. 3–5 (proceedings pp. 184–186), section 3.2 and Figure 1
  • Arquitectura BERT, truncación a 512 y pooling: Publisher PDF p. 5 (proceedings p. 186), section 4.1
  • BLSTM, atención, fusión y fine-tuning: Publisher PDF pp. 5–6 (proceedings pp. 186–187), sections 4.1–4.2
  • Grid search, 10-fold CV repetida y ausencia de detalle de selección: Publisher PDF pp. 4 and 6 (proceedings pp. 185 and 187), sections 4 and 4.2
  • Procedimiento de stacking en dos etapas: Publisher PDF p. 6 (proceedings p. 187), section 4.2
  • SP-LIME y perturbación de grupos a cero: Publisher PDF pp. 6–7 (proceedings pp. 187–188), section 4.3
  • Resultados completos por rasgo y modelo: Publisher PDF p. 7 (proceedings p. 188), Table 1
  • Inconsistencia 8,28 frente a resultado del ensemble: Publisher PDF pp. 1 and 7 (proceedings pp. 182 and 188), abstract, section 5 and Table 1
  • Importancia de los cuatro grupos: Publisher PDF p. 8 (proceedings p. 189), Table 2 and section 5
  • Desbalance visual de etiquetas: Publisher PDF p. 11 (proceedings p. 192), Figures 2–3
  • Features asociadas descriptivamente a cada etiqueta: Publisher PDF pp. 8, 12–13 (proceedings pp. 189, 193–194), section 5 and Figures 4–5
  • Conclusiones y generalización futura propuesta: Publisher PDF pp. 8–9 (proceedings pp. 189–190), section 6
  • Inspección visual: All 13 pages of the final ACL PDF rendered and visually inspected, including five figures, two tables and equations; checked 15 Jul 2026
  • Ausencia de implementación enlazada: ACL record, final PDF and targeted GitHub searches for exact title, BERT+ATTN-PSYLING and ATTN-PSYLING; checked 15 Jul 2026