Este artículo de WASSA 2022 estudia la predicción de personalidad humana a partir de textos; no evalúa la personalidad de un LLM ni demuestra que BERT tenga rasgos propios. Usa dos benchmarks. Essays contiene 2.468 ensayos de estudiantes, de unas 672 palabras, con cinco etiquetas binarias derivadas de autoinforme Big Five. Kaggle MBTI agrega publicaciones de PersonalityCafe de 8.675 usuarios, unas 1.288 palabras por usuario, con cuatro dicotomías MBTI autodeclaradas. El sistema extrae por frase lo que denomina 437 características psicolingüísticas y conserva su secuencia o «contorno textual»: complejidad morfosintáctica, riqueza léxica, legibilidad y señales de sentimiento, emoción o afecto. Sin embargo, los cuatro grupos declarados suman 436 (19+77+14+326) y las ecuaciones también usan vectores de 436 dimensiones. Compara BLSTM con y sin atención, combinaciones de esas redes con `bert-base-uncased` mediante fusión tardía, BERT congelado frente a ajuste fino y un ensemble apilado de diez instancias. BERT solo recibe los primeros 512 tokens, mientras que los contornos representan las frases del documento. El artículo declara grid search y 10-fold cross-validation repetida diez veces, pero no documenta particiones, seeds, rejilla, selección de checkpoint ni una evaluación externa o anidada de la segunda etapa del stacking. La tabla principal informa solo exactitud. El ensemble obtiene 63,50% de promedio en Essays y 86,51% en MBTI. En Essays, la mejora frente al mejor promedio previo mostrado, 60,6%, es de 2,90 puntos porcentuales. En MBTI, 86,51 menos 77,1 equivale a 9,41 puntos, no al 8,28% repetido en el abstract y en resultados; 8,28 puntos corresponde a la mejor red individual ajustada, 85,38%, frente a 77,1. En los modelos sin BERT, ATTN-PSYLING alcanza 60,04% y 75,29%. El análisis SP-LIME pone en primer lugar el grupo de sentimiento/emoción/afecto en los nueve objetivos y el grupo léxico en segundo lugar salvo P/J. Esto es una explicación post hoc obtenida poniendo grupos a cero, no una ablación por reentrenamiento ni evidencia causal de que esos rasgos expresen personalidad. La exactitud en MBTI es especialmente difícil de interpretar porque la propia figura muestra clases desbalanceadas y no se publican balanced accuracy, macro-F1, intervalos ni variabilidad. Tampoco se controla que los textos del foro mencionen etiquetas o vocabulario MBTI. No hay validación en otro dominio, análisis demográfico, auditoría de sesgo o evaluación de consecuencias. ACL y el PDF no enlazan código; las búsquedas dirigidas no localizaron una implementación. Sin features, predicciones, folds y configuración completa, los resultados no se pueden reproducir de extremo a extremo. La conclusión defendible es limitada: en estos dos datasets y bajo este protocolo no plenamente auditable, combinar representaciones BERT con secuencias de medidas psicolingüísticas produce exactitudes mayores que las baselines citadas; no establece una medición general, justa o causal de la personalidad.
Pregunta de investigación
¿Mejora la clasificación textual de etiquetas Big Five y MBTI al representar la distribución frase a frase de características psicolingüísticas y combinar esos contornos con BERT, y qué grupos de características contribuyen a las predicciones?