Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Jia Li, Yichao He, Jiacheng Xu, Tianhao Luo, Zhenzhen Hu, Richang Hong, Meng Wang

Palabras clave: Computation and Language, Multimedia, ACM MM 2025

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
7
Hallazgos
16
Limitaciones
9
Evidencias

Resumen editorial

Español

Traits Run Deep es el sistema ganador de la pista de Evaluación de Personalidad del AVI Challenge 2025 y fue publicado en ACM Multimedia 2025. Predice por regresión cuatro rasgos HEXACO, Honestidad-Humildad, Extraversión, Amabilidad y Responsabilidad, a partir de entrevistas en vídeo. Whisper-small transcribe el audio; Emotion2Vec representa la voz; SigLIP2 representa los recortes faciales; y SFR-Embedding-Mistral genera una representación textual a partir de la transcripción, una instrucción específica del rasgo y metadatos de la persona. Los encoders permanecen congelados. Una red centrada en texto proyecta las representaciones por bloques, usa atención intermodal con texto como consulta, refuerza la característica textual y promedia 32 regresores. En validación, el sistema completo obtiene MSE 0,1003 frente a 0,1796 del baseline del reto, una reducción relativa de aproximadamente 44,2 %. En el test ciego obtiene 0,12284 y supera al segundo equipo, con 0,13724. La comparación text-only también favorece los prompts específicos: el MSE medio pasa de aproximadamente 0,1303 sin ellos a 0,1069 con ellos. Añadir audio y vídeo reduce después ese promedio a 0,1003, una mejora adicional de alrededor del 6 %. Estos resultados respaldan la utilidad competitiva de las representaciones guiadas y la fusión propuesta en este conjunto, pero no validan una evaluación psicológica general. Solo se predicen cuatro de los seis dominios HEXACO y las etiquetas son puntuaciones autoinformadas, no diagnósticos. Los autores prueban un único conjunto de 644 participantes y realizan selección empírica de prompts, grid search y ensemble sobre la validación, sin informar cuántas alternativas se probaron ni corregir el posible sobreajuste. No publican intervalos, pruebas estadísticas, calibración, fiabilidad psicométrica, rendimiento por subgrupos ni validación externa. El prompt incorpora edad, género, educación y experiencia laboral, pero no hay una ablación de esos metadatos ni auditoría de estereotipos o discriminación, especialmente relevante porque el artículo motiva usos en selección de personal y salud mental. Las ablations se limitan a validación; el test solo ofrece un MSE agregado. La reproducibilidad sigue siendo insuficiente: no se publican los prompts exactos, splits, valores de K, semillas, predicciones ni código. El repositorio oficial, auditado en el commit f44c9ade, contiene únicamente licencia y un README que dice “Code coming soon”.

English

Traits Run Deep won the Personality Assessment track of AVI Challenge 2025 and was published at ACM Multimedia 2025. It regresses four HEXACO traits, Honesty-Humility, Extraversion, Agreeableness, and Conscientiousness, from video interviews. Whisper-small transcribes speech; Emotion2Vec represents audio; SigLIP2 represents cropped faces; and SFR-Embedding-Mistral embeds a prompt combining the transcript, a trait-specific instruction, and participant metadata. All encoders are frozen. A text-centric network projects features in chunks, applies cross-modal attention with text as query, enhances the text feature, and averages 32 regression heads. On validation, the full system reaches 0.1003 MSE versus the challenge baseline’s 0.1796, a relative reduction of about 44.2%. On the blind test it reaches 0.12284 and ranks ahead of the second team at 0.13724. The text-only comparison also favors trait-specific prompts: average MSE falls from about 0.1303 without them to 0.1069 with them. Adding audio and video then lowers the average to 0.1003, a further improvement of roughly 6%. This supports the competitive utility of the guided representations and fusion architecture on this dataset, but it does not validate general psychological assessment. Only four of six HEXACO domains are predicted and labels are self-reported scores rather than diagnoses. The study uses a single dataset of 644 participants and empirically selects prompts, grid-searches hyperparameters, and ensembles on validation without reporting how many alternatives were tried or controlling for validation overfitting. It reports no confidence intervals, significance tests, calibration, psychometric reliability, subgroup performance, or external validation. Prompts include age, gender, education, and work experience, yet there is no metadata ablation or stereotype/discrimination audit, despite motivating recruitment and mental-health uses. Ablations are validation-only; the test result is a single aggregate MSE. Reproducibility remains insufficient: exact prompts, splits, K, seeds, predictions, and implementation are absent. At audited commit f44c9ade, the official repository contains only a license and a README stating “Code coming soon”.

Pregunta de investigación

¿Mejora la predicción de cuatro rasgos HEXACO desde entrevistas asíncronas combinar representaciones textuales guiadas por prompts específicos del rasgo con señales de voz y rostro mediante una red de fusión centrada en texto?

Método

Estudio competitivo sobre el conjunto AVI Challenge 2025. Cada participante responde seis preguntas en vídeo: dos generales y cuatro asociadas a Honestidad-Humildad, Extraversión, Amabilidad y Responsabilidad. Se extrae audio a 16 kHz, Whisper-small produce la transcripción, Emotion2Vec representa el audio y SigLIP2 los recortes faciales. SFR-Embedding-Mistral recibe una instrucción del rasgo, la transcripción y metadatos de edad, género, educación y experiencia laboral. Los encoders se congelan. Un Chunk-Wise Projector reduce dimensionalidad, dos conectores de atención fusionan texto con audio y vídeo, un Text-Feature Enhancer combina las rutas y 32 regresores producen una media. El entrenamiento usa Adam, tasa 1e-4, batch 32, 200 épocas, búsqueda en rejilla, media móvil exponencial y una estrategia K-fold no especificada. Las ablations se evalúan en validación; el ranking final usa el test ciego del reto.

Muestra: El artículo declara 644 participantes con entrevistas estructuradas en vídeo. Cada entrevista incluye seis respuestas: dos a preguntas generales y cuatro a preguntas vinculadas a rasgos. Las etiquetas de los cuatro rasgos se expresan de 1 a 5 y se predicen por separado. El manuscrito no informa los tamaños de entrenamiento, validación y test, la distribución de las puntuaciones, el número final de vídeos utilizables por modalidad ni los identificadores del split. Tampoco aclara si los cinco experimentos del análisis de estabilidad reutilizan exactamente los mismos folds y semillas.

Hallazgos

  • El sistema completo obtiene en validación MSE 0,1072 en Honestidad-Humildad, 0,1003 en Extraversión, 0,0981 en Amabilidad y 0,0957 en Responsabilidad; la media es 0,1003.
  • Frente al baseline oficial de 0,1796, el MSE medio de validación se reduce aproximadamente un 44,2 %, que el abstract redondea a 45 %.
  • En texto solo, añadir el prompt específico reduce el promedio aproximado de 0,1303 a 0,1069; la mejora aparece en los cuatro rasgos, aunque los prompts se seleccionan empíricamente sobre validación.
  • La fusión completa mejora el promedio frente al texto guiado de aproximadamente 0,1069 a 0,1003; la ganancia audiovisual incremental es bastante menor que la mejora total citada frente al baseline.
  • En la ablación de fusión, CMC solo obtiene 0,1239, TFE solo 0,1336, ambos 0,1003 y concatenación simple 0,2074.
  • En cinco ejecuciones, sustituir una sola cabeza por 32 regresores reduce la desviación declarada del error de 0,0096 a 0,0031, pero no se informa la diferencia de MSE medio ni incertidumbre de esa comparación.
  • En el test del reto, HFUT-VisionXL ocupa el primer puesto con MSE 0,12284; el segundo equipo obtiene 0,13724. El test no ofrece resultados por rasgo o subgrupo.

Limitaciones

  • Se evalúa un único conjunto competitivo y no hay réplica en otro corpus, otra lengua, otro contexto de entrevista o una muestra independiente.
  • La muestra es pequeña para representaciones de alta dimensión: 644 participantes en total. El artículo no informa los tamaños de los splits ni los identificadores usados, lo que impide reconstruir la evaluación.
  • Los prompts se prueban en variedad y se elige empíricamente el mejor de cada rasgo según validación; además se hace grid search, EMA y ensemble. No se cuantifica el espacio de búsqueda ni se reserva un conjunto para selección, por lo que existe riesgo de sobreajuste a validación.
  • No se publican los prompts finales completos, el valor de K, semillas, criterios de selección, predicciones, configuración exacta de los 32 regresores o archivos de entorno.
  • Se emplea lenguaje de mejora significativa sin pruebas estadísticas, intervalos de confianza, análisis de potencia o comparación pareada por participante.
  • Las etiquetas son puntuaciones autoinformadas en cuatro rasgos, no observaciones clínicas ni una evaluación completa de HEXACO; se omiten Emotionalidad y Apertura a la experiencia.
  • El prompt añade edad, género, educación y experiencia laboral. No hay ablación de metadatos, análisis de atajos, calibración ni métricas de error y equidad por grupo.
  • El artículo no separa cuánto aprende el texto de la respuesta y cuánto explota correlaciones demográficas o artefactos del entrevistador, de la pregunta, del ASR, del rostro o del split.
  • La afirmación de psicología guiada se basa en instrucciones redactadas por los autores y seleccionadas por rendimiento; no se valida su correspondencia con teoría, facetas HEXACO o juicio de psicólogos.
  • La representación visual utiliza recortes faciales y el texto habla de Arc2Face como herramienta de detección/crop, aunque la referencia describe un modelo generativo de identidad facial; faltan detalles para reproducir ese paso.
  • Las ablations se hacen en validación y el test solo publica una cifra agregada. El primer puesto confirma rendimiento de competición, no la contribución causal de cada componente ni generalización externa.
  • El ensemble de 32 regresores reduce una desviación reportada en cinco experimentos, pero no se define con precisión qué errores se agregan ni se muestra el coste, el MSE medio del control o una prueba de estabilidad.
  • No hay evaluación de validez convergente, discriminante o incremental, fiabilidad test–retest, calibración individual, utilidad en decisiones reales ni impacto sobre personas.
  • No se examinan consentimiento, privacidad biométrica, sesgos de ASR/visión, posibilidad de fingir respuestas o daños de usar inferencias de personalidad en empleo, educación o salud mental.
  • El repositorio oficial prometido no contiene implementación, datos, pesos, prompts ni resultados: en el commit f44c9ade solo hay LICENSE y README.
  • El PDF arXiv v1 conserva campos sin editar de la plantilla ACM: conferencia XX y Woodstock 2018, ISBN y DOI ficticios, una instrucción al autor y fechas de recepción de 2007–2009. La publicación final existe con DOI 10.1145/3746027.3762017, pero esos defectos reducen la fiabilidad editorial del snapshot auditado.

Qué no demuestra

  • No demuestra una evaluación completa, estable o diagnóstica de la personalidad; predice cuatro puntuaciones autoinformadas en un único reto.
  • No prueba que los rasgos se “filtren subconscientemente” ni que el modelo identifique causas psicológicas internas; aprende correlaciones de texto, audio, rostro y metadatos.
  • No demuestra que edad, género, educación o experiencia laboral mejoren legítimamente la predicción ni que su uso sea justo o apropiado.
  • No valida aplicaciones en contratación, diagnóstico de salud mental, educación personalizada u otras decisiones de alto impacto.
  • No establece interpretabilidad o explicación psicológica: el sistema produce puntuaciones y el mecanismo de atención/fusión no se evalúa como explicación fiel para usuarios.
  • No demuestra que la ventaja de test se mantenga sin selección intensiva sobre validación, fuera del conjunto AVI 2025 o en poblaciones y lenguas distintas.
  • No permite reproducir los resultados con el repositorio oficial disponible en la fecha de auditoría.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2507.22367v1, submitted 30 July 2025, 8 pages; published at ACM Multimedia 2025, DOI 10.1145/3746027.3762017

Fuente consultada: https://arxiv.org/pdf/2507.22367v1

Revisión: Codex full-text, bilingual-fidelity, 8-page visual, ACM-metadata, official-repository, reproducibility, psychometric-scope, validation-selection, multimodal-ablation, demographic-shortcut, fairness, privacy and high-impact-use audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • SFR-Embedding-Mistral
  • Mistral-7B
  • E5-mistral-7b-instruct
  • Whisper-small
  • Emotion2Vec
  • SigLIP2
  • ALBERT-base-v2
  • ALBERT-large-v2
  • ALBERT-xxlarge-v2
  • BERT-base
  • BERT-large
  • DeBERTa-v3-base
  • DeBERTa-v3-large
  • Flan-T5-base
  • Flan-T5-large
  • RoBERTa-base
  • RoBERTa-large
  • ViTMAE

Instrumentos y métricas

  • Four HEXACO-domain self-report targets on a 1–5 scale
  • Trait-specific psychology-informed prompt plus participant metadata
  • Chunk-Wise Projector
  • Cross-Modal Connectors with text queries
  • Text-Feature Enhancer
  • 32-head ensemble regression
  • Mean squared error
  • Validation ablations and blind challenge leaderboard

Datos utilizados

  • AVI Challenge 2025 Personality Assessment Track

Evidencia y localización

  • Objetivo, arquitectura y afirmación de reducción del MSE: Paper, pp. 1–2, Abstract and Introduction
  • Encoders, prompts con metadatos y módulos de fusión: Paper, pp. 3–4, Sections 3.1–3.2 and Figure 2
  • Muestra, configuración y selección de prompts/hiperparámetros: Paper, p. 5, Sections 4.1–4.2
  • Resultados unimodales, prompt específico y sistema completo: Paper, p. 5, Table 1 and Section 4.3
  • Ablations de proyección, fusión y ensemble: Paper, pp. 5–6, Figure 3, Table 2 and Section 4.3
  • Resultado de test y ranking del reto: Paper, p. 6, Table 3 and Section 4.4
  • Publicación final en ACM Multimedia 2025: Crossref record for DOI 10.1145/3746027.3762017; Proceedings of the 33rd ACM International Conference on Multimedia, pp. 13901–13908
  • Ausencia de código y materiales reproducibles: Official repository commit f44c9ade13e6669bbec6d02141f11d32a93614a2, README.md and repository tree
  • Inspección visual integral y placeholders editoriales: Paper, all 8 rendered pages; pp. 1–8 ACM template headers/metadata and p. 8 obsolete received/revised/accepted dates