Traits Run Deep es el sistema ganador de la pista de Evaluación de Personalidad del AVI Challenge 2025 y fue publicado en ACM Multimedia 2025. Predice por regresión cuatro rasgos HEXACO, Honestidad-Humildad, Extraversión, Amabilidad y Responsabilidad, a partir de entrevistas en vídeo. Whisper-small transcribe el audio; Emotion2Vec representa la voz; SigLIP2 representa los recortes faciales; y SFR-Embedding-Mistral genera una representación textual a partir de la transcripción, una instrucción específica del rasgo y metadatos de la persona. Los encoders permanecen congelados. Una red centrada en texto proyecta las representaciones por bloques, usa atención intermodal con texto como consulta, refuerza la característica textual y promedia 32 regresores. En validación, el sistema completo obtiene MSE 0,1003 frente a 0,1796 del baseline del reto, una reducción relativa de aproximadamente 44,2 %. En el test ciego obtiene 0,12284 y supera al segundo equipo, con 0,13724. La comparación text-only también favorece los prompts específicos: el MSE medio pasa de aproximadamente 0,1303 sin ellos a 0,1069 con ellos. Añadir audio y vídeo reduce después ese promedio a 0,1003, una mejora adicional de alrededor del 6 %. Estos resultados respaldan la utilidad competitiva de las representaciones guiadas y la fusión propuesta en este conjunto, pero no validan una evaluación psicológica general. Solo se predicen cuatro de los seis dominios HEXACO y las etiquetas son puntuaciones autoinformadas, no diagnósticos. Los autores prueban un único conjunto de 644 participantes y realizan selección empírica de prompts, grid search y ensemble sobre la validación, sin informar cuántas alternativas se probaron ni corregir el posible sobreajuste. No publican intervalos, pruebas estadísticas, calibración, fiabilidad psicométrica, rendimiento por subgrupos ni validación externa. El prompt incorpora edad, género, educación y experiencia laboral, pero no hay una ablación de esos metadatos ni auditoría de estereotipos o discriminación, especialmente relevante porque el artículo motiva usos en selección de personal y salud mental. Las ablations se limitan a validación; el test solo ofrece un MSE agregado. La reproducibilidad sigue siendo insuficiente: no se publican los prompts exactos, splits, valores de K, semillas, predicciones ni código. El repositorio oficial, auditado en el commit f44c9ade, contiene únicamente licencia y un README que dice “Code coming soon”.
Pregunta de investigación
¿Mejora la predicción de cuatro rasgos HEXACO desde entrevistas asíncronas combinar representaciones textuales guiadas por prompts específicos del rasgo con señales de voz y rostro mediante una red de fusión centrada en texto?