Esta publicación de Findings of EMNLP 2025 es una revisión narrativa y una propuesta de taxonomía sobre personalidad en LLM, no una revisión sistemática reproducible ni un estudio empírico. Esa distinción es central. Aunque el abstract dice que analiza sistemáticamente las limitaciones y la introducción presenta el trabajo como el primer systematic account del modelado multimodal de personalidad, el artículo no informa bases bibliográficas, consulta de búsqueda, fecha o intervalo de búsqueda, criterios de inclusión y exclusión, proceso de cribado, número de trabajos recuperados o incluidos, revisores, protocolo de extracción, evaluación de calidad ni riesgo de sesgo. Tampoco ofrece una tabla de estudios incluidos. Por tanto, comprehensive describe la ambición temática, no una cobertura demostrada, y systematic no debe interpretarse como el diseño formal de una systematic review. Los propios autores reconocen que pueden faltar aportaciones recientes o de dominios específicos, que quedan fuera los idiomas de bajos recursos, la adaptación cultural y los estudios longitudinales, y que no realizan benchmarking, reimplementación ni comparación cuantitativa. La contribución defendible es un mapa conceptual amplio. La taxonomía organiza primero cómo se modela la personalidad. Los antecedentes incluyen reglas y léxicos manuales, rasgos construidos, n-gramas, embeddings clásicos y machine learning, seguidos por modelos preentrenados como BERT y GPT-2. En la etapa LLM distingue enfoques model-centric, zero-shot, few-shot y fine-tuning, de enfoques system-level, RAG y agentes. Zero-shot y few-shot controlan la salida mediante prompts o demostraciones; fine-tuning modifica parámetros y puede ofrecer mayor estabilidad, pero exige datos, cómputo y controles frente a overfitting o catastrophic forgetting. RAG puede introducir información de usuario o contexto sin reentrenar, aunque depende de la calidad de recuperación, y los agentes pueden mantener perfiles, memoria y herramientas, pero hacen más compleja la coherencia de la persona. Esta clasificación es útil para ubicar técnicas, pero reúne bajo personality fenómenos distintos: rasgos psicométricos, estilos inducidos, perfiles de usuario, personalización, personajes ficticios, role-play y conducta de agentes. El paper no fija una prueba que permita determinar cuándo una salida condicionada es un rasgo, una persona o simple instruction following. Una segunda dimensión amplía la expresión más allá del texto: visión, voz y realidad virtual. La tesis es que prosodia, expresión facial, gesto y embodiment pueden hacer más creíble una personalidad. Sin embargo, la evidencia multimodal es mucho más escasa que la textual y la sección de VR se apoya de forma destacada en un estudio de 2025 cofirmado por autoras de la revisión. Los autores admiten que la literatura citada sigue siendo principalmente text-centric. En consecuencia, Embodying señala una agenda prometedora, no una base madura o representativa de resultados. La tercera dimensión compara evaluación cualitativa y cuantitativa. Entre las cualitativas, la evaluación humana aporta sensibilidad contextual, pero es cara, subjetiva, difícil de reproducir y sensible a la composición demográfica. LLM-as-judge reduce coste y escala el juicio, pero hereda sesgos y limitaciones culturales del evaluador, puede ser inconsistente o alucinar y requiere calibración independiente. Entre las cuantitativas, los cuestionarios psicométricos producen puntuaciones aparentemente estandarizadas, pero fueron diseñados para humanos. El modelo predice tokens, no introspecciona un yo estable; orden de opciones, redacción, formato de escala, framing y posible exposición del material en entrenamiento pueden cambiar la respuesta. LIWC es trazable y fácil de usar, pero sus diccionarios rígidos pierden contexto y semántica. Los vectores y embeddings capturan relaciones contextuales y escalan bien, pero son menos interpretables y pueden correlacionar con etiquetas de personalidad sin estar fundamentados psicométricamente. Esta discusión identifica correctamente amenazas importantes, pero no valida empíricamente ninguna familia. Table 1 asigna a cinco métodos valores binarios para Traceable, Scalable, Prompt-Agnostic y Context-Aware. Los ejes no se operacionalizan ni se miden; por ejemplo, declarar human evaluation prompt-agnostic o personality tests no context-aware depende del protocolo concreto. La tabla es una heurística editorial, no evidencia comparativa. Los retos propuestos son coherentes con el diagnóstico: desarrollar benchmarks invariantes al prompt, sensibles al contexto y psicométricamente fundamentados; integrar modalidades; escalar la personalización; y asegurar que la conducta condicionada sea segura, coherente y socialmente apropiada. La discusión ética menciona manipulación por personas emocionalmente adaptativas, estereotipos impuestos por taxonomías de rasgos, suplantación de figuras públicas o personajes y falta de consentimiento o transparencia en adaptaciones longitudinales. Son riesgos pertinentes, pero tampoco se someten a una revisión sistemática o a evaluación causal. El artículo no aporta experimentos, muestra, modelos ejecutados, datos nuevos, código ni síntesis cuantitativa. Sus afirmaciones sobre avances proceden de los trabajos citados y no deben convertirse en resultados propios. Tampoco demuestra que los LLM posean rasgos internos, que una técnica produzca personalidad estable, que los inventarios humanos sean válidos para máquinas, que la literatura cubierta sea completa ni que exista consenso sobre la mejor evaluación. Debe citarse como una taxonomía narrativa útil y crítica: ofrece vocabulario para conectar modelado, modalidades y evaluación, pero la fuerza de cada conclusión depende de las fuentes primarias y la exhaustividad no puede auditarse. La ficha anterior contenía además un fallo grave de integridad: abstract_en_original era un párrafo genérico inventado que no figuraba en la publicación. Se ha sustituido literalmente por el abstract de ACL, conservando incluso los errores development LLMs y consistent consistent porque el campo original debe ser fiel a la fuente.
Pregunta de investigación
¿Cómo puede organizarse conceptualmente la literatura sobre modelado, expresión multimodal y evaluación de personalidad en LLM, y qué limitaciones y líneas futuras identifica esa literatura?