La versión final publicada en ACL 2025 de BIG5-CHAT presenta una cadena de generación y entrenamiento para expresar niveles altos o bajos de los cinco rasgos Big Five en respuestas de LLM. Su base empírica no es un corpus final escrito por personas: parte de PsychGenerator, 846.304 publicaciones de Facebook asociadas a puntuaciones de personalidad de sus autores, y de 10.000 escenarios de SODA, un conjunto de situaciones sociales generado originalmente con GPT-3.5. Los autores ajustan cinco generadores expertos LLaMA-3-8B-Instruct, uno por rasgo, con los extremos superior e inferior de PsychGenerator. Después combinan sus logits con LLaMA-3-70B-Instruct mediante una variante de DExperts y producen 100.000 diálogos sintéticos de un solo turno: 20.000 por rasgo, equilibrados entre nivel alto y bajo. Por ello, «human-grounded» describe la señal de personalidad heredada de publicaciones humanas, no la autoría humana de BIG5-CHAT. Un clasificador RoBERTa-large entrenado en PsychGenerator alcanza 93,8 % en su test binarizado y asigna correctamente el nivel objetivo al 80,4 % de las salidas del generador, frente a 59,2 % para una línea base GPT-4o-mini. Esta evaluación comparte dominio y datos de origen con el generador, y el apéndice muestra que clasificadores entrenados con Big Five Essay solo alcanzan aproximadamente 50–60 %, señal de escasa generalización entre dominios. Sobre BIG5-CHAT se ajustan LLaMA-3-8B-Instruct y 70B-Instruct mediante LoRA con SFT y DPO; se comparan con inferencia directa y prompts de instrucción o demostración. En BFI-44 e IPIP-NEO-120, repetidos cinco veces a temperatura 0,6, todas las intervenciones separan en alguna medida niveles altos y bajos. SFT y DPO suelen empujar con más fuerza los extremos, sobre todo las puntuaciones bajas, y en 70B se acercan a los límites 5 y 1 de las escalas; no aparece una ventaja sustancial y uniforme de DPO sobre SFT. Sin embargo, el apéndice muestra que prompts con palabras clave, ítems MPI o descripciones generadas por LLM pueden igualar o superar algunos resultados de ajuste, aunque los autores los excluyen de la comparación principal por su solapamiento léxico con los cuestionarios. Las correlaciones internas entre rasgos se acercan más a una referencia humana con SFT: la distancia de Frobenius es 1,55, frente a 2,10 para prompting y 2,06 para DPO, pero persisten discrepancias, especialmente en Neuroticism. Dos estudiantes de posgrado comparan 200 pares de respuestas; BIG5-CHAT gana a un baseline por prompt en expresividad el 50,3 % y en realismo el 47,8 %, con 39,8 % y 42,3 % de empates y kappas 0,50 y 0,55. En razonamiento, el resultado más favorable corresponde al SFT de 70B, con mejoras medias en razonamiento social, matemático y de sentido común; no supera de forma uniforme al modelo directo en TruthfulQA o conocimiento general. Los resultados de 8B son mucho más inestables: DPO colapsa HumanEval en varias condiciones, SFT reduce fuertemente GSM8K y los efectos de Agreeableness y Neuroticism son débiles o contradictorios. Por tanto, el estudio aporta evidencia de control de patrones de respuesta bajo un pipeline concreto, pero no demuestra que una personalidad cause mejor razonamiento. Las diferencias pueden proceder del método y los datos de ajuste. La discusión de alucinación se basa en ejemplos cualitativos escogidos, no en una métrica sistemática. Tampoco se estudian combinaciones de rasgos, diálogos prolongados, estabilidad temporal, otros idiomas o efectos sobre usuarios.
Pregunta de investigación
¿Puede construirse un corpus conversacional basado en señales humanas de los Big Five para alinear LLM mediante SFT o DPO, inducir niveles altos y bajos más claramente que con prompting y relacionar esos perfiles de salida con el rendimiento en tareas de razonamiento?