BIG5-CHAT: Shaping LLM Personalities Through Training on...

Inducción y control de rasgos2024OpenReviewRevisión editorial aprobada

Título original: BIG5-CHAT: Shaping LLM Personalities Through Training on Human-Grounded Data

Autores: Wenkai Li, Jiarui Liu, Andy Liu, Xuhui Zhou, Mona Diab, Maarten Sap

Palabras clave: Computation and Language, Personality traits, Human-grounded data

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
7
Hallazgos
7
Limitaciones
6
Evidencias

Resumen editorial

Español

La versión final publicada en ACL 2025 de BIG5-CHAT presenta una cadena de generación y entrenamiento para expresar niveles altos o bajos de los cinco rasgos Big Five en respuestas de LLM. Su base empírica no es un corpus final escrito por personas: parte de PsychGenerator, 846.304 publicaciones de Facebook asociadas a puntuaciones de personalidad de sus autores, y de 10.000 escenarios de SODA, un conjunto de situaciones sociales generado originalmente con GPT-3.5. Los autores ajustan cinco generadores expertos LLaMA-3-8B-Instruct, uno por rasgo, con los extremos superior e inferior de PsychGenerator. Después combinan sus logits con LLaMA-3-70B-Instruct mediante una variante de DExperts y producen 100.000 diálogos sintéticos de un solo turno: 20.000 por rasgo, equilibrados entre nivel alto y bajo. Por ello, «human-grounded» describe la señal de personalidad heredada de publicaciones humanas, no la autoría humana de BIG5-CHAT. Un clasificador RoBERTa-large entrenado en PsychGenerator alcanza 93,8 % en su test binarizado y asigna correctamente el nivel objetivo al 80,4 % de las salidas del generador, frente a 59,2 % para una línea base GPT-4o-mini. Esta evaluación comparte dominio y datos de origen con el generador, y el apéndice muestra que clasificadores entrenados con Big Five Essay solo alcanzan aproximadamente 50–60 %, señal de escasa generalización entre dominios. Sobre BIG5-CHAT se ajustan LLaMA-3-8B-Instruct y 70B-Instruct mediante LoRA con SFT y DPO; se comparan con inferencia directa y prompts de instrucción o demostración. En BFI-44 e IPIP-NEO-120, repetidos cinco veces a temperatura 0,6, todas las intervenciones separan en alguna medida niveles altos y bajos. SFT y DPO suelen empujar con más fuerza los extremos, sobre todo las puntuaciones bajas, y en 70B se acercan a los límites 5 y 1 de las escalas; no aparece una ventaja sustancial y uniforme de DPO sobre SFT. Sin embargo, el apéndice muestra que prompts con palabras clave, ítems MPI o descripciones generadas por LLM pueden igualar o superar algunos resultados de ajuste, aunque los autores los excluyen de la comparación principal por su solapamiento léxico con los cuestionarios. Las correlaciones internas entre rasgos se acercan más a una referencia humana con SFT: la distancia de Frobenius es 1,55, frente a 2,10 para prompting y 2,06 para DPO, pero persisten discrepancias, especialmente en Neuroticism. Dos estudiantes de posgrado comparan 200 pares de respuestas; BIG5-CHAT gana a un baseline por prompt en expresividad el 50,3 % y en realismo el 47,8 %, con 39,8 % y 42,3 % de empates y kappas 0,50 y 0,55. En razonamiento, el resultado más favorable corresponde al SFT de 70B, con mejoras medias en razonamiento social, matemático y de sentido común; no supera de forma uniforme al modelo directo en TruthfulQA o conocimiento general. Los resultados de 8B son mucho más inestables: DPO colapsa HumanEval en varias condiciones, SFT reduce fuertemente GSM8K y los efectos de Agreeableness y Neuroticism son débiles o contradictorios. Por tanto, el estudio aporta evidencia de control de patrones de respuesta bajo un pipeline concreto, pero no demuestra que una personalidad cause mejor razonamiento. Las diferencias pueden proceder del método y los datos de ajuste. La discusión de alucinación se basa en ejemplos cualitativos escogidos, no en una métrica sistemática. Tampoco se estudian combinaciones de rasgos, diálogos prolongados, estabilidad temporal, otros idiomas o efectos sobre usuarios.

English

The final ACL 2025 version of BIG5-CHAT presents a generation and training pipeline for expressing high or low levels of each Big Five trait in LLM responses. Its empirical basis is not a final human-written dialogue corpus. It starts from PsychGenerator, 846,304 Facebook posts linked to their authors' personality scores, and 10,000 SODA scenarios, themselves originally generated with GPT-3.5. The authors fine-tune five LLaMA-3-8B-Instruct expert generators, one per trait, on the upper and lower ends of PsychGenerator. They then combine expert logits with LLaMA-3-70B-Instruct through a DExperts-style method and produce 100,000 synthetic single-turn dialogues: 20,000 per trait, balanced between high and low levels. “Human-grounded” therefore refers to personality signals inherited from human social-media posts, not human authorship of BIG5-CHAT. A RoBERTa-large classifier trained on PsychGenerator reaches 93.8% on its binarized test set and assigns the intended level to 80.4% of expert-generator outputs, versus 59.2% for a GPT-4o-mini baseline. This evaluator shares the generator's source domain, and appendix experiments with Big Five Essay classifiers reach only about 50–60%, exposing weak cross-domain generalization. LLaMA-3-8B-Instruct and 70B-Instruct are aligned on BIG5-CHAT with LoRA-based SFT and DPO and compared with direct inference and instruction- or demonstration-based prompting. Across BFI-44 and IPIP-NEO-120, repeated five times at temperature 0.6, all interventions produce some high–low separation. SFT and DPO usually push scores closer to the scale extremes, especially for low-trait conditions, but DPO has no consistent overall advantage over SFT. Appendix baselines using keywords, MPI items, or LLM-written descriptions can match or exceed some fine-tuning results, although the authors exclude them from the main comparison because of lexical overlap with the questionnaires. SFT best approximates the selected human within-trait correlation matrix, with Frobenius distance 1.55 versus 2.10 for prompting and 2.06 for DPO, while notable discrepancies remain, especially for Neuroticism. Two graduate annotators compare 200 response pairs: BIG5-CHAT beats a prompt baseline on expressiveness in 50.3% of cases and realism in 47.8%, with 39.8% and 42.3% ties and kappa values of 0.50 and 0.55. The most favorable reasoning result is 70B SFT, which improves average social, mathematical, and commonsense performance, but does not uniformly beat direct inference on TruthfulQA or general knowledge. Results for 8B are far less stable: DPO collapses HumanEval in several conditions, SFT sharply reduces GSM8K, and Agreeableness and Neuroticism effects are weak or contradictory. The study therefore supports controllable output patterns under one pipeline, not a causal claim that personality improves reasoning. Training method and data remain confounded. Its hallucination discussion uses selected qualitative examples rather than a systematic metric, and the work does not test multi-trait combinations, long conversations, temporal stability, other languages, or user effects.

Pregunta de investigación

¿Puede construirse un corpus conversacional basado en señales humanas de los Big Five para alinear LLM mediante SFT o DPO, inducir niveles altos y bajos más claramente que con prompting y relacionar esos perfiles de salida con el rendimiento en tareas de razonamiento?

Método

Pipeline experimental en cuatro etapas. Cinco LLaMA-3-8B-Instruct se ajustan como generadores expertos con publicaciones PsychGenerator de los tercios alto y bajo de cada rasgo. Sus logits se combinan con LLaMA-3-70B-Instruct para reescribir respuestas en 10.000 escenarios SODA y crear 100.000 diálogos sintéticos de un turno. Un RoBERTa-large entrenado en PsychGenerator y dos evaluaciones humanas examinan la expresión de rasgos. LLaMA-3-8B-Instruct y 70B-Instruct se alinean con LoRA mediante SFT y DPO y se comparan con prompting usando BFI-44, IPIP-NEO-120, matrices de correlación y benchmarks de razonamiento; cada cuestionario se repite cinco veces a temperatura 0,6.

Muestra: Cien mil diálogos sintéticos de un turno, 20.000 por rasgo y equilibrados por nivel, derivados de 10.000 escenarios SODA y señales aprendidas de 846.304 publicaciones PsychGenerator. Dos modelos LLaMA-3 se evalúan con cinco repeticiones de dos inventarios. La evaluación humana usa dos estudiantes de posgrado y 200 comparaciones por estudio; no incluye una muestra representativa de usuarios ni psicólogos clínicos.

Hallazgos

  • El clasificador RoBERTa entrenado en PsychGenerator obtiene 93,8 % en su test binarizado, 80,4 % al evaluar al generador experto y 59,2 % sobre la línea base GPT-4o-mini; esa ventaja se mide dentro del mismo dominio de datos.
  • SFT y DPO producen separaciones altas–bajas más extremas que los baselines principales en BFI e IPIP-NEO, sobre todo en LLaMA-3-70B, pero no hay una diferencia sustancial general entre SFT y DPO.
  • SFT reproduce mejor la matriz humana de correlaciones entre rasgos según distancia de Frobenius: 1,55 frente a 2,10 para prompting y 2,06 para DPO; la aproximación sigue siendo imperfecta, en especial para Neuroticism.
  • Frente a prompting, BIG5-CHAT gana el 50,3 % de comparaciones humanas de expresividad y el 47,8 % de realismo; los empates son 39,8 % y 42,3 %, con acuerdo moderado entre dos anotadores.
  • En el modelo 70B, SFT logra el mejor promedio de razonamiento y mejora especialmente tareas sociales, matemáticas y de sentido común, pero no supera consistentemente al modelo directo en TruthfulQA y conocimiento general.
  • En 8B los efectos no son robustos: DPO degrada gravemente HumanEval en varias condiciones, SFT colapsa GSM8K para muchos rasgos y Agreeableness y Neuroticism no siguen una relación estable con el rendimiento.
  • La validación con Big Five Essay cae aproximadamente al 50–60 %, lo que cuestiona que el clasificador y los patrones aprendidos se transfieran fuera de PsychGenerator.

Limitaciones

  • BIG5-CHAT es sintético: SODA fue generado con GPT-3.5 y las respuestas finales proceden de LLM; la señal humana proviene indirectamente de publicaciones de Facebook, cuya muestra tiene sesgos demográficos, culturales y de plataforma.
  • El generador y el clasificador evaluador aprenden de PsychGenerator. La evaluación automática puede premiar los mismos patrones de dominio en lugar de validez psicológica externa, y falla al generalizar a Big Five Essay.
  • BFI e IPIP-NEO se puntúan como medidas humanas sin demostrar invariancia ni equivalencia métrica para LLM; la saturación cerca de 1 y 5 puede reflejar seguimiento explícito de etiquetas y solapamiento lingüístico.
  • Solo dos estudiantes de posgrado evalúan 200 pares y no son expertos en psicología; el tamaño y el perfil de anotación limitan las afirmaciones de realismo humano.
  • La personalidad, el método de ajuste, los ejemplos y las etiquetas explícitas cambian a la vez, por lo que las diferencias de razonamiento no identifican un efecto causal del rasgo.
  • El análisis se limita al inglés, a rasgos aislados y a diálogos de un turno; no examina combinaciones Big Five, estabilidad longitudinal, interacción prolongada ni efectos reales sobre personas.
  • La discusión sobre sesgo y alucinación es cualitativa y usa ejemplos seleccionados; no aporta una tasa sistemática ni una evaluación de seguridad.

Qué no demuestra

  • No demuestra que LLaMA posea personalidad, estados mentales o rasgos humanos internos; demuestra control de respuestas bajo instrucciones y ajuste concretos.
  • No demuestra que BIG5-CHAT esté escrito por personas ni que sus diálogos sean observaciones naturales; es un corpus sintético apoyado indirectamente en señales humanas.
  • No prueba que SFT o DPO sean universalmente superiores al prompting, porque algunos prompts adicionales del apéndice igualan o superan resultados y el rendimiento depende del modelo y el instrumento.
  • No establece que un rasgo de personalidad cause mejor razonamiento ni que los patrones humanos se transfieran a LLM; los resultados de 8B y varios dominios contradicen una regla general.
  • No valida el clasificador PsychGenerator como medida de personalidad fuera de su dominio ni las puntuaciones BFI/IPIP como equivalentes a puntuaciones humanas.
  • No demuestra seguridad, ausencia de estereotipos o idoneidad para personalización en aplicaciones reales.

Trazabilidad

Alcance: Texto completo

Versión: ACL 2025 Long Paper, pp. 20434–20471

Fuente consultada: https://aclanthology.org/2025.acl-long.999.pdf

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • LLaMA-3-8B-Instruct
  • LLaMA-3-70B-Instruct
  • GPT-4o-mini
  • GPT-4o
  • RoBERTa-large personality classifier

Instrumentos y métricas

  • Big Five Inventory (44 items)
  • IPIP-NEO-120
  • PsychGenerator-derived five-head personality classifier
  • Pairwise human evaluation of expressiveness and realism
  • Within-trait correlation matrices and Frobenius distance
  • LIWC2015 linguistic analysis

Datos utilizados

  • PsychGenerator (846,304 Facebook posts)
  • SODA (10,000 sampled scenarios)
  • BIG5-CHAT (100,000 synthetic single-turn dialogues)
  • PAPI-120-600K human IPIP-NEO response data
  • Big Five Essay (2,468 essays)
  • SocialIQA, GSM8K, MathQA, TruthfulQA, CommonsenseQA, PIQA, MMLU, GPQA, HumanEval and MBPP

Evidencia y localización

  • Construcción de generadores expertos y origen humano/sintético de los datos: ACL 2025, pp. 20436–20439, sections 3–5.1 and Table 1
  • Resultados de cuestionarios, razonamiento y límites declarados: ACL 2025, pp. 20439–20443, sections 5.2–8 and Tables 2–4
  • Evaluaciones humanas y acuerdo entre anotadores: ACL 2025, pp. 20454–20456, Appendix E.1–E.2 and Tables 10–11
  • Baselines adicionales, correlaciones internas y razonamiento completo: ACL 2025, pp. 20457–20465, Appendices E.3–F.2 and Tables 12–15
  • Generalización a Big Five Essay y aclaración del pipeline sintético: ACL 2025, pp. 20451–20453 and 20466–20467, Appendices D.1 and H; Figure 5
  • Sesgo, alucinación y análisis lingüístico: ACL 2025, pp. 20465–20471, Appendices G–I and Table 16