Diagnosing and Repairing Persona Collapse in LLM Advice

Personas, identidad y agentes2026arXivRevisión editorial aprobada

Autores: Harsh Kumar, Karina Vold, Louis Tay, Ashton Anderson

Palabras clave: persona collapse, LLM advice, situation-conditioned persona, post-training, inverse-process distillation, human preference, alignment

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
6
Hallazgos
7
Limitaciones
4
Evidencias

Resumen editorial

Español

El artículo define “persona collapse” como el uso casi invariable de una postura de consejo aunque cambie la situación. Representa cinco posturas en dos ejes, tono hedónico y apoyo a la agencia, y etiqueta con gpt-5.4-nano 1.281 respuestas mejor votadas de 14 contextos de Reddit. Las respuestas humanas se distribuyen entre Healer/Guide (49,2 %), Doomer (21,6 %), Stoic (14,7 %), Enabler (9,4 %) y Technician (5,1 %); GPT-5.1, Claude Opus 4.5 y Gemini 3 Pro concentran entre 89,2 % y 99,8 % en Healer. Esta referencia describe normas comunitarias, no calidad o eficacia del consejo. El juez alcanza 60,0 % de acuerdo exacto promedio sobre dos ejes y 84,1 % cuando se tolera ±1 en el eje de agencia. Para reparar el patrón, se crea un corpus de 8.262 pares y se comparan seis condiciones en OLMo3-7B, Llama-3.1-8B y Qwen3-4B. El fine-tuning aumenta diversidad y mejora kappa, pero la selección sigue débil (aproximadamente 0,194–0,215 para Inverse-Process) y confunde desafío constructivo con dureza corrosiva. La afirmación del abstract de reducir la divergencia “aproximadamente 80 %” no coincide con la Tabla 13: de Instruct a Inverse-Process la reducción JS es 62,3 %, 60,2 % y 61,1 % en los tres modelos. El estudio humano prerregistrado conserva 199 de 300 participantes y contradice su hipótesis principal: todas las variantes SFT reciben puntuaciones mucho peores que Instruct en ajuste, comprensión y honestidad, y mayores en daño; solo el cambio dentro de cuatro exposiciones es exploratorio. No se miden resultados longitudinales ni beneficio real. La versión de trabajo no enlaza código, datos, checkpoints o salidas, por lo que no permite reproducción independiente completa.

English

The paper defines “persona collapse” as using nearly the same advisory posture even when the situation changes. It places five postures in a two-axis space, hedonic tone and support for agency, and uses gpt-5.4-nano to label 1,281 top-voted responses from 14 Reddit contexts. Human responses distribute across Healer/Guide (49.2%), Doomer (21.6%), Stoic (14.7%), Enabler (9.4%), and Technician (5.1%), whereas GPT-5.1, Claude Opus 4.5, and Gemini 3 Pro place 89.2% to 99.8% of responses in Healer. This human reference describes community norms, not advice quality or effectiveness. The judge achieves 60.0% average exact agreement across the two axes and 84.1% when allowing ±1 on agency. For repair, the authors build an 8,262-item corpus and compare six conditions on OLMo3-7B, Llama-3.1-8B, and Qwen3-4B. Fine-tuning increases diversity and improves kappa, but item selection remains weak, approximately 0.194–0.215 for Inverse-Process, and repeatedly confuses constructive challenge with corrosive harshness. The abstract’s claim of reducing divergence by “approximately 80%” does not match Table 13: from Instruct to Inverse-Process, JS reduction is 62.3%, 60.2%, and 61.1% across the three models. The preregistered human study retains 199 of 300 recruits and contradicts its primary hypothesis: every SFT variant scores much worse than Instruct on tone fit, understanding, and truth, and higher on harm; only the change across four exposures is exploratory. No longitudinal outcome or actual benefit is measured. The working draft links no public code, data, checkpoints, or outputs, preventing full independent reproduction.

Pregunta de investigación

¿Los modelos eligen una postura de consejo sensible al contexto, puede repararse una concentración excesiva en apoyo cálido y prefieren las personas las respuestas reparadas?

Método

Diagnóstico de 1.281 posts en 14 contextos con etiquetas LLM sobre dos ejes; corpus de reparación de 8.262 ítems con split 80/20; seis intervenciones en tres modelos abiertos; bootstrap por ítem; y estudio humano prerregistrado, ciego e intraparticipante.

Muestra: 1.281 situaciones diagnósticas; 8.262 ítems de entrenamiento/reparación con 1.652 en test; tres modelos abiertos; 300 reclutados y 199 participantes retenidos, cada uno con cuatro posts y seis respuestas por post.

Hallazgos

  • Los modelos frontier concentran 89,2–99,8 % de respuestas en Healer.
  • Plan-First empeora diversidad y divergencia en los tres modelos.
  • SFT restaura diversidad, pero la alineación por ítem sigue siendo baja.
  • La reducción JS de Inverse-Process es alrededor de 60–62 %, no 80 %.
  • Los participantes prefieren claramente Instruct y juzgan las variantes SFT más dañinas.
  • La disminución de la brecha en cuatro rondas es exploratoria y no longitudinal.

Limitaciones

  • Los votos de comunidades no son ground truth de buen consejo.
  • El marco de cinco posturas comprime respuestas mixtas y depende de un juez LLM con acuerdo moderado.
  • El split es por ítem y los artefactos del corpus no son públicos.
  • El fine-tuning reproduce respuestas humanas y un razonamiento reconstruido a posteriori.
  • La evaluación es mayoritariamente monovuelta.
  • No hay resultados clínicos, conductuales o de bienestar a largo plazo.
  • No hay repositorio público reproducible en v1.

Qué no demuestra

  • No demuestra que una postura confrontativa ayude más al usuario.
  • No valida las respuestas más votadas como consejo verdadero o seguro.
  • No prueba que el modelo posea personas internas discretas.
  • No demuestra una reducción del 80 % en los tres modelos.
  • No muestra preferencia o ayuda longitudinal.
  • No autoriza uso clínico o de crisis.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2607.08326v1 working draft; complete 32-page PDF and TeX source; AsPredicted #292682 verified; no public code/data repository identified

Fuente consultada: https://arxiv.org/abs/2607.08326v1

Revisión: Codex 32-page visual full-text, TeX, preregistration, arithmetic, human-study and artifact audit, 2026-07-18

Aprobación: Codex fidelity pass, 2026-07-18

Modelos evaluados

  • GPT-5.1
  • Claude Opus 4.5
  • Gemini 3 Pro
  • gpt-5.4-nano (judge)
  • OLMo3-7B-Instruct
  • Llama-3.1-8B-Instruct
  • Qwen3-4B-Instruct
  • frontier reasoning teacher

Instrumentos y métricas

  • Hedonic tone H (-1, 0, +1)
  • Agency depth E (-2 to +2)
  • Five advisory persona regions
  • Effective number of personas
  • Jensen-Shannon divergence
  • Macro-recall and Cohen kappa
  • Five 7-point human-rating items and two rankings

Datos utilizados

  • 1,281-item diagnostic Reddit corpus
  • 8,262-item Reddit/Stack Exchange/CounselChat/CareerNet repair corpus
  • 165-post human-evaluation pool

Evidencia y localización

  • Marco, corpus diagnóstico y concentración Healer: arXiv v1, sections 3–4 and Figures 1–3
  • Reparación y resultados por modelo: arXiv v1, section 5 and Appendix Table 13
  • Prerregistro y estudio humano: AsPredicted #292682; arXiv v1, section 6 and Appendix H
  • Límites y ausencia de resultados reales: arXiv v1, sections 7–8