Maintaining Stable Personas? Examining Temporal Stability in LLM-Based Human Simulation

Personas, identidad y agentes2026arXivRevisión editorial aprobada

Título original: Stable Personas: Dual-Assessment of Temporal Stability in LLM-Based Human Simulation

Autores: Jana Gonnermann-Müller, Jennifer Haase, Nicolas Leins, Thomas Kosch, Sebastian Pokutta

Palabras clave: Large Language Models, Personality, Persona, Personality Control, AI Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
20
Hallazgos
89
Limitaciones
14
Evidencias

Resumen editorial

Español

La publicación definitiva de este trabajo se titula “Maintaining Stable Personas? Examining Temporal Stability in LLM-Based Human Simulation”, apareció en CHI EA 2026 y tiene DOI 10.1145/3772363.3799334. Esta revisión audita sus seis páginas completas y el manuscrito metodológico ampliado arXiv:2601.22812v2, de 19 páginas, revisado el 20 de mayo de 2026. El título antiguo “Stable Personas: Dual-Assessment…” se conserva solo como título original. No se localizó repositorio, dataset ni código oficial público; el source de arXiv contiene LaTeX y figuras, pero no los outputs, scripts o configuración ejecutable.

El estudio no prueba una “personalidad” completa. Construye cuatro condiciones de intensidad de síntomas ADHD: high, moderate, low y default sin persona. Los prompts textuales convierten criterios DSM/ICD en descripciones con “frequently”, “sometimes” o “rarely”; el prompt de escala fija inattention, hyperactivity e impulsivity en 6/7, 3/7 o 1/7; una tercera variante parafrasea el texto. Son instrucciones explícitas para representar frecuencia de síntomas, no perfiles de personas con historia, edad, contexto, fortalezas, impairment, subtipo, comorbilidad o diversidad real. La afirmación de que las tres variantes son semánticamente equivalentes no se valida y sus resultados absolutos difieren sustancialmente.

Se prueban siete modelos, Claude Sonnet 4.5, DeepSeek V3.2, GPT-5.1, GPT OSS 120B, Gemini 3 Pro, Grok 4.1 y Llama 3.3 70B, con defaults de cada proveedor. Los modelos comerciales usan APIs oficiales y los open-weight, Ollama. No se publican IDs inmutables, fecha exacta por llamada, temperatura/top-p/top-k, cuantización, versión de Ollama, seeds, retries ni código. Usar defaults busca representar una experiencia típica, pero confunde arquitectura, alineamiento, proveedor y decoding; además impide repetir el experimento cuando cambien aliases y valores por defecto.

El Experimento I genera una narración en primera persona de un día laboral y un self-report de 12 ítems del CAARS ADHD Index. Apunta a 3.500 ejecuciones y conserva 3.473 después de 0,77% de attrition. Tres LLM, Claude, GPT-5.1 y Gemini, califican cada narración con la forma observer. La publicación informa una separación ordenada: low Self M=1,22, Obs M=0,56; moderate 18,1/15,5; high 29,1/20,3. El default, sin prompt, es revelador: Self M=14,7 pero Observer M=2,16. Es decir, el mismo modelo se autodescribe con síntomas moderados aunque su texto apenas los muestra a observadores. Esto no es evidencia de una representación interna estable; es una disociación entre obediencia al cuestionario y expresión textual.

La aparente estabilidad de high y low está favorecida por suelo y techo. Low queda casi en cero y high cerca del máximo 36, por lo que ambos tienen menos espacio para variar; moderate y default ocupan el centro y presentan SD mayores. Los autores lo reconocen parcialmente en CHI. La varianza atribuida a persona, 92,3% del self-report y 89,5% del observer, tampoco es una medida pura de estabilidad: el denominador incluye diferencias deliberadamente enormes entre prompts low y high. Ese contraste hace que modelo, prompt y residual parezcan pequeños. Aun así, el suplemento muestra diferencias prácticas grandes: en moderate, el self-report medio cambia de 15,1 con scale prompt a 21,1 con text prompt; el observer de Claude es 10,0 frente a 18,6 en GPT-5.1. “Menos del 1%” global no significa que prompt o modelo sean intercambiables.

El Experimento II apunta a 1.400 conversaciones y conserva 1.370; cada una dura 18 turnos y se evalúa en 6, 12 y 18. El self-report permanece casi constante: high +0,2, moderate 0, low +0,18 y default +0,4 sobre 36. En cambio, el observer baja high de 17,5 a 14,0 y moderate de 13,2 a 10,8; low y default suben ligeramente. Ese descenso es descriptivo: no se informa un test o intervalo para una interacción persona×turn. El mixed model trata turn como factor aleatorio con solo tres niveles y reporta 1,32% de varianza global; ese promedio puede ocultar direcciones opuestas por intensidad y no estima una pendiente temporal.

La medición observer tampoco compara ventanas equivalentes. En cada checkpoint, los jueces califican “the accumulated turns”: turn 12 incluye 1–12 y turn 18 incluye 1–18. Las tres observaciones están anidadas y comparten todo el texto previo. Añadir conversación neutral puede diluir la densidad de marcadores de síntomas o cambiar la heurística del juez sobre un texto más largo aunque la conducta posterior no derive. La fiabilidad entre jueces cae de ICC .83 en turn 6 a .75 y .69, reforzando que la tarea de evaluación cambia con la longitud. Para demostrar drift harían falta ventanas no solapadas, coding por turno y un modelo de slope/interaction con incertidumbre.

La validación humana aparece en el suplemento arXiv, no en el extended abstract definitivo. Cinco psicólogos con máster califican solo veinte narraciones: seis high, seis moderate, seis low y dos default, procedentes únicamente de Claude y Gemini y de dos formatos. El ICC humano–LLM agregado es .95, pero su CI [.57, .99] es muy amplio y la separación extrema de grupos puede inflarlo. No valida los otros cinco modelos, el prompt parafraseado, las conversaciones de 18 turnos, la sensibilidad al drift o la similitud con adultos con ADHD. Humanos y LLM pueden coincidir al reconocer los mismos estereotipos explícitos sin que los textos reproduzcan distribución, heterogeneidad o conducta humana.

La analogía “multi-informant” debe leerse con cautela. En psicología clínica, self e informant aportan observaciones parcialmente independientes sobre una persona real. Aquí el self-report es otra salida del modelo que conoce el prompt y el observer es un LLM que infiere los síntomas desde texto sintético. Claude, GPT y Gemini actúan además como persona y como jueces dentro del mismo estudio, permitiendo auto-familia y sesgos compartidos. CAARS está validado para adultos humanos, no como métrica de un generador. No hay ground truth humano, diagnóstico, dataset de pacientes ni calibración de qué score debería corresponder a low/moderate/high.

La especificación estadística es insuficiente para varias conclusiones. Modelo tiene siete niveles, prompt tres y turn tres, pero se tratan como random effects; no se justifican esas poblaciones ni se dan intervalos de componentes. El índice es discreto y acotado, sin diagnóstico de residuos. No hay preregistro, hipótesis cuantitativas, power, corrección por comparaciones de modelos/prompts o análisis de missingness. La attrition global parece baja, pero llega al 30% en Grok-default del Experimento II y 10% en GPT OSS-default del I, por lo que no es uniforme. Las fórmulas de N del suplemento son incorrectas: la de Exp I imprime 7×4×3×50+7×50=4.550, no 3.500; la de Exp II, tal como está escrita, da 224, no 1.400. Las tablas de celdas sí suman los targets correctos.

La publicación CHI y arXiv v2 también discrepan en estadísticas del mismo Experimento I y N=3.473. CHI da low observer M=0,56, SD=2,37 y moderate self M=18,1, SD=4,14; arXiv v2 da 0,35/1,88 y 18,50/3,99. Default observer es 2,16/1,76 frente a 2,19/1,75. No se documenta una versión de dataset o análisis que explique el cambio. Esta revisión prioriza las cifras definitivas de CHI y conserva las del suplemento como discrepancia, no como si ambas fueran simultáneamente exactas.

La conclusión defendible es estrecha: prompts de frecuencia extrema hacen que siete LLM produzcan scores CAARS ordenados y relativamente repetibles, sobre todo cuando se les pregunta directamente por los mismos síntomas. En conversación neutral, jueces LLM perciben menos marcadores high/moderate en prefijos acumulativos más largos. Esto es útil como alerta de que self-report y expresión observable no son intercambiables y de que se debe medir variabilidad en varios puntos. No demuestra simulación humana válida, ADHD realista, una representación interna, estabilidad de personalidad, comportamiento multi-agente, seguridad clínica ni que reprompting corrija el problema.

English

The definitive publication is titled “Maintaining Stable Personas? Examining Temporal Stability in LLM-Based Human Simulation,” appeared in CHI EA 2026, and has DOI 10.1145/3772363.3799334. This review audits all six pages and the expanded 19-page methodological manuscript arXiv:2601.22812v2, revised 20 May 2026. The old title “Stable Personas: Dual-Assessment…” is retained only as the original title. No official public repository, dataset, or code was found; the arXiv source contains LaTeX and figures but not outputs, scripts, or an executable configuration.

The study does not test a complete “personality.” It constructs four ADHD symptom-intensity conditions: high, moderate, low, and default without a persona. Text prompts turn DSM/ICD criteria into descriptions using “frequently,” “sometimes,” or “rarely”; a scale prompt fixes inattention, hyperactivity, and impulsivity at 6/7, 3/7, or 1/7; a third variant paraphrases the text. These are explicit instructions to portray symptom frequency, not people with histories, ages, contexts, strengths, impairment, subtypes, comorbidities, or real diversity. Semantic equivalence among the three prompts is not validated, and their absolute results differ substantially.

Seven models are tested, Claude Sonnet 4.5, DeepSeek V3.2, GPT-5.1, GPT OSS 120B, Gemini 3 Pro, Grok 4.1, and Llama 3.3 70B, with provider defaults. Commercial models use official APIs and open-weight models use Ollama. Immutable IDs, per-call dates, temperature/top-p/top-k, quantization, Ollama version, seeds, retries, and code are not released. Defaults are intended to represent typical usage, but they conflate architecture, alignment, provider, and decoding, and make replication impossible when aliases or defaults change.

Experiment I generates a first-person workday narrative and a 12-item CAARS ADHD Index self-report. It targets 3,500 runs and retains 3,473 after .77% attrition. Three LLMs, Claude, GPT-5.1, and Gemini, rate each narrative using the observer form. The definitive paper reports ordered separation: low Self M=1.22, Obs M=.56; moderate 18.1/15.5; high 29.1/20.3. The default condition is revealing: Self M=14.7 while Observer M=2.16. The same unprompted model describes itself as moderately symptomatic while observers see little symptom expression. This is not evidence of a stable internal representation; it is a dissociation between questionnaire compliance and generated behavior.

Apparent high/low stability is aided by floor and ceiling effects. Low is near zero and high near the maximum 36, leaving less room to vary; moderate and default occupy the center and have larger SDs. CHI partly acknowledges this. Persona's 92.3% self-report and 89.5% observer variance shares are not pure stability metrics either: the denominator includes deliberately huge low-versus-high prompt differences, making model, prompt, and residual shares look small. Yet the supplement shows large practical differences: moderate self-report ranges from 15.1 with the scale prompt to 21.1 with the text prompt; Claude's moderate observer mean is 10.0 versus 18.6 for GPT-5.1. A global share below 1% does not make prompts or models interchangeable.

Experiment II targets 1,400 conversations and retains 1,370; each lasts 18 turns and is assessed at turns 6, 12, and 18. Self-report barely changes: high +.2, moderate 0, low +.18, and default +.4 on a 36-point scale. Observer ratings fall from 17.5 to 14.0 for high and 13.2 to 10.8 for moderate; low and default rise slightly. The decline is descriptive: no test or interval is reported for a persona-by-turn interaction. The mixed model treats turn as a random factor with only three levels and reports 1.32% global variance; this average can conceal opposite directions across intensities and does not estimate a temporal slope.

Observer measurement also compares non-equivalent windows. At each checkpoint judges rate “the accumulated turns”: turn 12 contains 1–12 and turn 18 contains 1–18. Measurements are nested and share all earlier text. Adding neutral conversation can dilute symptom-marker density or alter judge heuristics on longer text even if later behavior has not drifted. Inter-rater reliability falls from ICC .83 at turn 6 to .75 and .69, reinforcing that the rating task changes with transcript length. Demonstrating drift would require non-overlapping windows, turn-level coding, and a slope/interaction model with uncertainty.

Human validation appears in the arXiv supplement, not the definitive extended abstract. Five master's-level psychologists rate only twenty narratives: six high, six moderate, six low, and two default, from Claude and Gemini under two prompt formats. Aggregated human–LLM ICC is .95, but its CI [.57, .99] is very wide and extreme group separation can inflate agreement. It does not validate the other five models, the paraphrased prompt, 18-turn conversations, drift sensitivity, or similarity to adults with ADHD. Humans and LLMs may agree on explicit stereotypes without the texts reproducing human distributions, heterogeneity, or behavior.

The “multi-informant” analogy is limited. In clinical psychology, self and informant provide partly independent observations about a real person. Here self-report is another output from a model that knows the prompt, while observer report is an LLM inference from synthetic text. Claude, GPT, and Gemini also act as both personas and judges in the study, allowing same-family and shared-bias effects. CAARS is validated for human adults, not as a generator metric. There is no human ground truth, patient dataset, diagnosis, or calibration of what score should correspond to low/moderate/high.

The statistical specification is insufficient for several claims. Model has seven levels, prompt three, and turn three, yet all are random effects; the sampled populations are not justified and component intervals are absent. The index is bounded and discrete without residual diagnostics. There is no preregistration, quantitative hypothesis, power analysis, correction for model/prompt comparisons, or missingness analysis. Overall attrition looks small but reaches 30% for Grok-default in Experiment II and 10% for GPT OSS-default in I. The supplement's N formulas are wrong: its Experiment I expression yields 4,550 rather than 3,500, and its written Experiment II expression yields 224 rather than 1,400. Cell tables do sum to the correct targets.

CHI and arXiv v2 also disagree on statistics for the same Experiment I and N=3,473. CHI reports low observer M=.56, SD=2.37 and moderate self M=18.1, SD=4.14; arXiv v2 reports .35/1.88 and 18.50/3.99. Default observer is 2.16/1.76 versus 2.19/1.75. No dataset or analysis version explains the change. This review prioritizes the definitive CHI figures and records the supplement values as a discrepancy rather than treating both as simultaneously exact.

The defensible conclusion is narrow: extreme frequency prompts make seven LLMs produce ordered and relatively repeatable CAARS scores, especially when directly asked about the symptoms they were instructed to portray. During neutral conversation, LLM judges perceive fewer high/moderate markers in longer cumulative prefixes. This usefully warns that self-report and observable expression are not interchangeable and that variability should be measured at multiple points. It does not demonstrate valid human simulation, realistic ADHD, an internal representation, personality stability, multi-agent behavior, clinical safety, or that reprompting fixes the issue.

Pregunta de investigación

¿Repiten siete LLM de forma consistente una intensidad de síntomas ADHD instruida entre generaciones independientes y durante una conversación de 18 turnos, según self-report CAARS y ratings observer realizados principalmente por otros LLM?

Método

Dos experimentos factoriales con siete modelos, tres formatos de prompt y condiciones high/moderate/low/default. Exp I: 3.473 narraciones de un día laboral y self-reports CAARS, con tres jueces LLM. Exp II: 1.370 conversaciones neutrales de 18 turnos, evaluadas acumulativamente en 6/12/18. Se resumen medias/SD y se descompone varianza con modelos lineales mixtos. El suplemento añade cinco psicólogos calificando 20 narraciones.

Muestra: No hay muestra de personas simuladas reales ni adultos con ADHD. Las unidades son generaciones LLM: 3.473 en Exp I y 1.370 conversaciones en Exp II. La única participación humana descrita en arXiv v2 son cinco psicólogos con máster que califican 20 textos sintéticos; no se detallan reclutamiento, compensación, selección de narrativas o revisión ética.

Hallazgos

  • La publicación definitiva de CHI EA 2026 usa un título distinto y DOI 10.1145/3772363.3799334.
  • Exp I conserva 3.473 de 3.500 runs; Exp II conserva 1.370 de 1.400 conversaciones.
  • Los scores definitivos se ordenan low < moderate < high en self-report y observer.
  • En CHI, low tiene Self 1,22 y Observer 0,56; moderate 18,1/15,5; high 29,1/20,3.
  • Default sin persona produce Self 14,7 pero Observer 2,16, una gran disociación interna/observable.
  • High y low presentan SD menores, compatibles en parte con techo y suelo.
  • Moderate self-report difiere seis puntos entre scale prompt (15,1) y text prompt (21,1) en el suplemento.
  • Moderate observer difiere 8,6 puntos entre Claude (10,0) y GPT-5.1 (18,6).
  • La descomposición atribuye 92,3%/89,5% a persona en Exp I, dominada por el contraste low-high.
  • Self-report cambia solo +0,2 high, 0 moderate, +0,18 low y +0,4 default entre turn 6 y 18.
  • Observer baja 3,5 puntos en high y 2,4 en moderate, y sube ligeramente en low/default.
  • La varianza global de turn se estima en 0% self-report y 1,32% observer.
  • Los judges califican prefijos acumulativos, no ventanas independientes de seis turnos.
  • La fiabilidad LLM observer cae de ICC .83 a .75 y .69 a medida que crece la transcripción.
  • Cinco psicólogos y jueces LLM coinciden en 20 narraciones con ICC agregado .95, CI [.57,.99].
  • La validación humana solo cubre dos target models, dos prompts y 20 textos.
  • La attrition por celda alcanza 30% en Grok-default Exp II y 10% en GPT OSS-default Exp I.
  • Las fórmulas escritas de sample size en arXiv v2 no producen los targets declarados.
  • CHI y arXiv v2 publican medias/SD distintas para el mismo N sin explicar la versión analítica.
  • El resultado robusto es estabilidad de respuestas instruidas; la validez como simulación humana no se evalúa.

Limitaciones

  • El artículo definitivo es un extended abstract de seis páginas y omite detalles del suplemento.
  • El suplemento arXiv está maquetado como submission ICML y no es idéntico a la versión CHI.
  • No hay código, datos, outputs, ratings ni entorno ejecutable públicos.
  • No existe repositorio oficial localizado por título, arXiv ID o autores.
  • No se pueden reproducir modelos comerciales ni sus aliases históricos.
  • Los provider defaults no se enumeran numéricamente.
  • No se reportan temperature, top-p, top-k, max tokens o seeds por modelo.
  • No se reportan retries, caching, concurrencia o control de independencia entre runs.
  • Ollama no tiene versión, quantization, hardware ni flags documentados.
  • Arquitectura, alignment, proveedor y decoding están confundidos.
  • Las personas son intensidades de síntomas, no personas completas.
  • Los prompts reducen ADHD a descriptores explícitos de frecuencia.
  • No incluyen onset, impairment, contextos múltiples, subtipos o diagnóstico diferencial.
  • No incluyen fortalezas, coping, tratamiento, comorbilidad o heterogeneidad neurodiversa.
  • Low ADHD equivale a ausencia estereotipada de síntomas y no a una distribución humana.
  • Default no es un control equivalente porque carece de longitud y contenido del persona prompt.
  • Los tres formatos no tienen validación de equivalencia semántica.
  • El scale prompt es estructuralmente distinto y contiene anchors numéricos explícitos.
  • Las diferencias de media por prompt contradicen una equivalencia práctica simple.
  • CAARS está validado para adultos humanos, no para outputs LLM.
  • No hay calibración entre high/moderate/low y scores CAARS esperados.
  • No hay muestra humana con ADHD ni distribución de referencia.
  • No se mide realismo, representatividad o sensibilidad/especificidad clínica.
  • Self-report pregunta al modelo por los mismos síntomas que el prompt le ordena representar.
  • Cumplimiento estable del cuestionario no implica representación interna.
  • El término internal persona representation antropomorfiza una salida condicionada.
  • Default self-report moderado y observer casi nulo cuestionan la interpretación del self-report.
  • High y low están cerca de techo/suelo, restringiendo SD.
  • SD absoluta no separa estabilidad de floor/ceiling o calibración incorrecta.
  • La varianza de persona está inflada por extremos construidos deliberadamente.
  • Un porcentaje residual pequeño depende del rango total entre condiciones.
  • Porcentajes pequeños de model/prompt ocultan diferencias absolutas grandes.
  • No se dan intervalos de confianza para componentes de varianza.
  • No se explica cómo se atribuye varianza al fixed effect persona.
  • Modelo tiene solo siete niveles como random effect.
  • Prompt tiene solo tres niveles como random effect.
  • Turn tiene solo tres niveles como random effect.
  • Turn debería modelarse como tendencia/contraste para probar drift.
  • No se estima ni prueba interacción persona×turn.
  • Declines de -3,5 y -2,4 carecen de CI o test inferencial.
  • El promedio global de turn puede cancelar high/moderate a la baja con low/default al alza.
  • La fórmula LMM no modela explícitamente slope temporal por conversación o modelo.
  • Los checkpoints acumulativos comparten texto y no son observaciones independientes.
  • Turn 12 contiene turnos 1–12 y turn 18 contiene 1–18.
  • La densidad de síntomas puede diluirse al añadir conversación neutral.
  • Los judges pueden cambiar heurística con la longitud del input.
  • La fiabilidad de jueces disminuye en cada checkpoint.
  • No se analizan ventanas 1–6, 7–12 y 13–18 por separado.
  • No hay coding por turno de conductas observables.
  • No se aclara qué backend genera el neutral conversation partner.
  • No se aclara si los self-reports de checkpoint permanecen en el contexto y reanclan la persona.
  • El partner neutral ofrece pocas oportunidades naturales para expresar hyperactivity/impulsivity.
  • Una narración laboral y charla neutral no cubren conducta transituacional.
  • Las conversaciones solo duran 18 turnos.
  • No hay interacción entre varias personas o agentes con roles sociales.
  • No se prueba negociación, confianza, grupo u opinion dynamics.
  • Tres jueces LLM no son informants independientes de entrenamiento/alineamiento.
  • Claude, GPT y Gemini son simultáneamente targets y evaluadores.
  • No se informa prevención de auto-family evaluation.
  • ICC(2,1) es fiabilidad single-rater aunque se agregan tres jueces.
  • El ICC no establece construct validity ni realismo humano.
  • La validación humana N=20 es muy pequeña.
  • Solo hay dos textos default en validación humana.
  • Solo Claude y Gemini aparecen como target models en validación.
  • Solo se validan text y scale, no paraphrase.
  • No se valida ninguna conversación larga o cambio temporal.
  • El CI human–LLM [.57,.99] es muy amplio.
  • La separación artificial de intensidades puede inflar ICC de convergencia.
  • Los cinco psicólogos tienen máster, pero no se informa experiencia ADHD.
  • No se informa selección aleatoria de las 20 narraciones.
  • No se informa reclutamiento, compensación, conflictos o ética de human raters.
  • No hay preregistro ni protocolo analítico previo.
  • No hay power analysis o target de precisión.
  • No se diagnostican residuos de un outcome discreto 0–36.
  • No hay análisis robusto/ordinal/binomial alternativo.
  • No se corrigen comparaciones descriptivas por modelo y prompt.
  • La missingness se atribuye a API/JSON pero no se prueba que sea aleatoria.
  • La attrition global oculta 30% en una celda y 10% en otra.
  • Exp I formula N como 7×4×3×50+7×50, que da 4.550.
  • La fórmula correcta Exp I es 7×(3×3×50+50)=3.500.
  • Exp II omite ×20 en el producto principal y su expresión da 224.
  • Las estadísticas CHI/arXiv difieren sin changelog de datos o análisis.
  • El abstract CHI llama N=4.054 assessments sin mencionar 12.201 observer ratings.
  • No hay licencias o gobernanza publicadas para outputs y ratings.
  • No se examinan sesgos culturales, de género, edad o presentación ADHD.
  • No se evalúa daño de estereotipar una condición clínica en agentes.
  • La recomendación de reprompting no se prueba experimentalmente.
  • La estabilidad de CAARS no demuestra validez para prototype testing.
  • La generalización a personalidad, educación, terapia y social simulation no está probada.

Qué no demuestra

  • No establece que los LLM simulen personas humanas válidamente.
  • No demuestra que los textos reproduzcan adultos con ADHD.
  • No demuestra estabilidad de personalidad general.
  • No demuestra una representación interna o autoconocimiento del modelo.
  • No demuestra que self-report LLM tenga el significado de self-report humano.
  • No demuestra equivalencia entre los tres prompts.
  • No demuestra que modelo y prompt sean irrelevantes en magnitud práctica.
  • No demuestra drift conductual separado de dilución y heurística del juez.
  • No demuestra un slope temporal significativo o generalizable.
  • No demuestra estabilidad más allá de 18 turnos.
  • No valida los siete modelos con humanos.
  • No demuestra estabilidad en multi-agent social simulation.
  • No demuestra seguridad o utilidad clínica/educativa.
  • No prueba que reprompting periódico prevenga el descenso observer.
  • No permite reproducir resultados desde artefactos públicos.

Trazabilidad

Alcance: Texto completo

Versión: Definitive CHI EA 2026 extended abstract, DOI 10.1145/3772363.3799334, 6 pages; audited with arXiv:2601.22812v2 methodological supplement, 19 pages

Fuente consultada: https://hcistudio.org/publication/gonnermann2026maintaining/gonnermann2026maintaining.pdf

Revisión: Codex definitive-CHI, full-text bilingual-fidelity, 6-page publisher visual, 19-page arXiv-v2 visual, DOI/title reconciliation, source-package, prompt-construct, clinical-measure, human-validation, LLM-judge, mixed-model, variance-denominator, floor-ceiling, longitudinal-window, attrition, arithmetic, cross-version consistency, reproducibility, ethics and multi-agent-claim audit; summaries written from the complete sources rather than abstract keyword extraction, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Anthropic Claude Sonnet 4.5, exact API snapshot not reported, persona and observer judge
  • DeepSeek V3.2, reported as 685B, exact API snapshot not reported, persona
  • OpenAI GPT-5.1, exact API snapshot not reported, persona and observer judge
  • OpenAI GPT OSS 120B via local Ollama, quantization and runtime version not reported, persona
  • Google Gemini 3 Pro, exact API snapshot not reported, persona and observer judge
  • xAI Grok 4.1, exact API snapshot not reported, persona
  • Meta Llama 3.3 70B via local Ollama, quantization and runtime version not reported, persona
  • A neutral conversation-partner LLM/prompt whose backend assignment is not clearly identified

Instrumentos y métricas

  • Three ADHD symptom-intensity prompt formats: text, 1–7 scale, and paraphrase
  • Default condition with no persona instruction
  • First-person typical-workday narrative task
  • Neutral open-question conversation-partner prompt
  • Conners Adult ADHD Rating Scales 12-item ADHD Index self-report, range 0–36
  • Parallel CAARS observer-report ratings from Claude, GPT-5.1, and Gemini
  • Standard deviation within experimental cells as the primary stability descriptor
  • Linear mixed-effects variance decomposition with persona fixed and model/prompt random
  • Conversation and turn random effects in Experiment II
  • Supplementary human annotation by five M.Sc.-level psychologists on 20 narratives

Datos utilizados

  • Experiment I target 3,500 runs; 3,473 retained after 27 failures
  • Experiment I: 3,473 self-reports and 10,419 LLM observer assessments
  • Experiment II target 1,400 conversations; 1,370 retained after 30 failures
  • Experiment II: 4,054 self-reports and 12,201 LLM observer assessments at three checkpoints
  • Twenty-narrative human-validation subset in arXiv v2: 6 high, 6 moderate, 6 low, 2 default, from Claude/Gemini and two prompts
  • Definitive six-page CHI EA 2026 paper, DOI 10.1145/3772363.3799334
  • Nineteen-page arXiv:2601.22812v2 methodological supplement and source package
  • No public raw conversations, questionnaire outputs, ratings, analysis code, model configs, or environment found as of 15 July 2026

Evidencia y localización

  • Publicación definitiva, título, DOI y páginas: CHI EA 2026 official author-hosted PDF, DOI 10.1145/3772363.3799334, pp. 1–6
  • Diseño, modelos y prompts: Definitive CHI paper Sections 2–2.2 and Appendix Table 3; arXiv:2601.22812v2 Sections 2.1–2.3 and Appendix A.1–A.3
  • Resultados definitivos Exp I: Definitive CHI paper Section 3 and Figure 1
  • Resultados definitivos Exp II: Definitive CHI paper Section 3 and Figure 2
  • Varianza y especificación LMM: Definitive CHI paper Section 2.2 and Appendix Tables 1–2; arXiv v2 Equations 1–2
  • Conteos y attrition por celda: arXiv:2601.22812v2 Appendix Tables 7–8, pp. 13–14
  • Fórmulas N incorrectas: arXiv v2 Section 2.4; independent arithmetic versus Appendix Table 7 targets
  • Model/prompt absolute differences: arXiv v2 Section 3.1 and Appendix Tables 9–10
  • Checkpoints acumulativos y declining ICC: arXiv v2 Sections 2.1 and 2.3; observer ICC .83/.75/.69
  • Validación humana suplementaria: arXiv v2 Section 2.3: five M.Sc. psychologists, 20 narratives, ICC and CIs
  • Discrepancias CHI versus arXiv v2: Definitive CHI Section 3 versus arXiv v2 Table 1 and Section 3.1 for the same N=3,473
  • Limitaciones reconocidas: Definitive CHI Section 4.1; arXiv v2 Section 4.1
  • Ausencia de repositorio/datos/código: Official PDF, arXiv v2 source package, exact-title/arXiv-ID GitHub searches on 15 July 2026
  • Inspección visual completa: All 6 definitive CHI pages and all 19 arXiv v2 pages rendered and visually inspected on 15 July 2026