La publicación definitiva de este trabajo se titula “Maintaining Stable Personas? Examining Temporal Stability in LLM-Based Human Simulation”, apareció en CHI EA 2026 y tiene DOI 10.1145/3772363.3799334. Esta revisión audita sus seis páginas completas y el manuscrito metodológico ampliado arXiv:2601.22812v2, de 19 páginas, revisado el 20 de mayo de 2026. El título antiguo “Stable Personas: Dual-Assessment…” se conserva solo como título original. No se localizó repositorio, dataset ni código oficial público; el source de arXiv contiene LaTeX y figuras, pero no los outputs, scripts o configuración ejecutable.
El estudio no prueba una “personalidad” completa. Construye cuatro condiciones de intensidad de síntomas ADHD: high, moderate, low y default sin persona. Los prompts textuales convierten criterios DSM/ICD en descripciones con “frequently”, “sometimes” o “rarely”; el prompt de escala fija inattention, hyperactivity e impulsivity en 6/7, 3/7 o 1/7; una tercera variante parafrasea el texto. Son instrucciones explícitas para representar frecuencia de síntomas, no perfiles de personas con historia, edad, contexto, fortalezas, impairment, subtipo, comorbilidad o diversidad real. La afirmación de que las tres variantes son semánticamente equivalentes no se valida y sus resultados absolutos difieren sustancialmente.
Se prueban siete modelos, Claude Sonnet 4.5, DeepSeek V3.2, GPT-5.1, GPT OSS 120B, Gemini 3 Pro, Grok 4.1 y Llama 3.3 70B, con defaults de cada proveedor. Los modelos comerciales usan APIs oficiales y los open-weight, Ollama. No se publican IDs inmutables, fecha exacta por llamada, temperatura/top-p/top-k, cuantización, versión de Ollama, seeds, retries ni código. Usar defaults busca representar una experiencia típica, pero confunde arquitectura, alineamiento, proveedor y decoding; además impide repetir el experimento cuando cambien aliases y valores por defecto.
El Experimento I genera una narración en primera persona de un día laboral y un self-report de 12 ítems del CAARS ADHD Index. Apunta a 3.500 ejecuciones y conserva 3.473 después de 0,77% de attrition. Tres LLM, Claude, GPT-5.1 y Gemini, califican cada narración con la forma observer. La publicación informa una separación ordenada: low Self M=1,22, Obs M=0,56; moderate 18,1/15,5; high 29,1/20,3. El default, sin prompt, es revelador: Self M=14,7 pero Observer M=2,16. Es decir, el mismo modelo se autodescribe con síntomas moderados aunque su texto apenas los muestra a observadores. Esto no es evidencia de una representación interna estable; es una disociación entre obediencia al cuestionario y expresión textual.
La aparente estabilidad de high y low está favorecida por suelo y techo. Low queda casi en cero y high cerca del máximo 36, por lo que ambos tienen menos espacio para variar; moderate y default ocupan el centro y presentan SD mayores. Los autores lo reconocen parcialmente en CHI. La varianza atribuida a persona, 92,3% del self-report y 89,5% del observer, tampoco es una medida pura de estabilidad: el denominador incluye diferencias deliberadamente enormes entre prompts low y high. Ese contraste hace que modelo, prompt y residual parezcan pequeños. Aun así, el suplemento muestra diferencias prácticas grandes: en moderate, el self-report medio cambia de 15,1 con scale prompt a 21,1 con text prompt; el observer de Claude es 10,0 frente a 18,6 en GPT-5.1. “Menos del 1%” global no significa que prompt o modelo sean intercambiables.
El Experimento II apunta a 1.400 conversaciones y conserva 1.370; cada una dura 18 turnos y se evalúa en 6, 12 y 18. El self-report permanece casi constante: high +0,2, moderate 0, low +0,18 y default +0,4 sobre 36. En cambio, el observer baja high de 17,5 a 14,0 y moderate de 13,2 a 10,8; low y default suben ligeramente. Ese descenso es descriptivo: no se informa un test o intervalo para una interacción persona×turn. El mixed model trata turn como factor aleatorio con solo tres niveles y reporta 1,32% de varianza global; ese promedio puede ocultar direcciones opuestas por intensidad y no estima una pendiente temporal.
La medición observer tampoco compara ventanas equivalentes. En cada checkpoint, los jueces califican “the accumulated turns”: turn 12 incluye 1–12 y turn 18 incluye 1–18. Las tres observaciones están anidadas y comparten todo el texto previo. Añadir conversación neutral puede diluir la densidad de marcadores de síntomas o cambiar la heurística del juez sobre un texto más largo aunque la conducta posterior no derive. La fiabilidad entre jueces cae de ICC .83 en turn 6 a .75 y .69, reforzando que la tarea de evaluación cambia con la longitud. Para demostrar drift harían falta ventanas no solapadas, coding por turno y un modelo de slope/interaction con incertidumbre.
La validación humana aparece en el suplemento arXiv, no en el extended abstract definitivo. Cinco psicólogos con máster califican solo veinte narraciones: seis high, seis moderate, seis low y dos default, procedentes únicamente de Claude y Gemini y de dos formatos. El ICC humano–LLM agregado es .95, pero su CI [.57, .99] es muy amplio y la separación extrema de grupos puede inflarlo. No valida los otros cinco modelos, el prompt parafraseado, las conversaciones de 18 turnos, la sensibilidad al drift o la similitud con adultos con ADHD. Humanos y LLM pueden coincidir al reconocer los mismos estereotipos explícitos sin que los textos reproduzcan distribución, heterogeneidad o conducta humana.
La analogía “multi-informant” debe leerse con cautela. En psicología clínica, self e informant aportan observaciones parcialmente independientes sobre una persona real. Aquí el self-report es otra salida del modelo que conoce el prompt y el observer es un LLM que infiere los síntomas desde texto sintético. Claude, GPT y Gemini actúan además como persona y como jueces dentro del mismo estudio, permitiendo auto-familia y sesgos compartidos. CAARS está validado para adultos humanos, no como métrica de un generador. No hay ground truth humano, diagnóstico, dataset de pacientes ni calibración de qué score debería corresponder a low/moderate/high.
La especificación estadística es insuficiente para varias conclusiones. Modelo tiene siete niveles, prompt tres y turn tres, pero se tratan como random effects; no se justifican esas poblaciones ni se dan intervalos de componentes. El índice es discreto y acotado, sin diagnóstico de residuos. No hay preregistro, hipótesis cuantitativas, power, corrección por comparaciones de modelos/prompts o análisis de missingness. La attrition global parece baja, pero llega al 30% en Grok-default del Experimento II y 10% en GPT OSS-default del I, por lo que no es uniforme. Las fórmulas de N del suplemento son incorrectas: la de Exp I imprime 7×4×3×50+7×50=4.550, no 3.500; la de Exp II, tal como está escrita, da 224, no 1.400. Las tablas de celdas sí suman los targets correctos.
La publicación CHI y arXiv v2 también discrepan en estadísticas del mismo Experimento I y N=3.473. CHI da low observer M=0,56, SD=2,37 y moderate self M=18,1, SD=4,14; arXiv v2 da 0,35/1,88 y 18,50/3,99. Default observer es 2,16/1,76 frente a 2,19/1,75. No se documenta una versión de dataset o análisis que explique el cambio. Esta revisión prioriza las cifras definitivas de CHI y conserva las del suplemento como discrepancia, no como si ambas fueran simultáneamente exactas.
La conclusión defendible es estrecha: prompts de frecuencia extrema hacen que siete LLM produzcan scores CAARS ordenados y relativamente repetibles, sobre todo cuando se les pregunta directamente por los mismos síntomas. En conversación neutral, jueces LLM perciben menos marcadores high/moderate en prefijos acumulativos más largos. Esto es útil como alerta de que self-report y expresión observable no son intercambiables y de que se debe medir variabilidad en varios puntos. No demuestra simulación humana válida, ADHD realista, una representación interna, estabilidad de personalidad, comportamiento multi-agente, seguridad clínica ni que reprompting corrija el problema.