PERSIST estudia cuánto cambia la respuesta de un modelo al mismo ítem de personalidad cuando varía el contexto de administración. Combina BFI-44 y Short Dark Triad, 71 ítems y ocho rasgos en total, con versiones reformuladas para LLM, orden aleatorio, paráfrasis, cinco perfiles de persona destacados, razonamiento activado o desactivado e historial conversacional. El método enumera 29 modelos de ocho familias, de 1B a 671B parámetros, aunque el abstract y la introducción dicen 25 modelos open-source de 1B a 685B; el paper no reconcilia esas cifras. Las ejecuciones principales usan temperatura 0, 250 runs declarados y preguntas de una en una; los experimentos de razonamiento usan temperatura 0,6 y Claude se limita a 70 runs. La métrica central es la desviación estándar de la respuesta 1–5 a cada ítem entre ejecuciones, agregada después por modelo y rasgo.
El patrón descriptivo es claro. La variabilidad por pregunta disminuye al aumentar el tamaño del modelo (Spearman, p<0,001), pero no desaparece y los autores muestran SD superiores a 0,3 incluso en modelos de más de 400B. La perplejidad no cambia con el tamaño (p=0,934), aunque correlaciona moderadamente con la SD por pregunta (rho=0,465). Los scores medios se vuelven más altos en apertura, consciencia, extraversión y amabilidad y más bajos en neuroticismo y Dark Triad al escalar; esto puede reflejar alignment, extremidad y efectos techo, no una personalidad más prosocial. Las versiones adaptadas a LLM no reducen la SD frente a los cuestionarios originales (Wilcoxon p=0,286) y elevan la perplejidad (p<0,001), por lo que eliminar referencias humanas no basta para estabilizar respuestas.
Las intervenciones producen efectos heterogéneos. En GPT-OSS, más reasoning effort eleva la SD; Qwen 3, Qwen 3 MoE, DeepSeek y Claude muestran mayor variabilidad con razonamiento en los análisis agregados, mientras la perplejidad suele bajar. Las personas buddhist y teacher reducen la SD frente al assistant; schizophrenia la aumenta junto con la perplejidad, pero antisocial no cambia significativamente la SD (p=0,260), de modo que el abstract exagera al generalizar el aumento a «misaligned personas» en plural. Las paráfrasis aumentan la variabilidad solo en el grupo de cuatro modelos de al menos 50B según el contraste publicado (p<0,01; modelos menores p=0,244). El historial conversacional aumenta la SD en los 19 modelos menores de 50B y la reduce en los cuatro mayores; el delta se correlaciona negativamente con tamaño (rho=-0,512, p=0,0126).
El artefacto permite inspeccionar cuestionarios, prompts, generador y scripts, pero no reproducir los resultados: el repositorio oficial no contiene outputs brutos, CSV preprocesados, figuras ni logs, y no ofrece release de datos. Además, el código actual trata las diferencias modelo×pregunta como observaciones independientes en los Wilcoxon de paráfrasis e historial, aunque las Tablas 3–4 presentan n como número de modelos; el análisis de razonamiento también usa Mann–Whitney sobre preguntas pese a que muchas comparaciones están emparejadas. Esa pseudorreplicación puede hacer los p-valores demasiado optimistas. El generador interpreta n_iter de forma inclusiva: n_iter=250 produce 251 condiciones y n_iter=100 produce 101, sin que existan configuraciones de ejecución para saber qué se lanzó realmente. El banco BFI contiene 4.399 paráfrasis, 4.377 únicas, y «Can be moody» solo tiene 99, no 100.
La evidencia respalda que estos autoinformes 1–5 son sensibles al contexto, al wording y al modo de inferencia, y que un score único no representa una medida estable. No demuestra que los modelos carezcan de toda consistencia conductual, que la SD elegida prediga fallos de seguridad reales o que exista una carencia arquitectónica. Los cuestionarios originales y adaptados carecen de validación psicométrica para LLM, no se evalúa conducta externa y el umbral SD>0,3 no se justifica como peligroso. PERSIST es una batería útil para detectar fragilidad de administración; sus conclusiones de seguridad deben leerse como hipótesis motivadas, no como certificación empírica de riesgo.