Persistent Instability in LLM's Personality Measurements: Effects of Scale, Reasoning, and Conversation History

Evaluación y validez psicométrica2026AAAI ProceedingsRevisión editorial aprobada

Autores: Tommaso Tosato, Saskia Helbling, Yorguin-Jose Mantilla-Ramos, Mahmood Hegazy, Alberto Tosato, David John Lemay, Irina Rish, Guillaume Dumas

Palabras clave: Computation and Language, Artificial Intelligence, Large Language Models, Personality Measurements, Model Behavior Consistency

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

8
Autores
16
Hallazgos
28
Limitaciones
17
Evidencias

Resumen editorial

Español

PERSIST estudia cuánto cambia la respuesta de un modelo al mismo ítem de personalidad cuando varía el contexto de administración. Combina BFI-44 y Short Dark Triad, 71 ítems y ocho rasgos en total, con versiones reformuladas para LLM, orden aleatorio, paráfrasis, cinco perfiles de persona destacados, razonamiento activado o desactivado e historial conversacional. El método enumera 29 modelos de ocho familias, de 1B a 671B parámetros, aunque el abstract y la introducción dicen 25 modelos open-source de 1B a 685B; el paper no reconcilia esas cifras. Las ejecuciones principales usan temperatura 0, 250 runs declarados y preguntas de una en una; los experimentos de razonamiento usan temperatura 0,6 y Claude se limita a 70 runs. La métrica central es la desviación estándar de la respuesta 1–5 a cada ítem entre ejecuciones, agregada después por modelo y rasgo.

El patrón descriptivo es claro. La variabilidad por pregunta disminuye al aumentar el tamaño del modelo (Spearman, p<0,001), pero no desaparece y los autores muestran SD superiores a 0,3 incluso en modelos de más de 400B. La perplejidad no cambia con el tamaño (p=0,934), aunque correlaciona moderadamente con la SD por pregunta (rho=0,465). Los scores medios se vuelven más altos en apertura, consciencia, extraversión y amabilidad y más bajos en neuroticismo y Dark Triad al escalar; esto puede reflejar alignment, extremidad y efectos techo, no una personalidad más prosocial. Las versiones adaptadas a LLM no reducen la SD frente a los cuestionarios originales (Wilcoxon p=0,286) y elevan la perplejidad (p<0,001), por lo que eliminar referencias humanas no basta para estabilizar respuestas.

Las intervenciones producen efectos heterogéneos. En GPT-OSS, más reasoning effort eleva la SD; Qwen 3, Qwen 3 MoE, DeepSeek y Claude muestran mayor variabilidad con razonamiento en los análisis agregados, mientras la perplejidad suele bajar. Las personas buddhist y teacher reducen la SD frente al assistant; schizophrenia la aumenta junto con la perplejidad, pero antisocial no cambia significativamente la SD (p=0,260), de modo que el abstract exagera al generalizar el aumento a «misaligned personas» en plural. Las paráfrasis aumentan la variabilidad solo en el grupo de cuatro modelos de al menos 50B según el contraste publicado (p<0,01; modelos menores p=0,244). El historial conversacional aumenta la SD en los 19 modelos menores de 50B y la reduce en los cuatro mayores; el delta se correlaciona negativamente con tamaño (rho=-0,512, p=0,0126).

El artefacto permite inspeccionar cuestionarios, prompts, generador y scripts, pero no reproducir los resultados: el repositorio oficial no contiene outputs brutos, CSV preprocesados, figuras ni logs, y no ofrece release de datos. Además, el código actual trata las diferencias modelo×pregunta como observaciones independientes en los Wilcoxon de paráfrasis e historial, aunque las Tablas 3–4 presentan n como número de modelos; el análisis de razonamiento también usa Mann–Whitney sobre preguntas pese a que muchas comparaciones están emparejadas. Esa pseudorreplicación puede hacer los p-valores demasiado optimistas. El generador interpreta n_iter de forma inclusiva: n_iter=250 produce 251 condiciones y n_iter=100 produce 101, sin que existan configuraciones de ejecución para saber qué se lanzó realmente. El banco BFI contiene 4.399 paráfrasis, 4.377 únicas, y «Can be moody» solo tiene 99, no 100.

La evidencia respalda que estos autoinformes 1–5 son sensibles al contexto, al wording y al modo de inferencia, y que un score único no representa una medida estable. No demuestra que los modelos carezcan de toda consistencia conductual, que la SD elegida prediga fallos de seguridad reales o que exista una carencia arquitectónica. Los cuestionarios originales y adaptados carecen de validación psicométrica para LLM, no se evalúa conducta externa y el umbral SD>0,3 no se justifica como peligroso. PERSIST es una batería útil para detectar fragilidad de administración; sus conclusiones de seguridad deben leerse como hipótesis motivadas, no como certificación empírica de riesgo.

English

PERSIST studies how much a model's response to the same personality item changes when the administration context changes. It combines the 44-item BFI and 27-item Short Dark Triad, 71 items and eight traits in total, with LLM-adapted versions, random order, paraphrases, five highlighted persona profiles, reasoning on or off, and conversation history. The method enumerates 29 models from eight families, spanning 1B to 671B parameters, although the abstract and introduction claim 25 open-source models spanning 1B to 685B; the paper does not reconcile these counts. Main experiments use temperature 0, a reported 250 runs, and one question per turn. Reasoning experiments use temperature 0.6, and Claude is limited to 70 runs. The central metric is the standard deviation of each 1–5 item response across runs, later aggregated by model and trait.

The descriptive pattern is clear. Question-level variability decreases with model size (Spearman, p<0.001), but does not vanish, and the authors display standard deviations above 0.3 even for models larger than 400B. Perplexity does not change with size (p=0.934), although it correlates moderately with question-level SD (rho=0.465). Mean scores become higher for Openness, Conscientiousness, Extraversion, and Agreeableness and lower for Neuroticism and Dark Triad traits as models scale. This can reflect alignment, extremity, and ceiling effects rather than a more prosocial personality. LLM-adapted instruments do not reduce SD relative to the originals (Wilcoxon p=0.286) and increase perplexity (p<0.001), so removing human-specific references is not sufficient to stabilize responses.

Interventions have heterogeneous effects. Greater reasoning effort raises SD in GPT-OSS; Qwen 3, Qwen 3 MoE, DeepSeek, and Claude show higher variability with reasoning in the aggregated analyses, while perplexity usually falls. Buddhist and teacher personas reduce SD relative to the assistant; the schizophrenia persona increases both SD and perplexity, but the antisocial persona does not significantly change SD (p=0.260), so the abstract overstates the result when it generalizes higher variability to plural 'misaligned personas.' Paraphrases increase variability only in the published group of four models at least 50B (p<0.01; smaller models p=0.244). Conversation history raises SD for the 19 models below 50B and lowers it for the four larger models; the change correlates negatively with size (rho=-0.512, p=0.0126).

The artifact exposes questionnaires, prompts, generation code, and analysis scripts, but it does not reproduce the results: the official repository contains no raw outputs, preprocessed CSVs, figures, or logs, and has no data release. The current code also treats model-by-question differences as independent observations in the paraphrase and history Wilcoxon tests even though Tables 3 and 4 label n as the number of models; the reasoning analysis likewise applies Mann–Whitney to question-level values although many comparisons are paired. This pseudoreplication can make p-values too optimistic. The generator interprets n_iter inclusively: n_iter=250 creates 251 conditions and n_iter=100 creates 101, while no run configurations or data are available to establish what was actually executed. The BFI bank contains 4,399 paraphrases, 4,377 unique strings, and only 99 entries for 'Can be moody,' not 100.

The evidence supports the conclusion that these 1–5 self-reports are sensitive to context, wording, and inference mode, and that a single score is not a stable measurement. It does not establish that models lack every form of behavioral consistency, that the selected SD predicts real safety failures, or that an architectural deficiency has been identified. Neither the original nor adapted questionnaires has psychometric validation for LLMs, no external behavior is tested, and SD >0.3 is not justified as a hazardous threshold. PERSIST is a useful stress test for administration fragility; its safety conclusions should be read as motivated hypotheses rather than empirical risk certification.

Pregunta de investigación

¿Hasta qué punto son estables los scores de BFI y Dark Triad de los LLM ante cambios de tamaño, persona, razonamiento, wording, orden e historial conversacional, y reducen esa inestabilidad el escalado o instrumentos adaptados?

Método

Batería experimental multifactorial. Se administran BFI-44 y SD3-27, junto con BFI-LLM y SD3-LLM, a una lista declarada de 29 modelos. Las preguntas se responden individualmente en escala 1–5 bajo 250 runs declarados de orden, 100 paráfrasis declaradas, personas assistant/buddhist/teacher/antisocial/schizophrenia, y depression en figuras suplementarias, con y sin historial y con varios modos de razonamiento. Se calcula media por rasgo, SD de cada ítem entre runs y perplejidad del token de respuesta. Se aplican correlaciones de Spearman, Wilcoxon, Kruskal–Wallis/Dunn y Mann–Whitney. La auditoría leyó la versión oficial y la extendida, renderizó tablas y figuras, revisó el repositorio oficial en cee3b5ff8291bd794b0f751f10f9f2761fdccfd7, compiló estáticamente el Python, contó cuestionarios/paráfrasis y ejecutó el generador sin inferencia para comprobar su semántica de iteraciones.

Muestra: No hay participantes humanos nuevos. Cada respuesta de modelo a un ítem es una observación, repetida bajo permutaciones o paráfrasis. El método enumera 29 modelos; las figuras principales de escalado muestran 24 configuraciones y los experimentos de razonamiento añaden familias/modos específicos. Todos los experimentos se declaran con 250 runs salvo Claude, con 70, pero el generador público crea n_iter+1 condiciones. Cada run con una respuesta inválida se excluye completo: la versión extendida informa 0% de runs inválidos para escalado, paráfrasis e historial, 0,07% para personas y 0,35% para razonamiento.

Hallazgos

  • La SD media por pregunta decrece con el tamaño de modelo (Spearman p<0,001), mientras la perplejidad no muestra relación con tamaño (p=0,934).
  • La perplejidad y la SD por pregunta correlacionan de forma moderada en el análisis de escala (rho=0,465), por lo que la incertidumbre del token explica solo parte de la variación.
  • Incluso modelos de más de 400B presentan en las figuras SD superiores a 0,3 en la escala 1–5; el trabajo no define un umbral externo de aceptabilidad.
  • Con tamaño, los scores positivos suben (p=0,001) y los negativos bajan (p<0,001), pero los propios autores advierten posibles efectos techo y alejamiento de normas humanas.
  • Las versiones LLM-adapted no cambian significativamente la SD respecto a las originales (p=0,286) y aumentan la perplejidad (p<0,001).
  • GPT-OSS muestra mayor SD con mayor reasoning effort; los análisis agregados reportan más SD con razonamiento en Qwen 3, Qwen 3 MoE, DeepSeek y Claude.
  • La perplejidad suele bajar al activar razonamiento aun cuando la SD sube, de modo que mayor confianza local no implica mayor estabilidad entre runs.
  • Buddhist reduce scores negativos (p<0,001), SD (p=0,005) y perplejidad (p=0,020) frente a assistant; la diferencia de scores positivos no es significativa.
  • Teacher aumenta scores positivos, reduce negativos y reduce SD (p=0,021), sin cambio significativo de perplejidad.
  • Antisocial cambia scores medios en la dirección inducida, pero no cambia significativamente SD (p=0,260) ni perplejidad (p=0,098).
  • Schizophrenia reduce scores positivos, eleva negativos, SD (p<0,05) y perplejidad (p<0,001).
  • El efecto de paráfrasis sobre SD tiende a crecer con tamaño (rho=0,39, p=0,0671); el contraste publicado es no significativo bajo 50B (n=19, p=0,244) y positivo desde 50B (n=4, p<0,01).
  • El historial conversacional tiene un delta de SD inversamente relacionado con tamaño (rho=-0,512, p=0,0126).
  • Según las Tablas 4, el historial eleva la SD bajo 50B y la reduce desde 50B, ambos p<0,001; esos p-valores proceden de diferencias modelo×pregunta, no de 19 y 4 unidades independientes de modelo.
  • El paper declara más de dos millones de respuestas, pero el repositorio no publica los datos necesarios para verificar el total o recomputar figuras y tests.
  • La tasa de runs inválidos reportada es baja: 0,35% en razonamiento, 0,07% en persona y 0% en los otros tres bloques.

Limitaciones

  • El abstract dice 25 modelos open-source y 1B–685B, mientras la sección de modelos enumera 29 incluyendo Claude y dice 1B–671B; no hay tabla de inclusión que reconcilie cifras y experimentos.
  • La sección afirma que DeepSeek solo participa en razonamiento, pero las figuras de escalado incluyen DeepSeek V3.
  • La metodología enumera cinco personas, mientras el suplemento también grafica depression; el alcance exacto de cada bloque no se resume en una matriz experimental.
  • No se liberan outputs brutos, datos preprocesados, figuras generadas, logs, comandos exactos, seeds por job o manifest de modelos; los resultados y el total de dos millones no son reproducibles desde el artefacto.
  • El repositorio solo tiene un commit público de initial release y ninguna release de datos; README describe carpetas de resultados que están ignoradas y ausentes.
  • Los ejemplos del README llaman fig_scale.py, fig_persona.py, fig_reason.py y fig_paraph.py, archivos que no existen con esos nombres.
  • No hay tests automatizados, lockfile ni revisiones de weights/tokenizers; pyproject usa rangos amplios y omite scikit-posthocs, por lo que Dunn se salta si no está instalado.
  • La ruta de Llama 3.1 405B está hardcodeada a un scratch path privado del cluster, impidiendo ejecutar ese modelo sin modificar código.
  • El generador usa un rango inclusivo: n_iter=250 crea 251 runs y n_iter=100 crea 101. Sin configs/datos no puede saberse si el estudio compensó el off-by-one.
  • Aunque se afirma que hay 100 paráfrasis por pregunta, el banco BFI contiene 99 para «Can be moody»; 15 ítems BFI y 3 SD3 contienen duplicados exactos.
  • Las paráfrasis se generan con Qwen y son revisadas por dos autores, pero no se informa validación semántica independiente, acuerdo, intensidad, polaridad ni conservación psicométrica por ítem.
  • Las versiones BFI-LLM y SD3-LLM son adaptaciones face-valid de los autores sin análisis factorial, consistencia interna, invariancia, validez convergente, discriminante o criterial.
  • El estudio mide estabilidad de autoinforme en una escala ordinal, no conducta abierta ni decisiones en healthcare, educación, finanzas o medicina.
  • Question order solo produce variación cuando se conserva historia: el orden cambia el contexto acumulado de preguntas y respuestas, por lo que «reordering alone» no describe una administración independiente de ítems.
  • Con temperatura 0, la variación de orden depende del contexto conversacional y potencial no determinismo del backend; con temperatura 0,6, razonamiento mezcla efecto del modo con muestreo estocástico.
  • La SD sobre categorías 1–5 es descriptiva, pero no tiene un umbral validado de riesgo; >0,3 no se vincula a error operativo, daño o incumplimiento de una decisión.
  • Los tests Wilcoxon de paráfrasis e historial agrupan deltas de cada pregunta dentro de modelos; esas observaciones están anidadas y correlacionadas, no son réplicas independientes aunque las tablas destaquen n de modelos.
  • Los Mann–Whitney agregados de reasoning comparan valores por pregunta como muestras independientes y no aprovechan el emparejamiento por ítem/modelo; DeepSeek R1 frente a V3 añade además un cambio de modelo.
  • No se usa un modelo jerárquico, bootstrap por modelo/familia, permutación por cluster o leave-one-family-out que respete la dependencia entre preguntas, modelos y familias.
  • Se informan muchos p-valores con correcciones no descritas de forma coherente entre tablas y scripts, y casi nunca tamaños de efecto numéricos o intervalos para los contrastes principales.
  • El corte arbitrario de 50B deja solo cuatro modelos grandes; una significación obtenida con muchas preguntas no prueba un efecto general entre poblaciones de modelos.
  • La correlación con tamaño mezcla familias, dense y MoE y cuenta parámetros totales, por ejemplo 235B-A22B, sin controlar arquitectura, datos, alignment o parámetros activos.
  • Los promedios humanos y sus SD describen variación entre personas, mientras las barras de los LLM describen variación entre runs; no son la misma fuente de incertidumbre ni una prueba de equivalencia.
  • Las normas humanas provienen de muestras e instrumentos externos heterogéneos y se usan visualmente sin matching demográfico, inferencia o corrección por contexto.
  • Descartar un run entero por una respuesta inválida evita imputación, pero puede introducir selección condicionada al modelo/persona; las bajas tasas agregadas no muestran dónde se concentran los descartes.
  • Perplejidad se calcula solo sobre el token de score parseado y no está disponible para Claude; no representa la incertidumbre completa del razonamiento o comportamiento.
  • La conclusión sobre fundamentos arquitectónicos es especulativa: no se interviene la arquitectura, el entrenamiento o el alignment ni se compara con una clase diseñada para estabilidad.
  • El paper reconoce que strategic deception no puede descartarse y que ambos instrumentos carecen de validación formal para LLM.

Qué no demuestra

  • No demuestra que los 29 modelos enumerados hayan participado en todos los experimentos ni aclara el conjunto exacto detrás de «25 open-source».
  • No verifica de forma independiente el total de más de dos millones de respuestas.
  • No demuestra una personalidad interna, un self estable o ausencia de ellos; mide respuestas a inventarios bajo prompts concretos.
  • No demuestra que toda conducta del modelo sea inestable ni que la inestabilidad del score prediga inconsistencia en tareas reales.
  • No demuestra que SD>0,3 sea peligrosa, clínicamente relevante o incompatible con un caso de uso.
  • No demuestra que escalar nunca pueda mejorar estabilidad; observa ganancias limitadas en las familias y tamaños incluidos.
  • No demuestra que reasoning cause inestabilidad en general; los contrastes mezclan emparejamiento, modelos y muestreo a temperatura 0,6.
  • No demuestra que todas las personas misaligned eleven variabilidad: antisocial no lo hace significativamente en sus propios resultados.
  • No demuestra que la adaptación LLM sea válida; solo muestra que esas dos reformulaciones no reducen SD.
  • No separa completamente efecto de orden de efecto de historia/contexto acumulado.
  • No prueba que las diferencias frente a normas humanas representen diferencias de personalidad comparables.
  • No identifica un mecanismo neuronal o arquitectónico causante ni prueba que current alignment strategies sean globalmente inadecuadas.
  • No proporciona evidencia de incidentes de seguridad, daño o desempeño en aplicaciones de alto riesgo.
  • No permite reproducir los p-valores publicados sin los datos ausentes.
  • No sustituye una validación psicométrica completa ni una evaluación conductual longitudinal.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2508.04826v3 extended 18-page version, 23 Dec 2025; cross-checked against the official AAAI-26 proceedings paper, vol. 40(44), pp. 37961–37969, DOI 10.1609/aaai.v40i44.41133

Fuente consultada: https://arxiv.org/pdf/2508.04826v3

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Llama 3.1 Instruct: 8B, 70B, 405B
  • Qwen 2.5 Instruct: 1.5B, 3B, 7B, 14B, 32B, 72B
  • Qwen 3: 1.7B, 4B, 8B, 14B, 32B
  • Qwen 3 MoE: 30B-A3B, 235B-A22B
  • Gemma 2 Instruct: 2B, 9B, 27B
  • Gemma 3 Instruct: 1B, 4B, 12B, 27B
  • DeepSeek V3 and DeepSeek R1, reported as 671B
  • GPT-OSS 20B and 120B
  • Claude Sonnet 4.5 and Opus 4.1

Instrumentos y métricas

  • Big Five Inventory (BFI-44)
  • Short Dark Triad (SD3-27)
  • BFI-LLM, an author-adapted 44-item version
  • SD3-LLM, an author-adapted 27-item version
  • Five-point Likert responses from Strongly Disagree to Strongly Agree
  • Question-level standard deviation across runs
  • Trait-level mean score across items and runs
  • Token-response perplexity from extracted log probability
  • Spearman scaling and SD–perplexity correlations
  • Wilcoxon, Kruskal–Wallis with Dunn post hoc, and Mann–Whitney comparisons

Datos utilizados

  • 71 original questionnaire items: 44 BFI and 27 SD3
  • 71 author-written LLM-adapted items
  • BFI paraphrase bank: 4,399 entries and 4,377 unique strings in the released artifact
  • SD3 paraphrase bank: 2,700 entries and 2,697 unique strings in the released artifact
  • Reported 250 order runs and 100 paraphrasing settings
  • Reported total of more than 2 million individual responses
  • Human BFI and SD3 reference means from external norms
  • No raw model outputs or preprocessed analysis tables released

Evidencia y localización

  • Publicación oficial, DOI, autores y alcance declarado: AAAI-26 official proceedings paper, vol. 40(44), pp. 37961–37969, DOI 10.1609/aaai.v40i44.41133; title page and abstract, p. 37961
  • 25 modelos, más de dos millones y cinco conclusiones declaradas: Official paper abstract and introduction, pp. 37961–37962; arXiv v3 extended version, pp. 1–2
  • Framework, descarte de runs y procesamiento: Official paper Methodology, p. 37963; extended version, p. 3
  • BFI, SD3 y versiones adaptadas: Official paper Questionnaire Design, p. 37963; extended Appendix C, pp. 11–12
  • Factores, 29 modelos, runs, temperatura y hardware: Official paper Experimental Design through Implementation Details, pp. 37963–37964; extended version, pp. 3–4
  • Escala, scores, SD, perplejidad y rho 0,465: Official paper Effects of Model Scale and Table 1, p. 37964; extended version, pp. 4–5
  • Personas y contrastes exactos: Official paper Effects of Persona Prompt, p. 37964; extended Tables A2–A5, p. 18
  • Razonamiento y perplejidad: Official paper Effects of Reasoning and Figure 2, pp. 37964–37966; extended version, pp. 4–6 and 14
  • Instrumentos originales frente a adaptados: Official paper Table 2 and Figure 3, pp. 37964–37967; extended version, pp. 4, 7 and 15
  • Paráfrasis y corte de 50B: Official paper Table 3 and Figure 4, pp. 37964–37967; extended version, pp. 4, 7 and 16
  • Historial conversacional, rho y grupos: Official paper Table 4 and Figure 5, pp. 37966–37967; extended version, pp. 6–7 and 17
  • Limitaciones reconocidas y conclusión: Official paper Limitations and Conclusion, p. 37968; extended version, p. 8
  • Prompts e invalid responses: arXiv v3 extended Appendix A–B and Table A1, pp. 10–11
  • Código, cuestionarios, paráfrasis y ausencia de datos: Official tosato/PERSIST repository commit cee3b5ff8291bd794b0f751f10f9f2761fdccfd7, audited 15 Jul 2026; 31 tracked files, no raw or preprocessed results, no data release
  • Semántica n_iter y conteos del banco de paráfrasis: Repository generator/utils.py plus direct non-inference execution at commit cee3b5f: n_iter 250 generated 251 response columns and n_iter 100 generated 101; JSON audit found BFI 4,399/4,377 total/unique and SD3 2,700/2,697
  • Dependencia estadística no modelada: Repository stats_convhist_trends.py and stats_paraph_comparison.py pool model×question std_diff in Wilcoxon; stats_reasoning_efforts.py uses aggregated question-level Mann–Whitney, audited 15 Jul 2026
  • Problemas de reproducción del entorno: Repository README, pyproject.toml and generator/generate.py: missing named figure scripts, no tests/lock/data, optional unpinned Dunn dependency and hardcoded 405B cluster path, audited 15 Jul 2026