Moral Susceptibility and Robustness under Persona Role-Play in Large Language Models

Aplicaciones, sesgos y seguridad2025arXivRevisión editorial aprobada

Autores: Davi Bastos Costa, Felippe Alves, Renato Vicente

Palabras clave: Persona Role-Play, Moral Foundations Questionnaire, Moral Robustness, Moral Susceptibility, LLM Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
6
Hallazgos
8
Limitaciones
5
Evidencias

Resumen editorial

Español

Este preprint propone dos índices para describir cómo varían las respuestas de un LLM al representar personas sintéticas en el Moral Foundations Questionnaire (MFQ). La robustez moral R es el inverso de la desviación típica media obtenida al repetir la misma pregunta con la misma persona: cuantifica repetibilidad de la respuesta, no corrección, calidad moral ni seguridad. La susceptibilidad S promedia, entre preguntas, la dispersión de las medias de distintas personas: cuantifica cuánto cambia la escala de respuestas en este conjunto de prompts, no si el modelo representa fielmente a una persona. Se evalúan 15 modelos de seis familias, Claude, DeepSeek, Gemini, GPT, Grok y Llama, con 100 descripciones, 30 ítems y diez repeticiones a temperatura 0,1. Son 30.000 llamadas principales por modelo y 450.000 en total, más baselines sin persona, logits y barridos de temperatura. Las 100 personas no forman una muestra humana ni equilibrada: son las primeras 100 entradas de un archivo de 1.000 descripciones obtenido mediante una baraja de PersonaHub con semilla 42. El archivo mezcla profesiones, lugares, aficiones y pistas políticas o morales sin codificación de atributos ni verdad de referencia. Los resultados publicados muestran una separación muy grande en R: Claude Sonnet y Haiku alcanzan aproximadamente 107,70 y 92,04, frente a 27,73 para Gemini Flash Lite, 9,96 para Gemini Flash, entre 9,75 y 14,48 para los cinco GPT-4/4.1 y alrededor de 3,27-4,59 para DeepSeek, Grok y Llama. S ocupa un rango mucho menor: Gemini Flash es el máximo con 1,043 y GPT-4o Mini el mínimo con 0,663. La variación relativa entre modelos es 152 % para R y 13 % para S. Una ANOVA por permutación sobre log R, con solo 15 observaciones agrupadas en seis proveedores, produce eta cuadrado 0,963 y p<0,00002; para S produce eta cuadrado 0,539 y p=0,137, sin significación convencional. El supuesto efecto de tamaño sobre S usa rangos ordinales discutibles, incluye V3 a V3.1 como progresión de tamaño y etiquetas Fast/full, y obtiene pendiente 0,056±0,035, p=0,150. Por tanto, los datos respaldan agrupamiento por proveedor en la repetibilidad, pero no prueban que el postentrenamiento cause R ni que el preentrenamiento determine S. No se comparan variantes controladas antes/después del entrenamiento y familia queda confundida con arquitectura, API, decodificación, escala y corpus. R y S son prácticamente ortogonales entre los 15 modelos, r=-0,03 y p=0,91; incluso la asociación más fuerte por fundamento, Pureza/Santidad, r=-0,49 y p=0,07, no alcanza significación. Además, R crece por construcción hacia infinito cuando la temperatura tiende a cero y las respuestas se vuelven deterministas, lo que limita su interpretación como propiedad intrínseca del modelo. El uso del MFQ añade otra frontera. El instrumento fue creado para autoinforme humano, pero aquí cada ítem se presenta por separado a un generador que representa una descripción sintética. No se comprueban fiabilidad de escalas, estructura factorial, invariancia entre familias, validez de criterio, equivalencia humano-modelo ni fidelidad a una persona real. Las salidas son distribuciones de texto inducidas por prompts, no creencias morales internas. El prompt pide un dígito seguido de razonamiento, pero el runner asigna un token en general y dos a Claude, de modo que principalmente se recogen dígitos; las diferencias de presupuesto y proveedor también quedan entrelazadas con el modelo. La auditoría de los 15 CSV confirma exactamente 30.000 filas por modelo. Claude Haiku conserva 94 personas completas tras 182 ratings inválidos y Gemini Flash Lite 97 tras 62; la exclusión se hace por modelo, así que las comparaciones no usan siempre la misma composición de personas. El artefacto público es amplio: incluye datos brutos, logits, resultados, figuras, prompts y 43 archivos Python que compilan. Una recomputación con caché limpia reproduce 14 de 15 filas principales. Claude Haiku, sin embargo, da R=89,87±10,30 en vez de 92,04±10,72; el resultado publicado dice que alguna celda tiene una sola ejecución, mientras el CSV actual tiene diez en todas las celdas retenidas. La tabla declara 364 fallos totales para sus 344 filas afectadas, pero el CSV suma 546. Esto indica deriva entre datos reparados y resultados cacheados. El repositorio actual mezcla además experimentos de réplica de julio de 2026 posteriores al PDF v3, carece de CI y tests y afirma licencia MIT sin publicar un archivo LICENSE. El trabajo ofrece un benchmark inspeccionable de consistencia y sensibilidad de ratings bajo este protocolo. No demuestra moralidad, personalidad, calidad de razonamiento, competencia de role-play, causas de entrenamiento ni generalización a otros prompts, instrumentos, personas, idiomas o despliegues.

English

This preprint proposes two indices for describing how an LLM's responses vary when it role-plays synthetic personas on the Moral Foundations Questionnaire (MFQ). Moral robustness R is the inverse of the mean standard deviation from repeating the same question with the same persona. It measures response repeatability, not correctness, moral quality, or safety. Moral susceptibility S averages, across questions, the dispersion of persona-level means. It measures how much scores move across this prompt set, not whether a model represents a person faithfully. Fifteen models from six families, Claude, DeepSeek, Gemini, GPT, Grok, and Llama, are tested with 100 descriptions, 30 items, and ten repetitions at temperature 0.1. This is 30,000 primary calls per model and 450,000 overall, plus no-persona baselines, logit collection, and temperature sweeps. The 100 personas are neither a human nor a balanced sample. They are the first 100 entries in a 1,000-description file produced by a seed-42 PersonaHub shuffle. The file mixes occupations, locations, fandoms, and political or moral cues without attribute coding or persona ground truth. Reported results show a very large separation in R. Claude Sonnet and Haiku reach about 107.70 and 92.04, compared with 27.73 for Gemini Flash Lite, 9.96 for Gemini Flash, 9.75–14.48 for the five GPT-4/4.1 variants, and roughly 3.27–4.59 for DeepSeek, Grok, and Llama. S covers a much narrower range: Gemini Flash is highest at 1.043 and GPT-4o Mini lowest at 0.663. Relative across-model variation is 152% for R and 13% for S. A permutation ANOVA on log R, using only 15 observations grouped into six providers, reports eta-squared 0.963 and p<0.00002; the matching S analysis gives eta-squared 0.539 and p=0.137, not conventionally significant. The proposed size trend for S uses questionable ordinal ranks, including V3 to V3.1 as a size progression and Fast/full product labels, and yields a slope of 0.056±0.035 with p=0.150. The evidence therefore supports provider clustering in repeatability under this setup, but does not show that post-training causes R or pretraining determines S. There are no controlled pre/post-training variants, and family is confounded with architecture, API, decoding, scale, and corpus. R and S are effectively orthogonal across the 15 models, r=-0.03 and p=0.91. Even the strongest foundation-level association, Purity/Sanctity at r=-0.49 and p=0.07, is not conventionally significant. R also grows toward infinity by construction as temperature approaches zero and answers become deterministic, limiting its interpretation as an intrinsic model property. MFQ use adds another boundary. The instrument was designed for human self-report, whereas this study presents one item at a time to a generator role-playing a synthetic description. It does not assess scale reliability, factor structure, measurement invariance across model families, criterion validity, human-model equivalence, or fidelity to an actual person. The outputs are prompt-induced text distributions, not internal moral beliefs. Prompts ask for a digit followed by reasoning, yet the runner assigns one token globally and two for Claude, so it primarily collects digits; provider and output-budget differences are also entangled with model comparisons. The audit confirms exactly 30,000 rows in each of the 15 main CSVs. Claude Haiku retains 94 complete personas after 182 invalid final ratings and Gemini Flash Lite retains 97 after 62; exclusions are model-specific, so comparisons do not always use the same persona composition. The public artifact is extensive, with raw outputs, logits, results, figures, prompts, and 43 Python files that compile. A fresh-cache recomputation reproduces 14 of the 15 main rows. Claude Haiku instead yields R=89.87±10.30 rather than 92.04±10.72. Its tracked result says one retained cell has a single run, while the current CSV has ten in every retained cell. The paper reports 364 total failures across 344 affected Claude Haiku rows, but the CSV sums to 546. These discrepancies indicate drift between repaired data and cached results. The current repository also mixes July 2026 rebuttal experiments added after the v3 PDF, has no CI or tests, and claims MIT licensing without tracking a LICENSE file. The study provides an inspectable benchmark of rating consistency and sensitivity under this protocol. It does not establish morality, personality, reasoning quality, role-play competence, training-stage causes, or generalization to other prompts, instruments, personas, languages, or deployments.

Pregunta de investigación

¿Cómo varían entre modelos la repetibilidad de ratings MFQ dentro de una persona sintética y la dispersión de esos ratings entre personas, y cómo dependen ambas medidas de familia, variante y temperatura?

Método

Quince modelos responden los 30 ítems del MFQ desde 100 descripciones PersonaHub, diez veces por combinación a temperatura 0,1. R invierte la desviación típica media dentro de cada celda persona-pregunta y S promedia la desviación entre medias de personas. Se añaden baselines sin persona, logits de siguiente token para cinco OpenAI y barridos de temperatura; las asociaciones por familia y rango ordinal se analizan mediante permutaciones.

Muestra: Cien descripciones sintéticas, primeras 100 de un archivo PersonaHub barajado con semilla 42, por 30 ítems y diez repeticiones para 15 modelos: 450.000 llamadas principales previstas. Tras fallos, Claude Haiku usa 94 personas completas, Gemini Flash Lite 97 y los demás análisis principales 100.

Hallazgos

  • R varía aproximadamente 33 veces: Claude Sonnet alcanza 107,70 y los modelos menos robustos rondan 3,3; S solo varía unas 1,6 veces, de 0,663 a 1,043.
  • La familia explica gran parte de log R en estas 15 observaciones, eta cuadrado 0,963 y p<0,00002; la prueba equivalente para S no es significativa, p=0,137.
  • El supuesto efecto de tamaño sobre S es débil y no significativo, pendiente 0,056±0,035 y p=0,150, además de usar rangos ordinales que no representan limpiamente parámetros.
  • R y S no correlacionan a nivel de modelo, r=-0,03 y p=0,91; Pureza/Santidad alcanza r=-0,49 y p=0,07.
  • Una reproducción con los CSV públicos coincide en 14 de 15 filas, pero Claude Haiku produce R=89,87 y no 92,04; su recuento de fallos también contradice la tabla.
  • Las exclusiones por fallos se realizan por modelo y cambian la composición de personas en Claude Haiku y Gemini Flash Lite.

Limitaciones

  • El MFQ no se valida psicométricamente para respuestas de LLM en role-play y no existe verdad de referencia humana por persona.
  • Las 100 personas son un corte posicional no estratificado de descripciones sintéticas heterogéneas.
  • R mide consistencia de muestreo y tiende a infinito en el límite determinista; no mide corrección o seguridad.
  • S mide dispersión en esta selección de prompts; no distingue sensibilidad apropiada, estereotipo o incumplimiento de rol.
  • Familia queda confundida con proveedor, arquitectura, API, decodificación, escala, corpus y postentrenamiento.
  • Las afirmaciones causales sobre preentrenamiento y postentrenamiento carecen de intervenciones o variantes controladas.
  • Los prompts piden razonamiento, pero los presupuestos de uno o dos tokens recogen esencialmente ratings.
  • El artefacto tiene deriva entre datos y resultados para Claude Haiku, mezcla versiones posteriores, carece de CI/tests y no incluye la licencia MIT anunciada.

Qué no demuestra

  • No demuestra moralidad interna, creencias, personalidad psicológica ni calidad de razonamiento del LLM.
  • No demuestra que una R alta o una S alta sean normativamente mejores.
  • No demuestra que el postentrenamiento cause robustez ni que el preentrenamiento cause susceptibilidad.
  • No demuestra un efecto de tamaño significativo sobre S.
  • No demuestra equivalencia psicométrica entre el MFQ humano y ratings de role-play generados.
  • No generaliza por sí solo a otras personas, prompts, instrumentos, idiomas, temperaturas o despliegues.
  • No reproduce exactamente todos los resultados publicados a partir de los datos actuales.
  • No consta una aceptación editorial verificada del preprint.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2511.08565v3

Fuente consultada: https://arxiv.org/pdf/2511.08565

Revisión: Codex 22-page visual, current arXiv-version, full-method, 450,000-row main-data, failure/missingness, fresh-cache metric reproduction, PersonaHub sampling, MFQ construct-validity, family/size/correlation statistics, causal-claim, official-code, licensing and artifact-version audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Claude Haiku 4.5
  • Claude Sonnet 4.5
  • DeepSeek V3
  • DeepSeek V3.1
  • Gemini 2.5 Flash
  • Gemini 2.5 Flash Lite
  • GPT-4.1
  • GPT-4.1 Mini
  • GPT-4.1 Nano
  • GPT-4o
  • GPT-4o Mini
  • Grok 4
  • Grok 4 Fast
  • Llama 4 Maverick
  • Llama 4 Scout

Instrumentos y métricas

  • 30-item Moral Foundations Questionnaire
  • Moral robustness R as inverse within-persona/question variability
  • Moral susceptibility S as across-persona rating dispersion
  • Repeated API sampling at temperature 0.1
  • Next-token digit log-probability analysis
  • Persona and rerun bootstrap uncertainty
  • Permutation ANOVA and within-series ordinal-rank regression

Datos utilizados

  • PersonaHub synthetic persona descriptions
  • Repository personas.json with 1,000 seeded-shuffle descriptions
  • 15 public 30,000-row main sampling CSV files
  • No-persona sampling files and OpenAI next-token log-probability files

Evidencia y localización

  • Definiciones de R y S, MFQ y diseño principal: arXiv v3 sections 2.1-2.3, pp. 2-6
  • Temperatura, rankings, resultados y estadísticas por familia/variante: arXiv v3 sections 2.4-3.4 and Table 3, pp. 6-10 and 16
  • Interpretaciones sobre pretraining/post-training, límites y reproducibilidad: arXiv v3 sections 4-5 and Reproducibility Statement, pp. 10-12
  • Prompts, fallos de parsing, personas y valores exactos: arXiv v3 Appendices A-F, pp. 12-22
  • Auditoría de datos, recomputación, código, licencia, validez de constructo y fronteras causales: reports/verification/article-261-arxiv-moral-susceptibility-mfq-persona-sampling-statistics-code-data-and-claim-audit.json