Este preprint propone dos índices para describir cómo varían las respuestas de un LLM al representar personas sintéticas en el Moral Foundations Questionnaire (MFQ). La robustez moral R es el inverso de la desviación típica media obtenida al repetir la misma pregunta con la misma persona: cuantifica repetibilidad de la respuesta, no corrección, calidad moral ni seguridad. La susceptibilidad S promedia, entre preguntas, la dispersión de las medias de distintas personas: cuantifica cuánto cambia la escala de respuestas en este conjunto de prompts, no si el modelo representa fielmente a una persona. Se evalúan 15 modelos de seis familias, Claude, DeepSeek, Gemini, GPT, Grok y Llama, con 100 descripciones, 30 ítems y diez repeticiones a temperatura 0,1. Son 30.000 llamadas principales por modelo y 450.000 en total, más baselines sin persona, logits y barridos de temperatura. Las 100 personas no forman una muestra humana ni equilibrada: son las primeras 100 entradas de un archivo de 1.000 descripciones obtenido mediante una baraja de PersonaHub con semilla 42. El archivo mezcla profesiones, lugares, aficiones y pistas políticas o morales sin codificación de atributos ni verdad de referencia. Los resultados publicados muestran una separación muy grande en R: Claude Sonnet y Haiku alcanzan aproximadamente 107,70 y 92,04, frente a 27,73 para Gemini Flash Lite, 9,96 para Gemini Flash, entre 9,75 y 14,48 para los cinco GPT-4/4.1 y alrededor de 3,27-4,59 para DeepSeek, Grok y Llama. S ocupa un rango mucho menor: Gemini Flash es el máximo con 1,043 y GPT-4o Mini el mínimo con 0,663. La variación relativa entre modelos es 152 % para R y 13 % para S. Una ANOVA por permutación sobre log R, con solo 15 observaciones agrupadas en seis proveedores, produce eta cuadrado 0,963 y p<0,00002; para S produce eta cuadrado 0,539 y p=0,137, sin significación convencional. El supuesto efecto de tamaño sobre S usa rangos ordinales discutibles, incluye V3 a V3.1 como progresión de tamaño y etiquetas Fast/full, y obtiene pendiente 0,056±0,035, p=0,150. Por tanto, los datos respaldan agrupamiento por proveedor en la repetibilidad, pero no prueban que el postentrenamiento cause R ni que el preentrenamiento determine S. No se comparan variantes controladas antes/después del entrenamiento y familia queda confundida con arquitectura, API, decodificación, escala y corpus. R y S son prácticamente ortogonales entre los 15 modelos, r=-0,03 y p=0,91; incluso la asociación más fuerte por fundamento, Pureza/Santidad, r=-0,49 y p=0,07, no alcanza significación. Además, R crece por construcción hacia infinito cuando la temperatura tiende a cero y las respuestas se vuelven deterministas, lo que limita su interpretación como propiedad intrínseca del modelo. El uso del MFQ añade otra frontera. El instrumento fue creado para autoinforme humano, pero aquí cada ítem se presenta por separado a un generador que representa una descripción sintética. No se comprueban fiabilidad de escalas, estructura factorial, invariancia entre familias, validez de criterio, equivalencia humano-modelo ni fidelidad a una persona real. Las salidas son distribuciones de texto inducidas por prompts, no creencias morales internas. El prompt pide un dígito seguido de razonamiento, pero el runner asigna un token en general y dos a Claude, de modo que principalmente se recogen dígitos; las diferencias de presupuesto y proveedor también quedan entrelazadas con el modelo. La auditoría de los 15 CSV confirma exactamente 30.000 filas por modelo. Claude Haiku conserva 94 personas completas tras 182 ratings inválidos y Gemini Flash Lite 97 tras 62; la exclusión se hace por modelo, así que las comparaciones no usan siempre la misma composición de personas. El artefacto público es amplio: incluye datos brutos, logits, resultados, figuras, prompts y 43 archivos Python que compilan. Una recomputación con caché limpia reproduce 14 de 15 filas principales. Claude Haiku, sin embargo, da R=89,87±10,30 en vez de 92,04±10,72; el resultado publicado dice que alguna celda tiene una sola ejecución, mientras el CSV actual tiene diez en todas las celdas retenidas. La tabla declara 364 fallos totales para sus 344 filas afectadas, pero el CSV suma 546. Esto indica deriva entre datos reparados y resultados cacheados. El repositorio actual mezcla además experimentos de réplica de julio de 2026 posteriores al PDF v3, carece de CI y tests y afirma licencia MIT sin publicar un archivo LICENSE. El trabajo ofrece un benchmark inspeccionable de consistencia y sensibilidad de ratings bajo este protocolo. No demuestra moralidad, personalidad, calidad de razonamiento, competencia de role-play, causas de entrenamiento ni generalización a otros prompts, instrumentos, personas, idiomas o despliegues.
Pregunta de investigación
¿Cómo varían entre modelos la repetibilidad de ratings MFQ dentro de una persona sintética y la dispersión de esos ratings entre personas, y cómo dependen ambas medidas de familia, variante y temperatura?