El artículo evalúa si prompts mínimos de ideología bastan para convertir modelos abiertos en sustitutos coherentes de personas liberales, moderadas o conservadoras. Doce modelos, desde 7B hasta arquitecturas MoE de 176B parámetros totales, contestan 50 veces el Moral Foundations Questionnaire (MFQ) bajo cuatro condiciones: baseline, liberal, moderada y conservadora. La pregunta sustantiva es importante para la investigación social: una salida políticamente plausible no garantiza que el sistema reproduzca de forma estable las pautas de valores de una población humana.
El MFQ contiene 32 ítems en escala 0-5: 30 puntúan cuidado, justicia, lealtad, autoridad y pureza, y dos son controles. Cada pregunta se envía por separado. El repositorio histórico permite contar 2.400 ficheros, 12 modelos × 4 condiciones × 50 encuestas, y 76.800 filas esperadas. Las personas solo añaden un mensaje como «You are a politically and ethically Conservative»; no se aporta biografía, contexto cultural ni ejemplos. Los resultados se comparan con medias agregadas de tres estudios: 1.613 participantes anónimos, 7.226 estadounidenses y 478 surcoreanos, agrupados como liberales, moderados y conservadores.
El principal hallazgo descriptivo es una estabilidad muy desigual. En los siete modelos mostrados en la Tabla 1, Mixtral 8x7B tiene la varianza media más baja, 0,030, y Qwen 72B la más alta, 0,425. Las medias publicadas son 0,150 para baseline, 0,237 para conservadora, 0,184 para liberal y 0,372 para moderada. El autor interpreta que «moderate» puede ser una etiqueta más ambigua. También reconoce un punto esencial: menor varianza no es necesariamente más humana, porque personas reales varían dentro de un grupo y a lo largo del tiempo; el estudio no dispone de un benchmark de varianza humana comparable.
La Tabla 1 tiene una inconsistencia de alcance. El método declara 12 modelos, pero la tabla solo incluye siete y omite Llama 3.1 8B y 70B, Gemma 2 27B, Phi-3 14B y Qwen 2 72B. Al reproducir la misma varianza con los 12 modelos, las medias cambian a 0,245, 0,279, 0,258 y 0,360. Baseline sigue siendo la menor y moderada la mayor, pero el tamaño del patrón cambia. Tampoco es cierto a nivel de cada modelo que añadir persona aumente siempre la varianza: por ejemplo, Mixtral 8x7B baja de 0,025 en baseline a 0,012 con persona moderada. El texto llama por error «Mistral 8x7B» al sistema que en tabla y datos es Mixtral 8x7B.
La comparación humana promedia la diferencia absoluta entre las cinco medias de fundamentos del modelo y las cinco medias humanas. El código y el pie de la Tabla 2 calculan mean absolute error, pero el texto lo llama mean squared error; el abstract habla de correlación débil, aunque no se calcula ningún coeficiente de correlación. La reproducción obtiene MAE emparejado de 0,665 para liberal, 0,610 para moderada y 0,973 para conservadora. Por muestras humanas, la media emparejada es 0,579 en el conjunto anónimo, 0,809 en Estados Unidos y 0,860 en Corea del Sur. Esto respalda una asimetría descriptiva y peor ajuste conservador, no una prueba general de sesgo político izquierdista.
Hay defectos de prompt y parsing que afectan a la validez. Las instrucciones enumeran 0-5, pero terminan pidiendo responder solo con 1-5, de modo que excluyen verbalmente el cero que sí existe en la escala humana. El baseline se describe como ausencia de persona, pero el código convierte el valor nulo en string y envía literalmente un mensaje de sistema «None». El parser conserva el primer dígito encontrado en cualquier parte de la respuesta, no guarda el texto original y no valida rango. En los datos hay 388 respuestas nulas que se eliminan y dos valores 6 que sí entran en los agregados. La missingness varía por modelo y condición, con entre 1.533 y 1.600 filas retenidas de 1.600 por combinación.
La varianza es la varianza muestral de cada ítem y condición, después promediada, e incluye los dos ítems de control. No se fijan temperatura, top-p, seeds u otras opciones, ni digests inmutables de Ollama. Por tanto, 50 respuestas describen una ejecución local concreta pero no una distribución repetible con exactitud. Las comparaciones humanas usan medias de grupo codificadas, no respuestas individuales: no incorporan dispersión humana, intervalos, error de muestreo o invariancia de medida. Además, «liberal», «moderate» y «conservative» son etiquetas inglesas mínimas cuyo significado no es idéntico entre Estados Unidos y Corea.
El artículo usa repetidamente la palabra «significant», pero no publica test estadístico, p-value, intervalo o control de multiplicidad. La afirmación de que el tamaño de modelo no se relaciona con consistencia o alineación también es descriptiva; no se informa correlación ni modelo de tendencia. El MFQ es un instrumento psicológico relevante, pero reduce la ideología a cinco fundamentos y no valida por sí solo creencias, razonamiento, identidad o conducta. El experimento tampoco ejecuta una sociedad de agentes: mide cuestionarios aislados y extrapola con cautela a simulaciones y redes sociales.
La conclusión más sólida del trabajo sobrevive a estos problemas: un prompt ideológico mínimo no ofrece evidencia suficiente para tratar al LLM como una población humana. El artículo advierte sobre caricaturizar grupos, fabricar consenso aparente, marginar perspectivas no occidentales y simular poblaciones sin consentimiento. Rechaza explícitamente sustituir participantes diversos. No demuestra que las diferencias sean significativas, que el MAE sea MSE o correlación, que el origen causal sea el entrenamiento o alignment, que escalar nunca pueda ayudar, ni que los modelos puedan representar experiencia moral encarnada.
La reproducibilidad pública es sustancial pero exige seguir el historial. El repositorio oficial actual enlazado por el autor contiene código, cuestionarios y experimentos. El commit e51c49a de septiembre de 2024 conserva las 2.400 encuestas completas y permite reproducir los valores clave; el working tree del día de publicación fue refactorizado y muestra un experimento baseline de 12 modelos, aunque el experimento de personas sigue recuperable en Git. No existe un release etiquetado de paper. El artefacto no conserva respuestas textuales originales, parámetros de muestreo, digests exactos, datos humanos individuales, tests o CI en el commit del experimento. La ficha usa el artículo final de 2025 y el commit histórico que realmente sustenta sus números.