El artículo audita posicionamiento político expresado por LLM, no una identidad política interna ni personalidad humana. La versión 2 combina cuatro análisis: estabilidad bajo muestreo repetido, sensibilidad a diez reformulaciones del prompt, comparación entre tres cuestionarios políticos y clasificación de sesgo de noticias. El diseño no usa una única cohorte de 33 modelos: Phase I(a) evalúa 26 modelos con diez administraciones idénticas de Political Compass, SapplyValues y 8Values; Phase I(b) usa otros siete modelos con una ejecución por cada una de diez variantes semánticas; la clasificación de 1.063 artículos vuelve a usar los 26 de Phase I(a). La Figura 1 suma ambos bloques y muestra 33 puntos, pero las inferencias no proceden de un experimento común.
En Phase I(a), 25 de 26 modelos, 96,154 %, redondeado a 96,3 % en el abstract, caen en el cuadrante Libertarian Left del Political Compass y uno en Authoritarian Left. Al combinar los 33 puntos de ambas fases, el porcentaje baja a 93,939 %: 31 Libertarian Left, uno Authoritarian Left y uno Libertarian Right. Esta concentración describe respuestas agregadas a esos cuestionarios, con sus prompts y scoring, y no demuestra creencias, intenciones o una ideología latente. Todos los modelos se consultan a través de OpenRouter a temperatura 0,7; la versión concreta del proveedor y parte del estado operativo no quedan fijados de forma suficiente para una comparación longitudinal.
La prueba de robustez Phase I(b) cruza siete modelos con diez prefijos de significado parecido. El ANOVA aditivo atribuye gran parte de la varianza al modelo y poca al efecto promedio del prompt. En los CSV públicos, η² de modelo va de 0,485 en autoridad SapplyValues a 0,981 en economía 8Values; seis de nueve ejes superan 0,90. El mayor η² de prompt es 0,059 y ningún efecto principal del prompt sobrevive FDR. Por tanto, “η² > 0,90” no describe todos los ejes. Más importante, hay una sola observación por celda modelo×prompt: el análisis omite la interacción y no puede separar sensibilidad específica de cada modelo. Un efecto promedio pequeño del wording no demuestra invariancia individual.
Las correlaciones muestran acuerdo alto entre ejes económicos: en los 70 puntos modelo×prompt, PCT–8Values r=0,921 y PCT–SapplyValues r=0,906. El eje social de Political Compass se relaciona poco con autoridad SapplyValues y más con progresivismo cultural. El r=−0,643 destacado en abstract procede del análisis de medias de otra cohorte; los datos públicos de Phase I(a) que lo sostienen no están liberados. En el bloque público de siete modelos, la correlación social–progresivismo es r=−0,719 al tratar 70 observaciones repetidas como independientes; al promediar primero por modelo queda r=−0,754 con n=7 y p=0,0501. El tamaño del efecto persiste, pero las p extremadamente pequeñas del paper están infladas por pseudorreplicación y no prueban validez de constructo de los cuestionarios para LLM.
La comparación open-weight/closed-source reporta SapplyValues Progressive 4,543 frente a 2,578, t=−12,494 y p<10⁻²⁴. La tabla usa n=110 por grupo, es decir, diez runs de once modelos por grupo, aunque la cohorte contiene 26; no explica con claridad los cuatro modelos omitidos y trata runs del mismo modelo como observaciones independientes. Además, access type está confundido con proveedor, familia, escala, fecha, datos y post-training. El paper modera la interpretación en discusión, pero el contraste no permite atribuir causalmente la diferencia a safety tuning o RLHF.
La ablation base/instruction compara solo Llama-3 8B y 70B. Encuentra desplazamientos grandes y no uniformes entre ejes; por ejemplo, Llama-3-8B cambia +3,29 en el eje social PCT y +16,4 en societal 8Values. Sin embargo, los modelos base se puntúan mediante log-probabilidades condicionales porque no siguen bien el formato, mientras los instruct producen respuestas categóricas; no es el mismo procedimiento de medición. El código y las respuestas de este experimento no están publicados, solo tres JSON de scores, así que es evidencia exploratoria y no una estimación causal del efecto de post-training.
La tarea downstream toma el titular y lead de 1.063 artículos en inglés y hereda para cada artículo la etiqueta de sesgo del medio en Ground News, agregada a su vez desde AllSides, Ad Fontes y MBFC. Se solicitan valores continuos de −3 a +3 y se comparan con siete clases discretas. El paper anuncia 27.638 predicciones, pero las tablas de resultados suman 27.432 observaciones: faltan 206 y no se publica su mecanismo de exclusión. La distribución es muy desequilibrada: solo 78 observaciones Far Left frente a 728 Far Right y 9.182 Center. La accuracy exacta es 19,2 % para Far Left y 2,1 % para Far Right; MAE es 1,305 y 1,880, respectivamente. El MDE agregado es −0,26, una desviación hacia etiquetas más a la izquierda respecto a Ground News. Estas cifras describen desacuerdo con etiquetas de medio, no verdad ideológica a nivel de artículo; el desequilibrio, la cobertura por modelo y los fallos faltantes impiden interpretar la asimetría como capacidad intrínseca.
Tres regresiones con una observación agregada por modelo (n=26) relacionan scores de cuestionario con: diferencia de MAE Far Right–Far Left, error direccional Center y MAE de categorías de derecha. Ningún predictor alcanza α=0,05; el resultado más cercano es progresivismo frente a asimetría extrema, β=−0,153 y p=0,066. Esto aporta ausencia de evidencia estadística bajo tres especificaciones pequeñas; no demuestra independencia o “decoupling”. Con n=26, múltiples ejes posibles, etiquetas ruidosas y análisis post hoc, un resultado no significativo también es compatible con falta de potencia o mala especificación.
El repositorio sakhadib/PolAlignLLM se auditó en el commit d8d4e428194694656f281636fe9d8bbdadc6c1c4. El código Python compila y, tras instalar dependencias, regenera los análisis públicos de Phase I(b) con diferencias solo de precisión flotante. Incluye 178 preguntas, las diez variantes, 70 scores por instrumento, scripts Selenium de scoring y análisis ANOVA/MTMM/clustering. No incluye licencia, tests, CI, lockfile, seeds, respuestas crudas, snapshots de los scorers web ni un entorno fijado. El README referencia responses.jsonl y or_modelrun.py, que no existen, y el repositorio contiene bytecode __pycache__.
La cobertura pública no reproduce el artículo completo. El runner solo configura siete modelos×diez prefijos; no implementa la cohorte de 26 con diez repeticiones, la clasificación de noticias, las regresiones ni la extracción logprob base/instruct. El fallback de seguridad cambia palabras como “violence”, “terrorism”, “authoritarian” o “war” solo cuando un proveedor bloquea un ítem, pese a que el paper afirma conservar wording fijo y no introducir overrides específicos. Sin responses.jsonl no puede auditarse qué modelos recibieron ítems alterados ni cuántos outputs fallaron.
También hay drift entre manuscrito y artefacto. La Tabla 16 llama “Mistral Medium” y “Qwen3 235B” a dos miembros de Phase I(b), mientras Table 6 y los CSV usan Mistral Large 2512 y Qwen 3.5 Flash; sus medias y desviaciones tampoco coinciden con los CSV actuales. Las η² completas de Table 17 y el resumen MTMM de Table 18 difieren de los resultados versionados; por ejemplo, el repositorio da media monotrait–heteromethod 0,587 y fracción significativa 0,714, frente a 0,82 y 1,00 en el PDF. Las tablas principales seleccionadas sí coinciden con algunos CSV. El repositorio permite comprobar una parte acotada de la robustez, no los resultados centrales de 26 modelos ni el downstream.
La contribución útil es separar cuestionarios, robustez de prompt y conducta en tarea, y mostrar que una sola proyección ideológica es insuficiente. La conclusión fiel es más limitada que el framing: estos modelos producen perfiles de respuesta parecidos bajo tres quizzes y una configuración, esos perfiles varían más entre modelos que por el efecto promedio de diez prefijos en siete sistemas, y no predicen significativamente tres errores agregados. No establece identidad política, validez psicométrica para agentes sintéticos, causalidad de alignment, neutralidad de Ground News ni generalización a otros idiomas, tareas, versiones o despliegues.