El artículo estudia cómo cambian las respuestas políticas de ocho LLM cuando se les asigna una persona sociodemográfica o cuando las mismas proposiciones se presentan en otro idioma. Es pertinente para personalidad sintética como caso de condicionamiento por persona, pero no mide personalidad psicométrica, identidad persistente ni una ideología interna. La versión auditada es la publicación de Findings of EACL 2026, pp. 2235–2252; también se revisaron arXiv v2, el checklist responsable y las seis hojas del repositorio oficial.
El instrumento parte de proposiciones del Political Compass Test, pero no usa su algoritmo propietario. Los autores anotan cada proposición como izquierda/derecha y libertaria/autoritaria y fuerzan respuestas binarias agree=1 o disagree=0. Por tanto, los valores no son coordenadas oficiales del Political Compass, sino scores de una adaptación propia. El propio paper reconoce que el PCT no está psicométricamente validado, que sus proposiciones no están estandarizadas y que los criterios originales no son públicos. La reducción binaria elimina intensidad de respuesta y tampoco recibe una validación independiente.
Se evalúan Gemini 2.0 Flash, Gemini 2.0 Flash-Lite, Gemini 2.5 Flash, GPT-4.1-mini-2025-04-14, Llama 3.3 70B Instruct, Llama 4 Scout 17B-16E Instruct, DeepSeek Coder V2 Lite Instruct y DeepSeek R1, todos declarados a temperatura 0. El baseline es el cuestionario en inglés. Las 19 personas explícitas cubren tres identidades de género, cuatro de etnia, seis países anglófonos y seis personas del tipo “German speaking person”; todas se expresan en inglés y todas las proposiciones se envían en una sola llamada estructurada. La condición denominada implícita elimina la persona y traduce el cuestionario a italiano, alemán, francés, polaco, checo o español.
La Tabla 1 coloca a los ocho endpoints en valores negativos de ambos ejes bajo este scoring: de −0,567 a −0,917 en economía y de −0,254 a −0,814 en lo social. Esto describe acuerdo con las etiquetas creadas por los autores, no una medición validada de ideología. El texto llama al patrón “consistent and significant”, pero no presenta test, intervalo ni unidad inferencial. Además, varios endpoints no están fijados por snapshot inmutable y solo se estudian ocho sistemas seleccionados, por lo que no puede atribuirse el patrón a los LLM en general ni causalmente a datos de entrenamiento o RLHF.
En las personas demográficas aparecen cambios muy dependientes de modelo. Gemini 2.0 Flash con “person of white ethnicity” se mueve +0,6083 en economía y +0,2453 en lo social; Gemini 2.5 Flash con “non-binary person” cambia −0,3833 y −0,2578; GPT-4.1-mini con “person from the United States” cambia +0,1917 y +0,1438. Llama 3.3 y Llama 4 muestran muchos cambios nulos o pequeños, aunque tampoco son completamente invariantes. Estos son efectos de instrucciones textuales sobre respuestas a un cuestionario, no evidencia de que las personas reales compartan esas posiciones ni de que el modelo posea estereotipos humanos como estado mental.
Las tablas lingüísticas sí apoyan una tendencia descriptiva acotada. Recalculando las magnitudes vectoriales de sus 48 pares, la media es 0,223 para la persona lingüística explícita y 0,288 para las preguntas traducidas; la traducción es mayor en 35 pares y menor en 13. La heterogeneidad importa: es mayor en los seis pares de GPT-4.1-mini y de los dos Gemini 2.0, pero solo en uno de seis de Llama 4. El paper no define antes del análisis una norma, contraste emparejado o intervalo, de modo que “más pronunciado” es una descripción de las tablas, no una conclusión estadística general.
Tampoco queda identificado un estereotipo “implícito”. La condición explícita combina cuestionario inglés y persona inglesa; la implícita cambia el idioma, las palabras, la traducción, el contexto cultural, la competencia lingüística, la tokenización y posibles conductas de seguridad, sin persona. No son intervenciones emparejadas que difieran solo en visibilidad del mismo atributo. Una diferencia entre idiomas puede ser real y relevante para despliegue multilingüe, pero este diseño no separa estereotipo latente de equivalencia semántica, dominio del idioma o sensibilidad a la formulación. La verificación “meticulosa” de un subconjunto traducido no informa tamaño, instrucciones, anotadores, acuerdo o adjudicación.
La afirmación de alineación entre estereotipos explícitos e implícitos tampoco tiene criterio formal. No se reportan correlación, ángulo, concordancia de signos o test. Como comprobación transparente, 36 de 48 pares tienen producto escalar positivo, pero otros criterios producen conteos diferentes. Convertir esa similitud en “transparency” o “awareness” antropomorfiza la regularidad: dos cambios direccionalmente parecidos no prueban autoconocimiento del modelo. La explicación sobre proximidad política de lenguas europeas también es especulativa porque no se incluye ningún idioma no europeo que la contraste.
La auditoría de las anotaciones encuentra drift entre texto y artefacto. El paper nombra tres anotadores LLM, pero Annotations_raw contiene cuatro columnas de modelo: 4omini, llama3.3, llama-4 y gpt-4.1, además de Human1–3. Las fórmulas finales promedian A:F y excluyen Human3. En estos datos concretos las 120 etiquetas redondeadas coinciden si se usan las siete columnas o las seis descritas B:G, por lo que la exclusión no cambia las clases finales; sí cambia el protocolo y los estadísticos de acuerdo. Entre las tres columnas de modelo declaradas hay discrepancia en 19 de 120 ítems bajo la definición natural de que no todas coinciden, no cinco. Un alfa nominal directo es 0,709 con las siete columnas, 0,712 con B:G y 0,672 con las A:F realmente promediadas; ninguna ruta reproduce 0,726. Sin código, nivel de medida y política exacta, el alfa y su IC del 90 % no son reproducibles.
También existe una discordancia de tamaño: Annotations_final tiene 60 proposiciones por dos ejes, mientras Data.xlsx publica 61 proposiciones multilingües. La extra solo tiene tres anotaciones humanas sociales en la hoja cruda y queda fuera de la final. Sin respuestas por ítem ni código de scoring no se sabe si las llamadas y scores usaron 60 o 61. El checklist confirma además que no se publican instrucciones humanas completas ni demografía; los anotadores eran estudiantes de grado no remunerados.
La ecuación de estereotipo imprime S = Bias_baseline − Bias_persona, pero todas las tablas usan la resta opuesta. Por ejemplo, Gemini 2.0 Flash pasa de −0,8083 a −0,8167 con man y la tabla informa −0,0083; la fórmula impresa produciría +0,0083. Más grave, las tablas no comparten un baseline uniforme. Para Flash-Lite, la Tabla 1 usa la media de diez ejecuciones (−0,7000, −0,2537), mientras las diferencias explícitas usan solo la primera (−0,6500, −0,2203): el shift de man publicado es −0,0833, −0,2448, no −0,0333, −0,2113 respecto al baseline de Tabla 1. Llama 4 excluye la primera ejecución social de su Tabla 1 y la reutiliza para diferencias explícitas. DeepSeek R1 combina selecciones no documentadas y su fila no es la media de las diez observaciones.
El repositorio oficial, commit db9020813c6e002a730f9aa73eef6c12525e47cb, tiene tres commits y solo seis hojas CSV/XLSX. scores.xlsx contiene 586 filas derivadas: 62 baselines, 104 personas demográficas y 420 ejecuciones traducidas. No hay código, respuestas por ítem, llamadas, parser, scoring, estadística, figuras, dependencias, seeds, fechas, tests, CI, README o licencia. De las 96 filas resumen de lenguaje de las Tablas 5–6, se publican fuentes de score para 42: faltan las 48 personas lingüísticas explícitas y las seis traducciones de DeepSeek R1. No puede reconstruirse de extremo a extremo ninguna tabla desde salidas brutas.
La contribución defendible es que, bajo una adaptación binaria y anotada por los autores, ciertos prompts de identidad y cambios de idioma alteran de manera heterogénea las respuestas políticas de ocho endpoints; las diferencias multilingües son descriptivamente mayores en 35 de 48 comparaciones. Es una señal útil sobre sensibilidad a persona, idioma y formulación. No demuestra coordenadas políticas oficiales, personalidad o ideología estable, estereotipos latentes, conciencia del sesgo, causalidad de entrenamiento, significación estadística ni reproducibilidad integral.