GermanPartiesQA: Benchmarking Commercial Large Language Models and AI Companions for Political Alignment and Sycophancy

Aplicaciones, sesgos y seguridad2025AAAIRevisión editorial aprobada

Autores: Jan Batzner, Volker Stocker, Stefan Schmid, Gjergji Kasneci

Palabras clave: GermanPartiesQA, Political alignment, Party-position factuality, Persona-based steerability, Wahl-o-Mat, Sycophancy terminology, AIES 2025

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
16
Hallazgos
24
Limitaciones
9
Evidencias

Resumen editorial

Español

GermanPartiesQA separa tres preguntas que no deben confundirse: si un LLM conoce la posición oficial de un partido, cuánto coincide su propia respuesta forzada con las respuestas partidistas y cuánto cambia al recibir el contexto de un político. No estudia personalidad. Las “personas” son prompts breves con nombre, partido, género, año de nacimiento y formación de líderes parlamentarios reales; la afiliación política se entrega explícitamente. El resultado es steerability condicionada por contexto, no inferencia de rasgos ni una personalidad política interna.

El paper compila declaraciones de Wahl-o-Mat de diez elecciones regionales y una federal entre 2021 y 2023. Reporta 418 ítems, cada uno con respuestas Agree, Disagree o Neutral de SPD, Verdes, Die Linke, CDU-CSU, FDP y AfD. Evalúa seis modelos comerciales en enero de 2025: gpt-4o-2024-08-06, gpt-3.5-turbo-0125, claude-3-sonnet-20240229, claude-2.1, command-r-plus-04-2024 y command. Cada declaración se consulta separadamente diez veces; se comparan temperaturas 0 y 1. El prompt y los ítems son alemanes.

La primera prueba pregunta directamente qué respondió cada partido y exige coincidencia exacta. GPT-4o obtiene las mejores cifras por partido, entre 69,38 % para SPD y 87,11 % para AfD; Command las menores, entre 47,23 % para AfD y 65,22 % para Die Linke. Los autores destacan errores en los partidos centristas SPD y CDU-CSU. Este resultado mide recuerdo o reconstrucción de posiciones electorales históricas, no la posición política propia del modelo. Tampoco implica que el modelo genere asesoramiento electoral correcto en diálogo abierto.

La segunda prueba pide al modelo responder Agree, Disagree o Neutral a cada enunciado. El alineamiento principal imita Wahl-o-Mat: 1 punto por coincidencia, 0 por oposición y 0,5 cuando una respuesta polar se compara con Neutral. Con esa métrica, los modelos suelen puntuar más alto frente a SPD, Verdes y Die Linke y más bajo frente a AfD. Por ejemplo, GPT-4o alcanza 75,78 % con Verdes y 34,59 % con AfD; Command R+ alcanza 70,93 % con SPD y 41,32 % con AfD. El artículo denomina al patrón alineamiento específico del modelo y señala una tendencia izquierda-verde en varias comparaciones, especialmente en versiones más nuevas de OpenAI y Cohere.

Esa lectura requiere una salvedad central: el score combina contenido con estilo de respuesta. En el CSV público, SPD, Verdes y Die Linke tienen más respuestas Agree que AfD; los modelos también difieren en aquiescencia y uso de Neutral. Al exigir coincidencia exacta, Claude 3 Sonnet pierde entre 36,4 y 40,3 puntos y Claude 2.1 entre 43,2 y 47,0, porque ambos seleccionan Neutral con frecuencia. Command y Command R+ caen mucho menos. La ordenación izquierda-verde permanece en varias celdas, pero el nivel absoluto y parte de las diferencias dependen de prevalencia de etiquetas y propensión de respuesta, no solo de ideología. No se ajustan marginales, dificultad de ítem, región o tiempo mediante un modelo estadístico.

La tercera prueba añade “I am [político]” o “You are [político]”. En ambos casos las respuestas se desplazan hacia el partido nombrado y partidos próximos, con diferencias grandes entre proveedores. Para un ejemplo CDU-CSU, GPT-4o sube más de 24 puntos, Command R+ más de 12 y Claude 3 Sonnet poco más de 2. Sin embargo, la máxima variación relativa no siempre produce el mayor score absoluto con el partido solicitado: con una persona AfD, los modelos pueden seguir coincidiendo más con CDU-CSU o FDP que con AfD. Las condiciones I am y You are producen patrones casi indistinguibles. Por eso el propio artículo concluye que el diseño no identifica sycophancy: no mide intención de adular, percepción humana ni acuerdo con una opinión del usuario frente a una verdad objetiva. El término más fiel es persona-based political steerability.

La demostración de Character.ai es distinta del benchmark principal. Examina un chatbot de Alice Weidel creado por un usuario, seleccionado por su número de interacciones, y un subconjunto de preguntas de Berlín 2023; reporta 58 % de coincidencia con AfD. No es un modelo controlado por los autores ni evidencia representativa de los 27 bots o de 364.542 chats citados, y no se publican sus transcripciones.

La auditoría del repositorio público descubre una brecha material entre el artefacto y el paper. En el commit 198d92f solo hay README y GermanPartiesQA-1.csv: no hay código, prompts ejecutables, outputs, figuras, tests, entorno, releases ni licencia. El CSV parsea 413 filas, no 418; faltan BY-18, HB-13, HB-26, SH-18 y SL-29. El texto del paper dice siete partidos, pero enumera y publica seis. Hay 36 posiciones AfD vacías.

Además, las justificaciones bávaras están sistemáticamente mal asociadas. Al comparar A1-A38 de Baviera con J1-J38 de Schleswig-Holstein, 34 de 37 pares compartidos tienen similitud media superior a 0,95 entre sus seis justificaciones; la media global es 0,987. Así, la pregunta BY A1 sobre horarios comerciales lleva razones SH J1 sobre energía eólica, BY A2 sobre policía fronteriza lleva razones sobre vacunación y BY A3 sobre agricultura ecológica lleva razones sobre la A20. Las traducciones inglesas también contienen errores evidentes y truncamientos. Como el análisis principal usa declaraciones alemanas y etiquetas de posición, esta corrupción no prueba por sí sola que los scores publicados sean erróneos; sí invalida las justificaciones liberadas, contradice el corpus público de 418 y hace imposible reproducir tablas y figuras.

La conclusión fiel es que, en forced-choice alemán y con snapshots comerciales de enero de 2025, los modelos difieren en factualidad, distribución de respuestas y sensibilidad a prompts que nombran partidos y políticos. El estudio aporta una crítica útil al uso indiscriminado de “sycophancy”. No demuestra personalidad sintética, ideología interna estable, simulación fiel de políticos, persuasión de votantes, conducta en producción ni un benchmark público limpio y plenamente reproducible.

English

GermanPartiesQA separates three questions that must not be conflated: whether an LLM knows a party's official position, how often its own forced-choice answers match party answers, and how much it changes when given a politician context. It does not study personality. Its “personas” are short prompts containing a real parliamentary leader's name, party, gender, birth year and education; political affiliation is supplied explicitly. The outcome is context-conditioned steerability, not trait inference or an internal political personality.

The paper compiles Wahl-o-Mat statements from ten state elections and one federal election held between 2021 and 2023. It reports 418 items with Agree, Disagree or Neutral answers from SPD, Greens, Die Linke, CDU-CSU, FDP and AfD. Six commercial models were evaluated in January 2025: gpt-4o-2024-08-06, gpt-3.5-turbo-0125, claude-3-sonnet-20240229, claude-2.1, command-r-plus-04-2024 and command. Each statement was queried separately ten times, and temperatures 0 and 1 were compared. Prompts and statements were in German.

The first test directly asks what each party answered and requires an exact match. GPT-4o has the best party-level values, ranging from 69.38% for SPD to 87.11% for AfD; Command has the lowest, from 47.23% for AfD to 65.22% for Die Linke. The authors emphasize errors for the centrist SPD and CDU-CSU. This outcome measures recall or reconstruction of historical electoral positions, not the model's own political position. It also does not establish accurate electoral advice in open dialogue.

The second test asks the model to answer Agree, Disagree or Neutral itself. The primary alignment score mirrors Wahl-o-Mat: 1 for a match, 0 for opposition and .5 when a polar answer is compared with Neutral. Models generally score higher against SPD, Greens and Die Linke and lower against AfD. GPT-4o, for example, reaches 75.78% with Greens and 34.59% with AfD; Command R+ reaches 70.93% with SPD and 41.32% with AfD. The paper describes model-specific alignment and a left-green pattern in several comparisons, especially for newer OpenAI and Cohere variants.

That interpretation needs a central caveat: the score mixes content with response style. In the released CSV, SPD, Greens and Die Linke have more Agree labels than AfD, while models differ in acquiescence and Neutral use. Under exact match, Claude 3 Sonnet drops by 36.4-40.3 percentage points and Claude 2.1 by 43.2-47.0 because both often choose Neutral; Command and Command R+ fall much less. A left-green ordering remains in several cells, but absolute levels and some differences depend on label prevalence and answer propensity, not ideology alone. The analysis does not adjust marginals, item difficulty, region or time with a statistical model.

The third test adds “I am [politician]” or “You are [politician].” Both shift answers toward the named party and nearby parties, with large provider differences. In one CDU-CSU example, GPT-4o increases by more than 24 points, Command R+ by more than 12, and Claude 3 Sonnet by only a little over 2. Yet the largest relative shift does not always yield the largest absolute match with the requested party: under an AfD persona, models may still match CDU-CSU or FDP more than AfD. I am and You are produce nearly indistinguishable patterns. The paper therefore concludes that this design does not identify sycophancy: it measures neither intent to flatter, human perception nor agreement with a user's opinion against objective truth. Persona-based political steerability is the faithful term.

The Character.ai demonstration is separate from the main benchmark. It tests one user-created Alice Weidel chatbot, selected by interaction count, on a subset of 2023 Berlin questions and reports 58% agreement with AfD. It is neither an author-controlled model nor representative evidence about the 27 bots or 364,542 chats mentioned, and its transcripts are not released.

The public-repository audit found a material gap between artifact and paper. At commit 198d92f, the repository contains only a README and GermanPartiesQA-1.csv: no experiment code, executable prompts, outputs, figures, tests, environment, releases or license. The CSV parses to 413 rows rather than 418; BY-18, HB-13, HB-26, SH-18 and SL-29 are absent. The paper says seven parties but names and releases six. Thirty-six AfD positions are empty.

Bavarian rationales are also systematically misattached. Comparing Bavaria A1-A38 with Schleswig-Holstein J1-J38, 34 of 37 shared-ID pairs have mean six-party rationale similarity above .95; the overall mean is .987. Thus BY A1 on shop opening carries SH J1 wind-energy rationales, BY A2 on border police carries vaccination rationales, and BY A3 on organic agriculture carries Autobahn A20 rationales. English translations also contain clear truncation and mistranslation. Because the main analysis uses German statements and categorical position labels, this corruption does not by itself prove the published scores wrong. It does invalidate the released rationales, contradict the public 418-row claim and make tables and figures unreproducible.

The faithful conclusion is that, in German forced-choice prompts with January 2025 commercial snapshots, models differ in factual recall, response distribution and sensitivity to explicit party-and-politician contexts. The paper offers a useful critique of indiscriminate “sycophancy” terminology. It does not establish synthetic personality, stable internal ideology, faithful politician simulation, voter persuasion, production behavior or a clean and fully reproducible public benchmark.

Pregunta de investigación

¿Con qué posiciones oficiales de seis partidos alemanes coinciden las respuestas de seis LLM comerciales, con qué exactitud recuerdan esas posiciones y cómo cambia el patrón al introducir prompts I am/You are con líderes parlamentarios reales?

Método

Benchmark forced-choice en alemán con declaraciones Wahl-o-Mat de once elecciones y etiquetas partidistas Agree/Disagree/Neutral. Se consultan seis modelos diez veces por ítem y se comparan temperaturas 0 y 1. La factualidad usa coincidencia exacta; el alineamiento usa score Wahl-o-Mat 1/0,5/0 y una sensibilidad de exact match; el role-play añade nombre, partido, género, edad y formación bajo I am o You are. La auditoría revisa el PDF completo y perfila el repositorio/CSV público.

Muestra: Se reportan 418 declaraciones, seis partidos, seis LLM y diez ejecuciones por declaración/modelo, con temperaturas 0 y 1. El role-play usa líderes de los grupos parlamentarios del 20.º Bundestag; las figuras detallan GPT-4o, Claude 3 Sonnet y Command R+. El artefacto público solo contiene 413 declaraciones y no publica outputs, por lo que no puede reconstruirse el número final de respuestas válidas, refusals ni el denominador exacto de cada figura.

Hallazgos

  • GPT-4o presenta la mayor exactitud factual por partido y Command la menor.
  • La exactitud GPT-4o va de 69,38 % para SPD a 87,11 % para AfD.
  • La exactitud Command va de 47,23 % para AfD a 65,22 % para Die Linke.
  • Los autores destacan limitaciones factuales especialmente para SPD y CDU-CSU.
  • Con score parcial, la coincidencia suele ser mayor con SPD, Verdes y Die Linke y menor con AfD.
  • GPT-4o puntúa 75,78 % con Verdes y 34,59 % con AfD bajo el score principal.
  • Command R+ puntúa 70,93 % con SPD y 41,32 % con AfD.
  • El uso de coincidencia exacta reduce drásticamente scores de modelos que responden Neutral con frecuencia.
  • Claude 2.1 pierde 43,2-47,0 puntos y Claude 3 Sonnet 36,4-40,3 frente al score parcial.
  • Temperatura 0 y 1 producen diferencias medias pequeñas, aunque no se reportan pruebas inferenciales.
  • I am y You are desplazan respuestas hacia el partido de la persona y partidos ideológicamente cercanos.
  • La magnitud de steerability varía mucho entre proveedores.
  • Las condiciones I am y You are son casi indistinguibles en sus patrones.
  • La máxima variación relativa no garantiza máxima coincidencia absoluta con el partido solicitado.
  • El artículo recomienda persona-based political steerability en vez de sycophancy.
  • La auditoría encuentra que el CSV público no corresponde a un benchmark limpio de 418 filas.

Limitaciones

  • No se mide personalidad ni rasgos psicológicos.
  • La afiliación política se entrega explícitamente en la persona.
  • I am y You are no identifican intención de adular o agradar.
  • No hay participantes humanos, percepción, opinión cambiada o conducta electoral.
  • El formato forced-choice no representa conversación política natural.
  • El score parcial confunde contenido con aquiescencia y uso de Neutral.
  • La prevalencia de Agree difiere entre partidos.
  • No se modelan marginales de respuesta, dificultad de ítem, región o año.
  • No se reportan intervalos, tests de hipótesis o corrección por múltiples comparaciones.
  • Los asteriscos de Table 5 son umbrales de desviación estándar, no significancia.
  • Las once elecciones combinan niveles de gobierno, regiones y momentos distintos.
  • Los modelos son snapshots comerciales cerrados de enero de 2025.
  • El identificador Cohere command es un alias genérico, no una revisión inmutable.
  • La demostración Character.ai usa un solo bot creado por un usuario y preguntas seleccionadas.
  • No se publican transcripciones de Character.ai.
  • El repositorio solo contiene README y CSV, pese a afirmaciones de código abierto.
  • El CSV contiene 413 filas en lugar de 418 y cinco IDs ausentes.
  • El paper dice siete partidos, pero enumera y publica seis.
  • Hay 36 posiciones AfD vacías.
  • Las justificaciones de Baviera están copiadas sistemáticamente de Schleswig-Holstein por ID.
  • Las traducciones inglesas incluyen truncamientos y errores graves.
  • No hay licencia, schema, tests, releases o procedencia por fila.
  • No hay outputs ni scripts para recalcular figuras y tablas.
  • Los defectos del release no prueban por sí solos que los scores internos del paper sean erróneos, pero impiden verificarlos.

Qué no demuestra

  • No demuestra ideología interna estable en los LLM.
  • No demuestra personalidad sintética.
  • No demuestra sycophancy como intención o adulación.
  • No demuestra simulación fiel de políticos concretos.
  • No demuestra que las respuestas representen opiniones de usuarios reales.
  • No demuestra influencia sobre creencias o voto.
  • No evalúa conducta real de herramientas electorales desplegadas.
  • No identifica la causa de diferencias entre proveedores.
  • No generaliza a otros idiomas, sistemas políticos o modelos actuales.
  • No valida 418 filas públicas limpias.
  • No permite reproducción numérica completa.
  • No convierte coincidencia con un partido en apoyo o preferencia política del modelo.

Trazabilidad

Alcance: Texto completo

Versión: AIES 2025 proceedings version, pp. 330-342; arXiv:2407.18008v2 metadata checked. Thirteen-page PDF fully rendered and visually inspected; public repository and released CSV audited at commit 198d92f1b0686e9356b67254bc882d58768dfe21.

Fuente consultada: https://ojs.aaai.org/index.php/AIES/article/view/36552

Revisión: Codex full-text, visual, methodological and public-dataset audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • OpenAI gpt-4o-2024-08-06
  • OpenAI gpt-3.5-turbo-0125
  • Anthropic claude-3-sonnet-20240229
  • Anthropic claude-2.1
  • Cohere command-r-plus-04-2024
  • Cohere command
  • One user-created Character.ai Alice Weidel chatbot in a separate demonstration

Instrumentos y métricas

  • GermanPartiesQA German forced-choice prompts
  • Wahl-o-Mat Agree/Disagree/Neutral response format
  • Exact party-position factuality score
  • Wahl-o-Mat 1/0.5/0 alignment score
  • Exact-match alignment sensitivity analysis
  • Random response baseline
  • Always-Neutral baseline
  • I am [politician] context prompt
  • You are [politician] role-play prompt
  • Ten-run consistency analysis at temperatures 0 and 1

Datos utilizados

  • 418 Wahl-o-Mat statements reported across 11 German elections from 2021-2023
  • 413 rows actually released in GermanPartiesQA-1.csv
  • Official categorical positions for SPD, Greens, Left, CDU-CSU, FDP and AfD
  • Public politician metadata from abgeordnetenwatch.de
  • No released model outputs or experiment code
  • Public repository at commit 198d92f1b0686e9356b67254bc882d58768dfe21

Evidencia y localización

  • Alcance, preguntas y separación conceptual: AIES 2025 proceedings pp. 330-332, Abstract, Introduction and Table 2
  • Corpus, partidos, modelos, prompts y repeticiones: AIES 2025 proceedings pp. 332-334, Data, Method and Table 3
  • Exactitud factual por partido: AIES 2025 proceedings p. 334, Figure 2 and Results A
  • Alineamiento base, temperaturas y score exacto: AIES 2025 proceedings pp. 335-337, Figures 3-4 and Tables 4-5
  • Role-play, steerability y crítica a sycophancy: AIES 2025 proceedings pp. 335-336, Figures 5-7 and Discussion
  • Reproducibilidad, límites, recomendaciones y ética: AIES 2025 proceedings pp. 337-338
  • Publicación y versión arXiv: Official AIES record and arXiv:2407.18008v2 metadata
  • Conteos, IDs ausentes, justificaciones corruptas y artefactos faltantes: janbatzner/GermanPartiesQA commit 198d92f1b0686e9356b67254bc882d58768dfe21 audited 16 July 2026
  • Informe completo: reports/verification/article-215-germanpartiesqa-data-and-validity-audit.json