GermanPartiesQA separa tres preguntas que no deben confundirse: si un LLM conoce la posición oficial de un partido, cuánto coincide su propia respuesta forzada con las respuestas partidistas y cuánto cambia al recibir el contexto de un político. No estudia personalidad. Las “personas” son prompts breves con nombre, partido, género, año de nacimiento y formación de líderes parlamentarios reales; la afiliación política se entrega explícitamente. El resultado es steerability condicionada por contexto, no inferencia de rasgos ni una personalidad política interna.
El paper compila declaraciones de Wahl-o-Mat de diez elecciones regionales y una federal entre 2021 y 2023. Reporta 418 ítems, cada uno con respuestas Agree, Disagree o Neutral de SPD, Verdes, Die Linke, CDU-CSU, FDP y AfD. Evalúa seis modelos comerciales en enero de 2025: gpt-4o-2024-08-06, gpt-3.5-turbo-0125, claude-3-sonnet-20240229, claude-2.1, command-r-plus-04-2024 y command. Cada declaración se consulta separadamente diez veces; se comparan temperaturas 0 y 1. El prompt y los ítems son alemanes.
La primera prueba pregunta directamente qué respondió cada partido y exige coincidencia exacta. GPT-4o obtiene las mejores cifras por partido, entre 69,38 % para SPD y 87,11 % para AfD; Command las menores, entre 47,23 % para AfD y 65,22 % para Die Linke. Los autores destacan errores en los partidos centristas SPD y CDU-CSU. Este resultado mide recuerdo o reconstrucción de posiciones electorales históricas, no la posición política propia del modelo. Tampoco implica que el modelo genere asesoramiento electoral correcto en diálogo abierto.
La segunda prueba pide al modelo responder Agree, Disagree o Neutral a cada enunciado. El alineamiento principal imita Wahl-o-Mat: 1 punto por coincidencia, 0 por oposición y 0,5 cuando una respuesta polar se compara con Neutral. Con esa métrica, los modelos suelen puntuar más alto frente a SPD, Verdes y Die Linke y más bajo frente a AfD. Por ejemplo, GPT-4o alcanza 75,78 % con Verdes y 34,59 % con AfD; Command R+ alcanza 70,93 % con SPD y 41,32 % con AfD. El artículo denomina al patrón alineamiento específico del modelo y señala una tendencia izquierda-verde en varias comparaciones, especialmente en versiones más nuevas de OpenAI y Cohere.
Esa lectura requiere una salvedad central: el score combina contenido con estilo de respuesta. En el CSV público, SPD, Verdes y Die Linke tienen más respuestas Agree que AfD; los modelos también difieren en aquiescencia y uso de Neutral. Al exigir coincidencia exacta, Claude 3 Sonnet pierde entre 36,4 y 40,3 puntos y Claude 2.1 entre 43,2 y 47,0, porque ambos seleccionan Neutral con frecuencia. Command y Command R+ caen mucho menos. La ordenación izquierda-verde permanece en varias celdas, pero el nivel absoluto y parte de las diferencias dependen de prevalencia de etiquetas y propensión de respuesta, no solo de ideología. No se ajustan marginales, dificultad de ítem, región o tiempo mediante un modelo estadístico.
La tercera prueba añade “I am [político]” o “You are [político]”. En ambos casos las respuestas se desplazan hacia el partido nombrado y partidos próximos, con diferencias grandes entre proveedores. Para un ejemplo CDU-CSU, GPT-4o sube más de 24 puntos, Command R+ más de 12 y Claude 3 Sonnet poco más de 2. Sin embargo, la máxima variación relativa no siempre produce el mayor score absoluto con el partido solicitado: con una persona AfD, los modelos pueden seguir coincidiendo más con CDU-CSU o FDP que con AfD. Las condiciones I am y You are producen patrones casi indistinguibles. Por eso el propio artículo concluye que el diseño no identifica sycophancy: no mide intención de adular, percepción humana ni acuerdo con una opinión del usuario frente a una verdad objetiva. El término más fiel es persona-based political steerability.
La demostración de Character.ai es distinta del benchmark principal. Examina un chatbot de Alice Weidel creado por un usuario, seleccionado por su número de interacciones, y un subconjunto de preguntas de Berlín 2023; reporta 58 % de coincidencia con AfD. No es un modelo controlado por los autores ni evidencia representativa de los 27 bots o de 364.542 chats citados, y no se publican sus transcripciones.
La auditoría del repositorio público descubre una brecha material entre el artefacto y el paper. En el commit 198d92f solo hay README y GermanPartiesQA-1.csv: no hay código, prompts ejecutables, outputs, figuras, tests, entorno, releases ni licencia. El CSV parsea 413 filas, no 418; faltan BY-18, HB-13, HB-26, SH-18 y SL-29. El texto del paper dice siete partidos, pero enumera y publica seis. Hay 36 posiciones AfD vacías.
Además, las justificaciones bávaras están sistemáticamente mal asociadas. Al comparar A1-A38 de Baviera con J1-J38 de Schleswig-Holstein, 34 de 37 pares compartidos tienen similitud media superior a 0,95 entre sus seis justificaciones; la media global es 0,987. Así, la pregunta BY A1 sobre horarios comerciales lleva razones SH J1 sobre energía eólica, BY A2 sobre policía fronteriza lleva razones sobre vacunación y BY A3 sobre agricultura ecológica lleva razones sobre la A20. Las traducciones inglesas también contienen errores evidentes y truncamientos. Como el análisis principal usa declaraciones alemanas y etiquetas de posición, esta corrupción no prueba por sí sola que los scores publicados sean erróneos; sí invalida las justificaciones liberadas, contradice el corpus público de 418 y hace imposible reproducir tablas y figuras.
La conclusión fiel es que, en forced-choice alemán y con snapshots comerciales de enero de 2025, los modelos difieren en factualidad, distribución de respuestas y sensibilidad a prompts que nombran partidos y políticos. El estudio aporta una crítica útil al uso indiscriminado de “sycophancy”. No demuestra personalidad sintética, ideología interna estable, simulación fiel de políticos, persuasión de votantes, conducta en producción ni un benchmark público limpio y plenamente reproducible.