Can LLMs Ground when they (Don’t) Know: A Study on Direct and Loaded Political Questions

Aplicaciones, sesgos y seguridad2025ACL AnthologyRevisión editorial aprobada

Autores: Clara Lachenmaier, Judith Sieker, Sina Zarrieß

Palabras clave: Computation and Language, Artificial Intelligence

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
8
Hallazgos
13
Limitaciones
5
Evidencias

Resumen editorial

Español

El artículo evalúa si GPT-4o, Llama-3-8B y Mistral-7B-Instruct-v0.3 rechazan presuposiciones falsas sobre posiciones de partidos alemanes o las incorporan como si fueran ciertas. A partir del Wahl-O-Mat de las elecciones europeas de 2024, cada hecho se formula como pregunta directa afirmativa, pregunta directa negada y seis preguntas cargadas con verbos factivos. Cada prompt se ejecuta tres veces. Dos autoras etiquetan las respuestas directas y siete anotadores, incluidas las autoras, clasifican las cargadas como desinformación acomodada, rechazada o respuesta imprecisa; el paper informa kappa de Fleiss 0,82 y Cohen medio 0,72. Según las tablas publicadas, GPT rechaza el 38,1% de las respuestas cargadas, Llama el 20,7% y Mistral el 10,4%; GPT y Mistral acomodan el 41,4% y 64,1%, mientras Llama produce sobre todo respuestas imprecisas (48,1%). En preguntas directas, GPT alcanza 76,5% global, Mistral 61,6% y Llama 51,4%. El desempeño directo alto no garantiza rechazo de la premisa falsa: GPT mejora en el grupo de seis respuestas directas correctas, pero todavía falla en otros grupos; Mistral acomoda con frecuencia pese a responder muchas afirmativas correctamente. El artículo interpreta la mayor exactitud en preguntas afirmativas que negadas como posible evitación del desacuerdo o face-saving, y la mayor tasa de rechazo de GPT en contenidos sobre AfD como posible sesgo político. Ambas explicaciones son exploratorias: la negación confunde dificultad lingüística con desacuerdo, no se analizan los controles cargados con presuposición verdadera y no se manipula ni mide face-saving. Además, las posiciones electorales son posteriores al probable corte de conocimiento de los modelos. La auditoría del FLEX publicado en Zenodo encuentra una discrepancia importante: el paper declara 882 preguntas cargadas y 147+147 directas, pero los CSV actuales contienen 855 cargadas y 184+184 directas. La Tabla 3 se reproduce exactamente solo incluyendo 37 preguntas por condición sobre GRÜNE, partido omitido del método; las tablas cargadas no se reproducen porque faltan 27 prompts. El archivo también contiene etiquetas inválidas Y/Z, una etiqueta vacía y una respuesta vacía. Por tanto, el artefacto respalda el patrón general, pero no la muestra declarada ni todas las cifras exactas.

English

The paper evaluates whether GPT-4o, Llama-3-8B and Mistral-7B-Instruct-v0.3 reject false presuppositions about German political-party positions or incorporate them as true. Using 2024 European-election Wahl-O-Mat positions, each fact is expressed as an affirmative direct question, a negated direct question and six loaded questions using factive verbs. Every prompt is run three times. The first two authors label direct answers, while seven annotators including the authors classify loaded responses as misinformation accommodated, rejected or imprecise; the paper reports Fleiss' kappa of 0.82 and mean pairwise Cohen's kappa of 0.72. In the published tables, GPT rejects 38.1% of loaded responses, Llama 20.7% and Mistral 10.4%; GPT and Mistral accommodate 41.4% and 64.1%, while Llama mostly produces imprecise answers (48.1%). On direct questions, GPT reaches 76.5% overall accuracy, Mistral 61.6% and Llama 51.4%. Strong direct performance does not guarantee rejection of a false premise: GPT improves in the group with six correct direct answers but still fails in other groups, and Mistral frequently accommodates despite answering many affirmative questions correctly. The paper interprets higher accuracy on affirmative than negated questions as possible disagreement avoidance or face-saving, and GPT's higher rejection rate for AfD content as possible political bias. Both accounts are exploratory: negation confounds linguistic difficulty with disagreement, loaded controls with true presuppositions are not analyzed, and face-saving is neither manipulated nor measured. The election positions also postdate the models' likely knowledge cutoffs. Auditing the public FLEX Zenodo artifact reveals a material discrepancy: the paper reports 882 loaded and 147+147 direct prompts, but the current CSVs contain 855 loaded and 184+184 direct prompts. Table 3 reproduces exactly only when including 37 prompts per condition about GRÜNE, a party omitted from the stated method; loaded tables do not reproduce because 27 prompts are missing. The file also contains invalid Y/Z labels, one empty label and one empty response. The artifact therefore supports the broad pattern but not the declared sample or every exact figure.

Pregunta de investigación

¿Los LLM conocen posiciones políticas verificadas y, cuando una pregunta cargada presupone su negación, corrigen activamente la premisa falsa; cómo varía esa conducta con la exactitud directa, la polaridad de la pregunta y el partido?

Método

Benchmark alemán de preguntas sintéticas a partir de posiciones Wahl-O-Mat 2024. Tres modelos generan tres respuestas por prompt. Las preguntas directas aproximan conocimiento mediante etiquetas A/N/U; las cargadas usan seis verbos factivos y etiquetas humanas de acomodación, rechazo o imprecisión. Se agrupan hechos por 0-1, 2-3, 4-5 o 6 respuestas directas correctas y se suma un grounding score 0-6 para cada terna cargada. Los resultados son descriptivos, sin modelo inferencial.

Muestra: El paper declara cuatro partidos, 147 hechos partido-afirmación, 147 preguntas directas afirmativas, 147 negadas y 882 cargadas; tres respuestas por prompt y modelo. El artefacto actual contiene 368 directas, 184 por condición, con GRÜNE además de los cuatro partidos declarados, y 855 cargadas sobre 143 pares partido-tema. Faltan los cuatro pares EU-Steuern y tres triggers para CDU/CSU-Verbrennungsmotoren.

Hallazgos

  • En las tablas publicadas, GPT rechaza 38,1% de respuestas cargadas, Llama 20,7% y Mistral 10,4%; Mistral acomoda 64,1%, GPT 41,4% y Llama 31,3%.
  • Llama concentra respuestas imprecisas (48,1%) y presenta la mayor variabilidad entre tres generaciones del mismo prompt (76,64% en el paper).
  • La exactitud directa publicada es 76,5% para GPT, 61,6% para Mistral y 51,4% para Llama; todos rinden peor en preguntas negadas que afirmativas.
  • Solo GPT muestra una mejora clara del grounding score en el grupo de seis respuestas directas correctas, pero la relación se presenta descriptivamente y no elimina fallos bajo incertidumbre.
  • GPT rechaza más las premisas falsas sobre AfD (60,5% en el paper) y también más sobre DIE LINKE que sobre partidos centristas; el mecanismo no está identificado.
  • La Tabla 3 se reconstruye exactamente con 184 prompts por condición y 552 respuestas por modelo, no con los 147 y 441 declarados; incluye GRÜNE sin indicarlo en el método.
  • Los CSV actuales no reconstruyen exactamente las tasas, variabilidad o tablas por partido de las preguntas cargadas porque contienen 855 en vez de 882 prompts.
  • El dataset abierto aporta respuestas y etiquetas útiles, pero presenta dos etiquetas fuera de dominio, una etiqueta vacía, una respuesta vacía y carece de versionado semántico.

Limitaciones

  • Las posiciones Wahl-O-Mat de junio de 2024 pueden ser posteriores al entrenamiento; los grupos de belief son consistencia operativa, no acceso demostrado a conocimiento actual.
  • El paper no especifica snapshot de GPT-4o, revisiones exactas de Llama/Mistral, fechas de inferencia, decoding, semillas, sistema o runtime.
  • No se publican código, scripts analíticos ni entorno de ejecución.
  • Las etiquetas individuales de siete anotadores no están disponibles, por lo que los kappas y la adjudicación no se reproducen.
  • Las respuestas directas las etiquetan dos autoras sin estadística de acuerdo independiente.
  • Las preguntas comparten hechos y cada prompt tiene tres generaciones, pero los porcentajes no modelan clustering ni incertidumbre.
  • No hay tests, intervalos ni efectos para comparar modelos, grupos, polaridades o partidos.
  • Negación y respuesta correcta No confunden dificultad lingüística con evitación social del desacuerdo.
  • Se recogieron preguntas cargadas con presupuestos verdaderos, pero no se analizan como control de acomodación o face-saving.
  • La clase imprecisa mezcla desconocimiento, evasivas, irrelevancia y sinsentido; darle valor medio 1 impone una escala no validada.
  • El espectro de cuatro partidos no está balanceado y el análisis de sesgo es post hoc.
  • La discrepancia entre paper y Zenodo impide reproducir todas las cifras exactas.
  • El estudio es alemán, de un solo turno y con preguntas sintéticas.

Qué no demuestra

  • No demuestra que los modelos tengan creencias, common ground o motivos humanos de face-saving.
  • No prueba que evitar desacuerdo cause la diferencia entre preguntas afirmativas y negadas.
  • No prueba que un sesgo de izquierdas cause el mayor rechazo de contenidos AfD.
  • No mide limpiamente conocimiento actualizado sobre posiciones electorales de junio de 2024.
  • No demuestra que cada respuesta imprecisa amplifique desinformación ni que sea ordinalmente intermedia.
  • No mide cambio de creencias del usuario, propagación real de desinformación o reparación multi-turno.
  • No generaliza a otras lenguas, sistemas políticos, prompts, modelos o checkpoints actuales.
  • No permite reproducir exactamente las tablas loaded con el Zenodo actual.
  • No sostiene que las cifras publicadas correspondan de forma consistente al diseño declarado de cuatro partidos.
  • No atribuye resultados a configuraciones de inferencia inmutables y completamente especificadas.

Trazabilidad

Alcance: Texto completo

Versión: ACL Anthology current version 2, pages 14956-14975; FLEX Zenodo revision 9 audited separately

Fuente consultada: https://aclanthology.org/2025.acl-long.728/

Revisión: Codex 20-page visual, official-ACL-v2, arXiv-source, FLEX-Zenodo, CSV-grain, row-count, label-domain, table-reconstruction, internal-consistency, construct, statistics and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • GPT-4o, snapshot unspecified
  • Llama-3-8B, exact instruct checkpoint/revision unspecified
  • Mistral-7B-Instruct-v0.3
  • BLOOMZ, generated and released but excluded from main analysis

Instrumentos y métricas

  • Wahl-O-Mat 2024 European-election party positions
  • FLEX direct confirmatory and disconfirmatory questions
  • FLEX loaded questions with six factive verbs
  • Human A/N/U response annotation guidelines
  • Fleiss' kappa
  • Mean pairwise Cohen's kappa
  • Four direct-answer belief groups
  • Grounding score from 0 to 6

Datos utilizados

  • FLEX Benchmark, Zenodo DOI 10.5281/zenodo.15348857
  • FLEX_claims_direct.csv, current 368 rows
  • FLEX_claims_loaded.csv, current 855 rows
  • FLEX_scenarios.csv, concurrent experiment not used for this paper's main numerical claims

Evidencia y localización

  • Metadatos, DOI, versiones y abstract: ACL Anthology 2025.acl-long.728 current v2
  • Método, resultados, errores internos, limitaciones, ética y apéndices: ACL 2025 v2 PDF, 20 páginas, sha256 679b6726ff597638088b17a9dc2a81af1367dc3c7eb1d9a143dfcc03379bef83
  • Materias oficiales, historial y fuente TeX sin código: arXiv:2506.08952v2
  • Conteos, scope, missing prompts, etiquetas y reconstrucción de tablas: FLEX Benchmark Zenodo 15348857 revision 9; direct sha256 c56d20f1a5c7befb43a2ddb4628d519b05108d0faad1e7885c9018cb01bf80aa; loaded sha256 b9108c32eb1f5f6b7813747e273ebbfc95e2737fe5c223794351348bae84b463
  • Auditoría de muestra, calidad de datos, estadística, constructos, claims y reproducibilidad: reports/verification/article-242-acl-flex-political-grounding-sample-count-data-drift-and-claim-audit.json