El artículo evalúa si GPT-4o, Llama-3-8B y Mistral-7B-Instruct-v0.3 rechazan presuposiciones falsas sobre posiciones de partidos alemanes o las incorporan como si fueran ciertas. A partir del Wahl-O-Mat de las elecciones europeas de 2024, cada hecho se formula como pregunta directa afirmativa, pregunta directa negada y seis preguntas cargadas con verbos factivos. Cada prompt se ejecuta tres veces. Dos autoras etiquetan las respuestas directas y siete anotadores, incluidas las autoras, clasifican las cargadas como desinformación acomodada, rechazada o respuesta imprecisa; el paper informa kappa de Fleiss 0,82 y Cohen medio 0,72. Según las tablas publicadas, GPT rechaza el 38,1% de las respuestas cargadas, Llama el 20,7% y Mistral el 10,4%; GPT y Mistral acomodan el 41,4% y 64,1%, mientras Llama produce sobre todo respuestas imprecisas (48,1%). En preguntas directas, GPT alcanza 76,5% global, Mistral 61,6% y Llama 51,4%. El desempeño directo alto no garantiza rechazo de la premisa falsa: GPT mejora en el grupo de seis respuestas directas correctas, pero todavía falla en otros grupos; Mistral acomoda con frecuencia pese a responder muchas afirmativas correctamente. El artículo interpreta la mayor exactitud en preguntas afirmativas que negadas como posible evitación del desacuerdo o face-saving, y la mayor tasa de rechazo de GPT en contenidos sobre AfD como posible sesgo político. Ambas explicaciones son exploratorias: la negación confunde dificultad lingüística con desacuerdo, no se analizan los controles cargados con presuposición verdadera y no se manipula ni mide face-saving. Además, las posiciones electorales son posteriores al probable corte de conocimiento de los modelos. La auditoría del FLEX publicado en Zenodo encuentra una discrepancia importante: el paper declara 882 preguntas cargadas y 147+147 directas, pero los CSV actuales contienen 855 cargadas y 184+184 directas. La Tabla 3 se reproduce exactamente solo incluyendo 37 preguntas por condición sobre GRÜNE, partido omitido del método; las tablas cargadas no se reproducen porque faltan 27 prompts. El archivo también contiene etiquetas inválidas Y/Z, una etiqueta vacía y una respuesta vacía. Por tanto, el artefacto respalda el patrón general, pero no la muestra declarada ni todas las cifras exactas.
Pregunta de investigación
¿Los LLM conocen posiciones políticas verificadas y, cuando una pregunta cargada presupone su negación, corrigen activamente la premisa falsa; cómo varía esa conducta con la exactitud directa, la polaridad de la pregunta y el partido?