The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment

Evaluación y validez psicométrica2026arXivRevisión editorial aprobada

Autores: Haonan Huang

Palabras clave: response bias, moral judgment, answer order, lexical bias, crossed symmetrization, measurement invariance, LLM evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

1
Autores
6
Hallazgos
7
Limitaciones
4
Evidencias

Resumen editorial

Español

El estudio separa tres explicaciones que una pregunta sí/no confunde: el veredicto lógico, la palabra elegida y la posición impresa de la respuesta. Usa 20 dilemas morales, 19 reproducidos de un trabajo anterior, y una batería de simetrización cruzada que invierte acción/complemento, dirección de escala, redacción, etiquetas y orden. Siete configuraciones frontier y dos modelos abiertos responden escalas graduadas, elección libre y formatos binarios; las API muestreadas se ejecutan a temperatura 1 con 3–8 réplicas por celda. En escalas graduadas, las configuraciones frontier muestran incoherencia entre formas de 0,12–0,21 en un eje ±1, mientras Qwen3.6-35B-A3B llega a 0,40 y Nemotron-3-Nano-30B-A3B se concentra cerca del punto medio. En el binario sí/no, el desplazamiento aparente se descompone exactamente en atracción por el último elemento y por la etiqueta. Claude Sonnet y Haiku presentan los artefactos mayores (-0,32 y -0,86, respectivamente); GPT-5.5 y Gemini se acercan a cero, y el razonamiento extendido reduce varios efectos. Al sustituir sí/no por A/B, colores, glifos o palabras de otros idiomas, el componente unido al veredicto es aproximadamente cero en todos los frontier, aunque persisten preferencias de etiqueta y orden dependientes del modelo. El resultado justifica cruzar formulaciones antes de interpretar una respuesta como valor moral. No demuestra, sin embargo, una escala moral interna en sentido psicológico: establece coherencia de salidas dentro de este instrumento, estos veinte dilemas y una sesión sin contexto. La comparación humana reutiliza dos muestras publicadas (N=285 y N=474) cuyos participantes no recorren todas las formas, y no hay datos humanos nuevos. Aunque el texto afirma que raw trials, código y una pipeline reproducen todo, el depósito conserva un marcador pendiente y el paquete arXiv omite SI, datos, código, prerregistro y scripts; por tanto, las cifras no pueden reproducirse de forma independiente desde el artefacto auditado.

English

The study separates three explanations that a yes/no question confounds: logical verdict, chosen word, and printed answer position. It uses 20 moral dilemmas, 19 reproduced from earlier work, and a crossed-symmetrization battery that reverses action/complement, scale direction, wording, labels, and order. Seven frontier configurations and two open models answer graded scales, free choices, and binary formats; sampled APIs run at temperature 1 with 3–8 replications per cell. On graded scales, frontier configurations show cross-form incoherence of 0.12–0.21 on a ±1 axis, while Qwen3.6-35B-A3B reaches 0.40 and Nemotron-3-Nano-30B-A3B clusters near the midpoint. In forced yes/no, the apparent shift decomposes exactly into attraction to the last option and to the label. Claude Sonnet and Haiku show the largest artifacts (-0.32 and -0.86 respectively); GPT-5.5 and Gemini are near zero, and extended reasoning reduces several effects. Replacing yes/no with A/B, colors, glyphs, or non-English words leaves the verdict-attached component near zero for every frontier model, although model-specific label and order preferences remain. The result supports crossing formulations before interpreting a response as a moral value. It does not establish an internal moral scale in a psychological sense: it demonstrates within-instrument output coherence for these twenty dilemmas in context-free single turns. The human comparison reuses two published samples (N=285 and N=474) whose participants do not traverse every crossed form, and no new human data are collected. Although the text claims raw trials, code, and a pipeline regenerate every result, the deposition remains a placeholder and the arXiv package omits the SI, data, code, preregistration, and scripts, so the reported numbers cannot be independently reproduced from the audited artifact.

Pregunta de investigación

¿Los cambios de veredicto en dilemas morales reflejan una alteración del juicio del modelo o artefactos separables de orden, etiqueta y redacción?

Método

Veinte dilemas se presentan mediante escalas graduadas, elección libre y formatos binarios con factores lógicamente irrelevantes cruzados y balanceados. Se estiman stance θ, incoherencia entre formas, sesgo aparente, componentes lógico/lexical/orden y un modelo logístico con susceptibilidad m y decisividad s.

Muestra: Veinte dilemas. Las condiciones graduadas cruzan 48 formas; la elección libre usa 12. Claude cubre 49–50 formas binarias y el resto un baseline común de 12. Las API tienen 3–8 réplicas por condición; los modelos abiertos usan logits y replicaciones saltadas.

Hallazgos

  • La incoherencia entre formas graduadas es 0,12–0,21 en los frontier y 0,40 en Qwen abierto.
  • El sesgo sí/no se descompone en orden más componente lexical.
  • El componente lógico unido al veredicto es aproximadamente cero en todos los frontier.
  • Claude presenta artefactos sustanciales; GPT-5.5 y Gemini se acercan a cero.
  • El razonamiento extendido reduce la susceptibilidad en varios pares de configuración.
  • Las preferencias de etiquetas son graduales, multilingües y específicas del modelo.

Limitaciones

  • Veinte dilemas, con 19 exposiciones verbatim potencialmente presentes en entrenamiento.
  • Coherencia dentro de modelo e instrumento, no validez moral externa o longitudinal.
  • Los modelos y APIs no forman una muestra representativa y pueden cambiar.
  • Las formas binarias no tienen la misma amplitud en Claude y los demás, aunque se informa un análisis emparejado.
  • La comparación humana procede de diseños anteriores y no cruza todas las formas por persona.
  • Persona, system prompt, conversación multivuelta y contexto permanecen fijos.
  • SI, raw trials, código, scripts, prerregistro y DOI de depósito no están disponibles.

Qué no demuestra

  • No demuestra valores, conciencia, intención o razonamiento moral internos.
  • No crea un eje moral objetivo comparable entre modelos.
  • No prueba que todo sesgo sí/no sea superficial en cualquier tarea.
  • No elimina artefactos en modelos abiertos ni en todas las configuraciones.
  • No demuestra equivalencia de medida con personas.
  • No permite reproducir de forma independiente las cifras publicadas.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2607.05552v1; complete 15-page PDF and main TeX; cited SI, raw trials, code, preregistration and deposition unavailable in the audited package

Fuente consultada: https://arxiv.org/abs/2607.05552v1

Revisión: Codex 15-page visual full-text, TeX, measurement, arithmetic, human-comparator and artifact audit, 2026-07-18

Aprobación: Codex fidelity pass, 2026-07-18

Modelos evaluados

  • Claude Sonnet 4.6
  • Claude Haiku 4.5
  • GPT-5.5
  • Gemini 3 Flash Preview
  • Gemini 3 Flash Lite
  • Qwen3.6-35B-A3B
  • NVIDIA Nemotron-3-Nano-30B-A3B

Instrumentos y métricas

  • 48-condition graded moral scale
  • Free-choice instrument under 12 framings
  • Forced-binary crossed instrument
  • 13 label-family map
  • Cross-form incoherence
  • P = sigma((theta ± m)/s)

Datos utilizados

  • 20 moral dilemmas, including 19 verbatim from Cheung, Maier, and Lieder
  • Previously published human Study 1 (N=285)
  • Previously published human Study 2 (N=474)

Evidencia y localización

  • Diseño de simetrización y escala graduada: arXiv v1, Results and Methods, pp. 1–4 and 9–11
  • Descomposición de orden, léxico y lógica: arXiv v1, Figures 2–6, pp. 3–9
  • Alcance humano y límites de la escala: arXiv v1, Discussion and Human data, pp. 6–12
  • Artefactos ausentes: arXiv v1 Data availability placeholder and audited TeX package contents