Distributive Fairness in Large Language Models: Evaluating Alignment with Human Values

Aplicaciones, sesgos y seguridad2025arXivRevisión editorial aprobada

Autores: Hadi Hosseini, Samarth Khanna

Palabras clave: Justicia distributiva, División justa, Equidad, Ausencia de envidia, Maximin rawlsiano, Valores humanos, Personas normativas, Reproducibilidad

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
10
Hallazgos
13
Limitaciones
6
Evidencias

Resumen editorial

Español

El artículo compara cómo cuatro LLM distribuyen bienes indivisibles, y en algunos problemas también dinero transferible, con las respuestas de un cuestionario humano anterior. Es relevante para personalidad sintética porque incluye prompts denominados «personas», pero aquí una persona consiste en decir explícitamente al modelo que «se preocupa» por equidad, ausencia de envidia, maximin rawlsiano o bienestar utilitarista. No se mide un rasgo psicológico, una identidad persistente ni una preferencia latente estable. La fuente auditada es arXiv v2, aceptada en NeurIPS 2025: se renderizaron e inspeccionaron visualmente sus 43 páginas y se contrastó el repositorio oficial en el commit indicado.

El benchmark adapta diez instancias I1–I10 de un estudio de cuestionario de Herreiner y Puppe. Dos o tres personas tienen valoraciones cardinales aditivas sobre entre tres y seis bienes; algunas instancias añaden dinero. Para cada modelo e instancia se recogen 100 respuestas a temperatura 1. El protocolo tiene dos turnos: primero pide explicar y proponer el reparto considerado más justo, sin plantilla; después solicita convertir ese reparto a JSON. Los modelos principales son GPT-4o gpt-4o-2024-05-13, Claude 3.5 Sonnet claude-3-5-sonnet-20240620, Llama 3 70B llama3-70b-8192 y Gemini 1.5 Pro bajo el alias flotante gemini-1.5-pro. Se clasifican las asignaciones por equidad, incluida igualdad perfecta, EQ*, ausencia de envidia (EF), maximin rawlsiano (RMM), optimalidad de Pareto (PO) y suma utilitarista máxima (USW). Como varias propiedades pueden coincidir, los porcentajes agregados por noción no son categorías excluyentes.

En promedio sobre las diez instancias, la equidad aparece en el 29,0 % de las respuestas humanas, frente al 8,5 % de GPT-4o, 7,7 % de Claude, 6,5 % de Llama y 7,9 % de Gemini. En cambio, PO aparece en 47,8 % de las humanas, 68,7 % de GPT-4o, 54,1 % de Claude, 71,0 % de Llama y 39,7 % de Gemini; USW aparece en 12,9 %, 25,4 %, 17,0 %, 36,1 % y 17,0 %, respectivamente. Esto apoya la conclusión descriptiva de que, bajo este protocolo, los modelos generan con mucha menos frecuencia las asignaciones que minimizan diferencias de utilidad y varios favorecen eficiencia. No permite identificar una única «preferencia» cuando el modelo puede haber fallado en cálculo, búsqueda, formato o interpretación.

Las instancias concretas muestran mejor la brecha. En I6, el reparto perfectamente equitativo único recibe 32,6 % de respuestas humanas, una de GPT-4o y ninguna de los otros tres modelos. En I7, con dinero, el reparto EQ*+RMM+PO recibe 55,1 % humano, 8 % GPT-4o, 2 % Gemini y 0 % Claude y Llama. Sin embargo, el abstract exagera al afirmar que los LLM son incapaces de usar dinero. En cuatro instancias nuevas, GPT-4o alcanza EQ*+EF en 43 %, 54 %, 58 % y 69 % y además USW en 43 %, 52 %, 56 % y 66 %. La conclusión fiel es que la mayoría de estos sistemas y condiciones rara vez usan el dinero para minimizar desigualdad, con GPT-4o como excepción importante; usar dinero y usarlo para equidad tampoco son lo mismo.

El contraste más informativo separa generación y selección. Cuando se ofrece un menú de cuatro o cinco asignaciones frecuentes entre humanos, GPT-4o elige EQ* en más del 60 % de las respuestas de cada una de cinco instancias y Claude supera el 70 % salvo en I7; Gemini y Llama quedan por debajo de 2 % y 1 % global. En menús deliberadamente injustos, GPT-4o y Claude suelen escoger la opción menos desigual: en I2 lo hacen 89 y 73 veces, mientras Gemini y Llama eligen la más desigual 93 y 73 veces. Por tanto, parte del resultado depende de tener que construir el reparto y no solo reconocerlo, aunque la diferencia entre familias persiste.

Las intervenciones no ofrecen una receta general. El ejemplo de razonamiento paso a paso mejora condiciones concretas, I2 para GPT-4o y Claude, e I7 para GPT-4o, pero apenas cambia la igualdad perfecta de I6. Las «personas» normativas funcionan especialmente mal para equidad: la tasa agregada mostrada es 17,5 % GPT-4o, 3,3 % Claude, 0,5 % Llama y 3,5 % Gemini. Objetivos directos y hasta dos reintentos con feedback mejoran algunos casos, pero todos fallan por completo en EQ* para I5 y casi todos en EF para I7. Cambiar orden o formato también altera sustancialmente las distribuciones: una plantilla JSON en un solo turno cambia la asignación modal en 3/10 instancias de GPT-4o, 5/10 de Llama, 6/10 de Gemini y 7/10 de Claude, sin aumentar equidad.

La afirmación inferencial central necesita cautela. Una nota dice que un test exacto de Fisher demuestra en cada instancia que la distribución de cada LLM difiere de la humana con p<.05. El código liberado no ejecuta un contraste ómnibus de la distribución completa: recorre categorías dibujadas y aplica muchos tests 2×2 de una categoría contra su complemento. Además usa los porcentajes humanos decimales como si fueran conteos sobre n=100, aunque no publica los denominadores humanos originales ni datos fila a fila, y no corrige multiplicidad. Las salidas del notebook contienen p-valores por categoría superiores a .05, incluidos .6827 y 1.0. Otra ruta aplica chi-cuadrado a porcentajes y produce inf o nan con ceros. Las frecuencias descriptivas son auditables; la afirmación global de significación no queda reproducida mediante un análisis válido.

El repositorio aporta evidencia valiosa: 1.224 CSV, unos 155 MB, texto bruto, asignaciones parseadas, cinco notebooks y 40 archivos principales con 100 filas para las diez instancias y cuatro modelos. Pero no incluye README, licencia, dependencias o lockfile, entorno, tests, CI, diccionario de datos, tag o release inmutable. Los scripts principales son ramas experimentales ad hoc; main.py tiene casi toda la adquisición comentada y su estado activo construye un único prompt de Claude. Los notebooks mezclan estados, modelos y rutas históricas. Tampoco se liberan respuestas humanas originales. Es posible reconstruir muchos resultados con trabajo manual, pero no repetir el estudio de extremo a extremo desde un entorno limpio ni rehacer correctamente la comparación inferencial humana.

«Alineación con valores humanos» significa aquí proximidad a las frecuencias de una muestra de un cuestionario de 2007, no valores universales. Los humanos vieron las diez instancias juntas y cada llamada al LLM solo una; difieren contexto, orden y dependencia. Cien muestreos del mismo endpoint no son cien agentes independientes. Las utilidades aditivas comparables entre personas son una idealización normativa fuerte y «Other» puede contener criterios razonables fuera de las seis nociones seleccionadas. La contribución defendible es un benchmark amplio, con artefactos ricos, que revela baja generación de soluciones equitativas, diferencias entre generación y selección y gran sensibilidad al protocolo en versiones concretas. No demuestra personalidad, moralidad interna, alineación general, daño en sistemas reales ni vigencia para modelos actuales.

English

The paper compares how four LLMs allocate indivisible goods, and, in some problems, transferable money, with responses from an earlier human questionnaire. It matters to synthetic-personality research because it includes prompts called personas, but a persona here explicitly tells the model that it cares about equitability, envy-freeness, Rawlsian maximin, or utilitarian welfare. No psychological trait, persistent identity, or stable latent preference is measured. The audited source is arXiv v2, accepted at NeurIPS 2025: all 43 pages were rendered and visually inspected, and the official repository was checked at the recorded commit.

The benchmark adapts ten instances I1–I10 from Herreiner and Puppe's questionnaire study. Two or three people have additive cardinal valuations over three to six goods, with money added in some instances. One hundred responses are collected per model and instance at temperature 1. The protocol uses two turns: the first asks for an explanation and the allocation considered fairest without a template; the second asks the same chat to express that allocation as JSON. The focal models are GPT-4o gpt-4o-2024-05-13, Claude 3.5 Sonnet claude-3-5-sonnet-20240620, Llama 3 70B llama3-70b-8192, and Gemini 1.5 Pro under the floating gemini-1.5-pro alias. Allocations are classified by equitability, including perfect equitability, EQ*, envy-freeness (EF), Rawlsian maximin (RMM), Pareto optimality (PO), and maximum utilitarian social welfare (USW). Because properties overlap, aggregate notion percentages are not mutually exclusive categories.

Averaged across the ten instances, equitability is satisfied by 29.0% of human responses, compared with 8.5% GPT-4o, 7.7% Claude, 6.5% Llama, and 7.9% Gemini. PO prevalence is 47.8% for humans, 68.7% GPT-4o, 54.1% Claude, 71.0% Llama, and 39.7% Gemini; USW prevalence is 12.9%, 25.4%, 17.0%, 36.1%, and 17.0%, respectively. This supports the descriptive conclusion that under this protocol the models generate allocations minimizing payoff differences much less often, while several favor efficiency. It does not identify a single model preference when arithmetic, search, formatting, or interpretation can also fail.

Specific instances make the gap clearer. In I6, the unique perfectly equitable allocation receives 32.6% of human responses, one GPT-4o response, and none from the other models. In money instance I7, the EQ*+RMM+PO allocation receives 55.1% human, 8% GPT-4o, 2% Gemini, and 0% Claude and Llama. The abstract nevertheless overstates the result by saying LLMs are unable to use money. Across four new instances, GPT-4o reaches EQ*+EF in 43%, 54%, 58%, and 69% of responses and also USW in 43%, 52%, 56%, and 66%. The faithful conclusion is that most tested systems and conditions rarely use money to minimize inequality, with GPT-4o as an important exception; using money and using it equitably are also distinct.

The most informative contrast separates generation from selection. When offered four or five allocations derived from frequent human responses, GPT-4o selects EQ* in more than 60% of responses in each of five instances and Claude exceeds 70% except I7; Gemini and Llama are below 2% and 1% overall. In deliberately unfair menus, GPT-4o and Claude usually select the least unequal option: in I2 they do so 89 and 73 times, while Gemini and Llama select the most unequal option 93 and 73 times. Part of the result therefore arises from constructing rather than merely recognizing an allocation, although model-family differences remain.

The interventions are not a general solution. A worked reasoning example improves selected conditions, I2 for GPT-4o and Claude and I7 for GPT-4o, but barely changes perfect equitability in I6. Normative personas perform especially poorly for equitability: the aggregate rate shown is 17.5% GPT-4o, 3.3% Claude, 0.5% Llama, and 3.5% Gemini. Direct objectives and up to two feedback retries improve some cases, yet every model still fails completely on EQ* for I5 and almost every model on EF for I7. Order and format changes also alter distributions substantially: a one-turn JSON template changes the modal allocation in 3/10 GPT-4o, 5/10 Llama, 6/10 Gemini, and 7/10 Claude instances, without increasing equitability.

The central inferential claim requires caution. A footnote says Fisher's exact test shows that every LLM distribution differs from the human distribution in every instance at p<.05. The released code does not run an omnibus test of a complete distribution: it loops over plotted categories and runs many 2x2 tests of one category versus its complement. It also treats decimal human percentages as counts out of 100 even though original human denominators and row-level records are not released, and it applies no multiplicity correction. Notebook outputs include category p-values above .05, including .6827 and 1.0. Another route applies chi-square to percentages and produces inf or nan with zero cells. Descriptive frequencies are auditable; the global significance statement is not reproduced by a valid released analysis.

The repository provides unusually useful evidence: 1,224 CSVs, roughly 155 MB, raw response text, parsed allocations, five notebooks, and 40 focal files with 100 rows for each of the ten instances and four models. It has no README, license, dependency manifest or lock, environment, tests, CI, data dictionary, tag, or immutable release. Main scripts are ad hoc experimental branches; most acquisition code in main.py is commented and its active state constructs one Claude prompt. Notebooks mix states, models, and historical paths. Original row-level human responses are also absent. Many results can be reconstructed manually, but the study cannot be rerun end to end from a clean environment or used to rebuild a sound human inferential comparison.

Human-values alignment here means proximity to response frequencies from one 2007 questionnaire sample, not universal human values. Humans saw all ten instances together while each LLM call sees one, creating different context, ordering, and dependence. One hundred samples from one endpoint are not one hundred independent agents. Interpersonally comparable additive utilities are a strong normative idealization, and Other can contain reasonable principles outside the chosen notions. The defensible contribution is a broad, artifact-rich benchmark showing rare generation of equitable solutions, a generation-selection gap, and substantial protocol sensitivity for specific model versions. It does not establish personality, internal morality, general alignment, real-world harm, or current-model behavior.

Pregunta de investigación

¿En qué medida las asignaciones generadas o seleccionadas por versiones concretas de cuatro LLM satisfacen nociones formales de división justa y reproducen las frecuencias de un cuestionario humano, y cómo cambian ante dinero, menús, razonamiento, objetivos, personas normativas, feedback, orden y formato?

Método

Benchmark de diez problemas de división no estratégica con valoraciones cardinales aditivas, dos o tres personas y 100 muestras por modelo e instancia a temperatura 1. Un primer turno pide explicar y generar el reparto más justo y un segundo lo parsea a JSON. Las asignaciones se clasifican por EQ/EQ*, EF, RMM, PO y USW y se comparan descriptivamente con porcentajes humanos publicados. Experimentos adicionales prueban menús, dinero, CoT, intenciones, personas normativas, objetivos, refinamiento, rol participante, orden, plantillas, versiones GPT y Gemini 2.5 Pro. La auditoría editorial revisó las 43 páginas y el código, notebooks y CSV del commit oficial.

Muestra: Por cada una de diez instancias se muestrean 100 respuestas de cada uno de cuatro endpoints, 4.000 salidas principales. Los porcentajes humanos proceden de un cuestionario anterior cuyos participantes vieron las diez instancias conjuntamente; este artículo no informa los n originales por instancia ni libera las respuestas individuales.

Hallazgos

  • EQ promedio: humanos 29,0 %, GPT-4o 8,5 %, Claude 7,7 %, Llama 6,5 % y Gemini 7,9 %.
  • PO promedio: 47,8 %, 68,7 %, 54,1 %, 71,0 % y 39,7 %; USW: 12,9 %, 25,4 %, 17,0 %, 36,1 % y 17,0 %.
  • En I6, EQ* recibe 32,6 % humano, 1/100 GPT-4o y 0/100 en los demás.
  • En I7 con dinero, EQ*+RMM+PO recibe 55,1 % humano, 8 % GPT-4o, 2 % Gemini y 0 % Claude/Llama.
  • GPT-4o sí usa dinero para EQ*+EF en 43-69 % de cuatro instancias nuevas, por lo que la incapacidad absoluta del abstract no se sostiene.
  • En menús humanos, GPT-4o y Claude seleccionan EQ* con mucha más frecuencia que al generarlo; Gemini y Llama no muestran esa mejora.
  • CoT, objetivos, personas y feedback mejoran condiciones concretas pero no de forma uniforme.
  • Una plantilla JSON cambia la asignación modal en 3/10 a 7/10 instancias según el modelo, sin aumentar equidad.
  • Gemini 1.5 Pro produce respuestas fuera de todas las nociones seleccionadas en 27,9 %, frente a aproximadamente 14-15 % en humanos y otros modelos.
  • El test publicado no reproduce un contraste global válido de cada distribución contra humanos.

Limitaciones

  • La referencia humana es un único cuestionario antiguo, no valores humanos universales o interculturales.
  • Humanos ven las diez instancias juntas y cada llamada al LLM solo una; cambian contexto, orden y dependencia.
  • Cien muestras del mismo endpoint no son cien agentes independientes ni preferencias estables.
  • Error de cálculo, búsqueda, parsing o instrucción se confunde con preferencia normativa.
  • Los porcentajes por noción se solapan y Other puede incluir principios no seleccionados.
  • Las utilidades cardinales aditivas y comparables entre personas son una idealización fuerte.
  • La persona es una instrucción normativa explícita, no un constructo psicométrico.
  • El análisis Fisher liberado usa tests categoría-contra-resto y porcentajes humanos como pseudoconteos sobre 100.
  • No hay denominadores ni microdatos humanos, contraste ómnibus reproducible o corrección por multiplicidad.
  • Gemini usa un alias flotante; faltan fechas, request IDs, seeds, top-p y revisiones inmutables.
  • El repositorio no tiene README, licencia, dependencias, lock, tests, CI, diccionario o release.
  • Scripts y notebooks son ad hoc y requieren reconstrucción manual para regenerar tablas y figuras.
  • Las tareas son pequeñas, no estratégicas, en inglés y con dos o tres personas; no representan sistemas de asignación reales.

Qué no demuestra

  • No establece personalidad humana, identidad persistente o preferencia moral interna del modelo.
  • No establece que una muestra de cuestionario represente los valores humanos en general.
  • No establece alineación moral, seguridad o justicia general de GPT-4o.
  • No establece que toda respuesta no equitativa sea tolerancia a la desigualdad.
  • No establece incapacidad absoluta de los LLM para usar dinero.
  • No establece que personas, CoT, objetivos o feedback alineen de forma robusta.
  • No establece que todas las distribuciones difieran significativamente con un test global válido.
  • No generaliza a modelos actuales, otros idiomas, culturas, preferencias no aditivas o decisiones reales de alto impacto.
  • No permite reproducción de extremo a extremo desde un entorno limpio sin trabajo sustancial.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2502.00313v2; 43-page preprint accepted at NeurIPS 2025. Every PDF page was rendered and visually inspected. The official repository was audited at commit 8c117903829b36f3bdde6cc3691f06597af979fa, including code, notebooks and 1,224 result CSVs.

Fuente consultada: https://arxiv.org/abs/2502.00313v2

Revisión: Codex full-text, 43-page visual, bilingual-fidelity, construct, statistical, code, data and reproducibility audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • GPT-4o gpt-4o-2024-05-13 via OpenAI
  • Claude 3.5 Sonnet claude-3-5-sonnet-20240620 via Anthropic
  • Llama 3 70B llama3-70b-8192 via Groq
  • Gemini 1.5 Pro gemini-1.5-pro via Google
  • Gemini 2.5 Pro in supplementary comparison
  • GPT-4 Turbo, GPT-4 Preview and GPT-3.5 Turbo in supplementary comparison

Instrumentos y métricas

  • Ten fair-division instances adapted from Herreiner and Puppe 2007
  • Equitability and perfect equitability (EQ/EQ*)
  • Envy-freeness (EF)
  • Rawlsian maximin (RMM)
  • Pareto optimality (PO)
  • Utilitarian social welfare maximization (USW)
  • Human-response allocation-frequency reference
  • Menu selection, CoT, normative persona, objective, feedback, order and template interventions

Datos utilizados

  • Ten original fair-division questionnaire instances I1-I10
  • 4,000 focal endpoint samples: 10 instances × 4 models × 100 responses
  • Human percentages hard-coded from the prior questionnaire; no row-level human data or denominators released
  • Official repository with 1,224 CSV files, approximately 155 MB, and five notebooks
  • Forty focal raw CSVs with 100 rows each plus many supplementary model and prompt conditions

Evidencia y localización

  • Diseño, nociones, instancias y comparación principal: arXiv:2502.00313v2, pp. 1-8, Abstract and Sections 1-4
  • Menús, CoT, personas, refinamiento, sesgo y limitaciones: arXiv:2502.00313v2, pp. 8-10, Sections 4-6
  • Tablas detalladas, intervalos, menús, CoT, objetivos, robustez y modelos: arXiv:2502.00313v2, pp. 21-29, Appendices C-H, Tables 5, 9-16 and Figures 5-12
  • Instancias, prompts y asignaciones humanas: arXiv:2502.00313v2, pp. 29-43, Appendices I-K
  • Código, datos y ruta estadística liberada: SamarthKhanna/Distributive-Fairness-LLMs commit 8c117903829b36f3bdde6cc3691f06597af979fa, Experiments/components.py, notebooks and results
  • Auditoría de constructo, estadística, versiones y reproducibilidad: reports/verification/article-224-distributive-fairness-human-alignment-validity-and-reproducibility-audit.json