El artículo compara cómo cuatro LLM distribuyen bienes indivisibles, y en algunos problemas también dinero transferible, con las respuestas de un cuestionario humano anterior. Es relevante para personalidad sintética porque incluye prompts denominados «personas», pero aquí una persona consiste en decir explícitamente al modelo que «se preocupa» por equidad, ausencia de envidia, maximin rawlsiano o bienestar utilitarista. No se mide un rasgo psicológico, una identidad persistente ni una preferencia latente estable. La fuente auditada es arXiv v2, aceptada en NeurIPS 2025: se renderizaron e inspeccionaron visualmente sus 43 páginas y se contrastó el repositorio oficial en el commit indicado.
El benchmark adapta diez instancias I1–I10 de un estudio de cuestionario de Herreiner y Puppe. Dos o tres personas tienen valoraciones cardinales aditivas sobre entre tres y seis bienes; algunas instancias añaden dinero. Para cada modelo e instancia se recogen 100 respuestas a temperatura 1. El protocolo tiene dos turnos: primero pide explicar y proponer el reparto considerado más justo, sin plantilla; después solicita convertir ese reparto a JSON. Los modelos principales son GPT-4o gpt-4o-2024-05-13, Claude 3.5 Sonnet claude-3-5-sonnet-20240620, Llama 3 70B llama3-70b-8192 y Gemini 1.5 Pro bajo el alias flotante gemini-1.5-pro. Se clasifican las asignaciones por equidad, incluida igualdad perfecta, EQ*, ausencia de envidia (EF), maximin rawlsiano (RMM), optimalidad de Pareto (PO) y suma utilitarista máxima (USW). Como varias propiedades pueden coincidir, los porcentajes agregados por noción no son categorías excluyentes.
En promedio sobre las diez instancias, la equidad aparece en el 29,0 % de las respuestas humanas, frente al 8,5 % de GPT-4o, 7,7 % de Claude, 6,5 % de Llama y 7,9 % de Gemini. En cambio, PO aparece en 47,8 % de las humanas, 68,7 % de GPT-4o, 54,1 % de Claude, 71,0 % de Llama y 39,7 % de Gemini; USW aparece en 12,9 %, 25,4 %, 17,0 %, 36,1 % y 17,0 %, respectivamente. Esto apoya la conclusión descriptiva de que, bajo este protocolo, los modelos generan con mucha menos frecuencia las asignaciones que minimizan diferencias de utilidad y varios favorecen eficiencia. No permite identificar una única «preferencia» cuando el modelo puede haber fallado en cálculo, búsqueda, formato o interpretación.
Las instancias concretas muestran mejor la brecha. En I6, el reparto perfectamente equitativo único recibe 32,6 % de respuestas humanas, una de GPT-4o y ninguna de los otros tres modelos. En I7, con dinero, el reparto EQ*+RMM+PO recibe 55,1 % humano, 8 % GPT-4o, 2 % Gemini y 0 % Claude y Llama. Sin embargo, el abstract exagera al afirmar que los LLM son incapaces de usar dinero. En cuatro instancias nuevas, GPT-4o alcanza EQ*+EF en 43 %, 54 %, 58 % y 69 % y además USW en 43 %, 52 %, 56 % y 66 %. La conclusión fiel es que la mayoría de estos sistemas y condiciones rara vez usan el dinero para minimizar desigualdad, con GPT-4o como excepción importante; usar dinero y usarlo para equidad tampoco son lo mismo.
El contraste más informativo separa generación y selección. Cuando se ofrece un menú de cuatro o cinco asignaciones frecuentes entre humanos, GPT-4o elige EQ* en más del 60 % de las respuestas de cada una de cinco instancias y Claude supera el 70 % salvo en I7; Gemini y Llama quedan por debajo de 2 % y 1 % global. En menús deliberadamente injustos, GPT-4o y Claude suelen escoger la opción menos desigual: en I2 lo hacen 89 y 73 veces, mientras Gemini y Llama eligen la más desigual 93 y 73 veces. Por tanto, parte del resultado depende de tener que construir el reparto y no solo reconocerlo, aunque la diferencia entre familias persiste.
Las intervenciones no ofrecen una receta general. El ejemplo de razonamiento paso a paso mejora condiciones concretas, I2 para GPT-4o y Claude, e I7 para GPT-4o, pero apenas cambia la igualdad perfecta de I6. Las «personas» normativas funcionan especialmente mal para equidad: la tasa agregada mostrada es 17,5 % GPT-4o, 3,3 % Claude, 0,5 % Llama y 3,5 % Gemini. Objetivos directos y hasta dos reintentos con feedback mejoran algunos casos, pero todos fallan por completo en EQ* para I5 y casi todos en EF para I7. Cambiar orden o formato también altera sustancialmente las distribuciones: una plantilla JSON en un solo turno cambia la asignación modal en 3/10 instancias de GPT-4o, 5/10 de Llama, 6/10 de Gemini y 7/10 de Claude, sin aumentar equidad.
La afirmación inferencial central necesita cautela. Una nota dice que un test exacto de Fisher demuestra en cada instancia que la distribución de cada LLM difiere de la humana con p<.05. El código liberado no ejecuta un contraste ómnibus de la distribución completa: recorre categorías dibujadas y aplica muchos tests 2×2 de una categoría contra su complemento. Además usa los porcentajes humanos decimales como si fueran conteos sobre n=100, aunque no publica los denominadores humanos originales ni datos fila a fila, y no corrige multiplicidad. Las salidas del notebook contienen p-valores por categoría superiores a .05, incluidos .6827 y 1.0. Otra ruta aplica chi-cuadrado a porcentajes y produce inf o nan con ceros. Las frecuencias descriptivas son auditables; la afirmación global de significación no queda reproducida mediante un análisis válido.
El repositorio aporta evidencia valiosa: 1.224 CSV, unos 155 MB, texto bruto, asignaciones parseadas, cinco notebooks y 40 archivos principales con 100 filas para las diez instancias y cuatro modelos. Pero no incluye README, licencia, dependencias o lockfile, entorno, tests, CI, diccionario de datos, tag o release inmutable. Los scripts principales son ramas experimentales ad hoc; main.py tiene casi toda la adquisición comentada y su estado activo construye un único prompt de Claude. Los notebooks mezclan estados, modelos y rutas históricas. Tampoco se liberan respuestas humanas originales. Es posible reconstruir muchos resultados con trabajo manual, pero no repetir el estudio de extremo a extremo desde un entorno limpio ni rehacer correctamente la comparación inferencial humana.
«Alineación con valores humanos» significa aquí proximidad a las frecuencias de una muestra de un cuestionario de 2007, no valores universales. Los humanos vieron las diez instancias juntas y cada llamada al LLM solo una; difieren contexto, orden y dependencia. Cien muestreos del mismo endpoint no son cien agentes independientes. Las utilidades aditivas comparables entre personas son una idealización normativa fuerte y «Other» puede contener criterios razonables fuera de las seis nociones seleccionadas. La contribución defendible es un benchmark amplio, con artefactos ricos, que revela baja generación de soluciones equitativas, diferencias entre generación y selección y gran sensibilidad al protocolo en versiones concretas. No demuestra personalidad, moralidad interna, alineación general, daño en sistemas reales ni vigencia para modelos actuales.