Generative AI voting: fair collective choice is resilient to LLM biases and inconsistencies

Sociedad, cultura y comportamiento colectivo2026link.springer.comRevisión editorial aprobada

Autores: Srijoni Majumdar, Edith Elkind, Evangelos Pournaras

Palabras clave: Voting, Generative AI, Large language models, Collective decision making, Social choice, Proportional representation, Participatory budgeting, Voter turnout

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
9
Hallazgos
20
Limitaciones
5
Evidencias

Resumen editorial

Español

El artículo pregunta qué ocurre cuando un LLM genera el voto de una persona a partir de rasgos demográficos, políticos y de preferencias, y si el diseño de la votación puede amortiguar sus errores. Su resultado más sólido no es que la IA represente bien a cada votante: en los formatos complejos lo hace muy mal. La consistencia individual media entre voto humano y sintético es 5,68 % en la votación real de Aarau y 28,005 % en su encuesta hipotética, frente a 84,5 % en las elecciones estadounidenses binarias. La aportación útil es otra: al agregar miles de votos, algunos conjuntos de ganadores son bastante más estables que las predicciones individuales, y esa estabilidad depende mucho de la regla de agregación.

El estudio combina tres escenarios observados. ANES aporta las elecciones presidenciales de Estados Unidos de 2012, 2016 y 2020: el texto parte de 20.650 encuestados, conserva 17.010 perfiles completos y usa voto único con mayoría. City Idea, una campaña de presupuesto participativo realizada en Aarau en 2023, aporta una encuesta de 3.314 personas sobre cinco proyectos con voto único, aprobación y puntuación, y una votación real de 1.703 ciudadanos sobre 33 proyectos con papeleta acumulativa; 505 votantes tienen rasgos enlazados para la emulación. El diseño suma correctamente 21, 207 y 135 elecciones emuladas, 363 en total.

Se etiquetan seis LLM, GPT-4o Mini, GPT-3.5, GPT-3, DeepSeek R1, Gemini 1.5 Flash y Llama 3 8B, y una red neuronal predictiva. Los prompts son zero-shot, incluyen el contexto electoral y rasgos personales, y piden razonamiento paso a paso. El suplemento dice que se probaron temperaturas de 0,4 a 0 y 20 ejecuciones por ajuste, promediando la consistencia. Sin embargo, no publica un manifiesto que asocie cada resultado con checkpoint, proveedor, endpoint, parámetros, temperatura, repetición, prompt exacto, parser o fallo. Las dos ventanas de recogida, junio-noviembre de 2023 y abril-agosto de 2025, tampoco se vinculan modelo por modelo. Por ello, los nombres genéricos no permiten reconstruir qué sistemas respondieron.

La métrica principal cuenta coincidencias relativas en comparaciones de Condorcet entre dos papeletas. Para comparar formatos, convierte puntuaciones y votos acumulativos a representaciones binarias y excluye empates; para resultados colectivos, convierte proyectos en ganadores o perdedores. Es una medida razonable de similitud ordinal, pero no valida que el agente comparta las razones, valores o mandato de la persona. La conversión descarta intensidad y empates y puede alterar el denominador. En especial, el método de equal shares suele financiar más proyectos baratos que utilitarian greedy, lo que eleva mecánicamente la coincidencia de conjuntos de ganadores. Los autores reconocen el problema: equal shares y Phragmén promedian 69,9 % de consistencia colectiva, 31,6 puntos más que greedy, pero la ventaja baja a 22,8 puntos al igualar el número de ganadores.

Entre los LLM, GPT-4o Mini obtiene la mayor consistencia individual y supera en 4,85 puntos a GPT-3.5 y en 7,85 a Llama 3 8B. La red neuronal queda 1,7 puntos por encima del promedio de LLM a nivel individual y 2,9 a nivel colectivo. La consistencia entre formatos humanos es 97,1 %; en los modelos baja a 74,3 % para GPT-4o Mini, 72,1 % para GPT-3.5, 76,2 % para Llama 3 8B, 71,23 % para Gemini y 68,7 % para DeepSeek. Equal shares aumenta 12,2 puntos la consistencia colectiva entre formatos frente a greedy. Estos contrastes describen esta simulación; no son pruebas generales de capacidad de cada familia.

El experimento de baja participación es retrospectivo. En un subconjunto de 252 participantes de Aarau que completó las encuestas previa y posterior, se definen como probablemente abstencionistas grupos con bajo compromiso, baja alfabetización digital o baja confianza, que además se solapan. Después se eliminan votos de personas que realmente sí participaron y se intenta recuperar el resultado de participación completa con sus perfiles y votos sintéticos. Con hasta 75 % del grupo de bajo compromiso sustituido por GPT-3.5, equal shares logra hasta 50 % más recuperación que una eliminación aleatoria; los métodos proporcionales promedian 7,53 puntos más, o 6,72 al controlar ganadores. Pero el propio suplemento muestra que equal shares retiene alrededor del 83-84 % de ganadores incluso con 80 % de abstención simulada. Parte importante de la resiliencia pertenece a la regla, no a la representación artificial.

Esto no estudia a abstencionistas reales. No se observa una decisión de abstenerse, la intención frustrada de votar ni el consentimiento para delegar. Los targets son correlatos elegidos entre participantes observados, y el objetivo de referencia se construye con los votos reales de esas mismas personas. Por tanto, la evidencia no demuestra que un LLM pueda conocer la preferencia de un no votante, recuperar una elección real o poseer mandato democrático. El contraste GPT-4o Mini–GPT-3.5 de 2,1 puntos tampoco es significativo, p=0,092.

La inferencia estadística necesita mucha cautela. El artículo combina mediante Fisher los p-valores de ejecuciones con diferentes hiperparámetros. Esas pruebas reutilizan los mismos votantes, alternativas y outcomes y no son independientes; no se informa cuántas se combinan, cuáles son los tests base, la cuadrícula completa, las exclusiones ni una corrección global para las numerosas comparaciones. La mayoría de afirmaciones ofrece umbrales de p combinados sin intervalos pareados de efecto. Es una señal descriptiva, no una réplica independiente entre modelos o elecciones.

También hay un exceso causal. Una red recurrente clasifica la consistencia discretizada a partir de rasgos personales y SHAP, LIME y ablación ordenan variables predictivas. Eso no identifica causas. No hay intervención, grafo causal, estrategia de identificación ni control suficiente de rasgos correlacionados. La asignación posterior de etiquetas psicológicas como sesgo afectivo, inconsciente, descuento temporal o surrogation tampoco usa instrumentos validados de esos constructos. El material visible no documenta un split reproducible por persona, controles de leakage, validación externa o incertidumbre completa para el RNN y su pipeline de fairness.

La reproducibilidad pública es parcial y corresponde a otra etapa. La colección Figshare oficial, creada en junio de 2024, contiene tres Excel ANES con 5.914, 5.272 y 6.031 filas: 17.217 en total. Incluyen perfiles, prompts, voto humano, GPT-3.5 a temperatura 0,2, salida de Llama 2 y una predicción ML. No coinciden con el subconjunto final de 17.010 ni contienen Llama 3, GPT-4o Mini, los otros modelos, Aarau, repeticiones, scripts, parsing, agregación, abstención, RNN, figuras o entornos. La aritmética interna añade otra alerta: 3.640 perfiles incompletos multiplicados por los tres modelos nombrados serían 10.920 representantes, pero el artículo informa 7.280, exactamente dos modelos. No se encontró repositorio de código asociado.

Los Excel públicos contienen en los prompts combinaciones de raza, género, edad, ideología, partido, religión, interés político, estado y voto inferido. No aparecen identificadores directos obvios, pero la combinación es sensible y exige documentar minimización, gobernanza y riesgo de enlace. Los autores sí plantean autonomía, privacidad, consentimiento y rendición de cuentas y no recomiendan reemplazar sin más a los ciudadanos.

La lectura fiel conserva una conclusión importante y más estrecha que el título. En estos datos retrospectivos, los LLM reproducen deficientemente votos individuales complejos, mientras que reglas proporcionales como equal shares y Phragmén pueden hacer más estable el resultado agregado ante papeletas sintéticas y pérdida simulada de participación. Eso convierte el diseño de agregación en una salvaguarda relevante para investigar. No demuestra representación fiel de abstencionistas, fairness demográfica del agente, resiliencia democrática causal, sesgos cognitivos causales ni reproducibilidad completa del experimento final.

English

The paper asks what happens when an LLM generates a person's ballot from demographic, political, and preference traits, and whether voting design can absorb the resulting errors. Its strongest result is not that AI represents individuals accurately: it performs very poorly on complex ballots. Mean individual human-AI consistency is 5.68% for the actual Aarau vote and 28.005% for its hypothetical survey, versus 84.5% in binary US elections. The useful contribution is different: after thousands of ballots are aggregated, some winner sets are much more stable than the individual predictions, and that stability depends strongly on the aggregation rule.

The study combines three observed settings. ANES supplies the 2012, 2016, and 2020 US presidential elections: the paper begins with 20,650 respondents, retains 17,010 complete profiles, and uses single-choice ballots with majority aggregation. City Idea, a 2023 participatory-budgeting campaign in Aarau, supplies a 3,314-person survey over five projects using single choice, approval, and score ballots, plus an actual 1,703-citizen vote over 33 projects using cumulative ballots; 505 voters have linked traits for emulation. The design adds correctly to 21, 207, and 135 emulated elections, 363 in total.

The study labels six LLMs, GPT-4o Mini, GPT-3.5, GPT-3, DeepSeek R1, Gemini 1.5 Flash, and Llama 3 8B, and one predictive neural network. Prompts are zero-shot, provide election context and personal traits, and request step-by-step reasoning. The supplement says temperatures from 0.4 to 0 were tested with 20 runs per setting and mean consistency across runs. It does not provide a manifest linking each result to a checkpoint, provider, endpoint, parameters, temperature, repetition, exact prompt, parser, or failure. The June-November 2023 and April-August 2025 collection windows are not mapped model by model. Generic model labels therefore do not identify reproducible systems.

The main metric counts relative matches in Condorcet pairwise comparisons between two ballots. Cross-format comparisons convert scores and cumulative votes to binary representations and exclude ties; collective outcomes become winner/loser vectors. This is a defensible ordinal-similarity measure, but it does not validate shared reasons, values, or a voter's mandate. Conversion discards intensity and ties and can change the denominator. In particular, the method of equal shares often funds more low-cost projects than utilitarian greedy, mechanically increasing overlap between winner sets. The authors recognize this: equal shares and Phragmén average 69.9% collective consistency, 31.6 percentage points above greedy, but the advantage falls to 22.8 points after equalizing winner counts.

Among the LLMs, GPT-4o Mini has the highest individual consistency and is reported 4.85 points above GPT-3.5 and 7.85 above Llama 3 8B. The neural-network baseline is 1.7 points above the LLM average individually and 2.9 collectively. Human cross-format consistency is 97.1%; model values fall to 74.3% for GPT-4o Mini, 72.1% for GPT-3.5, 76.2% for Llama 3 8B, 71.23% for Gemini, and 68.7% for DeepSeek. Equal shares raises collective cross-format consistency by 12.2 points over greedy. These are descriptions of this simulation, not stable capability rankings of model families.

The low-turnout experiment is retrospective. In a subset of 252 Aarau participants who completed both pre- and post-vote surveys, overlapping groups with low engagement, digital literacy, or trust are treated as likely abstainers. The analysis then removes ballots from people who actually participated and tries to recover the full-turnout result using their profiles and synthetic ballots. With up to 75% of the low-engagement group replaced by GPT-3.5, equal shares recovers up to 50% more consistency than random removal; proportional methods average a 7.53-point advantage, or 6.72 after controlling winner counts. Yet the supplement also shows that equal shares retains roughly 83-84% of winners with 80% simulated abstention. A substantial part of the resilience belongs to the rule itself, not AI representation.

This is not a study of actual abstainers. It does not observe an abstention decision, frustrated intent to vote, or consent to delegate. Targets are selected correlates among observed participants, and the reference outcome uses those same people's real ballots. The evidence therefore does not show that an LLM knows a nonvoter's preference, can recover a real election, or has democratic authorization. The 2.1-point GPT-4o Mini versus GPT-3.5 contrast is also nonsignificant, p=0.092.

Statistical inference requires substantial caution. The paper uses Fisher's method to combine p-values from runs with different hyperparameters. These tests reuse the same voters, alternatives, and outcomes and are dependent; the number and identity of component tests, base statistics, complete grid, exclusion rules, and global correction across many comparisons are not reported. Most claims provide combined p-value thresholds without paired effect intervals. This is descriptive evidence, not independent replication across models or elections.

Causal language is also excessive. A recurrent network predicts discretized consistency from personal traits, while SHAP, LIME, and ablation rank predictive feature contributions. This does not identify causes: there is no intervention, causal graph, identification strategy, or sufficient control of correlated traits. Post hoc mappings to affect, unconscious, time-discounting, or surrogation bias do not use validated instruments for those constructs. The visible materials do not document a reproducible person-level split, leakage controls, external validation, or complete uncertainty for the RNN and fairness pipeline.

Public reproducibility is partial and belongs to an earlier stage. The official Figshare collection, created in June 2024, contains three ANES workbooks with 5,914, 5,272, and 6,031 rows, 17,217 total. They include profiles, prompts, human choice, GPT-3.5 at temperature 0.2, Llama 2 output, and an ML prediction. They do not match the final 17,010 subset and omit Llama 3, GPT-4o Mini, the other models, Aarau, repetitions, scripts, parsing, aggregation, abstention, RNN, figures, and environments. Internal arithmetic raises another flag: 3,640 incomplete profiles times the three named models would be 10,920 representatives, but the paper reports 7,280, exactly two models. No associated public code repository was found.

The public workbooks embed prompt profiles combining race, gender, age, ideology, party, religion, political interest, state, and inferred vote. No obvious direct identifiers were found, but the combination is sensitive and needs explicit minimization, governance, and linkage-risk documentation. The authors do discuss autonomy, privacy, consent, and accountability and do not simply advocate replacing citizens.

A faithful reading preserves an important conclusion narrower than the title. In these retrospective data, LLMs reproduce complex individual ballots poorly, while proportional rules such as equal shares and Phragmén can make aggregate outcomes more stable under synthetic ballots and simulated turnout loss. Aggregation design is therefore a relevant safeguard to investigate. The study does not establish faithful representation of abstainers, demographic fairness of AI agents, causal democratic resilience, causal cognitive biases, or full reproducibility of the final experiment.

Pregunta de investigación

¿Con qué fidelidad seis LLM reproducen votos humanos en elecciones binarias y presupuestos participativos con papeletas complejas, qué rasgos predicen sus inconsistencias y hasta qué punto las reglas de agregación preservan o recuperan el resultado colectivo cuando se simula baja participación y representación mediante IA?

Método

Se emulan 363 elecciones a partir de ANES 2012/2016/2020 y de una encuesta y una votación real de presupuesto participativo en Aarau. Los prompts combinan rasgos personales, contexto, alternativas y formato; seis LLM y una red neuronal generan o predicen papeletas. La similitud individual y colectiva se calcula mediante coincidencias de comparaciones Condorcet, también entre formatos estandarizados. Se simula abstención eliminando votos de grupos proxy y sustituyendo una fracción por votos de IA; se comparan mayoría, utilitarian greedy, equal shares y Phragmén. RNN, SHAP, LIME, ablación y un pipeline de fairness exploran asociaciones de rasgos. La auditoría leyó y renderizó las 22 páginas y las 31 del suplemento, inspeccionó los tres Excel oficiales y buscó código público.

Muestra: ANES informa 20.650 personas, 17.010 perfiles completos y 3.640 parciales; City Idea aporta 3.314 encuestados en cinco proyectos y 1.703 votantes reales en 33 proyectos, de los que 505 tienen rasgos enlazados. La simulación de abstención se concentra en 252 personas con encuestas previa y posterior. El diseño declara 363 elecciones emuladas. Los conteos explícitos de representantes suman 81.224, pero el bloque de 3.640 perfiles parciales es aritméticamente inconsistente: tres modelos implicarían 10.920, no 7.280.

Hallazgos

  • La consistencia individual media es 5,68 % en City Idea real, 28,005 % en la encuesta y 84,5 % en las elecciones binarias de EE. UU.
  • GPT-4o Mini lidera los LLM y supera en 4,85 puntos a GPT-3.5 y 7,85 a Llama 3 8B; la red predictiva supera en promedio a los LLM en 1,7 puntos individuales y 2,9 colectivos.
  • La consistencia entre formatos es 97,1 % en humanos y 68,7-76,2 % en los LLM informados.
  • Equal shares y Phragmén promedian 69,9 % de consistencia colectiva, 31,6 puntos sobre greedy; al igualar ganadores la ventaja baja a 22,8.
  • Equal shares mejora 12,2 puntos la consistencia colectiva entre formatos frente a greedy.
  • Los métodos proporcionales recuperan 7,53 puntos más de consistencia bajo abstención simulada, o 6,72 al controlar ganadores.
  • GPT-4o Mini supera 2,1 puntos a GPT-3.5 en recuperación, pero el contraste no es significativo, p=0,092.
  • Equal shares conserva aproximadamente 83-84 % de ganadores con 80 % de abstención simulada, incluso antes de atribuir el efecto a representantes de IA.
  • La colección pública final enlazada es un artefacto ANES de 2024 con Llama 2, GPT-3.5 y ML, no el experimento completo publicado en 2026.

Limitaciones

  • Los labels de modelo no identifican checkpoints, proveedores, endpoints ni parámetros reproducibles.
  • Las dos ventanas de recogida no se asignan modelo por modelo.
  • No hay registro completo de prompts, outputs, parsing, retries, fallos, temperaturas y repeticiones.
  • La consistencia Condorcet es similitud operacional, no validez de representación o mandato.
  • La conversión entre formatos excluye empates y pierde intensidad de preferencia.
  • Equal shares suele producir más ganadores baratos y eleva mecánicamente la coincidencia; el control secundario solo reduce el confound.
  • Fairness nombra propiedades normativas de la regla, no métricas demográficas de los resultados de IA.
  • Los abstencionistas son proxies entre personas que sí participaron; no se observa abstención real ni intención frustrada.
  • Los tres grupos proxy se solapan y el análisis principal usa solo 252 encuestados enlazados.
  • El target de recuperación es retrospectivo y utiliza el voto real conocido de las mismas personas.
  • Los p-valores Fisher combinan runs e hiperparámetros dependientes sobre los mismos datos.
  • No se enumeran tests base, cuadrícula, número de p-valores, exclusiones ni corrección global por multiplicidad.
  • Faltan intervalos pareados y una cuantificación completa de incertidumbre por votante, elección y modelo.
  • SHAP, LIME y ablación sobre datos observacionales no identifican causas.
  • Las etiquetas de sesgo cognitivo son mapeos post hoc sin instrumentos psicológicos validados.
  • No se documenta un split reproducible, controles de leakage o validación externa del RNN y fairness pipeline.
  • La aritmética de 3.640 perfiles parciales y tres modelos no coincide con 7.280 representantes.
  • Los datos públicos suman 17.217 filas y no coinciden con los 17.010 casos completos del estudio final.
  • No se publican City Idea, cinco de los seis modelos finales, código, figuras reproducibles ni entornos.
  • Los prompts públicos combinan atributos políticos y demográficos sensibles con voto inferido sin documentación detallada de riesgo de enlace.

Qué no demuestra

  • No demuestra que los LLM representen fielmente a abstencionistas reales.
  • No demuestra consentimiento, autorización o mandato democrático para delegar un voto.
  • No demuestra que sustituir votantes con IA mejore prospectivamente una elección real.
  • No demuestra que equal shares haga demográficamente fair al representante de IA.
  • No demuestra que la resiliencia agregada provenga principalmente de la IA y no de la regla electoral.
  • No demuestra relaciones causales entre rasgos, sesgos cognitivos y decisiones del modelo.
  • No establece replicación independiente mediante p-valores combinados sobre runs dependientes.
  • No permite reproducir el experimento final de seis LLM y City Idea con el artefacto Figshare disponible.
  • No generaliza a no votantes, otros países, otras elecciones, otros checkpoints o despliegues futuros.

Trazabilidad

Alcance: Texto completo

Versión: EPJ Data Science 15:24 version of record, published 2026-02-09; 22-page article plus 31-page official supplement

Fuente consultada: https://link.springer.com/article/10.1140/epjds/s13688-025-00612-3

Revisión: Codex full-text, 22-page visual, 31-page supplement visual, publication-metadata, arithmetic, metric, aggregation, abstention-validity, causal, statistical, privacy, Figshare-workbook and public-code audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • GPT-4o Mini; snapshot, provider and exact endpoint not reported
  • GPT-3.5; snapshot, provider and exact endpoint not reported
  • GPT-3; snapshot, provider and exact endpoint not reported
  • DeepSeek R1; snapshot, provider and exact endpoint not reported
  • Gemini 1.5 Flash; snapshot and exact endpoint not reported
  • Llama 3 8B; checkpoint and serving stack not reported
  • Recurrent neural-network predictive baseline

Instrumentos y métricas

  • Personalized zero-shot, context-based and chain-of-thought voting prompts
  • Single-choice, approval, score and cumulative ballots
  • Condorcet pairwise-match consistency
  • Kemeny-distance robustness analysis
  • Majority, utilitarian greedy, method of equal shares and sequential Phragmén aggregation
  • Low-engagement, low-digital-literacy and low-trust abstention proxies
  • Fisher combination of p-values across runs and hyperparameters
  • RNN consistency classifier with SHAP, LIME and feature ablation
  • Decision-tree and SMOTE fairness pipeline

Datos utilizados

  • American National Election Studies 2012, 2016 and 2020
  • City Idea Aarau 2023 pre-voting survey
  • City Idea Aarau 2023 actual participatory-budgeting vote
  • Linked City Idea pre- and post-voting survey subset
  • Official Figshare ANES-only 2024 artifact, 17,217 rows, older than final study

Evidencia y localización

  • Diseño, métodos, resultados, aritmética, limitaciones, ética y disponibilidad: EPJ Data Science 15:24, DOI 10.1140/epjds/s13688-025-00612-3, pp. 1-22
  • Prompts, repeticiones, temperaturas, robustez, abstención, RNN, fairness, SHAP y LIME: Official Supplementary Information 13688_2025_612_MOESM1_ESM, pp. 1-31
  • Metadatos oficiales, año de publicación, DOI, licencia y fechas editoriales: https://link.springer.com/article/10.1140/epjds/s13688-025-00612-3
  • Contenido y divergencia del artefacto ANES público de 2024: https://figshare.com/collections/Generative_AI_Voting_-_ANES/7261288
  • Auditoría integral de agregación, abstención, causalidad, estadística, privacidad y reproducibilidad: reports/verification/article-232-ai-voting-aggregation-abstention-causal-statistical-and-artifact-audit.json