El artículo pregunta qué ocurre cuando un LLM genera el voto de una persona a partir de rasgos demográficos, políticos y de preferencias, y si el diseño de la votación puede amortiguar sus errores. Su resultado más sólido no es que la IA represente bien a cada votante: en los formatos complejos lo hace muy mal. La consistencia individual media entre voto humano y sintético es 5,68 % en la votación real de Aarau y 28,005 % en su encuesta hipotética, frente a 84,5 % en las elecciones estadounidenses binarias. La aportación útil es otra: al agregar miles de votos, algunos conjuntos de ganadores son bastante más estables que las predicciones individuales, y esa estabilidad depende mucho de la regla de agregación.
El estudio combina tres escenarios observados. ANES aporta las elecciones presidenciales de Estados Unidos de 2012, 2016 y 2020: el texto parte de 20.650 encuestados, conserva 17.010 perfiles completos y usa voto único con mayoría. City Idea, una campaña de presupuesto participativo realizada en Aarau en 2023, aporta una encuesta de 3.314 personas sobre cinco proyectos con voto único, aprobación y puntuación, y una votación real de 1.703 ciudadanos sobre 33 proyectos con papeleta acumulativa; 505 votantes tienen rasgos enlazados para la emulación. El diseño suma correctamente 21, 207 y 135 elecciones emuladas, 363 en total.
Se etiquetan seis LLM, GPT-4o Mini, GPT-3.5, GPT-3, DeepSeek R1, Gemini 1.5 Flash y Llama 3 8B, y una red neuronal predictiva. Los prompts son zero-shot, incluyen el contexto electoral y rasgos personales, y piden razonamiento paso a paso. El suplemento dice que se probaron temperaturas de 0,4 a 0 y 20 ejecuciones por ajuste, promediando la consistencia. Sin embargo, no publica un manifiesto que asocie cada resultado con checkpoint, proveedor, endpoint, parámetros, temperatura, repetición, prompt exacto, parser o fallo. Las dos ventanas de recogida, junio-noviembre de 2023 y abril-agosto de 2025, tampoco se vinculan modelo por modelo. Por ello, los nombres genéricos no permiten reconstruir qué sistemas respondieron.
La métrica principal cuenta coincidencias relativas en comparaciones de Condorcet entre dos papeletas. Para comparar formatos, convierte puntuaciones y votos acumulativos a representaciones binarias y excluye empates; para resultados colectivos, convierte proyectos en ganadores o perdedores. Es una medida razonable de similitud ordinal, pero no valida que el agente comparta las razones, valores o mandato de la persona. La conversión descarta intensidad y empates y puede alterar el denominador. En especial, el método de equal shares suele financiar más proyectos baratos que utilitarian greedy, lo que eleva mecánicamente la coincidencia de conjuntos de ganadores. Los autores reconocen el problema: equal shares y Phragmén promedian 69,9 % de consistencia colectiva, 31,6 puntos más que greedy, pero la ventaja baja a 22,8 puntos al igualar el número de ganadores.
Entre los LLM, GPT-4o Mini obtiene la mayor consistencia individual y supera en 4,85 puntos a GPT-3.5 y en 7,85 a Llama 3 8B. La red neuronal queda 1,7 puntos por encima del promedio de LLM a nivel individual y 2,9 a nivel colectivo. La consistencia entre formatos humanos es 97,1 %; en los modelos baja a 74,3 % para GPT-4o Mini, 72,1 % para GPT-3.5, 76,2 % para Llama 3 8B, 71,23 % para Gemini y 68,7 % para DeepSeek. Equal shares aumenta 12,2 puntos la consistencia colectiva entre formatos frente a greedy. Estos contrastes describen esta simulación; no son pruebas generales de capacidad de cada familia.
El experimento de baja participación es retrospectivo. En un subconjunto de 252 participantes de Aarau que completó las encuestas previa y posterior, se definen como probablemente abstencionistas grupos con bajo compromiso, baja alfabetización digital o baja confianza, que además se solapan. Después se eliminan votos de personas que realmente sí participaron y se intenta recuperar el resultado de participación completa con sus perfiles y votos sintéticos. Con hasta 75 % del grupo de bajo compromiso sustituido por GPT-3.5, equal shares logra hasta 50 % más recuperación que una eliminación aleatoria; los métodos proporcionales promedian 7,53 puntos más, o 6,72 al controlar ganadores. Pero el propio suplemento muestra que equal shares retiene alrededor del 83-84 % de ganadores incluso con 80 % de abstención simulada. Parte importante de la resiliencia pertenece a la regla, no a la representación artificial.
Esto no estudia a abstencionistas reales. No se observa una decisión de abstenerse, la intención frustrada de votar ni el consentimiento para delegar. Los targets son correlatos elegidos entre participantes observados, y el objetivo de referencia se construye con los votos reales de esas mismas personas. Por tanto, la evidencia no demuestra que un LLM pueda conocer la preferencia de un no votante, recuperar una elección real o poseer mandato democrático. El contraste GPT-4o Mini–GPT-3.5 de 2,1 puntos tampoco es significativo, p=0,092.
La inferencia estadística necesita mucha cautela. El artículo combina mediante Fisher los p-valores de ejecuciones con diferentes hiperparámetros. Esas pruebas reutilizan los mismos votantes, alternativas y outcomes y no son independientes; no se informa cuántas se combinan, cuáles son los tests base, la cuadrícula completa, las exclusiones ni una corrección global para las numerosas comparaciones. La mayoría de afirmaciones ofrece umbrales de p combinados sin intervalos pareados de efecto. Es una señal descriptiva, no una réplica independiente entre modelos o elecciones.
También hay un exceso causal. Una red recurrente clasifica la consistencia discretizada a partir de rasgos personales y SHAP, LIME y ablación ordenan variables predictivas. Eso no identifica causas. No hay intervención, grafo causal, estrategia de identificación ni control suficiente de rasgos correlacionados. La asignación posterior de etiquetas psicológicas como sesgo afectivo, inconsciente, descuento temporal o surrogation tampoco usa instrumentos validados de esos constructos. El material visible no documenta un split reproducible por persona, controles de leakage, validación externa o incertidumbre completa para el RNN y su pipeline de fairness.
La reproducibilidad pública es parcial y corresponde a otra etapa. La colección Figshare oficial, creada en junio de 2024, contiene tres Excel ANES con 5.914, 5.272 y 6.031 filas: 17.217 en total. Incluyen perfiles, prompts, voto humano, GPT-3.5 a temperatura 0,2, salida de Llama 2 y una predicción ML. No coinciden con el subconjunto final de 17.010 ni contienen Llama 3, GPT-4o Mini, los otros modelos, Aarau, repeticiones, scripts, parsing, agregación, abstención, RNN, figuras o entornos. La aritmética interna añade otra alerta: 3.640 perfiles incompletos multiplicados por los tres modelos nombrados serían 10.920 representantes, pero el artículo informa 7.280, exactamente dos modelos. No se encontró repositorio de código asociado.
Los Excel públicos contienen en los prompts combinaciones de raza, género, edad, ideología, partido, religión, interés político, estado y voto inferido. No aparecen identificadores directos obvios, pero la combinación es sensible y exige documentar minimización, gobernanza y riesgo de enlace. Los autores sí plantean autonomía, privacidad, consentimiento y rendición de cuentas y no recomiendan reemplazar sin más a los ciudadanos.
La lectura fiel conserva una conclusión importante y más estrecha que el título. En estos datos retrospectivos, los LLM reproducen deficientemente votos individuales complejos, mientras que reglas proporcionales como equal shares y Phragmén pueden hacer más estable el resultado agregado ante papeletas sintéticas y pérdida simulada de participación. Eso convierte el diseño de agregación en una salvaguarda relevante para investigar. No demuestra representación fiel de abstencionistas, fairness demográfica del agente, resiliencia democrática causal, sesgos cognitivos causales ni reproducibilidad completa del experimento final.