Este artículo pregunta si los LLM permiten experimentar a gran escala con mecanismos clásicos de persuasión política y, en particular, si personalizar un mensaje o convertirlo en conversación aumenta su efecto frente a un texto genérico. La contribución empírica es real pero más estrecha que la lectura teórica sugerida por el título. Dos encuestas preregistradas muestran que varios paquetes persuasivos generados con GPT-4 causan pequeños cambios inmediatos en respuestas políticas frente a controles sobre juegos de mesa. Los modelos principales se reproducen exactamente desde los datos públicos. Sin embargo, el diseño no manipula personalización e interacción de manera ortogonal, no mide elaboración cognitiva, omite una variable dependiente preregistrada y numerosos análisis de robustez, no permite regenerar exactamente los tratamientos y publica datos personales incompatibles con la promesa de anonimato hecha a los participantes.
Los autores realizaron en mayo de 2024 dos experimentos en CloudResearch Connect, pagados con 3 dólares y aprobados por el IRB de Brigham Young University. El Estudio 1 trata la inmigración legal en Estados Unidos y analiza 1.862 respuestas para cambio de actitud. El Estudio 2 trata la regulación de opiniones sociales y políticas en aulas K-12 y analiza 1.819. Cada persona contesta primero tres ítems políticos de siete puntos. La segunda pregunta determina la dirección contraria a su postura que promoverá el tratamiento. Se calcula el cambio en el promedio de los tres ítems y se orienta el signo hacia la dirección asignada. En inmigración hubo un error de programación: todos los neutrales recibieron mensajes favorables a aumentar la inmigración. En K-12 se corrigió y los neutrales se asignaron aleatoriamente a una de las dos direcciones.
Hay seis condiciones. Dos controles hablan de juegos de mesa: un texto fijo y una conversación de seis turnos. El texto persuasivo genérico es una generación nueva para cada persona, pero no recibe su perfil. El microdirigido sí recibe edad, género, raza o etnia, estado civil, religión, educación, ocupación, ciudad, estado, partido, ideología y posición previa, aunque se le ordena no mencionar esos atributos explícitamente. La persuasión directa mantiene seis turnos y también recibe el perfil y las respuestas del participante. La entrevista motivacional hace lo mismo, pero pide que la persona encuentre discrepancias sin introducir argumentos nuevos. En la práctica el prompt adopta el papel de una campaña, ordena cambiar la opinión y pide presionar más si la persona no encuentra ventajas de la posición contraria.
El resultado es inmediato y autoinformado. Además del cambio de actitud se pregunta la probabilidad hipotética de votar por un candidato con la postura promovida, cuánto persuadió el mensaje y cuatro ítems de reciprocidad democrática. No hay seguimiento, conducta electoral real ni observación natural. El primer ítem del índice de inmigración carga solo 0,50 antes y 0,48 después, pero los tres se promedian con igual peso. Los controles se agrupan porque seis pruebas t no rechazan diferencias en las tres variables publicadas; eso sigue el preregistro, aunque una no significación no demuestra equivalencia entre una lectura fija y una conversación.
La auditoría reproduce los OLS principales. En inmigración, frente al control agrupado, el cambio orientado al tratamiento es 0,0595 para persuasión directa, 0,0561 para texto genérico y 0,0461 para microdirección, todos significativos; entrevista motivacional da 0,0046, p=0,749. En intención de voto, directa, genérica y microdirigida dan 0,0645, 0,0745 y 0,0424; la última queda en p=0,0487 y la entrevista es nula. Ninguna estrategia cambia convencionalmente la reciprocidad democrática. Son desplazamientos de pocos puntos porcentuales de la escala, no grandes conversiones políticas.
En K-12 los cuatro paquetes cambian la actitud: 0,0788 para interacción directa, 0,0575 para entrevista motivacional, 0,0537 para texto genérico y 0,1006 para microdirección. Los cuatro elevan la intención hipotética de voto, con coeficientes entre 0,0428 y 0,0859. En reciprocidad democrática solo las dos condiciones interactivas cambian: 0,0418 para directa y 0,0418 para entrevista; el genérico es nulo y el microdirigido queda en p=0,064. Los datos sostienen que mensajes contrarios a la postura inicial pueden mover respuestas inmediatas y que el efecto sobre tolerancia al adversario es débil e inconsistente.
La conclusión de que personalización e interacción no aportan mucho más que el genérico requiere cautela. Las condiciones no forman un factorial 2×2. El genérico carece de perfil e interacción; el microdirigido añade perfil; la directa añade simultáneamente perfil, conversación, más texto, más tiempo y respuestas adaptativas; la entrevista conserva perfil e interacción pero cambia estrategia y contenido. La directa ya está personalizada. Compararla con el genérico cambia varias propiedades a la vez. Compararla con la microdirigida aproxima el efecto de interacción, pero también cambia turnos, longitud y dinámica. No hay manipulation check de personalización percibida, elaboración, atención, motivación o capacidad. La conversación se usa como proxy de elaboración sin demostrar el mecanismo. Resultados similares pueden significar efecto adicional pequeño, manipulación débil o confusa, o diferencias dentro de la incertidumbre; no refutan de forma general las teorías.
La selección del prompt añade otra limitación. El equipo probó aproximadamente 110 plantillas y después unas 30 variantes. Escogió la que maximizaba variación y mutual information entre perfiles y textos embebidos, suponiendo que mensajes más diferentes serían más microdirigidos y persuasivos. El suplemento reconoce que este proxy no está validado contra persuasión real. No se publican plantillas candidatas, perfiles GSS, puntuaciones ni código de selección. El estudio prueba una implementación elegida por diversidad textual, no el potencial máximo ni una definición validada de personalización eficaz.
Los preregistros confirman los modelos centrales, pero el informe es incompleto. Se registraron cuatro variables dependientes y el artículo presenta tres. La persuasividad autoinformada se recogió, pero los controles no recibieron la pregunta, por lo que el contraste tratamiento-control registrado no puede ejecutarse tal como estaba escrito. Sí pueden compararse las cuatro estrategias. En inmigración, genérico, microdirigido y directo promedian 0,396, 0,404 y 0,402; la entrevista baja a 0,306 y difiere del genérico, p=0,00034. En K-12, genérico promedia 0,330, directo 0,424 y microdirigido 0,391; directa y microdirigida superan al genérico, p=0,00018 y p=0,015. No revierten los cambios de actitud, pero muestran diferencias percibidas cuya omisión no se explica.
Tampoco aparecen la corrección Holm, restricciones por attention check, reCAPTCHA, 2,5 percentil de tiempo o cumplimiento conversacional, controles demográficos, confianza, moderaciones por interés político o preocupación por IA, ni el cambio absoluto previsto para la entrevista del Estudio 2. El suplemento sí declara cambios entre preregistros tras conocer el Estudio 1 y reconoce el error de neutrales, una fortaleza. Aun así, debería distinguir análisis confirmatorios, desviaciones y exploraciones y explicar cada resultado registrado no publicado.
La reproducibilidad es mixta. OSF ofrece preregistros, prompts, exportaciones, mensajes y conversaciones, limpieza R y scripts. La auditoría reproduce coeficientes, errores, p y tamaños. No obstante, solo se informa «GPT-4», sin snapshot, temperatura, seed o reintentos, y falta el código de generación. No hay lockfile R, requirements Python, contenedor ni licencia OSF. El análisis de palabras clave llama a GPT-4o con temperatura 1 y advierte que no reproducirá las etiquetas; fija manualmente 50 clústeres y pasa resultados por Google Sheets. El notebook de Figura 1 exige CUDA, silencia excepciones e invierte listas plus/minus para la condición motivacional. Parte del acabado se hizo en Illustrator. La replicación es fuerte para OLS y débil para generación, selección de prompt y NLP.
La incidencia más grave está en los datos públicos. El consentimiento promete encuesta anónima, imposibilidad de vincular respuestas y publicación de datos anónimos. Sin embargo, el CSV de inmigración conserva 1.932 IP, 1.781 pares de coordenadas, 1.932 ResponseId y 1.928 participantId; K-12 conserva 1.875 IP, 1.810 coordenadas, 1.875 ResponseId y 1.853 participantId. Las mismas filas incluyen timestamps, ciudad, estado, edad, género, raza o etnia, religión, estado civil, ingresos, educación, partido, ideología, ocupación libre y conversación completa. Esta auditoría no reproduce valores personales. La combinación no es anónima y crea riesgo material de reidentificación. Los archivos deberían retirarse o restringirse de inmediato, notificarse a la función institucional o IRB responsable y sustituirse por datos realmente desidentificados.
La contribución defendible es que una implementación GPT-4 de 2024 permitió comparar mensajes políticos a escala y causó pequeños desplazamientos inmediatos frente a controles no políticos. No establece que la microdirección sea inútil, que conversar no produzca elaboración, que teorías generales deban reemplazarse, ni que los efectos duren, cambien votos reales o generalicen a otros temas, países, modelos o contextos. Una ficha de referencia debe mostrar los efectos reproducidos, el diseño no factorial, la variable omitida, los límites de generación y, con máxima visibilidad, la exposición crítica de datos personales.