El preprint estudia si el discurso político de r/politics cambió alrededor del lanzamiento público de ChatGPT el 30 de noviembre de 2022. Distingue polarización ideológica, alejamiento de un punto neutral en el lenguaje, de polarización afectiva, hostilidad y toxicidad, y propone un resultado doble: después del lanzamiento, el lenguaje de autores inicialmente liberales y conservadores se alejó modestamente del centro, mientras bajaron sobre todo las puntuaciones de hostilidad. El interés del trabajo está en esa separación entre contenido ideológico y tono; su principal límite es que observa una fecha y proxies lingüísticos, no el uso real de ChatGPT por cada autor o comentario.
El conjunto declarado reúne 6.882.091 posts y comentarios de 334.002 autores. Incluye tres meses antes y después del lanzamiento y compara ese intervalo con los mismos meses un año antes mediante diferencias en diferencias. Para evitar que la entrada de usuarios nuevos determine el resultado, retiene personas que habían comentado al menos una vez entre junio y diciembre de 2021. Las regresiones principales usan observaciones de comentario, efectos fijos de autor y errores agrupados por autor; también se presentan agregados autor-día y se citan análisis autor-mes. El PDF muestra un event study de seis semanas a cada lado y afirma pruebas placebo desplazando la fecha, pero los resultados completos están en un suplemento no disponible.
La orientación política se estima con un diccionario bag-of-words construido a partir del Congressional Record de 2021. Cada comentario recibe un score entre -1 y 1: negativo se interpreta como liberal, positivo como conservador y cero como neutral. Un 59,4% de autores queda neutral, 15,7% liberal y 24,9% conservador; por comentarios, las proporciones son 17,9%, 31,6% y 50,5%. El diccionario, sus coeficientes y su validación para lenguaje de Reddit no aparecen en el artefacto público. Por ello, el score mide uso de vocabulario asociado a congresistas y temas, no directamente creencias, identidad partidista o conducta política.
En el análisis por comentario, la interacción posterior al 30 de noviembre por periodo tratado es -0,0030 para autores liberales, -0,0003 para neutrales y +0,0026 para conservadores. En autor-día es -0,0038, -0,0004 y +0,0033. Los autores interpretan los signos opuestos como mayor polarización y afirman que el cambio desplaza un comentario mediano hacia el 30% más extremo, equivalencia remitida a una figura suplementaria que no puede comprobarse. Los grupos más cercanos al centro muestran desplazamientos pequeños o no significativos. Estos resultados documentan una asociación temporal bajo la métrica del artículo; no aíslan por sí solos la causa ChatGPT frente a noticias, composición, moderación, cambios de plataforma u otros shocks coincidentes.
Para estudiar quién impulsa el cambio, el artículo llama activos al 10% superior por número de comentarios en el periodo de selección, 20 o más, e inactivos a todos los demás. Tras el lanzamiento, el grupo denominado inactivo escribe aproximadamente 2,9-3,1 palabras más por comentario, reduce más su perplejidad logarítmica y baja cerca de 0,01 su Human Score. Su cambio de slant también es mayor: -0,0082 entre liberales y +0,0072 entre conservadores, frente a -0,0022 y +0,0019 en activos. Son diferencias lingüísticas consistentes con asistencia generativa, pero longitud, perplejidad y un clasificador no observan qué herramienta se usó. Además, llamar inactivo a cerca del 90% de la distribución agrupa conductas muy heterogéneas.
El mecanismo de “sycophancy” depende de clasificar comentarios individuales como humanos o ChatGPT. El paper denomina al Human Score detector de ChatGPT de OpenAI y considera ChatGPT todo score humano inferior al 30%. Sin embargo, su referencia 22 es Solaiman et al. (2019): el detector RoBERTa de salidas GPT-2, entrenado para distinguir WebText de texto producido por GPT-2 1.5B antes de que existiera ChatGPT. La ficha del modelo advierte que no debe tratarse como detector fiable de ChatGPT. El preprint no identifica el checkpoint exacto ni publica validación en Reddit, matriz de confusión, calibración o sensibilidad al error de clasificación. Figura 4 muestra que las respuestas etiquetadas como ChatGPT se alinean más con el slant del contenido padre; eso es compatible con eco o adaptación, pero no demuestra que ChatGPT generara esas respuestas ni que la sycophancy sea el mecanismo causal.
En la dimensión afectiva, la hostilidad baja en los cuatro grupos: -0,0042 y -0,0016 para liberales activos e inactivos y -0,0049 y -0,0014 para conservadores. Las cuatro estimaciones de toxicidad son negativas, entre -0,0017 y -0,0025, pero solo las de activos liberales y conservadores llevan marca de significancia; las dos de inactivos no. La Tabla 6B además está mal rotulada: repite “liberal-active” y el número de columna (5) cuatro veces. El texto remite las emociones a una tabla suplementaria ausente. Hostilidad y toxicidad son indicadores de civismo textual, no una medida directa de animadversión hacia el partido contrario, que es el constructo habitual de polarización afectiva.
El diseño de diferencias en diferencias mejora una simple comparación antes-después al usar el mismo calendario del año previo, pero la ecuación publicada incluye efectos fijos de autor y no efectos fijos de fecha. Como toda la exposición cambia en el mismo momento, persisten shocks temporales comunes y dependencia serial; agrupar solo por autor puede no capturar esa incertidumbre. Los placebos citados descartan algunas fechas alternativas, no todos los eventos concurrentes. Tampoco hay preregistro. El preprint es una v1 sin estado de revisión por pares en el registro oficial.
La reproducibilidad es baja en el estado público auditado. El PDF remite reiteradamente a un SI Appendix para el diccionario, métodos, robustez, figuras y Tablas S1-S7, pero arXiv solo entrega el PDF principal de 19 páginas: incluso el endpoint de fuentes devuelve ese mismo PDF. No se localizan código, datos, diccionario, checkpoint, score de perplejidad, salidas derivadas o scripts. Por tanto, esta ficha conserva los coeficientes reportados pero no los presenta como reproducidos.
La conclusión fiel es más estrecha que el abstract: en una comparación observacional de los primeros meses de r/politics, el lenguaje medido de grupos liberales y conservadores se alejó ligeramente del cero después del lanzamiento, mientras disminuyeron medidas de hostilidad y parte de las de toxicidad. El patrón abre una pregunta valiosa sobre si los asistentes generativos pueden separar extremidad temática y tono civil. No demuestra uso individual de ChatGPT, causalidad, sycophancy como mecanismo, cambios en creencias o voto, reducción general de polarización afectiva ni que la IA mejore el discurso democrático. Es evidencia sugerente que requiere detector validado, suplemento completo, datos/código y una estrategia causal más fuerte.