“I understand your perspective”: LLM Persuasion through the Lens of Communicative Action Theory

Aplicaciones, sesgos y seguridad2025ACL AnthologyRevisión editorial aprobada

Autores: Esra Dönmez, Agnieszka Faleńska

Palabras clave: Computation and Language, Artificial Intelligence, Computers and Society

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
7
Hallazgos
11
Limitaciones
5
Evidencias

Resumen editorial

Español

El trabajo estudia cómo tres LLM seleccionados, Llama-2-chat 7B, Mistral-7B-Instruct y GPT-3.5-turbo, redactan contraargumentos para 13.504 publicaciones sociopolíticas del corpus pre-2016 de r/ChangeMyView. A cada modelo se le muestra solo la publicación y la instrucción «You have one chance to change my view»; se genera una respuesta con temperatura 0,9, top_p 0,6 y límite de 600 tokens. El análisis no observa intenciones directamente: reutiliza nueve clasificadores LSTM que asignan a cada texto dimensiones sociales como conocimiento, confianza, apoyo, similitud o conflicto, toma la puntuación máxima entre sus frases, binariza al percentil 85 y aplica un descuento por longitud. Con esta operacionalización, las respuestas de los tres modelos contienen lenguaje clasificado como confianza casi siempre, con odds ratios de 375,31 a 611,28 frente a comentarios humanos que recibieron delta; también concentran más dimensiones por mensaje, pero menos conocimiento y similitud, precisamente las dos dimensiones más asociadas con delta en los datos humanos. El resultado de confianza parece estar impulsado por fórmulas recurrentes como «I understand your perspective» y no demuestra confianza sentida ni intención habermasiana. Para estudiar dinámica conversacional, el artículo compara dimensiones del post y del comentario. Algunos patrones humanos de reciprocidad se asocian con delta, y los modelos reproducen parte de ellos; GPT-3.5 muestra reciprocidad más fuerte en varias dimensiones. Esa comparación es observacional y condicional: no se muestra que las respuestas generadas cambien ninguna opinión. En un estudio exploratorio adicional, 40 trabajadores estadounidenses de Prolific evalúan 100 ternas formadas por un post, un comentario humano con delta y una respuesta de GPT-3.5. Por voto mayoritario, eligen la respuesta de GPT como más probable para cambiar la opinión del autor en 83 de 100 casos, con alfa de Krippendorff 0,79, y declaran estar de acuerdo con 92 respuestas de GPT frente a 66 humanas. Los evaluadores, sin embargo, no son los autores originales y juzgan persuasividad hipotética de un tercero; no hay medida pre/post ni cambio real de opinión. Además, el enlace presentado como «código y datos» contiene solo un .gitignore genérico y una licencia CC0, por lo que el filtrado, las generaciones, las etiquetas, las estadísticas y la encuesta no pueden reproducirse con el artefacto público auditado.

English

The paper studies how three selected LLMs, Llama-2-chat 7B, Mistral-7B-Instruct and GPT-3.5-turbo, write counter-arguments for 13,504 sociopolitical posts from the pre-2016 r/ChangeMyView corpus. Each model receives only the post plus the instruction 'You have one chance to change my view'; one response is sampled at temperature 0.9, top_p 0.6 and a 600-token cap. The analysis does not observe intentions directly. It reuses nine LSTM classifiers that assign social dimensions such as knowledge, trust, support, similarity and conflict, represents a message by its maximum sentence score, binarizes at the 85th percentile and applies a length discount. Under this operationalization, all three generated corpora almost always contain language classified as trust, with odds ratios from 375.31 to 611.28 relative to human delta comments. Generated messages also contain more dimensions per message but less knowledge and similarity, the two dimensions most associated with delta in the human data. The trust result appears to be driven by recurring formulas such as 'I understand your perspective' and does not demonstrate felt trust or Habermasian intention. To examine interaction dynamics, the paper compares dimensions in a post and its comment. Some human reciprocity patterns are associated with receiving a delta, and the models reproduce part of those patterns; GPT-3.5 shows stronger reciprocity on several dimensions. This comparison is observational and conditional: it does not show that any generated response changed an opinion. In an additional exploratory study, 40 US Prolific workers evaluate 100 triples containing a post, one human delta comment and one GPT-3.5 response. By majority vote, workers select the GPT response as more likely to change the original poster's view in 83 of 100 cases, with Krippendorff's alpha of 0.79, and report agreement with 92 GPT comments versus 66 human comments. The raters are not the original posters, however, and judge hypothetical third-party persuasiveness; there is no pre/post measure or observed opinion change. Finally, the link presented as 'our code & data' contains only a generic .gitignore and a CC0 license, so the filtering, generations, classifier labels, statistics and survey cannot be reproduced from the audited public artifact.

Pregunta de investigación

¿Qué dimensiones sociales detectan clasificadores automáticos en contraargumentos de LLM, cómo difieren de comentarios humanos con y sin delta, en qué medida reproducen dinámicas post-comentario asociadas al cambio de opinión y cuál de una respuesta humana con delta o una respuesta de GPT-3.5 juzgan terceros como más persuasiva?

Método

Análisis observacional del corpus ChangeMyView de Tan et al. y generación de un contraargumento por post con tres modelos seleccionados tras una criba automática de siete modelos sobre 50 posts. Nueve clasificadores LSTM heredados puntúan dimensiones sociales por frase; se usa el máximo por mensaje, umbral del percentil 85, descuento por longitud, odds ratios e intervalos nominales del 95%. Un estudio exploratorio compara 100 pares humano-GPT mediante tres juicios por caso en Prolific.

Muestra: El corpus pasa de 20.626 posts y 1.260.266 comentarios a 20.151 y 1.193.483 tras limpieza, y a 13.504 posts y 864.890 comentarios tras el filtro sociopolítico. Se marcan 7.254 comentarios como positivos porque son comentarios padre escritos por una persona que recibe delta en el hilo. La selección de modelos usa 50 posts. La encuesta usa 100 ternas, tres anotaciones por terna y 40 residentes de EE. UU. angloparlantes, 20 mujeres y 20 hombres.

Hallazgos

  • En los datos humanos, conocimiento (OR 1,84) y similitud (1,58) se asocian positivamente con delta; ausencia de dimensiones y las otras siete dimensiones se asocian negativamente bajo el etiquetado automático.
  • Los tres modelos muestran confianza detectada casi universal: OR 375,31 para Llama-2, 434,93 para Mistral y 611,28 para GPT-3.5 frente a comentarios humanos con delta.
  • Las respuestas generadas contienen más apoyo, estatus, poder, conflicto, identidad y diversión, pero menos similitud (aprox. OR 0,60-0,62) y conocimiento (0,53) que los comentarios con delta.
  • Los comentarios humanos que reciprocan conocimiento, poder o similitud presentan asociaciones positivas con delta; los modelos reproducen parte de las diagonales y GPT-3.5 presenta reciprocidad superior en varias combinaciones.
  • En la encuesta, el comentario GPT-3.5 es elegido como más probable para cambiar la opinión en 83 de 100 casos por voto mayoritario; alfa global 0,79.
  • Los trabajadores expresan acuerdo mayoritario con 92 comentarios GPT y 66 comentarios humanos, pero preferencia y acuerdo no equivalen a persuasión observada.
  • El repositorio público citado como código y datos no contiene ningún artefacto ejecutable o analítico en el commit auditado.

Limitaciones

  • Las dimensiones sociales son proxies automáticos heredados; no hay validación humana de intención ilocutiva en las generaciones del estudio.
  • El máximo por frase, el umbral del percentil 85, la longitud y las fórmulas de alineamiento pueden inflar especialmente la etiqueta confianza.
  • Se etiquetan como persuasivos todos los comentarios padre del autor que recibe delta, aunque el cambio puede deberse solo a otro mensaje posterior.
  • Los LLM reciben el post aislado, mientras los comentarios humanos pertenecen a hilos con contexto y posiciones conversacionales distintas.
  • La criba de siete modelos se basa en solo 50 posts y selecciona resultados mediante clasificadores automáticos; limita la generalización.
  • No se especifican checkpoints, revisiones, plantillas, semillas, versiones de runtime ni snapshot de GPT-3.5.
  • Los análisis no modelan explícitamente la dependencia por autor, post o hilo ni documentan corrección por las numerosas comparaciones de pares de dimensiones.
  • La encuesta es exploratoria, de 100 casos, solo con GPT-3.5 y trabajadores estadounidenses que juzgan a un tercero.
  • No se controlan experimentalmente longitud, estilo, fluidez, tema o acuerdo previo entre los comentarios comparados.
  • No se manipula el entrenamiento de alineamiento ni se mide sycophancy como mecanismo.
  • El repositorio prometido no permite reproducir el estudio.

Qué no demuestra

  • No demuestra que los LLM posean confianza, comprensión, intención comunicativa o agencia habermasiana.
  • No valida que los clasificadores midan directamente intención ilocutiva en texto de LLM.
  • No prueba que el lenguaje de confianza cause persuasión.
  • No significa que GPT-3.5 cambiara el 83% de las opiniones ni que persuadiera a los autores originales.
  • No demuestra superioridad persuasiva general de LLM frente a humanos.
  • No establece causalmente que preference training o alignment training produzcan estos patrones.
  • No demuestra que reciprocar dimensiones sociales cause cambio de opinión.
  • No generaliza a los siete modelos candidatos, a modelos actuales, a otras lenguas, plataformas o diálogos reales.
  • No atribuye resultados a checkpoints reproducibles.
  • No aporta el código y los datos que declara disponibles.
  • No establece sycophancy de forma independiente en el experimento publicado.

Trazabilidad

Alcance: Texto completo

Versión: Findings of ACL 2025 version of record, pages 15312-15327; later related preprint arXiv:2606.08076v1 identified but not substituted for the published record

Fuente consultada: https://aclanthology.org/2025.findings-acl.793/

Revisión: Codex 16-page visual, official-ACL, later-arXiv-metadata, CMV-delta-label, model-selection, social-dimension-construct, statistics, crowd-preference, claim-boundary and empty-artifact audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Llama-2-chat 7B
  • Mistral-7B-Instruct
  • GPT-3.5-turbo
  • Candidate screen only: Llama-2-chat 70B
  • Candidate screen only: Llama-3-chat 8B
  • Candidate screen only: Llama-3-chat 70B
  • Candidate screen only: GPT-4

Instrumentos y métricas

  • Nine Choi et al. 2020 LSTM social-dimension classifiers
  • Falk and Lapesa 2023 argument-quality adapters for model selection
  • Sociopolitical-post logistic-regression classifier inherited from Monti et al. 2022
  • DeltaBot-derived proxy for opinion-changing comments
  • Prolific agreement and forced-choice preference survey
  • Krippendorff's alpha
  • Odds ratios with nominal 95% confidence intervals

Datos utilizados

  • Tan et al. 2016 ChangeMyView corpus, pre-2016
  • 13,504 filtered sociopolitical posts and 864,890 comments
  • 7,254 comments proxy-labeled as delta-associated
  • 13,504 generated counter-arguments per selected model
  • 100 post-human-delta-GPT triples for crowdsourcing

Evidencia y localización

  • Metadatos, abstract, DOI y versión publicada: ACL Anthology 2025.findings-acl.793
  • Diseño, corpus, modelos, resultados, limitaciones, ética y apéndices: Findings of ACL 2025 PDF, 16 páginas, sha256 03eb21a11530a0c254307e3039fb3806d75afae702f78b32cdccd0226cb396f8
  • Versión posterior, materias oficiales y título ampliado con sycophancy: arXiv:2606.08076v1
  • Ausencia de código y datos pese a la declaración del paper: esradonmez/llm_persuasion commit 973aaa951e08ed9627175dc9688a93365729c0ee
  • Auditoría del constructo, delta, selección, estadística, encuesta, claims y reproducibilidad: reports/verification/article-241-acl-persuasive-social-dimensions-crowd-preference-and-empty-artifact-audit.json