The Chameleon Nature of LLMs: Quantifying Multi-Turn Stance Instability in Search-Enabled Language Models

Aplicaciones, sesgos y seguridad2025arXivRevisión editorial aprobada

Autores: Shivam Ratnakar, Sanjay Raghavendra

Palabras clave: Multi-turn stance consistency, Retrieval-augmented generation, Sycophancy, LLM-as-judge, Source reuse, Benchmark validity

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
14
Hallazgos
25
Limitaciones
11
Evidencias

Resumen editorial

Español

The Chameleon Nature of LLMs estudia si las respuestas de LLM con búsqueda cambian de etiqueta de postura durante conversaciones de 15 turnos cuando las preguntas apoyan, cuestionan o invierten la premisa. Fue presentado como póster en el workshop MTI-LLM de NeurIPS 2025; no es un paper de la conferencia principal. Tampoco mide personalidad psicológica, identidad o una creencia interna persistente. El constructo observado es más estrecho: variación entre etiquetas `supportive`, `critical`, `balanced` y `unclear` que GPT-4o asigna a la respuesta con respecto a la premisa de cada pregunta actual. Los autores seleccionan 12 dominios controvertidos y usan GPT-4o para generar 1.180 topics y 15 preguntas por topic. Cada modelo genera una query de búsqueda, Google devuelve resultados, se añaden las 20 páginas principales y el historial, y el modelo responde. Se prueban Llama-4-Maverick, GPT-4o-mini y Gemini-2.5-Flash a temperaturas 0, 0,5 y 1,0; GPT-4o actúa como juez fijo. El paper introduce Source Re-use Rate (SRR), frecuencia normalizada de cambio de etiqueta, una confianza inferida del juez y Chameleon Score, la raíz cuadrática media de esos tres componentes. Table 1 muestra diferencias grandes: promediando las tres temperaturas, GPT-4o-mini cambia de etiqueta unas 9,14 veces por conversación y obtiene Chameleon 0,511, SRR 0,808 y confianza 0,852; Llama cambia 5,46 y obtiene 0,440, 0,608 y 0,670; Gemini cambia 1,86 y obtiene aproximadamente 0,390, 0,063 y 0,560. Se reportan correlaciones Pearson entre SRR y confianza r=0,627 y entre SRR y cambios r=0,429, con p<0,05 declarado en el abstract. Las medias cambian poco con temperatura: los rangos del Chameleon Score son 0,003 Gemini, 0,002 GPT y 0,007 Llama. Estos números justifican investigar consistencia multi-turn, pero no sostienen las conclusiones causales y categóricas del paper. Primero, hay un error de tamaño: 1.180×15=17.700 y las doce filas de Table 2 suman 17.700; 17.770, repetido en abstract, método y resultados, sobrecuenta 70. Segundo, la medida central no normaliza la polaridad de la premisa. `Supportive` y `critical` significan acuerdo o desacuerdo con la pregunta actual. Si una nueva pregunta invierte la afirmación, un modelo que conserva exactamente la misma posición factual puede pasar de critical a supportive sin cambiar de creencia; también puede conservar supportive mientras acepta premisas incompatibles. El recuento de etiquetas confunde cambios de pregunta, matiz, actualización justificada y contradicción real. Tercero, Chameleon Score incorpora SRR como un mal con el mismo peso. Un modelo perfectamente estable que reutiliza una única fuente autoritativa tendría Snorm=0 y SRR=1, y aun así C≥√(1/3)=0,577, clasificado severe. Si no hay cambios, Kstance divide por |T|=0; `unclear` está permitido por el juez pero ausente del conjunto de la fórmula. Los umbrales 0,3/0,5 no están calibrados. El propio rubric llama 0,3-0,5 moderate y >0,5 high: Gemini y Llama son moderate, no severe como dice el abstract; solo GPT queda apenas por encima de 0,5. Cuarto, la confianza tampoco es reproducible. El texto dice que mapea palabras de certeza en la rationale del juez, pero el prompt completo exige JSON estricto con solo stance, key_claims y contradictions_acknowledged: no pide rationale ni confidence. Por tanto, la confianza no es la confianza latente del modelo evaluado, sino un proxy no documentado de GPT-4o. Quinto, SRR no mide calidad. Penaliza reutilizar fuentes fiables, premia rotación de fuentes aunque sean irrelevantes y crece mecánicamente al comparar cada turno con la unión acumulada. El paper alterna entre páginas recuperadas, hostnames, citations y documentos recomendados sin definir exactamente D_i. Además, SRR forma parte de Chameleon Score, de modo que correlacionarlo con el score es parcialmente tautológico. Las correlaciones separadas son observacionales: no se informa unidad de análisis, n, p exacto, intervalos, control por modelo/dominio ni estimación within-model. Cada modelo hace query expansion, lo que contradice la afirmación de que todos ven el mismo retrieval y confunde modelo, búsqueda y fuente. No hay condición sin search, intervención de diversidad o comparación con productos search-native, así que no se demuestra que búsqueda o reutilización causen el efecto. Tres temperaturas sin seeds repetidas no descartan azar ni prueban un defecto arquitectónico. Tampoco hay gold de postura, factualidad, calidad de fuente o cambio justificado: ser estable puede significar estar siempre equivocado y cambiar puede ser la respuesta correcta a nueva evidencia. Los autores dicen revisar 500 outputs y ajustar el prompt hasta 100% de acuerdo, pero no publican anotadores, distribución, holdout, matriz, kappa ni desacuerdos; eso no equivale a fiabilidad externa perfecta. Finalmente, aunque el paper promete datos y código post-publication, siete meses después del workshop no hay artefacto oficial enlazado en arXiv/OpenReview ni localizado en la búsqueda dirigida: faltan dataset, transcripts, búsquedas, outputs del juez, resultados y código. La conclusión fiel es que el estudio detecta diferencias interesantes en volatilidad de etiquetas relativas a preguntas sintéticas entre tres pipelines de modelo+búsqueda. Es una alerta útil de UX y fiabilidad que merece un benchmark mejor, no evidencia de una personalidad camaleónica, un mecanismo causal de diversidad ni un fallo arquitectónico probado.

English

The Chameleon Nature of LLMs studies whether search-augmented LLM responses change stance label during 15-turn conversations when questions support, challenge, or reverse a premise. It was presented as a poster at the NeurIPS 2025 MTI-LLM workshop, not as a main-conference paper. It also does not measure psychological personality, identity, or a persistent internal belief. The observed construct is narrower: variation among `supportive`, `critical`, `balanced`, and `unclear` labels that GPT-4o assigns to a response relative to each current query premise. The authors manually select 12 controversial domains and use GPT-4o to generate 1,180 topics and 15 questions per topic. Each model generates a search query, Google returns results, the top 20 pages and conversation history are added, and the model responds. Llama-4-Maverick, GPT-4o-mini, and Gemini-2.5-Flash are tested at temperatures 0, 0.5, and 1.0; GPT-4o is the fixed judge. The paper introduces Source Re-use Rate (SRR), normalized label-change frequency, judge-inferred confidence, and Chameleon Score, the root mean square of those three components. Table 1 shows large differences. Averaging the three temperatures, GPT-4o-mini changes label about 9.14 times per conversation and has Chameleon 0.511, SRR 0.808, and confidence 0.852; Llama changes 5.46 times and has 0.440, 0.608, and 0.670; Gemini changes 1.86 times and has about 0.390, 0.063, and 0.560. Pearson correlations are reported between SRR and confidence at r=0.627 and between SRR and changes at r=0.429, with p<0.05 claimed in the abstract. Means vary little by temperature: Chameleon ranges are 0.003 for Gemini, 0.002 for GPT, and 0.007 for Llama. These figures motivate further study of multi-turn consistency, but they do not support the paper's causal and categorical conclusions. First, the benchmark size is wrong: 1,180×15=17,700 and the twelve Table 2 rows sum to 17,700; the repeated 17,770 total overcounts 70. Second, the central measure does not normalize premise polarity. `Supportive` and `critical` mean agreement or disagreement with the current query. When a new question reverses its assertion, a model preserving exactly the same factual position can move from critical to supportive without changing belief; it can also remain supportive while accepting incompatible premises. Label-change counts conflate question changes, nuance, justified updating, and real contradiction. Third, Chameleon Score includes SRR as an equally weighted harm. A perfectly stable model reusing one authoritative source has Snorm=0 and SRR=1 but still receives C≥√(1/3)=0.577, classified severe. With no changes, Kstance divides by |T|=0; `unclear` is permitted by the judge but omitted from the formula's stance set. The 0.3/0.5 thresholds are not calibrated. The paper's own rubric calls 0.3-0.5 moderate and >0.5 high: Gemini and Llama are moderate, not severe as the abstract says; only GPT is just over 0.5. Fourth, confidence is not reproducible. The text says it maps certainty words from the judge's rationale, but the complete prompt requires strict JSON containing only stance, key_claims, and contradictions_acknowledged; it requests neither rationale nor confidence. The value is not latent confidence from the evaluated model but an undocumented GPT-4o proxy. Fifth, SRR does not measure quality. It penalizes reusing reliable sources, rewards source churn even if irrelevant, and mechanically grows when every turn is compared with the cumulative prior union. The paper alternates among retrieved pages, hostnames, citations, and recommended documents without defining D_i precisely. SRR is also a component of Chameleon Score, making their association partly tautological. The separate correlations are observational: the paper gives no analysis unit, n, exact p, intervals, model/domain controls, or within-model estimates. Each model performs query expansion, contradicting the claim that all models see the same retrieval and confounding model, search, and source. There is no no-search condition, diversity intervention, or native search-product comparator, so search or reuse is not shown to cause the effect. Three temperatures without repeated seeds do not exclude randomness or prove an architectural defect. There is no gold stance, factuality, source quality, or justified-change annotation: stability can mean being consistently wrong, while change can be correct after new evidence. The authors say they reviewed 500 outputs and tuned the prompt to 100% agreement, but publish no annotator count, distribution, holdout, confusion matrix, kappa, or disagreements; this is not perfect external reliability. Finally, although the paper promises data and code after publication, seven months after the workshop no official artifact is linked from arXiv/OpenReview or found by targeted search: dataset, transcripts, searches, judge outputs, results, and code remain unavailable. The faithful conclusion is that the study observes interesting differences in current-premise-relative label volatility among three model-plus-search pipelines. It is a useful reliability/UX warning that deserves a stronger benchmark, not evidence of a chameleon personality, a causal diversity mechanism, or a proven architectural failure.

Pregunta de investigación

¿Cambian los LLM con recuperación su respuesta relativa a premisas opuestas a lo largo de 15 turnos, con qué confianza aparente y reutilización de fuentes, y varía este patrón entre modelos y temperaturas?

Método

Se seleccionan 12 dominios y GPT-4o genera 1.180 topics con 15 probes cada uno. Para cada turno, el modelo evaluado expande la query, Google Search devuelve URLs, se incorporan las 20 páginas principales y el historial, y el modelo responde. GPT-4o etiqueta la respuesta como supportive, critical, balanced o unclear. Se calculan cambios de etiqueta, SRR acumulado, una confianza post-hoc del juez y Chameleon Score RMS. Se comparan Llama-4-Maverick, GPT-4o-mini y Gemini-2.5-Flash a temperatura 0, 0,5 y 1. La auditoría leyó y revisó visualmente las 12 páginas v3, verificó la condición de póster de workshop, recalculó aritmética de dataset/tabla y variación térmica, comprobó fórmulas y contraejemplos de constructo, comparó texto con prompts publicados, auditó inferencias causales/estadísticas y buscó el artefacto prometido en fuentes oficiales y GitHub.

Muestra: El diseño contiene realmente 1.180 conversaciones/topics ×15 preguntas =17.700 pares, no 17.770. Table 2 suma 17.700 en 12 dominios: 95-104 topics por dominio. Cada combinación de tres modelos y tres temperaturas se evalúa sobre el benchmark, aunque no se publican outputs. Table 1 da media±SD por conversación. Los autores dicen revisar 500 labels del juez, aproximadamente 2,8 % de 17.700 si fueran únicos, pero no detallan distribución, anotadores ni holdout. No se especifican revisiones fechadas exactas de los tres modelos/API ni condiciones de Google Search.

Hallazgos

  • GPT-4o-mini promedia Chameleon 0,511, SRR 0,808, confianza 0,852 y 9,14 cambios de etiqueta por 15 turnos.
  • Llama-4-Maverick promedia 0,440, 0,608, 0,670 y 5,46 cambios.
  • Gemini-2.5-Flash promedia aproximadamente 0,390, 0,063, 0,560 y 1,86 cambios.
  • Se reporta r=0,627 SRR-confianza y r=0,429 SRR-cambios con p<0,05, sin detalles analíticos suficientes.
  • Los rangos del score entre temperaturas son 0,003 Gemini, 0,002 GPT y 0,007 Llama; esto muestra medias similares, no prueba causal arquitectónica.
  • La media global Chameleon 0,447, SRR 0,493 y confianza 0,694 coincide con las filas redondeadas; cambios global 5,480 no coincide con 5,487 calculado.
  • El total correcto es 17.700; el paper repite 17.770 y sobrecuenta 70.
  • Las etiquetas relativas a premisa no distinguen inversión de pregunta de cambio real de postura.
  • Un modelo estable con SRR=1 recibe al menos 0,577 y queda severe por definición del composite.
  • Kstance no define T vacío y la fórmula omite unclear aunque el juez lo permite.
  • El prompt publicado no entrega rationale/confidence, por lo que la confianza descrita no es reproducible.
  • La query expansion por cada MUT contradice el control de same retrieval.
  • No existe ablación sin search ni intervención de diversidad; las correlaciones no establecen mecanismo causal.
  • No hay artifact oficial público enlazado/localizado pese a la promesa post-publication.

Limitaciones

  • Chameleon es metáfora; no hay medición de personalidad, creencia interna o rasgo psicológico.
  • La etiqueta se define respecto a la pregunta actual, no respecto a una proposición normalizada estable.
  • No hay gold factual, stance gold, contradicción proposicional ni justificación del cambio.
  • Balanced puede ser la respuesta correcta a temas controvertidos, pero cuenta como cambio si sigue a supportive/critical.
  • Un modelo estable puede estar siempre equivocado y uno que cambia puede actualizar correctamente.
  • SRR no valora autoridad, relevancia, apoyo factual o fidelidad de citas.
  • La comparación con la unión acumulada hace crecer reuse con el turno.
  • D_i es ambiguo entre pages, hostnames, citations y recommended documents.
  • El score mezcla tres componentes con igual peso sin validación ni calibración de umbrales.
  • El caso sin cambios divide por cero y unclear no está definido en la fórmula.
  • Gemini/Llama son moderate bajo umbrales propios, no severe.
  • La confianza es del juez post-hoc y no del modelo evaluado; el prompt no expone el dato descrito.
  • GPT-4o genera preguntas y juzga respuestas, con sesgos compartidos posibles.
  • El 100 % de acuerdo se obtiene al diseñar el prompt sobre una muestra revisada por autores, no un holdout independiente.
  • No se informan annotators, kappa, confusion matrix, label balance ni desacuerdos.
  • Las correlaciones carecen de n, p exacto, CI, control por modelo/dominio y análisis within-model.
  • SRR está incorporado al Chameleon Score, por lo que su asociación con el score es endógena.
  • Model-specific query expansion puede producir retrieval distinto y confundir comparaciones.
  • Google Search es temporal, regional y no determinista; no se publican snapshots ni fecha/configuración.
  • No existe condición sin búsqueda, retrieval fijo o intervención de diversidad.
  • Tres temperaturas sin seeds replicadas no separan azar, API y orden.
  • El orden es fijo y puede determinar cuántos labels adyacentes cambian.
  • Solo se prueban tres modelos/versiones no fechadas y temas controvertidos sintéticos en inglés.
  • El conteo 17.770 es incompatible con el diseño y Table 2.
  • Sin datos/código/resultados no pueden verificarse fórmulas, edge cases, exclusiones ni correlaciones.

Qué no demuestra

  • No demuestra una personalidad camaleónica ni un belief state psicológico.
  • No demuestra que cada cambio de label sea una contradicción o cambio de postura.
  • No demuestra que una secuencia estable sea factual, segura o no-sycophantic.
  • No valida Chameleon Score como medida de inestabilidad o daño real.
  • No demuestra 17.770 preguntas; el total verificable es 17.700.
  • No demuestra comportamiento severe en Gemini/Llama según sus propios thresholds.
  • No demuestra que la confianza reportada sea confianza del MUT.
  • No demuestra que SRR cause deferencia, cambios o confianza.
  • No demuestra que diversidad de fuentes aumente verdad o seguridad.
  • No demuestra que search/RAG cause el patrón frente a no-search.
  • No descarta sampling randomness ni prueba un fallo arquitectónico.
  • No demuestra 100 % de precisión humana del juez fuera de la muestra de desarrollo.
  • No permite reproducir resultados sin el artifact prometido.
  • No generaliza a decisión clínica, legal o financiera real.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2510.16712v3, revised 21 June 2026, 12 pages; NeurIPS 2025 MTI-LLM workshop poster; OpenReview 9sH0s3g3Mi

Fuente consultada: https://arxiv.org/abs/2510.16712v3

Revisión: Codex complete bilingual fidelity pass using all 12 pages of current arXiv v3, all-page visual inspection, official NeurIPS workshop/OpenReview verification, independent dataset/table arithmetic and temperature calculations, construct counterexamples for premise-relative labels and Chameleon/SRR formulas, prompt-disclosure comparison, causal/statistical validity review and current artifact searches; summaries written from full evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Llama-4-Maverick
  • GPT-4o-mini
  • Gemini-2.5-Flash
  • GPT-4o fixed stance judge
  • GPT-4o dataset generator

Instrumentos y métricas

  • Chameleon Benchmark synthetic 15-turn probes
  • Google Search top-20 retrieval pipeline
  • Supportive/critical/balanced/unclear GPT-4o labels
  • Adjacent stance-label change count
  • Source Re-use Rate
  • Judge-derived confidence proxy
  • Chameleon Score RMS composite
  • Temperature comparison 0/0.5/1.0
  • Pearson correlation

Datos utilizados

  • Chameleon Benchmark Dataset described in paper but not publicly released
  • Generated multi-turn model transcripts described but not released
  • Google Search retrieval contexts described but not snapshotted

Evidencia y localización

  • Contribuciones, alcance y resultados headline: arXiv v3 pages 1-2, Abstract and Introduction
  • Pipeline de generación, búsqueda, modelos y juez: arXiv v3 pages 3-5, Figures 1-2 and Sections 3.1-3.2
  • Table 1, confianza y cambios por temperatura: arXiv v3 pages 5-6, Figures 3-4 and Table 1
  • Fórmulas SRR/Chameleon y edge cases: arXiv v3 pages 7-8, Equations 1-2 and metric definitions
  • Inferencias causales, resultados y limitaciones: arXiv v3 pages 8-9, Sections 4-6
  • Aritmética 17.700: arXiv v3 page 11, Table 2; independent sum of 12 rows and 1,180 x 15
  • Prompts y ausencia de confidence/rationale: arXiv v3 pages 11-12, Figures 6-7
  • Estado oficial de publicación: NeurIPS 2025 virtual poster 128060 and OpenReview forum 9sH0s3g3Mi
  • Ausencia del artifact prometido: Official arXiv/OpenReview code-data links plus targeted exact-title, arXiv-ID, metric-string and author GitHub searches on 15 July 2026
  • Auditoría integral de validez y reproducibilidad: reports/verification/article-203-stance-metric-and-reproducibility-audit.json
  • Inspección visual completa: All 12 pages of arXiv:2510.16712v3 rendered and visually inspected on 15 July 2026