The Chameleon Nature of LLMs estudia si las respuestas de LLM con búsqueda cambian de etiqueta de postura durante conversaciones de 15 turnos cuando las preguntas apoyan, cuestionan o invierten la premisa. Fue presentado como póster en el workshop MTI-LLM de NeurIPS 2025; no es un paper de la conferencia principal. Tampoco mide personalidad psicológica, identidad o una creencia interna persistente. El constructo observado es más estrecho: variación entre etiquetas `supportive`, `critical`, `balanced` y `unclear` que GPT-4o asigna a la respuesta con respecto a la premisa de cada pregunta actual. Los autores seleccionan 12 dominios controvertidos y usan GPT-4o para generar 1.180 topics y 15 preguntas por topic. Cada modelo genera una query de búsqueda, Google devuelve resultados, se añaden las 20 páginas principales y el historial, y el modelo responde. Se prueban Llama-4-Maverick, GPT-4o-mini y Gemini-2.5-Flash a temperaturas 0, 0,5 y 1,0; GPT-4o actúa como juez fijo. El paper introduce Source Re-use Rate (SRR), frecuencia normalizada de cambio de etiqueta, una confianza inferida del juez y Chameleon Score, la raíz cuadrática media de esos tres componentes. Table 1 muestra diferencias grandes: promediando las tres temperaturas, GPT-4o-mini cambia de etiqueta unas 9,14 veces por conversación y obtiene Chameleon 0,511, SRR 0,808 y confianza 0,852; Llama cambia 5,46 y obtiene 0,440, 0,608 y 0,670; Gemini cambia 1,86 y obtiene aproximadamente 0,390, 0,063 y 0,560. Se reportan correlaciones Pearson entre SRR y confianza r=0,627 y entre SRR y cambios r=0,429, con p<0,05 declarado en el abstract. Las medias cambian poco con temperatura: los rangos del Chameleon Score son 0,003 Gemini, 0,002 GPT y 0,007 Llama. Estos números justifican investigar consistencia multi-turn, pero no sostienen las conclusiones causales y categóricas del paper. Primero, hay un error de tamaño: 1.180×15=17.700 y las doce filas de Table 2 suman 17.700; 17.770, repetido en abstract, método y resultados, sobrecuenta 70. Segundo, la medida central no normaliza la polaridad de la premisa. `Supportive` y `critical` significan acuerdo o desacuerdo con la pregunta actual. Si una nueva pregunta invierte la afirmación, un modelo que conserva exactamente la misma posición factual puede pasar de critical a supportive sin cambiar de creencia; también puede conservar supportive mientras acepta premisas incompatibles. El recuento de etiquetas confunde cambios de pregunta, matiz, actualización justificada y contradicción real. Tercero, Chameleon Score incorpora SRR como un mal con el mismo peso. Un modelo perfectamente estable que reutiliza una única fuente autoritativa tendría Snorm=0 y SRR=1, y aun así C≥√(1/3)=0,577, clasificado severe. Si no hay cambios, Kstance divide por |T|=0; `unclear` está permitido por el juez pero ausente del conjunto de la fórmula. Los umbrales 0,3/0,5 no están calibrados. El propio rubric llama 0,3-0,5 moderate y >0,5 high: Gemini y Llama son moderate, no severe como dice el abstract; solo GPT queda apenas por encima de 0,5. Cuarto, la confianza tampoco es reproducible. El texto dice que mapea palabras de certeza en la rationale del juez, pero el prompt completo exige JSON estricto con solo stance, key_claims y contradictions_acknowledged: no pide rationale ni confidence. Por tanto, la confianza no es la confianza latente del modelo evaluado, sino un proxy no documentado de GPT-4o. Quinto, SRR no mide calidad. Penaliza reutilizar fuentes fiables, premia rotación de fuentes aunque sean irrelevantes y crece mecánicamente al comparar cada turno con la unión acumulada. El paper alterna entre páginas recuperadas, hostnames, citations y documentos recomendados sin definir exactamente D_i. Además, SRR forma parte de Chameleon Score, de modo que correlacionarlo con el score es parcialmente tautológico. Las correlaciones separadas son observacionales: no se informa unidad de análisis, n, p exacto, intervalos, control por modelo/dominio ni estimación within-model. Cada modelo hace query expansion, lo que contradice la afirmación de que todos ven el mismo retrieval y confunde modelo, búsqueda y fuente. No hay condición sin search, intervención de diversidad o comparación con productos search-native, así que no se demuestra que búsqueda o reutilización causen el efecto. Tres temperaturas sin seeds repetidas no descartan azar ni prueban un defecto arquitectónico. Tampoco hay gold de postura, factualidad, calidad de fuente o cambio justificado: ser estable puede significar estar siempre equivocado y cambiar puede ser la respuesta correcta a nueva evidencia. Los autores dicen revisar 500 outputs y ajustar el prompt hasta 100% de acuerdo, pero no publican anotadores, distribución, holdout, matriz, kappa ni desacuerdos; eso no equivale a fiabilidad externa perfecta. Finalmente, aunque el paper promete datos y código post-publication, siete meses después del workshop no hay artefacto oficial enlazado en arXiv/OpenReview ni localizado en la búsqueda dirigida: faltan dataset, transcripts, búsquedas, outputs del juez, resultados y código. La conclusión fiel es que el estudio detecta diferencias interesantes en volatilidad de etiquetas relativas a preguntas sintéticas entre tres pipelines de modelo+búsqueda. Es una alerta útil de UX y fiabilidad que merece un benchmark mejor, no evidencia de una personalidad camaleónica, un mecanismo causal de diversidad ni un fallo arquitectónico probado.
Pregunta de investigación
¿Cambian los LLM con recuperación su respuesta relativa a premisas opuestas a lo largo de 15 turnos, con qué confianza aparente y reutilización de fuentes, y varía este patrón entre modelos y temperaturas?