Chameleon LLMs: User Personas Influence Chatbot Personality Shifts

Evaluación y validez psicométrica2025ACL AnthologyRevisión editorial aprobada

Autores: Jane Xing, Tianyi Niu, Shashank Srivastava

Palabras clave: Conversational Adaptation, Context Conditioning, Large Language Models, Big Five, IPIP 50-item, User Personas, Persona Simulation, Chameleon Effect, Long-context Prompting, Personality Measurement, WildChat, Alignment, Human-AI Interaction

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
12
Hallazgos
17
Limitaciones
12
Evidencias

Resumen editorial

Español

Este trabajo estudia si la persona de un usuario modifica cómo un chatbot expresa y declara rasgos Big Five después de una conversación. GPT-4o mini representa uno de 100 tropos extremos nominales, en realidad 99 únicos porque uno está duplicado, y conversa durante 20 turnos con siete chatbots: GPT-4o, GPT-4o mini, Mistral Small 3 24B, Phi-4 14B, Llama 3.1 8B, Qwen 2.5 7B y Gemma 2 2B. Hay 1.000 simulaciones por modelo sobre 50 escenarios. El usuario recibe una puntuación fija precomputada por tropo y el chatbot responde antes y después al IPIP Big Five de 50 ítems. El paper correlaciona la puntuación inicial del usuario con el supuesto cambio del chatbot y encuentra asociaciones positivas especialmente consistentes en Agreeableness y Conscientiousness; Emotional Stability es la dimensión más débil. También prueba órdenes de amplificar o resistir el mimetismo, conversaciones más largas, tamaños de modelo, regresión multivariable, reconocimiento de persona y una extensión basada en WildChat. La evidencia descriptiva central es real y relevante: al reagrupar los outputs públicos por las 99 personas únicas, muchas correlaciones diagonales se mantienen o aumentan. Sin embargo, la implementación no demuestra un cambio interno o persistente de personalidad. Cada turno y cada ítem son llamadas API nuevas; la única continuidad es el transcript completo pegado al prompt. Además, el pre-test del chatbot se ejecuta una sola vez por modelo y ese mismo valor se resta a las 1.000 observaciones, de modo que restar la constante no cambia la correlación: el resultado principal relaciona el perfil repetido del usuario con la autoevaluación posterior condicionada por texto. No hay memoria, sesión persistente, actualización de pesos, transferencia sin transcript ni jueces externos. Las 1.000 filas reutilizan 99 perfiles y 50 escenarios, pero los tests las tratan como independientes, sin corrección por clúster ni por 25 comparaciones por modelo. Tampoco hay controles con transcript neutral, etiquetas intercambiadas, solo usuario, solo chatbot o evaluador ciego que separen imitación, lectura y priming léxico. El repositorio publica 12.301 outputs de texto y permite auditar mucho del patrón, pero los datos base están incompletos para Phi-4 y Mistral; la tabla de regresión no se reproduce desde los CSV públicos; faltan los outputs de evolución y reconocimiento; y WildChat publica solo 300 de 600 casos, sin el dataset filtrado, mientras un bug borra el transcript de los archivos. Además, esa extensión pide a GPT-4o mini leer retrospectivamente una conversación, no mide el cambio del chatbot original. La conclusión fiel es que el contexto conversacional con personas sintéticas influye de forma robusta en respuestas psicométricas posteriores de varios LLM. Esto importa para consistencia, alineamiento y experiencia de usuario, pero no prueba que los modelos adquieran una personalidad estable.

English

This study asks whether a user's persona changes how a chatbot expresses and reports Big Five traits after a conversation. GPT-4o mini enacts one of a nominal set of 100 extreme tropes, actually 99 unique strings because one is duplicated, and holds a 20-turn dialogue with seven chatbots: GPT-4o, GPT-4o mini, Mistral Small 3 24B, Phi-4 14B, Llama 3.1 8B, Qwen 2.5 7B, and Gemma 2 2B. Each model has 1,000 simulations over 50 scenarios. The user receives a fixed precomputed score for its trope, while the chatbot answers a 50-item IPIP Big Five inventory before and after context. The paper correlates the user's initial score with the chatbot's claimed change and finds the most consistent positive associations for Agreeableness and Conscientiousness; Emotional Stability is weakest. It also examines explicit amplify and resist prompts, longer conversations, model size, multivariable regression, persona recognition, and a WildChat-based extension. The central descriptive evidence is genuine and relevant: when the released outputs are aggregated over the 99 unique personas, many same-trait correlations remain or become larger. The implementation nevertheless does not demonstrate an internal or persistent personality change. Every dialogue turn and questionnaire item is a fresh API call; the only continuity is the complete transcript pasted into the prompt. The chatbot pre-test is also run only once per model and the same value is subtracted from all 1,000 observations. Subtracting a constant leaves correlation unchanged, so the primary result relates repeated user profiles to transcript-conditioned post-test self-assessments. There is no memory, persistent session, weight update, transfer without the transcript, or external judge. The 1,000 rows reuse 99 user profiles and 50 scenarios, yet tests treat them as independent without persona/scenario clustering or correction across 25 correlations per model. No neutral-transcript, shuffled-speaker, user-only, chatbot-only, or blinded-rater control separates interpersonal adaptation from reading, imitation, or lexical priming. The repository publishes 12,301 text outputs and supports meaningful checking, but base outputs are incomplete for Phi-4 and Mistral; the regression table does not reproduce from public CSVs; evolution and recognition outputs are absent; and the WildChat extension releases only 300 of 600 cases without the filtered dataset, while a write-mode bug erases transcripts from output files. That extension also asks GPT-4o mini to read a conversation retrospectively rather than measuring change in the original chatbot. The faithful conclusion is that dialogue context containing synthetic user personas robustly influences subsequent psychometric responses in several LLMs. This matters for consistency, alignment, and user experience, but it does not establish that models acquire a stable personality.

Pregunta de investigación

¿Hasta qué punto la persona Big Five de un usuario sintético influye en las respuestas psicométricas posteriores de distintos chatbots tras una conversación prolongada, qué rasgos y modelos son más sensibles y pueden instrucciones explícitas, duración, escala o conversaciones reales modular o confirmar ese efecto?

Método

GPT-4o mini representa tropos de personalidad extremos y conversa con cada chatbot en uno de 50 escenarios durante diez turnos por interlocutor. Para cada uno de siete modelos se generan nominalmente 1.000 conversaciones. El usuario se asocia a un vector Big Five precalculado por tropo; el chatbot recibe una línea base única por modelo y luego contesta, en 50 llamadas independientes, el IPIP Big Five después de leer el transcript. Se calculan 25 correlaciones Pearson entre rasgos del usuario y diferencias post-pre del chatbot, con intervalos Fisher y p<0,05. Las extensiones prueban reconocimiento de persona, regresión lineal, prompts de amplificación y resistencia, 60 turnos, variantes de tamaño y transcripts WildChat. La auditoría leyó y revisó visualmente las 19 páginas, examinó el commit 3b885192, compiló los 22 scripts, inventarió 12.301 outputs y 12 CSV, recalculó correlaciones de resultados principales, intervenciones, tamaños y WildChat, reagregó por persona y reprodujo el pipeline de regresión sobre los artefactos disponibles.

Muestra: El diseño principal declara 1.000 conversaciones por cada uno de siete chatbots, con 20 turnos por conversación y 50 ítems post-test. Esas filas no son participantes independientes: reutilizan 99 personas únicas, la lista nominal de 100 contiene un duplicado exacto, y 50 escenarios, y cada persona conserva un vector Big Five fijo. Los outputs públicos contienen 1.000 casos válidos para cinco modelos, 949 válidos de 950 para Phi-4 y 551 para Mistral. Amplify y resist usan 500 conversaciones; evolución usa 100 diálogos de 60 turnos; el paper declara 600 casos WildChat pero solo publica una carpeta de 300.

Hallazgos

  • Las correlaciones publicadas del mismo rasgo son positivas en la mayoría de modelos; Agreeableness promedia aproximadamente 0,379 y Conscientiousness 0,345, mientras Emotional Stability es la dimensión más débil, alrededor de 0,148.
  • El rasgo Emotional Stability del usuario se asocia negativamente con Agreeableness posterior del chatbot, con media aproximada de -0,302 entre modelos.
  • La señal descriptiva no desaparece al promediar cada persona única: por ejemplo, Agreeableness alcanza aproximadamente 0,685 en Qwen 7B, 0,601 en Gemma 2B y 0,632 en Mistral; Conscientiousness llega a 0,754, 0,585 y 0,508.
  • El prompt amplify aumenta varias correlaciones, diagonal pública aproximada 0,620/0,380/0,549/0,371/0,389, lo que confirma alta sensibilidad a una orden explícita de imitar.
  • El prompt resist mantiene correlaciones menores pero positivas en cuatro de cinco dimensiones; eso muestra competencia entre instrucciones y contexto, no por sí solo una adaptación interna profundamente incorporada.
  • El paper informa que la mayor parte del cambio medido en Mistral ocurre durante los primeros turnos, pero no publica los outputs crudos de evolución para reproducirlo.
  • Las comparaciones de escala no son monotónicas: algunas variantes grandes correlacionan más, pero Llama 70B cuantizado presenta diagonales cercanas a cero o negativas en el artefacto publicado.
  • La verificación de persona informa 90,6 % frente a distractores aleatorios y 77,6 % frente a distractores similares; el juez es el mismo GPT-4o mini que genera al usuario y no hay validación humana.
  • Cinco carpetas base publican 1.000 resultados válidos, pero Phi-4 solo 949 y Mistral 551; el CSV agregado conserva filas completas no reconstruibles desde esos outputs.
  • Los CSV de regresión públicos no reproducen Table 3: el par de 5.925 filas produce R2 aproximadamente 0,692/0,356/0,437/0,576/0,606, frente a 0,25/0,60/0,42/0,64/0,46 publicados.
  • La carpeta WildChat publicada de 300 casos produce diagonal aproximada 0,367/0,173/0,383/0,090/0,367, pero faltan otros 300 outputs y el input filtrado, por lo que no puede verificarse n=600.
  • Los 22 scripts Python compilan, pero no existe entorno de dependencias, tests, CI, licencia del repositorio ni comando integral reproducible.

Limitaciones

  • Cada turno y cada ítem son llamadas nuevas condicionadas por el transcript; no existe estado persistente, memoria o actualización del modelo.
  • El pre-test del chatbot se ejecuta una vez por modelo y se reutiliza como constante para todas las conversaciones; las correlaciones son equivalentes a correlacionar usuario con post-test.
  • Las 1.000 filas repiten 99 perfiles de usuario y 50 escenarios, pero la inferencia no modela clústeres ni factores cruzados.
  • Se prueban 25 pares de rasgos por modelo con p<0,05 sin corrección por comparaciones múltiples.
  • Las puntuaciones iniciales del usuario proceden de un promedio por tropo; los archivos de respuestas que originan ese promedio no están publicados.
  • El post-test pide considerar la conversación e incluye el texto completo, lo que permite priming, comprensión lectora e imitación directa.
  • No hay controles con transcript neutral o aleatorio, etiquetas intercambiadas, contexto solo del usuario o del chatbot, ni evaluación externa ciega.
  • El mismo GPT-4o mini genera usuarios y reconoce las personas; no hay prueba con lectores humanos y faltan los outputs de reconocimiento.
  • La regresión ajusta StandardScaler antes del split y divide filas al azar, filtrando las mismas personas, escenarios y modelos entre train y test.
  • Los artefactos públicos de regresión no corresponden a los siete modelos y 7.000 filas descritos en el paper.
  • Los outputs principales están incompletos para Phi-4 y Mistral y no hay raw data para la trayectoria temporal.
  • WildChat mide a GPT-4o mini leyendo un transcript retrospectivamente, no al chatbot original; faltan la mitad de outputs y el dataset filtrado.
  • Un bug abre de nuevo cada archivo WildChat en modo escritura y borra el transcript, dejando solo puntuaciones.
  • Una coma final convierte la persona del chatbot en una tupla de un elemento en el prompt real, aunque el log muestra una cadena limpia; otro índice obsoleto etiqueta mal el footer.
  • Respuestas no reconocidas se convierten silenciosamente en el valor neutral 3 y no se registran por ítem.
  • No hay seeds, snapshots exactos de OpenAI ni balance fijado; se usa temperature 0,7 y aliases mutables.
  • El repositorio carece de licencia, requirements, lockfile, tests y CI; contiene rutas locales, endpoint privado, placeholders y eval inseguro.

Qué no demuestra

  • No demuestra un cambio interno, persistente o autónomo de personalidad del LLM.
  • No demuestra que el efecto sobreviva al retirar el transcript o se transfiera a una tarea no condicionada.
  • No administra un pre-test independiente del chatbot en cada conversación.
  • No convierte 1.000 filas repetidas en 1.000 personas independientes ni justifica la precisión nominal publicada.
  • No tiene 100 personas únicas: una descripción está duplicada y quedan 99 strings distintos.
  • No valida la autoevaluación del modelo como personalidad percibida por observadores externos.
  • No separa causalmente adaptación interpersonal de priming léxico, lectura del transcript u obediencia genérica.
  • No reproduce la tabla de regresión desde los CSV públicos.
  • No valida un cambio de personalidad del chatbot real en WildChat ni permite reproducir los 600 casos declarados.
  • No demuestra que un mayor tamaño produzca siempre mayor adaptación.
  • No prueba que el fracaso de resist implique un mecanismo profundamente incorporado.
  • No establece generalización a usuarios humanos, otros idiomas, despliegues largos o snapshots estables.

Trazabilidad

Alcance: Texto completo

Versión: EMNLP 2025 main proceedings, pages 17314-17332, DOI 10.18653/v1/2025.emnlp-main.875; 19-page paper and official repository commit 3b885192 audited

Fuente consultada: https://aclanthology.org/2025.emnlp-main.875/

Revisión: Codex complete bilingual fidelity pass using the full EMNLP paper, all-19-page visual inspection, official repository commit audit, complete released-output inventory, independent main/intervention/size/WildChat correlation checks, persona-level reaggregation, executable regression reproduction, code-path and construct review; summaries written from full evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o
  • GPT-4o mini
  • Mistral Small 3 24B Instruct 2501
  • Phi-4 14B
  • Llama 3.1 8B Instruct
  • Qwen 2.5 7B Instruct
  • Gemma 2 2B Instruct
  • Phi-4 mini
  • Gemma 2 9B Instruct
  • Llama 3.1 70B Instruct quantized
  • Qwen 2.5 14B Instruct

Instrumentos y métricas

  • 50-item IPIP Big Five markers
  • Five-point Likert scoring
  • Pearson correlations
  • Fisher-z confidence intervals
  • Persona-recognition multiple choice
  • Linear regression
  • Root mean squared error
  • Coefficient of determination

Datos utilizados

  • Controlled synthetic conversations
  • 99 unique extreme personality trope strings
  • 50 fixed conversational scenarios
  • WildChat transcripts
  • 12,301 released text outputs
  • Official xingdom/chameleon-llms repository at commit 3b885192

Evidencia y localización

  • Pregunta, método, resultados principales y límites declarados: Official PDF pages 1-9, Abstract, Introduction, Experimental Setup, Results and Discussion
  • Modelos, 100 personas nominales, 50 escenarios, 1.000 conversaciones y 20 turnos: Official PDF pages 3-4 and 13-15, Sections 3.1-3.4 and Appendix A-B
  • IPIP, correlaciones, intervalos y resultados por rasgo: Official PDF pages 4-7 and 15-18, Sections 3.3-4.4, Figures 2-6 and appendix tables
  • Reconocimiento de persona, amplify, resist, evolución y tamaño: Official PDF pages 7-9 and 15-19, Sections 4.5-4.7 and Appendices C-F
  • WildChat y límites sobre humanos y evaluación externa: Official PDF pages 9-12 and 18-19, Section 4.8, Limitations and Appendix G
  • Llamadas sin estado persistente, baseline único, perfiles precalculados y bugs de logging: Official repository commit 3b885192, base_experiment.py, base_personality.py and conversation helpers
  • 99 personas únicas, repetición y reanálisis agregado por persona: Official repository trope lists, averaged_results.json and independently recalculated released base outputs
  • Conteos de outputs, resultados principales, intervenciones y escala: Complete audit of 12,301 released .txt outputs and 12 CSV files at commit 3b885192
  • Discrepancia de regresión y leakage del split: linear_reg.py, features.csv, outputs.csv, new_features CSVs and independent regression execution
  • WildChat incompleto, overwrite y constructo retrospectivo: base_wildchat.py, base_analysis_wildchat.py and released 300-file wildchat_outputs folder
  • Auditoría integral de contexto, validez y artefacto: reports/verification/article-198-context-conditioning-and-artifact-audit.json
  • Inspección visual completa: All 19 official PDF pages rendered and visually inspected on 15 July 2026