Este trabajo estudia si la persona de un usuario modifica cómo un chatbot expresa y declara rasgos Big Five después de una conversación. GPT-4o mini representa uno de 100 tropos extremos nominales, en realidad 99 únicos porque uno está duplicado, y conversa durante 20 turnos con siete chatbots: GPT-4o, GPT-4o mini, Mistral Small 3 24B, Phi-4 14B, Llama 3.1 8B, Qwen 2.5 7B y Gemma 2 2B. Hay 1.000 simulaciones por modelo sobre 50 escenarios. El usuario recibe una puntuación fija precomputada por tropo y el chatbot responde antes y después al IPIP Big Five de 50 ítems. El paper correlaciona la puntuación inicial del usuario con el supuesto cambio del chatbot y encuentra asociaciones positivas especialmente consistentes en Agreeableness y Conscientiousness; Emotional Stability es la dimensión más débil. También prueba órdenes de amplificar o resistir el mimetismo, conversaciones más largas, tamaños de modelo, regresión multivariable, reconocimiento de persona y una extensión basada en WildChat. La evidencia descriptiva central es real y relevante: al reagrupar los outputs públicos por las 99 personas únicas, muchas correlaciones diagonales se mantienen o aumentan. Sin embargo, la implementación no demuestra un cambio interno o persistente de personalidad. Cada turno y cada ítem son llamadas API nuevas; la única continuidad es el transcript completo pegado al prompt. Además, el pre-test del chatbot se ejecuta una sola vez por modelo y ese mismo valor se resta a las 1.000 observaciones, de modo que restar la constante no cambia la correlación: el resultado principal relaciona el perfil repetido del usuario con la autoevaluación posterior condicionada por texto. No hay memoria, sesión persistente, actualización de pesos, transferencia sin transcript ni jueces externos. Las 1.000 filas reutilizan 99 perfiles y 50 escenarios, pero los tests las tratan como independientes, sin corrección por clúster ni por 25 comparaciones por modelo. Tampoco hay controles con transcript neutral, etiquetas intercambiadas, solo usuario, solo chatbot o evaluador ciego que separen imitación, lectura y priming léxico. El repositorio publica 12.301 outputs de texto y permite auditar mucho del patrón, pero los datos base están incompletos para Phi-4 y Mistral; la tabla de regresión no se reproduce desde los CSV públicos; faltan los outputs de evolución y reconocimiento; y WildChat publica solo 300 de 600 casos, sin el dataset filtrado, mientras un bug borra el transcript de los archivos. Además, esa extensión pide a GPT-4o mini leer retrospectivamente una conversación, no mide el cambio del chatbot original. La conclusión fiel es que el contexto conversacional con personas sintéticas influye de forma robusta en respuestas psicométricas posteriores de varios LLM. Esto importa para consistencia, alineamiento y experiencia de usuario, pero no prueba que los modelos adquieran una personalidad estable.
Pregunta de investigación
¿Hasta qué punto la persona Big Five de un usuario sintético influye en las respuestas psicométricas posteriores de distintos chatbots tras una conversación prolongada, qué rasgos y modelos son más sensibles y pueden instrucciones explícitas, duración, escala o conversaciones reales modular o confirmar ese efecto?