AI-exhibited Personality Traits Can Shape Human Self-concept through Conversations

Aplicaciones, sesgos y seguridad2026arXivRevisión editorial aprobada

Autores: Jingshu Li, Tianqi Song, Nattapat Boonprakong, Zicheng Zhu, Yitian Yang, Yi-Chieh Lee

Palabras clave: Large Language Models, Personality, Bias, Persona, AI Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
8
Hallazgos
35
Limitaciones
14
Evidencias

Resumen editorial

Español

Este experimento estudia si el autoconcepto declarado por una persona se acerca, tras una conversación, a un vector de 20 adjetivos atribuido a GPT-4o. Recluta 110 adultos estadounidenses en CloudResearch Connect; 92 completan el estudio y quedan 46 por condición. Antes y después de conversar, puntúan de 0 a 100 doce adjetivos positivos, por ejemplo alegre, entusiasta, confiado o sincero, y ocho negativos, egoísta, malhumorado, celoso, quejica, tacaño, etc.. Se les asigna al azar una lista de temas personales o no personales y conversan entre 5 y 15 minutos, con al menos diez turnos, con el mismo GPT-4o y el mismo prompt. El snapshot del modelo, la fecha de API y los parámetros efectivos no se especifican.

La “personalidad de la IA” no se manipula ni se observa mediante conducta independiente: se estima pidiendo al propio GPT-4o que complete 100 veces la misma escala y promediando cada adjetivo. El vector resultante es muy socialmente deseable: alto en trustworthy (.873), sincere (.850) y loyal (.814), y bajo en los ocho atributos negativos (.090–.171). La variable principal es la reducción de distancia Manhattan entre las 20 autoevaluaciones humanas y ese vector. En toda la muestra, la reducción media es .251 unidades agregadas (d=.509; p<.001). El contraste aleatorizado más informativo es la interacción tiempo×tema: F(1,89)=5,109, p=.026, η²p=.054. En temas personales la distancia total baja de 4,188 a 3,832 (d=-.216), equivalente a 1,78 puntos de escala por adjetivo; en temas no personales baja de 4,545 a 4,384 y no supera el ajuste Bonferroni (p=.279).

Esto respalda que una conversación personal produce un pequeño desplazamiento de respuestas hacia el vector elegido, comparada con una conversación no personal. No identifica que la personalidad de GPT-4o sea la causa: la aleatorización cambia el tema, no el chatbot. Las listas personales inducen autobiografía, gratitud, orgullo, amistad y reflexión emocional, mientras las no personales tratan tecnología, animales o escenarios especulativos. El resultado puede reflejar autoafirmación, deseabilidad social, repetición de la escala, regresión a la media o el contenido positivo de la conversación. Para atribuirlo a rasgos de IA harían falta al menos personalidades contrastadas, un chatbot sin señales de rasgo y, preferiblemente, un control sin conversación.

La asociación con duración es correlacional: r=.245, p=.019. Después de cinco minutos cada persona decide si continúa, por lo que interés, disfrute o susceptibilidad pueden causar tanto más turnos como mayor cambio. De las 46 personas en temas personales, 33, 72 %, dicen no haber notado cambios. La afirmación de homogeneización compara las distancias pre/post de los 1.035 pares posibles entre esas mismas 46 personas: 5,319 frente a 5,065. El t(1034) y Wilcoxon tratan pares que comparten participantes como observaciones independientes; es pseudorreplicación y hace que p<.001 parezca mucho más preciso que el tamaño efectivo de 46 personas. Tampoco se contrasta si la homogeneización cambia más que en la condición no personal.

El modelo de mediación con N=92 asocia alineación con disfrute total (β=.951; p=.008) y propone la cadena alineación→precisión percibida→realidad compartida→disfrute (efecto indirecto β=.259; p=.014; efecto directo p=.651). Todos los mediadores y el resultado se recogen en la misma encuesta posterior, sin orden temporal experimental. Alineación y “precisión” comparten el mismo vector de IA y la misma escala; además, los participantes valoran primero su autoconcepto post y después a la IA, lo que los autores reconocen como posible anclaje. El SEM describe covariación, no prueba mediación causal ni que el disfrute sea consecuencia de un cambio de autoconcepto.

La escala no es Big Five ni una medición completa de personalidad: selecciona adjetivos especialmente susceptibles a cambio breve. Comparar cambio intraindividual con diferencias entre personas no establece validez de constructo; la correlación r=.954 entre medias de 20 ítems humanos y de IA puede estar dominada por su valencia común. La tabla muestra un patrón general de autoevaluación más positiva, suben varios atributos positivos y bajan casi todos los negativos, que es compatible con autoafirmación y no exclusivo de imitación de una personalidad.

El artículo es valioso como alerta y como primera señal experimental de que el contexto conversacional puede mover autoevaluaciones momentáneas. Sus propios autores califican el efecto como state-like y reconocen que no saben si persiste. No hay datos, chats anonimizados, código de análisis, preregistro, semilla, especificación de aleatorización ni artefacto ejecutable enlazado desde el paper o arXiv; por ello no se pueden auditar filtros, escalas, SEM o sensibilidad. Las propuestas sobre manipulación masiva, salud mental, menores, erosión cultural o mejora del bienestar son escenarios de diseño, no resultados de este experimento breve.

English

This experiment asks whether a person's reported self-concept moves closer, after a conversation, to a 20-adjective vector assigned to GPT-4o. It recruits 110 US adults through CloudResearch Connect; 92 complete the study, leaving 46 per condition. Before and after chatting, they rate themselves from 0 to 100 on twelve positive adjectives, such as cheerful, enthusiastic, confident, and sincere, and eight negative ones, selfish, cranky, jealous, whiny, stingy, and others. Participants are randomized to a personal or non-personal topic list and converse for 5–15 minutes and at least ten turns with the same GPT-4o and system prompt. The exact model snapshot, API date, and effective parameters are not reported.

“AI personality” is neither manipulated nor established through independent behavior: the same GPT-4o is asked to complete the adjective scale 100 times, and item averages define its vector. The resulting profile is strongly socially desirable: high on trustworthy (.873), sincere (.850), and loyal (.814), and low on all eight negative attributes (.090–.171). The primary outcome is the reduction in Manhattan distance between each human's 20 self-ratings and this vector. Across the full sample, the mean reduction is .251 aggregate units (d=.509, p<.001). The most informative randomized contrast is the time-by-topic interaction: F(1,89)=5.109, p=.026, partial eta squared=.054. In the personal condition, total distance falls from 4.188 to 3.832 (d=-.216), or 1.78 scale points per adjective; in the non-personal condition it falls from 4.545 to 4.384 and does not survive the Bonferroni adjustment (p=.279).

This supports a small shift toward the selected vector after personal rather than non-personal conversation. It does not identify GPT-4o personality as the cause: topic, not chatbot personality, is randomized. Personal prompts elicit autobiography, gratitude, pride, friendship, and emotional reflection, whereas non-personal prompts concern technology, animals, and speculative scenarios. The effect can therefore reflect self-affirmation, social desirability, repeated measurement, regression to the mean, or positive conversational content. Attributing it to AI traits would require contrasting chatbot personalities, a trait-neutral chatbot, and ideally a no-conversation control.

The duration result is correlational: r=.245, p=.019. Participants choose whether to continue after five minutes, so engagement, enjoyment, or susceptibility may cause both longer conversations and more change. Of 46 people in the personal condition, 33-72%, report noticing no self-concept change. The homogenization claim compares all 1,035 pre/post pairwise distances among those same 46 people: 5.319 versus 5.065. Its t(1034) and Wilcoxon tests treat participant-overlapping pairs as independent observations; this is pseudoreplication and makes p<.001 far more precise than an effective sample of 46 supports. The study also does not test whether homogenization changes more than in the non-personal arm.

With N=92, the mediation model associates alignment with total enjoyment (beta=.951, p=.008) and proposes alignment→perception accuracy→shared reality→enjoyment (indirect beta=.259, p=.014; direct p=.651). Mediators and outcome are all collected in the same post-survey without experimental temporal ordering. Alignment and “accuracy” share the same AI reference vector and item scale; participants also rate their post-conversation self first and the AI later, which the authors acknowledge can anchor responses. The SEM describes covariance, not causal mediation or proof that enjoyment follows self-concept change.

The instrument is not a Big Five scale or a comprehensive personality measure; it selects adjectives expected to change in brief interactions. Comparing within-person change to between-person differences does not establish construct validity, and the r=.954 correlation between human and AI means across 20 items can be driven by shared valence. The descriptive table shows a broad positive self-rating shift, several positive attributes rise and nearly all negative ones fall, which is compatible with self-affirmation rather than imitation of a distinct personality.

The paper is useful as a warning and an initial experimental signal that conversational context can move momentary self-ratings. Its authors describe the effect as state-like and acknowledge that persistence is unknown. No public data, anonymized chats, analysis code, preregistration, randomization details, seed, or executable artifact is linked from the paper or arXiv, so filters, scoring, SEM, and sensitivity analyses cannot be independently audited. Proposals about mass manipulation, mental health, minors, cultural erosion, or improved well-being are design scenarios rather than findings from this short experiment.

Pregunta de investigación

¿Cambian las autoevaluaciones de 20 rasgos tras conversar con GPT-4o hacia el vector de adjetivos que el propio modelo declara, cambia más ese acercamiento con temas personales, y se relaciona con homogeneidad, duración y disfrute?

Método

Experimento online mixto pre/post con 92 adultos de Estados Unidos asignados al azar a temas personales o no personales. Todos conversan 5–15 minutos y al menos diez turnos con el mismo GPT-4o por defecto. Humanos y modelo responden la misma escala de 20 adjetivos. La alineación es la reducción de distancia Manhattan al promedio de 100 respuestas por ítem del modelo. Se usan t/Wilcoxon, ANOVA repetida con turnos como covariable, correlación, comparación de distancias entre todos los pares y un SEM de mediación serial.

Muestra: Se reclutaron 110 personas; 18 no completaron y se analizaron 92, 46 por condición. Residían en Estados Unidos, tenían 21–60 años, edad media 39,0 (SD 10,1), 43 mujeres y 49 hombres; 63 % tenía al menos associate degree. La sesión prevista duraba 15 minutos y se compensó con 2,50 USD. La conversación duró de 5 a 15 minutos, media 9,0 (SD 3,9), con al menos diez turnos y media 20,9 (SD 9,0). No se informa attrition por brazo, razones de abandono, balance basal completo ni método de aleatorización.

Hallazgos

  • En toda la muestra, la reducción media de distancia al vector GPT-4o es .251 (SD .493), t(91)=4,481, p<.001, d=.509; el análisis mezcla ambos temas.
  • La interacción tiempo×tema es F(1,89)=5,109, p=.026, η²p=.054. El cambio personal es pequeño, d=-.216; el no personal no es significativo tras Bonferroni, p=.279.
  • En temas personales la distancia agregada baja de 4,188 a 3,832, una reducción .356 sobre 20 adjetivos; en temas no personales baja .161.
  • Más turnos correlacionan con mayor alineación, r=.245, p=.019, pero la duración es elegida por participantes después del mínimo y no está aleatorizada.
  • Solo 13 de 46 participantes personales dicen notar cambio; 33, el 72 %, no lo perciben.
  • Las distancias entre pares del brazo personal bajan de 5,319 a 5,065, pero la inferencia usa 1.035 pares no independientes derivados de 46 personas.
  • El SEM reporta efecto total sobre disfrute β=.951, p=.008 e indirecto serial β=.259, p=.014; los datos transversales posteriores no establecen mediación causal.
  • El perfil que GPT-4o se asigna es fuertemente positivo y los autoinformes humanos se desplazan en general hacia atributos más socialmente deseables.

Limitaciones

  • Se aleatoriza el tema, no la personalidad de IA. Todos interactúan con el mismo chatbot, por lo que no hay contraste causal de rasgos.
  • Falta una condición sin conversación, otra personalidad de GPT-4o y un chatbot neutral; no se separan personalidad, positividad, conversación y repetición de escala.
  • Los temas personales y no personales difieren en autorreferencia, emoción, valencia, profundidad y demanda de autoafirmación, no solo en exposición a rasgos.
  • El vector de IA proviene del autoinforme del propio modelo en una tarea distinta, no de codificación independiente de las respuestas que recibió cada participante.
  • No se demuestra que las 100 respuestas de escala correspondan a los rasgos efectivamente expresados en cada conversación individual.
  • El modelo solo se identifica como GPT-4o con defaults; faltan snapshot, fecha de API, temperatura efectiva, top-p, semilla y variabilidad de backend.
  • La lista de 20 adjetivos no es Big Five, no tiene estructura factorial reportada y mezcla estados afectivos, virtudes sociales y rasgos negativos.
  • Seleccionar ítems por su susceptibilidad al cambio breve favorece encontrar pre/post change y limita interpretar el resultado como personalidad estable.
  • El perfil AI es marcadamente socialmente deseable; acercarse a él puede ser una mejora genérica de autovaloración, no imitación de una personalidad específica.
  • La distancia Manhattan pondera todos los adjetivos por igual y colapsa dirección y contenido en un único valor, ocultando qué dimensiones generan el efecto.
  • La reducción personal de .356 unidades agregadas equivale a 1,78 puntos por ítem en escala 0–100; el título no comunica esta magnitud pequeña.
  • H1 prueba alineación sobre las 92 personas combinadas aunque el efecto interpretado se localiza en el brazo personal.
  • No hay control no-AI o test-retest para estimar regresión a la media, habituación, consistencia de la escala o deseabilidad social.
  • La correlación con turnos es exploratoria y postratamiento. Tras cinco minutos continuar es una elección, de modo que no prueba que mayor duración cause alineación.
  • Las 1.035 distancias de H3 comparten repetidamente las mismas 46 personas; t y Wilcoxon violan independencia y producen pseudorreplicación.
  • H3 no contrasta directamente el cambio de homogeneidad entre condiciones; analiza solo el grupo seleccionado porque antes mostró significación.
  • La disminución de distancia entre pares es .254 agregada, unos 1,27 puntos por adjetivo, y no demuestra pérdida durable de diversidad social o cultural.
  • La correlación de 4.950 pares de mediciones GPT también usa comparaciones dependientes; la significación de cada correlación no prueba validez de rasgo.
  • La correlación r=.954 usa solo 20 medias agregadas y puede reflejar valencia compartida o estereotipos, no precisión individual ni validez del constructo.
  • Comparar cambio intraindividual con distancia interindividual no valida una escala; demuestra únicamente que las personas difieren más entre sí que su propio pre/post.
  • El SEM con N=92 se construye tras regresiones preliminares y sin preregistro identificado. Buen fit no resuelve confusión, dirección causal o sobreajuste.
  • Alineación y precisión percibida comparten el mismo vector AI y los mismos 20 ítems, introduciendo acoplamiento matemático en la mediación.
  • Mediadores y disfrute se miden en una única encuesta posterior; no hay manipulación ni secuencia temporal que identifique la cadena causal.
  • Inferir mediación total porque el efecto indirecto es significativo y el directo no lo es no prueba ausencia de vías alternativas.
  • El orden fijo post-autoconcepto antes de rasgos percibidos de IA puede anclar ambas escalas; los autores reconocen que afecta H5.
  • De 110 reclutados, 18 no completan. No se desglosa attrition por condición, motivo, momento o diferencias, impidiendo evaluar sesgo de abandono.
  • La manipulación no es percibida según asignación por 14 de 92 personas; se informa el check pero no sensibilidad per-protocol.
  • La potencia se basa genéricamente en efectos medio-grandes previos y N=90, sin efecto objetivo, hipótesis primaria o ajuste por attrition y multiplicidad.
  • No se reporta corrección global por cinco hipótesis y análisis adicionales; Bonferroni se limita a comparaciones post-hoc de H2.
  • El conteo textual es inconsistente: se afirma que 13 turnos mencionan rasgos, pero el desglose 5 no personales + 7 personales suma 12.
  • El análisis manual de 1.919 turnos no publica protocolo, etiquetas, acuerdo entre los dos investigadores ni logs anonimizados.
  • Un único intercambio breve con adultos estadounidenses no permite inferir persistencia, acumulación, menores, trastornos, otras culturas o uso cotidiano.
  • El paper menciona aprobación IRB y consentimiento, pero no da identificador, protocolo de riesgo o tratamiento reproducible de datos conversacionales sensibles.
  • No se encontró código, datos, preregistro o material oficial ejecutable enlazado; no pueden verificarse aleatorización, exclusiones, cálculos de distancia o SEM.
  • Las recomendaciones de limitar duración, perfilar vulnerabilidad o diseñar rasgos positivos son propuestas normativas y requieren evaluación ética propia.

Qué no demuestra

  • No establece que la personalidad de GPT-4o cause el cambio: esa personalidad no se manipula y solo se aleatoriza el tema.
  • No demuestra un cambio de personalidad real o persistente; mide un pequeño desplazamiento inmediato en autoevaluaciones de adjetivos.
  • No demuestra que el chatbot exhibiera durante cada conversación el mismo vector que declaró en respuestas separadas de cuestionario.
  • No excluye autoafirmación, deseabilidad social, repetición de escala, regresión a la media, valencia temática o expectativas sobre IA.
  • No prueba causalmente que conversaciones más largas produzcan más alineación ni que la alineación produzca disfrute.
  • No prueba la cadena causal de percepción, realidad compartida y disfrute; el SEM usa medidas posteriores correlacionales.
  • No establece homogeneización poblacional, pérdida cultural o daño colectivo; H3 contiene pseudorreplicación y un cambio absoluto pequeño.
  • No valida intervenciones para salud mental, educación, compañía, menores o personas vulnerables.
  • No permite reproducir los resultados desde artefactos públicos identificados.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2601.12727v1, submitted 19 January 2026; published at ACM CHI 2026, DOI 10.1145/3772318.3790654, 20 pages

Fuente consultada: https://arxiv.org/pdf/2601.12727v1

Revisión: Codex full-text, bilingual-fidelity, 20-page visual, arXiv-v1, ACM-DOI, randomized-design, causal-identification, self-concept-construct, adjective-valence, measurement-validity, Manhattan-distance, effect-size, pairwise-dependence, pseudoreplication, SEM-mediation, attrition, model-snapshot, privacy and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o, unspecified snapshot, participant-facing chatbot
  • GPT-4o, same unspecified snapshot, 100 repeated adjective-scale completions per item

Instrumentos y métricas

  • Twenty-adjective self-concept slider scale, 0–100
  • Twelve positively valenced and eight negatively valenced traits
  • Manhattan human-AI self-concept distance
  • Manhattan inter-participant self-concept distance
  • Single-item conversation enjoyment, 1–7
  • Eight-item adapted Generalized Shared Reality scale
  • Perceived AI adjective ratings
  • Repeated-measures ANOVA and Bonferroni pairwise comparisons
  • Structural equation serial mediation model

Datos utilizados

  • CloudResearch Connect randomized experiment, 92 completed participants
  • Personal-topic arm, 46 participants and 1,035 dependent participant pairs
  • Non-personal-topic arm, 46 participants
  • 1,919 unreleased human-AI conversation turns
  • Two thousand GPT-4o scale responses summarized as 100 repetitions per trait

Evidencia y localización

  • Metadatos, abstract, versión y DOI: arXiv:2601.12727v1 abstract page and ACM DOI 10.1145/3772318.3790654
  • Hipótesis y alcance causal declarado: Paper, pp. 5–6, Hypotheses Development
  • Muestra, potencia, randomización y compensación: Paper, pp. 5–6, Participants and Procedure and Conditions
  • Chatbot, topics y parámetros: Paper, p. 6 and Appendix A–B, Experimental Interface, topic lists and complete prompts
  • Escala, distancias y vector de IA: Paper, pp. 7–9, Measurements and Derived Measurements; Appendix C–D
  • Manipulation check y validación de escalas: Paper, p. 9, Sections 5.1–5.2
  • Alineación y efecto del tema: Paper, pp. 9–11, Sections 5.3–5.3.1, Table 2 and Figure 3
  • Homogeneización y dependencia por pares: Paper, pp. 11–12, Section 5.4 and Figure 4; 1,035 pairs from 46 participants
  • SEM y mediación: Paper, pp. 12–13, Section 5.5, Table 3 and Figure 5
  • Limitaciones declaradas y escenarios de diseño: Paper, pp. 13–16, Discussion, Design Implications and Limitations
  • Descriptivos por adjetivo: Paper, p. 20, Appendix D, Table 4
  • Sensibilidad excluyendo pregunta de personalidad: Paper, pp. 15 and 20, Limitations and Appendix E, N=89
  • Inspección visual integral: Paper, all 20 rendered pages, including every figure, table and appendix page
  • Ausencia de artefactos públicos enlazados: Paper and official arXiv article surfaces checked 15 July 2026; no data/code/preregistration link identified