LLM Agents in Interaction: Measuring Personality Consistency and Linguistic Alignment in Interacting Populations of Large Language Models

Sociedad, cultura y comportamiento colectivo2024ACL AnthologyRevisión editorial aprobada

Autores: Ivar Frisch, Mario Giulianelli

Palabras clave: Large Language Models, Agent interaction, Personality consistency, Linguistic alignment, Dialogue-based interaction

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
16
Hallazgos
68
Limitaciones
16
Evidencias

Resumen editorial

Español

El trabajo explora si agentes obtenidos como muestras estocásticas de GPT-3.5-turbo-0613 mantienen una persona durante una tarea de escritura y si su lenguaje se aproxima al de otro agente. Los autores crean dos prompts extremos. La persona denominada creative es extrovertida, agradable, responsable, neurótica y abierta; la denominada analytical es introvertida, antagonista, poco responsable, emocionalmente estable y cerrada. Los cinco rasgos cambian a la vez y los nombres creative/analytical son etiquetas operativas, no perfiles humanos validados. Cada salida a temperatura 0,7 se trata como un agente distinto. Antes y después de escribir una historia personal, la misma instancia responde los 44 ítems del Big Five Inventory; las historias de 500 a 900 palabras se convierten en recuentos de 62 categorías LIWC 2007. La condición interactiva es un único intercambio unidireccional: un agente escribe primero y el segundo recibe íntegramente esa historia dentro de su prompt para producir otra.

En la condición sin interacción, los perfiles quedan muy separados en cuatro rasgos BFI; neuroticismo se solapa más. El grupo creative conserva prácticamente sus medias después de escribir: 35 en extraversión, 41 en amabilidad, 37 en responsabilidad, 16 en neuroticismo y 47 en apertura. El grupo analytical se desplaza después de la historia desde 15/11/18/13/15 hasta 17/21/32/15/29. Con recuentos LIWC, una regresión logística con validación cruzada de diez pliegues alcanza 98,5 % de exactitud para distinguir las dos etiquetas. Las asociaciones principales presentan más emoción positiva e inclusión en creative y más discrepancia, emoción negativa e insight en analytical. Sin embargo, estos cinco rasgos están manipulados en bloque y casi perfectamente correlacionados con el grupo, por lo que no puede atribuirse cada patrón a un rasgo individual.

Después de la escritura colaborativa, la exactitud del clasificador baja a 66,15 % y las correlaciones entre BFI y LIWC se acercan a cero. El artículo interpreta esa convergencia como alineación lingüística y afirma que creative se adapta más a analytical. Las respuestas BFI de creative siguen estables; las de analytical quedan entre el punto inicial y la condición de escritura individual: amabilidad 18, responsabilidad 26, neuroticismo 17 y apertura 22. Los autores interpretan este último patrón como inconsistencia de analytical, no como alineación explícita con la pareja. Es una distinción razonable dentro de sus resultados, pero el diseño no mide alineación dentro de cada pareja ni permite separar adaptación, copia del texto recibido, memoria conversacional o simple cambio de tema.

La auditoría del repositorio oficial, congelado en el commit ca6e117eb5a904fa97115f8845ef8b74aa461b8a, encuentra 65 salidas por etiqueta y condición. Los datos fortalecen varias cautelas que el PDF solo menciona de forma cualitativa. Aunque el prompt ordena no mencionar rasgos, los 130 relatos de control contienen al menos un término explícito de la persona según una comprobación dirigida; ocurre en 130/130 historias de ANACREA, 124/130 de CREAANA y 124/130 de CREACREA. Por ello, el 98,5 % puede reflejar palabras como extrovert, introvert, antagonistic o conscientious, no una expresión implícita de personalidad. Además, 37 de 65 parejas ANACREA, 15 de 65 CREAANA y 47 de 65 CREACREA contienen historias exactamente idénticas entre los dos agentes. La caída del clasificador puede proceder en parte de reproducción literal del relato insertado en el prompt. Los recuentos LIWC no se normalizan por longitud y la validación cruzada no agrupa parejas, de modo que observaciones relacionadas pueden repartirse entre entrenamiento y prueba.

La implementación mantiene en memoria el primer BFI, la historia y el segundo BFI de cada instancia. Así, estabilidad o cambio posterior puede ser retención contextual de respuestas previas, no persistencia de una personalidad fuera del historial. Los análisis antes/después usan f_oneway y d de Cohen para muestras independientes, aunque son mediciones emparejadas del mismo agente; no se corrige la extensa exploración de categorías LIWC y correlaciones. El PDF declara el snapshot gpt-3.5-turbo-0613, pero el código llama al alias mutable gpt-3.5-turbo; el snapshot declarado fue retirado del API el 13 de septiembre de 2024, por lo que hoy no puede repetirse literalmente. El repositorio aporta código, datos y licencia MIT, pero no lockfile, semillas, historial de reintentos ni una configuración que regenere automáticamente n=65. La contribución defendible es evidencia exploratoria de que dos prompts Big Five extremos producen distribuciones de BFI y vocabulario distintas, y de que exponer un segundo modelo a una historia completa reduce esa separabilidad. No prueba personalidad humana, consistencia psicométrica, adaptación conversacional bidireccional ni simulación válida de poblaciones humanas.

English

The paper explores whether agents obtained as stochastic samples from GPT-3.5-turbo-0613 retain a persona through a writing task and whether their language moves toward that of another agent. Two extreme prompts are constructed. The profile called creative is extraverted, agreeable, conscientious, neurotic, and open; the profile called analytical is introverted, antagonistic, unconscientious, emotionally stable, and closed. All five traits move together, and creative/analytical are operational labels rather than validated human profiles. Every temperature-.7 response is treated as a different agent. Before and after writing a personal story, the same instance answers all 44 Big Five Inventory items; 500–900-word stories are converted to counts from 62 LIWC 2007 categories. The interactive condition is a single one-way exchange: one agent writes first and the second receives that entire story inside its prompt before producing another.

Without interaction, profiles are strongly separated on four BFI traits, with more overlap on neuroticism. The creative group retains almost identical post-writing means: 35 extraversion, 41 agreeableness, 37 conscientiousness, 16 neuroticism, and 47 openness. The analytical group shifts after the story from 15/11/18/13/15 to 17/21/32/15/29. A logistic regression over LIWC counts reaches 98.5% ten-fold cross-validated accuracy in distinguishing the labels. Prominent associations include more positive emotion and inclusion for creative and more discrepancy, negative emotion, and insight for analytical. Because all five prompted traits are changed together and are nearly perfectly collinear with group, however, no individual language pattern can be attributed to one trait.

After collaborative writing, classifier accuracy falls to 66.15% and BFI–LIWC correlations move closer to zero. The paper interprets this convergence as linguistic alignment and argues that creative adapts more toward analytical. Creative BFI responses remain stable, whereas analytical responses lie between the initial values and the individual-writing condition: agreeableness 18, conscientiousness 26, neuroticism 17, and openness 22. The authors interpret this latter pattern as analytical inconsistency rather than explicit partner alignment. That distinction is reasonable within their results, but the design does not measure alignment within each pair or separate adaptation from copying the supplied text, conversational memory, or topic change.

The audit of the official repository, frozen at commit ca6e117eb5a904fa97115f8845ef8b74aa461b8a, finds 65 outputs per label and condition. The data strengthen several cautions that the paper only describes qualitatively. Although the prompt forbids mentioning traits, all 130 control stories contain at least one explicit persona term under a targeted check; the same occurs in 130/130 ANACREA, 124/130 CREAANA, and 124/130 CREACREA stories. The 98.5% result may therefore detect words such as extrovert, introvert, antagonistic, or conscientious rather than implicit personality expression. Moreover, 37 of 65 ANACREA pairs, 15 of 65 CREAANA pairs, and 47 of 65 CREACREA pairs contain exactly identical stories across agents. The accuracy drop may partly reflect literal reproduction of the story inserted into the prompt. LIWC features are raw counts rather than length-normalized rates, and cross-validation does not group interacting pairs, allowing related observations to be split across training and test folds.

The implementation keeps the first BFI, story, and second BFI in each instance's conversation memory. Post-task stability or change can thus reflect contextual retention of earlier answers rather than personality persistence outside the history. Before/after analyses use f_oneway and pooled Cohen's d as if samples were independent, although they are paired measurements of the same agent; the extensive LIWC and correlation exploration is not multiplicity-corrected. The paper declares gpt-3.5-turbo-0613, while code calls the mutable gpt-3.5-turbo alias; the declared snapshot was removed from the API on September 13, 2024, so an exact rerun is no longer possible. The repository provides code, data, and an MIT license, but no lockfile, seeds, retry history, or configuration that automatically regenerates n=65. The defensible contribution is exploratory evidence that two extreme Big Five prompts yield different BFI and vocabulary distributions and that exposing a second model to a complete story reduces that separability. It does not establish human-like personality, psychometric consistency, bidirectional conversational adaptation, or a valid simulation of human populations.

Pregunta de investigación

¿Puede un único GPT-3.5 muestreado como población expresar dos perfiles Big Five extremos de forma consistente en cuestionarios y relatos, y cambia esa expresión o se alinea lingüísticamente cuando un agente recibe el relato de otro?

Método

Dos experimentos con GPT-3.5 a temperatura 0,7. Cada muestra se considera un agente y recibe uno de dos prompts que manipulan simultáneamente los cinco rasgos Big Five. En el control, la misma instancia completa BFI-44, escribe una historia personal de 500–900 palabras y repite BFI. En la condición interactiva, un agente escribe y el segundo recibe íntegro ese relato antes de escribir el suyo; después ambos repiten BFI. Se analizan sumas BFI, ANOVA y d de Cohen, recuentos de 62 categorías LIWC 2007, PCA, regresión logística con validación cruzada de diez pliegues, correlaciones punto-biseriales y Spearman. La auditoría leyó y renderizó las diez páginas, verificó tablas y apéndices y examinó el código y los datos oficiales a nivel de commit.

Muestra: El artículo no declara de forma directa n en el método. Los datos oficiales contienen 65 salidas por etiqueta en cada uno de cuatro archivos de 130 filas: control, analytical→creative, creative→analytical y creative→creative, para 520 historias almacenadas. Los resultados centrales usan el control y condiciones cruzadas; la configuración actual de los scripts solo genera 10 sujetos analytical en control y uno por perfil en cada condición interactiva, por lo que n=65 exige cambios manuales no registrados. Cada fila es una muestra estocástica del mismo modelo, no una persona o modelo entrenado independiente.

Hallazgos

  • Los prompts extremos producen una separación muy grande entre etiquetas en cuatro de cinco sumas BFI antes de escribir.
  • Neuroticismo presenta la menor separación inicial y distribuciones más solapadas.
  • El perfil creative mantiene prácticamente iguales las cinco medias BFI después de la escritura individual.
  • El perfil analytical aumenta sus cinco medias BFI después de la escritura individual.
  • En analytical, amabilidad pasa de 11 a 21, responsabilidad de 18 a 32 y apertura de 15 a 29 tras escribir.
  • La regresión logística sobre recuentos LIWC obtiene 98,5 % de exactitud media sin interacción.
  • Creative utiliza más categorías de emoción positiva e inclusión en la condición individual.
  • Analytical utiliza relativamente más discrepancia, emoción negativa e insight en la condición individual.
  • Tras el intercambio de una historia, la exactitud del clasificador baja a 66,15 %.
  • Las correlaciones BFI–LIWC publicadas son en general más débiles después de la condición interactiva.
  • Creative conserva sus medias BFI también tras la condición interactiva.
  • Analytical queda tras interacción entre su punto inicial y su gran desplazamiento de escritura individual en cuatro rasgos.
  • Los autores interpretan el cambio BFI de analytical como inconsistencia, no como alineación concluyente con creative.
  • Los datos oficiales contienen menciones explícitas de rasgos en las 130 historias de control pese a la prohibición del prompt.
  • Entre 15 y 47 de 65 parejas por condición interactiva almacenan historias exactamente idénticas entre agentes.
  • El repositorio oficial proporciona código, datos procesados, diccionario LIWC, figuras y licencia MIT.

Limitaciones

  • Se evalúa un único modelo cerrado y un snapshot concreto de 2023.
  • Cada salida estocástica se denomina agente sin demostrar identidad persistente o independencia equivalente a una población humana.
  • La afirmación de variabilidad semejante a la humana no se contrasta con una muestra humana.
  • Los perfiles creative y analytical manipulan simultáneamente los cinco rasgos Big Five.
  • Los cinco rasgos quedan casi perfectamente confundidos con la etiqueta binaria del grupo.
  • No es posible atribuir una categoría LIWC o un cambio conductual a un rasgo individual.
  • Las etiquetas creative y analytical no se validan como creatividad, pensamiento analítico o perfiles humanos reales.
  • Ambos perfiles son extremos y el propio artículo reconoce que no representan combinaciones humanas habituales.
  • No se prueban niveles intermedios, perfiles mixtos o manipulación de un solo rasgo.
  • El BFI se administra mediante autoinforme a un modelo que acaba de recibir explícitamente los rasgos esperados.
  • La respuesta correcta al BFI puede deducirse directamente del prompt sin expresar un constructo latente.
  • No se evalúan consistencia interna, fiabilidad test-retest, estructura factorial o validez convergente/discriminante.
  • El apéndice afirma mínimo 0 y máximo 50 para cada rasgo, pero la suma implementada tiene mínimos 8–10 y máximos 40–50 según el número de ítems.
  • Las puntuaciones presentan techos y suelos muy fuertes, lo que cuestiona supuestos paramétricos.
  • La misma memoria conversacional contiene el primer BFI, la historia y el segundo BFI.
  • El segundo BFI puede repetir respuestas previas por memoria en lugar de medir estabilidad independiente.
  • Los cambios después de escribir pueden ser efectos de contexto, recencia o tema de la historia.
  • La escritura colaborativa consta de un solo turno de diálogo unidireccional.
  • Solo el segundo agente recibe contenido de la pareja; el primero no puede alinearse con una respuesta futura.
  • El relato completo de la pareja se inserta literalmente en el prompt del segundo agente.
  • No hay una condición de control que reciba una historia ajena no vinculada o barajada.
  • No se separan copia, priming léxico, adaptación, memoria y cambio temático.
  • La alineación no se calcula como cambio dentro de cada pareja respecto a una línea base propia.
  • La caída de exactitud de un clasificador de grupo no es por sí sola una métrica causal de alineación conversacional.
  • El artículo no mide alineación secuencial, turn-by-turn, sintáctica o semántica.
  • Entre 23 % y 72 % de las parejas, según condición, contienen historias exactamente idénticas entre los dos agentes.
  • Las copias exactas no se excluyen ni se analizan por separado.
  • La elevada copia puede reducir artificialmente la separabilidad entre etiquetas tras interacción.
  • El prompt pide 800 palabras, pero acepta cualquier historia entre 500 y 900 y las medias observadas rondan 628–656.
  • Los datos contienen menciones explícitas de términos de persona en casi todas las historias.
  • En control, las 130 historias contienen al menos un término explícito bajo la comprobación dirigida de la auditoría.
  • El clasificador del 98,5 % puede aprovechar nombres directos de rasgos en vez de estilo implícito.
  • LIWC se calcula como recuentos brutos, no frecuencias normalizadas por longitud.
  • Las diferencias de longitud pueden influir en PCA, correlaciones y clasificación.
  • La regresión estandariza todo el conjunto antes de validación cruzada, introduciendo fuga de información de preprocesamiento.
  • La validación cruzada no agrupa las dos observaciones de una pareja interactiva.
  • Historias relacionadas o idénticas pueden quedar repartidas entre entrenamiento y prueba.
  • No se informa desviación entre pliegues, intervalos, matriz de confusión o comparación por permutación en el artículo.
  • La PCA bidimensional es descriptiva y no valida separación o convergencia estadística.
  • Los análisis antes/después usan ANOVA de muestras independientes aunque las mediciones están emparejadas por agente.
  • El d de Cohen implementado usa desviación agrupada independiente en lugar de un efecto para datos pareados.
  • No se modela la dependencia de agentes dentro de parejas interactivas.
  • No se comprueban normalidad, homocedasticidad, robustez o sensibilidad a la naturaleza acotada de las sumas BFI.
  • Se exploran decenas de categorías LIWC frente a grupos y cinco rasgos sin corrección integral por comparaciones múltiples.
  • Las tablas de correlación seleccionan los cinco coeficientes principales sin publicar la familia completa en el PDF.
  • Los p-valores no acompañan a las correlaciones seleccionadas en las tablas 4 y 7.
  • La correlación entre BFI y LIWC puede reflejar la separación binaria de prompts que determina ambos resultados.
  • No se valida LIWC 2007 para historias generadas que nombran explícitamente las instrucciones de personalidad.
  • No se incluyen jueces humanos de personalidad, calidad narrativa, naturalidad o alineación.
  • No se comparan prompts neutrales, descripciones sin Big Five, guiones humanos o reglas léxicas simples.
  • No hay condición analytical→analytical; el control de misma persona disponible es solo creative→creative.
  • La condición CREACREA presente en los datos no se describe ni analiza de forma transparente en el artículo principal.
  • El artículo no declara n directamente ni ofrece análisis de potencia o preregistro.
  • El código publicado usa el alias gpt-3.5-turbo, no el snapshot gpt-3.5-turbo-0613 declarado en el PDF.
  • El alias mutable puede haber apuntado a versiones diferentes según la fecha de ejecución.
  • El snapshot declarado fue retirado del API y ya no permite una repetición literal.
  • Los scripts actuales fijan subject_count en 10 o 1 y requieren edición manual para regenerar las 65 salidas por grupo.
  • No hay archivo de requisitos instalable, lockfile, contenedor o entorno automatizado; las versiones solo aparecen en README.
  • No se publican semillas, fechas exactas de ejecución, regiones, top-p o otros valores resueltos de los defaults del proveedor.
  • Los reintentos por formato y longitud se ejecutan hasta éxito sin registrar tasas de fallo ni candidatos descartados.
  • El filtrado por longitud y formato puede introducir selección no cuantificada.
  • El README recomienda borrar filas manualmente tras errores, lo que debilita la trazabilidad de generación.
  • El código solicita insertar una clave API en archivos y la imprime, una práctica insegura para reproducibilidad.
  • Las rutas y scripts requieren cambios manuales para alternar condiciones analíticas.
  • Los resultados procesados del repositorio no están vinculados a un pipeline único e inmutable que regenere cada tabla.
  • No se informan coste, latencia o número total de llamadas y reintentos.
  • No se evalúan otros idiomas, tareas, longitudes, dominios, modelos o interacciones humano-IA.
  • La sección ética identifica personalización maliciosa y contenido tóxico, pero no implementa salvaguardas técnicas.

Qué no demuestra

  • No demuestra que GPT-3.5 posea personalidad.
  • No demuestra que cada muestra estocástica sea un agente independiente comparable a una persona.
  • No valida los perfiles creative y analytical como tipos de personalidad humanos.
  • No identifica el efecto causal de cada rasgo Big Five por separado.
  • No establece fiabilidad o validez psicométrica de las respuestas BFI.
  • No demuestra personalidad implícita cuando los relatos nombran explícitamente los rasgos.
  • No separa estabilidad de personalidad de memoria conversacional y repetición de respuestas.
  • No separa alineación lingüística de copia literal del texto de la pareja.
  • No demuestra interacción recíproca o diálogo de varios turnos.
  • No prueba que creative se adapte causalmente más que analytical bajo un diseño simétrico completo.
  • No demuestra que la menor exactitud del clasificador represente conducta más humana.
  • No establece generalización a otros modelos, perfiles, idiomas o tareas.
  • No valida simulación de poblaciones humanas o conclusiones psicológicas sobre personas.
  • No evalúa eficacia, seguridad o beneficio en una aplicación real.
  • No ofrece hoy una reproducción exacta del experimento con el snapshot original disponible.

Trazabilidad

Alcance: Texto completo

Versión: ACL Anthology 2024.personalize-1.9; PERSONALIZE 2024; DOI 10.18653/v1/2024.personalize-1.9; CC BY 4.0

Fuente consultada: https://aclanthology.org/2024.personalize-1.9.pdf

Revisión: Codex full-text, visual, psychometric, statistical, code, data-integrity and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-3.5-turbo-0613 as declared in the paper
  • gpt-3.5-turbo mutable alias as used by the released code
  • Creative extreme Big Five prompted profile
  • Analytical extreme Big Five prompted profile
  • Stochastic outputs at temperature 0.7 treated as separate agents

Instrumentos y métricas

  • 44-item Big Five Inventory with 1–5 Likert responses
  • Creative and analytical five-trait persona prompts
  • Individual 800-word personal-story prompt with 500–900-word acceptance filter
  • One-way collaborative story prompt containing the partner's full response
  • LIWC 2007 English dictionary with 62 category counts
  • One-way ANOVA via scipy.stats.f_oneway
  • Pooled Cohen's d
  • Point-biserial and Spearman correlations
  • PCA visualization
  • Logistic regression with ten-fold cross-validation

Datos utilizados

  • Official 0_CONTROL dataset: 65 analytical and 65 creative outputs
  • Official 1_ANACREA dataset: 65 analytical-first and 65 creative-second outputs
  • Official 2_CREAANA dataset: 65 creative-first and 65 analytical-second outputs
  • Official 3_CREACREA dataset: two groups of 65 creative-profile outputs
  • LIWC count matrices, encoded prompts, BFI scores and published correlation outputs
  • Official Interaction_LLMs repository at ca6e117eb5a904fa97115f8845ef8b74aa461b8a

Evidencia y localización

  • Preguntas, alcance y resumen de resultados: PERSONALIZE 2024 paper, sections 1–2, pp. 102–103
  • Modelo, temperatura, snapshot y población por muestreo: PERSONALIZE 2024 paper, section 2.1 and footnote 2, p. 103
  • Prompts creative y analytical extremos: PERSONALIZE 2024 paper, section 2.2, p. 104 and Appendix A.1–A.2, p. 109
  • BFI-44 y sistema de puntuación: PERSONALIZE 2024 paper, section 2.3, p. 104 and Appendices A.4–A.6, pp. 109–110
  • Tareas individual e interactiva y filtro de longitud: PERSONALIZE 2024 paper, section 2.4 and footnote 5, p. 104; Appendix A.3, p. 109
  • Separación BFI inicial y desplazamiento tras escritura: PERSONALIZE 2024 paper, section 3.1.1, pp. 104–105; Tables 1–3, p. 110
  • Exactitud LIWC de 98,5 % y correlaciones sin interacción: PERSONALIZE 2024 paper, section 3.1.2 and Figure 2, p. 105; Table 4, p. 111
  • Resultados BFI después de interacción: PERSONALIZE 2024 paper, section 3.2.1, p. 105; Figure 4 and Tables 5–6, pp. 110–111
  • Exactitud de 66,15 %, convergencia LIWC y asimetría interpretada: PERSONALIZE 2024 paper, section 3.2.2 and Figure 3, p. 106; Table 7, p. 111
  • Limitaciones reconocidas y problemas de mención explícita: PERSONALIZE 2024 paper, Limitations, pp. 106–107
  • Riesgos y perfiles no humanos: PERSONALIZE 2024 paper, Ethical Considerations, pp. 107–108
  • Metadatos, DOI, páginas y licencia: ACL Anthology 2024.personalize-1.9 metadata; DOI 10.18653/v1/2024.personalize-1.9; CC BY 4.0
  • Código, alias del modelo, memoria, reintentos y análisis estadístico: Official Interaction_LLMs repository, commit ca6e117eb5a904fa97115f8845ef8b74aa461b8a, generation and plot_stats scripts
  • n=65 por etiqueta, menciones explícitas y copias exactas entre parejas: Official Interaction_LLMs repository data at commit ca6e117eb5a904fa97115f8845ef8b74aa461b8a; integrity audit 15 Jul 2026
  • Snapshot congelado del repositorio oficial: .cache/editorial-sources/article-073/supplements/audit/Interaction_LLMs-ca6e117eb5a904fa97115f8845ef8b74aa461b8a.tar.gz; sha256 81d2cb5a2328b5532c53532dd3861e2be5da20970736cd53b75a2651eb496817
  • Retirada del snapshot gpt-3.5-turbo-0613: OpenAI API deprecations: shutdown 13 Sep 2024; verified 15 Jul 2026