Personality Expression Across Contexts: Linguistic and Behavioral Variation in LLM Agents

Evaluación y validez psicométrica2026arXivRevisión editorial aprobada

Autores: Bin Han, Deuksin Kwon, Jonathan Gratch

Palabras clave: Large Language Models, Personality, Persona, Personality Control, AI Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
10
Hallazgos
38
Limitaciones
11
Evidencias

Resumen editorial

Español

El estudio compara cómo un agente LLM expresa cada rasgo Big Five, inducido por un prompt explícito High o Low, en cuatro interacciones agente–agente: tres preguntas de ice-breaking, una disputa comprador–vendedor, una decisión conjunta sobre cinco obras que salvar de un incendio y un diálogo empático. En cada caso el Personality Agent conversa con un Generic Agent sin prompt de personalidad. El diseño cruza cinco rasgos, dos niveles y cuatro tareas, 40 condiciones conceptuales, pero el artículo no informa cuántas conversaciones se generaron por condición.

La manipulación no mide personalidad basal: el system prompt enumera adjetivos que definen directamente la salida esperada. High Extraversion incluye “outgoing, sociable, energetic, talkative, assertive, enthusiastic”; Low incluye “reserved, quiet, solitary, passive, withdrawn, subdued”, y se hace lo mismo con Agreeableness, Conscientiousness, Neuroticism y Openness. El estudio pregunta si la fuerza y forma de esa actuación cambia por contexto, no si el modelo posee rasgos estables.

Se usan cuatro familias de medidas. LIWC cuantifica rasgos léxicos seleccionados previamente porque una meta-análisis humano los relaciona con Big Five. Un clasificador BERT+rasgos psicolingüísticos convierte utterances en etiquetas binarias de rasgo. Un LLM juez, instruido como “expert personality psychologist”, puntúa cada conversación 1–5 con definiciones de rasgo muy parecidas a las usadas para generarla. Otro evaluador LLM asigna valencia y arousal. En negociación se mide acuerdo y reducción desde una petición inicial de reembolso del 100 %; en supervivencia se mide acuerdo y Sum of Rank Differences respecto al ranking inicial.

Los promedios LIWC de todas las features elegidas siguen la dirección humana prevista. Por ejemplo, High Extraversion produce más palabras por frase; High Agreeableness más positive-emotion words y menos swear/anger; High Neuroticism produce más negative-emotion, “I” y pronouns que Low. Sin embargo, la tabla solo presenta medias: no ofrece n, dispersión, intervalos o tests. Como las features fueron seleccionadas por su dirección esperada, el resultado es una comprobación descriptiva condicionada por selección, no una validación independiente del constructo.

El clasificador preentrenado reconoce varios contrastes, pero no todos y con fuerte dependencia de tarea. En ice-breaking, por ejemplo, algunos traits reciben 100 % tanto en High como en Low, mientras otros se separan. No se identifica el checkpoint, corpus de entrenamiento, threshold, unidad estadística o calibración para este dominio conversacional. El clasificador original se cita, pero el artículo no explica cómo se trasladó de su dominio a utterances de diálogo ni cómo se trataron múltiples turnos del mismo agente.

El juez LLM muestra la separación más fuerte en ice-breaking: diferencias High–Low de 2,00 para Openness, 3,00 Conscientiousness, 3,56 Extraversion, 3,30 Agreeableness y 2,00 Neuroticism. En negociación las diferencias son 0,30, 0,50, 2,18, 3,90 y 0,70; en supervivencia 1,10, 0,70, 1,10, 2,90 y 1,62; en empatía 0,11, 0,00, 1,10, 0,80 y 0,00. Por tanto, la modulación contextual es heterogénea: Agreeableness se separa más en la negociación competitiva que en cualquier contexto cooperativo, mientras Conscientiousness y Neuroticism desaparecen en empatía.

La Figura 3 anota p<.001 para los cinco rasgos de ice-breaking y supervivencia; negociación reporta p=.135, .015, <.001, <.001 y .010, y empatía p=.947 para Openness, <.001 para Extraversion y .037 para Agreeableness, con igualdad visible en Conscientiousness y Neuroticism. El texto resume p<.001 “across most traits”, pero no especifica test, hipótesis, tamaño de muestra, independencia, corrección por 20 comparaciones, estimador, varianza o intervalo. Es imposible auditar la significación o saber si turnos del mismo diálogo fueron tratados como observaciones independientes.

La emoción también varía por tarea: ice-breaking se concentra en valencia positiva/arousal alto; negociación en valencia negativa/arousal moderado-alto; supervivencia es mixta; empatía muestra valencia positiva y arousal bajo. Pero esos tonos estaban incorporados al diseño: Table 1 define de antemano ice-breaking como joy, negociación como anger y empatía como sadness, y los prompts contienen escenarios con esas cargas. Sin una condición contrafactual dentro de cada tarea, el análisis muestra que el contenido del escenario induce tono, no que una personalidad se adapte funcionalmente.

Los resultados conductuales son descriptivos y pequeños. En negociación, los acuerdos High/Low son: Openness 0/0 %, Conscientiousness 10/0, Extraversion 10/20, Agreeableness 20/0 y Neuroticism 0/10. En supervivencia son 90/50, 50/60, 80/40, 90/70 y 90/30. Los saltos de diez puntos son compatibles con un denominador de diez, pero el paper nunca declara ese n y no debe inferirse como muestra confirmada. Varios contrastes van contra una lectura uniforme: Low Extraversion supera High en negociación; Low Conscientiousness supera High en supervivencia; High Neuroticism alcanza 90 % de acuerdo en supervivencia.

Las curvas sugieren que High Agreeableness concede más de 40 % al final de negociación, Low Agreeableness y High Neuroticism permanecen por debajo de 10 % durante gran parte del diálogo, y Openness/Extraversion convergen cerca de 20–25 %. En supervivencia, High Agreeableness y High Openness alcanzan SRD aproximado 6–7 frente a menos de 3 para Low. No se muestran errores, distribución de runs, tests o datos crudos. SRD mide cuánto cambia un ranking, no si el cambio es correcto, cooperativo o mejora el resultado; refund concession tampoco separa cooperación de abandono de objetivos.

El artículo interpreta el patrón mediante Whole Trait Theory: las expresiones serían estados modulados por metas y afecto, no reproducciones fijas. Esa es una analogía teórica plausible, pero el experimento no prueba los mecanismos de Whole Trait Theory, distribuciones intraindividuales, goals, beliefs, affect o procesos causales. Las cuatro tareas cambian simultáneamente contenido, rol, objetivo, cooperación, emoción, longitud y estructura. No hay humanos, modelo sin personalidad emparejado como outcome, tareas equivalentes con una sola variable contextual, ni criterio de adaptación exitosa. El propio cierre reconoce que falta determinar si el cambio es funcionalmente adaptativo como en personas.

El reporte de reproducibilidad es insuficiente incluso en la versión publicada en LaCATODA@AAAI 2026. No identifica el modelo generador, el Generic Agent, el juez de personalidad o el juez emocional; tampoco API/proveedor, versión, temperatura, top-p, seeds, número de turnos, stopping, retries, orden, muestras o coste. El TeX de arXiv contiene una footnote comentada, no visible ni publicada, que dice “gpt-4o-mini-2024-07-18”; es una pista del entorno de generación, no evidencia suficiente para asignar ese modelo a todos los roles. No se enlazan código, diálogos, scores o scripts, y una búsqueda dirigida no localizó un artefacto público.

La versión CEUR añade venue, licencia CC BY 4.0, financiación AFOSR y una declaración de que ChatGPT solo ayudó con gramática, sentence polishing y rephrasing, no con razonamiento o resultados. Los resultados sustantivos son los mismos que en arXiv v1. La contribución defendible es un estudio exploratorio que muestra que el mismo prompt de rasgo produce lenguaje, evaluaciones y decisiones diferentes cuando cambia toda la tarea social. No establece personalidad sintética profunda, adaptación equivalente a la humana, coherencia causal entre emoción y conducta ni robustez en modelos distintos.

English

The study compares how an LLM agent expresses each Big Five trait, explicitly prompted High or Low, across four agent–agent interactions: three ice-breaking questions, a buyer–seller dispute, a joint decision about five artworks to save from a fire, and an empathetic dialogue. In every case the Personality Agent interacts with a Generic Agent without a personality prompt. The design crosses five traits, two levels, and four tasks, 40 conceptual conditions, but the paper does not report how many conversations were generated per condition.

This manipulation does not measure baseline personality: the system prompt directly lists adjectives defining the expected output. High Extraversion includes “outgoing, sociable, energetic, talkative, assertive, enthusiastic,” while Low includes “reserved, quiet, solitary, passive, withdrawn, subdued”; analogous lists define Agreeableness, Conscientiousness, Neuroticism, and Openness. The study asks whether the strength and form of this performance vary by context, not whether the model possesses stable traits.

Four measurement families are used. LIWC quantifies lexical features preselected because a human meta-analysis links them to Big Five. A BERT-plus-psycholinguistic-feature classifier maps utterances to binary trait labels. An LLM judge, prompted as an “expert personality psychologist,” rates each conversation from 1–5 using trait definitions closely overlapping the generation prompts. Another LLM evaluator assigns valence and arousal. Negotiation behavior uses agreement and reduction from an initial 100% refund request; survival uses agreement and Sum of Rank Differences from the initial ranking.

Means for every selected LIWC feature follow the expected human direction. High Extraversion, for example, produces more words per sentence; High Agreeableness more positive-emotion words and less swearing/anger; High Neuroticism produces more negative-emotion words, “I,” and pronouns than Low. The table reports means only, no n, dispersion, intervals, or tests. Because features were selected for their expected direction, this is a selection-conditioned descriptive check rather than independent construct validation.

The pretrained classifier recognizes several contrasts but not all and varies strongly by task. In ice-breaking, some traits receive 100% for both High and Low while others separate. The paper does not identify a checkpoint, training corpus, threshold, statistical unit, or calibration for conversational data. It cites the original classifier but does not explain domain transfer to dialogue utterances or dependence among turns from the same agent.

The LLM judge shows strongest separation in ice-breaking: High–Low differences are 2.00 Openness, 3.00 Conscientiousness, 3.56 Extraversion, 3.30 Agreeableness, and 2.00 Neuroticism. Negotiation differences are 0.30, 0.50, 2.18, 3.90, and 0.70; survival 1.10, 0.70, 1.10, 2.90, and 1.62; empathy 0.11, 0.00, 1.10, 0.80, and 0.00. Context modulation is therefore heterogeneous: Agreeableness separates more in competitive negotiation than in any cooperative context, while Conscientiousness and Neuroticism disappear in empathy.

Figure 3 marks p<.001 for all five ice-breaking and survival traits; negotiation reports p=.135, .015, <.001, <.001, and .010, while empathy reports p=.947 for Openness, <.001 for Extraversion, and .037 for Agreeableness, with visible equality for Conscientiousness and Neuroticism. The prose summarizes p<.001 “across most traits,” but names no test, hypothesis, sample size, independence assumption, correction across 20 comparisons, estimator, variance, or interval. Significance cannot be audited, and it is unknown whether turns from one dialogue were treated as independent.

Emotion varies by task: ice-breaking clusters at positive valence/high arousal, negotiation at negative valence/moderate-to-high arousal, survival is mixed, and empathy has positive valence/low arousal. Yet these tones are built into the design: Table 1 prelabels ice-breaking as joy, negotiation as anger, and empathy as sadness, and the scenarios contain those affective cues. Without within-task counterfactuals, this shows that scenario content induces tone, not that personality adapts functionally.

Behavioral results are descriptive and apparently small. Negotiation High/Low agreement rates are Openness 0/0%, Conscientiousness 10/0, Extraversion 10/20, Agreeableness 20/0, and Neuroticism 0/10. Survival rates are 90/50, 50/60, 80/40, 90/70, and 90/30. Ten-point steps are compatible with a denominator of ten, but the paper never reports that n and it cannot be treated as confirmed. Several contrasts resist a uniform reading: Low Extraversion beats High in negotiation, Low Conscientiousness beats High in survival, and High Neuroticism reaches 90% agreement in survival.

Curves suggest High Agreeableness concedes over 40% by the end of negotiation; Low Agreeableness and High Neuroticism stay below 10% for much of the dialogue; Openness/Extraversion converge near 20–25%. In survival, High Agreeableness and High Openness reach SRD around 6–7 versus below 3 for Low. No error bands, run distributions, tests, or raw data are shown. SRD measures movement from a ranking, not whether the movement is correct, cooperative, or beneficial; refund concession likewise does not separate cooperation from goal abandonment.

The paper interprets the pattern through Whole Trait Theory: expression is a state modulated by goals and affect rather than a fixed reproduction. This is a plausible analogy, but the experiment does not test Whole Trait mechanisms, within-person state distributions, goals, beliefs, affect, or causal processes. The four tasks simultaneously change content, role, objective, cooperation, emotion, length, and structure. There are no human comparisons, matched no-personality outcome controls, equivalent tasks varying one contextual factor, or adaptation-success criterion. The conclusion itself acknowledges that functional adaptation comparable to humans remains untested.

Reproducibility reporting is inadequate even in the LaCATODA@AAAI 2026 proceedings version. It identifies neither the generator model, Generic Agent, personality judge, nor emotion judge, and gives no API/provider, version, temperature, top-p, seeds, turn count, stopping, retries, ordering, sample counts, or cost. The arXiv TeX contains a commented, non-rendered footnote saying “gpt-4o-mini-2024-07-18”; this is a clue about the generation environment, not sufficient evidence to assign that model to every role. No code, dialogues, scores, or scripts are linked, and a targeted search found no public artifact.

The CEUR version adds venue, CC BY 4.0 licensing, AFOSR funding, and a declaration that ChatGPT was used only for grammar checking, sentence polishing, and rephrasing, not reasoning or results. Substantive results match arXiv v1. The defensible contribution is an exploratory demonstration that the same trait prompt yields different language, judge ratings, and decisions when the entire social task changes. It does not establish deep synthetic personality, human-equivalent adaptation, causal coherence between emotion and behavior, or robustness across models.

Pregunta de investigación

¿Cómo cambia la expresión lingüística, emocional y conductual de prompts Big Five High/Low entre ice-breaking, negociación, decisión grupal y empatía, y aparecen esos cambios en acuerdo y concesión además del estilo?

Método

Diseño agente–agente con un Personality Agent y un Generic Agent. Se cruzan cinco rasgos Big Five, dos niveles promptados y cuatro tareas sociales. LIWC y un clasificador BERT evalúan lenguaje; dos jueces LLM no identificados evalúan Big Five y valencia/arousal; acuerdo, refund concession y SRD describen conducta. La auditoría revisa arXiv v1, las 13 páginas oficiales de LaCATODA 2026, el TeX fuente y la ausencia de artefacto reproducible.

Muestra: Cuarenta celdas conceptuales: 5 rasgos × 2 niveles × 4 tareas. El número de diálogos, utterances y runs por celda no se informa. Agreement aparece en incrementos de 10 puntos, compatibles con, pero no prueba de, diez ejecuciones. Tampoco se informa el número de turnos por tarea salvo tres preguntas ice-breaking y cinco ítems de ranking en supervivencia.

Hallazgos

  • Todas las features LIWC preseleccionadas siguen la dirección Big Five esperada en los promedios publicados.
  • El clasificador preentrenado reconoce algunas condiciones High/Low, pero presenta techos, empates y variación fuerte por tarea.
  • El juez LLM separa más los traits en ice-breaking y menos en empatía, con patrones específicos por rasgo.
  • Agreeableness mantiene separación alta también en negociación, de modo que cooperativo versus competitivo no resume todos los resultados.
  • Ice-breaking muestra afecto más positivo/activado, negociación más negativo/activado, supervivencia mixto y empatía positivo/calmado.
  • High Agreeableness alcanza 20% de acuerdo en negociación frente a 0% Low y concede más de 40% al final.
  • En supervivencia, High Openness, Extraversion, Agreeableness y Neuroticism superan a Low en acuerdo; Conscientiousness no.
  • High Agreeableness y High Openness modifican más su ranking en supervivencia que sus condiciones Low.
  • No hay evidencia suficiente para verificar p-values, tamaño de muestra o incertidumbre conductual.
  • La versión publicada no identifica los LLM ni publica un pipeline reproducible.

Limitaciones

  • Los prompts definen la conducta esperada con adjetivos explícitos; evalúan seguimiento de instrucciones.
  • No hay condición sin personalidad emparejada como outcome del Personality Agent, solo un partner genérico.
  • Cada contexto cambia a la vez contenido, rol, meta, cooperación, emoción, estructura y duración.
  • No se aísla qué cue contextual causa cada cambio.
  • El Generic Agent puede adaptarse al Personality Agent y mediar el resultado.
  • No se informa identidad o versión del modelo generador.
  • No se informa si personalidad y Generic Agent usan el mismo modelo o system prompt base.
  • No se identifican los dos jueces LLM ni se separan del generador.
  • No se reportan API, proveedor, fecha de snapshot, temperatura, top-p, seeds o sampling.
  • No se reportan número de diálogos, utterances, turnos, runs, retries o fallos.
  • El denominador de las tasas de acuerdo no se declara.
  • La unidad de análisis de cada p-value no se declara.
  • No se especifica el test estadístico usado en Figure 3.
  • No hay corrección por las 20 comparaciones rasgo×tarea.
  • No se muestran intervalos, effect sizes, desviaciones o error bars.
  • Los turnos dentro de un diálogo no son independientes si se usan como observaciones.
  • Las features LIWC se seleccionan por concordar con asociaciones previas.
  • Table 2 solo publica medias y no prueba diferencias contextuales.
  • Las asociaciones LIWC humanas no validan automáticamente texto generado por un LLM.
  • El checkpoint, threshold y calibración del clasificador BERT no se reportan.
  • El dominio del clasificador preentrenado no se valida sobre estos diálogos.
  • El juez de personalidad recibe rubricas solapadas con los adjetivos de generación, creando circularidad.
  • No hay evaluación humana ciega ni acuerdo inter-rater para personality/emotion scores.
  • El juez emocional puede reflejar palabras del escenario en vez de un estado del agente.
  • Los contextos fueron diseñados con emociones dominantes antes de medir valencia/arousal.
  • Agreement binario con pocos casos es inestable y no se acompaña de incertidumbre.
  • Concession puede indicar cooperación, capitulación o pérdida de objetivo.
  • SRD mide cambio de ranking, no calidad, consenso causal ni beneficio.
  • Algunos resultados contradicen una narrativa simple: Low Extraversion negocia más acuerdos y Low Conscientiousness supera High en supervivencia.
  • High Neuroticism alcanza 90% de acuerdo en supervivencia pese a describirse como inestable.
  • No hay comparación con conversaciones humanas ni densidades de estados humanos.
  • No se manipulan goals, beliefs o affect como mecanismos de Whole Trait Theory.
  • No se evalúa estabilidad media dentro de persona a lo largo del tiempo.
  • No existe criterio externo de que el cambio sea funcionalmente adaptativo.
  • Solo se estudian cuatro tareas artificiales y un entorno self-play.
  • La generalización a usuarios, idiomas, culturas, modelos y despliegues no se prueba.
  • La footnote gpt-4o-mini está comentada y no forma parte del reporte publicado.
  • No hay código, datos, prompts completos de tareas, outputs o scripts públicos enlazados.

Qué no demuestra

  • No establece que el modelo posea rasgos Big Five internos o una personalidad humana.
  • No distingue adaptación contextual de obediencia al escenario y al prompt.
  • No demuestra que la variación sea funcionalmente adaptativa o beneficiosa.
  • No prueba los mecanismos causales de Whole Trait Theory.
  • No demuestra coherencia general entre lenguaje, emoción y conducta en todos los rasgos.
  • No valida los jueces LLM o el clasificador como medidas psicométricas para este dominio.
  • No permite verificar la significación estadística sin n, test y datos.
  • No permite reproducir los resultados con la información y artefactos publicados.
  • No muestra robustez entre modelos, seeds, prompts alternativos o partners distintos.
  • No generaliza a interacción humano–agente real.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2602.01063v1, submitted 1 February 2026, 9 pages; also published in LaCATODA@AAAI 2026, CEUR-WS Vol. 4178, pp. 1–13, CC BY 4.0

Fuente consultada: https://arxiv.org/pdf/2602.01063v1

Revisión: Codex full-text, bilingual-fidelity, arXiv-v1, 9-page visual, LaCATODA-2026, 13-page visual, TeX-source, missing-model, missing-sample, statistical-reporting, LIWC-selection, classifier-domain, LLM-judge-circularity, emotion-confound, behavior, Whole-Trait and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Generator LLM not reported in the published paper
  • Generic-agent LLM not reported
  • LLM personality judge not reported
  • LLM valence-arousal judge not reported
  • gpt-4o-mini-2024-07-18 appears only in a commented, non-rendered arXiv TeX footnote and is not treated as confirmed
  • BERT-plus-psycholinguistic-feature Big Five classifier from Kazameini et al. 2020; exact checkpoint not reported

Instrumentos y métricas

  • Explicit High/Low Big Five adjective prompts
  • LIWC 2015 lexical categories selected from a prior human meta-analysis
  • Pretrained BERT plus psycholinguistic Big Five binary classifier
  • Context-aware LLM Big Five judge on a 1–5 scale
  • LLM valence-arousal emotion evaluation
  • Agreement rate
  • Negotiation concession as 100% minus refund offer
  • Survival-task Sum of Rank Differences across five items

Datos utilizados

  • Personal Questions paradigm, three ice-breaking questions
  • KODIS-inspired buyer-seller refund and negative-review dispute
  • Save-the-Art survival task reduced from 15 to five artworks with opposite initial rankings
  • Empathetic Dialogues-inspired emotionally charged statement and support response
  • No generated dialogues, score tables, scripts or run-level data released

Evidencia y localización

  • Metadatos, v1 e historial: Official arXiv:2602.01063v1 page, submitted 1 February 2026
  • Publicación, venue, licencia y páginas: CEUR-WS Vol. 4178, paper 1, LaCATODA@AAAI 2026, pp. 1–13, published 4 March 2026, CC BY 4.0
  • Diseño, prompts y cuatro tareas: Proceedings paper, pp. 2–5, Sections 2–4 and Appendix A
  • LIWC, classifier, LLM judges and behavior metrics: Proceedings paper, pp. 4–6, Section 4.4
  • Personality and emotion results: Proceedings paper, pp. 6–8, Figures 2–5 and Sections 5.1–5.5
  • Agreement and concession results: Proceedings paper, pp. 8–9, Table 3, Figure 6 and Section 6
  • Interpretation and explicit caveat on functional adaptation: Proceedings paper, p. 10, Sections 7–8
  • Funding and generative-AI declaration: Proceedings paper, pp. 10–11
  • Non-rendered gpt-4o-mini clue: Official arXiv TeX source, sample-1col.tex line 191; commented footnote excluded from the paper
  • No linked public artifact: Official arXiv and CEUR records plus targeted title/author GitHub search, audited 15 July 2026
  • Inspección visual integral: All 9 arXiv pages and all 13 CEUR proceedings pages rendered and visually reviewed