El estudio compara cómo un agente LLM expresa cada rasgo Big Five, inducido por un prompt explícito High o Low, en cuatro interacciones agente–agente: tres preguntas de ice-breaking, una disputa comprador–vendedor, una decisión conjunta sobre cinco obras que salvar de un incendio y un diálogo empático. En cada caso el Personality Agent conversa con un Generic Agent sin prompt de personalidad. El diseño cruza cinco rasgos, dos niveles y cuatro tareas, 40 condiciones conceptuales, pero el artículo no informa cuántas conversaciones se generaron por condición.
La manipulación no mide personalidad basal: el system prompt enumera adjetivos que definen directamente la salida esperada. High Extraversion incluye “outgoing, sociable, energetic, talkative, assertive, enthusiastic”; Low incluye “reserved, quiet, solitary, passive, withdrawn, subdued”, y se hace lo mismo con Agreeableness, Conscientiousness, Neuroticism y Openness. El estudio pregunta si la fuerza y forma de esa actuación cambia por contexto, no si el modelo posee rasgos estables.
Se usan cuatro familias de medidas. LIWC cuantifica rasgos léxicos seleccionados previamente porque una meta-análisis humano los relaciona con Big Five. Un clasificador BERT+rasgos psicolingüísticos convierte utterances en etiquetas binarias de rasgo. Un LLM juez, instruido como “expert personality psychologist”, puntúa cada conversación 1–5 con definiciones de rasgo muy parecidas a las usadas para generarla. Otro evaluador LLM asigna valencia y arousal. En negociación se mide acuerdo y reducción desde una petición inicial de reembolso del 100 %; en supervivencia se mide acuerdo y Sum of Rank Differences respecto al ranking inicial.
Los promedios LIWC de todas las features elegidas siguen la dirección humana prevista. Por ejemplo, High Extraversion produce más palabras por frase; High Agreeableness más positive-emotion words y menos swear/anger; High Neuroticism produce más negative-emotion, “I” y pronouns que Low. Sin embargo, la tabla solo presenta medias: no ofrece n, dispersión, intervalos o tests. Como las features fueron seleccionadas por su dirección esperada, el resultado es una comprobación descriptiva condicionada por selección, no una validación independiente del constructo.
El clasificador preentrenado reconoce varios contrastes, pero no todos y con fuerte dependencia de tarea. En ice-breaking, por ejemplo, algunos traits reciben 100 % tanto en High como en Low, mientras otros se separan. No se identifica el checkpoint, corpus de entrenamiento, threshold, unidad estadística o calibración para este dominio conversacional. El clasificador original se cita, pero el artículo no explica cómo se trasladó de su dominio a utterances de diálogo ni cómo se trataron múltiples turnos del mismo agente.
El juez LLM muestra la separación más fuerte en ice-breaking: diferencias High–Low de 2,00 para Openness, 3,00 Conscientiousness, 3,56 Extraversion, 3,30 Agreeableness y 2,00 Neuroticism. En negociación las diferencias son 0,30, 0,50, 2,18, 3,90 y 0,70; en supervivencia 1,10, 0,70, 1,10, 2,90 y 1,62; en empatía 0,11, 0,00, 1,10, 0,80 y 0,00. Por tanto, la modulación contextual es heterogénea: Agreeableness se separa más en la negociación competitiva que en cualquier contexto cooperativo, mientras Conscientiousness y Neuroticism desaparecen en empatía.
La Figura 3 anota p<.001 para los cinco rasgos de ice-breaking y supervivencia; negociación reporta p=.135, .015, <.001, <.001 y .010, y empatía p=.947 para Openness, <.001 para Extraversion y .037 para Agreeableness, con igualdad visible en Conscientiousness y Neuroticism. El texto resume p<.001 “across most traits”, pero no especifica test, hipótesis, tamaño de muestra, independencia, corrección por 20 comparaciones, estimador, varianza o intervalo. Es imposible auditar la significación o saber si turnos del mismo diálogo fueron tratados como observaciones independientes.
La emoción también varía por tarea: ice-breaking se concentra en valencia positiva/arousal alto; negociación en valencia negativa/arousal moderado-alto; supervivencia es mixta; empatía muestra valencia positiva y arousal bajo. Pero esos tonos estaban incorporados al diseño: Table 1 define de antemano ice-breaking como joy, negociación como anger y empatía como sadness, y los prompts contienen escenarios con esas cargas. Sin una condición contrafactual dentro de cada tarea, el análisis muestra que el contenido del escenario induce tono, no que una personalidad se adapte funcionalmente.
Los resultados conductuales son descriptivos y pequeños. En negociación, los acuerdos High/Low son: Openness 0/0 %, Conscientiousness 10/0, Extraversion 10/20, Agreeableness 20/0 y Neuroticism 0/10. En supervivencia son 90/50, 50/60, 80/40, 90/70 y 90/30. Los saltos de diez puntos son compatibles con un denominador de diez, pero el paper nunca declara ese n y no debe inferirse como muestra confirmada. Varios contrastes van contra una lectura uniforme: Low Extraversion supera High en negociación; Low Conscientiousness supera High en supervivencia; High Neuroticism alcanza 90 % de acuerdo en supervivencia.
Las curvas sugieren que High Agreeableness concede más de 40 % al final de negociación, Low Agreeableness y High Neuroticism permanecen por debajo de 10 % durante gran parte del diálogo, y Openness/Extraversion convergen cerca de 20–25 %. En supervivencia, High Agreeableness y High Openness alcanzan SRD aproximado 6–7 frente a menos de 3 para Low. No se muestran errores, distribución de runs, tests o datos crudos. SRD mide cuánto cambia un ranking, no si el cambio es correcto, cooperativo o mejora el resultado; refund concession tampoco separa cooperación de abandono de objetivos.
El artículo interpreta el patrón mediante Whole Trait Theory: las expresiones serían estados modulados por metas y afecto, no reproducciones fijas. Esa es una analogía teórica plausible, pero el experimento no prueba los mecanismos de Whole Trait Theory, distribuciones intraindividuales, goals, beliefs, affect o procesos causales. Las cuatro tareas cambian simultáneamente contenido, rol, objetivo, cooperación, emoción, longitud y estructura. No hay humanos, modelo sin personalidad emparejado como outcome, tareas equivalentes con una sola variable contextual, ni criterio de adaptación exitosa. El propio cierre reconoce que falta determinar si el cambio es funcionalmente adaptativo como en personas.
El reporte de reproducibilidad es insuficiente incluso en la versión publicada en LaCATODA@AAAI 2026. No identifica el modelo generador, el Generic Agent, el juez de personalidad o el juez emocional; tampoco API/proveedor, versión, temperatura, top-p, seeds, número de turnos, stopping, retries, orden, muestras o coste. El TeX de arXiv contiene una footnote comentada, no visible ni publicada, que dice “gpt-4o-mini-2024-07-18”; es una pista del entorno de generación, no evidencia suficiente para asignar ese modelo a todos los roles. No se enlazan código, diálogos, scores o scripts, y una búsqueda dirigida no localizó un artefacto público.
La versión CEUR añade venue, licencia CC BY 4.0, financiación AFOSR y una declaración de que ChatGPT solo ayudó con gramática, sentence polishing y rephrasing, no con razonamiento o resultados. Los resultados sustantivos son los mismos que en arXiv v1. La contribución defendible es un estudio exploratorio que muestra que el mismo prompt de rasgo produce lenguaje, evaluaciones y decisiones diferentes cuando cambia toda la tarea social. No establece personalidad sintética profunda, adaptación equivalente a la humana, coherencia causal entre emoción y conducta ni robustez en modelos distintos.