Can LLMs Generate Behaviors for Embodied Virtual Agents Based on Personality Traits?

Personas, identidad y agentes2025arXivRevisión editorial aprobada

Autores: Bin Han, Deuksin Kwon, Spencer Lin, Kaleen Shrestha, Jonathan Gratch

Palabras clave: Human-Computer Interaction, Large Language Models, Virtual Agents, Personality Traits, Extraversion

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
15
Hallazgos
45
Limitaciones
16
Evidencias

Resumen editorial

Español

El trabajo construye un agente virtual encarnado que utiliza GPT-4o-mini-2024-07-18 para generar diálogo y seleccionar comportamientos no verbales asociados a extraversión o introversión. El modelo recibe una definición de personalidad, el contexto de negociación o conversación para romper el hielo y una lista cerrada de acciones faciales, corporales y vocales. No genera movimiento desde cero: escoge etiquetas y descripciones que se ejecutan en Unity mediante un personaje masculino de Reallusion, expresiones SALSA, animaciones de Mixamo/Reallusion y voces de ElevenLabs. Un GPT también describe previamente los clips disponibles. Las voces Eric y Brian se asignan respectivamente a los agentes extrovertido e introvertido después de un piloto con 15 personas, de modo que voz, longitud verbal, gesto y personalidad cambian conjuntamente.

El Experimento 1 ejecuta diez conversaciones por escenario. En negociación se permiten hasta diez turnos y en ice-breaking hasta ocho. LIWC 2015 muestra 15 categorías diferentes en negociación y 11 en ice-breaking después de que los autores retengan únicamente diferencias con p<0,05 y d de Cohen>0,5. Los agentes extrovertidos generan más palabras: 90,58 frente a 56,30 en ice-breaking y 56,32 frente a 41,46 en negociación, con p<0,001. Un clasificador de personalidad basado en BERT ofrece una validación desigual: en negociación clasifica como extrovertidas el 68 % de las intervenciones de ambos agentes y la diferencia entre condiciones no es significativa (χ²=2,65; p=0,10); en ice-breaking clasifica así el 97,5 % de las intervenciones extrovertidas y el 50 % de las introvertidas (χ²=20,92; p<0,001). Las figuras no verbales siguen en general los estereotipos incorporados a la lista: más mirada, sonrisa, gesto amplio, volumen alto y velocidad rápida para extraversión; más evitación de mirada, gesto estrecho, volumen bajo y ritmo lento para introversión. No se aplican pruebas inferenciales a esas probabilidades.

El Experimento 2 presenta vídeos pregrabados a 30 participantes de Prolific, 17 mujeres y 13 hombres, asignados a negociación o ice-breaking. Cada participante compara agentes extrovertido e introvertido y responde sobre extraversión percibida y señales influyentes; su propia extraversión se estima con los dos ítems correspondientes del BFI-10. El efecto principal del tipo de agente es claro en las medias mostradas: los agentes extrovertidos reciben entre 4,8 y 6,0 puntos y los introvertidos entre 3,4 y 3,9 en una escala de siete puntos; el artículo informa F=44,57 y p<0,001. El contexto no alcanza significación (p=0,086). Los participantes atribuyen mayor influencia a lo verbal que a lo no verbal, 60 % para el agente extrovertido y 63,3 % para el introvertido, y la mayoría considera los comportamientos coherentes: 66,7–93,3 % responde «sí» para lo no verbal y 73,3 % para lo verbal; nadie responde «no».

Esta evidencia demuestra reconocibilidad de dos presentaciones deliberadamente contrastadas, no que el LLM haya descubierto o mantenido una personalidad psicológica general. Los prompts, la longitud de respuesta, la voz, las animaciones y las etiquetas de acción están diseñados para maximizar señales estereotípicas y no se aíslan mediante ablaciones. El estudio no incluye condición solo verbal, solo no verbal, sin personalidad, guion humano o agente no encarnado. Ver dos condiciones puede además revelar la hipótesis a los participantes. Las unidades del Experimento 1 son intervenciones anidadas en apenas diez diálogos por escenario, pero se analizan con t-tests sin modelar dependencia; se filtran categorías LIWC significativas sin corrección por comparaciones múltiples. En el estudio humano faltan potencia, randomización y orden, grados de libertad, tamaños de efecto y detalles de exclusión. El dato F=2,99 con p=0,622 para versión de vídeo es internamente inverosímil y no puede verificarse con los datos ausentes.

No se enlazan código, prompts, vídeos, cuestionario completo, datos, animaciones derivadas, plan analítico o registro ético, y una búsqueda dirigida no localizó un repositorio oficial. El artículo tampoco informa aprobación ética o consentimiento, pese al estudio humano, ni analiza riesgos de estereotipar introversión/extraversión o de aplicar estos agentes en terapia, mencionada solo como futuro posible. La contribución defendible es un prototipo multimodal y evidencia inicial de que observadores distinguen dos configuraciones audiovisuales muy contrastadas, especialmente en un contexto social informal. No prueba generalización a otros rasgos, agentes, modelos, voces, cuerpos, culturas, tareas o interacción en tiempo real.

English

The work builds an embodied virtual agent that uses GPT-4o-mini-2024-07-18 to generate dialogue and select nonverbal behaviors associated with extraversion or introversion. The model receives a personality definition, a negotiation or ice-breaking context, and a closed list of facial, bodily, and vocal actions. It does not generate motion from scratch: it selects labels and descriptions executed in Unity with a male Reallusion character, SALSA expressions, Mixamo/Reallusion animations, and ElevenLabs voices. A GPT also describes the available clips offline. Eric and Brian voices are assigned to the extraverted and introverted agents after a 15-person pilot, so voice identity, utterance length, gesture, and personality change together.

Experiment 1 runs ten conversations per scenario, with up to ten negotiation turns and eight ice-breaking turns. LIWC 2015 yields 15 differing categories in negotiation and 11 in ice-breaking after the authors retain only differences with p<.05 and Cohen's d>.5. Extraverted agents produce more words: 90.58 versus 56.30 in ice-breaking and 56.32 versus 41.46 in negotiation, with p<.001. A BERT-based personality classifier provides mixed validation. In negotiation, it classifies 68% of utterances from both agents as extraverted and the condition difference is not significant (χ²=2.65, p=.10). In ice-breaking, it classifies 97.5% of extraverted-agent and 50% of introverted-agent utterances as extraverted (χ²=20.92, p<.001). Nonverbal plots largely follow the stereotypes encoded in the action list: more gaze, smiling, wide gestures, loud volume, and fast pace for extraversion; more averted gaze, narrow gestures, low volume, and slow pace for introversion. No inferential tests are reported for those probabilities.

Experiment 2 shows recorded videos to 30 Prolific participants, 17 women and 13 men, assigned to negotiation or ice-breaking. Each participant compares extraverted and introverted agents and reports perceived extraversion and influential cues; their own extraversion is estimated using the two relevant BFI-10 items. The displayed means show a clear agent-type effect: extraverted agents receive 4.8–6.0 and introverted agents 3.4–3.9 on a seven-point scale; the paper reports F=44.57 and p<.001. Scenario does not reach significance (p=.086). Participants attribute more influence to verbal than nonverbal behavior, 60% for the extraverted agent and 63.3% for the introverted agent, and most judge behavior consistent: 66.7–93.3% answer yes for nonverbal and 73.3% for verbal behavior; nobody answers no.

This evidence shows recognizability of two deliberately contrasted presentations, not that an LLM discovered or maintained a general psychological personality. Prompts, response length, voice, animations, and action labels are designed to maximize stereotypical cues and are not isolated through ablations. There is no verbal-only, nonverbal-only, no-personality, human-script, or disembodied baseline. Seeing both conditions may also disclose the hypothesis. Experiment 1 utterances are nested within only ten dialogues per scenario but are analyzed with t-tests that do not model dependence; significant LIWC categories are filtered without multiple-comparison correction. The human study omits power analysis, randomization and order, degrees of freedom, effect sizes, and exclusion details. The reported F=2.99 with p=.622 for video version is internally implausible and cannot be checked without data.

No code, prompts, videos, full questionnaire, data, derived animation assets, analysis plan, or ethics record is linked, and targeted search did not locate an official repository. The paper also reports no ethics approval or consent despite the human study and does not analyze stereotyping risks or the proposed future use in therapy. The defensible contribution is a multimodal prototype and initial evidence that observers distinguish two strongly contrasted audiovisual configurations, especially in an informal social context. It does not establish generalization to other traits, agents, models, voices, bodies, cultures, tasks, or live interaction.

Pregunta de investigación

¿Puede un LLM generar para agentes virtuales comportamientos verbales y no verbales que reproduzcan señales atribuidas a extraversión e introversión, pueden los observadores humanos distinguir esas condiciones y qué modalidad influye más en su juicio?

Método

Dos experimentos con un prototipo Unity. GPT-4o-mini-2024-07-18 genera diálogo y selecciona acciones de una lista cerrada para agentes introvertido, extrovertido y genérico en negociación e ice-breaking. Diez simulaciones por escenario se analizan con longitud, LIWC 2015, un clasificador Big Five basado en BERT y distribuciones de acciones. Después, 30 participantes de Prolific ven vídeos pregrabados, puntúan extraversión y señalan señales verbales y no verbales; su extraversión se estima con dos ítems BFI-10. La auditoría editorial leyó y renderizó las diez páginas, comprobó tablas, figuras, estadística, metadatos y licencia, y buscó artefactos públicos.

Muestra: Experimento 1: diez ensayos por escenario; conversaciones de hasta diez turnos en negociación y ocho en ice-breaking, sin recuento publicado de intervenciones analizadas por condición. Piloto de voz: 15 participantes, sin características o resultados detallados. Experimento 2: 30 personas de Prolific, 17 mujeres y 13 hombres, repartidas entre dos escenarios; no se informan edad, país, lengua, criterios de inclusión, exclusiones, potencia o tamaños exactos por celda.

Hallazgos

  • GPT-4o-mini produce diálogo y selecciona acciones no verbales distintas bajo prompts de extraversión e introversión.
  • Los agentes extrovertidos generan más palabras que los introvertidos en ambos escenarios.
  • En ice-breaking, la media de palabras es 90,58 frente a 56,30 y la de frases 5,80 frente a 4,92.
  • En negociación, la media de palabras es 56,32 frente a 41,46.
  • Quince categorías LIWC filtradas difieren en negociación y once en ice-breaking.
  • En negociación, el clasificador etiqueta como extrovertidas el 68 % de las intervenciones de ambas condiciones.
  • La diferencia del clasificador entre agentes no es significativa en negociación, con p=0,10.
  • En ice-breaking, el clasificador marca 97,5 % de las intervenciones extrovertidas y 50 % de las introvertidas como extrovertidas.
  • Las acciones seleccionadas siguen las asociaciones predefinidas de mirada, expresividad, amplitud gestual, volumen y velocidad.
  • Los 30 observadores puntúan los agentes extrovertidos entre 4,8 y 6,0 y los introvertidos entre 3,4 y 3,9.
  • El artículo informa un efecto principal del tipo de agente sobre extraversión percibida, F=44,57 y p<0,001.
  • El escenario no presenta un efecto principal significativo, aunque aparece una tendencia con p=0,086.
  • La interacción entre tipo de agente y extraversión del participante se informa con p=0,009.
  • Las señales verbales se declaran más influyentes que las no verbales en ambas condiciones.
  • La mayoría de participantes considera coherentes los comportamientos con la personalidad percibida y nadie elige la respuesta no.

Limitaciones

  • Solo se manipula extraversión frente a introversión; no se evalúan los otros cuatro rasgos Big Five.
  • El sistema usa un único checkpoint de GPT-4o-mini y no prueba replicación en otros modelos.
  • La temperatura se deja en el valor por defecto, que puede cambiar o no quedar congelado de forma reproducible.
  • No se publican prompts completos, mensajes de sistema, salidas estructuradas o reglas de validación.
  • El modelo elige en una lista de comportamientos diseñada para codificar diferencias estereotípicas de personalidad.
  • Los movimientos no son generados por el LLM: se seleccionan animaciones y expresiones preexistentes.
  • Las descripciones de clips producidas offline por GPT no se publican ni se evalúan por precisión.
  • Los comportamientos se sincronizan a nivel de intervención, no con palabras o tiempos finos.
  • Se utiliza un único personaje masculino y no se prueban cuerpos, apariencias, géneros o estilos alternativos.
  • Las voces Eric y Brian quedan confundidas con la personalidad porque no se contrabalancean entre condiciones.
  • El piloto de 15 personas no informa procedimiento, preguntas, puntuaciones, estadística o características de la muestra.
  • Longitud verbal, contenido, voz, gesto, postura y cara cambian simultáneamente entre condiciones.
  • No hay ablaciones solo verbal, solo no verbal, sin prompt de personalidad, guion humano o agente no encarnado.
  • El agente genérico participa en la generación, pero no aparece como condición de control del estudio humano.
  • Solo se ejecutan diez conversaciones por escenario y no se justifican mediante potencia o saturación.
  • No se informa el número total de intervenciones usado en t-tests, LIWC y clasificador.
  • Las intervenciones están anidadas en conversaciones, pero el análisis no modela esa dependencia.
  • Se examinan muchas categorías LIWC y se reportan solo las que superan p<0,05 y d>0,5.
  • No se aplica corrección por comparaciones múltiples ni se publica la familia completa de pruebas.
  • Los valores de Cohen d usados para filtrar no aparecen en las tablas.
  • La notación de estrellas de las tablas no se define de forma explícita.
  • Se usa LIWC 2015 mientras la referencia metodológica principal citada describe LIWC-22.
  • El clasificador binario de personalidad no se valida para diálogo sintético ni para estas longitudes.
  • Que el 68 % de ambas condiciones de negociación se clasifique como extrovertido contradice una separación robusta allí.
  • El 50 % de clasificación extrovertida para el agente introvertido en ice-breaking equivale al azar en una salida binaria.
  • Las probabilidades de acciones no verbales se describen sin tests, incertidumbre o variabilidad entre conversaciones.
  • El estudio humano tiene solo 30 participantes y aproximadamente 15 por escenario.
  • No se aporta análisis de potencia, preregistro, hipótesis direccionales o plan analítico previo.
  • No se informan randomización, contrabalanceo del orden, atención, exclusiones o datos perdidos.
  • Ver agentes contrastados dentro del mismo escenario puede revelar la manipulación y favorecer demanda experimental.
  • La descripción textual de vídeos y versiones es ambigua: se habla de dos vídeos, pero el ANOVA incluye dos versiones por tipo.
  • No se publican los vídeos, por lo que no puede auditarse si difieren en contenido, calidad o duración.
  • El ANOVA no informa grados de libertad, tamaños de efecto, intervalos o verificación de supuestos.
  • F=2,99 con p=0,622 para versión de vídeo es una combinación internamente inverosímil y sugiere error de reporte.
  • Para escenario se da p=0,086 sin el estadístico F correspondiente.
  • La regresión de interacción no informa coeficientes, errores, intervalos, R², codificación o corte de grupos.
  • Dos ítems BFI-10 ofrecen una medida muy breve y no se explica inversión o puntuación.
  • Las categorías de influencia permiten selección múltiple, pero los porcentajes normalizados y chi-cuadrado no se explican con recuentos.
  • La opción de coherencia pregunta por alineación con la personalidad ya percibida, lo que puede ser tautológico.
  • No se evalúan naturalidad, agrado, credibilidad, presencia, eficacia de tarea o consecuencias conductuales.
  • La interacción es mediante vídeos pregrabados, no conversación en tiempo real.
  • No se informan aprobación ética, consentimiento, compensación exacta o protección de datos.
  • No se discuten riesgos de estereotipar introversión como retraimiento, tristeza, voz baja o evitación de mirada.
  • No se enlazan código, datos, prompts, estímulos, cuestionario o materiales suplementarios.
  • La posible aplicación futura en terapia se menciona sin evaluación clínica, seguridad o gobernanza.

Qué no demuestra

  • No demuestra que el LLM posea personalidad propia.
  • No demuestra inducción de un constructo psicométrico estable más allá de señales diseñadas.
  • No prueba consistencia en otros rasgos Big Five.
  • No prueba generalización a otros modelos, prompts, voces, cuerpos, idiomas o culturas.
  • No demuestra separación fiable entre introversión y extraversión en negociación.
  • No establece que el LLM sea necesario frente a guiones o reglas equivalentes.
  • No identifica causalmente si la percepción procede del lenguaje, la voz, el rostro, el gesto o su combinación.
  • No demuestra generación de movimiento no verbal desde cero.
  • No demuestra interacción efectiva en tiempo real.
  • No prueba mejora de negociación, colaboración, satisfacción o resultados de tarea.
  • No demuestra que observadores perciban personalidad sin comparar condiciones contrastadas.
  • No establece que la personalidad del participante mejore precisión en vez de introducir sesgo.
  • No valida uso en terapia, educación, salud o decisiones sensibles.
  • No evalúa seguridad, equidad o daño por estereotipos.
  • No ofrece un experimento reproducible con los artefactos públicos disponibles.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2508.21087v1 (27 Aug 2025); arXiv non-exclusive distribution license 1.0

Fuente consultada: https://arxiv.org/pdf/2508.21087v1

Revisión: Codex full-text, visual, statistical, human-study and artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o-mini-2024-07-18 with default temperature
  • Generic, introverted and extraverted prompted agents
  • Bagged SVM over BERT embeddings personality classifier from Kazameini et al. (2020)
  • Unity male Reallusion embodied character
  • ElevenLabs Eric and Brian English voices

Instrumentos y métricas

  • Closed nonverbal action list covering face, body and voice
  • LIWC 2015 lexical categories
  • Binary pretrained Big Five personality detector
  • Seven-point perceived-extraversion rating
  • Two extraversion items from BFI-10
  • Cue-influence and verbal/nonverbal consistency questions
  • Mixed ANOVA, chi-square tests, linear regression, t-tests and Cohen's d filtering

Datos utilizados

  • Ten agent-to-agent trials per scenario for negotiation and ice-breaking
  • Recorded virtual-agent video stimuli generated from those conversations
  • Prolific user study with 30 participants
  • Pilot voice-selection study with 15 participants

Evidencia y localización

  • Objetivos y preguntas de investigación: arXiv v1, abstract and section 1, pp. 1–2
  • Lista cerrada de acciones y fundamento conductual: arXiv v1, section 3.1 and Table 1, pp. 3–4
  • Pipeline Unity, GPT y animaciones: arXiv v1, section 3.2 and Figure 2, p. 4
  • Voces y piloto de 15 participantes: arXiv v1, section 3.2, p. 4
  • Checkpoint, escenarios, turnos y diez ensayos: arXiv v1, section 4.1 and footnote 1, p. 5
  • LIWC y clasificador de personalidad: arXiv v1, section 4.2, p. 5
  • Longitud verbal y categorías LIWC filtradas: arXiv v1, section 4.3.1 and Tables 2–3, pp. 5–6
  • Resultados del clasificador por escenario: arXiv v1, Figure 3 and section 4.3.1, pp. 5–6
  • Distribuciones de acciones no verbales: arXiv v1, Figures 4–5 and section 4.3.2, p. 6
  • Diseño, muestra y medida BFI-10: arXiv v1, section 5.1, pp. 6–7
  • Medias y ANOVA de personalidad percibida: arXiv v1, Figure 6 and section 5.2.2, p. 7
  • Interacción con personalidad del observador: arXiv v1, Figure 7 and section 5.2.3, p. 7
  • Influencia de señales y coherencia percibida: arXiv v1, Table 4 and sections 5.2.4–5.2.5, pp. 7–8
  • Alcance, interpretación y trabajo futuro: arXiv v1, sections 6–7, p. 8
  • Versión y licencia: arXiv:2508.21087v1 metadata; submitted 27 Aug 2025; non-exclusive distribution license 1.0
  • Ausencia de artefactos públicos enlazados: arXiv v1 paper and metadata plus targeted repository search; audited 15 Jul 2026