From Personas to Talks: Revisiting the Impact of Personas on LLM-Synthesized Emotional Support Conversations

Personas, identidad y agentes2025ACL AnthologyRevisión editorial aprobada

Autores: Shenghan Wu, Yimo Zhu, Wynne Hsu, Mong-Li Lee, Yang Deng

Palabras clave: Emotional Support Conversations, Persona Conditioning, Persona Extraction, Synthetic Dialogue, HEXACO-60, Communication Styles Inventory, GPT-4o mini, Claude 3.5 Haiku, Llama 3.1 8B Instruct, PersonaHub, ESConv, CAMS, Dreaddit, Human Evaluation, Strategy Distribution, Mental Health AI

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
12
Hallazgos
21
Limitaciones
12
Evidencias

Resumen editorial

Español

Este trabajo analiza cómo la información de persona modifica conversaciones de apoyo emocional sintetizadas por LLM. El pipeline usa GPT-4o mini para extraer edad, género, ocupación, descripción sociodemográfica y problema emocional de ESConv, CAMS y Dreaddit; después GPT-4o mini, Claude 3.5 Haiku y Llama 3.1 8B amplían las tarjetas con descripciones alineadas a HEXACO y al Communication Styles Inventory, responden ambos cuestionarios y correlacionan sus seis dimensiones. En un segundo experimento, 1.000 descripciones de PersonaHub se enriquecen con datos y frases indicativas de rasgos, se puntúan, se usan para generar diálogos buscador-soporte, se vuelven a extraer y se puntúan de nuevo. Las distribuciones agregadas permanecen parecidas en Honesty-Humility, Agreeableness, Conscientiousness y Openness, pero las personas derivadas del diálogo muestran mayor Emotionality y menor Extraversion. Finalmente, se continúan historias ESConv con y sin las doce puntuaciones HEXACO/CSI del buscador. Con persona, GPT-4o mini y Claude generan más preguntas y affirmation/reassurance y menos self-disclosure; Llama cambia menos. Diez estudiantes anglófonos comparan 50 pares: la versión con persona gana 37–39 % y pierde 33–35 % en suggestion, comforting, identification y overall, mientras consistency empata en 54 %. La aportación defendible es que añadir información explícita de persona cambia de forma medible el texto, la longitud y las estrategias autoetiquetadas del diálogo sintético, y ofrece una señal humana débil pero favorable. Sin embargo, no valida rasgos psicológicos estables ni una mejora terapéutica. El mismo LLM redacta descripciones de rasgo, contesta los dos inventarios, genera ambos interlocutores, vuelve a extraer la persona y etiqueta sus propias estrategias; esto introduce circularidad y common-method bias. La supuesta estabilidad se apoya en violin plots de distribuciones, no en retención persona-a-persona: una distribución puede coincidir aunque todos los individuos hayan cambiado. El control sin persona tampoco iguala información o longitud, y el modelo omnisciente cambia tanto al buscador como al soporte. La evaluación humana no publica intervalos, tests, acuerdo, cegamiento ni ratings crudos, por lo que márgenes de 3–5 puntos no demuestran superioridad. Además, la distribución GPT-4o mini con persona suma 101,10 %, imposible por redondeo, y el texto habla de diferencias significativas sin reportar tests. No hay código, datos generados ni juicios enlazados públicamente. El checklist reconoce que no se comprobaron PII/contenido ofensivo ni se documentaron los artefactos, pese a derivar tarjetas personales detalladas de datos sensibles de salud mental. La conclusión fiel es que las personas son una variable de diseño influyente para síntesis de conversaciones; aún no hay evidencia suficiente de inferencia psicométrica válida, eficacia, seguridad, privacidad o preparación para despliegue real.

English

This study examines how persona information changes LLM-synthesized emotional-support conversations. The pipeline uses GPT-4o mini to extract age, gender, occupation, socio-demographic description, and emotional problem from ESConv, CAMS, and Dreaddit. GPT-4o mini, Claude 3.5 Haiku, and Llama 3.1 8B then augment cards with descriptions aligned to HEXACO and the Communication Styles Inventory, answer both questionnaires, and correlate their six dimensions. In a second experiment, 1,000 PersonaHub descriptions are enriched with demographics and trait-indicative statements, scored, used to generate seeker-supporter dialogues, re-extracted, and scored again. Aggregate distributions remain similar for Honesty-Humility, Agreeableness, Conscientiousness, and Openness, while dialogue-derived personas show higher Emotionality and lower Extraversion. Finally, ESConv histories are continued with and without the seeker's twelve HEXACO/CSI scores. With persona information, GPT-4o mini and Claude generate more questions and affirmation/reassurance and less self-disclosure; Llama changes less. Ten English-speaking undergraduates compare 50 pairs: persona-conditioned versions win 37-39% and lose 33-35% on suggestion, comforting, identification, and overall quality, while consistency ties in 54% of judgments. The defensible contribution is that explicit persona information measurably changes synthetic dialogue text, length, and self-labelled strategy use, with a weak but favorable human preference signal. It does not validate stable psychological traits or therapeutic improvement. The same LLM writes trait descriptions, completes both inventories, generates both speakers, re-extracts the persona, and labels its own strategies, creating circularity and common-method bias. Claimed stability rests on violin plots of group distributions rather than person-level retention: distributions can match even if every individual's scores change. The no-persona control is not matched for information or length, and an omniscient model changes both seeker and supporter. Human evaluation reports no intervals, tests, agreement, blinding, or raw ratings, so 3-5-point margins do not establish superiority. The GPT-4o-mini with-persona distribution also sums to 101.10%, which rounding cannot explain, while the text calls strategy differences significant without reporting tests. No code, generated data, or judgments are publicly linked. The checklist acknowledges that PII/offensive-content checks and artifact documentation were not performed, despite deriving detailed persona cards from sensitive mental-health data. The faithful conclusion is that personas are an influential design variable for conversation synthesis; evidence is not yet sufficient for valid psychometric inference, efficacy, safety, privacy, or real-world readiness.

Pregunta de investigación

¿Pueden los LLM inferir rasgos HEXACO y estilos comunicativos coherentes desde tarjetas de persona, conservar esos rasgos al sintetizar conversaciones de apoyo emocional y modificar mediante su inyección las estrategias y la calidad percibida de esos diálogos?

Método

GPT-4o mini extrae tarjetas de 1.155 casos ESConv, 1.140 CAMS y 730 Dreaddit. Tres modelos, a temperatura 0, generan descripciones para seis dimensiones HEXACO y seis CSI, completan HEXACO-60 y CSI desde esas tarjetas y calculan matrices Pearson entre escalas. Para consistencia, 1.000 personas PersonaHub se expanden con datos sociodemográficos y frases de rasgo, se puntúan, generan diálogos sintéticos, se reextraen y vuelven a puntuar; se comparan distribuciones antes/después. Para impacto, cada modelo continúa historias ESConv generando a ambos roles bajo dos prompts: uno añade puntuaciones y definiciones HEXACO/CSI y otro las omite. El propio output anota la estrategia de cada turno del soporte. Diez estudiantes nativos de inglés comparan 50 pares en cinco criterios. La auditoría leyó y revisó visualmente las 15 páginas y las dos del checklist, recalculó sumas de porcentajes y p-valores de control, evaluó constructos, comparadores, estadística, privacidad y seguridad, y buscó artefactos públicos por título y arXiv ID.

Muestra: RQ1 usa 1.155 tarjetas ESConv, 1.140 CAMS y 730 Dreaddit; cada una es procesada por tres LLM en dos inventarios. RQ2 selecciona aleatoriamente 1.000 descripciones PersonaHub, sin publicar seed ni muestra. RQ3 continúa historias ESConv; el apéndice informa 10.398 turnos y 218.433 palabras con persona frente a 12.666 turnos y 232.674 palabras sin persona. La evaluación humana incluye 10 estudiantes y 50 pares; no se aclara cuántos jueces puntúan cada par ni se publican ratings individuales.

Hallazgos

  • Las matrices HEXACO-CSI suelen contener las asociaciones teóricas esperadas, pero no en todos los casos son la mayor correlación absoluta de la fila y no existe ground truth humano externo.
  • GPT-4o mini produce relaciones más coherentes en varias tablas, aunque la afirmación de que es el más fuerte en las seis dimensiones no se cumple literalmente celda por celda.
  • Las distribuciones antes/después se parecen para Honesty-Humility, Agreeableness, Conscientiousness y Openness; Emotionality sube y Extraversion baja después del diálogo en los tres modelos.
  • La evidencia publicada es distribución agregada y no informa correlación, error o equivalencia persona-a-persona.
  • Con persona, GPT-4o mini aumenta questioning de 16,45 % a 27,23 % y affirmation/reassurance de 21,06 % a 29,72 %, y reduce self-disclosure de 10,64 % a 2,64 %.
  • Claude muestra la misma dirección general; Llama 8B presenta cambios más pequeños y questioning queda casi igual.
  • Las categorías GPT-4o mini con persona suman 101,10 % y se repiten como columna CSI en Table 8; el error supera ampliamente lo explicable por redondeo.
  • Los prompts con persona producen 18 % menos turnos totales, pero turnos más largos, por lo que contenido y longitud también cambian entre condiciones.
  • En evaluación humana, persona gana 39 % y pierde 34 % en overall; los otros criterios sustantivos tienen márgenes de victoria de solo 3-4 puntos y consistency es principalmente empate.
  • El paper no publica intervalos, significancia, acuerdo interanotador, asignación de jueces, cegamiento ni datos crudos para la evaluación humana.
  • No se localizó un repositorio o dataset público enlazado; no pueden reproducirse muestras, generaciones, inventarios, conteos ni ratings.
  • Los autores advierten que el trabajo es académico y no debe desplegarse en apoyo emocional real sin salvaguardas.

Limitaciones

  • El mismo modelo genera descripciones alineadas a los rasgos y responde ambos cuestionarios desde esas descripciones, creando una prueba circular de coherencia semántica.
  • Las correlaciones entre dos escalas contestadas por el mismo LLM no validan precisión respecto a rasgos de personas reales ni estabilidad temporal.
  • No hay autoinformes humanos, jueces independientes, criterios conductuales o test-retest para validar las personas inferidas.
  • RQ2 compara violin plots marginales; no reporta correspondencia individual, rank-order, distancia pareada, intervalo ni equivalencia.
  • Las descripciones PersonaHub se enriquecen explícitamente con frases indicativas de HEXACO/CSI antes de medir y regenerar esos mismos rasgos.
  • El control sin persona omite doce scores, definiciones y una orden de usarlos; no es un placebo equiparado en información, longitud o atención del prompt.
  • Un único modelo omnisciente genera buscador y soporte con acceso a toda la información; las dos condiciones pueden cambiar ambos lados de la conversación.
  • Las estrategias son autoetiquetadas por el mismo modelo generador y no se validan con anotadores o clasificador independiente.
  • La distribución GPT-4o mini con persona suma 101,10 %, señal de al menos un porcentaje o denominador erróneo.
  • Se llaman significativas diferencias de estrategia sin tests, intervalos, unidades de análisis ni corrección por comparaciones.
  • Table 2 afirma p<0,01 para todos los metrics pese a mostrar correlaciones de 0,01-0,04, que no son significativas con n=1.155 si la frase se refiere a las 36 celdas.
  • La evaluación humana usa solo 10 estudiantes y 50 pares, con márgenes estrechos, sin uncertainty, agreement, blinding o raw data.
  • Los anotadores tienen experiencia en tareas, pero no se reporta formación clínica o de apoyo emocional.
  • No hay usuarios reales, resultados de bienestar, crisis, escalado, harmful advice, dependencia, seguimiento ni revisión por profesionales de salud mental.
  • ESConv es crowdsourced y RQ3 genera ambos interlocutores; el diseño no reproduce una interacción real con un usuario independiente.
  • No se documentan seed, muestra PersonaHub, coste/computación total, infraestructura o parámetros de generación aparte de temperatura 0 y snapshots de API.
  • El checklist marca como reportados varios elementos, cómputo, error bars, instrucciones completas, consentimiento y demografía, que el paper no desarrolla de forma verificable.
  • No hay artefacto público de código/datos para revisar o corregir los resultados.
  • El checklist responde no a comprobaciones de PII/contenido ofensivo y documentación, y deja licencias e intended use como N/A.
  • Extraer demografía y problemas detallados de posts de salud mental puede inventar o amplificar atributos; el ejemplo convierte young en 23 años sin auditoría de exactitud.
  • El estudio es en inglés y las personas y evaluadores no sustentan generalización cultural, lingüística o clínica.

Qué no demuestra

  • No demuestra que los LLM infieran con precisión rasgos psicológicos estables de personas reales.
  • No valida HEXACO o CSI para medición psicométrica de tarjetas generadas y contestadas por el mismo modelo.
  • No demuestra que cada persona individual conserve sus rasgos tras el diálogo.
  • No convierte similitud de distribuciones en fiabilidad test-retest o equivalencia.
  • No demuestra significancia estadística de las diferencias de estrategias ni que todos los porcentajes publicados sean correctos.
  • No valida las autoetiquetas del modelo como anotaciones independientes de estrategias de apoyo.
  • No aísla causalmente el efecto de la persona frente a más información, instrucciones explícitas, longitud y cambios en el buscador generado.
  • No demuestra que márgenes de 3–5 puntos en 50 pares representen mejor empatía o calidad general.
  • No demuestra que las preguntas retóricas mejoren bienestar, seguridad o resultados terapéuticos.
  • No demuestra privacidad, consentimiento, ausencia de PII o compatibilidad de uso para personas derivadas de datos de salud mental.
  • No establece seguridad o preparación para apoyo emocional real.
  • No permite reproducción independiente desde código, datos y ratings públicos.

Trazabilidad

Alcance: Texto completo

Versión: EMNLP 2025 main proceedings, pages 5439-5453, DOI 10.18653/v1/2025.emnlp-main.277; 15-page paper plus 2-page Responsible NLP Checklist

Fuente consultada: https://aclanthology.org/2025.emnlp-main.277/

Revisión: Codex complete bilingual fidelity pass using the full EMNLP paper and Responsible NLP Checklist, all-17-page visual inspection, independent percentage and p-value checks, construct/common-method/control/human-evaluation/privacy/safety review, and targeted public-artifact search; summaries written from full evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o mini 2024-07-18
  • Claude 3.5 Haiku 2024-10-22
  • Meta Llama 3.1 8B Instruct

Instrumentos y métricas

  • HEXACO-60
  • Communication Styles Inventory
  • Pearson correlation
  • Persona-card extraction prompts
  • Eight-class emotional-support strategy taxonomy
  • Five-criterion pairwise human evaluation
  • Principal component analysis visualization

Datos utilizados

  • ESConv
  • CAMS
  • Dreaddit
  • PersonaHub
  • LLM-synthesized emotional-support conversations

Evidencia y localización

  • Pregunta, pipeline, resultados y límites declarados: Official paper pages 1-9, Sections 1-7, Limitations and Ethical Considerations
  • Extracción y conteos ESConv, CAMS y Dreaddit: Official paper page 3, Section 3 and Table 1
  • HEXACO, CSI, snapshots, temperatura y matrices de correlación: Official paper pages 4-5 and 13-14, Section 4 and Tables 2-4 and 10-15
  • Diseño PersonaHub y estabilidad por distribuciones: Official paper pages 5-6 and 13-15, Section 5, Figures 4-7 and 19-21
  • Prompts con/sin persona y autoetiquetado de estrategias: Official paper pages 7 and 14, Section 6 and Figures 16-18
  • Distribuciones de estrategias y error de suma 101.10%: Official paper page 7, Tables 5-8; independent percentage-sum recalculation on 15 July 2026
  • Evaluación humana, márgenes y ausencia de incertidumbre: Official paper page 8, Section 6.2 and Table 9
  • Diferencias de longitud y turnos: Official paper page 15, Appendix H and Table 16
  • Privacidad, licencias, documentación, cómputo y anotadores: Official two-page Responsible NLP Checklist, fully rendered and inspected
  • Ausencia de artefacto enlazado: Paper, ACL and arXiv records plus targeted GitHub title/arXiv-ID repository and code searches on 15 July 2026
  • Auditoría integral de medición, evaluación y reproducibilidad: reports/verification/article-199-persona-measurement-and-evaluation-audit.json
  • Inspección visual completa: All 15 paper pages and both checklist pages rendered and visually inspected on 15 July 2026