PSYDIAL: Personality-based Synthetic Dialogue Generation Using Large Language Models

Personas, identidad y agentes2024ACL AnthologyRevisión editorial aprobada

Autores: Ji-Eun Han, Jun-Seok Koh, Hyeon-Tae Seo, Du-Seong Chang, Kyung-Ah Sohn

Palabras clave: synthetic dialogue generation, personality-based dialogue, Big Five extraversion, multilingual NLP, Korean language, conversational AI, data augmentation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
26
Hallazgos
40
Limitaciones
18
Evidencias

Resumen editorial

Español

PSYDIAL propone un pipeline de cinco etapas para generar diálogos sintéticos en coreano condicionados por personalidad: asignación del rasgo, selección de un perfil de PersonaChat, generación con GPT-4, filtrado automático y hasta tres regeneraciones. Aunque el artículo habla de personalidad basada en Big Five, el experimento solo usa una dimensión, extraversión, reducida a dos polos, extrovertido e introvertido, para cada uno de dos interlocutores. De 4.000 diálogos iniciales, el filtro rechaza 1.051 por perfil, 208 por personalidad y uno por estilo; las regeneraciones acumulan 4.305 intentos y la Tabla 4 declara 2.928 positivos. Sin embargo, la Tabla 1 suma 2.932 diálogos finales, 715 E/E, 685 E/I, 763 I/E y 769 I/I, una discrepancia interna de cuatro casos sin explicar. Los diálogos tienen una media de 8,16 turnos y 33,25 tokens a nivel silábico. Los perfiles escogidos revelan asociaciones estereotípicas: viaje, baile, fútbol, senderismo y natación aparecen para extroversión, mientras lectura, videojuegos, pintura, soledad y también senderismo aparecen para introversión. La visualización t-SNE sugiere separación tras el filtrado, pero no se aporta una métrica de separación ni una prueba estadística. Para evaluar utilidad, los autores comparan KoGPT2, KoBART, Kolang-T5 y KoDialoGPT-v0 en cinco configuraciones: preentrenado, con prompt de personalidad, ajustado tres épocas con HuLiC, ajustado tres épocas con PSYDIAL y este último más prompt. Los modelos ajustados con PSYDIAL y prompt alcanzan P-ACC de 0,881, 0,864 y 0,864 para KoGPT2, KoBART y Kolang-T5, frente a 0,653, 0,664 y 0,625 sin el prompt; también mejoran la mayoría de BLEU y ROUGE. Esto respalda que entrenar con diálogos etiquetados y repetir la etiqueta en el prompt facilita reproducir las clases sintéticas dentro de este protocolo. No demuestra personalidad amplia, realismo humano ni validez psicométrica. P-ACC procede de un KLUE RoBERTa-base ajustado durante cinco épocas sobre PSYDIAL, pero no se describen particiones de entrenamiento y prueba ni protección frente a fuga entre generador, clasificador y evaluación. Tampoco hay evaluación humana de naturalidad o personalidad coreana; los propios autores reconocen expresiones parecidas a traducciones directas del inglés. La auditoría del código agrava la circularidad: el mismo historial contiene el prompt con los rasgos explícitos cuando GPT-4 vuelve a clasificar el diálogo, y el filtro de perfil recibe el perfil seleccionado, no el diálogo. El repositorio oficial publica tres scripts y dos CSV de perfiles, pero no el corpus PSYDIAL final, los modelos ajustados, las particiones, los resultados, un manifiesto de dependencias ni una licencia. El trabajo aporta una receta inicial útil para crear datos conversacionales sintéticos en un recurso lingüístico reducido, pero la evidencia publicada no permite verificar de forma independiente su calidad, reproducir la evaluación completa ni generalizar sus resultados más allá de extraversión binaria en coreano.

English

PSYDIAL proposes a five-stage pipeline for generating personality-conditioned synthetic Korean dialogues: trait assignment, PersonaChat profile selection, GPT-4 generation, automatic filtering, and up to three regeneration rounds. Although the paper frames the task around Big Five personality, the experiment uses only one dimension, Extraversion, reduced to extrovert and introvert poles for each of two speakers. Of 4,000 initial dialogues, the filter rejects 1,051 for profile, 208 for personality, and one for style; regeneration yields 4,305 cumulative attempts and Table 4 reports 2,928 positives. Table 1, however, sums to 2,932 final dialogues, 715 E/E, 685 E/I, 763 I/E, and 769 I/I, an unexplained four-item discrepancy. Dialogues average 8.16 turns and 33.25 syllable-level tokens. Selected profiles expose stereotypical associations: travel, dancing, football, hiking, and swimming for extroversion, versus reading, video games, painting, being alone, and also hiking for introversion. A t-SNE plot suggests post-filter separation, but no separation metric or statistical test is reported. For downstream evaluation, the authors compare KoGPT2, KoBART, Kolang-T5, and KoDialoGPT-v0 under five settings: pretrained, personality-prompted, fine-tuned for three epochs on HuLiC, fine-tuned for three epochs on PSYDIAL, and PSYDIAL fine-tuning plus a personality prompt. PSYDIAL-trained models with prompting reach P-ACC of 0.881, 0.864, and 0.864 for KoGPT2, KoBART, and Kolang-T5, versus 0.653, 0.664, and 0.625 without the prompt; most BLEU and ROUGE scores also improve. This supports the narrower claim that training on labeled dialogues and restating the label in the prompt helps reproduce synthetic classes within this protocol. It does not establish broad personality, human realism, or psychometric validity. P-ACC comes from KLUE RoBERTa-base fine-tuned for five epochs on PSYDIAL, yet no train/test split or safeguard against leakage across generation, classification, and evaluation is described. There is also no human evaluation of Korean naturalness or personality; the authors themselves note English-like direct-translation expressions. The code audit further exposes circularity: the history used by GPT-4 to classify a dialogue still contains the explicit trait prompt, while the profile filter receives the selected profile rather than the dialogue. The official repository publishes three scripts and two profile CSV files, but not the final PSYDIAL corpus, fine-tuned models, splits, result artifacts, a dependency manifest, or a license. The paper offers a useful initial recipe for synthetic conversational data in a lower-resource setting, but the published evidence does not independently verify data quality, reproduce the full evaluation, or support generalization beyond binary Extraversion in Korean.

Pregunta de investigación

¿Puede un pipeline basado en prompting de GPT-4 generar y filtrar diálogos sintéticos coreanos que expresen polos de extraversión, y mejora el ajuste de modelos conversacionales con esos datos la generación automática evaluada por solapamiento, perplejidad y un clasificador de personalidad?

Método

El pipeline asigna a Person1 y Person2 uno de dos polos de extraversión, selecciona mediante GPT-4 una frase de perfil de PersonaChat compatible con Person1, genera un diálogo informal en coreano y pide al mismo GPT-4 clasificar perfil, personalidad y estilo. Los casos negativos se regeneran hasta tres veces. Se construyen cuatro combinaciones E/E, E/I, I/E e I/I. Para el análisis de perfiles se cuentan términos frecuentes y se visualizan embeddings de un sentence-transformer coreano con t-SNE. La utilidad se estudia con KoGPT2, KoBART y Kolang-T5 ajustados durante tres épocas, más KoDialoGPT-v0 como referencia, en cinco configuraciones que cruzan preentrenamiento, HuLiC, PSYDIAL y prompt de personalidad. Se informan BLEU-2, ROUGE-1/2/L, perplejidad 3-gram estimada con KoGPT2 y P-ACC de un KLUE RoBERTa-base ajustado cinco épocas con PSYDIAL.

Muestra: El pipeline parte de 4.000 generaciones iniciales, 1.000 por cada combinación E/E, E/I, I/E e I/I. Tras filtrado y hasta tres regeneraciones, la Tabla 1 informa 715, 685, 763 y 769 diálogos, respectivamente, que suman 2.932; la Tabla 4 informa 2.928 positivos. La longitud media declarada es 8,16 turnos y 33,25 tokens silábicos. No participan personas ni se anotan diálogos humanos para personalidad. HuLiC se usa como corpus comparativo de ajuste, pero el artículo no documenta en esta evaluación tamaños o particiones reproducibles para PSYDIAL.

Hallazgos

  • El estudio operacionaliza personalidad únicamente como extraversión binaria para dos hablantes; no genera ni evalúa las otras cuatro dimensiones Big Five.
  • Las cuatro combinaciones de hablantes son E/E, E/I, I/E e I/I, con 1.000 intentos iniciales por combinación.
  • La Tabla 1 declara 715, 685, 763 y 769 diálogos finales; esas cifras suman 2.932.
  • La Tabla 4 declara 2.928 positivos acumulados, cuatro menos que la Tabla 1, sin reconciliación textual.
  • De los 4.000 diálogos iniciales, 1.051 fallan el filtro de perfil, 208 el de personalidad y uno el de estilo; 2.740 pasan directamente.
  • Tres rondas de regeneración añaden 138, 37 y 13 positivos, con 4.305 intentos acumulados.
  • Los diálogos tienen una media de 8,16 turnos y 33,25 tokens medidos a nivel silábico.
  • Los perfiles extrovertidos seleccionados se asocian con viajes, baile, fútbol, senderismo y natación; los introvertidos con lectura, videojuegos, pintura, estar solo y también senderismo.
  • La presencia de senderismo en ambos polos muestra que la selección de perfiles no produce una separación semántica simple o exclusiva.
  • La Figura 2 muestra una separación visual mayor después del filtrado, pero no cuantifica calidad de clusters, error o significación.
  • Los prompts se diseñan en inglés para generar conversaciones en coreano y el artículo reconoce expresiones parecidas a traducciones directas del inglés.
  • El prompt de personalidad añade de forma explícita la etiqueta de cada interlocutor al mismo contexto que genera el diálogo.
  • En el código oficial, ese contexto etiquetado permanece en el historial cuando GPT-4 clasifica posteriormente la personalidad, por lo que el filtrado no es ciego al tratamiento.
  • El filtro de perfil del script separado recibe únicamente el perfil seleccionado y la etiqueta esperada, no el diálogo cuya coherencia debería comprobar.
  • En la configuración preentrenada, P-ACC es 0,481 para KoGPT2, 0,463 para KoBART y 0,565 para Kolang-T5.
  • El ajuste con HuLiC no produce una mejora uniforme de personalidad: P-ACC queda en 0,505, 0,531 y 0,518.
  • El ajuste con PSYDIAL eleva P-ACC a 0,653, 0,664 y 0,625 para KoGPT2, KoBART y Kolang-T5.
  • Añadir el prompt de personalidad a los modelos ajustados con PSYDIAL eleva P-ACC a 0,881, 0,864 y 0,864.
  • La formulación del artículo sobre un aumento de hasta 88 % corresponde a alcanzar 88,1 % de exactitud, no a una mejora de 88 puntos porcentuales.
  • La mayoría de BLEU y ROUGE mejora al pasar de PSYDIAL sin prompt a PSYDIAL con prompt, coherente con una señal explícita adicional.
  • La perplejidad de Kolang-T5 empeora de 15,223 a 16,521 al añadir el prompt, por lo que no todas las métricas mejoran.
  • P-ACC se calcula con un KLUE RoBERTa-base ajustado durante cinco épocas sobre PSYDIAL, el mismo dominio sintético que evalúa.
  • El paper no describe una evaluación humana de naturalidad, coherencia, diversidad o personalidad percibida.
  • El repositorio oficial contiene el código de generación, filtrado y regeneración y dos CSV de entrada, pero no el corpus final ni artefactos de evaluación.
  • El README referencia main_filtering.py y main_regeneration.py, pero los archivos publicados se llaman main_filter.py y main_regenerate.py.
  • El código define una función de moderación, pero no la invoca en el pipeline publicado.

Limitaciones

  • Reducir personalidad a un solo rasgo binario impide sostener afirmaciones sobre Big Five o personalidad en sentido amplio.
  • Los polos extrovertido e introvertido se tratan como clases discretas y simétricas, sin intensidad, facetas, ambiversión ni incertidumbre.
  • El perfil se elige de PersonaChat en inglés y el diálogo se genera en coreano, introduciendo transferencia cultural y lingüística no evaluada.
  • La selección de perfiles reproduce asociaciones estereotípicas entre actividades y extraversión.
  • No se mide si los perfiles seleccionados son válidos psicológicamente o si personas coreanas reconocen los rasgos.
  • El mismo GPT-4 genera y juzga los datos, sin jueces independientes ni anotación humana.
  • El juez conserva en el historial el prompt que revela explícitamente la personalidad asignada, creando una vía directa de fuga de etiqueta.
  • El filtro de perfil publicado evalúa el perfil en sí, no su realización en el diálogo.
  • No se cuantifica acuerdo entre filtros, errores del juez, falsos positivos o falsos negativos.
  • Las regeneraciones vuelven a usar el mismo modelo y criterios, por lo que pueden intensificar estereotipos y autoconsistencia del juez.
  • La visualización t-SNE es exploratoria, sensible a parámetros y no sustituye una medida cuantitativa de separabilidad.
  • No se documentan parámetros de t-SNE, estabilidad entre semillas ni validación fuera de la proyección bidimensional.
  • La Tabla 1 suma 2.932 casos y la Tabla 4 informa 2.928 positivos; el corpus publicado no está disponible para resolver la diferencia.
  • El artículo no describe con claridad particiones de entrenamiento, validación y prueba para los modelos generativos.
  • Tampoco describe la partición usada para ajustar y evaluar el clasificador P-ACC sobre PSYDIAL.
  • Sin particiones por perfil, diálogo o plantilla, P-ACC puede explotar solapamiento, estilos del generador o fuga de etiquetas.
  • El clasificador de evaluación se entrena con el mismo dataset sintético y taxonomía binaria, por lo que la métrica es circular respecto al objetivo.
  • BLEU y ROUGE premian solapamiento con respuestas sintéticas de referencia en una tarea de diálogo abierta con muchas respuestas válidas.
  • La perplejidad se calcula con KoGPT2 3-gram según la descripción y no se justifica como medida de naturalidad humana.
  • No hay intervalos de confianza, desviaciones, pruebas estadísticas ni réplicas para respaldar el término significant improvements del abstract.
  • El ajuste se resume casi únicamente por el número de épocas; faltan tasa de aprendizaje, batch, optimizador, semillas, checkpoints y criterio de selección.
  • No se informan configuraciones de decodificación comparables para las salidas evaluadas de los modelos ajustados.
  • KoDialoGPT-v0 no se ajusta bajo todas las condiciones, lo que limita su comparabilidad con los otros tres modelos.
  • No se evalúan modelos generadores distintos de GPT-4 ni la robustez a versiones del endpoint.
  • El alias gpt-4 del código no fija una instantánea exacta y no permite reproducir la conducta original.
  • El código usa la interfaz antigua openai.ChatCompletion y no incluye versiones de dependencias.
  • La selección aleatoria de perfiles y descriptores no establece semilla.
  • Los scripts no crean de forma robusta todos los directorios de salida y requieren reconstrucción manual del entorno.
  • El repositorio no contiene requirements.txt, pyproject.toml, lockfile, configuración de entorno ni instrucciones de ejecución completas.
  • El README usa nombres de archivos que no coinciden con dos scripts reales.
  • El corpus PSYDIAL final, las particiones, salidas de modelos, checkpoints y resultados de métricas no están en el repositorio auditado.
  • No hay licencia visible para código o datos, lo que deja incierta la reutilización académica y la redistribución.
  • No se discuten derechos y condiciones de PersonaChat, HuLiC, salidas de GPT-4 o datos derivados.
  • La función de moderación está definida pero no se usa, y no se reporta auditoría de toxicidad, privacidad o contenido dañino.
  • No existe evaluación humana de coreano natural, adecuación cultural, coherencia entre turnos, diversidad o utilidad conversacional.
  • Los autores reconocen expresiones similares a traducción directa del inglés, pero no cuantifican su prevalencia o impacto.
  • No se comparan los diálogos sintéticos con conversaciones humanas equivalentes etiquetadas por personalidad.
  • No se analiza memorabilidad, consistencia en conversaciones largas, comportamiento fuera del prompt o interacción con usuarios.
  • El estudio no presenta una sección ética sustantiva sobre estereotipos, consentimiento de datos, riesgos de personificación o usos manipulativos.
  • La generalización a otras dimensiones, idiomas y tareas se plantea como potencial, no se evalúa empíricamente.

Qué no demuestra

  • No demuestra que GPT-4 o los modelos coreanos posean personalidad psicológica.
  • No demuestra control de los cinco rasgos Big Five; solo estudia extraversión binaria.
  • No demuestra que los perfiles de actividades sean indicadores válidos o no estereotípicos de extraversión.
  • No demuestra que los diálogos sean más humanos, porque no hay comparación humana directa.
  • No demuestra naturalidad o adecuación cultural para hablantes coreanos.
  • No demuestra que el filtrado identifique personalidad a partir del diálogo sin acceso a la etiqueta.
  • No demuestra que la separación visual de t-SNE sea estadísticamente robusta.
  • No demuestra que 2.932 o 2.928 sea el tamaño correcto del corpus final.
  • No demuestra generalización a nuevos perfiles, prompts, generadores, modelos o dominios.
  • No demuestra que P-ACC mida personalidad en lugar de señales del generador y de la etiqueta sintética.
  • No demuestra una mejora estadísticamente significativa al no aportar pruebas, varianza o intervalos.
  • No demuestra que añadir el prompt mejore todas las métricas; Kolang-T5 empeora en perplejidad.
  • No demuestra superioridad frente a un corpus humano de personalidad comparable.
  • No permite reproducir la construcción del corpus o las tablas de evaluación desde los artefactos publicados.
  • No establece que el pipeline sea seguro, ético o apto para despliegues con usuarios.
  • No verifica la afirmación de aplicabilidad a tareas no conversacionales u otros idiomas.

Trazabilidad

Alcance: Texto completo

Versión: LREC-COLING 2024 final paper, pp. 13321-13331, 11 pages; official PSYDIAL repository main audited at commit 08cd9a2c8037d65adf4b5ec4e77b3c072ed2982b; pipeline code and source profile files present, final 2.9K-dialogue corpus absent

Fuente consultada: https://aclanthology.org/2024.lrec-main.1166.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, synthetic-data, leakage, Korean-language, automatic-evaluation, code-artifact, reproducibility, release and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4 mediante el alias no versionado gpt-4 para selección, generación, filtrado y regeneración
  • KoGPT2, 125 millones de parámetros
  • KoBART, 123 millones de parámetros
  • Kolang-T5, 225 millones de parámetros
  • KoDialoGPT-v0, 125 millones de parámetros
  • KLUE RoBERTa-base ajustado como clasificador de P-ACC
  • Sentence-transformer coreano para embeddings de la visualización t-SNE

Instrumentos y métricas

  • Una dimensión Big Five: extraversión frente a introversión
  • Prompts de perfil, personalidad, personaje y estilo
  • Filtrado GPT-4 de perfil, personalidad y estilo
  • BLEU-2
  • ROUGE-1, ROUGE-2 y ROUGE-L
  • Perplejidad 3-gram con KoGPT2
  • P-ACC con clasificador KLUE RoBERTa-base
  • Embeddings de sentence-transformer y t-SNE
  • Frecuencias de palabras de perfiles seleccionados

Datos utilizados

  • PSYDIAL: aproximadamente 2,9 mil diálogos sintéticos coreanos etiquetados por la combinación binaria de extraversión de dos interlocutores
  • PersonaChat como fuente de frases de perfil en inglés
  • HuLiC como corpus humano coreano de chit-chat para la condición de ajuste comparativa
  • 5_personality.csv del repositorio, con descripciones de polos Big Five
  • personaChat_personality_origin.csv del repositorio, con perfiles fuente; el corpus PSYDIAL final no está publicado en la revisión auditada

Evidencia y localización

  • Registro bibliográfico y abstract oficial: ACL Anthology 2024.lrec-main.1166; LREC-COLING 2024, pp. 13321-13331
  • Fuente completa auditada: .cache/editorial-sources/article-099/source.pdf; official ACL PDF; 11 pages; sha256 ac43d5a12f565467fc540cdb60263b6c3a78229806d5fc50c37f794eae20e3b7
  • Pipeline de cinco etapas: Full text pp. 13323-13326, sections 3.1-3.4 and Figure 1
  • Prompts de perfil, personalidad, personaje y estilo: Full text pp. 13324-13325, sections 3.3.1-3.3.4
  • Distribución y longitud del corpus: Full text pp. 13326-13327, section 4.1 and Tables 1-2
  • Perfiles y estereotipos léxicos: Full text p. 13327, section 4.2.1 and Table 3
  • Filtrado, regeneraciones y discrepancia de recuento: Full text pp. 13327-13328, section 4.2.2, Figure 2 and Table 4; Table 1 total 2,932 versus Table 4 positive total 2,928
  • Modelos y cinco configuraciones experimentales: Full text pp. 13328-13329, sections 5.1-5.3
  • Métricas automáticas y clasificador P-ACC: Full text p. 13329, section 5.4
  • Resultados BLEU, ROUGE, perplejidad y P-ACC: Full text pp. 13329-13330, section 5.5 and Table 5
  • Limitaciones lingüísticas reconocidas: Full text p. 13330, Discussion and Conclusion: English-like direct-translation expressions and future Korean profile source
  • Repositorio oficial auditado: Official https://github.com/jiSilverH/psydial main, commit 08cd9a2c8037d65adf4b5ec4e77b3c072ed2982b; checked 15 Jul 2026
  • Fuga de etiqueta en filtrado de personalidad: Official repository main_pipeline.py: dial_prompt and dial_response are appended to previous_questions_and_answers before tag_prompt_1 and tag_prompt_2 are sent
  • Filtro de perfil no observa el diálogo: Official repository main_filter.py: profile filter is prompted from the selected profile and expected pole rather than the generated dialogue
  • Reproducibilidad del generador: Official repository main_pipeline.py: model alias gpt-4, random.choice without seed, legacy ChatCompletion API, temperature 0.5, max_tokens 1024 and presence_penalty 0.6
  • Moderación no conectada: Official repository main_pipeline.py defines get_moderation but no call is present in the published pipeline
  • Artefactos y documentación ausentes: Official repository tree contains three scripts, overview image, 5_personality.csv, personaChat_personality_origin.csv and README; no final dialogue corpus, model/evaluation artifacts, dependency manifest or license; README names differ from two actual scripts
  • Comprobación visual integral: All 11 PDF pages rendered and visually inspected, including five tables, two figures, prompts, equations, dataset analysis, experimental settings, results, discussion, conclusion and references; checked 15 Jul 2026