PSYDIAL propone un pipeline de cinco etapas para generar diálogos sintéticos en coreano condicionados por personalidad: asignación del rasgo, selección de un perfil de PersonaChat, generación con GPT-4, filtrado automático y hasta tres regeneraciones. Aunque el artículo habla de personalidad basada en Big Five, el experimento solo usa una dimensión, extraversión, reducida a dos polos, extrovertido e introvertido, para cada uno de dos interlocutores. De 4.000 diálogos iniciales, el filtro rechaza 1.051 por perfil, 208 por personalidad y uno por estilo; las regeneraciones acumulan 4.305 intentos y la Tabla 4 declara 2.928 positivos. Sin embargo, la Tabla 1 suma 2.932 diálogos finales, 715 E/E, 685 E/I, 763 I/E y 769 I/I, una discrepancia interna de cuatro casos sin explicar. Los diálogos tienen una media de 8,16 turnos y 33,25 tokens a nivel silábico. Los perfiles escogidos revelan asociaciones estereotípicas: viaje, baile, fútbol, senderismo y natación aparecen para extroversión, mientras lectura, videojuegos, pintura, soledad y también senderismo aparecen para introversión. La visualización t-SNE sugiere separación tras el filtrado, pero no se aporta una métrica de separación ni una prueba estadística. Para evaluar utilidad, los autores comparan KoGPT2, KoBART, Kolang-T5 y KoDialoGPT-v0 en cinco configuraciones: preentrenado, con prompt de personalidad, ajustado tres épocas con HuLiC, ajustado tres épocas con PSYDIAL y este último más prompt. Los modelos ajustados con PSYDIAL y prompt alcanzan P-ACC de 0,881, 0,864 y 0,864 para KoGPT2, KoBART y Kolang-T5, frente a 0,653, 0,664 y 0,625 sin el prompt; también mejoran la mayoría de BLEU y ROUGE. Esto respalda que entrenar con diálogos etiquetados y repetir la etiqueta en el prompt facilita reproducir las clases sintéticas dentro de este protocolo. No demuestra personalidad amplia, realismo humano ni validez psicométrica. P-ACC procede de un KLUE RoBERTa-base ajustado durante cinco épocas sobre PSYDIAL, pero no se describen particiones de entrenamiento y prueba ni protección frente a fuga entre generador, clasificador y evaluación. Tampoco hay evaluación humana de naturalidad o personalidad coreana; los propios autores reconocen expresiones parecidas a traducciones directas del inglés. La auditoría del código agrava la circularidad: el mismo historial contiene el prompt con los rasgos explícitos cuando GPT-4 vuelve a clasificar el diálogo, y el filtro de perfil recibe el perfil seleccionado, no el diálogo. El repositorio oficial publica tres scripts y dos CSV de perfiles, pero no el corpus PSYDIAL final, los modelos ajustados, las particiones, los resultados, un manifiesto de dependencias ni una licencia. El trabajo aporta una receta inicial útil para crear datos conversacionales sintéticos en un recurso lingüístico reducido, pero la evidencia publicada no permite verificar de forma independiente su calidad, reproducir la evaluación completa ni generalizar sus resultados más allá de extraversión binaria en coreano.
Pregunta de investigación
¿Puede un pipeline basado en prompting de GPT-4 generar y filtrar diálogos sintéticos coreanos que expresen polos de extraversión, y mejora el ajuste de modelos conversacionales con esos datos la generación automática evaluada por solapamiento, perplejidad y un clasificador de personalidad?