Roleplay-doh: Enabling Domain-Experts to Create LLM-simulated Patients via Eliciting and Adhering to Principles

Personas, identidad y agentes2024ACL AnthologyRevisión editorial aprobada

Autores: Ryan Louie, Ananjan Nandi, William Fang, Cheng Chang, Emma Brunskill, Diyi Yang

Palabras clave: LLM-simulated patients, Expert-defined principles, Human-LLM collaboration, Mental health training, Role-playing agents

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
8
Hallazgos
22
Limitaciones
6
Evidencias

Resumen editorial

Español

Roleplay-doh es una herramienta para que una persona experta en apoyo psicológico construya un paciente simulado a partir de un caso que recuerda, converse con él y convierta kudos, críticas o reescrituras en principios de comportamiento. GPT-3.5 transforma kudos y críticas en reglas; GPT-4 explica una reescritura y deriva la regla. Para generar cada turno, gpt-4-turbo-1106 recibe escenario, principios e historial. Una segunda tubería descompone los principios en preguntas de sí/no, añade criterios generales de diálogo, decide cuáles aplican, evalúa la respuesta inicial y la reescribe si algún criterio aplicable falla. El piloto reunió seis consejeros de 7 Cups; después cuatro coautores conversaron con cuatro pacientes seleccionados y calificaron 276 respuestas, una sola persona por respuesta. Cincuenta y cinco, el 20%, recibieron satisfacción moderada o baja, pero esta estimación no tiene acuerdo entre jueces ni evaluación experta independiente. El estudio principal, intra-sujeto, incluyó 25 profesionales o consejeros estadounidenses. Todos hicieron primero una conversación de diez minutos con Scenario-Only y luego una sesión de treinta minutos sobre el mismo caso, añadiendo reglas. Crearon 25 pares de pacientes y 123 principios. Quienes crearon los pacientes puntuaron más alto la versión con principios en cinco de seis escalas: los incrementos fueron 0,80 en autenticidad, 0,76 en parecido al caso recordado, 1,00 en aspectos desafiantes, 0,64 en preparación para entrenar y 0,52 en recomendación; mantenerse en el rol apenas cambió, +0,08. Sin embargo, no hubo contrabalanceo: orden, práctica, duración y uso de la herramienta cambiaron a la vez, y las personas conocían la condición y juzgaban sus propias reglas. Cinco consejeros tomados del mismo grupo de creadores evaluaron, a ciegas y en orden aleatorio, las transcripciones de los 25 pares, 125 comparaciones. Un modelo mixto, Rating~Treatment+CreatorID+(1|AnnotatorID), estimó incrementos menores en autenticidad (+0,31), parecido a casos típicos (+0,49), preparación (+0,39) y recomendación (+0,38); rol (+0,09) y dificultad para el consejero (+0,22) no fueron significativos. El desacuerdo fue alto: alpha de Krippendorff de 0,023-0,082 para diferencias de puntuación y 0,046-0,232 para preferencia. La evaluación técnica comparó cinco variantes con tres consejeros. En 40 fallos seleccionados, la tubería completa ganó, empató y perdió frente a la respuesta inicial en 30%, 55% y 15% de los casos en la valoración global. Ese 30% es una proporción de victorias, no una mejora del 30% en una métrica de calidad. En 50 turnos aleatorios el resultado fue 18%/78%/4%, y en 34 de 50 todas las variantes produjeron exactamente la misma respuesta. Por tanto, el trabajo respalda que las reglas son autorables y que esta pequeña muestra percibió mejoras modestas en ciertas transcripciones; no demuestra aprendizaje de novatos, validez clínica, seguridad ni transferencia a pacientes reales. Los casos procedían de recuerdos de pacientes reales, pero el paper no documenta consentimiento de esos pacientes, desidentificación o revisión de privacidad. La web promete código y datos, pero su único repositorio oficial contiene solo el sitio estático y el botón de código está comentado. El dataset de principios está en Hugging Face bajo CC BY-NC 4.0, pero exige autenticarse y compartir contacto; no se publicaron aplicación, análisis, datos crudos ni outputs para reproducir el estudio de extremo a extremo.

English

Roleplay-doh is a tool for a mental-health-support expert to construct a simulated patient from a remembered case, converse with it, and convert kudos, critiques or rewritten responses into behavioral principles. GPT-3.5 turns kudos and critiques into rules; GPT-4 explains a rewrite and derives the rule. For every dialogue turn, gpt-4-turbo-1106 receives the scenario, principles and history. A second pipeline decomposes principles into yes/no questions, adds general dialogue criteria, decides which criteria apply, evaluates the initial response and rewrites it if any applicable criterion fails. The pilot involved six 7 Cups counselors; four coauthors then conversed with four selected patients and rated 276 responses, with only one rater per response. Fifty-five, or 20%, received moderate or low satisfaction, but this estimate has no inter-rater agreement or independent expert adjudication. The main within-subject study included 25 US professionals or counselors. Everyone first held a ten-minute Scenario-Only conversation and then a thirty-minute session about the same remembered case while adding rules. They created 25 patient pairs and 123 principles. Creators rated the principle version higher on five of six scales: increases were 0.80 for authenticity, 0.76 for resemblance to the remembered case, 1.00 for challenging aspects, 0.64 for training readiness and 0.52 for recommendation; staying in role barely changed, by 0.08. The design was not counterbalanced, however: order, practice, session length and tool use changed together, while creators knew the condition and judged their own rules. Five counselors drawn from the same creator cohort rated randomized, blinded transcripts for all 25 pairs, producing 125 comparisons. A mixed model, Rating~Treatment+CreatorID+(1|AnnotatorID), estimated smaller increases for authenticity (+0.31), typical-case resemblance (+0.49), readiness (+0.39) and recommendation (+0.38); role (+0.09) and counselor challenge (+0.22) were not significant. Agreement was poor: Krippendorff alpha was 0.023-0.082 for rating differences and 0.046-0.232 for preference. The technical evaluation compared five variants with three expert counselors. On 40 selected failures, Full won, tied and lost against the initial response in 30%, 55% and 15% of overall judgments. That 30% is a win proportion, not a 30% improvement on a quality scale. On 50 random turns the result was 18%/78%/4%, and in 34 of 50 turns every method returned exactly the same response. The work therefore supports that principles are authorable and that this small sample perceived modest improvements in some transcripts; it does not establish novice learning, clinical validity, safety or transfer to real patients. Scenarios came from counselors' memories of real patients, but the paper does not document patient consent, de-identification or a privacy review. Although the project page promises code and data, its only official repository contains the static website and the Code button is commented out. The principle dataset is on Hugging Face under CC BY-NC 4.0 but requires authentication and contact sharing; the application, analysis, raw study data and model outputs needed for end-to-end reproduction are not public.

Pregunta de investigación

¿Puede una herramienta convertir el feedback de expertos en principios que gobiernen pacientes simulados por LLM, mejorar la adhesión a esas reglas y producir transcripciones que consejeros perciban como más auténticas y útiles que un escenario sin principios?

Método

El trabajo combina diseño iterativo, un piloto, un estudio intra-sujeto con 25 creadores, una comparación ciega de 125 pares por cinco jueces del mismo grupo y una evaluación técnica por tres expertos. La tubería GPT-4 genera, formula criterios, evalúa y, si detecta incumplimientos, reescribe. Se publican escalas Likert, un modelo mixto para jueces externos, preferencias win/tie/loss y alpha de Krippendorff.

Muestra: Seis consejeros de 7 Cups en el piloto; cuatro coautores como conversadores y únicos evaluadores de 276 respuestas; 25 expertos estadounidenses como creadores; cinco de esos mismos 25 como jueces de 125 pares; y tres consejeros expertos en la evaluación técnica. Entre los 25 casos, 14 no tenían diagnóstico, 10 describían síntomas o diagnósticos previos y uno una enfermedad mental grave.

Hallazgos

  • Los 25 creadores produjeron 123 principios, entre 1 y 10 por paciente, mediana 5; 11,4% tuvieron que editarse manualmente.
  • La versión con principios recibió mayores medias de los creadores en cinco de seis medidas, con incrementos de 0,52 a 1,00 puntos; mantenerse en rol cambió solo +0,08.
  • Los cinco jueces ciegos estimaron incrementos de +0,31 en autenticidad, +0,49 en parecido, +0,39 en preparación y +0,38 en recomendación; dos medidas no cambiaron significativamente.
  • El acuerdo entre jueces fue muy bajo: alpha 0,023-0,082 para diferencias de puntuación y 0,046-0,232 para preferencias.
  • En 40 errores seleccionados, Full obtuvo 30% victorias, 55% empates y 15% derrotas globales frente a No Critique.
  • En 50 turnos aleatorios, Full obtuvo 18% victorias, 78% empates y 4% derrotas; 34 de 50 daban el mismo output en todas las variantes.
  • Las conversaciones Scenario-Only y con principios tuvieron 13,04 y 13,64 turnos medios, pero outputs de 177,29 y 120,43 tokens respectivamente.
  • La usabilidad autopercibida fue alta, aunque algunas personas describieron dificultad para formular, generalizar, fusionar o hacer cumplir reglas.

Limitaciones

  • El estudio de creadores tuvo orden fijo: Scenario-Only siempre antes de Scenario+ExpertPrinciples.
  • Las fases duraron 10 y 30 minutos y difirieron también en práctica, familiaridad y uso de la herramienta; el efecto causal de los principios no queda aislado.
  • Los creadores conocían la condición, habían invertido esfuerzo en sus reglas y juzgaban el parecido con un caso que solo ellos recordaban.
  • Los cinco jueces externos procedían del mismo grupo de 25 creadores, no de una muestra independiente.
  • Solo hay cinco clusters de anotador y la potencia se simuló con parámetros estimados de datos tempranos del mismo estudio y un efecto supuesto de 0,52.
  • El acuerdo entre jueces es extremadamente bajo, por lo que las diferencias medias no equivalen a consenso experto estable.
  • Se prueban seis outcomes por grupo sin corrección de comparaciones múltiples reportada ni intervalos de confianza.
  • El paper no especifica el test o modelo usado para las estrellas de significación del estudio de creadores.
  • El 30% es el porcentaje de victorias en 40 casos escogidos porque ya contenían errores, con 55% empates; no es mejora porcentual de calidad ni prevalencia en uso normal.
  • En la muestra aleatoria predominan los empates y 68% de los casos producen outputs idénticos en todas las variantes.
  • La cifra piloto del 20% usa pacientes seleccionados, conversaciones de coautores y un solo evaluador por respuesta.
  • GPT-4 genera, crea criterios, evalúa y reescribe; no se prueba un juez de modelo independiente.
  • No se reportan latencia, coste, tokens totales, retries, fallos de JSON ni carga operacional de las múltiples llamadas.
  • El sistema presupone consistencia interna de los principios y no demuestra detección o resolución automática de conflictos.
  • Los casos recuerdan pacientes reales, pero no se describe consentimiento de pacientes, desidentificación, redacción, minimización o evaluación de riesgo de reidentificación.
  • Solo se miden percepciones sobre transcripciones, no desempeño o aprendizaje de consejeros novatos.
  • No se evalúan corrección clínica, crisis, autolesión, sesgo, seguridad, outcomes de pacientes o daño en despliegue.
  • Solo hay diálogo textual y una sesión breve; faltan señales no verbales, consistencia longitudinal y seguimiento.
  • La muestra es estadounidense y contiene un solo caso de enfermedad mental grave.
  • La dependencia de gpt-4-turbo-1106 limita reproducción temporal y generalización a modelos actuales o abiertos.
  • El dataset está gated y no hay código de aplicación, datos crudos, outputs ni análisis públicos para reproducir de extremo a extremo.
  • El paper, el dataset, la web y la frase 'research use only' presentan licencias distintas y no hay código de la tubería al que aplicar una licencia clara.

Qué no demuestra

  • No demuestra que los consejeros novatos aprendan mejor ni transfieran habilidades a pacientes reales.
  • No valida clínicamente los pacientes simulados ni su idoneidad para entrenamiento no supervisado.
  • No aísla causalmente el efecto de los principios frente a orden, tiempo, práctica y esfuerzo.
  • No demuestra consenso experto fuerte sobre autenticidad.
  • No demuestra una mejora de calidad del 30% en uso ordinario.
  • No evita outputs dañinos, absurdos o derogatorios.
  • No prueba privacidad o consentimiento de los pacientes reales recordados.
  • No generaliza a enfermedad grave, otras culturas, otros dominios, multimodalidad o sesiones longitudinales.
  • No permite reproducción integral con los artefactos públicos.
  • No prueba el resultado con modelos actuales, abiertos o ajenos a OpenAI.

Trazabilidad

Alcance: Texto completo

Versión: EMNLP 2024, pages 10570-10603; arXiv:2407.00870v2, project repository and gated dataset audited separately

Fuente consultada: https://aclanthology.org/2024.emnlp-main.591/

Revisión: Codex 34-page visual, official-ACL, arXiv-v2, full-method, prompt, participant-flow, fixed-order, mixed-model, power, agreement, selected-vs-random-case, privacy, artifact, license, reproducibility and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • gpt-4-turbo-1106
  • GPT-3.5, snapshot not specified for principle elicitation

Instrumentos y métricas

  • Roleplay-doh expert-feedback interface
  • Six seven-point creator patient-rating items
  • Four seven-point tool-experience items
  • Six seven-point third-party transcript-rating items
  • Linear mixed-effects model: Rating~Treatment+CreatorID+(1|AnnotatorID)
  • Simulation-based power analysis with R simr over 300 trials
  • Win/tie/loss majority vote from three expert rankings
  • Krippendorff alpha for rating differences, preferences and ranked outputs

Datos utilizados

  • Twenty-five remembered real-patient scenarios and 25 paired simulated patients
  • 123 expert-defined principles, gated at SALT-NLP/roleplay-doh_principles
  • Sixteen pilot conversations with 276 singly rated responses
  • 125 blinded third-party patient-pair comparisons
  • Forty selected error turns and fifty random turns for pipeline evaluation

Evidencia y localización

  • Metadatos, DOI, páginas, autores, licencia y abstract exacto: ACL Anthology 2024.emnlp-main.591
  • Sistema, prompts, participantes, tablas, estadística, limitaciones, ética y apéndices: EMNLP 2024 PDF, 34 páginas, sha256 3dfcae6a4597fa50ebe8fff89095aea6bf63a48ad7ecd0c63dc8067381059feb
  • Historial y versión del preprint: arXiv:2407.00870v2
  • Disponibilidad real del código y contenido del repositorio: roleplay-doh/roleplay-doh.github.io at commit d87eae73826c371df47ee5136eeb0f37c3dcb468; checked 2026-07-16
  • Gate, ficheros, licencia y acceso del dataset: SALT-NLP/roleplay-doh_principles metadata and unauthenticated 401 GatedRepo response; checked 2026-07-16
  • Auditoría de diseño, estadística, privacidad, artefactos y fronteras de afirmación: reports/verification/article-247-emnlp-roleplay-doh-study-design-statistics-privacy-artifact-and-claim-audit.json