Roleplay-doh es una herramienta para que una persona experta en apoyo psicológico construya un paciente simulado a partir de un caso que recuerda, converse con él y convierta kudos, críticas o reescrituras en principios de comportamiento. GPT-3.5 transforma kudos y críticas en reglas; GPT-4 explica una reescritura y deriva la regla. Para generar cada turno, gpt-4-turbo-1106 recibe escenario, principios e historial. Una segunda tubería descompone los principios en preguntas de sí/no, añade criterios generales de diálogo, decide cuáles aplican, evalúa la respuesta inicial y la reescribe si algún criterio aplicable falla. El piloto reunió seis consejeros de 7 Cups; después cuatro coautores conversaron con cuatro pacientes seleccionados y calificaron 276 respuestas, una sola persona por respuesta. Cincuenta y cinco, el 20%, recibieron satisfacción moderada o baja, pero esta estimación no tiene acuerdo entre jueces ni evaluación experta independiente. El estudio principal, intra-sujeto, incluyó 25 profesionales o consejeros estadounidenses. Todos hicieron primero una conversación de diez minutos con Scenario-Only y luego una sesión de treinta minutos sobre el mismo caso, añadiendo reglas. Crearon 25 pares de pacientes y 123 principios. Quienes crearon los pacientes puntuaron más alto la versión con principios en cinco de seis escalas: los incrementos fueron 0,80 en autenticidad, 0,76 en parecido al caso recordado, 1,00 en aspectos desafiantes, 0,64 en preparación para entrenar y 0,52 en recomendación; mantenerse en el rol apenas cambió, +0,08. Sin embargo, no hubo contrabalanceo: orden, práctica, duración y uso de la herramienta cambiaron a la vez, y las personas conocían la condición y juzgaban sus propias reglas. Cinco consejeros tomados del mismo grupo de creadores evaluaron, a ciegas y en orden aleatorio, las transcripciones de los 25 pares, 125 comparaciones. Un modelo mixto, Rating~Treatment+CreatorID+(1|AnnotatorID), estimó incrementos menores en autenticidad (+0,31), parecido a casos típicos (+0,49), preparación (+0,39) y recomendación (+0,38); rol (+0,09) y dificultad para el consejero (+0,22) no fueron significativos. El desacuerdo fue alto: alpha de Krippendorff de 0,023-0,082 para diferencias de puntuación y 0,046-0,232 para preferencia. La evaluación técnica comparó cinco variantes con tres consejeros. En 40 fallos seleccionados, la tubería completa ganó, empató y perdió frente a la respuesta inicial en 30%, 55% y 15% de los casos en la valoración global. Ese 30% es una proporción de victorias, no una mejora del 30% en una métrica de calidad. En 50 turnos aleatorios el resultado fue 18%/78%/4%, y en 34 de 50 todas las variantes produjeron exactamente la misma respuesta. Por tanto, el trabajo respalda que las reglas son autorables y que esta pequeña muestra percibió mejoras modestas en ciertas transcripciones; no demuestra aprendizaje de novatos, validez clínica, seguridad ni transferencia a pacientes reales. Los casos procedían de recuerdos de pacientes reales, pero el paper no documenta consentimiento de esos pacientes, desidentificación o revisión de privacidad. La web promete código y datos, pero su único repositorio oficial contiene solo el sitio estático y el botón de código está comentado. El dataset de principios está en Hugging Face bajo CC BY-NC 4.0, pero exige autenticarse y compartir contacto; no se publicaron aplicación, análisis, datos crudos ni outputs para reproducir el estudio de extremo a extremo.
Pregunta de investigación
¿Puede una herramienta convertir el feedback de expertos en principios que gobiernen pacientes simulados por LLM, mejorar la adhesión a esas reglas y producir transcripciones que consejeros perciban como más auténticas y útiles que un escenario sin principios?