Este trabajo estudia si una instrucción de sistema de una sola frase, “You are an Emergency Department Physician/Nurse”, sus variantes Bold/Cautious, “Helpful Assistant” o ninguna persona, cambia cinco modelos clínicos en dos tareas. La auditoría cubre las 14 páginas de arXiv:2601.05376v1, su paquete fuente y el repositorio oficial en el commit 19a7487. A 15 de julio de 2026 no se localizó publicación definitiva posterior: el CV de la primera autora lo presenta como trabajo ACL/ARR, por lo que debe tratarse como preprint no revisado por pares. El paper aporta una demostración clara de sensibilidad al prompt, pero sus resultados no equivalen a validación clínica ni a una medida limpia de expertise.
La tarea de triage combina 1.466 registros desidentificados de pacientes de una unidad de urgencias con sospecha de TIA/ictus y 201 casos sintomáticos de menor agudeza. El modelo debe elegir A quedarse en casa, B atención rutinaria/primaria o C urgencias. Se prueban HuatuoGPT-o1-8B y 70B sobre Llama, HuatuoGPT-o1-7B y 72B sobre Qwen, y MedGemma-27B. Se calculan accuracy, ECE, concordancia entre la etiqueta de mayor probabilidad y la generada, propensión a elegir urgencias y una razón de errores de sobretriage/undertriage. En PatientSafetyBench se generan respuestas a 466 consultas abiertas y tres jueces, GPT-5, HuatuoGPT-o1-70B y 72B, ordenan las personas por harmfulness, helpfulness y factual accuracy.
El hallazgo descriptivo principal es real pero más estrecho que el titular: los roles de urgencias desplazan las predicciones hacia mayor urgencia. Ese desplazamiento mejora hasta unos 20 puntos porcentuales la accuracy en el conjunto de alta agudeza, empeora alrededor de 10 puntos en atención primaria y modifica ECE y consistencia de forma dependiente del modelo. No se compara una persona de primaria con los casos de primaria. Por tanto, el diseño confunde “persona médica” con congruencia de contexto: exactamente el mismo rol de urgencias se aplica a datos de urgencias y fuera de urgencias. Además, procedencia, prevalencia de etiquetas y contexto cambian juntos entre los dos subconjuntos. Sin rendimiento por clase dentro de una fuente común, no se puede separar mejor razonamiento de un simple cambio del prior hacia C.
El abstract dice ganancias de “~+20% in accuracy and calibration”, pero el cuerpo y la figura muestran cambios en puntos porcentuales: aproximadamente +20 pp de accuracy y −20 pp de ECE. La ECE menor es una mejora; no es una ganancia positiva de 20%. La calibración se deriva de probabilidades de tokens A/B/C, no de confianza comunicada al paciente, y no se documentan número de bins, sensibilidad a binning, intervalos ni calibración por clase. La consistencia tampoco accede a un estado interno: compara dos lecturas observables del mismo modelo, probabilidad condicionada y texto decodificado, y excluye outputs no parseables del denominador.
Las variantes Bold y Cautious no controlan el riesgo de manera monotónica. El paper lo reconoce: el orden cambia según el modelo, con diferencias de propensión pequeñas en algunos casos y razones de sensibilidad muy dispares. Esto demuestra fragilidad ante formulaciones cortas, no que el constructo psicológico “bold/cautious” haya sido manipulado o medido. No hay manipulation check, paraphrases, seeds, repetición estocástica, factorial role×style completo ni estimación de incertidumbre para estas razones. La razón Type-I/Type-II puede ser inestable con denominadores pequeños o cero y omite errores A↔B.
La evaluación por LLM favorece en agregado a roles médicos, pero el acuerdo caso a caso de los tres jueces es bajo: 43–53% de acuerdo mayoritario y κ entre 0 y 0,1. Las diferencias significativas agregadas no convierten esas preferencias en verdad clínica. Los jueces ven respuestas más o menos profesionalizadas, evalúan dimensiones parcialmente estilísticas y, por instrucción, no usan ground truth en reasoning quality. La t de Student sobre MRR acotado/ordinal, las numerosas comparaciones de personas, modelos, tareas y dimensiones, la ausencia de corrección y la falta de tablas de efectos/p exactos limitan la inferencia.
La validación humana usa tres coautores voluntarios: dos attending physicians con más de diez años y un MD recién graduado. Cada uno evalúa 50 pares por tarea; se reciben 149 juicios de razonamiento y 150 de seguridad. No es una muestra independiente ni representativa. Los 50 casos se seleccionan después de que los tres jueces LLM coincidan unánimemente, balanceando 25 favorables a persona médica y 25 a no médica. Es una validación condicionada a extremos del propio evaluador, no una estimación del corpus completo.
El κ=0,43 está descrito de forma equívoca. La matriz de la Figura 5b muestra κ clínico–clínico de −0,10, −0,067 y 0,45, cuyo promedio es aproximadamente 0,09. Los valores clínico–“LLM Judge” son −0,091, 0,76 y 0,64; su promedio es 0,436 y explica el 0,43 citado. Por tanto, 0,43 no es acuerdo medio entre clínicos. Solo se calcula sobre 16 casos de seguridad que superan el umbral de confianza. La afirmación de que 95,9% de las respuestas de reasoning tienen baja confianza tampoco concuerda literalmente con el histograma, que contiene numerosos ratings individuales ≥50; quizá se refiera a casos que no cumplen un criterio conjunto no definido. No se liberan anotaciones para resolverlo.
La conclusión de que esto “valida” a los jueces LLM es demasiado fuerte: una persona anotadora tiene acuerdo negativo con el agregado LLM, el acuerdo entre clínicos es bajo, la selección incorpora el consenso LLM y las preferencias no miden outcomes ni corrección clínica. La tabla de preferencias solo describe el subconjunto seleccionado y filtrado por confianza. Perceived safety, fluidez o justificación no son seguridad real.
El código publicado no reproduce el estudio completo. El repositorio tiene cinco scripts Python, una figura y un README de una frase; no contiene datos, outputs, análisis, tablas, notebooks, requirements/lockfile, licencia, tests ni CI. Los datos clínicos son restringidos por DUA, pero tampoco se incluye un fixture sintético o un esquema. infer_safety.py fija la persona ED Nurse y procesa solo head(5). run_triage_med_gemma.py procesa head(5) y run_triage_reasoning_model.py tail(5); este último tiene rutas GPFS absolutas y bloques de imports duplicados. Los dos evaluadores solo procesan head(3). Ningún script calcula McNemar, t-tests, ECE, MRR, risk metrics, κ o las figuras; no hay implementación del juez GPT-5 ni ensamblado de prompts de ranking. Los defaults apuntan a archivos ausentes.
Hay además divergencias entre paper y código: el prompt de MedGemma exige un encabezado “## Final Response” ausente en el paper; el evaluador de triage solicita ASSERTIVENESS y CLINICAL EXPERIENCE además de JUSTIFICATION QUALITY, mientras el paper solo define esta última; y el script de safety concatena la frase adicional sin espacio tras el query. Los parsers aceptan aliases y frases aunque el protocolo exige una sola letra, introduciendo reglas no documentadas. Los archivos compilan sintácticamente, pero eso no constituye un pipeline ejecutable ni permite verificar ninguna cifra.
La conclusión defendible es que instrucciones profesionales mínimas pueden alterar el prior de respuesta, el texto y las preferencias de jueces en modelos clínicos, con dirección dependiente del contexto y del modelo. Es una advertencia útil contra asumir que una persona experta garantiza seguridad. No demuestra mejora clínica, expertise adquirido, causalidad del rol separada del prior de etiqueta, calibración para usuarios, seguridad de despliegue ni acuerdo clínico robusto.