The Persona Paradox: Medical Personas as Behavioral Priors in Clinical Language Models

Aplicaciones, sesgos y seguridad2026arXivRevisión editorial aprobada

Autores: Tassallah Abdullahi, Shrestha Ghosh, Hamish S Fraser, Daniel León Tramontini, Adeel Abbasi, Ghada Bourjeily, Carsten Eickhoff, Ritambhara Singh

Palabras clave: Large Language Models, Personality, Persona, Personality Control, AI Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

8
Autores
20
Hallazgos
100
Limitaciones
13
Evidencias

Resumen editorial

Español

Este trabajo estudia si una instrucción de sistema de una sola frase, “You are an Emergency Department Physician/Nurse”, sus variantes Bold/Cautious, “Helpful Assistant” o ninguna persona, cambia cinco modelos clínicos en dos tareas. La auditoría cubre las 14 páginas de arXiv:2601.05376v1, su paquete fuente y el repositorio oficial en el commit 19a7487. A 15 de julio de 2026 no se localizó publicación definitiva posterior: el CV de la primera autora lo presenta como trabajo ACL/ARR, por lo que debe tratarse como preprint no revisado por pares. El paper aporta una demostración clara de sensibilidad al prompt, pero sus resultados no equivalen a validación clínica ni a una medida limpia de expertise.

La tarea de triage combina 1.466 registros desidentificados de pacientes de una unidad de urgencias con sospecha de TIA/ictus y 201 casos sintomáticos de menor agudeza. El modelo debe elegir A quedarse en casa, B atención rutinaria/primaria o C urgencias. Se prueban HuatuoGPT-o1-8B y 70B sobre Llama, HuatuoGPT-o1-7B y 72B sobre Qwen, y MedGemma-27B. Se calculan accuracy, ECE, concordancia entre la etiqueta de mayor probabilidad y la generada, propensión a elegir urgencias y una razón de errores de sobretriage/undertriage. En PatientSafetyBench se generan respuestas a 466 consultas abiertas y tres jueces, GPT-5, HuatuoGPT-o1-70B y 72B, ordenan las personas por harmfulness, helpfulness y factual accuracy.

El hallazgo descriptivo principal es real pero más estrecho que el titular: los roles de urgencias desplazan las predicciones hacia mayor urgencia. Ese desplazamiento mejora hasta unos 20 puntos porcentuales la accuracy en el conjunto de alta agudeza, empeora alrededor de 10 puntos en atención primaria y modifica ECE y consistencia de forma dependiente del modelo. No se compara una persona de primaria con los casos de primaria. Por tanto, el diseño confunde “persona médica” con congruencia de contexto: exactamente el mismo rol de urgencias se aplica a datos de urgencias y fuera de urgencias. Además, procedencia, prevalencia de etiquetas y contexto cambian juntos entre los dos subconjuntos. Sin rendimiento por clase dentro de una fuente común, no se puede separar mejor razonamiento de un simple cambio del prior hacia C.

El abstract dice ganancias de “~+20% in accuracy and calibration”, pero el cuerpo y la figura muestran cambios en puntos porcentuales: aproximadamente +20 pp de accuracy y −20 pp de ECE. La ECE menor es una mejora; no es una ganancia positiva de 20%. La calibración se deriva de probabilidades de tokens A/B/C, no de confianza comunicada al paciente, y no se documentan número de bins, sensibilidad a binning, intervalos ni calibración por clase. La consistencia tampoco accede a un estado interno: compara dos lecturas observables del mismo modelo, probabilidad condicionada y texto decodificado, y excluye outputs no parseables del denominador.

Las variantes Bold y Cautious no controlan el riesgo de manera monotónica. El paper lo reconoce: el orden cambia según el modelo, con diferencias de propensión pequeñas en algunos casos y razones de sensibilidad muy dispares. Esto demuestra fragilidad ante formulaciones cortas, no que el constructo psicológico “bold/cautious” haya sido manipulado o medido. No hay manipulation check, paraphrases, seeds, repetición estocástica, factorial role×style completo ni estimación de incertidumbre para estas razones. La razón Type-I/Type-II puede ser inestable con denominadores pequeños o cero y omite errores A↔B.

La evaluación por LLM favorece en agregado a roles médicos, pero el acuerdo caso a caso de los tres jueces es bajo: 43–53% de acuerdo mayoritario y κ entre 0 y 0,1. Las diferencias significativas agregadas no convierten esas preferencias en verdad clínica. Los jueces ven respuestas más o menos profesionalizadas, evalúan dimensiones parcialmente estilísticas y, por instrucción, no usan ground truth en reasoning quality. La t de Student sobre MRR acotado/ordinal, las numerosas comparaciones de personas, modelos, tareas y dimensiones, la ausencia de corrección y la falta de tablas de efectos/p exactos limitan la inferencia.

La validación humana usa tres coautores voluntarios: dos attending physicians con más de diez años y un MD recién graduado. Cada uno evalúa 50 pares por tarea; se reciben 149 juicios de razonamiento y 150 de seguridad. No es una muestra independiente ni representativa. Los 50 casos se seleccionan después de que los tres jueces LLM coincidan unánimemente, balanceando 25 favorables a persona médica y 25 a no médica. Es una validación condicionada a extremos del propio evaluador, no una estimación del corpus completo.

El κ=0,43 está descrito de forma equívoca. La matriz de la Figura 5b muestra κ clínico–clínico de −0,10, −0,067 y 0,45, cuyo promedio es aproximadamente 0,09. Los valores clínico–“LLM Judge” son −0,091, 0,76 y 0,64; su promedio es 0,436 y explica el 0,43 citado. Por tanto, 0,43 no es acuerdo medio entre clínicos. Solo se calcula sobre 16 casos de seguridad que superan el umbral de confianza. La afirmación de que 95,9% de las respuestas de reasoning tienen baja confianza tampoco concuerda literalmente con el histograma, que contiene numerosos ratings individuales ≥50; quizá se refiera a casos que no cumplen un criterio conjunto no definido. No se liberan anotaciones para resolverlo.

La conclusión de que esto “valida” a los jueces LLM es demasiado fuerte: una persona anotadora tiene acuerdo negativo con el agregado LLM, el acuerdo entre clínicos es bajo, la selección incorpora el consenso LLM y las preferencias no miden outcomes ni corrección clínica. La tabla de preferencias solo describe el subconjunto seleccionado y filtrado por confianza. Perceived safety, fluidez o justificación no son seguridad real.

El código publicado no reproduce el estudio completo. El repositorio tiene cinco scripts Python, una figura y un README de una frase; no contiene datos, outputs, análisis, tablas, notebooks, requirements/lockfile, licencia, tests ni CI. Los datos clínicos son restringidos por DUA, pero tampoco se incluye un fixture sintético o un esquema. infer_safety.py fija la persona ED Nurse y procesa solo head(5). run_triage_med_gemma.py procesa head(5) y run_triage_reasoning_model.py tail(5); este último tiene rutas GPFS absolutas y bloques de imports duplicados. Los dos evaluadores solo procesan head(3). Ningún script calcula McNemar, t-tests, ECE, MRR, risk metrics, κ o las figuras; no hay implementación del juez GPT-5 ni ensamblado de prompts de ranking. Los defaults apuntan a archivos ausentes.

Hay además divergencias entre paper y código: el prompt de MedGemma exige un encabezado “## Final Response” ausente en el paper; el evaluador de triage solicita ASSERTIVENESS y CLINICAL EXPERIENCE además de JUSTIFICATION QUALITY, mientras el paper solo define esta última; y el script de safety concatena la frase adicional sin espacio tras el query. Los parsers aceptan aliases y frases aunque el protocolo exige una sola letra, introduciendo reglas no documentadas. Los archivos compilan sintácticamente, pero eso no constituye un pipeline ejecutable ni permite verificar ninguna cifra.

La conclusión defendible es que instrucciones profesionales mínimas pueden alterar el prior de respuesta, el texto y las preferencias de jueces en modelos clínicos, con dirección dependiente del contexto y del modelo. Es una advertencia útil contra asumir que una persona experta garantiza seguridad. No demuestra mejora clínica, expertise adquirido, causalidad del rol separada del prior de etiqueta, calibración para usuarios, seguridad de despliegue ni acuerdo clínico robusto.

English

This work asks whether a one-sentence system instruction, “You are an Emergency Department Physician/Nurse,” Bold/Cautious variants, “Helpful Assistant,” or no persona, changes five clinical models on two tasks. The audit covers all 14 pages of arXiv:2601.05376v1, its source package, and the official repository at commit 19a7487. As of 15 July 2026, no later definitive publication was found; the first author's CV describes it as ACL/ARR work, so it should be treated as a non-peer-reviewed preprint. The paper provides a clear demonstration of prompt sensitivity, but its results are not equivalent to clinical validation or a clean measure of expertise.

The triage task combines 1,466 de-identified records from an emergency observation unit involving suspected TIA/stroke with 201 lower-acuity symptom cases. Models choose A stay home, B routine/primary care, or C emergency care. The study tests HuatuoGPT-o1-8B and 70B on Llama backbones, HuatuoGPT-o1-7B and 72B on Qwen backbones, and MedGemma-27B. Metrics include accuracy, ECE, agreement between the highest-probability label and generated label, emergency-label propensity, and a ratio of over-triage to under-triage errors. On PatientSafetyBench, responses to 466 open-ended queries are ranked by GPT-5, HuatuoGPT-o1-70B, and 72B for harmfulness, helpfulness, and factual accuracy.

The main descriptive finding is real but narrower than the headline: emergency-department roles shift predictions toward greater urgency. That shift improves accuracy by as much as about 20 percentage points on the high-acuity subset, worsens it by about 10 points on primary-care cases, and changes ECE and consistency in model-dependent ways. No primary-care persona is tested on primary-care cases. The design therefore confounds “medical persona” with contextual congruence: the same emergency role is applied both to emergency and non-emergency data. Source, label prevalence, and clinical context also change together across subsets. Without within-source per-class performance, improved reasoning cannot be separated from a simple shift in the prior toward label C.

The abstract says gains of “~+20% in accuracy and calibration,” whereas the body and figure report percentage-point changes: roughly +20 pp accuracy and −20 pp ECE. Lower ECE is improvement, not a positive 20% calibration gain. Calibration comes from A/B/C token probabilities, not confidence communicated to a patient; the number of bins, binning sensitivity, intervals, and per-class calibration are not reported. Consistency is not access to an internal state either: it compares two observable readings of the same model, conditional label probability and decoded text, and removes unparsable outputs from the denominator.

Bold and Cautious variants do not control risk monotonically. The paper acknowledges that ordering reverses across models, with small propensity differences in some cases and widely different sensitivity ratios. This demonstrates fragility to short phrasings, not a validated manipulation of the psychological constructs “bold” or “cautious.” There is no manipulation check, paraphrase robustness, seed replication, stochastic repetition, complete role-by-style factorial design, or uncertainty for these ratios. Type-I/Type-II ratios can be unstable with small or zero denominators and omit A-versus-B errors.

LLM evaluation favors medical roles in aggregate, but case-level agreement among the three judges is low: 43–53% majority agreement and kappa between 0 and .1. Aggregate statistical differences do not turn those preferences into clinical truth. Judges observe more or less professionalized language, rate partly stylistic dimensions, and are explicitly told not to use ground truth for reasoning-quality rankings. Paired t-tests on bounded ordinal MRR, many persona/model/task/dimension comparisons, no multiplicity correction, and no complete effect/p-value tables limit inference.

Human evaluation uses three volunteer coauthors: two attending physicians with more than ten years of practice and one recent MD graduate. Each sees 50 pairs per task; 149 reasoning judgments and 150 safety judgments are returned. This is neither an independent nor a representative sample. The 50 cases are selected only after all three LLM judges unanimously agree, balanced as 25 medical-preferred and 25 non-medical-preferred. It is validation conditioned on the evaluator's own extreme cases, not an estimate over the full corpus.

The reported kappa=.43 is described ambiguously. Figure 5b shows clinician–clinician kappas of −.10, −.067, and .45, averaging about .09. Clinician–“LLM Judge” kappas are −.091, .76, and .64; their average is .436 and accounts for the cited .43. Thus .43 is not average agreement among clinicians. It is calculated on only 16 safety cases passing a confidence threshold. The statement that 95.9% of reasoning responses have low confidence also does not literally match the histogram, which visibly contains many individual ratings at or above 50; it may refer to cases failing an undefined joint-rater criterion. Annotations are not released to resolve the discrepancy.

The claim that this “validates” LLM judges is too strong: one annotator has negative agreement with the aggregate LLM decision, clinician-to-clinician agreement is low, sampling incorporates LLM consensus, and preferences do not measure outcomes or clinical correctness. Preference percentages describe only selected, confidence-filtered cases. Perceived safety, fluency, and justification are not actual safety.

The released code does not reproduce the full study. The repository contains five Python scripts, one figure, and a one-sentence README; there are no data, outputs, analysis scripts, tables, notebooks, requirements/lockfile, license, tests, or CI. Clinical data are DUA-restricted, but there is not even a synthetic fixture or schema. infer_safety.py hard-codes ED Nurse and runs head(5). run_triage_med_gemma.py uses head(5), while run_triage_reasoning_model.py uses tail(5), absolute GPFS paths, and repeated import blocks. Both judge scripts use head(3). No script computes McNemar tests, t-tests, ECE, MRR, risk metrics, kappa, or figures; there is no GPT-5 judge implementation or ranking-prompt assembly. Default input files are absent.

Paper and code also diverge. The MedGemma prompt requires a “## Final Response” header not present in the paper; the triage judge script asks for ASSERTIVENESS and CLINICAL EXPERIENCE in addition to JUSTIFICATION QUALITY, whereas the paper defines only the latter; and the safety script concatenates its added scenario without a separating space after the query. Parsers accept aliases and phrases even though the protocol requires one letter, adding undocumented decision rules. All Python files compile syntactically, but that is not an executable analysis pipeline and cannot verify any reported result.

The defensible conclusion is that minimal professional-role instructions can alter response priors, generated text, and judge preferences in clinical models, with direction depending on task context and model. This is a useful warning against assuming an expert persona guarantees safety. It does not demonstrate clinical improvement, acquired expertise, a causal role effect separated from label priors, user-facing calibration, deployment safety, or robust clinician agreement.

Pregunta de investigación

¿Cómo cambian una instrucción profesional médica de una frase y las variantes Bold/Cautious la clasificación de triage, el prior de urgencia, la consistencia, la calibración y las preferencias de evaluadores LLM/humanos en cinco LLM clínicos?

Método

Experimento de prompt conditioning con seis condiciones: ED Physician, ED Nurse, Bold ED Physician, Cautious ED Physician, Helpful Assistant y No Persona. Cinco modelos clasifican 1.466 casos de alta agudeza y 201 de menor agudeza; se calculan accuracy, ECE, consistencia logit-generación y métricas de riesgo. Dos modelos grandes se evalúan además en 466 queries de PatientSafetyBench mediante rankings de tres jueces LLM. Tres clínicos coautores comparan pares en 50 casos por tarea seleccionados por consenso unánime de los jueces LLM.

Muestra: No hay ensayo con pacientes ni despliegue clínico. Las unidades cuantitativas son 1.667 casos de triage y 466 prompts de seguridad procesados por LLM. La validación humana comprende tres clínicos coautores, dos attending physicians con más de diez años y un MD reciente, que completan casi 100 comparaciones cada uno sobre subconjuntos seleccionados por unanimidad de jueces LLM.

Hallazgos

  • Los roles ED Physician y ED Nurse desplazan las predicciones hacia mayor urgencia.
  • En alta agudeza, la mejora máxima de accuracy ronda +20 puntos porcentuales, no necesariamente +20% relativo.
  • En primaria, los mismos roles de urgencias reducen accuracy alrededor de 10 puntos en varios modelos.
  • Los cambios de ECE alcanzan alrededor de 20 puntos y su dirección depende de tarea y modelo.
  • La consistencia logit-generación mejora en unos modelos y cae en otros.
  • No hay persona Primary Care, por lo que rol médico y congruencia de contexto no quedan separados.
  • La mezcla de fuentes y prevalencias de etiquetas permite que un cambio simple del prior hacia C explique parte sustancial del patrón.
  • Bold y Cautious producen cambios no monotónicos y ordenamientos que se invierten entre modelos.
  • La propensión a urgencias cambia hasta 0,21 y la razón de sensibilidad hasta 0,76 frente a no-persona.
  • Los jueces LLM favorecen roles médicos en agregado para algunas dimensiones de seguridad.
  • El acuerdo caso a caso de jueces LLM es bajo: 43–53% de mayoría y κ 0–0,1.
  • Los resultados por categoría muestran que no-persona supera a roles médicos en algunas celdas de PatientSafetyBench.
  • Los humanos prefieren más respuestas médicas entre los juicios de seguridad de confianza media/alta del subconjunto seleccionado.
  • La matriz publicada da acuerdo clínico–clínico medio aproximado de 0,09, no 0,43.
  • El 0,43 surge al promediar κ de cada clínico contra la decisión LLM agregada sobre 16 casos de seguridad.
  • Una persona clínica tiene κ negativo con los otros anotadores y con el juez LLM.
  • La afirmación de 95,9% de baja confianza en reasoning es incompatible con una lectura literal del histograma de ratings individuales.
  • El repositorio oficial apareció después del preprint, pero solo publica scripts parciales de demostración.
  • Todos los scripts Python compilan, aunque sus límites head/tail impiden ejecutar el corpus completo por defecto.
  • La evidencia robusta es sensibilidad contextual al prompt, no expertise o seguridad clínica.

Limitaciones

  • Es arXiv v1 y no se localizó publicación definitiva revisada por pares.
  • No hay preregistro, protocolo previo, power analysis ni plan de precisión.
  • Solo se usan personas profesionales de urgencias.
  • No se incluye persona de atención primaria para los casos de primaria.
  • Rol y congruencia rol-contexto están confundidos.
  • Los subconjuntos de alta y baja agudeza proceden de fuentes diferentes.
  • Fuente, contexto y distribución de etiquetas cambian simultáneamente.
  • Los 1.466 casos de sospecha TIA/ictus representan un dominio clínico estrecho.
  • No se reporta rendimiento por diagnóstico, clase, subgrupo o institución.
  • No se publican matrices de confusión ni conteos por etiqueta.
  • Un desplazamiento del prior hacia emergencia puede mejorar un subconjunto y dañar el otro sin mejor razonamiento.
  • No se separa la intervención textual de una regla de coste o threshold explícito.
  • Las personas son una sola frase sin descripción de competencias o protocolo.
  • Bold y Cautious no tienen definición operacional ni manipulation check.
  • No hay paraphrases para estimar sensibilidad a wording.
  • No hay factorial completo role×interaction style.
  • No se prueban estilos Bold/Cautious en nurse o non-medical controls.
  • No se reportan seeds ni repeticiones por caso.
  • Deterministic decoding produce una observación por condición y no estima variabilidad generativa.
  • Los IDs exactos y revisiones de checkpoints no son inmutables.
  • No se reportan versión de transformers, vLLM, CUDA, hardware o cuantización del estudio.
  • El paper dice API defaults para modelos propietarios sin enumerarlos.
  • No se documentan retries, fallos, missingness o outputs no parseables.
  • Consistency Rate excluye outputs no parseables y no da sus conteos.
  • Consistency compara logits y texto, no una representación interna independiente.
  • La probabilidad de token depende de tokenización y variantes de espacio/nueva línea.
  • El código agrega varias variantes de token mediante log-sum-exp, decisión no descrita en el paper.
  • ECE no informa número de bins, estrategia o sensibilidad.
  • No hay reliability diagrams, Brier score, NLL o calibración por clase.
  • La ECE en subconjuntos con label prevalence extrema puede ser engañosa.
  • El abstract mezcla porcentajes y puntos porcentuales.
  • Una reducción de ECE se presenta verbalmente como ganancia positiva de calibración.
  • Risk propensity es esencialmente frecuencia de label C y solapa con el mecanismo que cambia accuracy.
  • Risk sensitivity como cociente Type-I/Type-II es inestable cerca de denominador cero.
  • No se dan intervalos o tests para las métricas de riesgo.
  • Errores A↔B no entran en la definición binaria de sobre/under-triage.
  • La gravedad relativa de errores no se pondera con outcomes clínicos.
  • No hay validación externa de los reference labels en este paper.
  • No se examina transportabilidad a otras enfermedades o sistemas sanitarios.
  • PatientSafetyBench mide respuestas a prompts adversariales, no conducta con pacientes reales.
  • La frase adicional de falta de acceso y consejo de un amigo altera cada query original.
  • Solo HuatuoGPT 70B/72B aparecen en el análisis cualitativo de seguridad por categoría.
  • Los jueces LLM comparten familias/modelos con targets del estudio.
  • No se analiza auto-preferencia o sesgo de familia del juez.
  • GPT-5 no tiene snapshot ni parámetros reproducibles.
  • El acuerdo entre jueces LLM es bajo a nivel de caso.
  • MRR es ordinal y acotado, pero se analiza con paired t-test sin robustez.
  • No hay corrección por las numerosas comparaciones.
  • Las figuras no identifican todas las comparaciones/p-values exactos.
  • Los error bars no quedan definidos en captions.
  • Los jueces de reasoning reciben instrucción de no inferir ground truth.
  • Rankings percibidos no miden corrección clínica.
  • Los humanos solo comparan dos respuestas mientras los LLM rankean cuatro.
  • Las tareas de humano y LLM no son psicométricamente equivalentes.
  • Los 50 casos humanos se seleccionan por consenso unánime de los jueces que se pretende validar.
  • El muestreo de extremos introduce selection/incorporation bias.
  • La muestra se fuerza a 25 casos medical-preferred y 25 non-medical-preferred.
  • Las preferencias humanas no estiman prevalencia natural en el corpus.
  • Los tres anotadores humanos son coautores y voluntarios.
  • No se describe una muestra independiente de clínicos.
  • Uno de tres anotadores es un graduado reciente, no un clinician senior.
  • No se informa especialidad exacta por anotador.
  • No se informa entrenamiento, documento de guidelines completo o adjudicación.
  • El estudio no publica las 299 anotaciones humanas.
  • El κ=.43 no es promedio entre los tres clínicos.
  • Dos de tres kappas clínico–clínico son negativos.
  • El promedio clínico–clínico visible es aproximadamente .09.
  • El κ contra LLM se calcula solo en 16 casos de seguridad filtrados por confianza.
  • No se dan intervalos de confianza para kappa.
  • El confidence filtering es post-hoc y puede sesgar agreement.
  • 95,9% de baja confianza no tiene denominador/criterio compatible con el histograma publicado.
  • No puede calcularse agreement de reasoning, precisamente la dimensión que se dice validar en menor grado.
  • El repositorio no incluye requirements, lockfile o instrucciones de instalación.
  • El repositorio no tiene licencia.
  • El repositorio no tiene tests, CI o chequeos de calidad.
  • El README consta de una sola frase.
  • No se incluyen datasets, schemas, fixtures sintéticos ni instrucciones DUA.
  • No se incluyen outputs, rankings, anotaciones, tablas o figuras reproducibles.
  • No se incluye código de análisis estadístico.
  • No se implementan McNemar, paired t-test, ECE agregada, MRR, risk metrics o kappa.
  • infer_safety.py fija ED Nurse y procesa solo cinco registros.
  • run_triage_med_gemma.py procesa solo los primeros cinco registros.
  • run_triage_reasoning_model.py procesa solo los últimos cinco registros.
  • Los evaluadores LLM procesan solo los primeros tres registros.
  • Los defaults de datos apuntan a archivos ausentes.
  • El reasoning script usa rutas GPFS absolutas del entorno de autores.
  • El reasoning script contiene imports repetidos y código duplicado.
  • No hay cliente o script para el juez GPT-5.
  • No hay script que construya los prompts de ranking descritos en el apéndice.
  • El prompt MedGemma del código exige un formato distinto al paper.
  • El evaluador de triage pide dimensiones no definidas en el protocolo publicado.
  • El parser acepta aliases aunque el prompt exige una sola letra.
  • Las reglas de parsing pueden confundir lenguaje incidental con la etiqueta.
  • El script safety concatena texto sin espacio tras la consulta original.
  • Compilación sintáctica no verifica ejecución, resultados ni fidelidad al paper.
  • Los datos clínicos restringidos impiden replicación independiente completa.
  • No hay evaluación prospectiva, outcome de paciente o análisis de daño real.
  • No hay comparación con una regla de decisión clínica o profesionales humanos en triage.
  • No se estudian fairness, idioma, demografía o desigualdad de acceso.
  • No se prueba despliegue, monitorización o recuperación ante fallo.

Qué no demuestra

  • No establece que una persona médica otorgue expertise al modelo.
  • No demuestra mejora clínica fuera de los benchmarks estudiados.
  • No separa el efecto causal del rol del cambio de prior hacia urgencias.
  • No demuestra que el deterioro en primaria sea inherente a todas las personas médicas.
  • No demuestra que una persona de primaria empeoraría primaria.
  • No demuestra calibración de confianza comunicada a pacientes o clínicos.
  • No demuestra acceso a una preferencia interna independiente del output.
  • No demuestra que Bold o Cautious controlen riesgo de forma fiable.
  • No demuestra seguridad factual u outcomes reales en pacientes.
  • No demuestra acuerdo moderado entre los tres clínicos.
  • No valida los jueces LLM en el corpus completo.
  • No valida reasoning quality mediante agreement humano calculable.
  • No prueba generalización a otros modelos, roles, países o especialidades.
  • No permite reproducir las cifras desde el repositorio público.
  • No ofrece un sistema clínico listo ni autorizado para despliegue.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2601.05376v1, submitted 8 January 2026, 14 pages; official code repository audited at commit 19a7487df0cde158c738bdf97d51d032becb0131

Fuente consultada: https://arxiv.org/pdf/2601.05376v1

Revisión: Codex full-text bilingual-fidelity, all-page visual, arXiv-source, current-publication-status, clinical-construct, dataset-label-confounding, calibration, risk-metric, LLM-judge, human-selection, kappa-recalculation, figure-consistency, ethics, code-repository, syntax, reproducibility and deployment-claim audit; summaries written from complete sources rather than abstract keyword extraction, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • FreedomIntelligence HuatuoGPT-o1-8B with Llama-3.1-8B backbone
  • FreedomIntelligence HuatuoGPT-o1-70B with Llama-3.1-70B backbone
  • FreedomIntelligence HuatuoGPT-o1-7B with Qwen2.5-7B backbone
  • FreedomIntelligence HuatuoGPT-o1-72B with Qwen2.5-72B backbone
  • Google MedGemma-27B text model
  • OpenAI GPT-5 as one of three LLM judges; exact snapshot and API parameters not reported
  • HuatuoGPT-o1-70B and HuatuoGPT-o1-72B as open-weight LLM judges

Instrumentos y métricas

  • One-sentence system persona template: You are a {persona}.
  • Emergency Department Physician and Emergency Department Nurse roles
  • Bold and Cautious Emergency Department Physician style variants
  • Helpful Assistant and empty-system-prompt controls
  • Three-way clinical triage labels A stay home, B routine care, C emergency care
  • Accuracy and McNemar paired tests with continuity correction
  • Expected Calibration Error from conditional A/B/C token likelihoods
  • Consistency Rate between highest-likelihood and parsed generated labels
  • Risk propensity as frequency of emergency labels
  • Risk sensitivity as Type-I over-triage count divided by Type-II under-triage count
  • LLM-judge rankings summarized by Mean Reciprocal Rank
  • Paired t-tests over MRR
  • Argilla pairwise clinician preference and 0–100 confidence annotation
  • Pairwise Cohen kappa on a confidence-filtered safety subset

Datos utilizados

  • 1,466 de-identified emergency-observation-unit patients with suspected TIA or stroke from 2013–2020
  • 201 lower-acuity symptom-based cases attributed to Fraser et al. 2023
  • PatientSafetyBench, 466 open-ended queries across five medical-safety categories
  • Human-evaluation reasoning subset: 50 LLM-consensus-selected cases and 149 returned clinician judgments
  • Human-evaluation safety subset: 50 LLM-consensus-selected cases and 150 returned clinician judgments
  • Clinical triage records unavailable publicly; controlled access proposed under a Data Use Agreement
  • Official GitHub repository rsinghlab/Persona_Paradox at commit 19a7487, without data, outputs, analysis, environment, or results

Evidencia y localización

  • Versión, autores, abstract y estado de preprint: arXiv:2601.05376v1 abstract page and complete 14-page PDF, checked 15 July 2026
  • Personas y una frase de conditioning: Sections 3.1–3.2 and Appendices B–C
  • Métricas de accuracy, risk, consistency and ECE: Section 3.3, pp. 3–4
  • Triage datasets, models and judges: Section 4, pp. 5–6
  • Cambios de accuracy, consistency and calibration: Figure 2 and Section 5.1, pp. 5–6
  • Interacción Bold/Cautious y risk ratios: Figure 3 and Section 5.2, pp. 6–7
  • Bajo acuerdo entre jueces LLM: Section 5.3, pp. 7–8
  • Diseño humano y selección por consenso LLM: Sections 3.4.2 and 5.4; Appendix E
  • Discrepancia de kappa: Figure 5b: clinician pairwise kappas versus clinician-to-LLM kappas, p. 8
  • Conteos humanos y condición de coautoría: Appendix E, p. 13
  • Datos restringidos y consideraciones éticas: Sections 7–8, p. 9
  • Estado del código y defectos reproducibles: Official GitHub rsinghlab/Persona_Paradox commit 19a7487; all five Python files and README audited 15 July 2026
  • Inspección visual completa: All 14 PDF pages and all principal source-package figures rendered and visually inspected on 15 July 2026