PERSONAJUDGE pregunta si un modelo juez puede reproducir el criterio de una persona concreta a partir de decisiones anteriores de esa misma persona. El estudio usa dos tareas del conjunto Anthropic Helpful and Harmless: 700 conversaciones únicas para helpfulness y otras 700 para harmlessness, cada una anotada por tres personas. Participan 32 anotadores profesionales de un equipo interno; 21 trabajan en cada tarea y 10 aparecen en ambas. Cada anotador completa 100 comparaciones con tres respuestas posibles, preferir A, neutral o preferir B, para un total de 4.200 juicios humanos. En una segunda fase revisa la reproducción de su interacción y verbaliza retrospectivamente cómo entendió la conversación, evaluó las respuestas y decidió. El sistema conserva la etiqueta, telemetría de interfaz, clics, desplazamiento, selección, espera y escritura, y esa explicación post hoc. No es una muestra de preferencias de la población general ni una simulación completa de personas: el objetivo empírico es predecir etiquetas de evaluadores profesionales en dos tareas muy próximas.
Por persona y tarea, 40 ítems forman el banco de demostraciones y 60 el conjunto de validación. PERSONAJUDGE descompone cada predicción en dos rondas: primero decide si esa persona expresaría preferencia o neutralidad y, si prevé preferencia, elige su dirección. Cruza cuatro modelos, Claude 3.5 Sonnet V2, Claude 3.7 Sonnet V1, DeepSeek-R1 y Amazon Nova Premier, cuatro contenidos de demostración, solo juicio; juicio más telemetría; juicio más razonamiento retrospectivo; o los tres, y 1, 2, 4 u 8 ejemplos. Son 64 condiciones, 80.640 simulaciones por tarea y 161.280 en total. Los ítems de validación no entran en el banco, pero cada condición usa una sola muestra aleatoria de demostraciones; no hay repeticiones que estimen la sensibilidad a qué ejemplos concretos caen en el prompt. Tampoco se publican snapshots inmutables, parámetros de inferencia, respuestas de los modelos o un entorno ejecutable.
Promediando las 64 condiciones, el juez sin personalización obtiene exactitud 0,452 en harmlessness y 0,496 en helpfulness; PERSONAJUDGE alcanza 0,480 y 0,510. En el subconjunto comparable, las demostraciones de la persona correcta superan a demostraciones de otros evaluadores por 0,028 puntos en harmlessness, 0,477 frente a 0,450; p=0,019, y 0,044 en helpfulness, 0,515 frente a 0,471; p<0,001. El razonamiento retrospectivo es la señal más útil: juicio más razonamiento promedia 0,505 y 0,537, mientras juicio más telemetría cae a 0,457 y 0,492, incluso por debajo de usar solo etiquetas. La configuración destacada, Claude 3.5 con ocho ejemplos de juicio y razonamiento, llega a 0,581 frente a 0,482 en harmlessness y 0,558 frente a 0,500 en helpfulness. Sus contrastes planificados dan p=0,046 y p=0,008, pero el apéndice muestra que, tras corrección FDR de las comparaciones por configuración, solo 3 de 64 mejoras sobreviven en harmlessness y ninguna en helpfulness. La cifra de “hasta 9,9 puntos” describe el mejor caso seleccionado, no el efecto general.
La personalización detectada es real pero modesta. Frente al predictor que siempre usa la etiqueta más frecuente de cada persona, la media de PERSONAJUDGE no mejora significativamente: diferencia -0,019 con p=0,95 en harmlessness y +0,042 con p=0,14 en helpfulness. En los ítems donde una persona discrepa de la mayoría, 20,2% y 23,3%, acierta su etiqueta exacta en 0,367 y 0,360; cuando el sistema también se aparta del consenso elige la dirección individual correcta en 0,617 y 0,632, por encima del azar binario de 0,5. Aun así, neutralidad es la clase más difícil, con recall 0,356 y 0,242. La exactitud individual varía mucho, de 0,375 a 0,565 y de 0,386 a 0,655. Entre las diez personas presentes en ambas tareas, la simulatabilidad no se transfiere, r=0,181; p=0,616; sí se correlaciona el uso de neutralidad, r=0,728; p<0,05, una inferencia frágil por n=10 y sin réplica externa.
El diseño tiene fortalezas: separa banco y validación, conserva la opción neutral, controla el orden de respuestas, compara contra demostraciones de otras personas y publica resultados por evaluador, clase y configuración. Pero las explicaciones se recogen después de ver una reproducción y pueden racionalizar la decisión, no revelar su causa. El estudio no mide estabilidad test-retest humana, de modo que desconoce el techo de predicción de una etiqueta personal; tampoco prueba otros dominios, idiomas, modalidades o poblaciones. La documentación afirma consentimiento y confidencialidad del audio, pero no identifica revisión ética, compensación, país, demografía ni condiciones laborales. El TeX de arXiv contiene el prompt, tablas y figuras, pero no los 4.200 juicios, telemetría, transcripciones, 161.280 predicciones, scripts, seeds ni el workbook citado. Por tanto, la contribución defendible es un experimento amplio que demuestra una señal incremental y dependiente del contexto en ejemplos históricos de evaluadores. No demuestra una personalidad estable, una copia fiable de la persona, generalización fuera de estas tareas ni capacidad para sustituir evaluadores humanos.