Persona-judge es un algoritmo de decodificación para combinar dos descripciones de preferencias sin actualizar parámetros. El mismo checkpoint se carga dos veces, como draft y judge, y recibe prefijos distintos, por ejemplo, creative y vivid, además de la consulta. El draft propone una ventana de lambda tokens desde una distribución q. El judge calcula p bajo el otro prefijo; cada token se acepta con probabilidad min(1,p/q) y, si se rechaza, se remuestrea desde la parte positiva normalizada p−q. La demostración del apéndice establece que, para un paso con q y p fijas, el token corregido queda distribuido exactamente como p. Después los papeles se alternan. Por tanto, “self-judgment” significa que dos instancias del mismo modelo, condicionadas por instrucciones diferentes, comparan distribuciones token a token. No hay una entidad psicológica que se juzgue, un embedding aprendido de persona ni un reward model durante la generación. La etiqueta más precisa es steering multiatributo training-free en tiempo de decodificación. La personalización se limita a criterios escritos por investigadores; ningún usuario expresa preferencias y no se construye un perfil individual. El estudio usa P-Soups/Koala con 50 prompts y HelpSteer2, que se filtra por longitud sin informar el n final. Aplicar el código publicado a la versión oficial vigente deja 146 prompts únicos, pero no se fija una revisión del dataset y por ello no puede asegurarse que sea exactamente la muestra del paper. El backbone principal es Llama-3-Base-8B-SFT y la generalidad se prueba en nueve modelos entre 0,5B y 9B. Los objetivos son helpful, harmless, humor, correct, informative, professional, creative, touching y vivid. En helpful/harmless de P-Soups, Persona-judge obtiene una media 0,93 frente a 0,90 para Aligner y 0,90 para la variante de papeles fijos. Esa media es el promedio aritmético de cuatro salidas procedentes de tres reward models, dos dimensiones de ArmoRM y dos GPT-2 reward models, con escalas distintas; su ponderación no está justificada y la diferencia de 0,03 no tiene intervalo ni test. GPT-4 también compara cada salida con el prompt directo. En nueve modelos y nueve criterios, las tasas de victoria van de 40% a 98% en P-Soups y de 45% a 99% en HelpSteer2. Muchos pares favorecen Persona-judge, pero no todos: hay resultados inferiores a 50%, como 40% en correct para Llama-3.2-3B sobre P-Soups, 45% en helpful para Qwen 0.5B sobre HelpSteer2 y 47% en creative para TinyLlama. Los “87% de ventaja” citados para Gemma 2 9B son una tasa media de preferencia GPT-4 de 82%, 88% y 90%, no una mejora absoluta de 87 puntos. GPT-4 no tiene modelo/version fijado, validación humana, repeticiones ni intervalos; el paper reconoce sesgo de posición, autorrefuerzo, longitud y sensibilidad de prompt, pero solo dice aleatorizar el orden. El término “significativo” es descriptivo, no estadístico. Training-free significa que no se afina un modelo, no que sea barato. La generación requiere dos copias del checkpoint y sus distribuciones. En cuatro A40, el paper reporta 8,82±0,45 s para vivid, 8,91±0,37 s para dos objetivos y 9,13±0,39 s para tres, pero no compara con decodificación ordinaria o prompt directo, no controla tokens y no da throughput; por eso no demuestra eficiencia computacional relativa. El repositorio oficial permite inspeccionar el sampler, pero no reproducir las tablas tal como está. Los dos ficheros de results son texto marcador de 27 y 30 bytes, no resultados. Falta koala_eval_50.json y HelpSteer2 se lee desde una ruta absoluta del ordenador del autor. Los prefijos activos están hardcodeados a vivid/creative. sample_temp, mode, rm_weight, topk y --max_new_token se parsean o pasan pero no afectan a la ruta activa; el generador fija top-k 20, top-p 0,9, temperatura 0,9, semilla 123 y 128 tokens. Esto contradice la descripción de greedy decoding con candidatos top-k. No se publica el evaluador GPT-4 ni sus juicios y no hay una vía funcional para seleccionar lambda 1–6 sin editar código. El README ejecuta solo 10% de P-Soups. El commit auditado precede seis días a arXiv v2 y no tiene tag o release. La conclusión fiel es que un sampler correctivo que alterna dos distribuciones condicionadas puede mejorar con frecuencia, según reward models y GPT-4, la expresión conjunta de atributos de estilo/calidad frente a escribir ambos atributos en un prompt. No demuestra que el sistema aprenda valores humanos individuales, personalidad, satisfacción de usuarios o alineamiento duradero; tampoco demuestra escalabilidad ilimitada, seguridad o ahorro frente a alternativas. Además, afirmar que no hay riesgos identificables omite que el mismo steering podría reforzar preferencias dañinas, engañosas o discriminatorias.
Pregunta de investigación
¿Puede un muestreador token a token, usando dos prefijos de preferencia y dos instancias del mismo modelo, combinar objetivos no vistos sin afinado ni reward model y superar al prompt directo?