El artículo propone Multi-Personality Generation (MPG), una forma de combinar durante la decodificación varios modelos ajustados por separado para atributos de personalidad. Cada modelo de atributo es un adaptador LoRA-DPO sobre Llama-3-8B-Instruct. Speculative Chunk-level Rejection sampling (SCR) genera bloques de cuatro tokens con un modelo de referencia, calcula en paralelo para cada atributo la razón entre la probabilidad del modelo ajustado y la del modelo de referencia, suma esas razones con pesos alpha y acepta el bloque, alguno de sus prefijos o un token de respaldo mediante un umbral M estimado con los últimos veinte scores. La evaluación MBTI usa solo tres perfiles, ESTP, INFJ y ENTJ, sobre 148 registros QA, 93 MCQA y 60 ítems procedentes de 16Personalities. GPT-4o y DeepSeek-R1 puntúan estilo, pensamiento, conducta y naturalidad. El origen del reclamo de mejora del 16%-18% es concreto: el Overall de SCR con referencia DPO sube frente al modelo base de 3,084 a 3,626 con GPT-4o, un 17,57% relativo, y de 3,368 a 3,919 con DeepSeek-R1, un 16,36%. No es una mejora universal. Los autores ajustan alpha mirando la precisión del mismo MBTI-MCQA que después aparece en la tabla y en el Overall, por lo que la cifra afinada no es una estimación completamente held-out. En role-play evalúan 100 perfiles sintéticos adaptados de ALOE, con anotaciones de entrenamiento generadas por ChatGPT-4o. GPT-4o da 4,167 a SCR y 4,166 a MOD; DeepSeek-R1 favorece ligeramente a MOD, 4,241 frente a 4,230. No hay evaluación humana, intervalos, pruebas estadísticas, acuerdo entre jueces ni análisis de variación entre generaciones. En eficiencia, tres ejecuciones sobre 100 prompts y un máximo de 128 tokens dan a SCR 97 tokens/s y 1,20 s por secuencia, frente a 120 y 1,07 para Base, 60 y 2,13 para MOD, 11 y 11,64 para rechazo por secuencia y 30 y 4,27 para rechazo por token. No se identifica el hardware y solo se publican medias. La principal reserva es matemática. La ecuación 7 conserva la inversa del gradiente exigida por el óptimo regularizado, pero las ecuaciones 9-10 la eliminan por ser monótona y afirman que una suma ponderada de log(r_i)+1 es proporcional a una suma ponderada de r_i. No lo es: para reverse KL, aplicar la inversa conduce a una combinación exponencial o producto ponderado, no a la suma aritmética usada por SCR. Preservar el orden no preserva las probabilidades necesarias para rejection sampling. Además, el umbral M es un máximo observado en ventana, no una cota global; si aparece un score mayor, truncar la aceptación a uno sesga la distribución. El paper impone al principio alpha no negativo y de suma uno, y el algoritmo calcula log(alpha), pero luego usa pesos negativos y publica para INFJ [1,0,-9,-3]; el recorte posterior a cero define otra heurística y no la distribución derivada. Por tanto, las tablas pueden describir el rendimiento empírico de una heurística, pero no validan que SCR muestree exactamente del objetivo teórico. La publicación tampoco es reproducible de extremo a extremo. El repositorio oficial, auditado en el commit 57626f1, tiene 16 archivos: datos, README y dos ficheros de constantes de prompts. No contiene implementación MPG/SCR, entrenamiento, evaluación, adaptadores, outputs, juicios crudos, dependencias, tests, CI ni licencia. Los seis datasets públicos suman 21.917 pares y tampoco declaran licencia o procedencia detallada. Hay 426 pares chosen/rejected idénticos y 806 equivalentes tras quitar comillas o el prefijo User Message. En role-play, 2.933 de 7.000 respuestas rechazadas llevan ese prefijo y ninguna elegida lo lleva, un atajo de formato que permite aprender la etiqueta sin aprender personalidad. También existen 25 prompts repetidos entre train y test en los dos datasets de role-play y 70 prompts compartidos entre ambos. La conclusión fiel es estrecha: la implementación no publicada obtuvo mejores medias MBTI que el base bajo dos jueces LLM y un compromiso de velocidad favorable en el ensayo descrito. No queda demostrado el muestreo exacto, la validez psicométrica, la significación, la generalización ni la reproducibilidad.
Pregunta de investigación
¿Puede combinarse en inferencia la señal de varios modelos DPO de un solo atributo para generar texto con múltiples rasgos, manteniendo control y calidad con menos coste que otros métodos de combinación?