Este preprint propone tratar la personalización por preferencias como edición de conocimiento: para cada dato del usuario se forma una asociación sujeto-relación-respuesta y se aplican editores ya existentes, FT-L, FT-M, LoRA, ROME, GRACE e ICE, para que el modelo recuerde la respuesta deseada sin incluirla de nuevo en cada prompt. «Personalization Editing» es, por tanto, un marco de aplicación y evaluación, no un algoritmo de edición nuevo. Su aporte metodológico adicional es representar una preferencia mediante grupos de hasta nueve sinónimos del tipo de atributo, preguntas y respuestas alternativas, y ejecutar varias ediciones léxicamente relacionadas. El trabajo también publica UPQA, un benchmark de respuesta corta construido a partir de atributos de Synthetic Persona Chat. Claude Sonnet 4 transforma cada atributo sintético en una pregunta directa, una paráfrasis, una pregunta implícita, una solicitud de producto y una respuesta breve. El archivo liberado contiene exactamente 1.000 atributos, no consultas observadas de usuarios reales: llamar «in-situ» a preguntas generadas por otro LLM exagera su procedencia. La auditoría encuentra 172 tipos de atributo, pero los diez más frecuentes concentran 646 casos y 104 tipos aparecen una sola vez. Además, muchas plantillas se reutilizan con respuestas incompatibles: solo hay 188 preguntas directas únicas; 878 de los 1.000 registros comparten una pregunta directa que en otro registro exige otra respuesta, y «What's my hobby?» aparece 191 veces. El subconjunto de 100 sí contiene diez casos de cada una de diez categorías; el denominado equilibrado de 200 tiene distribuciones entre 17 y 21 y se obtiene tomando los primeros registros disponibles. No existe una partición por usuario, preferencia o dominio: se edita una respuesta y se prueban variantes generadas del mismo elemento. Así, «generalización» significa transferencia intracasos a paráfrasis o pistas relacionadas, no generalización a usuarios o preferencias nuevas. Los resultados muestran una heterogeneidad importante. En la Tabla 3, sobre 100 casos y cuatro modelos, FT-M promedia 100 % en pregunta explícita, 97,42 % en paráfrasis y 83,75 % en implícita; LoRA alcanza 100 %, 75,67 % y 51,25 %. En cambio, ROME obtiene 99,5 % en la pregunta directa pero solo 9,58 % y 2,75 % en paráfrasis e implícita; GRACE logra 96,92 %, 0,67 % y 3,08 %. Por tanto, insertar la respuesta explícita puede funcionar casi perfectamente sin que el editor aprenda a aplicarla fuera de la plantilla, y la afirmación general sobre los «métodos de edición» oculta que FT-M concentra el resultado fuerte. Los grupos de sinónimos elevan el rendimiento al aumentar de uno a tres elementos y luego tienden a estabilizarse, lo que respalda la utilidad de ampliar la cobertura léxica, no razonamiento sobre preferencias no vistas. En PrefEval, FT-M, ROME y LoRA conservan una tasa alta de reconocimiento de la preferencia tras diez turnos distractores en OLMo2-7B y Qwen3-8B, mientras zero-shot y chain-of-thought caen por debajo del 20 % hacia el turno ocho. Sin embargo, la métrica solo pregunta si la respuesta muestra alguna conciencia de la preferencia; no verifica que sea correcta, útil, consistente o segura. La comparación tampoco incluye RAG ni memoria externa y está diseñada para que los modelos editados tengan la preferencia en parámetros mientras los baselines dependen de contexto desplazable. Las pruebas de efectos secundarios cubren solo Llama y OLMo, tres editores y cinco ediciones por condición, con cambios pequeños en BoolQ, NaturalQuestions, GSM8K y NLI. No prueban localidad o seguridad general. La evaluación usa coincidencia de la respuesta como subcadena y un juez LLM como respaldo. El artículo declara Claude Sonnet 4, pero el código ejecutable usa Claude 3.7 tanto en la precisión como en el diálogo; tampoco hay evaluación humana ni calibración del juez. El repositorio aporta datos, hiperparámetros y 145 archivos Python que compilan, pero no los outputs que el artículo dice incluir. La guía rápida usa un argumento inexistente, faltan un archivo de distractores modificado y el cuaderno de agregación, hay rutas absolutas de los autores y un trabajo se lanza a GPU 25. El estudio ofrece evidencia útil de que FT-M y la augmentación léxica pueden fijar preferencias sintéticas de respuesta corta y resistir distractores bajo este protocolo. No demuestra personalidad psicológica, personalización con usuarios reales, generalización entre personas, superioridad frente a RAG o memoria, ni una reproducción integral disponible hoy. El envío ICLR 2026 fue retirado y el registro ACL ARR de enero de 2026 sigue siendo un envío, no una aceptación.
Pregunta de investigación
¿Pueden técnicas existentes de edición de modelos fijar preferencias de usuario como asociaciones paramétricas, conservarlas ante diálogo distractor y aplicarlas a variantes explícitas, parafraseadas e implícitas?