Towards Effective Model Editing for LLM Personalization

Inducción y control de rasgos2025arXivRevisión editorial aprobada

Autores: Baixiang Huang, Limeng Cui, Jiapeng Liu, Haoran Wang, Jiawei Xu, Zhuiyue Tan, Yutong Chen, Chen Luo, Yi Liu, Kai Shu

Palabras clave: LLM Personalization, Model Editing, User Preferences, UPQA, Preference Persistence

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

10
Autores
6
Hallazgos
8
Limitaciones
5
Evidencias

Resumen editorial

Español

Este preprint propone tratar la personalización por preferencias como edición de conocimiento: para cada dato del usuario se forma una asociación sujeto-relación-respuesta y se aplican editores ya existentes, FT-L, FT-M, LoRA, ROME, GRACE e ICE, para que el modelo recuerde la respuesta deseada sin incluirla de nuevo en cada prompt. «Personalization Editing» es, por tanto, un marco de aplicación y evaluación, no un algoritmo de edición nuevo. Su aporte metodológico adicional es representar una preferencia mediante grupos de hasta nueve sinónimos del tipo de atributo, preguntas y respuestas alternativas, y ejecutar varias ediciones léxicamente relacionadas. El trabajo también publica UPQA, un benchmark de respuesta corta construido a partir de atributos de Synthetic Persona Chat. Claude Sonnet 4 transforma cada atributo sintético en una pregunta directa, una paráfrasis, una pregunta implícita, una solicitud de producto y una respuesta breve. El archivo liberado contiene exactamente 1.000 atributos, no consultas observadas de usuarios reales: llamar «in-situ» a preguntas generadas por otro LLM exagera su procedencia. La auditoría encuentra 172 tipos de atributo, pero los diez más frecuentes concentran 646 casos y 104 tipos aparecen una sola vez. Además, muchas plantillas se reutilizan con respuestas incompatibles: solo hay 188 preguntas directas únicas; 878 de los 1.000 registros comparten una pregunta directa que en otro registro exige otra respuesta, y «What's my hobby?» aparece 191 veces. El subconjunto de 100 sí contiene diez casos de cada una de diez categorías; el denominado equilibrado de 200 tiene distribuciones entre 17 y 21 y se obtiene tomando los primeros registros disponibles. No existe una partición por usuario, preferencia o dominio: se edita una respuesta y se prueban variantes generadas del mismo elemento. Así, «generalización» significa transferencia intracasos a paráfrasis o pistas relacionadas, no generalización a usuarios o preferencias nuevas. Los resultados muestran una heterogeneidad importante. En la Tabla 3, sobre 100 casos y cuatro modelos, FT-M promedia 100 % en pregunta explícita, 97,42 % en paráfrasis y 83,75 % en implícita; LoRA alcanza 100 %, 75,67 % y 51,25 %. En cambio, ROME obtiene 99,5 % en la pregunta directa pero solo 9,58 % y 2,75 % en paráfrasis e implícita; GRACE logra 96,92 %, 0,67 % y 3,08 %. Por tanto, insertar la respuesta explícita puede funcionar casi perfectamente sin que el editor aprenda a aplicarla fuera de la plantilla, y la afirmación general sobre los «métodos de edición» oculta que FT-M concentra el resultado fuerte. Los grupos de sinónimos elevan el rendimiento al aumentar de uno a tres elementos y luego tienden a estabilizarse, lo que respalda la utilidad de ampliar la cobertura léxica, no razonamiento sobre preferencias no vistas. En PrefEval, FT-M, ROME y LoRA conservan una tasa alta de reconocimiento de la preferencia tras diez turnos distractores en OLMo2-7B y Qwen3-8B, mientras zero-shot y chain-of-thought caen por debajo del 20 % hacia el turno ocho. Sin embargo, la métrica solo pregunta si la respuesta muestra alguna conciencia de la preferencia; no verifica que sea correcta, útil, consistente o segura. La comparación tampoco incluye RAG ni memoria externa y está diseñada para que los modelos editados tengan la preferencia en parámetros mientras los baselines dependen de contexto desplazable. Las pruebas de efectos secundarios cubren solo Llama y OLMo, tres editores y cinco ediciones por condición, con cambios pequeños en BoolQ, NaturalQuestions, GSM8K y NLI. No prueban localidad o seguridad general. La evaluación usa coincidencia de la respuesta como subcadena y un juez LLM como respaldo. El artículo declara Claude Sonnet 4, pero el código ejecutable usa Claude 3.7 tanto en la precisión como en el diálogo; tampoco hay evaluación humana ni calibración del juez. El repositorio aporta datos, hiperparámetros y 145 archivos Python que compilan, pero no los outputs que el artículo dice incluir. La guía rápida usa un argumento inexistente, faltan un archivo de distractores modificado y el cuaderno de agregación, hay rutas absolutas de los autores y un trabajo se lanza a GPU 25. El estudio ofrece evidencia útil de que FT-M y la augmentación léxica pueden fijar preferencias sintéticas de respuesta corta y resistir distractores bajo este protocolo. No demuestra personalidad psicológica, personalización con usuarios reales, generalización entre personas, superioridad frente a RAG o memoria, ni una reproducción integral disponible hoy. El envío ICLR 2026 fue retirado y el registro ACL ARR de enero de 2026 sigue siendo un envío, no una aceptación.

English

This preprint proposes treating preference personalization as knowledge editing. Each user fact is represented as a subject-relation-answer association, and existing editors, FT-L, FT-M, LoRA, ROME, GRACE, and ICE, are used to make the model recall the desired answer without restating it in every prompt. “Personalization Editing” is therefore an application and evaluation framework, not a new low-level editing algorithm. Its additional methodological idea is to represent one preference with clusters of up to nine alternative attribute names, questions, and target phrasings, then perform several lexically related edits. The paper also releases UPQA, a short-answer benchmark built from attributes in Synthetic Persona Chat. Claude Sonnet 4 converts each synthetic attribute into a direct question, paraphrase, implicit question, product request, and short target. The released file contains exactly 1,000 attributes, not queries observed from real users: describing LLM-generated questions as “in-situ” overstates their provenance. The data audit finds 172 attribute types, but the ten most frequent cover 646 cases and 104 types occur once. Many templates are also reused with incompatible answers. There are only 188 unique direct questions; 878 of the 1,000 rows use a direct question that is paired with another target elsewhere, and “What's my hobby?” appears 191 times. The 100-row subset has ten cases from each of ten categories, whereas the file called balanced at size 200 ranges from 17 to 21 cases per category and selects the earliest available rows. There is no user-, preference-, or domain-held-out split: one answer is edited and generated variants of that same item are tested. “Generalization” consequently means within-item transfer to paraphrases or related cues, not transfer to unseen users or preferences. Results are highly heterogeneous. In Table 3, on 100 cases and four models, FT-M averages 100% on explicit questions, 97.42% on paraphrases, and 83.75% on implicit questions; LoRA reaches 100%, 75.67%, and 51.25%. ROME reaches 99.5% on the direct question but only 9.58% and 2.75% on paraphrase and implicit tests; GRACE reaches 96.92%, 0.67%, and 3.08%. Near-perfect insertion of the explicit answer can therefore coexist with almost no ability to apply it outside the template, and the broad claim about editing methods masks that FT-M carries the consistent result. Synonym clusters improve scores from one to roughly three elements and then tend to plateau, supporting lexical coverage rather than reasoning over unseen preferences. On PrefEval, FT-M, ROME, and LoRA retain high preference-acknowledgement rates through ten inserted distractor turns for OLMo2-7B and Qwen3-8B, while zero-shot and chain-of-thought fall below 20% around turn eight. The metric, however, asks only whether a response shows any awareness of the preference; it does not establish correctness, helpfulness, consistency, or safety. The comparison omits RAG and external memory and deliberately gives edited models parametric access to the preference while prompting baselines rely on displaceable context. Side-effect tests cover only Llama and OLMo, three editors, and five edits per condition, with small changes on BoolQ, NaturalQuestions, GSM8K, and NLI. They do not establish general locality or safety. Accuracy first accepts a target substring and then uses an LLM judge. The paper names Claude Sonnet 4, but the executable accuracy and dialogue evaluators select Claude 3.7; there is no human evaluation or judge calibration. The repository provides data, hyperparameters, and 145 Python files that compile, but not the outputs the paper says are included. Its quick start uses an unsupported argument, a modified distractor file and aggregation notebook are missing, author-machine paths remain hardcoded, and one experiment is assigned to GPU 25. The study provides useful evidence that FT-M and lexical augmentation can encode synthetic short-answer preferences and resist distractors under this protocol. It does not establish psychological personality, real-user personalization, transfer across people, superiority to RAG or memory, or end-to-end public reproducibility. The ICLR 2026 submission was withdrawn, and the January 2026 ACL ARR record remains a submission rather than an acceptance.

Pregunta de investigación

¿Pueden técnicas existentes de edición de modelos fijar preferencias de usuario como asociaciones paramétricas, conservarlas ante diálogo distractor y aplicarlas a variantes explícitas, parafraseadas e implícitas?

Método

Se construye UPQA a partir de 1.000 atributos sintéticos transformados por Claude en cuatro tipos de pregunta y una respuesta corta. Se comparan FT-L, FT-M, LoRA, ROME, GRACE, ICE y prompting sobre seis LLM, se amplían las ediciones con grupos de nueve sinónimos y se adapta PrefEval para insertar hasta diez turnos distractores sin repetir la preferencia en el contexto del modelo editado.

Muestra: UPQA libera 1.000 preferencias sintéticas y evalúa principalmente subconjuntos de 100 o 200; la Tabla 3 usa 100 casos, cuatro modelos y tres ejecuciones. PrefEval usa subconjuntos de 100 o 200 preferencias y la prueba multivuelta principal cubre OLMo2-7B y Qwen3-8B hasta diez turnos.

Hallazgos

  • FT-M es el método más consistente de la Tabla 3: 100 % explícito, 97,42 % en paráfrasis y 83,75 % implícito al promediar cuatro modelos.
  • ROME y GRACE rozan el 100 % en respuesta directa pero caen respectivamente a 9,58/2,75 % y 0,67/3,08 % en paráfrasis/implícita.
  • Los grupos de sinónimos mejoran las variantes parafraseadas e implícitas hasta un punto de rendimientos decrecientes alrededor de tres elementos.
  • Los editores evaluados mantienen reconocimiento de la preferencia con distractores mejor que zero-shot y chain-of-thought, pero la métrica no evalúa la calidad completa de la respuesta.
  • Los cambios en cuatro benchmarks generales son pequeños en Llama y OLMo para ROME, FT-M y LoRA bajo cinco ediciones.
  • La auditoría de UPQA confirma ausencia de duplicados exactos, pero gran reutilización de preguntas con respuestas incompatibles y falta de un corte de generalización por usuario o preferencia.

Limitaciones

  • UPQA deriva de perfiles sintéticos y consultas generadas por Claude, no de interacciones observadas con usuarios.
  • La evaluación reutiliza variantes del mismo dato editado; no prueba usuarios, preferencias ni dominios nuevos.
  • No hay baseline RAG, memoria externa o gestión moderna de contexto.
  • No existe evaluación humana ni calibración o acuerdo del juez LLM.
  • El juez declarado y el implementado difieren: Sonnet 4 en el artículo y Claude 3.7 en el código.
  • La métrica multivuelta mide reconocimiento, no corrección, utilidad, coherencia ni seguridad.
  • Los análisis de efectos secundarios abarcan pocos modelos, métodos y ediciones.
  • Faltan outputs, un archivo de distractores modificado, el cuaderno de agregación, CI y pruebas del pipeline; varios comandos y rutas publicados fallan.

Qué no demuestra

  • No demuestra inducción, medición ni validación de personalidad psicológica.
  • No demuestra personalización con consultas o preferencias reales de usuarios.
  • No demuestra que todos los editores generalicen; varios solo memorizan la respuesta directa.
  • No demuestra transferencia a personas, atributos o dominios no vistos.
  • No demuestra superioridad frente a RAG, memoria externa o recuperación de perfiles.
  • No demuestra que reconocer una preferencia produzca una respuesta correcta o segura.
  • No permite reproducir hoy todas las tablas y figuras a partir del artefacto público.
  • No es un artículo aceptado en ICLR 2026 ni, a fecha de auditoría, en ACL 2026.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2512.13676v1; current ACL ARR and withdrawn ICLR records checked

Fuente consultada: https://arxiv.org/pdf/2512.13676

Revisión: Codex 15-page visual, current arXiv/OpenReview status, full-method, UPQA row-level, question-collision, clustered-data, metric-implementation, official-code, reproducibility, construct-validity and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Llama-3-8B-Instruct
  • Mistral-7B-Instruct-v0.3
  • GPT-J-6B
  • OLMo-7B-Instruct-hf / OLMo2-7B
  • Qwen3-8B
  • DeepSeek-R1-Distill-Qwen-7B
  • Claude Sonnet 4 for data generation according to the paper
  • Claude 3.7 Sonnet in the released evaluators

Instrumentos y métricas

  • FT-L and FT-M fine-tuning editors
  • LoRA
  • ROME
  • GRACE
  • ICE / in-context editing
  • Target-substring and LLM-judge short-answer accuracy
  • Preference acknowledgement rate
  • Synonym-cluster sequential editing
  • BoolQ, NaturalQuestions, GSM8K and NLI side-effect checks

Datos utilizados

  • UPQA generated from Synthetic Persona Chat
  • UPQA balanced 100- and nominally balanced 200-row subsets
  • PrefEval adapted to subject-target editing pairs
  • LMSYS-Chat-1M distraction conversations

Evidencia y localización

  • Formulación de edición, UPQA y generación de preguntas: arXiv v1 sections 3-4 and Appendix C, pp. 3-5 and 13
  • Métodos, métricas y protocolo multivuelta: arXiv v1 sections 5.1-5.2, pp. 5-7
  • Generalización, persistencia y grupos de sinónimos: arXiv v1 Figures 4-7 and sections 5.3-5.5, pp. 7-8
  • Limitaciones, reproducibilidad, efectos secundarios y resultados numéricos: arXiv v1 sections 7-8 and Appendices A-G, pp. 9-15
  • Auditoría de datos, juez, código, estado editorial y fronteras de afirmación: reports/verification/article-260-arxiv-personalization-editing-upqa-synthetic-data-judge-code-and-claim-audit.json