Do Implicit Personalization and Explicit Styles Conflict? PsPLUG: A Lightweight Plug-in for Balancing Personalization and Style in Customized LLMs

Inducción y control de rasgos2026arXivRevisión editorial aprobada

Autores: Yutong Song, Jiang Wu, Shaofan Yuan, Chengze Shen, Jian Wang, Yu Wang, Nikil Dutt, Amir M. Rahmani

Palabras clave: Personalized generation, Style-conditioned generation, Soft prompts, Preference optimization, LaMP benchmark

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

8
Autores
8
Hallazgos
10
Limitaciones
4
Evidencias

Resumen editorial

Español

La versión arXiv v2 estudia si una instrucción explícita de estilo puede borrar los patrones de un usuario que un sistema personalizado intenta conservar, fenómeno que denomina personalization collapse. PsPLUG mantiene congelado un backbone Qwen3 y antepone tres embeddings continuos: un vector de sistema compartido, un vector de usuario y un vector dependiente de la consulta. Para construir el vector de usuario, Qwen3-8B resume diez elementos del historial con un prompt específico de la tarea; BGE-base-en-v1.5 codifica ese perfil y un MLP entrenable lo proyecta al espacio del LLM. El entrenamiento trata la respuesta real del usuario como preferida y una generación impersonal condicionada por el estilo como rechazada dentro de una pérdida Bradley-Terry/DPO. En inferencia, alpha escala solo el vector de usuario.

Sin instrucciones de estilo, el paper evalúa seis tareas de LaMP. PsPLUG obtiene el mejor valor en 12 de 15 métricas, empata con RAG en METEOR de LaMP-7 y queda por detrás de OPPU en accuracy de LaMP-2 y de RAG en METEOR de LaMP-5. Con cuatro estilos, warm, critical, concise y elaborative, sobre LaMP-4, LaMP-5 y LaMP-7, los números lo sitúan primero o segundo en 22 de 24 celdas ROUGE. Queda fuera de los dos primeros en LaMP-5 concise ROUGE-L y LaMP-7 critical ROUGE-L. La tabla contiene al menos seis marcas de mejor/segundo incorrectas, aunque la afirmación de superar el 80% sigue cumpliéndose al recalcular los rangos. No se publican repeticiones, intervalos ni pruebas de significación; varias diferencias son de 0,001 a 0,005.

La evidencia no separa limpiamente persona y estilo. La respuesta positiva fue escrita por el usuario sin la instrucción de estilo nueva, mientras la negativa sí sigue ese estilo; el contraste cambia a la vez personalización y cumplimiento estilístico y no identifica un residual puro. Además, las tablas de estilo llaman personalización a ROUGE contra la referencia original no estilizada: obedecer el estilo puede reducir solapamiento e ignorarlo puede aumentarlo. La evaluación humana y con GPT-5.2 Pro solo se muestra para LaMP-7. El paper no publica cuántos ejemplos fueron anotados, quiénes anotaron, acuerdo interanotador ni puntuaciones crudas. Las correlaciones se calculan sobre medias agregadas de cinco sistemas por cuatro estilos, como máximo 20 puntos, no a nivel de ejemplo, y carecen de incertidumbre. Por ello apoyan asociación direccional entre rankings, no que el juez sea casi indistinguible de humanos ni que mida persona verdadera. Los valores del backbone 8B en la Tabla 4 tampoco coinciden con la Tabla 2: por ejemplo, METEOR de LaMP-5 es 0,321 frente a 0,398.

La reproducibilidad es bloqueante. El enlace anónimo de código de v2 ha caducado. Un repositorio público homónimo contiene cinco scripts parciales para LaMP-7, pero no puede vincularse de forma inequívoca al archivo expirado y no incluye datos, resultados, checkpoints, dependencias, jueces, evaluación humana, tests o CI. El checkpoint guardado por entrenamiento usa claves anidadas incompatibles con las claves planas que exige inferencia; alpha no aparece como opción; la referencia DPO es otra política PsPLUG congelada desde inicialización, no el modelo base de las ecuaciones; y faltan las otras tareas y barridos de estilo. La contribución respalda que un perfil comprimido y un prefijo compartido son una vía plausible de personalización y que los estilos explícitos alteran los resultados de LaMP. No demuestra desentrelazado matemático, una compensación calibrada, eficiencia medida, privacidad, personalidad psicológica ni reproducción extremo a extremo. Bibliográficamente, v2 sigue siendo un preprint y reemplaza el título, abstract y orden de autores de v1.

English

ArXiv v2 studies whether an explicit style instruction can erase user patterns that a personalized system is intended to preserve, a failure mode it calls personalization collapse. PsPLUG freezes a Qwen3 backbone and prepends three continuous embeddings: a shared system vector, a user vector, and a query-dependent vector. To build the user vector, Qwen3-8B summarizes ten history items with a task-specific prompt; BGE-base-en-v1.5 encodes that profile and a trainable MLP projects it into the LLM space. Training treats the real user response as preferred and an impersonal style-conditioned generation as rejected in a Bradley-Terry/DPO loss. At inference, alpha scales only the user vector.

Without style instructions, the paper evaluates six LaMP tasks. PsPLUG is best on 12 of 15 metrics, ties RAG on LaMP-7 METEOR, and trails OPPU on LaMP-2 accuracy and RAG on LaMP-5 METEOR. With four styles, warm, critical, concise, and elaborative, on LaMP-4, LaMP-5, and LaMP-7, the numerical values place it first or second in 22 of 24 ROUGE cells. It falls outside the top two on LaMP-5 concise ROUGE-L and LaMP-7 critical ROUGE-L. The table contains at least six incorrect best/second markings, although the over-80-percent claim still holds when ranks are recomputed. No repeated runs, intervals, or significance tests are reported; several differences are only 0.001 to 0.005.

The evidence does not cleanly separate persona from style. The positive response was written by the user without the newly imposed style instruction, while the negative follows that style; the contrast changes personalization and style compliance at the same time and cannot identify a pure residual. The style tables also call ROUGE against the original unstyled reference a personalization measure: obeying the requested style can reduce overlap, while ignoring it can increase overlap. Human and GPT-5.2 Pro evaluation is shown only for LaMP-7. The paper does not report how many items were annotated, who annotated them, inter-rater agreement, or raw ratings. Correlations use means aggregated over five systems and four styles, at most 20 points, rather than item-level judgments and have no uncertainty. They therefore support directional rank association, not claims that the judge is nearly indistinguishable from humans or measures true persona adherence. The 8B values in Table 4 also conflict with Table 2; for example, LaMP-5 METEOR is 0.321 versus 0.398.

Reproducibility is blocked. The anonymous code link in v2 has expired. A public homonymous repository contains five partial LaMP-7 scripts, but it cannot be unambiguously tied to the expired archive and includes no data, results, checkpoints, dependencies, judges, human evaluation, tests, or CI. Training saves nested checkpoint keys incompatible with the flat keys required by inference; alpha is not exposed; the DPO reference is another frozen PsPLUG policy copied at initialization rather than the equation's base model; and the other tasks and style sweeps are absent. The contribution supports compact-profile prompting as a plausible personalization direction and shows that explicit styles alter reported LaMP behavior. It does not establish mathematical disentanglement, a calibrated trade-off, measured efficiency, privacy, psychological personality, or end-to-end reproduction. Bibliographically, v2 remains a preprint and replaces v1's title, abstract, and author order.

Pregunta de investigación

¿Puede un prefijo continuo derivado del historial preservar patrones específicos del usuario cuando el LLM recibe una instrucción explícita de estilo, y permite escalar en inferencia el compromiso entre ambas señales?

Método

PsPLUG congela Qwen3 y aprende un prefijo de tres vectores: sistema compartido, perfil de usuario y consulta. El perfil resume diez elementos del historial con Qwen3-8B, se codifica con BGE y se proyecta con un MLP. Una pérdida Bradley-Terry/DPO prefiere la respuesta histórica del usuario frente a una generación base condicionada por estilo. La evaluación compara seis tareas LaMP sin estilo, tres tareas generativas bajo cuatro estilos, cinco sistemas, tres tamaños de backbone, cinco intensidades alpha, métricas de tarea, jueces GPT-5.2 Pro y una validación humana insuficientemente documentada.

Muestra: Seis tareas LaMP con 6.542/1.500, 5.073/1.410, 20.000/2.500, 12.500/1.500, 14.682/1.500 y 13.437/1.498 instancias train/validation, respectivamente. Los historiales medios van de 15,7 a 204,6 elementos, pero el perfil usa solo k=10. No se informan usuarios únicos por split ni tamaño del subconjunto humano. La correlación publicada agrega cinco sistemas por cuatro estilos, como máximo 20 puntos por dimensión.

Hallazgos

  • Sin estilo, PsPLUG es mejor en 12 de 15 métricas, empata una y pierde dos; no supera literalmente todos los baselines en todas las métricas.
  • En las 24 celdas ROUGE con estilo, PsPLUG es primero o segundo en 22 al recalcular los rangos numéricos.
  • Las marcas tipográficas de mejor y segundo contienen al menos seis errores que no siempre coinciden con los valores.
  • ROUGE contra una referencia no estilizada no puede separar preservación de usuario y obediencia al estilo.
  • La evaluación humana/LLM de LaMP-7 muestra correlación agregada, pero no valida acuerdo a nivel de ejemplo ni las otras dos tareas generativas.
  • Los resultados 8B de la Tabla 4 divergen de los resultados Qwen3-8B de la Tabla 2 sin explicación.
  • Figura 5 muestra sensibilidad a alpha, pero no publica números, incertidumbre ni una curva independiente de cumplimiento de estilo.
  • La eficiencia se argumenta mediante complejidad asintótica; no se miden latencia, memoria, throughput o tiempo real.

Limitaciones

  • El positivo no está controlado por estilo y el negativo sí, de modo que el contraste de entrenamiento está confundido.
  • No hay teorema o prueba factorial que identifique por separado persona y estilo.
  • No se reportan ejecuciones repetidas, semillas de resultados, intervalos, significación o sensibilidad al muestreo de diez historiales.
  • El protocolo humano omite tamaño de muestra, anotadores, blinding, asignación, acuerdo y puntuaciones crudas.
  • Las correlaciones se calculan sobre medias de sistema-estilo y pueden ocultar desacuerdo a nivel de ejemplo.
  • El juez propietario no tiene snapshot de API/configuración reproducible y recibe una referencia potencialmente incompatible con el estilo arbitrario.
  • Las tablas tienen marcas de ranking erróneas y valores 8B contradictorios.
  • Solo se estudian cuatro estilos escritos a mano, LaMP en inglés y un conjunto estrecho de backbones.
  • El artefacto oficial está expirado y el candidato público es parcial, incompatible y no reproduce tablas.
  • Las afirmaciones de privacidad no se acompañan de implementación cliente, ataques, borrado, consentimiento o garantías formales.

Qué no demuestra

  • Que el objetivo aprenda un residual puro de personalización después de controlar el estilo.
  • Que las respuestas positivas obedezcan cada estilo impuesto.
  • Que persona y estilo sean factores identificables o causalmente separados.
  • Que ROUGE frente a la referencia original mida simultáneamente ambos objetivos sin confusión.
  • Que PsPLUG sea mejor en todas las métricas o que diferencias pequeñas sean estadísticamente fiables.
  • Que los jueces LLM sean casi indistinguibles de humanos o midan persona verdadera a nivel de ejemplo.
  • Que alpha proporcione una compensación calibrada entre dos objetivos medidos por separado.
  • Que la latencia, memoria, throughput o escalabilidad multiusuario sean mínimas en mediciones reales.
  • Que el comportamiento se generalice a otros idiomas, dominios, historiales, estilos abiertos o modelos.
  • Que el código público ejecute el pipeline completo o reproduzca alguna tabla.
  • Que el perfil comprimido preserve toda la historia, no alucine o proteja privacidad.
  • Que se mida personalidad psicológica, estabilidad de rasgos o una representación interna de persona.
  • Que v2 haya sido revisado por pares o publicado fuera de arXiv.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2601.06362v2, 20 pages; TeX source, v1-v2 metadata drift, expired anonymous code artifact and public homonymous candidate commit ea133d4 also audited

Fuente consultada: https://arxiv.org/abs/2601.06362v2

Revisión: Codex 20-page arXiv-v2 visual, TeX-source, v1-v2 metadata, objective-identification, table-ranking, human-LLM aggregation, efficiency and expired/candidate-code audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Qwen3-8B
  • Qwen3 backbone variants labeled 4B and 32B (exact checkpoints not reported)
  • BAAI/bge-base-en-v1.5
  • GPT-5.2 Pro

Instrumentos y métricas

  • Profile-Augmented Generation user profiles
  • Three-token continuous prefix
  • Bradley-Terry/DPO-style preference loss
  • Inference-time user-vector scaling alpha
  • Accuracy, F1, MAE and RMSE
  • ROUGE-1, ROUGE-L and METEOR
  • LLM persona and style judges
  • Human ratings
  • Spearman, Kendall and Pearson correlations

Datos utilizados

  • LaMP-1 Citation Identification
  • LaMP-2 Movie Tagging
  • LaMP-3 Product Rating
  • LaMP-4 News Headline Generation
  • LaMP-5 Scholarly Title Generation
  • LaMP-7 Tweet Paraphrasing

Evidencia y localización

  • Versión actual, arquitectura, objetivo, experimentos, tablas, apéndices y limitaciones: arXiv:2601.06362v2, 20 pages; TeX source archive
  • Deriva de título, abstract y orden de autores: arXiv v1 and v2 metadata records; v2 API and PDF
  • Estado del artefacto oficial y alcance/defectos del candidato público: Anonymous GitHub PsPLUG-038C repository_expired response; hulameow/PsPLUG commit ea133d4
  • Confusión del objetivo, recálculo de rankings, evaluación humana, contradicción 8B, eficiencia y reproducibilidad: reports/verification/article-265-psplug-version-objective-metric-human-evaluation-efficiency-and-artifact-audit.json