La versión arXiv v2 estudia si una instrucción explícita de estilo puede borrar los patrones de un usuario que un sistema personalizado intenta conservar, fenómeno que denomina personalization collapse. PsPLUG mantiene congelado un backbone Qwen3 y antepone tres embeddings continuos: un vector de sistema compartido, un vector de usuario y un vector dependiente de la consulta. Para construir el vector de usuario, Qwen3-8B resume diez elementos del historial con un prompt específico de la tarea; BGE-base-en-v1.5 codifica ese perfil y un MLP entrenable lo proyecta al espacio del LLM. El entrenamiento trata la respuesta real del usuario como preferida y una generación impersonal condicionada por el estilo como rechazada dentro de una pérdida Bradley-Terry/DPO. En inferencia, alpha escala solo el vector de usuario.
Sin instrucciones de estilo, el paper evalúa seis tareas de LaMP. PsPLUG obtiene el mejor valor en 12 de 15 métricas, empata con RAG en METEOR de LaMP-7 y queda por detrás de OPPU en accuracy de LaMP-2 y de RAG en METEOR de LaMP-5. Con cuatro estilos, warm, critical, concise y elaborative, sobre LaMP-4, LaMP-5 y LaMP-7, los números lo sitúan primero o segundo en 22 de 24 celdas ROUGE. Queda fuera de los dos primeros en LaMP-5 concise ROUGE-L y LaMP-7 critical ROUGE-L. La tabla contiene al menos seis marcas de mejor/segundo incorrectas, aunque la afirmación de superar el 80% sigue cumpliéndose al recalcular los rangos. No se publican repeticiones, intervalos ni pruebas de significación; varias diferencias son de 0,001 a 0,005.
La evidencia no separa limpiamente persona y estilo. La respuesta positiva fue escrita por el usuario sin la instrucción de estilo nueva, mientras la negativa sí sigue ese estilo; el contraste cambia a la vez personalización y cumplimiento estilístico y no identifica un residual puro. Además, las tablas de estilo llaman personalización a ROUGE contra la referencia original no estilizada: obedecer el estilo puede reducir solapamiento e ignorarlo puede aumentarlo. La evaluación humana y con GPT-5.2 Pro solo se muestra para LaMP-7. El paper no publica cuántos ejemplos fueron anotados, quiénes anotaron, acuerdo interanotador ni puntuaciones crudas. Las correlaciones se calculan sobre medias agregadas de cinco sistemas por cuatro estilos, como máximo 20 puntos, no a nivel de ejemplo, y carecen de incertidumbre. Por ello apoyan asociación direccional entre rankings, no que el juez sea casi indistinguible de humanos ni que mida persona verdadera. Los valores del backbone 8B en la Tabla 4 tampoco coinciden con la Tabla 2: por ejemplo, METEOR de LaMP-5 es 0,321 frente a 0,398.
La reproducibilidad es bloqueante. El enlace anónimo de código de v2 ha caducado. Un repositorio público homónimo contiene cinco scripts parciales para LaMP-7, pero no puede vincularse de forma inequívoca al archivo expirado y no incluye datos, resultados, checkpoints, dependencias, jueces, evaluación humana, tests o CI. El checkpoint guardado por entrenamiento usa claves anidadas incompatibles con las claves planas que exige inferencia; alpha no aparece como opción; la referencia DPO es otra política PsPLUG congelada desde inicialización, no el modelo base de las ecuaciones; y faltan las otras tareas y barridos de estilo. La contribución respalda que un perfil comprimido y un prefijo compartido son una vía plausible de personalización y que los estilos explícitos alteran los resultados de LaMP. No demuestra desentrelazado matemático, una compensación calibrada, eficiencia medida, privacidad, personalidad psicológica ni reproducción extremo a extremo. Bibliográficamente, v2 sigue siendo un preprint y reemplaza el título, abstract y orden de autores de v1.