SynthesizeMe! Inducing Persona-Guided Prompts for Personalized Reward Models in LLMs

Inducción y control de rasgos2025ACL AnthologyRevisión editorial aprobada

Autores: Michael J. Ryan, Omar Shaikh, Aditri Bhagirath, Daniel Frees, William Held, Diyi Yang

Palabras clave: Personalized Reward Modeling, Synthetic User Personas, Pairwise Preferences, LLM-as-a-Judge, PersonalRewardBench

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
10
Hallazgos
22
Limitaciones
6
Evidencias

Resumen editorial

Español

SynthesizeMe convierte un historial breve de elecciones entre dos respuestas en un prompt personalizado para predecir elecciones futuras. No parte de una identidad o de rasgos declarados. Primero pide a un LLM que especule por qué el usuario eligió una respuesta y descarte las explicaciones que no ayudan a predecir un pequeño conjunto de validación. Después resume las explicaciones seleccionadas como una persona en lenguaje natural. Por último busca qué ejemplos previos, junto con esa persona, maximizan la precisión de validación. El prompt que define cómo redactar personas se optimiza con DSPy MIPROv2 en usuarios de PRISM y se transfiere a Chatbot Arena y a otros modelos. El propio paper aclara que el razonamiento inicial se produce sin información de fondo y es especulativo.

La evaluación usa PersonalRewardBench, una curación de dos datasets existentes. Chatbot Arena aporta 131 usuarios y 1.338 pares; PRISM, 723 usuarios, 3.897 conversaciones y 16.705 pares, para un total de 854 usuarios. Se conservan usuarios con al menos cinco preferencias, GPT-4o-mini filtra consultas consideradas personalizables y cinco jueces LLM, ejecutados en ambos órdenes de respuesta, eliminan los casos de acuerdo unánime. Los usuarios se separan 40/10/50% para train, validación y test; dentro de cada usuario, las interacciones temporales se reparten 50/20/30% entre contexto de entrenamiento, validación y objetivo. La auditoría completa de los Parquet confirma los totales y que no hay usuarios ni conversaciones cruzando particiones. También encuentra 12 filas PRISM duplicadas, seis pares con respuestas elegida y rechazada idénticas y hasta 16 pares correlacionados por conversación. El filtro de personalizabilidad solo se comprobó con 100 ejemplos manuales y 50 casos de test, sin acuerdo entre anotadores ni intervalos.

En los jueces LLM, el paper informa mejoras máximas de 4,4 puntos en Chatbot Arena y 3,41 en PRISM. Esas cifras requieren leer qué variante y baseline se comparan: 61,97% para Llama 70B con solo demostraciones frente a 57,57% del baseline Memory en Arena, y 57,76% con solo demostraciones frente a 54,35% del juez por defecto en PRISM. La ablación es decisiva: la persona sin demostraciones empeora al juez por defecto en los modelos 3B y 70B de ambos datasets y solo mejora los dos casos 8B. Todas las configuraciones ganadoras incluyen ejemplos seleccionados. Con el prompt de persona destilado desde 70B, Persona+Demos llega a 61,62% en Arena y 55,24% en PRISM con Llama 8B, frente a 53,70% y 52,80% del juez por defecto. Sin embargo, reward models Bradley-Terry ajustados a cada distribución son bastante más fuertes. Añadir SynthesizeMe solo mejora ligeramente tres de seis configuraciones, siempre dentro de los intervalos, y empeora o no cambia el resto; por eso los autores lo recomiendan principalmente para personalización in-context.

La supuesta fidelidad de las personas tiene una frontera estrecha. Los usuarios de PRISM escribieron una o dos frases sobre lo que querían de un LLM; GPT-4o-mini, no personas evaluadoras, decide si una persona generada coincide fuertemente con esas frases. Las coincidencias verdaderas pasan de 26,5% a 50,2% y 56,1% para 3B, 8B y 70B, mientras los emparejamientos aleatorios rondan 46-47% en 8B/70B; solo 70B está marcado como significativo. Esto valida cierta asociación predictiva, no la verdad de los detalles biográficos o psicológicos. Los anexos muestran prompts que inventan nombre, edad, profesión, valores, intereses y rasgos no observados. El prompt 70B optimizado incluso incorpora temas concretos del conjunto de optimización, arte, justicia social, medio ambiente, pesimismo y esperanza, evidencia de impronta del dataset. Que el texto sea legible no lo convierte en una explicación causal ni en una descripción factual del usuario.

La incertidumbre y los artefactos también limitan la conclusión. El código publicado calcula intervalos re-muestreando por separado las dos órdenes del mismo par y los múltiples pares de una conversación, sin clustering por conversación o usuario, por lo que puede subestimar incertidumbre. El benchmark selecciona casos mediante los mismos tipos de jueces LLM que después se evalúan, y acuerdo unánime no equivale a corrección. Los autores reconocen posible contaminación de modelos Gemini con Chatbot Arena público, bajo realismo longitudinal y riesgo de sicofancia. El repositorio contiene el algoritmo central y los prompts, pero no la construcción completa del benchmark ni scripts para reproducir tablas, baselines o seeds; no tiene tests y su único workflow publica paquetes. `pip install SynthesizeMe` instala hoy la versión estable 0.0.1, que no coincide con el repositorio 0.0.11-alpha.1 ni expone el loader documentado. La versión del repositorio omite la dependencia `datasets` y presenta fallos en carga, fallback de demos y estado previo al entrenamiento. Los dos datasets derivados son públicos y completos, pero sus tarjetas están vacías y sin licencia, no trasladan las condiciones de no reidentificación y licencias de las fuentes, y conservan identificadores PRISM enlazables con perfiles demográficos. La evidencia sólida es que seleccionar ejemplos y, a veces, añadir una hipótesis de persona puede mejorar predicción de preferencias en dos benchmarks filtrados. No demuestra que el sistema descubra quién es el usuario ni que las personas sean verdaderas, seguras o estables.

English

SynthesizeMe turns a short history of pairwise choices into a personalized prompt for predicting future choices. It does not start from a declared identity or trait inventory. First, an LLM speculates about why the user selected one response and validation-driven search retains reasoning that helps predict a small held-out context. The selected explanations are then condensed into a natural-language persona. Finally, the method searches for prior examples that, together with the persona, maximize validation accuracy. The instruction for writing personas is optimized with DSPy MIPROv2 on PRISM users and transferred to Chatbot Arena and other models. The paper explicitly states that the initial reasoning is generated without background knowledge and is purely speculative.

Evaluation uses PersonalRewardBench, a curation of two existing datasets. Chatbot Arena contributes 131 users and 1,338 pairs; PRISM contributes 723 users, 3,897 conversations, and 16,705 pairs, for 854 users in total. Users need at least five preferences, GPT-4o-mini filters queries deemed personalizable, and five LLM judges run in both response orders remove unanimously judged cases. Users are partitioned 40/10/50% into train, validation, and test; within each user, temporally ordered interactions are divided 50/20/30% into training context, validation context, and target preferences. Full Parquet QA reproduces the totals and finds no user or conversation crossing partitions. It also finds 12 duplicate PRISM rows, six pairs with identical chosen and rejected responses, and up to 16 correlated pairs per conversation. The personalizability filter was checked on only 100 manually labeled examples with a 50-case test set, without annotator agreement or uncertainty.

For LLM judges, the paper reports gains up to 4.4 points on Chatbot Arena and 3.41 on PRISM. Those figures depend on the variant and comparator: 61.97% for 70B Just Demos versus the 57.57% Memory baseline on Arena, and 57.76% for 70B Just Demos versus the 54.35% default judge on PRISM. The ablation is central: persona text without demonstrations is worse than the default judge for 3B and 70B on both datasets and improves only the two 8B cases. Every winning configuration contains selected examples. With a persona prompt distilled from 70B, the 8B Persona+Demos variant reaches 61.62% on Arena and 55.24% on PRISM, versus 53.70% and 52.80% for the default judge. Distribution-fitted Bradley-Terry reward models are much stronger, however. Adding SynthesizeMe improves only three of six configurations slightly, always within the reported intervals, and degrades or leaves unchanged the others; the authors therefore recommend it mainly for in-context personalization.

Persona fidelity has a narrow operational meaning. PRISM users wrote one or two sentences about what they wanted from an LLM; GPT-4o-mini, not human raters, decides whether a generated persona strongly matches those statements. True-pair match rates rise from 26.5% to 50.2% and 56.1% for 3B, 8B, and 70B, while random matches remain around 46-47% for 8B/70B; only the 70B comparison is marked significant. This supports some predictive association, not the truth of biographical or psychological detail. Appendix prompts invent unobserved names, ages, occupations, values, interests, and traits. The optimized 70B instruction itself embeds topics from the optimization set, art, social justice, environmental issues, pessimism, and hope, showing dataset imprinting. Readable text is not automatically a causal explanation or factual user description.

Uncertainty and artifacts further narrow the conclusion. The released code bootstraps the two orders of a pair and multiple pairs from one conversation as separate observations, without user or conversation clustering, so uncertainty may be understated. The benchmark is selected with the same class of LLM judges later evaluated, and unanimity is not ground-truth accuracy. The authors acknowledge possible contamination of Gemini models by public Chatbot Arena data, limited longitudinal realism, and sycophancy risk. The repository contains the core algorithm and prompts but not the full filtering pipeline or scripts to reproduce tables, baselines, and seeds; it has no tests and only a publishing workflow. `pip install SynthesizeMe` currently selects stable 0.0.1 rather than repository version 0.0.11-alpha.1 and lacks the documented dataset loader. The repository version omits the `datasets` dependency and has defects in loading, demo fallback, and pre-fit state. Both complete derived datasets are public, but their cards are empty and unlicensed, fail to carry forward upstream no-reidentification and licensing terms, and retain PRISM identifiers linkable to demographic profiles. The supported result is that selected examples and, in some settings, persona hypotheses improve preference prediction on two filtered benchmarks. The paper does not establish that the system discovers who a user is or that its personas are true, safe, or stable.

Pregunta de investigación

¿Puede un sistema inducir una persona textual y seleccionar demostraciones a partir de 5-15 preferencias pareadas para mejorar la predicción de futuras preferencias de cada usuario sin depender de categorías demográficas predefinidas?

Método

Se generan explicaciones especulativas para preferencias de entrenamiento y se seleccionan por precisión en preferencias de validación. Un LLM resume las explicaciones en una persona mediante un prompt optimizado con MIPROv2, y una segunda búsqueda elige demostraciones informativas. Persona y ejemplos condicionan un LLM-as-a-judge o un reward model. La evaluación compara ablations, baselines de memoria y demografía, GPO/VPL/PAL, Bradley-Terry LoRA y transferencia entre familias de modelos en PersonalRewardBench.

Muestra: PersonalRewardBench contiene 131 usuarios de Chatbot Arena, 1.338 conversaciones y 1.338 pares, más 723 usuarios de PRISM, 3.897 conversaciones y 16.705 pares: 854 usuarios en total. Los splits de usuarios son 23/19/89 y 280/65/378. Cada usuario aporta al menos cinco pares y suele tener menos de 25; dentro de usuario se usa 50/20/30% para contexto train, validación y objetivo. El filtro de personalizabilidad se desarrolló con 100 labels manuales. Los artefactos reproducen estos totales, salvo el typo de 720 usuarios PRISM en la Tabla 7.

Hallazgos

  • Las mejoras máximas declaradas son 4,4 puntos en Chatbot Arena y 3,41 en PRISM, ambas logradas por la variante Just Demos con Llama 70B frente a comparadores distintos.
  • La persona sin demostraciones queda por debajo del juez por defecto en 3B y 70B en ambos datasets; solo mejora las condiciones 8B.
  • Todas las configuraciones ganadoras de los seis experimentos principales incluyen demostraciones seleccionadas.
  • Persona+Demos con prompt 70B destilado alcanza 61,62% en Arena y 55,24% en PRISM con Llama 8B, frente a 53,70% y 52,80% del baseline por defecto.
  • Los reward models Bradley-Terry ajustados a la distribución superan ampliamente a los jueces in-context.
  • Añadir SynthesizeMe al reward model solo mejora tres de seis celdas, siempre dentro de intervalos, y empeora o empata las demás.
  • SynthesizeMe supera al juez por defecto en 12 de 14 pruebas de transferencia, pero solo tres de seis condiciones repetidas Qwen alcanzan los umbrales de permutación.
  • La coincidencia automática persona-preferencia llega a 56,1% en 70B frente a aproximadamente 47% aleatorio y solo esa escala está marcada p<0,05.
  • Los datos públicos reproducen 854 usuarios y los splits sin fuga entre usuarios o conversaciones.
  • El repositorio y los dos datasets existen, pero no permiten reproducir de extremo a extremo las tablas del paper y el paquete instalable por defecto está desalineado.

Limitaciones

  • El razonamiento inicial sobre el usuario es explícitamente especulativo y se postselecciona con muy pocos datos.
  • Persona, demos y prompt global se eligen por validación, con riesgo de overfitting y winner's curse sin evaluación anidada.
  • La persona por sí sola no mejora de forma consistente; el beneficio principal puede proceder de las demostraciones.
  • La fidelidad se juzga con GPT-4o-mini, no con anotación humana, y solo frente a 1-2 frases de preferencias declaradas.
  • Los prompts optimizados inventan biografía y psicografía e incorporan temas del conjunto de optimización.
  • El filtro de personalizabilidad solo tiene 100 labels y carece de acuerdo, balance, intervalos y análisis de error.
  • El filtro de calidad selecciona desacuerdo de jueces LLM; unanimidad no equivale a corrección.
  • La selección del benchmark y la evaluación dependen de LLM-as-a-judge, creando un circuito mediado por modelos.
  • PRISM contiene múltiples pares correlacionados por conversación y seis pares de respuestas idénticas.
  • Los intervalos del código no agrupan por usuario o conversación y duplican cada par en dos órdenes.
  • No se modela cambio temporal, preferencia por tema o interacción; el usuario se trata como función estable.
  • Los usuarios con menos de cinco preferencias quedan excluidos.
  • La evaluación se concentra en inglés y en casos subjetivos/controvertidos seleccionados.
  • Los resultados GPT y Gemini son single-run y puede existir contaminación por Chatbot Arena público.
  • Los clusters LLoom describen textos generados, sin validación humana o estabilidad.
  • El repositorio no incluye pipeline completo, scripts de tablas, datos intermedios, seeds ni environment lock.
  • No hay tests; Ruff detecta 22 incidencias bajo la configuración declarada.
  • PyPI instala una versión estable obsoleta y la versión del repo omite la dependencia datasets.
  • load(), fallback sin demos, directorio de salida y guards pre-fit presentan defectos funcionales.
  • Las tarjetas de los derivados están vacías, sin licencia, provenance, PII o proceso de retirada.
  • Los IDs PRISM permiten enlazar conversaciones con perfiles demográficos y preferencias declaradas.
  • Personalización puede amplificar estereotipos, manipulación y sicofancia; no se evalúan mitigaciones.

Qué no demuestra

  • Que la persona generada sea una descripción factual o psicológicamente válida del usuario.
  • Que el sistema descubra identidad, edad, profesión, valores, intereses o rasgos reales.
  • Que la persona textual, separada de las demostraciones, cause las mejoras principales.
  • Que una coincidencia decidida por GPT-4o-mini equivalga a validación humana.
  • Que PersonalRewardBench represente tráfico ordinario no filtrado.
  • Que acuerdo unánime de cinco jueces signifique 100% de exactitud.
  • Que los intervalos publicados tengan cobertura correcta bajo dependencia por par, conversación y usuario.
  • Que los resultados generalicen a usuarios nuevos con pocos datos, otros idiomas o preferencias longitudinales.
  • Que la transferencia a modelos cerrados esté libre de contaminación.
  • Que evitar demografía como input elimine el riesgo de enlace de identidad o perfilado sensible.
  • Que las personas sean seguras frente a estereotipos, sicofancia o manipulación.
  • Que el paquete actual funcione de forma limpia siguiendo el README.
  • Que los artefactos públicos reproduzcan todos los experimentos y tablas del artículo.
  • Que los datasets derivados trasladen correctamente licencias, términos de proveedores y prohibiciones de reidentificación.

Trazabilidad

Alcance: Texto completo

Versión: ACL 2025 long paper; audited text arXiv:2506.05598v1, 34 pages; official code, PyPI package and both full PersonalRewardBench derivatives also audited

Fuente consultada: https://aclanthology.org/2025.acl-long.397/

Revisión: Codex 34-page full-text visual, ACL publication, full benchmark Parquet, persona-validity, selection/statistics, upstream governance, GitHub/PyPI/package and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Llama-3.2-3B-Instruct
  • Llama-3.1-8B-Instruct
  • Llama-3.3-70B-Instruct
  • Llama-3.1-70B-Instruct prompt optimizer
  • GPT-4o-mini
  • Gemini-2.0-Flash, Gemini-2.5-Flash and Gemini-2.5-Pro
  • Qwen3-8B, Qwen3-30B-A3B and Qwen3-32B
  • GPT-4o-mini, Llama-3.1-70B, Llama-3.3-70B, Gemini-1.5-Pro and Qwen2.5-72B quality-filter judges

Instrumentos y métricas

  • Pairwise preference prediction accuracy
  • DSPy MIPROv2 persona-prompt optimization
  • Bootstrap reasoning with validation selection
  • Validation-selected few-shot demonstrations
  • Default, demographic and memory LLM-as-a-judge prompts
  • Bradley-Terry rank-64 LoRA reward models
  • GPO, VPL and PAL personalized reward-model baselines
  • GPT-4o-mini personalizability filter
  • Five-model bidirectional consensus filter
  • GPT-4o-mini persona-to-stated-preference match test
  • LLoom persona clustering
  • Item-level bootstrap confidence intervals and permutation tests

Datos utilizados

  • PersonalRewardBench Chatbot Arena derivative: MichaelR207/chatbot_arena_personalized_0125
  • PersonalRewardBench PRISM derivative: MichaelR207/prism_personalized_0125
  • Upstream Chatbot Arena conversations
  • Upstream PRISM Alignment survey and conversations

Evidencia y localización

  • Publicación, autoría, DOI, venue, páginas y licencia: ACL Anthology 2025.acl-long.397 checked 2026-07-16
  • Método, tablas, ablations, prompts optimizados, ética y limitaciones: arXiv:2506.05598v1 PDF, 34 pages; every page rendered and visually inspected
  • Totales, splits, duplicados, dependencia por conversación, respuestas idénticas y posibles identificadores directos: Full Parquet audit of MichaelR207/chatbot_arena_personalized_0125@636706aac659eb8da30c8e687ea22208eddc830f and MichaelR207/prism_personalized_0125@a03cab5122c397f1307ed092423a05732cc2aa93
  • Código, tests, wheel, lint, dependencias, PyPI y defectos de runtime: SALT-NLP/SynthesizeMe commit e91f340122db42b2940c07bcfe6a264bbe554353; clean installs, wheel build, compileall and Ruff audit on 2026-07-16
  • Licencias, términos, enlace de user_id y gobierno de datos upstream: Official Chatbot Arena gated dataset terms and HannahRoseKirk/prism-alignment dataset card checked 2026-07-16
  • Validez de persona, selección, incertidumbre, reproducibilidad y límites de afirmación: reports/verification/article-271-acl-synthesizeme-personalrewardbench-user-split-selection-persona-validity-code-data-and-claim-audit.json