SynthesizeMe convierte un historial breve de elecciones entre dos respuestas en un prompt personalizado para predecir elecciones futuras. No parte de una identidad o de rasgos declarados. Primero pide a un LLM que especule por qué el usuario eligió una respuesta y descarte las explicaciones que no ayudan a predecir un pequeño conjunto de validación. Después resume las explicaciones seleccionadas como una persona en lenguaje natural. Por último busca qué ejemplos previos, junto con esa persona, maximizan la precisión de validación. El prompt que define cómo redactar personas se optimiza con DSPy MIPROv2 en usuarios de PRISM y se transfiere a Chatbot Arena y a otros modelos. El propio paper aclara que el razonamiento inicial se produce sin información de fondo y es especulativo.
La evaluación usa PersonalRewardBench, una curación de dos datasets existentes. Chatbot Arena aporta 131 usuarios y 1.338 pares; PRISM, 723 usuarios, 3.897 conversaciones y 16.705 pares, para un total de 854 usuarios. Se conservan usuarios con al menos cinco preferencias, GPT-4o-mini filtra consultas consideradas personalizables y cinco jueces LLM, ejecutados en ambos órdenes de respuesta, eliminan los casos de acuerdo unánime. Los usuarios se separan 40/10/50% para train, validación y test; dentro de cada usuario, las interacciones temporales se reparten 50/20/30% entre contexto de entrenamiento, validación y objetivo. La auditoría completa de los Parquet confirma los totales y que no hay usuarios ni conversaciones cruzando particiones. También encuentra 12 filas PRISM duplicadas, seis pares con respuestas elegida y rechazada idénticas y hasta 16 pares correlacionados por conversación. El filtro de personalizabilidad solo se comprobó con 100 ejemplos manuales y 50 casos de test, sin acuerdo entre anotadores ni intervalos.
En los jueces LLM, el paper informa mejoras máximas de 4,4 puntos en Chatbot Arena y 3,41 en PRISM. Esas cifras requieren leer qué variante y baseline se comparan: 61,97% para Llama 70B con solo demostraciones frente a 57,57% del baseline Memory en Arena, y 57,76% con solo demostraciones frente a 54,35% del juez por defecto en PRISM. La ablación es decisiva: la persona sin demostraciones empeora al juez por defecto en los modelos 3B y 70B de ambos datasets y solo mejora los dos casos 8B. Todas las configuraciones ganadoras incluyen ejemplos seleccionados. Con el prompt de persona destilado desde 70B, Persona+Demos llega a 61,62% en Arena y 55,24% en PRISM con Llama 8B, frente a 53,70% y 52,80% del juez por defecto. Sin embargo, reward models Bradley-Terry ajustados a cada distribución son bastante más fuertes. Añadir SynthesizeMe solo mejora ligeramente tres de seis configuraciones, siempre dentro de los intervalos, y empeora o no cambia el resto; por eso los autores lo recomiendan principalmente para personalización in-context.
La supuesta fidelidad de las personas tiene una frontera estrecha. Los usuarios de PRISM escribieron una o dos frases sobre lo que querían de un LLM; GPT-4o-mini, no personas evaluadoras, decide si una persona generada coincide fuertemente con esas frases. Las coincidencias verdaderas pasan de 26,5% a 50,2% y 56,1% para 3B, 8B y 70B, mientras los emparejamientos aleatorios rondan 46-47% en 8B/70B; solo 70B está marcado como significativo. Esto valida cierta asociación predictiva, no la verdad de los detalles biográficos o psicológicos. Los anexos muestran prompts que inventan nombre, edad, profesión, valores, intereses y rasgos no observados. El prompt 70B optimizado incluso incorpora temas concretos del conjunto de optimización, arte, justicia social, medio ambiente, pesimismo y esperanza, evidencia de impronta del dataset. Que el texto sea legible no lo convierte en una explicación causal ni en una descripción factual del usuario.
La incertidumbre y los artefactos también limitan la conclusión. El código publicado calcula intervalos re-muestreando por separado las dos órdenes del mismo par y los múltiples pares de una conversación, sin clustering por conversación o usuario, por lo que puede subestimar incertidumbre. El benchmark selecciona casos mediante los mismos tipos de jueces LLM que después se evalúan, y acuerdo unánime no equivale a corrección. Los autores reconocen posible contaminación de modelos Gemini con Chatbot Arena público, bajo realismo longitudinal y riesgo de sicofancia. El repositorio contiene el algoritmo central y los prompts, pero no la construcción completa del benchmark ni scripts para reproducir tablas, baselines o seeds; no tiene tests y su único workflow publica paquetes. `pip install SynthesizeMe` instala hoy la versión estable 0.0.1, que no coincide con el repositorio 0.0.11-alpha.1 ni expone el loader documentado. La versión del repositorio omite la dependencia `datasets` y presenta fallos en carga, fallback de demos y estado previo al entrenamiento. Los dos datasets derivados son públicos y completos, pero sus tarjetas están vacías y sin licencia, no trasladan las condiciones de no reidentificación y licencias de las fuentes, y conservan identificadores PRISM enlazables con perfiles demográficos. La evidencia sólida es que seleccionar ejemplos y, a veces, añadir una hipótesis de persona puede mejorar predicción de preferencias en dos benchmarks filtrados. No demuestra que el sistema descubra quién es el usuario ni que las personas sean verdaderas, seguras o estables.