Profile-LLM: Dynamic Profile Optimization for Realistic Personality Expression in LLMs

Personas, identidad y agentes2025arXivRevisión editorial aprobada

Autores: Shi-Wei Dai, Yan-Wei Shie, Tsung-Huan Yang, Lun-Wei Ku, Yung-Hui Li

Palabras clave: Prompt Optimization, OPRO, Big Five, TRAIT, Machine Personality Inventory, Cross-Model Transfer, Personality Steering

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
5
Hallazgos
10
Limitaciones
5
Evidencias

Resumen editorial

Español

Profile-LLM propone optimizar perfiles de persona escritos en lenguaje natural para que un LLM elija con mayor frecuencia respuestas asociadas a un polo concreto de los Big Five. El método adapta OPRO: un LLM optimizador recibe los perfiles mejor puntuados de iteraciones anteriores y genera ocho candidatos nuevos por paso; un LLM objetivo los evalúa mediante preguntas situacionales de TRAIT. En los experimentos principales, LLaMA-3.1-8B-Instruct cumple ambos papeles. El optimizador usa temperatura 1,2, el objetivo responde de forma greedy, cada paso selecciona tres preguntas de entrenamiento y conserva tres perfiles. Apertura, extraversión y neuroticismo se optimizan durante 25 pasos, 200 candidatos por rasgo; responsabilidad y amabilidad se detienen a los 15, 120 candidatos, porque sus curvas se estabilizan antes. El abstract llama dos veces PersonaPulse al framework, pero el título y el resto del artículo usan Profile-LLM; el texto no explica esa discrepancia. La puntuación central no mide una personalidad interna. TRAIT presenta cuatro acciones por escenario, dos etiquetadas como mayor y dos como menor expresión del rasgo. Para cada ítem, los autores generan además una paráfrasis con LLaMA-3.1-8B. La métrica publicada como paraphrase-sensitive score cuenta la proporción de preguntas en las que original y paráfrasis producen ambos una opción etiquetada como el polo objetivo. Esto combina dirección del rasgo y repetición de la etiqueta; no comprueba coherencia semántica de todas las respuestas. La fórmula adicional de consistencia es asimétrica, éxitos conjuntos divididos por éxitos en el original, y el artículo no indica qué hace cuando el denominador es cero. La evaluación usa 1.000 preguntas Big Five de TRAIT, descritas como 200 de entrenamiento y 800 de test, y 120 ítems de Machine Personality Inventory. En TRAIT con LLaMA-3.1-8B, Profile-LLM obtiene 0,846 en apertura, 0,921 en responsabilidad, 0,719 en extraversión, 0,786 en amabilidad y 0,870 en neuroticismo, el mayor valor puntual de cada fila. Pero la ventaja frente al mejor prompt estático es muy desigual: 0,027, 0,002, 0,040, 0,003 y 0,436, respectivamente. El promedio mejora sobre los baselines sobre todo por neuroticismo; responsabilidad y amabilidad son prácticamente empates sin intervalos ni repetición de la optimización. En MPI, después de promediar 15 órdenes de preguntas, Profile-LLM logra 4,227, 4,656, 4,714, 4,717 y 4,553. Es primero en apertura y neuroticismo y segundo en los otros tres rasgos; su media es 4,573 frente a 4,464 de P2 y 4,352 del prompt descriptivo. El propio estudio encuentra una desviación estándar media de 0,439 al repetir el autoinforme sin perfil con órdenes distintos. Promediar reduce variación de muestreo, pero Table 3 no publica dispersión por método, por lo que no demuestra que Profile-LLM sea más estable. La transferencia se prueba en LLaMA-3.2 1B/3B, Gemma 3 1B/4B/12B/27B y Mistral-7B-Instruct-v0.3, comparando el perfil transferido con Profile*, reoptimizado para cada modelo. El resultado es heterogéneo. Profile* domina los cinco rasgos en Gemma 3 4B, pero en otros tamaños gana solo algunas filas, y en Gemma 12B/27B prompts estáticos sencillos igualan o superan a ambas variantes en varios rasgos. Esto respalda utilidad selectiva en ciertos modelos intermedios; no aísla un efecto causal del tamaño. Cambian a la vez familia, arquitectura, entrenamiento, checkpoint y tratamiento de cuantización, sin serie controlada ni análisis estadístico. Los experimentos ingenuos tampoco resuelven el mecanismo: una instrucción directa empeora los cinco scores de Gemma 1B, lo que no distingue conocimiento del rasgo de seguimiento de instrucciones o interacción con la métrica; en Gemma 27B, añadir «a bit», ningún modificador o «very» produce progresión clara en extraversión, amabilidad y neuroticismo, pero no en apertura ni responsabilidad. El supuesto control de grado se basa en curvas del objetivo de entrenamiento, promediadas entre ocho candidatos y suavizadas con ventana 8. El apéndice elige al azar un perfil retenido en tres checkpoints y pide a GPT-4o que lo resuma en una frase. No se solicitan niveles objetivo, no se calcula monotonía ni calibración y los checkpoints no se validan en una escala independiente. La evidencia muestra que las iteraciones cambian perfiles y scores, no un dial fino y predecible de intensidad psicológica. La reproducibilidad queda incompleta. El benchmark TRAIT original sí es público en pull-ups/TRAIT y mirlab/TRAIT; no lo son el split exacto 200/800 de este estudio, las paráfrasis, el calendario de tres preguntas por paso, las trayectorias, perfiles finales, respuestas, órdenes, seeds ni tablas fuente. No hay enlace oficial de código o datos de Profile-LLM en arXiv, PDF o página pública del autor, y la búsqueda pública no localizó un repositorio relacionado. Faltan además identificadores exactos de checkpoints, chat templates, entorno y coste. La conclusión fiel es que, en una ejecución no reproducible, la optimización de prompts eleva puntuaciones de selección de opciones en TRAIT y MPI y a veces transfiere entre modelos. No demuestra personalidad realista o humana, estabilidad superior, una ley de escalado por parámetros, control psicométrico fino ni mejora en conversaciones, usuarios, educación o terapia.

English

Profile-LLM optimizes natural-language persona profiles so that an LLM more frequently selects answers associated with a requested Big Five pole. It adapts OPRO: an optimizer LLM receives the best-scoring profiles from previous iterations and produces eight new candidates per step, while a target LLM scores them on TRAIT situational questions. LLaMA-3.1-8B-Instruct plays both roles in the main study. The optimizer runs at temperature 1.2, the target uses greedy decoding, each step selects three training questions and retains three profiles. Openness, Extraversion and Neuroticism run for 25 steps, producing 200 candidates per trait; Conscientiousness and Agreeableness stop after 15 steps, producing 120, because their curves plateau earlier. The abstract twice calls the framework PersonaPulse, while the title and paper use Profile-LLM, with no explanation. The central score does not measure an internal personality. TRAIT supplies four actions per scenario, two labelled as stronger and two as weaker trait expression. The authors also generate one paraphrase per item with LLaMA-3.1-8B. Their paraphrase-sensitive score is the fraction of questions for which both original and paraphrase produce an option labelled with the target pole. This combines trait direction and repeated label selection; it does not test semantic consistency across all answers. The additional consistency ratio is asymmetric, joint successes divided by original-item successes, and the paper does not specify how a zero denominator is handled. Evaluation uses 1,000 Big Five TRAIT questions, described as 200 training and 800 test items, and 120 Machine Personality Inventory statements. On TRAIT with LLaMA-3.1-8B, Profile-LLM scores 0.846 for Openness, 0.921 for Conscientiousness, 0.719 for Extraversion, 0.786 for Agreeableness and 0.870 for Neuroticism, the highest point estimate in every row. But its margin over the strongest static prompt is highly uneven: 0.027, 0.002, 0.040, 0.003 and 0.436, respectively. The average gain is driven largely by Neuroticism; Conscientiousness and Agreeableness are near ties without intervals or repeated optimization runs. On MPI, after averaging 15 question orders, Profile-LLM scores 4.227, 4.656, 4.714, 4.717 and 4.553. It ranks first on Openness and Neuroticism and second on the other three traits; its mean is 4.573 versus 4.464 for P2 and 4.352 for the description prompt. The study itself finds a mean standard deviation of 0.439 when repeating the no-profile self-assessment under different question orders. Averaging reduces sampling variation, but Table 3 gives no method-specific dispersion and therefore does not demonstrate that Profile-LLM is more stable. Transfer is tested on LLaMA-3.2 1B/3B, Gemma 3 1B/4B/12B/27B and Mistral-7B-Instruct-v0.3, comparing the transferred profile with Profile*, newly optimized for each model. Results are heterogeneous. Profile* leads all five traits for Gemma 3 4B, but wins only some rows elsewhere, and simple static prompts match or exceed both Profile variants on several traits for Gemma 12B and 27B. This supports selective usefulness in some mid-sized settings, not an isolated causal effect of model size. Family, architecture, training, checkpoint and reported quantization treatment change together, with no controlled scaling series or statistical model. The naive checks do not resolve the mechanism: a direct instruction lowers all five Gemma 1B scores, which cannot distinguish trait knowledge from instruction following or scoring interaction; for Gemma 27B, adding 'a bit', no modifier or 'very' is clearly progressive for Extraversion, Agreeableness and Neuroticism but not for Openness or Conscientiousness. Claimed degree control comes from training-objective curves averaged over eight candidates and smoothed with a window of eight. The appendix randomly selects one retained profile at three checkpoints and asks GPT-4o for a one-sentence summary. No target level is requested, no monotonicity or calibration statistic is computed, and checkpoints are not validated on an independent scale. The evidence shows that optimization iterations change profiles and scores, not a calibrated fine-grained psychological intensity dial. Reproducibility is incomplete. The underlying TRAIT benchmark is public through pull-ups/TRAIT and mirlab/TRAIT, but this study's exact 200/800 split, paraphrases, three-question schedule, trajectories, final profiles, responses, orders, seeds and table data are not. No official Profile-LLM code or data link appears on arXiv, in the PDF or on the audited author page, and public searches did not find a related repository. Exact checkpoint identifiers, chat templates, environment and cost are also missing. The faithful conclusion is that, in one unreproducible run, prompt optimization raises option-selection scores on TRAIT and MPI and sometimes transfers across models. It does not establish realistic or human personality, superior stability, a parameter-count scaling law, calibrated psychometric control or benefits in conversation, users, education or therapy.

Pregunta de investigación

¿Puede una búsqueda iterativa tipo OPRO optimizar perfiles de persona para aumentar respuestas asociadas a polos Big Five, transferir esos perfiles entre LLMs y usar checkpoints como niveles de expresión?

Método

Optimiza perfiles estructurados con LLaMA-3.1-8B como optimizador y objetivo; ocho candidatos por iteración, tres preguntas de entrenamiento por paso, tres perfiles retenidos y 15 o 25 pasos. Evalúa en un split 200/800 de TRAIT con paráfrasis generadas y en 120 ítems MPI promediados sobre 15 órdenes; después transfiere o reoptimiza perfiles en siete checkpoints LLaMA, Gemma y Mistral.

Muestra: Cinco rasgos Big Five; 1.000 preguntas TRAIT con una paráfrasis por ítem; 120 ítems MPI repetidos en 15 órdenes; una ejecución de optimización por rasgo con 120 o 200 candidatos; transferencia/reoptimización en LLaMA-3.2 1B/3B, Gemma 3 1B/4B/12B/27B y Mistral 7B.

Hallazgos

  • En LLaMA-3.1-8B, Profile-LLM lidera las cinco filas de TRAIT, pero las ventajas sobre el mejor baseline son solo 0,002 en responsabilidad y 0,003 en amabilidad, frente a 0,436 en neuroticismo.
  • En MPI, la media Profile es 4,573 y queda primera en dos rasgos y segunda en tres; la variabilidad por orden se mide solo para el autoinforme sin perfil, no por método.
  • La reoptimización específica es especialmente fuerte en Gemma 3 4B, mientras la tabla cross-model es mixta en el resto y no establece una ley monotónica de escala.
  • Las curvas cambian durante la optimización, pero el control de grado no se calibra en niveles solicitados ni se valida fuera del objetivo de entrenamiento.
  • TRAIT es público; los materiales propios de Profile-LLM necesarios para reproducir tablas y figuras no están publicados.

Limitaciones

  • Preprint v1 sin venue o revisión por pares identificada.
  • Tres preguntas por paso, selección/reuso no descritos y sin repeticiones ni seeds de optimización.
  • Sin intervalos, errores, tests, corrección múltiple ni análisis de coste o presupuesto equivalente.
  • Métrica de consistencia asimétrica y caso de denominador cero sin documentar.
  • Notación q/n conflictiva entre preguntas seleccionadas y perfiles retenidos.
  • MPI cercano al techo y sin dispersión por método, pese a afirmar mayor estabilidad.
  • Tamaño confundido con familia, entrenamiento, checkpoint y cuantización; pocos modelos por tamaño.
  • Control de intensidad inferido de curvas de entrenamiento suavizadas y resúmenes GPT-4o, no de calibración held-out.
  • Sin evaluación humana, conversación larga, tarea abierta o resultado en educación, terapia o engagement.
  • Sin código Profile-LLM, split exacto, paráfrasis, prompts finales, respuestas, seeds, checkpoints exactos o datos de análisis.

Qué no demuestra

  • Personalidad interna, realista, humana o psicométricamente equivalente en el LLM.
  • Que el score mida algo más que selección condicionada de opciones etiquetadas.
  • Significación de las mejoras pequeñas en responsabilidad y amabilidad.
  • Mayor estabilidad que P2 o el prompt descriptivo en MPI.
  • Que el número de parámetros determine por sí mismo comprensión o expresión de personalidad.
  • Un dial fino, monotónico y calibrado de intensidad de rasgo.
  • Generalización a conversación abierta, sesiones largas, otras tareas, usuarios o aplicaciones.
  • Robustez entre seeds, optimizadores, splits, generadores de paráfrasis o familias de modelos.
  • Mejoras reales en engagement, educación o terapia.
  • Reproducibilidad extremo a extremo con los artefactos públicos disponibles.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2511.19852v1, submitted 2025-11-25; preprint

Fuente consultada: https://arxiv.org/abs/2511.19852

Revisión: Codex 15-page visual, official-arXiv-v1, full-method, TRAIT/MPI scoring, optimization-budget, cross-model scaling-confound, degree-control, upstream-dataset, public-code/data, reproducibility and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • LLaMA-3.1-8B-Instruct as optimizer, target and paraphrase generator
  • LLaMA-3.2-1B-Instruct
  • LLaMA-3.2-3B-Instruct
  • Gemma 3 1B IT
  • Gemma 3 4B IT
  • Gemma 3 12B IT, reported QAT-Q4_0-Unquantized variant
  • Gemma 3 27B IT, reported QAT-Q4_0-Unquantized variant
  • Mistral-7B-Instruct-v0.3
  • GPT-4o for appendix checkpoint summaries only

Instrumentos y métricas

  • TRAIT Big Five scenario-based multiple-choice questions
  • LLaMA-generated semantically equivalent twin questions
  • Paraphrase-sensitive joint-success score
  • Asymmetric conditional consistency score
  • Machine Personality Inventory, 120 second-person IPIP-derived items
  • Big Five Inventory description prompts
  • P2 personality portrait prompts
  • Smoothed optimization trajectories and GPT-4o qualitative checkpoint summaries

Datos utilizados

  • TRAIT Big Five subset: 1,000 items, described as 200 train and 800 test; exact split not released
  • Generated TRAIT paraphrase pairs; not released
  • Machine Personality Inventory: 120 items across 15 shuffled trials
  • Optimization profiles, trajectories and raw responses; not released
  • Public upstream TRAIT artifacts at pull-ups/TRAIT and mirlab/TRAIT

Evidencia y localización

  • Metadatos, autores, versión, fecha, categoría y licencia: arXiv:2511.19852v1
  • Método, fórmulas, implementación, tablas, limitaciones y apéndices: arXiv v1 PDF, 15 páginas, sha256 10be67e52da0a9841b87e29bfab54d28b1ad50dbc107e1c1bd3bd36eadc07aa5
  • Benchmark TRAIT upstream públicamente accesible: pull-ups/TRAIT GitHub tree and mirlab/TRAIT Hugging Face dataset sha 8b31c078cb897c3917d2ee48735d0c15030680e0
  • Estado público de código y datos Profile-LLM: arXiv Code/Data section, PDF, Tsung-Huan Yang publication page and GitHub exact-title/PersonaPulse searches checked 2026-07-16
  • Auditoría de psicometría, escalado, control de grado, artefactos y fronteras de afirmación: reports/verification/article-252-arxiv-profile-llm-prompt-optimization-psychometrics-model-size-code-data-and-claim-audit.json