IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization

Inducción y control de rasgos2026AAAI ProceedingsRevisión editorial aprobada

Autores: Yuzhuo Bai, Shitong Duan, Muhua Huang, Jing Yao, Zhenghao Liu, Peng Zhang, Tun Lu, Xiaoyuan Yi, Maosong Sun, Xing Xie

Palabras clave: Large Language Models, Personality Control, Prompting, Persona, Steering

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

10
Autores
5
Hallazgos
13
Limitaciones
5
Evidencias

Resumen editorial

Español

IROTE busca inducir en un LLM un valor, una base moral o un rasgo Big Five mediante un breve texto en primera persona que combina reflexiones y ejemplos de conducta. No modifica los pesos del modelo objetivo. GPT-4o genera un conjunto inicial de frases del tipo «valoro X, por ejemplo hago Y» y un bucle de búsqueda alterna dos objetivos. La parte de evocativeness produce respuestas del modelo objetivo y premia los candidatos que el evaluador del rasgo considera alineados. La parte de compactness intenta conservar lo común entre las reflexiones y eliminar redundancia. El paper presenta ambas como un objetivo parecido a information bottleneck, con correlación total puntual e información mutua condicional, y lo optimiza mediante pasos inspirados en EM. La implementación práctica es más indirecta: como una API cerrada no proporciona las probabilidades necesarias, GPT-4o recibe tres prompts distintos, probabilidad condicional, entailment y semejanza de generación, asigna a cada par de textos una nota de 0 a 10, repite con el orden invertido y promedia. Esas notas no son likelihoods calibradas; por tanto, el código implementa una heurística de juicio semántico inspirada en la formulación, no una estimación literal de sus magnitudes informacionales.

El estudio cubre tres sistemas: diez valores de Schwartz, cinco Moral Foundations y cinco Big Five. PVQ21, PVQ-RR, MFQ y BFI participan en la optimización; SVS, MFQ-2 y BFI-2 quedan para evaluación. Las respuestas se comparan con un extremo considerado estándar para el rasgo y se transforman a diez puntos. Los downstream son AdAEM, 1.520 opiniones controvertidas puntuadas por presencia automática del valor objetivo, 626 tuits Offensive/Racist en escala de cinco puntos, 2.397 prompts MoralPrompt con proporción absoluta de violaciones, y 100 ROCStories seleccionadas al azar, limitadas a 300 palabras y juzgadas 1-5 por GPT-4o. Los modelos principales son Qwen2.5-7B-Instruct, Mistral-7B-Instruct-v0.3 y GPT-4o-2024-11-20; Qwen 3B, 14B y 32B se añaden al análisis de escala. Los baselines incluyen modelo sin steering, tres selecciones ICL, ICDPO, PICLe, Anthology adaptado y EvoPrompt. La comparación no tiene presupuesto uniforme: PICLe entrena dos adaptadores LoRA con 500 frases GPT-4o por rasgo y se omite, junto con ICDPO, para GPT-4o por falta de logits. El texto principal dice K=10 reflexiones iniciales, M1=3, M2=6, beta=1, T=5 y límite de 50 palabras; Appendix B.3 y los scripts públicos, en cambio, inicializan conjuntos de cinco reflexiones.

Table 2 favorece claramente a IROTE en los puntos publicados, pero el claim debe formularse con precisión. De 24 cruces modelo-dataset, IROTE es primero en 12, segundo en 11 y tercero en uno. Con Qwen lidera cinco de ocho celdas y queda segundo en SVS, Racist y BFI-2; su Avg es 80,01 frente a 77,73 de EvoPrompt. Con Mistral gana cuatro y queda segundo en cuatro; Avg 78,65 frente a 73,65. Con GPT-4o gana Racist, BFI-2 y ROC, queda segundo en SVS, AdAEM, MFQ-2 y MoralPrompt, y es tercero en Offensive: EvoPrompt 3,46, Similarity 3,40 e IROTE 3,38. Esto contradice literalmente la frase del paper según la cual siempre gana o queda segundo. Además, la regla declarada en el pie, llevar las ocho métricas a 100, usar 100-MoralPrompt y promediar, no reproduce varios Avg mostrados. Por ejemplo, las cifras visibles dan 59,64 para Qwen Raw, no 60,49; 75,49 para Qwen PICLe, no 72,44; 71,83 para Mistral PICLe, no 71,36; y 78,00 para GPT-4o IROTE, no 78,20. Sin datos fuente no puede saberse si hay ponderaciones ocultas, valores no redondeados o errores de tabla. Table 3 sí muestra que IROTE lidera los tres promedios de sistema para Qwen y Mistral; en GPT-4o pierde MFT ante Anthology, 73,01 frente a 74,97.

La evidencia de escalado no es monotónica: los gains cambian de forma muy distinta entre Qwen 3B, 7B, 14B y 32B, y cada tarea favorece tamaños diferentes. Tampoco existe una longitud universal: los óptimos de BFI-2 y ROC varían entre 25 y 100 palabras según modelo. Cincuenta es un default razonable, no una ley. La ablación de compactness se limita a una caída de 1,6 % en ROC con Mistral, insuficiente para atribuirle el conjunto de mejoras. Las tablas principales ofrecen puntos únicos sin desviaciones, intervalos, tests, seeds ni corrección por comparaciones. El experimento de contexto inserta diez preguntas MMLU en una conversación de Qwen, repite cinco veces y mide BFI-2 tras truncar a distintas longitudes. Es una perturbación sintética útil, pero no demuestra robustez en diálogos naturales, conflicto de instrucciones o identidad persistente.

La evaluación humana usa 15 outputs por cada una de las cinco bases morales para IROTE, EvoPrompt y Anthology, generados por Qwen2.5-7B. Tres titulados universitarios puntúan a ciegas de 0 a 10. Las medias son 7,7, 6,7 y 6,0; IROTE gana cuatro fundamentos, pero pierde Loyalty con 6,7 frente a 7,2 y 7,3. El paper llama a esto fuerte consistencia con la evaluación automática, aunque no publica dispersión, acuerdo interevaluador, tests, asignaciones exactas, reclutamiento, compensación, consentimiento ni revisión ética. La conclusión admisible es una preferencia media en esta muestra, no concordancia humana robusta.

Conceptualmente, la medición premia contestar en la dirección explícita del rasgo. No valida distribución humana, estructura factorial, discriminación entre rasgos, test-retest, estabilidad dentro del individuo ni continuidad de identidad. Puede capturar mejor obediencia al prompt o gaming del cuestionario, además de transferencia real. La «self-reflection» es texto conductual generado, no experiencia ni introspección psicológica. Algunas adaptaciones incluso ordenan inventar una biografía humana en primera persona y no describirse como IA, lo que aumenta el riesgo de antropomorfismo. GPT-4o genera reflexiones y también juzga ROCStories, introduciendo dependencia de familia. El propio artículo reconoce que la personalidad estable en LLMs es discutida y advierte sobre rasgos dañinos, power seeking, contenido ofensivo y sesgos, pero no los evalúa directamente.

El repositorio oficial Phosphor-Bai/IROTE permite inspeccionar prompts y lógica, pero no reproducir el paper. Sus 21 ficheros Python pasan parseo sintáctico, aunque el ejecutable importa dos módulos ausentes, usa cinco constantes no definidas, carece de los CSV de reflexiones y sustituye los siete cuestionarios por un JSON de ejemplo. No publica reflexiones finales, salvo Figure 6, resultados, generaciones, tablas, anotaciones humanas ni evaluadores downstream. `run_gpt_4o.sh` ejecuta Mistral; el shuffle modifica la única lista in situ y nunca añade permutaciones; la inicialización Azure mezcla nombres de claves y referencia una variable inexistente; las dependencias están sin pin y omiten imports directos. No hay licencia, tests, CI, lockfile o contenedor. La conclusión fiel es que IROTE ofrece evidencia amplia, aunque solo puntual y no reproducible, de que optimizar un prompt de reflexión mejora alineación con scorers de rasgos en estos modelos y tareas. No demuestra una personalidad humana o estable, probabilidades informacionales calibradas, una ley de escala, fuerte consenso humano, seguridad ni reproducción extremo a extremo.

English

IROTE aims to elicit a value, moral foundation or Big Five trait in an LLM through a short first-person text combining reflections with behavioural examples. It does not update the target model's weights. GPT-4o generates an initial pool of statements such as 'I value X, e.g. I do Y', and a search loop alternates two objectives. Evocativeness produces target-model responses and rewards candidates that a trait evaluator judges aligned. Compactness tries to retain shared content across reflections while removing redundancy. The paper frames both as an information-bottleneck-like objective involving pointwise total correlation and conditional mutual information, optimized through EM-inspired steps. The practical implementation is more indirect: because a closed API does not expose the required probabilities, GPT-4o receives three different prompts, conditional probability, entailment and generation relatedness, assigns each text pair a 0-10 score, repeats with reversed order and averages. These scores are not calibrated likelihoods. The code therefore implements a semantic-judgment heuristic inspired by the formalism, not a literal estimate of its information-theoretic quantities.

The study covers three systems: ten Schwartz values, five Moral Foundations and five Big Five traits. PVQ21, PVQ-RR, MFQ and BFI participate in optimization; SVS, MFQ-2 and BFI-2 are reserved for evaluation. Answers are compared with a designated trait-aligned endpoint and mapped to ten points. Downstream tasks are AdAEM, 1,520 controversial opinions scored by automatically detected target-value presence, 626 Offensive/Racist tweets on a five-point scale, 2,397 MoralPrompt adversarial completions measured by absolute proportion of violation, and 100 randomly selected ROCStories constrained to 300 words and judged 1-5 by GPT-4o. Main target models are Qwen2.5-7B-Instruct, Mistral-7B-Instruct-v0.3 and GPT-4o-2024-11-20; Qwen 3B, 14B and 32B are added for scaling. Baselines include raw generation, three ICL selection variants, ICDPO, PICLe, an adapted Anthology and EvoPrompt. Budgets are not uniform: the adapted PICLe trains two LoRA adapters from 500 GPT-4o-generated statements per trait, and both PICLe and ICDPO are omitted for GPT-4o because logits are unavailable. The main text states K=10 initial reflections, M1=3, M2=6, beta=1, T=5 and a 50-word limit; Appendix B.3 and the public scripts instead initialize five-reflection sets.

Table 2 clearly favours IROTE on the published point estimates, but the claim needs precision. Across 24 model-dataset cells, IROTE ranks first in 12, second in 11 and third in one. For Qwen it leads five of eight and ranks second on SVS, Racist and BFI-2; its reported Avg is 80.01 versus EvoPrompt's 77.73. For Mistral it wins four and ranks second in four; Avg 78.65 versus 73.65. For GPT-4o it wins Racist, BFI-2 and ROC, ranks second on SVS, AdAEM, MFQ-2 and MoralPrompt, and third on Offensive: EvoPrompt 3.46, Similarity 3.40 and IROTE 3.38. This literally contradicts the paper's statement that it always wins or ranks second. The caption's stated calculation, convert all eight metrics to 100, use 100 minus MoralPrompt, then average, also fails to reproduce several displayed Avg values. The visible numbers yield 59.64 for Qwen Raw rather than 60.49, 75.49 for Qwen PICLe rather than 72.44, 71.83 for Mistral PICLe rather than 71.36, and 78.00 for GPT-4o IROTE rather than 78.20. Without source data it is impossible to tell whether undisclosed weighting, unrounded trait-level values or table errors explain the discrepancies. Table 3 does show IROTE leading all three system averages for Qwen and Mistral; on GPT-4o it loses MFT to Anthology, 73.01 versus 74.97.

Scaling evidence is non-monotonic: gains vary sharply across Qwen 3B, 7B, 14B and 32B, with different tasks favouring different sizes. Nor is there a universal reflection length: BFI-2 and ROC optima range from 25 to 100 words depending on model. Fifty words is a reasonable default, not a law. The compactness ablation is limited to a 1.6% ROC decrease on Mistral, insufficient to attribute the broad gains to that component. Main tables provide point estimates without deviations, intervals, tests, seeds or multiplicity treatment. The context experiment inserts ten MMLU questions into a Qwen dialogue, repeats five times and measures BFI-2 after truncating at different lengths. It is a useful synthetic perturbation, but does not establish robustness in natural dialogue, instruction conflict or persistent identity.

Human evaluation samples 15 outputs for each of five moral foundations from IROTE, EvoPrompt and Anthology using Qwen2.5-7B. Three bachelor-degree annotators blindly score adherence from 0 to 10. Means are 7.7, 6.7 and 6.0. IROTE wins four foundations but loses Loyalty at 6.7 versus 7.2 and 7.3. The paper calls this strong consistency with automatic evaluation, yet reports no dispersion, inter-rater agreement, tests, exact assignment counts, recruitment, compensation, consent or ethics review. The defensible conclusion is a higher mean preference in this sample, not robust human agreement.

Conceptually, measurement rewards answering in the explicit target direction. It does not validate a human distribution, factor structure, trait discrimination, test-retest reliability, within-person stability or identity continuity. Results may reflect stronger prompt obedience or questionnaire gaming alongside genuine transfer. The 'self-reflection' is generated behavioural text, not psychological experience or introspection. Some adapted prompts explicitly ask for an invented human first-person biography and instruct the model not to describe itself as AI, increasing anthropomorphic framing. GPT-4o both generates reflection candidates and judges ROCStories, introducing family dependence. The paper itself acknowledges that stable LLM personality is contested and warns about harmful traits, power seeking, offensive content and bias, but does not evaluate those risks directly.

The official Phosphor-Bai/IROTE repository exposes prompts and intended logic but cannot reproduce the paper. Its 21 Python files parse syntactically, yet the main program imports two missing modules, references five undefined constants, lacks required reflection CSVs and replaces the seven questionnaires with a placeholder JSON. It publishes no final reflections except Figure 6, results, generations, tables, human annotations or downstream evaluators. `run_gpt_4o.sh` actually selects Mistral; the shuffle mutates its only index list in place and never adds permutations; Azure initialization mixes credential names and references an undefined variable; dependencies are unpinned and omit direct imports. There is no license, test suite, CI, lockfile or container. The faithful conclusion is that IROTE provides broad but point-estimate-only, non-reproducible evidence that optimized reflection prompts improve alignment with trait scorers for these models and tasks. It does not establish human or stable personality, calibrated information-theoretic probability, a scaling law, strong human consensus, safety or end-to-end reproducibility.

Pregunta de investigación

¿Puede una búsqueda iterativa de reflexiones en primera persona producir un prompt compacto que elicite de forma transferible un valor, fundamento moral o rasgo Big Five en distintos LLMs sin ajustar sus pesos?

Método

Genera reflexiones y ejemplos de conducta con GPT-4o y alterna optimización de compactness y evocativeness durante cinco iteraciones. Selecciona candidatos mediante evaluadores de rasgo y notas GPT-4o usadas como aproximación de probabilidades; evalúa tres modelos principales en tres cuestionarios held-out y cinco tareas downstream frente a hasta seis familias de baseline, con análisis de escala, longitud, contexto y una pequeña evaluación humana.

Muestra: Veinte rasgos en tres sistemas; tres modelos principales por ocho métricas, con dos baselines omitidos en GPT-4o; cuatro tamaños Qwen para escala; 100 ROCStories; cinco repeticiones del contexto MMLU; 15 outputs por cada uno de cinco fundamentos, tres métodos y tres anotadores en la evaluación humana.

Hallazgos

  • IROTE es primero en 12 de 24 celdas, segundo en 11 y tercero en GPT-4o Offensive; los Avg publicados son 80,01 Qwen, 78,65 Mistral y 78,20 GPT-4o.
  • La afirmación de quedar siempre primero o segundo es falsa por una celda, y varios Avg no se reproducen con la regla declarada y los números visibles.
  • Los gains por tamaño y longitud son heterogéneos; 50 palabras funciona como default, no como óptimo universal ni evidencia de una ley de escala.
  • La media humana favorece IROTE 7,7 frente a 6,7 y 6,0, pero pierde Loyalty y no se informa fiabilidad, dispersión o significación.
  • El código revela el mecanismo heurístico de búsqueda, pero faltan artefactos y contiene bloqueos que impiden una reproducción extremo a extremo.

Limitaciones

  • Puntos únicos sin desviaciones, intervalos, tests, seeds o repeticiones documentadas.
  • Promedios de Table 2 incompatibles en varias filas con el cálculo descrito.
  • K=10 en el texto principal frente a conjuntos de cinco en Appendix B.3 y scripts.
  • Scores 0-10 de GPT-4o tratados como probabilidades sin calibración.
  • Cuestionarios puntuados contra un extremo estándar, con riesgo de gaming y validez psicométrica limitada.
  • GPT-4o genera reflexiones y juzga ROCStories; dependencia de familia de modelo.
  • PICLe usa LoRA auxiliar y el conjunto de baselines cambia para GPT-4o.
  • Ablación de compactness limitada a un dato de ROC/Mistral.
  • Context robustness limitado a un modelo, BFI-2, cinco repeticiones y ruido MMLU sintético.
  • Evaluación humana de tres anotadores sin acuerdo, dispersión, tests ni detalles éticos suficientes.
  • Sin controles de rasgo contradictorio, leakage entre rasgos, estabilidad temporal o identidad longitudinal.
  • Sin evaluación directa de harmful traits, sesgo, antropomorfismo, engaño o misuse.
  • Repositorio sin datos, reflexiones finales, resultados, evaluadores downstream, módulos requeridos, licencia, tests o entorno reproducible.

Qué no demuestra

  • Que IROTE sea primero o segundo en cada resultado mostrado.
  • Que todos los Avg publicados sean el promedio declarado de las ocho celdas.
  • Personalidad humana, interna, coherente, estable o psicométricamente válida.
  • Que el texto generado constituya experiencia o autorreflexión psicológica.
  • Probabilidades condicionales calibradas o una implementación literal del objetivo informacional.
  • Significación y robustez de las mejoras entre seeds o muestras.
  • Causalidad general de compactness sobre los resultados.
  • Un óptimo universal de 50 palabras o una ley causal de tamaño de modelo.
  • Fuerte concordancia entre evaluación humana y automática.
  • Robustez en conversaciones naturales, largas o contradictorias.
  • Comparación con igual presupuesto de todos los baselines.
  • Seguridad frente a rasgos dañinos, sesgo, estereotipos o antropomorfismo.
  • Reproducción licenciada y extremo a extremo con los materiales públicos.

Trazabilidad

Alcance: Texto completo

Versión: AAAI 2026, volume 40 issue 36, DOI 10.1609/aaai.v40i36.40252; arXiv:2508.08719v2, submitted 2025-11-27; arXiv non-exclusive distribution license 1.0

Fuente consultada: https://arxiv.org/abs/2508.08719

Revisión: Codex 27-page visual, AAAI/arXiv-v2 metadata, full-method, Table-2 arithmetic/rank, system/scaling/length/ablation, context, human-design, psychometric-construct, repository-code/data/reproducibility and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Qwen2.5-7B-Instruct
  • Mistral-7B-Instruct-v0.3
  • GPT-4o-2024-11-20
  • GPT-4o as initial-reflection generator, black-box probability scorer and ROCStories judge
  • GPT-4o-Mini as ICL demonstration generator
  • Qwen2.5-3B-Instruct
  • Qwen2.5-14B-Instruct
  • Qwen2.5-32B-Instruct

Instrumentos y métricas

  • PVQ21 and PVQ-RR for Schwartz-value optimization
  • MFQ for Moral-Foundation optimization
  • BFI for Big-Five optimization
  • SVS, MFQ-2 and BFI-2 held-out questionnaires
  • AdAEM target-value occurrence ratio
  • Offensive and Racist five-point ratings
  • MoralPrompt absolute proportion of violation
  • GPT-4o PersonaLLM-style Big Five ratings of ROCStories
  • GPT-4o 0-10 conditional-probability, entailment and generation-relatedness prompts
  • Three-annotator 0-10 moral-foundation adherence ratings

Datos utilizados

  • PVQ21: 21 items and PVQ-RR: 57 items
  • MFQ: 30 substantive items after two catch items and MFQ-2: 36 items
  • BFI: 44 items, BFI-2: 60 items and SVS: 57 items
  • AdAEM: 1,520 controversial-opinion entries
  • Offensive and Racist: 626 toxic-language tweets
  • MoralPrompt: 2,397 adversarial prompts
  • ROCStories: 100 randomly selected test samples
  • MMLU context perturbation: ten questions from distinct subjects per trial
  • IROTE reflections, raw responses, results and human annotations: not released as data files

Evidencia y localización

  • Metadatos de publicación, venue, DOI, volumen, número y páginas: AAAI article 40252, DOI 10.1609/aaai.v40i36.40252
  • Método, tablas, apéndices, limitaciones y ética: arXiv:2508.08719v2 PDF, 27 páginas, sha256 2ea25941056677776e7ff697852b5940df71b883f3cd72eaf0f9aa591220ae58
  • Código oficial, prompts y defectos de ejecución/reproducibilidad: Phosphor-Bai/IROTE commit 7d36f7128f3dc9ea2fa930c7b3623fcdc5e7e655
  • Recálculo de rangos y promedios mostrados en Table 2: Table 2 displayed values and stated 100-point transformations
  • Auditoría de método, métricas, código, datos, validez y fronteras de afirmación: reports/verification/article-254-aaai-irote-trait-steering-metrics-code-data-and-claim-audit.json