IROTE busca inducir en un LLM un valor, una base moral o un rasgo Big Five mediante un breve texto en primera persona que combina reflexiones y ejemplos de conducta. No modifica los pesos del modelo objetivo. GPT-4o genera un conjunto inicial de frases del tipo «valoro X, por ejemplo hago Y» y un bucle de búsqueda alterna dos objetivos. La parte de evocativeness produce respuestas del modelo objetivo y premia los candidatos que el evaluador del rasgo considera alineados. La parte de compactness intenta conservar lo común entre las reflexiones y eliminar redundancia. El paper presenta ambas como un objetivo parecido a information bottleneck, con correlación total puntual e información mutua condicional, y lo optimiza mediante pasos inspirados en EM. La implementación práctica es más indirecta: como una API cerrada no proporciona las probabilidades necesarias, GPT-4o recibe tres prompts distintos, probabilidad condicional, entailment y semejanza de generación, asigna a cada par de textos una nota de 0 a 10, repite con el orden invertido y promedia. Esas notas no son likelihoods calibradas; por tanto, el código implementa una heurística de juicio semántico inspirada en la formulación, no una estimación literal de sus magnitudes informacionales.
El estudio cubre tres sistemas: diez valores de Schwartz, cinco Moral Foundations y cinco Big Five. PVQ21, PVQ-RR, MFQ y BFI participan en la optimización; SVS, MFQ-2 y BFI-2 quedan para evaluación. Las respuestas se comparan con un extremo considerado estándar para el rasgo y se transforman a diez puntos. Los downstream son AdAEM, 1.520 opiniones controvertidas puntuadas por presencia automática del valor objetivo, 626 tuits Offensive/Racist en escala de cinco puntos, 2.397 prompts MoralPrompt con proporción absoluta de violaciones, y 100 ROCStories seleccionadas al azar, limitadas a 300 palabras y juzgadas 1-5 por GPT-4o. Los modelos principales son Qwen2.5-7B-Instruct, Mistral-7B-Instruct-v0.3 y GPT-4o-2024-11-20; Qwen 3B, 14B y 32B se añaden al análisis de escala. Los baselines incluyen modelo sin steering, tres selecciones ICL, ICDPO, PICLe, Anthology adaptado y EvoPrompt. La comparación no tiene presupuesto uniforme: PICLe entrena dos adaptadores LoRA con 500 frases GPT-4o por rasgo y se omite, junto con ICDPO, para GPT-4o por falta de logits. El texto principal dice K=10 reflexiones iniciales, M1=3, M2=6, beta=1, T=5 y límite de 50 palabras; Appendix B.3 y los scripts públicos, en cambio, inicializan conjuntos de cinco reflexiones.
Table 2 favorece claramente a IROTE en los puntos publicados, pero el claim debe formularse con precisión. De 24 cruces modelo-dataset, IROTE es primero en 12, segundo en 11 y tercero en uno. Con Qwen lidera cinco de ocho celdas y queda segundo en SVS, Racist y BFI-2; su Avg es 80,01 frente a 77,73 de EvoPrompt. Con Mistral gana cuatro y queda segundo en cuatro; Avg 78,65 frente a 73,65. Con GPT-4o gana Racist, BFI-2 y ROC, queda segundo en SVS, AdAEM, MFQ-2 y MoralPrompt, y es tercero en Offensive: EvoPrompt 3,46, Similarity 3,40 e IROTE 3,38. Esto contradice literalmente la frase del paper según la cual siempre gana o queda segundo. Además, la regla declarada en el pie, llevar las ocho métricas a 100, usar 100-MoralPrompt y promediar, no reproduce varios Avg mostrados. Por ejemplo, las cifras visibles dan 59,64 para Qwen Raw, no 60,49; 75,49 para Qwen PICLe, no 72,44; 71,83 para Mistral PICLe, no 71,36; y 78,00 para GPT-4o IROTE, no 78,20. Sin datos fuente no puede saberse si hay ponderaciones ocultas, valores no redondeados o errores de tabla. Table 3 sí muestra que IROTE lidera los tres promedios de sistema para Qwen y Mistral; en GPT-4o pierde MFT ante Anthology, 73,01 frente a 74,97.
La evidencia de escalado no es monotónica: los gains cambian de forma muy distinta entre Qwen 3B, 7B, 14B y 32B, y cada tarea favorece tamaños diferentes. Tampoco existe una longitud universal: los óptimos de BFI-2 y ROC varían entre 25 y 100 palabras según modelo. Cincuenta es un default razonable, no una ley. La ablación de compactness se limita a una caída de 1,6 % en ROC con Mistral, insuficiente para atribuirle el conjunto de mejoras. Las tablas principales ofrecen puntos únicos sin desviaciones, intervalos, tests, seeds ni corrección por comparaciones. El experimento de contexto inserta diez preguntas MMLU en una conversación de Qwen, repite cinco veces y mide BFI-2 tras truncar a distintas longitudes. Es una perturbación sintética útil, pero no demuestra robustez en diálogos naturales, conflicto de instrucciones o identidad persistente.
La evaluación humana usa 15 outputs por cada una de las cinco bases morales para IROTE, EvoPrompt y Anthology, generados por Qwen2.5-7B. Tres titulados universitarios puntúan a ciegas de 0 a 10. Las medias son 7,7, 6,7 y 6,0; IROTE gana cuatro fundamentos, pero pierde Loyalty con 6,7 frente a 7,2 y 7,3. El paper llama a esto fuerte consistencia con la evaluación automática, aunque no publica dispersión, acuerdo interevaluador, tests, asignaciones exactas, reclutamiento, compensación, consentimiento ni revisión ética. La conclusión admisible es una preferencia media en esta muestra, no concordancia humana robusta.
Conceptualmente, la medición premia contestar en la dirección explícita del rasgo. No valida distribución humana, estructura factorial, discriminación entre rasgos, test-retest, estabilidad dentro del individuo ni continuidad de identidad. Puede capturar mejor obediencia al prompt o gaming del cuestionario, además de transferencia real. La «self-reflection» es texto conductual generado, no experiencia ni introspección psicológica. Algunas adaptaciones incluso ordenan inventar una biografía humana en primera persona y no describirse como IA, lo que aumenta el riesgo de antropomorfismo. GPT-4o genera reflexiones y también juzga ROCStories, introduciendo dependencia de familia. El propio artículo reconoce que la personalidad estable en LLMs es discutida y advierte sobre rasgos dañinos, power seeking, contenido ofensivo y sesgos, pero no los evalúa directamente.
El repositorio oficial Phosphor-Bai/IROTE permite inspeccionar prompts y lógica, pero no reproducir el paper. Sus 21 ficheros Python pasan parseo sintáctico, aunque el ejecutable importa dos módulos ausentes, usa cinco constantes no definidas, carece de los CSV de reflexiones y sustituye los siete cuestionarios por un JSON de ejemplo. No publica reflexiones finales, salvo Figure 6, resultados, generaciones, tablas, anotaciones humanas ni evaluadores downstream. `run_gpt_4o.sh` ejecuta Mistral; el shuffle modifica la única lista in situ y nunca añade permutaciones; la inicialización Azure mezcla nombres de claves y referencia una variable inexistente; las dependencias están sin pin y omiten imports directos. No hay licencia, tests, CI, lockfile o contenedor. La conclusión fiel es que IROTE ofrece evidencia amplia, aunque solo puntual y no reproducible, de que optimizar un prompt de reflexión mejora alineación con scorers de rasgos en estos modelos y tareas. No demuestra una personalidad humana o estable, probabilidades informacionales calibradas, una ley de escala, fuerte consenso humano, seguridad ni reproducción extremo a extremo.