Profile-LLM propone optimizar perfiles de persona escritos en lenguaje natural para que un LLM elija con mayor frecuencia respuestas asociadas a un polo concreto de los Big Five. El método adapta OPRO: un LLM optimizador recibe los perfiles mejor puntuados de iteraciones anteriores y genera ocho candidatos nuevos por paso; un LLM objetivo los evalúa mediante preguntas situacionales de TRAIT. En los experimentos principales, LLaMA-3.1-8B-Instruct cumple ambos papeles. El optimizador usa temperatura 1,2, el objetivo responde de forma greedy, cada paso selecciona tres preguntas de entrenamiento y conserva tres perfiles. Apertura, extraversión y neuroticismo se optimizan durante 25 pasos, 200 candidatos por rasgo; responsabilidad y amabilidad se detienen a los 15, 120 candidatos, porque sus curvas se estabilizan antes. El abstract llama dos veces PersonaPulse al framework, pero el título y el resto del artículo usan Profile-LLM; el texto no explica esa discrepancia. La puntuación central no mide una personalidad interna. TRAIT presenta cuatro acciones por escenario, dos etiquetadas como mayor y dos como menor expresión del rasgo. Para cada ítem, los autores generan además una paráfrasis con LLaMA-3.1-8B. La métrica publicada como paraphrase-sensitive score cuenta la proporción de preguntas en las que original y paráfrasis producen ambos una opción etiquetada como el polo objetivo. Esto combina dirección del rasgo y repetición de la etiqueta; no comprueba coherencia semántica de todas las respuestas. La fórmula adicional de consistencia es asimétrica, éxitos conjuntos divididos por éxitos en el original, y el artículo no indica qué hace cuando el denominador es cero. La evaluación usa 1.000 preguntas Big Five de TRAIT, descritas como 200 de entrenamiento y 800 de test, y 120 ítems de Machine Personality Inventory. En TRAIT con LLaMA-3.1-8B, Profile-LLM obtiene 0,846 en apertura, 0,921 en responsabilidad, 0,719 en extraversión, 0,786 en amabilidad y 0,870 en neuroticismo, el mayor valor puntual de cada fila. Pero la ventaja frente al mejor prompt estático es muy desigual: 0,027, 0,002, 0,040, 0,003 y 0,436, respectivamente. El promedio mejora sobre los baselines sobre todo por neuroticismo; responsabilidad y amabilidad son prácticamente empates sin intervalos ni repetición de la optimización. En MPI, después de promediar 15 órdenes de preguntas, Profile-LLM logra 4,227, 4,656, 4,714, 4,717 y 4,553. Es primero en apertura y neuroticismo y segundo en los otros tres rasgos; su media es 4,573 frente a 4,464 de P2 y 4,352 del prompt descriptivo. El propio estudio encuentra una desviación estándar media de 0,439 al repetir el autoinforme sin perfil con órdenes distintos. Promediar reduce variación de muestreo, pero Table 3 no publica dispersión por método, por lo que no demuestra que Profile-LLM sea más estable. La transferencia se prueba en LLaMA-3.2 1B/3B, Gemma 3 1B/4B/12B/27B y Mistral-7B-Instruct-v0.3, comparando el perfil transferido con Profile*, reoptimizado para cada modelo. El resultado es heterogéneo. Profile* domina los cinco rasgos en Gemma 3 4B, pero en otros tamaños gana solo algunas filas, y en Gemma 12B/27B prompts estáticos sencillos igualan o superan a ambas variantes en varios rasgos. Esto respalda utilidad selectiva en ciertos modelos intermedios; no aísla un efecto causal del tamaño. Cambian a la vez familia, arquitectura, entrenamiento, checkpoint y tratamiento de cuantización, sin serie controlada ni análisis estadístico. Los experimentos ingenuos tampoco resuelven el mecanismo: una instrucción directa empeora los cinco scores de Gemma 1B, lo que no distingue conocimiento del rasgo de seguimiento de instrucciones o interacción con la métrica; en Gemma 27B, añadir «a bit», ningún modificador o «very» produce progresión clara en extraversión, amabilidad y neuroticismo, pero no en apertura ni responsabilidad. El supuesto control de grado se basa en curvas del objetivo de entrenamiento, promediadas entre ocho candidatos y suavizadas con ventana 8. El apéndice elige al azar un perfil retenido en tres checkpoints y pide a GPT-4o que lo resuma en una frase. No se solicitan niveles objetivo, no se calcula monotonía ni calibración y los checkpoints no se validan en una escala independiente. La evidencia muestra que las iteraciones cambian perfiles y scores, no un dial fino y predecible de intensidad psicológica. La reproducibilidad queda incompleta. El benchmark TRAIT original sí es público en pull-ups/TRAIT y mirlab/TRAIT; no lo son el split exacto 200/800 de este estudio, las paráfrasis, el calendario de tres preguntas por paso, las trayectorias, perfiles finales, respuestas, órdenes, seeds ni tablas fuente. No hay enlace oficial de código o datos de Profile-LLM en arXiv, PDF o página pública del autor, y la búsqueda pública no localizó un repositorio relacionado. Faltan además identificadores exactos de checkpoints, chat templates, entorno y coste. La conclusión fiel es que, en una ejecución no reproducible, la optimización de prompts eleva puntuaciones de selección de opciones en TRAIT y MPI y a veces transfiere entre modelos. No demuestra personalidad realista o humana, estabilidad superior, una ley de escalado por parámetros, control psicométrico fino ni mejora en conversaciones, usuarios, educación o terapia.
Pregunta de investigación
¿Puede una búsqueda iterativa tipo OPRO optimizar perfiles de persona para aumentar respuestas asociadas a polos Big Five, transferir esos perfiles entre LLMs y usar checkpoints como niveles de expresión?