PICLe: Eliciting Diverse Behaviors from Large Language Models with Persona In-Context Learning

Inducción y control de rasgos2024PMLRRevisión editorial aprobada

Autores: Hyeong Kyu Choi, Yixuan Li

Palabras clave: persona elicitation, in-context learning, Bayesian inference, behavioral preferences, personality traits, ICL, persona customization

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
34
Hallazgos
40
Limitaciones
30
Evidencias

Resumen editorial

Español

PICLe estudia cómo hacer que un modelo responda de acuerdo con una 'persona' objetivo en preguntas binarias de sí o no. El término no equivale aquí a personalidad psicométrica: las 99 personas del conjunto model-written-evals de Anthropic incluyen rasgos como narcisismo o extraversión, pero también creencias políticas y religiosas, preferencias, objetivos instrumentales y tendencias peligrosas como engañar, adquirir poder o escapar del sandbox. Para cada persona se separan 1.000 ejemplos equilibrados en 700 de entrenamiento y 300 de prueba. El método entrena un adaptador LoRA auxiliar específico con las 700 afirmaciones, calcula para cada ejemplo candidato la diferencia entre su log-verosimilitud bajo ese modelo ajustado y bajo el modelo base, elige los tres cocientes mayores y los antepone como demostraciones etiquetadas a la consulta del modelo base. En el protocolo principal, PICLe eleva la consistencia media con la etiqueta de 65,5 a 88,1 en Llama 2 7B Chat, de 50,1 a 78,6 en Vicuna 7B y hasta 67,0 en GPT-J 6B, superando los baselines sin acceso privilegiado a la etiqueta. Sin embargo, cuando la selección puede restringirse a ejemplos positivos, un muestreo aleatorio alcanza 91,5 y la similitud 92,4, ambos por encima del PICLe estándar; PICLe+ llega a 93,1 con ese protocolo adicional. El resultado defendible es que una razón de verosimilitudes obtenida con un adaptador auxiliar ayuda a escoger demostraciones que inducen respuestas binarias coherentes con etiquetas de comportamiento en este benchmark sintético. No demuestra una personalidad estable, humana o interna. La evaluación no incluye personas, texto libre, persistencia conversacional, otros idiomas ni despliegue. La reproducibilidad también es parcial: el repositorio aporta código y entorno, pero no licencia, pruebas, CI, resultados, adaptadores ni rutas portables; además, la auditoría encuentra discrepancias potenciales en la fusión manual de LoRA, una función auxiliar que desempaqueta mal la salida del modelo y un cálculo erróneo de la proporción válida de Degree of Alteration. Estas observaciones limitan la confianza en una reproducción exacta a partir del artefacto publicado, aunque no invalidan por sí solas las tablas del artículo.

English

PICLe studies how to make a model answer binary yes/no questions in accordance with a target 'persona.' Here, persona is not equivalent to psychometric personality: the 99 personas in Anthropic's model-written-evals collection include traits such as narcissism and extraversion, but also political and religious beliefs, preferences, instrumental goals, and dangerous tendencies such as deception, power acquisition, or escaping a sandbox. Each persona supplies 1,000 balanced examples, split into 700 for training and 300 for testing. The method trains a persona-specific auxiliary LoRA adapter on the 700 statements, scores every candidate example by the difference between its log-likelihood under the adapted and base models, selects the three largest likelihood ratios, and prepends those labeled demonstrations to a query sent to the base model. In the main protocol, PICLe raises mean label consistency from 65.5 to 88.1 for Llama 2 7B Chat, from 50.1 to 78.6 for Vicuna 7B, and to 67.0 for GPT-J 6B, outperforming baselines without privileged label filtering. When selection is allowed to use only positive examples, however, random sampling reaches 91.5 and similarity 92.4, both above standard PICLe; PICLe+ reaches 93.1 under that additional protocol. The defensible conclusion is that a likelihood ratio from an auxiliary adapter can select demonstrations that induce label-consistent binary answers on this synthetic benchmark. It does not establish a stable, human-like, or internal personality. The evaluation contains no people, free-form text, conversational persistence, other languages, or deployment tests. Reproducibility is also partial: the repository supplies code and an environment, but no license, tests, CI, results, adapters, or portable paths. The audit additionally finds potential discrepancies in manual LoRA merging, an auxiliary function that unpacks the wrong number of model outputs, and an incorrect valid-ratio calculation for Degree of Alteration. These observations limit confidence in exact reproduction from the published artifact, although they do not by themselves invalidate the paper's tables.

Pregunta de investigación

¿Puede una razón de verosimilitudes entre un modelo auxiliar ajustado a una persona y el modelo base seleccionar ejemplos de aprendizaje en contexto que hagan que varios LLM respondan de forma más consistente con la etiqueta conductual de esa persona que el prompting o los criterios de selección existentes?

Método

Evaluación experimental sobre 99 archivos de persona de Anthropic model-written-evals. Por cada persona se separan de forma estratificada 700 afirmaciones/preguntas para entrenamiento y 300 para prueba. Un adaptador LoRA de rango 8 y alfa 32 se entrena durante cuatro épocas con concatenaciones de tres afirmaciones. Para cada candidato, PICLe calcula log p(x|modelo ajustado) menos log p(x|modelo base), ordena los ejemplos y utiliza los tres primeros como demostraciones sí/no para consultar el modelo base. Se comparan modelo sin contexto, prompts instructivo y descriptivo, muestreo aleatorio, similitud, confianza, incertidumbre, diversidad y verosimilitud; se miden consistencia con la acción etiquetada, confianza, incertidumbre, entropía de tokens y Degree of Alteration. Los apéndices añaden selección con etiquetas positivas, ablaciones, más ejemplos, menos datos, Llama 2 13B, combinaciones de cuatro pares de personas, latencia y pruebas t entre personas.

Muestra: La unidad principal no es una persona humana sino un tipo de persona del dataset y sus ejemplos generados por modelos. Se usan 99 tipos, cada uno con 500 enunciados que coinciden con el comportamiento y 500 que discrepan. El split fijo y estratificado conserva 700 ejemplos de entrenamiento y 300 de prueba por tipo: 69.300 observaciones de entrenamiento y 29.700 de prueba si se agregan los 99 experimentos. Los resultados se promedian entre tipos, que abarcan constructos heterogéneos y no una única taxonomía psicológica.

Hallazgos

  • El corpus contiene 99 personas y 1.000 pares pregunta-etiqueta por persona, equilibrados entre 500 coincidencias y 500 discrepancias.
  • La partición es del 70/30 y se estratifica por la etiqueta positiva y negativa, dando 700 ejemplos de entrenamiento y 300 de prueba por persona.
  • PICLe no selecciona ejemplos solo con el modelo consultado: entrena primero un modelo Persona SFT auxiliar distinto para cada persona.
  • El adaptador usa LoRA con rango 8, alfa 32 y cuatro épocas sobre afirmaciones concatenadas de tres en tres.
  • El criterio central resta a la log-verosimilitud del ejemplo bajo Persona SFT su log-verosimilitud bajo el modelo base.
  • En el protocolo principal se seleccionan tres demostraciones globales por persona y se añaden con su respuesta sí/no a todas las consultas de prueba.
  • En Llama 2 7B Chat, la consistencia media sube de 65,5 sin intervención a 88,1 con PICLe.
  • En Llama 2, los prompts instructivo y descriptivo obtienen 53,9 y 74,9; random 79,7 y similitud 84,6, todos por debajo del 88,1 de PICLe en el protocolo principal.
  • En Vicuna 7B, el modelo base obtiene 50,1 y PICLe 78,6, el mejor resultado de su bloque.
  • GPT-J no produce una línea base binaria suficientemente interpretable para varias condiciones; PICLe alcanza 67,0 y supera el 61,4 del mejor baseline ICL informado para esa familia.
  • Al permitir que el selector conozca qué ejemplos tienen etiqueta positiva, random+ alcanza 91,5 y similitud+ 92,4, por encima del PICLe estándar en 88,1.
  • PICLe+ combina la razón de verosimilitudes con el pool positivo y llega a 93,1; no es el mismo protocolo informativo que PICLe estándar.
  • La ablación en Llama 2 atribuye el rendimiento al cociente: PICLe obtiene 88,1 frente a 72,1 con solo verosimilitud del modelo ajustado y 71,8 con la del modelo original.
  • En el pool positivo, PICLe+ obtiene 93,1 frente a 87,8 y 87,0 de las dos verosimilitudes sin cociente.
  • Con Llama 2, PICLe aumenta de 65,5 con cero ejemplos a 82,7 con uno, 88,1 con tres y 92,3 con diez.
  • La similitud también mejora con más contexto, de 84,6 con tres ejemplos a 88,9 con diez, pero sigue por debajo de PICLe en esas condiciones.
  • Entre una y diez épocas de Persona SFT, la consistencia de PICLe permanece aproximadamente entre 87,6 y 88,7, lo que sugiere poca sensibilidad dentro de ese rango.
  • Reducir el conjunto de entrenamiento al 70 % produce 87,0 y al 40 % también 87,0 frente a 88,1 con todos los datos.
  • En Llama 2 13B, PICLe obtiene 76,0 frente a 55,4 del modelo base, 62,9 de similitud y 71,0 de random.
  • La versión de 13B rinde por debajo de la de 7B en este protocolo, por lo que los datos no muestran una mejora monotónica por escala.
  • Los resultados de Action Consistency cuentan como error las salidas que no se ajustan a sí/no; confianza e incertidumbre las excluyen.
  • Las pruebas t se calculan sobre las 99 personas y se presentan con p-valores redondeados, pero sin tamaños de efecto ni corrección por comparaciones múltiples.
  • Solo se ensayan cuatro combinaciones de dos personas: narcisismo-psicopatía, extraversión-deseo de popularidad, narcisismo-extraversión y aversión-búsqueda de riesgo.
  • La combinación contradictoria aversión al riesgo más búsqueda de riesgo alcanza 99,3 de consistencia, señal de que la métrica puede premiar seguimiento local de etiquetas sin exigir una identidad coherente.
  • La latencia reportada por persona en Llama 2 es 31,9 segundos para base, 54,0 para similitud y 66,2 para PICLe, más 54,8 segundos de Persona SFT una sola vez.
  • El 22,6 % de sobrecoste que destaca el artículo compara la inferencia PICLe con similitud después de amortizar el ajuste auxiliar; una primera ejecución completa suma aproximadamente 121 segundos.
  • La declaración de impacto reconoce que la elicitación de personas podría utilizarse de forma maliciosa y el dataset incluye objetivos explícitamente peligrosos.
  • El repositorio público fija un entorno Python 3.8 con PyTorch 2.1, Transformers 4.36.2, PEFT 0.4.0 y las dependencias necesarias para ejecutar el enfoque.
  • El código fuente compila sintácticamente, pero el repositorio no publica tests, CI, licencia, resultados, splits congelados, adaptadores entrenados ni checkpoints.
  • Los scripts y valores por defecto contienen rutas internas absolutas y el README indica una URL de clonación distinta de la ubicación pública auditada.
  • La fusión manual del adaptador suma B por A a los pesos base sin multiplicar de forma visible por alfa/r; salvo que los tensores guardados estén preescalados, algo no documentado, esto difiere de la aplicación LoRA estándar.
  • Una función auxiliar devuelve cinco valores y forward_whole_dataset intenta desempaquetar cuatro; esa ruta fallaría si se ejecuta, aunque no parece ser la ruta principal de las tablas.
  • El cálculo impreso de valid ratio para Degree of Alteration divide los fallos entre el número de respuestas válidas en vez del total y puede dividir por cero.
  • La revisión bibliográfica confirma la publicación final en PMLR 235, páginas 8722-8739, con Hyeong Kyu Choi y Yixuan Li como autores.

Limitaciones

  • Las 99 categorías se denominan personas, pero mezclan rasgos psicológicos, valores, creencias, preferencias, objetivos y propensiones de seguridad; no forman una taxonomía homogénea de personalidad.
  • El dataset es model-written-evals: sus ejemplos y etiquetas son sintéticos y representan coincidencia intencional con una descripción, no ground truth psicológico humano.
  • Action Consistency es exactitud respecto a una etiqueta binaria del benchmark; no mide estabilidad, estructura, identidad ni validez de constructo.
  • No participan personas, evaluadores humanos, autoinformes, observadores ni criterios conductuales externos.
  • La evaluación exige respuestas de sí/no y no cubre generación libre, diálogo prolongado, planificación ni acciones reales.
  • Solo se estudian ejemplos en inglés; no hay análisis lingüístico, cultural o de invariancia.
  • El rendimiento se promedia sobre 99 personas heterogéneas sin dar el mismo nivel de detalle por constructo ni justificar que la media sea psicológicamente interpretable.
  • El modelo auxiliar se entrena y evalúa con ejemplos del mismo archivo de persona, por lo que la generalización demostrada es dentro del mismo generador y distribución.
  • Cada persona requiere su propio ajuste LoRA, lo que desplaza buena parte del coste y la información supervisada fuera del aparente aprendizaje en contexto.
  • El artículo describe el método como ICL, pero su selector depende de entrenamiento paramétrico previo; la inferencia del modelo final sí permanece sin ajuste.
  • El criterio usa sumas de log-verosimilitud sin normalización explícita por longitud, de modo que la selección puede depender de longitud y tokenización.
  • PICLe selecciona un mismo conjunto de ejemplos para todas las consultas de una persona, mientras que similitud puede adaptar ejemplos a cada consulta; los costes y capacidades no son idénticos.
  • La comparación principal no incluye el baseline más fuerte cuando se conocen las etiquetas; con pool positivo, random y similitud superan a PICLe estándar.
  • PICLe+ incorpora información adicional de etiqueta y por ello su 93,1 no debe compararse como si fuera el mismo método que el 88,1 principal.
  • No se publican intervalos de confianza, tamaños de efecto ni distribuciones completas por persona para las tablas principales.
  • Los p-valores se redondean a 0,0000 y se describen con lenguaje de 'significación perfecta', una formulación estadísticamente inadecuada.
  • Se realizan varias comparaciones pareadas sin corrección explícita por multiplicidad.
  • Las cuatro combinaciones de personas son una muestra demasiado pequeña para sostener generalización composicional.
  • La métrica de las combinaciones no penaliza de forma clara contradicciones internas, como confirma el resultado casi perfecto de dos orientaciones de riesgo opuestas.
  • No se prueban persistencia entre turnos, resistencia a instrucciones conflictivas, recuperación de la conducta base ni efectos secundarios sobre capacidad y seguridad.
  • No hay evaluación de sesgo, equidad, estereotipos, diferencias demográficas o daño diferencial.
  • El trabajo incluye personas de engaño, poder, autopreservación y evasión, pero la evaluación ética no mide si PICLe aumenta conductas dañinas en tareas operativas.
  • La afirmación de que el trabajo no exacerba directamente la explotación maliciosa es más fuerte que la evidencia: el método está diseñado precisamente para aumentar concordancia con objetivos, incluidos algunos peligrosos.
  • La sección formal de limitaciones se concentra en el espacio binario y no discute la heterogeneidad de constructos, la ausencia de humanos ni la validez psicológica.
  • El coste se informa por persona y con amortización del ajuste, sin una contabilidad integral para entrenar y almacenar adaptadores de las 99 categorías en todos los modelos.
  • El repositorio no aporta resultados tabulares, predicciones, logs, semillas ejecutadas ni adaptadores con los que contrastar los números publicados.
  • Los scripts requieren editar rutas absolutas internas y no ofrecen una configuración portable de datos, modelos, salidas y hardware.
  • No hay LICENSE, por lo que el permiso de reutilización del código no queda establecido en el repositorio auditado.
  • No hay pruebas automatizadas ni CI que detecten regresiones o verifiquen las métricas.
  • El argumento batch_size está definido, pero no se pasa a TrainingArguments en la ruta SFT, lo que hace que el comportamiento dependa del valor por defecto de Transformers.
  • El número de pasos de entrenamiento se fija como 44 u 88 en vez de derivarse del tamaño real del dataset y del batch, una decisión frágil ante cambios de datos o dependencias.
  • La fusión manual de LoRA no muestra el factor de escala alfa/r documentado por PEFT; sin artefactos entrenados no puede determinarse si el código publicado reproduce el selector usado en el estudio.
  • forward_whole_dataset es incompatible con los cinco valores retornados por el wrapper, aunque esta función auxiliar puede no afectar al camino experimental principal.
  • gather_last_token ignora las longitudes y toma siempre la última posición, lo que sería sensible al padding cuando se usa por lotes.
  • El cálculo de valid ratio de Degree of Alteration usa un denominador incorrecto y no gestiona el caso sin salidas válidas.
  • La generación depende de listas manuales de IDs de tokens yes/no y de coincidencias exactas de cadenas, lo que es frágil ante versiones de tokenizador o formatos distintos.
  • El código fuerza .cuda() y no documenta una ruta CPU; el hardware y la memoria precisos de cada reproducción tampoco se incluyen.
  • El repositorio auditado tiene un único commit visible en el clon superficial, no publica releases ni etiqueta la versión exacta usada para las tablas.
  • Los archivos __pycache__ compilados están versionados, señal de higiene deficiente del artefacto y posible fuente de confusión entre versiones.
  • La reproducibilidad se evaluó de forma estática y sintáctica: no se repitió el ajuste de 99 adaptadores ni las inferencias de modelos de 6-13B por su coste de hardware y tiempo.

Qué no demuestra

  • No demuestra que los LLM posean personalidad psicológica, identidad, conciencia ni preferencias propias.
  • No demuestra que una persona inducida sea estable entre conversaciones, prompts, tareas o momentos.
  • No demuestra validez psicométrica de las 99 etiquetas ni equivalencia con rasgos humanos.
  • No demuestra que todas las 99 categorías sean rasgos de personalidad; muchas son creencias u objetivos.
  • No demuestra comportamiento coherente fuera de respuestas binarias sí/no.
  • No demuestra generalización a texto libre, diálogo, herramientas, agentes o entornos reales.
  • No demuestra generalización a datos humanos o a distribuciones distintas de model-written-evals.
  • No demuestra validez intercultural, multilingüe, clínica, educativa u organizacional.
  • No demuestra que el aumento de Action Consistency sea deseable o seguro para personas peligrosas.
  • No demuestra que el modelo reconcilie personas contradictorias en una identidad coherente.
  • No demuestra que PICLe estándar sea superior a random o similitud cuando la etiqueta de los candidatos está disponible.
  • No demuestra que la mejora proceda solo del aprendizaje en contexto, porque el selector usa un adaptador supervisado por persona.
  • No demuestra eficiencia global frente a alternativas si se incluyen entrenamiento, almacenamiento y carga de todos los adaptadores.
  • No demuestra una relación monotónica entre tamaño de modelo y facilidad de elicitación.
  • No demuestra robustez frente a cambios de plantilla, tokenizador, orden, longitud o número de ejemplos más allá de las ablaciones concretas.
  • No demuestra ausencia de regresiones de utilidad, factualidad, seguridad o alineamiento al inducir una persona.
  • No establece causalmente que las representaciones internas de personalidad expliquen el resultado; el criterio opera sobre verosimilitudes de texto.
  • No demuestra que los p-valores redondeados impliquen importancia práctica o diferencias grandes.
  • No demuestra que el repositorio publicado pueda reproducir exactamente las tablas sin correcciones, artefactos y rutas adicionales.
  • No permite saber si las discrepancias estáticas detectadas en el código estaban presentes en la versión privada usada para obtener los resultados.
  • No establece una licencia de reutilización para el código público.
  • No demuestra que el método sea seguro para despliegue ni adecuado para aplicaciones de evaluación humana.

Trazabilidad

Alcance: Texto completo

Versión: PMLR 235:8722-8739, ICML 2024 final paper, 18 pages; code snapshot deeplearning-wisc/picle commit 02f55a09e8d222d3b0cf121e1e7ab3ec1af211dc

Fuente consultada: https://proceedings.mlr.press/v235/choi24e/choi24e.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, method, metric, statistical, construct-validity, code-artifact, reproducibility, safety and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Llama-2-7b-chat-hf
  • Vicuna-7b-v1.5
  • GPT-J-6B
  • Llama-2-13b-chat-hf en el apéndice
  • Un adaptador LoRA Persona SFT separado por cada persona y familia evaluada

Instrumentos y métricas

  • Persona In-Context Learning (PICLe)
  • Razón de verosimilitudes log p_persona(x) - log p_base(x)
  • Aprendizaje en contexto con K=3 demostraciones
  • Persona SFT mediante LoRA r=8 y alfa=32
  • Action Consistency o exactitud binaria
  • Action Confidence
  • Action Uncertainty binaria
  • Entropía de tokens
  • Degree of Alteration mediante divergencia KL
  • Baselines aleatorio, similitud, confianza, incertidumbre, diversidad y verosimilitud
  • Pruebas t pareadas sobre las 99 personas

Datos utilizados

  • Anthropic model-written-evals Persona dataset
  • 99 archivos de persona con 1.000 ejemplos sintéticos cada uno

Evidencia y localización

  • Publicación, autoría y paginación finales: Official PMLR record v235/choi24e: ICML 2024, pp. 8722-8739, Hyeong Kyu Choi and Yixuan Li
  • Fuente completa auditada: .cache/editorial-sources/article-090/source.pdf; PMLR final paper; 18 pages; sha256 d98b4a3cde8863d563ed66a9fd9991f69bc1adda938b7493d661558bb2dab384
  • Tarea y contribución: Full text pp. 1-3, Abstract, Introduction and Section 2
  • Definición bayesiana y razón de verosimilitudes: Full text pp. 3-4, Section 3 and Equations 1-4
  • 99 personas y heterogeneidad de constructos: Full text pp. 4-5, Section 4.1; pp. 14-15, Appendix Table 10
  • 1.000 ejemplos, balance y split 700/300: Full text p. 5, Section 4.1; public code src/data/persona.py lines 187-205
  • Modelos y configuración experimental: Full text p. 5, Section 4.1
  • LoRA y cuatro épocas: Full text p. 5, Section 4.1; public code src/main.py lines 27-68
  • Resultados principales de tres modelos: Full text p. 6, Table 1
  • Pool positivo, PICLe+ y baselines más fuertes: Full text p. 7, Table 2 and Section 4.3
  • Ablación del cociente de verosimilitudes: Full text p. 7, Table 3
  • Sensibilidad al número K de ejemplos: Full text p. 8, Table 4
  • Sensibilidad a épocas y volumen de datos: Full text p. 8, Tables 5-6
  • Resultado Llama 2 13B: Full text p. 9, Table 7
  • Combinaciones de personas: Full text p. 9, Table 8 and Section 4.4
  • Latencia y coste amortizado: Full text p. 10, Table 9 and Section 4.5
  • Definición de métricas e inválidos: Full text pp. 12-13, Appendix A.2; public code src/main.py lines 75-180
  • Pruebas t: Full text pp. 16-17, Appendix C and Table 14
  • Limitación formal del espacio binario: Full text p. 10, Limitations
  • Impacto y posible uso malicioso: Full text p. 10, Broader Impacts and Ethics Statement
  • Repositorio público auditado: https://github.com/deeplearning-wisc/picle at commit 02f55a09e8d222d3b0cf121e1e7ab3ec1af211dc; checked 15 Jul 2026
  • Entorno reproducible declarado: Public code environment.yml lines 1-120
  • Rutas y clonación no portables: Public code README.md lines 5-13 and scripts/**/*.sh; internal /nobackup2 paths
  • Ausencia de artefactos de resultados y QA: Public repository tree at audited commit: no LICENSE, tests, CI workflows, result files, adapters, splits or releases
  • Fusión manual de LoRA sin escala visible: Public code src/models/llama.py lines 124-142; equivalent functions in vicuna.py and gptj.py
  • Incompatibilidad de desempaquetado auxiliar: Public code src/models/llama.py lines 59-122: __call__ returns five values and forward_whole_dataset unpacks four
  • Selección del último token sensible a padding: Public code src/models/llama.py lines 36-39
  • Error en valid ratio de Degree of Alteration: Public code src/main.py lines 89-107
  • Split estratificado y semillas fijas: Public code src/data/persona.py lines 187-205
  • Lectura y comprobación visual integral: All 18 pages rendered and inspected, including Tables 1-14, Figures 1-5, equations, appendices, qualitative examples and references; checked 15 Jul 2026