PICLe estudia cómo hacer que un modelo responda de acuerdo con una 'persona' objetivo en preguntas binarias de sí o no. El término no equivale aquí a personalidad psicométrica: las 99 personas del conjunto model-written-evals de Anthropic incluyen rasgos como narcisismo o extraversión, pero también creencias políticas y religiosas, preferencias, objetivos instrumentales y tendencias peligrosas como engañar, adquirir poder o escapar del sandbox. Para cada persona se separan 1.000 ejemplos equilibrados en 700 de entrenamiento y 300 de prueba. El método entrena un adaptador LoRA auxiliar específico con las 700 afirmaciones, calcula para cada ejemplo candidato la diferencia entre su log-verosimilitud bajo ese modelo ajustado y bajo el modelo base, elige los tres cocientes mayores y los antepone como demostraciones etiquetadas a la consulta del modelo base. En el protocolo principal, PICLe eleva la consistencia media con la etiqueta de 65,5 a 88,1 en Llama 2 7B Chat, de 50,1 a 78,6 en Vicuna 7B y hasta 67,0 en GPT-J 6B, superando los baselines sin acceso privilegiado a la etiqueta. Sin embargo, cuando la selección puede restringirse a ejemplos positivos, un muestreo aleatorio alcanza 91,5 y la similitud 92,4, ambos por encima del PICLe estándar; PICLe+ llega a 93,1 con ese protocolo adicional. El resultado defendible es que una razón de verosimilitudes obtenida con un adaptador auxiliar ayuda a escoger demostraciones que inducen respuestas binarias coherentes con etiquetas de comportamiento en este benchmark sintético. No demuestra una personalidad estable, humana o interna. La evaluación no incluye personas, texto libre, persistencia conversacional, otros idiomas ni despliegue. La reproducibilidad también es parcial: el repositorio aporta código y entorno, pero no licencia, pruebas, CI, resultados, adaptadores ni rutas portables; además, la auditoría encuentra discrepancias potenciales en la fusión manual de LoRA, una función auxiliar que desempaqueta mal la salida del modelo y un cálculo erróneo de la proporción válida de Degree of Alteration. Estas observaciones limitan la confianza en una reproducción exacta a partir del artefacto publicado, aunque no invalidan por sí solas las tablas del artículo.
Pregunta de investigación
¿Puede una razón de verosimilitudes entre un modelo auxiliar ajustado a una persona y el modelo base seleccionar ejemplos de aprendizaje en contexto que hagan que varios LLM respondan de forma más consistente con la etiqueta conductual de esa persona que el prompting o los criterios de selección existentes?