BILLY sustituye una conversación multiagente por una intervención en las activaciones de un único LLM. Para cada rol profesional, Claude Sonnet 4 genera cinco system prompts positivos; el modelo responde a 20 preguntas que pretenden elicitar ese rol bajo esos prompts y bajo un prompt neutral. GPT-4o-mini puntúa la expresión del rol de 0 a 100. Según el método escrito, se conservan respuestas positivas con score mayor de 50 y neutrales con score menor de 50; se promedia la activación del residual stream a través de tokens y se resta la media neutral de la positiva en cada capa. BILLY toma después la media aritmética de varios vectores y la suma, multiplicada por alfa, a las activaciones durante la generación. Los experimentos principales usan capa 20 y alfa 2,0. El default denominado de cuatro vectores es Creative Professional, Environmentalist, Futurist y Futurist: Futurist está duplicado y recibe la mitad del peso, por lo que no son cuatro perspectivas distintas.
La evaluación usa Qwen2.5-7B-Instruct, Llama-3.1-8B-Instruct y Gemma-3-4B-it en cuatro tareas de creatividad ampliadas previamente con GPT-4: Alternative Uses, Instances, Similarities y Scientific Creativity, con ficheros de 100 preguntas en el repositorio. Los modelos producen cinco ideas por pregunta. Los baselines son un agente a temperatura 0,7, el mismo a 1,0, un agente con prompt multirrol y LLM Discussion, que emplea cuatro agentes durante cinco rondas. GPT-4o-mini puntúa originalidad y elaboración de 1 a 5. En Table 2, BILLY obtiene el mayor punto de originalidad en 10 de 12 cruces modelo-tarea: los ocho de Qwen/Llama y AUT/Instances con Gemma. No lidera Gemma Scientific, 4,94 frente a 4,96 de SA y SA-MRP, ni Gemma Similarities, 4,94 frente a 4,97 de SA. La elaboración es competitiva, pero pierde varias filas. En Gemma hay fuerte efecto techo y LLM Discussion sufre salidas inestables y gran varianza, algo que los propios autores atribuyen al contexto largo del modelo pequeño. Por tanto, la evidencia favorece la intervención para esta rúbrica y estas tareas, pero es más estrecha que «supera los enfoques tradicionales» sin matices.
Los tests estadísticos sí pueden auditarse. Los scripts hacen t-tests pareados bilaterales entre BILLY y cuatro baselines en cada combinación disponible de tarea, modelo y métrica; para LLM Discussion promedian grupos consecutivos de cuatro agentes. Al recuperar los 55 JSON oficiales almacenados con Git LFS se reproducen 88 contrastes: 65 tienen p<0,05 (73,86 %) y 58 p<0,001 (65,91 %), que redondean a los 74 % y 66 % del texto. AUT tiene n=98 por dos respuestas ausentes; el resto n=100. No hay corrección por 88 comparaciones, familia preregistrada, intervalos ni tamaños de efecto. Un Bonferroni global 0,05/88 conserva 57 tests (64,77 %). La cifra publicada es numéricamente real, pero contar significaciones no informa de magnitud ni demuestra ventaja en todos los casos; 23 comparaciones no alcanzan 0,05.
La evaluación humana compara SA, LLM Discussion y BILLY en las cuatro tareas. Se seleccionan tres salidas por tarea y once voluntarios asignan originalidad y elaboración. El paper llama a esto 132 evaluation scores: corresponde a 11 evaluadores por 12 salidas; al desplegar tres métodos y dos métricas, el CSV contiene 11×72=792 valores escalares. BILLY logra la media más alta en las ocho filas tarea-métrica. Las correlaciones entre medias humanas y juez LLM son Spearman 0,73/Pearson 0,66 para originalidad y 0,43/0,40 para elaboración, calculadas sobre solo doce puntos agregados por métrica. La limitación decisiva aparece en los propios artefactos pero no en el cuerpo principal: los seis alfas de Krippendorff están entre 0,1253 y 0,2279, muy por debajo del umbral 0,667 que el script define como aceptable. Las medias de Kendall entre parejas son 0,083-0,231 en originalidad y 0,374-0,582 en elaboración. Así, las medias favorecen a BILLY, pero no existe consenso humano fiable suficiente para hablar de una validación estable.
El análisis de eficiencia es fuerte frente al baseline multiagente, pero no frente a cualquier alternativa. Table 5 informa por consulta: SA 23,9 s, 22,3/407,1 tokens y 0,25 dólares por 10.000; SA-MRP 36,8 s, 221,2/861,1 y 0,56; LLM Discussion 513 s, 88.853/12.922,1 y 25,50; BILLY 19 s, 62,2/475,6 y 0,30. La reducción mayor del 95 % se refiere a LLM Discussion y la latencia es aproximadamente 25 veces menor. Sin embargo, BILLY cuesta un 20 % más que SA con la propia tarifa del paper, aunque su latencia reportada es un 20 % menor. El coste usa precios por token de Nebius y amortiza inputs de creación de vectores, pero excluye GPU, tiempo de extracción, carga del modelo y overhead de intervenir activaciones. No sostiene que sea el método absolutamente más barato.
Los análisis de composición muestran interacciones, no control aditivo limpio. La curva de uno a siete vectores cambia simultáneamente identidad y cantidad: todas las condiciones desde dos incluyen Creative Professional y el default duplica Futurist. No permite estimar un efecto causal del número de personas. En doce prompts neutrales, Gemini 2.5 Pro, Gemini 2 Flash y GPT-4o-mini reparten exactamente 100 puntos entre cinco roles ad hoc. El vector Creative eleva Creative a 43,2 y Environmentalist eleva Environmental a 30,8. Pero la fusión Creative+Environmentalist obtiene 43,9 en Creative y solo 12,3 en Environmental, por debajo tanto de Environmentalist solo como del 14,9 de SA. Los autores admiten que el vocabulario creativo domina al juez. Esto contradice un control simultáneo fiable en el texto, aunque las activaciones se proyecten positivamente sobre ambas direcciones. Esa proyección tampoco es validación independiente: se proyecta el cambio causado por añadir una media de vectores sobre esos mismos vectores. Confirma la dirección inyectada, no su significado psicológico, la causalidad de la calidad creativa ni la expresión observada.
El repositorio oficial es valioso: publica 92 scripts Python sintácticamente válidos, cuatro datasets, 50 vectores serializados, ratings humanos, prompts, tablas de proyección y resultados suficientes para reproducir porcentajes. Pero no es una reproducción extremo a extremo limpia. El README expande mal BILLY, afirma licencia MIT sin que exista LICENSE y dirige el quick start a seis rutas ausentes. Ciento cuarenta JSON quedan como punteros en un clon sin Git LFS y no se documenta git-lfs pull. No hay tests, CI, contenedor, entorno bloqueado o seeds. Hay rutas absolutas de máquinas de autores. El generador publicado usa umbrales adaptativos basados en medianas, exige coherence>=50, conserva al menos tres casos y trunca a los primeros 20, distinto del >50/<50 descrito. La API genera la respuesta antes de añadir el supuesto prompt multirrol, /reset llama a un método comentado, los modos de persona fallan con cuatro vectores y tres métodos de fusión anunciados no implementan una alternativa estable. La conclusión fiel es que BILLY aporta evidencia prometedora de que una intervención de activación concreta mejora puntuaciones de originalidad en estos benchmarks y reduce radicalmente coste frente a una discusión de cuatro agentes. No demuestra personalidad coherente, creatividad verdadera, control interpretable independiente, consenso humano fiable ni generalización; sus artefactos permiten auditoría parcial, no todavía reproducción documentada de producción.