El artículo estudia interpolative decoding: en lugar de redactar un prompt distinto para cada nivel de un rasgo, define dos prompts extremos y mezcla sus distribuciones token a token mediante un parámetro lambda. Prueba dos variantes. Mixture decoding promedia las distribuciones con lambda entre 0 y 1; contrastive decoding ancla un extremo y amplifica su diferencia con el otro. La evidencia más clara es de control de salidas, no de personalidad humana. En Big Five, para cada rasgo se eligen tres de seis facetas como 12 ejemplos few-shot y se reservan las otras tres como 12 ítems de evaluación. Las respuestas aleatorias a los ejemplos fijan el score objetivo y se recorren las 20 particiones posibles. La tabla publica correlaciones de 0,69 en apertura, 0,83 en responsabilidad, 0,83 en extraversión, 0,70 en amabilidad y 0,73 en neuroticismo. Sin embargo, el pie las llama Spearman entre respuestas y niveles objetivo, mientras el texto dice Pearson entre lambda y score; la unidad y el estadístico no quedan descritos de forma consistente. Mixture decoding además salta casi de un extremo al otro alrededor de lambda 0,5, mientras contrastive cambia de forma más gradual. Esto muestra que el cuestionario puede dirigirse con prompts y few-shot relacionados; no valida un rasgo psicológico interno. El segundo bloque usa un dictator game. Interpola honestidad-humildad, amabilidad y emocionalidad de HEXACO entre -30 y 30, permutando cuatro frases del prompt. El pago al compañero correlaciona 0,74/0,78 con honestidad-humildad, 0,49/0,56 con amabilidad y -0,03/-0,08 con emocionalidad, en Pearson/Spearman. El orden cualitativo coincide con la literatura humana seleccionada, pero no se recoge ni reanaliza una muestra humana con el mismo protocolo y no hay prueba de equivalencia, intervalos o significación. En Pandemic, doce pares de recomendaciones social/táctica se prueban en ocho lambdas, 96 decisiones descritas. La probabilidad de seguir al compañero cae con lambda, Pearson -0,82 y Spearman -0,94; también cambian conteos léxicos construidos por inspección de los autores. El experimento denominado human twinning es mucho más estrecho de lo que sugiere el término. Observa a una sola persona durante cinco partidas y 25 turnos de Pandemic. Un planner externo propone solo los tres o cinco mejores movimientos; Gemma 3 4B y 12B los reordenan mediante comparaciones A/B en ambos órdenes. Los autores reconocen que el orden cambia el resultado en casi el 50% de los casos. Se comparan cuatro lambdas de mixture, cuatro de contrastive y un baseline mediante perplexity sobre esos mismos 25 turnos, sin separación train/test ni segundo sujeto. Interpolación reduce ligeramente la perplexity en tres de cuatro grupos publicados: 3,92 frente a 3,95 para Gemma 12B top-3; 4,84 frente a 5,00 para 12B top-5; y 4,93 frente a 5,31 para Gemma 4B top-5. En Gemma 4B top-3 gana el baseline, 3,67 frente al mejor 3,97 interpolado. La cobertura de acciones humanas no cambia con el decoder: el planner pierde de media 1,00 movimientos con top-3 y 0,80 con top-5. La tabla muestra solo configuraciones descritas como más significativamente distintas del baseline, pero no publica test, p-value, corrección ni grid completo. Por ello es ajuste in-sample de una distribución sobre acciones ya cubiertas por el planner, no predicción individual prospectiva. Un último experimento entrena un MLP con 1.294 respuestas sintéticas y valida en 214 para recuperar lambda; los MSE son 2,96, 2,19 y 1,28 según rasgo. Recuperar un parámetro generativo desde texto del propio LLM no estima un rasgo humano. La reproducibilidad es muy baja. Fuera del apartado de twinning no se identifica el LLM empleado; faltan temperatura, top-p, seeds, versiones y resultados crudos. La fórmula contrastive se escribe sobre probabilidades, no logits o log-probabilidades, y sin código no puede verificarse la operación real. El repositorio oficial BSD-3, commit 42cfaf8, contiene únicamente README, licencia y tres imágenes; sus siete commits nunca incluyeron código ni datos, pese a que el paper dice que se publicarán allí. Tampoco se aportan los 25 turnos humanos, consentimiento, demografía, experiencia, revisión ética o política de privacidad. La conclusión fiel es que lambda controla varias regularidades textuales y decisiones en los prompts ensayados. No queda demostrado un continuo psicológico humano, una replicación experimental formal ni un gemelo capaz de predecir a personas nuevas o turnos no observados.
Pregunta de investigación
¿Puede la combinación token a token de dos prompts extremos controlar de forma continua rasgos y decisiones de un LLM y, al invertir esa búsqueda, aproximar las acciones de una persona concreta?