Multi-Persona Thinking (MPT) es un procedimiento de prompting en inferencia, no un modelo de personalidad. Para cada pregunta instancia tres roles derivados de la categoría del benchmark: dos identidades contrastadas, por ejemplo, hombre/mujer o abuelo/nieto, y una persona “neutral general public”. Cada rol genera una respuesta inicial, revisa durante tres rondas las respuestas de los demás y un último pase sin identidad explícita agrega el historial. Con tres personas y R=3, el coste nominal es 3×(1+3)+1=13 llamadas por pregunta.
La evaluación cubre BBQ y una adaptación de StereoSet. BBQ contiene 58.492 preguntas de opción múltiple en once categorías y empareja contextos ambiguos, la respuesta correcta es “no se puede determinar”, con versiones desambiguadas. Se prueban Llama-3.1-8B-Instruct y 70B sobre BBQ completo; Qwen-2.5-7B y GPT-3.5-Turbo aparecen también en un subconjunto de 880 casos. StereoSet usa 12.766 casos adaptados de género, raza, religión y profesión con Llama-3.1-8B y Qwen-2.5-7B. Las tablas promedian cinco runs y comparan prompting directo, instrucción explícita de debiasing, persona simple, self-consistency, re-prompting y multi-agent debate.
En BBQ completo, MPT ofrece un resultado fuerte. Con Llama-3.1-8B logra accuracy media 0,8907 y diff-bias 0,0579, frente a 0,8316/0,0759 de multi-agent debate y 0,8210/0,0696 del mejor re-prompting comparado. La mejora es especialmente grande en los contextos ambiguos: accuracy 0,9054 y diff-bias 0,0279. Con Llama-3.1-70B obtiene 0,9283/0,0053. Su accuracy no difiere significativamente de self-consistency standard, 0,9269, p=0,451, pero el diff-bias sí baja de 0,0301 a 0,0053. Por tanto, “mantiene el razonamiento” es defendible en estos dos modelos, aunque no siempre supera en accuracy.
El resultado no es universal. En el subconjunto GPT-3.5, MPT obtiene accuracy 0,7499, por debajo de direct prompting, 0,7553, y re-prompting debias, 0,7580, aunque alcanza el menor diff-bias, 0,0141. En Qwen sobre el mismo subconjunto obtiene la mejor accuracy, 0,8913, pero su diff-bias 0,0266 no mejora el 0,0262 de re-prompting persona; la diferencia es nula estadísticamente, p=0,9422. La frase general de que MPT logra “el menor bias” debe leerse como tendencia agregada, no dominancia en todas las combinaciones.
StereoSet requiere una interpretación aún más cauta. Los autores no usan la tarea original de language-modeling: sustituyen la opción “unrelated” por variantes de “unknown” y la convierten en QA. La auditoría de los 12.766 JSON públicos confirma que en los 12.766 casos la respuesta etiquetada como correcta es una de diez fórmulas de abstención, “Unknown”, “Cannot answer”, “Not enough information”, etc.. Así, la accuracy mide cuántas veces el prompt de debiasing conduce a abstenerse, no la accuracy lingüística convencional de StereoSet ni una respuesta factual conocida.
En esa tarea transformada, MPT sube Llama-3.1-8B de 0,4664 del siguiente método en accuracy a 0,6073, +30 % relativo, y reduce diff-bias de 0,0888 a 0,0505, −43 % relativo. Qwen pasa a 0,7312/0,0921. Son mejoras reales bajo la definición liberada, pero el mecanismo está alineado con el target: los prompts repiten que se elimine bias, que se reconozca la ambigüedad y que se revise una respuesta “sin ningún bias”, mientras la opción correcta siempre es no decidir. No demuestran mejor comprensión general ni mitigación en generación abierta.
Las ablations apoyan que la iteración y el tercer punto de vista influyen. En Llama-3.1-8B BBQ, “sin neutral” obtiene 0,7775/0,0748 frente a 0,8901/0,0562 con neutral; R=1 produce el salto principal y el rendimiento se estabiliza hacia R=2. Sin embargo, el código de --no_general no elimina el tercer agente: reemplaza la persona neutral por el system prompt estándar. La conclusión de que “solo dos identidades binarias polarizan” no corresponde exactamente a esa implementación. El ejemplo de la Figura 1 también muestra que el supuesto observador neutral puede emitir el mismo estereotipo que una identidad, por lo que neutral es una instrucción, no garantía de imparcialidad.
La comparación de coste cuenta llamadas, no tokens ni latencia secuencial. MPT R=3 cuesta 13 inferencias frente a 15 muestras independientes de self-consistency y mejora 0,8901/0,0562 frente a 0,7907/0,0779. Pero MPT reinyecta historiales crecientes de hasta 512 tokens y tiene cinco etapas secuenciales; self-consistency puede paralelizarse. La combinación MPT+SC muestrea cinco ejecuciones MPT, 65 llamadas nominales, para subir accuracy de 0,8901 a 0,9232 y bajar diff-bias solo de 0,0562 a 0,0546. Sin tokens, tiempo, energía, memoria o coste monetario, “más eficiente” solo está demostrado en número de llamadas bajo ese setup.
Las personas se derivan de etiquetas del dataset y simplifican identidades complejas en pares como hombre/mujer, gay/straight, Black/White, rich/poor o Indian/Japanese. El paper reconoce límites no binarios e interseccionales. En StereoSet, el código crea además roles target/non-target, que pueden ser construcciones extrañas como “stepfather” y “non-stepfather”, no perspectivas sociales válidas. El método puede servir como scaffold de deliberación, pero no modela personas reales, experiencia vivida ni una teoría de personalidad.
La métrica también presenta una discrepancia. Las ecuaciones del paper definen Diff-bias como diferencia con signo, pero el evaluador público aplica valor absoluto en BBQ. Eso convierte dirección en magnitud y es coherente con “menor es mejor”, pero debe documentarse porque borra si el error favorece al grupo target o al counter-target. Para StereoSet el código conserva una diferencia con signo. Los outputs inválidos se excluyen de los denominadores de accuracy y de diff-bias BBQ; las tablas no publican tasas válidas/incompletas, por lo que un método con más fallos de parseo podría verse favorecido. El parser usa el primer dígito 0–2 de toda la respuesta si falta la etiqueta <answer>, una recuperación potencialmente ambigua.
La significación usa paired t-tests sobre cinco runs y reporta t extremadamente altos, pero no se publican los cinco resultados, seeds o script de tests/intervalos. No hay corrección por las múltiples comparaciones de modelos, datasets y métricas. Las CIs estrechas describen variación de sampling en un benchmark fijo, no incertidumbre sobre generalización a otros prompts, idiomas, modelos o dominios reales.
El repositorio MANGA-UOFA/multi-persona-thinking fue auditado en el commit c6f2b6cd1ad354b3aab2bacaea775452d1175869. Incluye los 58.492 casos BBQ, los 12.766 StereoSet adaptados, dos scripts Python, un environment completo y un comando para MPT con Llama-3.1-8B/BBQ. El código compila sintácticamente y los conteos coinciden con el paper. Pero no incluye licencia, tests, CI, outputs, logs de resultados, hardware/runtime, seeds de los cinco runs ni scripts de t-tests. El README no documenta baselines, Qwen, 70B, GPT, StereoSet, ablations o todas las tablas.
Hay además una limitación de implementación material: el pipeline de inferencia solo construye prompts cuando el método empieza por “m” y no contiene ramas que implementen direct prompting, self-consistency o re-prompting. Si se invoca mad, la misma rama asigna las personas MPT, a pesar de que el paper define MAD sin identidades explícitas. Para OpenAI, tres agentes indexan tres objetos de modelo; pasar una sola vez GPT-3.5 produce un índice fuera de rango y el README no explica repetir el identificador. El repositorio permite reconstruir MPT con recursos sustanciales, pero no reproduce de extremo a extremo las comparaciones publicadas.
La contribución está publicada en Findings of ACL 2026 y demuestra que una deliberación repetida, explícitamente orientada a evitar estereotipos, mejora BBQ para Llama y reduce varias métricas. No establece respuestas “bias-free”, imparcialidad en sistemas reales, beneficio para generación abierta o una ventaja inherente de las personas frente a otros prompts equivalentes en tokens y etapas.