El estudio crea, para cada uno de tres modelos abiertos, 32 agentes que cubren las 2^5 combinaciones binarias de los rasgos Big Five. Cada agente recibe un prompt formado por frases de una escala asociadas al polo alto o bajo de neuroticismo, amabilidad, responsabilidad, extraversión y apertura, y después responde el BFI-2 de 60 ítems. Qwen2.5-32B-Instruct, Qwen2.5-14B-Instruct y Llama 3.1-8B-Instruct se ejecutan con vLLM y temperatura 0. Los contrastes emparejados entre polos del rasgo muestran p<0,001 en las 15 combinaciones modelo-rasgo y tamaños d de Cohen de 1,49 a 23,17. Esto confirma que el prompt cambia las respuestas del cuestionario, pero la validación es semánticamente circular: se instruye al modelo con descripciones que expresan directamente los mismos constructos que luego se preguntan. No hay condición con instrucciones conductuales equivalentes pero sin etiqueta de personalidad, ni test-retest, ni evaluación humana de personalidad. Para tareas cerradas, los mismos 32 prompts se aplican a MMLU, MMLU-Pro, SciQ, ARC-Challenge y ARC-Easy. El promedio máximo y mínimo difieren 4,85 puntos en Qwen-32B (86,23 frente a 81,38), 2,77 en Qwen-14B (80,96 frente a 78,19) y 3,75 en Llama-8B (71,45 frente a 67,70). Los autores correlacionan los scores BFI-2 de los 32 agentes con su exactitud y encuentran patrones dependientes del modelo: en Qwen-32B apertura correlaciona 0,50–0,65 con los cinco benchmarks; en Qwen-14B no lo hace de forma estable, y en Llama sólo aparece 0,52 en MMLU-Pro. Neuroticismo es generalmente negativo, pero en Llama correlaciona +0,50 con MMLU-Pro. Las frases usadas para inducir rasgos incluyen «comprendo rápido», «me gusta resolver problemas complejos», «no me interesan los problemas de otros» o «desperdicio mi tiempo»; por ello el tratamiento altera de manera directa capacidad declarada, esfuerzo y cooperación. El diseño no permite atribuir los cambios a personalidad en lugar de a seguimiento de esas órdenes. Para creatividad, cada perfil responde AUT, INSTANCES, SCIENTIFIC y SIMILARITIES. GPT-4o-mini, sin snapshot declarado y con temperatura 0, asigna originalidad y elaboración de 1 a 10 y cuenta fluidez y flexibilidad. Se publican medias y desviaciones, pero no el número de ítems por tarea, resultados crudos, validación humana, fiabilidad del juez ni análisis de sensibilidad. Se calculan al menos 120 correlaciones rasgo-creatividad además de 75 rasgo-exactitud, sin corrección por multiplicidad. Apertura y amabilidad correlacionan frecuentemente con las puntuaciones del mismo juez, neuroticismo de forma negativa y extraversión de forma inconsistente; no se prueba creatividad humana ni transferencia fuera de esos prompts. La parte multiagente selecciona sólo nueve equipos manuales de tres miembros: seis homogéneos, dos diversos y uno con un único perfil +---- calificado de extremo. Tras respuesta inicial, discusión y revisión, se promedia la exactitud o creatividad de las tres respuestas finales. No hay permutaciones de posición, réplicas, equipos de control con las mismas capacidades y sin persona, ni inferencia estadística. En Qwen-32B, por ejemplo, Team 7 obtiene 47,25 en GPQA frente a 44,93 de Team 4, pero en MMLU y MMLU-Pro ambos difieren sólo −0,05 y −0,12. La tabla de creatividad multiagente repite exactamente las columnas SIMILARITIES de Teams 1–9 en los tres modelos, lo que exige datos o código para descartar un error de copia. Tampoco evalúa una decisión colectiva separada: el protocolo puntúa a cada miembro y promedia. Por tanto, no establece inteligencia colectiva distinta de la capacidad individual. El PDF arXiv v2 presenta además fallos visibles: tablas del apéndice pierden encabezados, signos, columnas o casi todo el cuerpo en las páginas 18, 22, 24, 28 y 30. No se enlazan código, outputs, prompts completos por perfil ni datos de evaluación. La conclusión defendible es más estrecha: instrucciones semánticamente ligadas a Big Five cambian respuestas BFI-2 y, en algunos modelos, también exactitud y scores automáticos de creatividad; nueve composiciones de debate producen diferencias descriptivas pequeñas o variables. No se demuestra que el modelo simule psicológicamente a humanos ni que la personalidad sea el mecanismo causal.
Pregunta de investigación
¿Cómo cambian las respuestas BFI-2, la exactitud en benchmarks, las puntuaciones automáticas de creatividad y los resultados de debate cuando tres LLM reciben combinaciones binarias de instrucciones asociadas a los cinco rasgos Big Five?