El artículo pregunta si inducir una personalidad Big Five mediante prompt hace que un modelo tome decisiones en la misma dirección que personas con ese rasgo y si la conducta puede graduarse de forma monotónica al aumentar la intensidad del prompt. Su aportación central es valiosa y más estrecha que algunas formulaciones del texto: aprobar un cuestionario de personalidad no garantiza que la conducta posterior sea humana ni controlable en una tarea concreta. Los cuatro casos estudiados muestran un patrón mixto: uno coincide en dirección con la comparación humana pero no es monotónico, dos cambian en dirección opuesta y uno no difiere significativamente de la línea base. Esto demuestra fallos posibles y dependencia de tarea, modelo y checkpoint; no demuestra que el personality prompting falle siempre.
La personalidad se induce siguiendo a Serapio-García et al.: adjetivos asociados positiva o negativamente con Agreeableness, Openness o Conscientiousness se combinan con calificadores como «a bit», «very» o «extremely». En el Ultimatum Game se usan nueve intensidades, de 1 a 9. El artículo dice que en Milgram 0 significa «Least» y 9 «Most», aunque sus tablas etiquetan los extremos como 0 y 8. Un apéndice aplica el IPIP de 300 ítems y muestra gráficamente que la puntuación medida en los modelos sigue, en general, el nivel inducido. Es un control útil contra un prompt completamente inerte, pero no prueba equivalencia psicométrica: no se publican respuestas, código de puntuación, número de repeticiones, fiabilidad ni una comparación de invariancia con humanos. Además, el paquete fuente sustituye la lista real de adjetivos por marcadores como «low adjective 1», de modo que no contiene los prompts completos necesarios para replicar el tratamiento.
En el Ultimatum Game, el modelo actúa como receptor de una división de 10 dólares y debe aceptar o rechazar ofertas de 0 a 10. Se varía Agreeableness u Openness entre 1 y 9 y se ejecutan 50 respuestas por combinación de intensidad y oferta. Participan GPT-3.5, GPT-4, GPT-4o-mini, GPT-4o, DeepSeek-V3, Llama-3.3-70B y Claude-3.5-Sonnet. Tras hasta tres intentos se eliminan respuestas que no adoptan el formato aceptar/rechazar; el texto informa 373 exclusiones de 25.300 para GPT-4 y 513 para Claude, aunque los porcentajes impresos, 1,51 % y 2,07 %, no coinciden exactamente con esas divisiones, que son 1,474 % y 2,028 %.
Los resultados del juego del ultimátum son coherentes entre modelos en su dirección general. Al aumentar Agreeableness, la aceptación tiende a subir, como en la asociación humana citada. Al aumentar Openness, la aceptación tiende a bajar en los siete modelos, en sentido contrario a la asociación humana. Sin embargo, el recorrido entre niveles no es monotónico para ninguna combinación modelo-rasgo salvo GPT-4, un modelo antiguo. Cinco variantes de redacción probadas con GPT-4o-mini conservan los patrones amplios; la variante en tercera persona sí cambia materialmente el umbral de aceptación, por lo que la robustez es cualitativa, no equivalencia de resultados.
El análisis ajusta un modelo de probabilidad lineal con un efecto independiente para cada nivel de rasgo, un coeficiente para la oferta normalizada y un intercepto. No incorpora interacción rasgo por oferta. Esto importa porque el referente humano, el estudio 4, página 98, de una tesis doctoral de 2007, relaciona Agreeableness y Openness medidas en personas con la aceptación de ofertas injustas, mientras la regresión LLM agrega todas las ofertas. Tampoco se asignaron rasgos a humanos experimentalmente ni se igualaron población, protocolo o escala. Por tanto, la comparación sirve como contraste de signo indirecto, no como réplica humana emparejada ni como estimación causal de un rasgo.
El segundo banco de pruebas adapta el experimento de Milgram a una narración iterativa. El modelo interpreta al profesor que puede continuar, dudar o detener una secuencia de descargas ficticias hasta 450 V; a 315 V el alumno deja de responder y golpea la pared. Otro LLM clasifica cada salida como detenerse, dudar u obedecer. Se varían solo los extremos de Agreeableness y Conscientiousness y se realizan 50 ejecuciones por personalidad, además de una línea base. El trabajo mide el nivel final, las desobediencias acumuladas y los rechazos de seguridad.
La selección de modelos en Milgram es una limitación sustantiva. GPT-3.5 se elimina por no seguir la narración; GPT-4o-mini y Claude-3.5 por respuestas del juez o formatos inconsistentes; Claude-3.7 por rechazar persistentemente la simulación. Se conservan GPT-4o, DeepSeek-V3 y Llama-3.3-70B, aunque el propio texto reconoce que Llama también tiene dificultades con el contexto largo. No se publican tasas de fallo, exclusiones ni denominadores. Así, la tabla final está condicionada a que el modelo acepte y ejecute el escenario; los fallos de competencia y las negativas de seguridad, que también son conducta relevante, quedan parcialmente fuera del análisis.
En Conscientiousness, el artículo dice que los extremos no difieren significativamente de la línea base según una prueba t de Welch. No aporta estadísticos, grados de libertad, p exactas ni corrección por múltiples comparaciones. En Agreeableness aparece un efecto fuerte y opuesto a la asociación humana usada como referencia: los prompts más agradables detienen antes la secuencia y desobedecen más. Para GPT-4o, el nivel final medio es 33,92 en Agree 0, 5,54 en Agree 8 y 29,44 en la línea base; DeepSeek y Llama muestran la misma dirección con menor magnitud o mayor dispersión. El denominado Disobedience Ratio es un recuento normalizado, no una probabilidad, y puede superar uno: llega a 1,13 para GPT-4o Agree 8.
La comparación humana de Milgram procede de Bègue et al. (2015), una muestra observacional de 66 adultos entrevistados ocho meses después de participar en un falso concurso televisivo inspirado en Milgram. Agreeableness y Conscientiousness medidas se asociaron con mayor intensidad de descarga. Es evidencia humana relevante, pero no el mismo tratamiento ni la misma situación que un prompt LLM. Además, retirarse pronto para proteger al alumno es más prosocial y seguro aunque contradiga aquella correlación. El resultado indica desalineación de personalidad o de semejanza humana bajo este referente, no desalineación moral ni peor seguridad.
El artículo prueba una perturbación del texto introductorio de Milgram y conserva la dirección de Agreeableness. También compara dos snapshots de GPT-4o, 2024-05-13 y 2024-08-06, y encuentra cambios grandes tanto en conducta basal como en sensibilidad al prompt. Esta es una aportación práctica importante: la relación entre personalidad inducida y conducta puede cambiar con el post-entrenamiento sin cambiar el nombre comercial. El pie de figura escribe por error 2024-08-16. La identidad y configuración del modelo juez tampoco se detallan, y usar nombres en tercera persona no elimina contaminación de preentrenamiento: el modelo aún puede reconocer y representar la conocida estructura de Milgram.
La reproducibilidad pública es baja. No hay código, datos crudos, generaciones, decisiones del juez, respuestas IPIP, seeds, registros de exclusión ni datos fuente de las figuras. Faltan temperatura, top_p, límite de tokens, proveedor de los modelos abiertos y varios identificadores exactos de snapshot. Incluso el fuente de arXiv omite el inventario real de adjetivos. La monotonicidad se inspecciona descriptivamente, sin una prueba ordenada preespecificada; tampoco hay prerregistro, análisis de potencia o ajuste completo por multiplicidad. Las conclusiones generales descansan en dos tareas artificiales y cuatro combinaciones rasgo-tarea.
La lectura rigurosa es, aun así, útil: en estos experimentos, los prompts sí mueven tanto las puntuaciones de cuestionario como las decisiones, pero esos dos efectos no son intercambiables. Agreeableness en el Ultimatum Game ofrece una dirección humana sin control fino; Openness invierte la dirección; Agreeableness en Milgram invierte la correlación observacional elegida y Conscientiousness resulta nula. La recomendación defendible es evaluar la personalidad con pruebas conductuales específicas del uso previsto, repetirlas por modelo y checkpoint y publicar prompts, datos y exclusiones. El estudio no establece que los LLM tengan rasgos humanos, que siempre se comporten de forma no humana ni que el prompting de personalidad sea inútil; establece que sus efectos conductuales no están garantizados por un cuestionario ni por la intensidad nominal del prompt.