El preprint estudia cuánto cambian cinco modelos cuando cada pregunta de un benchmark va precedida por un system prompt que describe un nivel alto, medio o bajo de un rasgo Big Five. Las descripciones concatenan 104 marcadores bipolares y el intensificador «extremely». Además de una línea base sin persona, se ensayan rasgos aislados, un perfil de baja amabilidad, baja responsabilidad y alto neuroticismo, otro de baja amabilidad, baja responsabilidad y alta extraversión, y un perfil que fija todos los rasgos en nivel medio. Los modelos son GPT-4.1, Llama-3-8B-Instruct, Llama-3-70B-Instruct, Llama-4-Maverick y DeepSeek-V3; se evalúan con temperatura 0, top-p 1 y semilla declarada 43 sobre MMLU, TruthfulQA, WMDP, cinco tareas ETHICS y Sycophancy. IPIP-NEO-300 comprueba si el autoinforme sigue el prompt y SD3 mide autoinformes de tríada oscura.
El efecto más grande aparece con baja responsabilidad, pero es muy heterogéneo. En GPT-4.1, TruthfulQA baja de 83,2 a 44,4, ETHICS-Commonsense de 71,4 a 38,7 y MMLU de 84,6 a 67,8; en Llama-3-70B las caídas correspondientes son 71,5→43,3, 67,0→45,2 y 77,8→69,8. En Llama-3-8B, Llama-4 y DeepSeek-V3 el patrón es mucho menor o mixto: por ejemplo, MMLU cambia −4,6, −2,7 y −1,1 puntos, respectivamente. El texto afirma que «todos» pierden 20–40 puntos, pero las tablas no sostienen esa generalización para los cinco modelos. Los perfiles combinados sí reducen ETHICS-Commonsense con poca pérdida de MMLU en varios modelos, aunque la magnitud va de −26,4 puntos en GPT-4.1 a −8,7 en DeepSeek-V3.
Estos resultados demuestran sensibilidad a instrucciones de persona, no identifican todavía un efecto causal de personalidad latente. Los marcadores incluyen contenido que se solapa directamente con las tareas: baja responsabilidad dice «lazy», «irresponsible» y «careless»; baja amabilidad, «immoral», «dishonest» y «uncooperative»; baja apertura, «unintelligent» y «unanalytical». Por tanto, una menor exactitud en MMLU o una respuesta menos moral o veraz puede ser obediencia literal a esas instrucciones. La comprobación IPIP también es circular: el modelo recibe adjetivos que casi dictan cómo contestar ítems de autoinforme semánticamente equivalentes. SD3 sigue siendo otro autoinforme bajo el mismo prompt y sus ítems se solapan con «dishonest», «self-important» o «immoral»; no constituye por sí solo validación conductual externa ni symbol grounding.
La interpretación de «seguridad» requiere además respetar la dirección de cada métrica. WMDP mide conocimiento peligroso: mayor exactitud significa más capacidad para responder preguntas de bioseguridad, química y ciberseguridad, no automáticamente mayor seguridad. En Sycophancy, la columna conductual es el porcentaje de cambios tras el desafío; GPT-4.1 pasa de 9,5 a 98,8 con baja responsabilidad. Sin embargo, la figura principal omite esa columna y muestra solo la exactitud de la respuesta original, aunque abstract y discusión hablan de Sycophancy. Los mapas colorean aumentos de exactitud como «mejora» de forma uniforme, una convención que no puede aplicarse igual a WMDP ni al cambio de respuesta. Las recomendaciones de despliegue sobre perfiles «seguros» no se validan en conversaciones, ataques reales, generación abierta o resultados de daño.
La auditoría estadística y de integridad encuentra contradicciones que impiden aceptar las afirmaciones de significación y validez tal como están escritas. El estudio principal es determinista y no publica intervalos ni pruebas por ítem. La sección robusta solo presenta GPT-4.1 y Llama-4, agrega medias de grupos de variantes y modelos, calcula d incluso sobre filas que ya son desviaciones estándar y no informa p-valores; los d narrados para MMLU, ETHICS-CM y TruthfulQA no coinciden con la tabla. El «efecto» psicométrico ∆M/4 no es Cohen d, pero recibe umbrales convencionales de d; sus tablas mezclan medias brutas en la fila baseline con cambios escalados en las demás. La tabla Llama-4 de IPIP/SD3 duplica exactamente la de Llama-3-70B y contradice los valores Llama-4 de otra tabla. La figura llamada «nine-panel» contiene doce paneles, excluye Llama-3-8B y usa ejes descritos incorrectamente; la tabla robusta apaisada resulta casi ilegible en el PDF. El archivo fuente oficial contiene TeX, figuras y tablas generadas, pero no código ni datos crudos. La contribución defendible es una alerta empírica: prompts extremos con descriptores moral y cognitivamente cargados pueden mover mucho determinados benchmarks. No establece que una personalidad sintética sea el mecanismo ni que esas oscilaciones invaliden por sí solas todos los resultados de seguridad.