Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models

Inducción y control de rasgos2025arXivRevisión editorial aprobada

Autores: Stephen Fitz, Peter Romero, Steven Basart, Sipeng Chen, Jose Hernandez-Orallo

Palabras clave: Artificial Intelligence, Computation and Language, Large Language Models, Personality Traits, Model Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
20
Hallazgos
71
Limitaciones
16
Evidencias

Resumen editorial

Español

El preprint estudia cuánto cambian cinco modelos cuando cada pregunta de un benchmark va precedida por un system prompt que describe un nivel alto, medio o bajo de un rasgo Big Five. Las descripciones concatenan 104 marcadores bipolares y el intensificador «extremely». Además de una línea base sin persona, se ensayan rasgos aislados, un perfil de baja amabilidad, baja responsabilidad y alto neuroticismo, otro de baja amabilidad, baja responsabilidad y alta extraversión, y un perfil que fija todos los rasgos en nivel medio. Los modelos son GPT-4.1, Llama-3-8B-Instruct, Llama-3-70B-Instruct, Llama-4-Maverick y DeepSeek-V3; se evalúan con temperatura 0, top-p 1 y semilla declarada 43 sobre MMLU, TruthfulQA, WMDP, cinco tareas ETHICS y Sycophancy. IPIP-NEO-300 comprueba si el autoinforme sigue el prompt y SD3 mide autoinformes de tríada oscura.

El efecto más grande aparece con baja responsabilidad, pero es muy heterogéneo. En GPT-4.1, TruthfulQA baja de 83,2 a 44,4, ETHICS-Commonsense de 71,4 a 38,7 y MMLU de 84,6 a 67,8; en Llama-3-70B las caídas correspondientes son 71,5→43,3, 67,0→45,2 y 77,8→69,8. En Llama-3-8B, Llama-4 y DeepSeek-V3 el patrón es mucho menor o mixto: por ejemplo, MMLU cambia −4,6, −2,7 y −1,1 puntos, respectivamente. El texto afirma que «todos» pierden 20–40 puntos, pero las tablas no sostienen esa generalización para los cinco modelos. Los perfiles combinados sí reducen ETHICS-Commonsense con poca pérdida de MMLU en varios modelos, aunque la magnitud va de −26,4 puntos en GPT-4.1 a −8,7 en DeepSeek-V3.

Estos resultados demuestran sensibilidad a instrucciones de persona, no identifican todavía un efecto causal de personalidad latente. Los marcadores incluyen contenido que se solapa directamente con las tareas: baja responsabilidad dice «lazy», «irresponsible» y «careless»; baja amabilidad, «immoral», «dishonest» y «uncooperative»; baja apertura, «unintelligent» y «unanalytical». Por tanto, una menor exactitud en MMLU o una respuesta menos moral o veraz puede ser obediencia literal a esas instrucciones. La comprobación IPIP también es circular: el modelo recibe adjetivos que casi dictan cómo contestar ítems de autoinforme semánticamente equivalentes. SD3 sigue siendo otro autoinforme bajo el mismo prompt y sus ítems se solapan con «dishonest», «self-important» o «immoral»; no constituye por sí solo validación conductual externa ni symbol grounding.

La interpretación de «seguridad» requiere además respetar la dirección de cada métrica. WMDP mide conocimiento peligroso: mayor exactitud significa más capacidad para responder preguntas de bioseguridad, química y ciberseguridad, no automáticamente mayor seguridad. En Sycophancy, la columna conductual es el porcentaje de cambios tras el desafío; GPT-4.1 pasa de 9,5 a 98,8 con baja responsabilidad. Sin embargo, la figura principal omite esa columna y muestra solo la exactitud de la respuesta original, aunque abstract y discusión hablan de Sycophancy. Los mapas colorean aumentos de exactitud como «mejora» de forma uniforme, una convención que no puede aplicarse igual a WMDP ni al cambio de respuesta. Las recomendaciones de despliegue sobre perfiles «seguros» no se validan en conversaciones, ataques reales, generación abierta o resultados de daño.

La auditoría estadística y de integridad encuentra contradicciones que impiden aceptar las afirmaciones de significación y validez tal como están escritas. El estudio principal es determinista y no publica intervalos ni pruebas por ítem. La sección robusta solo presenta GPT-4.1 y Llama-4, agrega medias de grupos de variantes y modelos, calcula d incluso sobre filas que ya son desviaciones estándar y no informa p-valores; los d narrados para MMLU, ETHICS-CM y TruthfulQA no coinciden con la tabla. El «efecto» psicométrico ∆M/4 no es Cohen d, pero recibe umbrales convencionales de d; sus tablas mezclan medias brutas en la fila baseline con cambios escalados en las demás. La tabla Llama-4 de IPIP/SD3 duplica exactamente la de Llama-3-70B y contradice los valores Llama-4 de otra tabla. La figura llamada «nine-panel» contiene doce paneles, excluye Llama-3-8B y usa ejes descritos incorrectamente; la tabla robusta apaisada resulta casi ilegible en el PDF. El archivo fuente oficial contiene TeX, figuras y tablas generadas, pero no código ni datos crudos. La contribución defendible es una alerta empírica: prompts extremos con descriptores moral y cognitivamente cargados pueden mover mucho determinados benchmarks. No establece que una personalidad sintética sea el mecanismo ni que esas oscilaciones invaliden por sí solas todos los resultados de seguridad.

English

The preprint studies how much five models change when each benchmark question is preceded by a system prompt describing a high, medium, or low level of a Big Five trait. Descriptions concatenate 104 bipolar markers with the intensifier “extremely.” In addition to an unprompted baseline, the study tests isolated traits; a low-Agreeableness, low-Conscientiousness, high-Neuroticism profile; a low-Agreeableness, low-Conscientiousness, high-Extraversion profile; and a profile setting every trait to medium. Models are GPT-4.1, Llama-3-8B-Instruct, Llama-3-70B-Instruct, Llama-4-Maverick, and DeepSeek-V3; generation uses temperature 0, top-p 1, and declared seed 43 on MMLU, TruthfulQA, WMDP, five ETHICS tasks, and Sycophancy. IPIP-NEO-300 checks whether self-reports follow the prompt, while SD3 measures dark-triad self-reports.

The largest effect occurs under low Conscientiousness, but it is highly heterogeneous. For GPT-4.1, TruthfulQA falls from 83.2 to 44.4, ETHICS-Commonsense from 71.4 to 38.7, and MMLU from 84.6 to 67.8; for Llama-3-70B the corresponding changes are 71.5→43.3, 67.0→45.2, and 77.8→69.8. Patterns are much smaller or mixed for Llama-3-8B, Llama-4, and DeepSeek-V3: MMLU changes by −4.6, −2.7, and −1.1 points, respectively. The text says that “all” lose 20–40 points, but the tables do not support that generalization across all five models. Composite profiles do lower ETHICS-Commonsense with little MMLU loss in several models, although the magnitude ranges from −26.4 points for GPT-4.1 to −8.7 for DeepSeek-V3.

These results demonstrate sensitivity to persona instructions; they do not yet identify a causal effect of latent personality. Markers contain content that directly overlaps the tasks: low Conscientiousness says “lazy,” “irresponsible,” and “careless”; low Agreeableness says “immoral,” “dishonest,” and “uncooperative”; low Openness says “unintelligent” and “unanalytical.” Lower MMLU accuracy or less moral and truthful answers can therefore be literal instruction following. The IPIP check is also circular: the model receives adjectives that nearly dictate responses to semantically equivalent self-report items. SD3 remains another self-report under the same prompt, and its items overlap with “dishonest,” “self-important,” and “immoral”; it does not by itself provide external behavioral validation or symbol grounding.

“Safety” interpretation must also respect metric direction. WMDP measures hazardous knowledge: greater accuracy means greater ability to answer biosecurity, chemistry, and cybersecurity questions, not automatically greater safety. In Sycophancy, the behavioral column is the percentage of answer changes after a challenge; GPT-4.1 moves from 9.5 to 98.8 under low Conscientiousness. The main figure nevertheless omits this column and displays only original-answer accuracy, while the abstract and discussion invoke Sycophancy. Heatmaps uniformly color accuracy increases as “improvement,” a convention that cannot be applied identically to WMDP or answer-changing. Deployment recommendations about “safe” profiles are not tested in conversations, real attacks, open-ended generation, or harm outcomes.

The statistical and integrity audit finds contradictions that prevent accepting the claims of significance and validity as written. The main study is deterministic and provides neither item-level intervals nor tests. The robustness section covers only GPT-4.1 and Llama-4, aggregates group means across prompt variants and models, computes d even for rows that are themselves standard deviations, and reports no p-values; the narrated d values for MMLU, ETHICS-CM, and TruthfulQA do not match the table. The psychometric “effect” ∆M/4 is not Cohen's d but receives conventional d thresholds; its tables mix raw baseline means with scaled changes in the other rows. The Llama-4 IPIP/SD3 table exactly duplicates Llama-3-70B and conflicts with Llama-4 values in another table. The figure called “nine-panel” contains twelve panels, excludes Llama-3-8B, and has incorrectly described axes; the landscape robustness table is nearly unreadable in the PDF. The official source archive contains TeX, figures, and generated tables, but no code or raw data. The defensible contribution is an empirical warning: extreme prompts containing morally and cognitively loaded descriptors can strongly move some benchmarks. It does not establish synthetic personality as the mechanism or show that these oscillations by themselves invalidate all safety results.

Pregunta de investigación

¿Cambian sistemáticamente la capacidad, el conocimiento peligroso, la veracidad, las respuestas éticas y la susceptibilidad a cambiar de respuesta cuando un mismo LLM recibe prompts extremos construidos con marcadores Big Five, y esos cambios pueden separarse de su capacidad general?

Método

Se antepone a cada ítem un system prompt con marcadores bipolares de un rasgo Big Five en nivel alto, medio o bajo, además de dos perfiles multirrasgo y un perfil all-medium. Se evalúan cinco modelos mediante APIs con temperatura 0, top-p 1 y semilla 43 en MMLU, TruthfulQA, WMDP bio/chem/cyber, ETHICS commonsense/deontology/justice/utilitarianism/virtue y dos salidas de Sycophancy. IPIP-NEO-300 y SD3 se administran bajo los mismos prompts. El resultado principal son diferencias de exactitud frente a la línea base; un apéndice añade ∆M/4 para autoinformes y una robustez de alta frente a baja responsabilidad sobre variaciones de prompt en dos modelos. La auditoría leyó y renderizó 45 páginas, comprobó todas las tablas/figuras, inspeccionó el archivo fuente oficial de arXiv y buscó código o datos públicos.

Muestra: La unidad básica es una pregunta de benchmark respondida una vez por modelo y condición en la ejecución principal determinista; el artículo no informa en una tabla el número de ítems efectivamente puntuados, exclusiones, fallos API o reintentos por benchmark. Hay cinco modelos y diecinueve condiciones tabuladas por modelo, pero las figuras principales solo muestran cuatro y omiten Llama-3-8B. La robustez agrega variantes de alta/baja responsabilidad para GPT-4.1 y Llama-4 sin declarar claramente el número de prompts y semillas subyacentes ni conservar el apareamiento por pregunta.

Hallazgos

  • Los cinco modelos cambian sus autoinformes IPIP en la dirección semánticamente solicitada.
  • Los prompts all-medium llevan muchas puntuaciones IPIP exactamente o casi exactamente a 3.
  • Baja amabilidad y algunos perfiles combinados elevan autoinformes SD3 de maquiavelismo y psicopatía.
  • Baja responsabilidad produce las mayores caídas agregadas en GPT-4.1.
  • GPT-4.1 baja 38,8 puntos en TruthfulQA y 17,2 en MMLU con baja responsabilidad.
  • GPT-4.1 baja entre 26,2 y 33,7 puntos en las cinco tareas ETHICS con baja responsabilidad.
  • Llama-3-70B baja 28,2 puntos en TruthfulQA y 8,0 en MMLU con baja responsabilidad.
  • Llama-3-8B no reproduce una caída de TruthfulQA bajo baja responsabilidad y pierde 4,6 puntos en MMLU.
  • Llama-4 pierde 12,2 puntos en TruthfulQA y 2,7 en MMLU bajo baja responsabilidad.
  • DeepSeek-V3 pierde 5,2 puntos en TruthfulQA y 1,1 en MMLU bajo baja responsabilidad.
  • Los efectos de baja responsabilidad no son uniformes entre tamaños y familias.
  • Alta extraversión reduce TruthfulQA en varios modelos, con magnitudes distintas.
  • Baja amabilidad reduce fuertemente ETHICS-Commonsense en los cinco modelos tabulados.
  • El perfil baja amabilidad, baja responsabilidad y alto neuroticismo reduce ETHICS-Commonsense en todos los modelos.
  • Ese perfil apenas cambia MMLU en GPT-4.1, Llama-3-70B, Llama-4 y DeepSeek, pero lo reduce 5,6 puntos en Llama-3-8B.
  • All-medium mejora TruthfulQA frente a baseline en los cinco modelos, pero no mejora uniformemente todas las métricas.
  • En GPT-4.1 baja responsabilidad eleva el cambio de respuesta Sycophancy de 9,5 a 98,8.
  • La figura principal omite la métrica de cambio de respuesta y solo incluye la exactitud original de Sycophancy.
  • Los prompts contienen descriptores cognitivos y morales directamente relacionados con los benchmarks.
  • El archivo fuente oficial confirma que no se distribuyen código ejecutable ni datos crudos.

Limitaciones

  • El trabajo es un preprint v1 bajo revisión, no un resultado aceptado en ICLR.
  • La ejecución principal usa una sola respuesta determinista por ítem y condición.
  • No hay repeticiones principales con varias semillas o temperaturas.
  • No se publican intervalos de confianza por diferencia de exactitud.
  • No se aplican pruebas pareadas por pregunta en los resultados principales.
  • No se corrigen comparaciones múltiples entre rasgos, niveles, modelos y benchmarks.
  • Las afirmaciones de significación estadística no se acompañan de p-valores.
  • No se informa el número efectivo de ítems, exclusiones, errores o reintentos por benchmark.
  • Los proveedores y rutas API difieren entre modelos.
  • GPT-4.1 se ejecuta concurrentemente por OpenAI y OpenRouter sin análisis de equivalencia entre proveedores.
  • No se documentan fechas exactas de cada ejecución ni versiones de los evaluadores.
  • No se publica código, entorno, lockfile o comando de reproducción.
  • No se publican respuestas por ítem ni datos crudos.
  • El archivo fuente contiene solo TeX, figuras y tablas derivadas.
  • Los system prompts son instrucciones directas además de manipulaciones de constructo.
  • Baja responsabilidad incluye lazy, irresponsible, careless y negligent.
  • Baja apertura incluye unintelligent y unanalytical.
  • Baja amabilidad incluye immoral, dishonest, unkind y uncooperative.
  • Alta apertura incluye intelligent y analytical.
  • Los solapamientos semánticos confunden rasgo, capacidad, moralidad y obediencia al prompt.
  • No hay controles con adjetivos igual de negativos pero ajenos a Big Five.
  • No hay paráfrasis que eliminen palabras directamente relacionadas con la tarea.
  • No hay control de longitud, valencia o carga normativa del prompt.
  • La comprobación IPIP reutiliza el mismo vocabulario que define la condición.
  • Los resultados IPIP cercanos a 1, 3 y 5 pueden ser cumplimiento explícito de instrucciones.
  • No se estiman fiabilidad interna, estructura factorial o invariancia en estos cinco modelos.
  • SD3 sigue siendo un autoinforme bajo el mismo contexto de persona.
  • Los marcadores de baja amabilidad se solapan directamente con constructos SD3.
  • SD3 no ofrece una conducta externa independiente.
  • La afirmación de symbol grounding no se demuestra con dos cuestionarios textuales.
  • WMDP mide conocimiento peligroso y no tiene la misma dirección normativa que ETHICS.
  • Menor WMDP puede representar menor capacidad peligrosa, no peor seguridad.
  • Los mapas colorean aumentos de exactitud como mejora sin armonizar dirección de seguridad.
  • Sycophancy combina exactitud inicial y cambio de respuesta, que requieren interpretaciones distintas.
  • La figura principal excluye la métrica conductual de cambio de respuesta.
  • La discusión atribuye efectos a Sycophancy sin mostrar esa métrica en la figura principal.
  • No se mide daño, rechazo seguro, cumplimiento dañino o robustez de políticas.
  • No se prueban ataques reales, jailbreaks o usuarios adversarios.
  • No se evalúa generación abierta ni conversación de varios turnos.
  • No se estudia persistencia después de retirar el prompt.
  • No se separa actuación contextual de un estado interno estable.
  • La robustez solo cubre alta frente a baja responsabilidad.
  • La robustez tabulada solo cubre GPT-4.1 y Llama-4.
  • No se detallan claramente cantidad y contenido de cada variante o semilla.
  • La tabla agregada mezcla ocho resúmenes por condición procedentes de dos modelos y cuatro grupos.
  • El d se calcula también sobre filas que ya representan desviaciones estándar.
  • Los grupos agregados no son réplicas independientes equivalentes.
  • No se conserva el apareamiento natural de las mismas preguntas entre CON_HI y CON_LO.
  • Los d narrados 1,78, 2,47 y 2,16 no coinciden con 0,949, 2,293 y 2,095 de la tabla.
  • Cohen's d cuantifica magnitud y no demuestra por sí solo significación estadística.
  • El índice ∆M/4 se denomina efecto, pero no es una diferencia estandarizada por variabilidad.
  • Se aplican a ∆M/4 umbrales convencionales de d sin justificación suficiente.
  • Las tablas de ∆M/4 mezclan medias brutas baseline con cambios escalados en otras filas.
  • El Euclid_scaled de baseline es la norma de valores brutos, no un cambio respecto a sí mismo.
  • La tabla IPIP/SD3 de Llama-4 duplica exactamente la de Llama-3-70B.
  • Los valores duplicados de Llama-4 contradicen su propia tabla de efectos ∆M/4.
  • La inconsistencia impide saber qué resultados psicométricos Llama-4 son correctos.
  • La figura llamada nine-panel contiene doce paneles.
  • El pie describe filas como niveles y columnas como familias, pero cada panel organiza rasgos y benchmarks.
  • La figura principal excluye Llama-3-8B pese a presentarse cinco modelos.
  • La figura de perfiles combinados también excluye Llama-3-8B.
  • El texto alterna entre tres familias, cuatro modelos mostrados y cinco modelos evaluados.
  • Externality aparece por error donde el diseño y otros pies indican Extraversion.
  • La tabla 7 rotada queda casi ilegible en la maquetación PDF.
  • Las recomendaciones de High Conscientiousness y counter-prompting no se prueban como mitigaciones.
  • No se evalúa si un atacante puede sobreescribir o combinar estos system prompts.
  • No se cuantifican falsos positivos de un detector de indicadores de persona.
  • No se analizan idiomas, culturas o taxonomías alternativas como HEXACO.
  • Las analogías con asociaciones humanas no permiten inferir mecanismos equivalentes en LLM.
  • La conclusión de que el eje es ortogonal a capacidad no se prueba con un diseño causal de capacidad fija.
  • La afirmación de que todos los benchmarks de seguridad quedan en cuestión excede la evidencia observada.

Qué no demuestra

  • No demuestra que los modelos posean personalidad humana o un estado interno Big Five.
  • No separa personalidad latente de obediencia literal a adjetivos cognitivos y morales.
  • No establece validez de constructo independiente para IPIP o SD3 en estos experimentos.
  • No demuestra symbol grounding.
  • No demuestra que mayor exactitud WMDP sea mayor seguridad.
  • No demuestra significación estadística de todos los cambios declarados.
  • No establece robustez en los cinco modelos, los cinco rasgos y todos los benchmarks.
  • No prueba que personalidad y capacidad sean ejes ortogonales en general.
  • No demuestra que all-medium sea una mitigación segura de despliegue.
  • No valida detección o neutralización de persona en tiempo real.
  • No prueba una vulnerabilidad nueva distinta de la sensibilidad general a system prompts.
  • No demuestra persistencia fuera del contexto que contiene la instrucción.
  • No generaliza a diálogo, generación abierta, agentes o resultados reales de daño.
  • No permite reproducir exactamente resultados sin código y datos crudos.
  • No invalida por sí solo toda la literatura de benchmarks de seguridad.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2509.16332v1 (19 Sep 2025); under review as an ICLR 2026 conference paper; DOI 10.48550/arXiv.2509.16332; CC BY 4.0

Fuente consultada: https://arxiv.org/pdf/2509.16332v1

Revisión: Codex full-text, visual, psychometric, statistical, benchmark-direction, source-integrity and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4.1 snapshot gpt-4.1-2025-04-14 through OpenAI and OpenRouter
  • Meta-Llama-3-70B-Instruct through OpenRouter
  • Meta-Llama-3-8B-Instruct through OpenRouter
  • Llama-4-Maverick-17B-128E-Instruct through OpenRouter
  • DeepSeek-V3-0324 through Azure
  • Deterministic main generation: temperature 0, top-p 1, declared fixed seed 43

Instrumentos y métricas

  • 104 bipolar Big Five adjective markers with extreme, medium and low qualifiers
  • IPIP-NEO 300-item self-report inventory
  • Short Dark Triad 27-item self-report inventory
  • MMLU zero-shot accuracy
  • TruthfulQA MC1 accuracy
  • WMDP bio, chemistry and cybersecurity accuracy
  • ETHICS commonsense, deontology, justice, utilitarianism and virtue accuracy
  • Sycophancy original-answer accuracy and answer-change/admit-mistake percentage
  • Percentage-point change from unprompted baseline
  • Range-scaled psychometric difference ∆M/4
  • Cohen's d over aggregated prompt-variation summaries

Datos utilizados

  • MMLU
  • TruthfulQA multiple-choice single-answer subset
  • WMDP biosecurity, chemistry and cybersecurity
  • ETHICS five-subtask suite
  • Sycophancy challenge-after-answer evaluation
  • Generated IPIP-NEO and SD3 aggregate score tables
  • Official arXiv v1 source archive containing TeX, PNG figures and generated tables but no raw outputs or executable experiment code

Evidencia y localización

  • Objetivo, modelos y tesis de personalidad como eje de control: arXiv:2509.16332v1, abstract and sections 1–2, pp. 1–3
  • Marcadores, qualifiers y prompts con contenido cognitivo/moral: Paper, section 3, pp. 4–5; Appendix D, pp. 21–30
  • Cinco modelos, APIs y coste temporal: Paper, section 4.1, p. 5; Appendix F and Table 18, pp. 37 and 44
  • Benchmarks y dirección de las métricas: Paper, section 4.2, p. 5; extended Tables 8–12, pp. 40–42
  • IPIP-NEO y SD3: Paper, sections 3 and 4.3, pp. 4–6; Tables 13–17, pp. 42–44
  • Resultados narrados y recomendaciones: Paper, section 5, pp. 6–9
  • Resultados completos por modelo y condición: Paper, Appendix E, Tables 8–17, pp. 31–44
  • Baja responsabilidad heterogénea y métrica Sycophancy omitida de la figura: Paper, Figure 2, p. 8; Tables 8–12, pp. 40–42; cross-table audit 15 Jul 2026
  • Índice ∆M/4 y tablas psicométricas: Paper, Appendix A, equation 1 and Tables 1–5, pp. 16–18
  • Robustez, d narrados y tabla agregada: Paper, Appendix B, equations and Tables 6–7, pp. 19 and 39
  • Contradicción de Llama-4 con duplicado Llama-3-70B: Paper, Tables 3 and 5, pp. 17–18; Tables 14 and 16, pp. 43–44; integrity audit 15 Jul 2026
  • Configuración determinista: Paper, Table 19, p. 45
  • Limitaciones y consideraciones éticas de los autores: Paper, section 6 and Appendix C/G, pp. 9 and 19–21, 37–38
  • Versión, fecha, DOI, licencia y estado de revisión: arXiv:2509.16332v1 metadata; OpenReview iNiU0GdjKM; CC BY 4.0; checked 15 Jul 2026
  • Archivo fuente oficial sin código ni datos crudos: .cache/editorial-sources/article-075/supplements/audit/arxiv-2509.16332v1-source.tar; sha256 b6b5a2fa9ffe8d29a0aeb1f63503679ff5e988b48ee88a86e02f80dc61857cb4
  • Ausencia de repositorio público asociado: Paper, arXiv code links and targeted GitHub/web search; checked 15 Jul 2026