SAC: A Framework for Measuring and Inducing Personality Traits in LLMs with Dynamic Intensity Control

Inducción y control de rasgos2026scitepress.orgRevisión editorial aprobada

Autores: Adithya Chittem, Aishna Shrivastava, Sai Tarun Pendela, Jagat Sesh Challa, Dhruv Kumar

Palabras clave: Computation and Language, Artificial Intelligence, Human-Computer Interaction

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
9
Hallazgos
12
Limitaciones
11
Evidencias

Resumen editorial

Español

El artículo presenta PERS-16, una adaptación de 163 ítems IPIP a dieciséis etiquetas inspiradas en 16PF, y Specific Attribute Control (SAC), un esquema de prompting que fija intensidades de rasgo de 1 a 5 mediante definiciones, adjetivos y preguntas conductuales. Primero perfila GPT-4o, Claude 3.7 Sonnet, Gemini 2.5 Flash y un modelo denominado solo Mistral; después compara una inducción binaria P2 con SAC-neutral y SAC-induced. La aportación más clara es operacional: el protocolo SAC logra que las respuestas de cuestionario del rasgo objetivo se ordenen generalmente de intensidad 1 a 3 y a 5 en los cuatro modelos reportados. Esto demuestra seguimiento graduado de instrucciones en el instrumento, no una personalidad latente ni control continuo validado fuera del propio prompt.

PERS-16 muestra perfiles basales distintos y P2 resulta inestable: Claude presenta deltas negativos en 11 de 16 rasgos, Gemini en 10 y GPT-4o en 3, mientras Mistral produce sobre todo cambios positivos. En SAC-induced cada modelo responde 11.520 preguntas; los extremos 1 y 5 tienden a quedar, respectivamente, por debajo y por encima del baseline. Sin embargo, el nivel 3 no reproduce de forma consistente el estado neutral: en GPT-4o todos los deltas objetivo son negativos y en Claude casi todos lo son. Por eso las figuras apoyan ordenación ordinal de tres anclajes, pero no simetría, calibración métrica ni una intensidad dinámica que pueda elegirse con precisión en tiempo real.

El trabajo también compara SAC-neutral con 30 adultos y selecciona, para cada rasgo inducido, los dos mayores cambios absolutos en otros rasgos como co-movers. La comparación humana se limita a medias y dispersión descriptivas del estado neutral, sin contraste inferencial, datos individuales ni trayectorias inducidas humanas. Los co-movers son exploratorios y se eligen después de observar los resultados; además, el propio prompt enumera todos los niveles, afirma que cambiar el rasgo objetivo puede afectar a otros y pide valorar cada rasgo observado en relación con el objetivo. Así, la covariación puede explicarse por semántica y demanda de la instrucción y no prueba que el modelo haya internalizado una arquitectura psicológica humana.

La publicación abierta y el suplemento son valiosos, pero la auditoría del artefacto revela diferencias materiales con el artículo: scripts SAC usan temperatura 0,7 donde el texto declara 0; SAC-neutral modifica acumulativamente las preguntas dentro del bucle; el código añadido como Mistral para SAC-induced llama en realidad a Gemini 2.5 Flash Preview mediante OpenRouter; no se fija la versión o tamaño de Mistral; y faltan datos humanos, licencia y entorno de dependencias reproducible. En consecuencia, SAC es una prueba prometedora de control de respuestas de autoinforme por prompting explícito, pero la reproducibilidad del resultado atribuido a Mistral y las afirmaciones de alineación humana, estructura latente y control fino quedan sin establecer.

English

The paper introduces PERS-16, an adaptation of 163 IPIP items to sixteen 16PF-inspired labels, and Specific Attribute Control (SAC), a prompting scheme that anchors trait intensity from 1 to 5 with definitions, adjectives, and behavioral questions. It first profiles GPT-4o, Claude 3.7 Sonnet, Gemini 2.5 Flash, and a model identified only as Mistral, then compares binary P2 induction with SAC-neutral and SAC-induced. Its clearest contribution is operational: under SAC, target-trait questionnaire responses are generally ordered from intensity 1 through 3 to 5 across the four reported models. This is evidence of graded instruction following within the instrument, not evidence of a latent personality or validated continuous control outside the prompt.

PERS-16 yields different baseline profiles and P2 is inconsistent: Claude has negative deltas for 11 of 16 traits, Gemini for 10, GPT-4o for 3, while Mistral is mostly positive. SAC-induced asks 11,520 questions per model, and levels 1 and 5 tend to fall below and above baseline respectively. Yet level 3 does not consistently recover the neutral state: all target deltas are negative for GPT-4o and nearly all are negative for Claude. The figures therefore support ordinal steering at three tested anchors, but not metric calibration, symmetry, or real-time dynamic intensity control.

SAC-neutral is descriptively compared with 30 adults, and the two largest absolute non-target shifts are selected as co-movers for each induced trait. The human comparison contains only neutral means and dispersion, without inferential tests, individual data, or human induction trajectories. Co-movers are post hoc and the prompt itself supplies every intensity anchor, says that changing one trait may affect other traits, and asks the model to assess an observed trait relative to the target. Their covariance can therefore arise from prompt semantics and demand characteristics rather than an internalized human psychological structure.

Open publication and supplementary material are strengths, but artifact auditing found material paper-code discrepancies: SAC scripts use temperature 0.7 where the paper reports 0; SAC-neutral mutates questions cumulatively inside its factor loop; the later Mistral SAC-induced script actually calls Gemini 2.5 Flash Preview through OpenRouter; the Mistral version and size are unspecified; and human data, a license, and a reproducible dependency environment are absent. SAC is consequently a promising test of explicit prompt control over self-report answers, while the Mistral attribution and claims of human alignment, latent structure, and fine-grained calibrated control remain unverified.

Pregunta de investigación

¿Puede una evaluación inspirada en 16PF medir perfiles de respuesta de LLM y puede un prompt con anclajes semánticos modular gradualmente un rasgo objetivo, superando la inducción binaria P2 y produciendo covariaciones interpretables con otros rasgos?

Método

El estudio construye PERS-16 con 163 enunciados IPIP puntuados de 1 a 5 y perfila cuatro modelos en modo stateless. Luego induce por separado cada uno de los 16 rasgos mediante P2 y vuelve a administrar los 163 ítems. SAC-neutral combina 16 rasgos observados, cinco factores de intensidad y dos preguntas para obtener 160 respuestas por modelo; SAC-induced cruza 16 rasgos objetivo, intensidades 1, 3 y 5, cinco factores, tres acciones conductuales y 16 rasgos observados, totalizando 11.520 respuestas por modelo. Se calculan medias, dispersión, distancias euclídeas y deltas frente al baseline. Treinta adultos completan SAC-neutral como referencia descriptiva. Para explorar covariación, se eligen post hoc los dos rasgos no objetivo con mayor delta absoluto. La revisión contrastó el PDF de actas y arXiv completos, figuras y tablas, el depósito Zenodo y el repositorio de código actual.

Muestra: PERS-16 usa 163 ítems para cada modelo. P2 genera 16 × 163 = 2.608 respuestas por modelo. SAC-neutral administra 16 rasgos × 5 factores × 2 preguntas = 160 respuestas por modelo. SAC-induced administra 16 rasgos objetivo × 3 intensidades × 5 factores × 3 prompts conductuales × 16 rasgos observados = 11.520 respuestas por modelo. La referencia humana incluye 30 adultos, 14 hombres y 16 mujeres, todos mayores de 18 años y cursando o con un grado universitario, que responden las mismas 160 preguntas SAC-neutral; no se publican sus respuestas individuales.

Hallazgos

  • En PERS-16, GPT-4o y Gemini son los perfiles más próximos por distancia euclídea (1,50); Claude y Mistral son los más distantes (3,94). Son distancias descriptivas de respuestas a ítems, no medidas de semejanza psicológica global.
  • La dispersión de PERS-16 varía sustancialmente por rasgo y modelo; denominar la desviación estándar proxy de consistencia interna no es psicométricamente correcto, porque dispersión entre ítems y fiabilidad de una escala son conceptos distintos.
  • P2 no induce uniformemente el extremo alto: Claude arroja 11 deltas negativos de 16, Gemini 10 y GPT-4o 3; Mistral es mayoritariamente positivo. Las tablas tituladas para tres LLM contienen cuatro modelos.
  • SAC produce una relación ordinal clara: para la mayoría de rasgos, la puntuación objetivo aumenta al pasar de los anclajes 1 a 3 y a 5 en los cuatro modelos reportados.
  • El nivel 3 no es un cero calibrado respecto del baseline: GPT-4o presenta los 16 deltas objetivo negativos y Claude casi todos negativos; Gemini es mixto. La expresión del artículo «alrededor de cero» oculta desplazamientos sistemáticos visibles en la figura y los datos.
  • Los extremos 1 y 5 separan con mayor claridad las respuestas que P2, lo que respalda SAC como ingeniería de prompt para controlar cómo el modelo contesta el mismo cuestionario.
  • La comparación con 30 humanos sitúa varias medias neutrales cerca del centro de la escala, pero no ofrece pruebas estadísticas, equivalencia de medición ni una muestra normativa que permita concluir alineación humana.
  • Los co-movers se definen como los dos mayores cambios absolutos observados; esta regla garantiza seleccionar alguna covariación incluso bajo ruido y la Tabla 6 solo interpreta 13 de los 16 objetivos, omitiendo Sensitivity, Imagination y Orderliness.
  • La auditoría del suplemento impide verificar el resultado SAC-induced de Mistral: el script etiquetado como Mistral llama al modelo google/gemini-2.5-flash-preview, mientras otros scripts usan un nombre Ollama genérico «mistral» sin versión o tamaño.

Limitaciones

  • Todos los resultados principales proceden de autoinforme forzado de opción múltiple. No se valida que las puntuaciones predigan conducta en conversación abierta, tareas, decisiones, seguridad o interacción longitudinal.
  • El prompt SAC revela explícitamente el rasgo objetivo, su nivel deseado y los adjetivos de los cinco niveles, y ordena responder de acuerdo con ellos. El efecto puede ser simple obediencia semántica y no modificación de un estado interno.
  • El prompt indica además que cambiar el objetivo puede afectar a otros rasgos y pide evaluar el rasgo observado en relación con aquel; esto introduce demanda directa en el análisis de co-movimiento.
  • Solo se prueban tres niveles de inducción, 1, 3 y 5. No se evalúan los niveles 2 y 4 ni suficientes puntos para justificar continuidad, linealidad o control fino en toda la escala 1–5.
  • Los co-movers se seleccionan post hoc por magnitud absoluta, sin hipótesis previa de covarianza, modelo nulo, significación, intervalos de confianza, corrección por comparaciones, replicación ni validación cruzada.
  • La referencia humana es pequeña, educada y demográficamente limitada; faltan reclutamiento detallado, ética/consentimiento, respuestas individuales, fiabilidad, incertidumbre y contraste inferencial modelo-humano.
  • La desviación estándar de ítems no estima consistencia interna. No se aportan alfa u omega, análisis factorial, invariancia, validez convergente/discriminante ni calibración psicométrica de PERS-16 o SAC.
  • El texto alterna de forma inconsistente entre tres y cuatro LLM, entre dos y tres preguntas en SAC-neutral y omite tres rasgos de la tabla interpretativa de co-movers.
  • El artículo declara temperatura 0, top-p 0,95 y máxima reproducibilidad, pero scripts SAC usan temperatura 0,7 y configuraciones distintas entre proveedores; tampoco se fijan snapshots de las APIs propietarias.
  • En varios scripts SAC-neutral, las dos preguntas se modifican acumulativamente dentro del bucle de cinco factores, de modo que ejecuciones posteriores pueden contener prefijos concatenados y no representar el procedimiento descrito.
  • El depósito Zenodo y el repositorio no contienen datos humanos crudos, una licencia, un manifiesto o lockfile de dependencias ni una canalización única que regenere figuras y tablas; el ZIP de Zenodo tampoco corresponde limpiamente a su commit Git embebido.
  • «Dinámico» significa aquí elegir de antemano un anclaje textual. El control adaptativo en tiempo real, multi-rasgo y dependiente del contexto se reserva expresamente para trabajo futuro.

Qué no demuestra

  • No demuestra que un LLM posea los dieciséis rasgos como estados internos, estables o equivalentes a personalidad humana.
  • No demuestra que SAC controle una variable psicológica continua: solo prueba tres condiciones discretas de prompt y respuestas al propio instrumento.
  • No demuestra simetría ni calibración de la intensidad 3 respecto del baseline neutral.
  • No demuestra que los co-movers reflejen una arquitectura latente internalizada o las correlaciones 16PF humanas, porque no existe comparación humana equivalente ni control de demanda semántica.
  • No demuestra validez o fiabilidad psicométrica de PERS-16; medias y desviaciones estándar no sustituyen esos análisis.
  • No permite reproducir ni atribuir con seguridad los resultados SAC-induced presentados como Mistral.
  • No establece generalización a otros modelos, idiomas, instrumentos, conversaciones prolongadas, usuarios o dominios de despliegue.
  • No evalúa consecuencias de seguridad, persuasión, sesgo, bienestar, dependencia, engaño o efectos sobre el rendimiento de tareas al inducir rasgos.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2506.20993v2 (12 Jan 2026); ICAART 2026 proceedings, DOI 10.5220/0014415000004052, also reviewed; Zenodo 10.5281/zenodo.15487993 and GitHub commit 15fb883951562df25889f78de06717f8f1ea0e58 audited

Fuente consultada: https://arxiv.org/pdf/2506.20993

Revisión: Codex editorial review and methods/code audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o
  • Claude 3.7 Sonnet
  • Gemini 2.5 Flash
  • Mistral (versión y tamaño no especificados)

Instrumentos y métricas

  • PERS-16 (163 IPIP-derived items across 16 traits)
  • 16PF-inspired trait taxonomy
  • Machine Personality Inventory / P2 prompting adaptation
  • Specific Attribute Control (SAC-neutral and SAC-induced)
  • Euclidean distance between 16-trait profiles
  • Trait deltas relative to neutral baseline
  • Post-hoc top-two absolute co-mover selection

Datos utilizados

  • PERS-16 item set
  • SAC adjective and behavioral-anchor dataset
  • SAC-neutral model responses
  • SAC-induced model responses
  • Human SAC-neutral baseline (aggregate results only)

Evidencia y localización

  • Publicación definitiva, DOI, autoría y paginación: SCITEPRESS ICAART 2026 paper 144150, DOI 10.5220/0014415000004052, pp. 3267–3278
  • Construcción, puntuación y configuración declarada de PERS-16: Paper, pp. 3268–3269, section 3.1, Equation 1 and Figure 1
  • Perfiles neutrales, dispersión y distancias entre modelos: Paper, pp. 3269–3270, Tables 1–2, sections 3.2–3.3
  • Diseño P2, 2.608 respuestas y deltas por modelo: Paper, pp. 3270–3272, section 4, Tables 3–4 and Equation 3
  • Diseño SAC-neutral, tamaño y referencia de 30 participantes: Paper, pp. 3272–3273, section 5.1 and Table 5
  • Diseño SAC-induced y total de 11.520 preguntas por modelo: Paper, pp. 3273–3274, section 5.2, Figure 4 and Equation 4
  • Trayectorias de intensidades 1, 3 y 5 y falta de alineación exacta del nivel 3: Paper, pp. 3274–3275, Figure 5 and accompanying discussion; supplementary SAC delta CSVs
  • Selección e interpretación post hoc de co-movers: Paper, pp. 3274–3277, Figures 6–7 and Table 6
  • Limitaciones declaradas, discusión y carácter futuro del control en tiempo real: Paper, pp. 3275 and 3277–3278, sections 6–8
  • Disponibilidad y contenido del suplemento: Zenodo record 15487993, DOI 10.5281/zenodo.15487993, archive SHA-256 8bb7e9ff287f073c9323a5def1dcf3a85fbf7c1884d735c3f66ba458c4c9de8
  • Diferencias entre método publicado y código, incluida la ruta atribuida a Mistral: GitHub repository aishna0310/SAC at commit 15fb883951562df25889f78de06717f8f1ea0e58; MPI/models/*/personality_prompting/sac.py and SAC-neutral scripts