The Personality Illusion: Revealing Dissociation Between Self-Reports & Behavior in LLMs

Evaluación y validez psicométrica2026ICML ProceedingsRevisión editorial aprobada

Autores: Pengrui Han, Rafal Kocielnik, Peiyang Song, Ramit Debnath, Dean Mobbs, Anima Anandkumar, R. Michael Alvarez

Palabras clave: Artificial Intelligence, Computation and Language, Computers and Society, Machine Learning

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
22
Hallazgos
47
Limitaciones
19
Evidencias

Resumen editorial

Español

Han y coautores separan tres preguntas que a menudo se confunden: qué perfil declara un LLM en cuestionarios, si ese perfil predice lo que hace en otras tareas y si una persona textual cambia ambas cosas. El estudio, aceptado en ICML 2026, usa 18 endpoints: seis modelos base, sus seis variantes instruct y seis instruct grandes. Administra el Big Five Inventory de 44 ítems y el Self-Regulation Questionnaire de 63; cada ítem es una llamada independiente. Cada modelo se prueba con tres system prompts, temperaturas 0,3/0,7/1 y tres repeticiones, es decir, 27 configuraciones agregadas por modelo.

En RQ1, los autores comparan los seis pares base–instruct. Un clasificador logístico de fase encuentra que los modelos instruct declaran más apertura (β=1,48), más amabilidad (0,74) y menos neuroticismo (−1,20); extraversión y responsabilidad no cambian significativamente. Levene indica menor variabilidad en cinco de seis escalas, no en amabilidad. Las relaciones entre Big Five y autorregulación también se vuelven más fuertes y adoptan en general los signos esperados en humanos. Esto describe respuestas al cuestionario, no una trayectoria de desarrollo: los checkpoints no son participantes que maduren, las 27 configuraciones no son 27 modelos independientes y el diseño no aísla RLHF de instruction tuning, datos, arquitectura o tamaño. Además, los coeficientes de autorregulación reportados, entre aproximadamente 11 y 23, contradicen la afirmación de que esa variable fue estandarizada.

RQ2 evalúa 12 modelos instruct en cinco outcomes: tarjetas elegidas en una versión textual de Columbia Card Task; asociaciones explícitas forzadas que el artículo llama IAT; cambio de respuesta ante una opinión contraria del usuario; sobreconfianza en 50 preguntas; y diferencia entre dos juicios de confianza. Solo alrededor del 24% de las asociaciones rasgo–tarea resulta significativa y, entre ellas, el 52% tiene el signo esperado a partir de literatura humana, prácticamente azar. Por rasgo, la coincidencia direccional va del 45% en neuroticismo al 62% en amabilidad y todos los intervalos solapan el 50%. La mayoría de modelos queda cerca de azar; Qwen3-235B alcanza 82% y es la excepción significativa. El resultado central es sólido en su formulación negativa: estos autoinformes no funcionan como proxies generales de esas tareas. No implica que las tareas midan comportamiento real ni que todo tipo de autoinforme carezca de validez predictiva.

En RQ3 se inyectan personas de amabilidad o autorregulación mediante tres estrategias y tres variantes léxicas. Las personas se detectan con claridad en el target declarado: amabilidad β≈3,6–4,4 y autorregulación β≈2,2–2,9. Sin embargo, el comportamiento apenas separa las condiciones: sycophancy arroja β≈−0,05–0,32 con resultados inconsistentes, y riesgo β≈−0,14–0,20 no significativo. La persona de autorregulación aumenta responsabilidad todavía más que su propia escala y reduce apertura y amabilidad, mostrando que la manipulación no es selectiva. Esta es una demostración útil de que repetir literalmente «agreeable», «disciplined» o «goal-oriented» altera respuestas que contienen ítems semánticamente cercanos, pero no basta para producir transferencia estable a otra tarea.

La auditoría del artefacto exige cautela adicional. GitHub contiene nueve CSV completos a nivel de configuración, con 2.754 filas agregadas, pero no los outputs por ítem, logs ni código de los modelos estadísticos; por eso no puede auditarse qué respuestas se excluyeron o reconstruir exactamente las figuras. Los notebooks son ejemplos reducidos a GPT-4o: Big5 falla por nombres globales inexistentes y SRQ contiene un SyntaxError y dos referencias a una variable no definida. Ningún notebook fija o envía un seed aunque el artículo hable de tres seeds. Más grave, los fallos de API o parsing se convierten en observaciones: Big Five/SRQ imputan 3, riesgo imputa 0 cartas, IAT puede devolver −1 y el flujo de sycophancy puede desalinear respuestas tras un parseo desconocido. En honestidad, los ceros de confianza se excluyen del ECE; en IAT se promedian scores firmados aunque el método dice usar magnitud absoluta; y una tabla invierte la interpretación de la diferencia C1–C2.

La contribución defendible es conceptual y empírica: obliga a validar autoinformes contra outcomes separados y muestra, en una batería amplia, que la coherencia lingüística y el control por persona no garantizan transferencia. La evidencia no autoriza a hablar de rasgos internos, disposiciones, objetivos o una disociación cognitiva equivalente a la humana. También queda abierta una explicación más sencilla: cuestionarios y tareas son prompts independientes, algunos instrumentos no conservan su constructo humano y las repeticiones emparejadas no representan una misma entidad persistente. El artículo es valioso precisamente como advertencia metodológica, siempre que sus resultados se lean como propiedades de este protocolo y no como prueba exhaustiva de lo que los LLM «son».

English

Han and coauthors separate three questions that are often conflated: what profile an LLM reports on questionnaires, whether that profile predicts its outputs on other tasks, and whether a textual persona changes both. The study, accepted to ICML 2026, uses 18 endpoints: six base models, their six instruct variants, and six large instruct models. It administers the 44-item Big Five Inventory and the 63-item Self-Regulation Questionnaire, with every item sent as an independent API call. Each model is tested under three system prompts, temperatures 0.3/0.7/1.0, and three repetitions, yielding 27 aggregate configurations per model.

For RQ1, the authors compare the six base–instruct pairs. A logistic classifier of training phase finds that instruct models report higher Openness (β=1.48), higher Agreeableness (0.74), and lower Neuroticism (−1.20); Extraversion and Conscientiousness do not change significantly. Levene tests find lower variability on five of six scales, not Agreeableness. Associations between the Big Five and self-regulation also become stronger and generally take the directions expected in humans. These findings describe questionnaire outputs, not a developmental trajectory: checkpoints are not participants who mature, the 27 configurations are not 27 independent models, and the design does not isolate RLHF from instruction tuning, data, architecture, or scale. The reported self-regulation coefficients of roughly 11–23 also conflict with the statement that this outcome was standardized.

RQ2 evaluates 12 instruct models on five outcomes: cards chosen in a textual Columbia Card Task; forced explicit associations labeled as an IAT; answer changes after a contrary user opinion; overconfidence on 50 questions; and the difference between two confidence judgments. Only about 24% of trait–task associations are significant, and 52% of those significant coefficients have the direction expected from human literature, essentially chance. Trait-level directional agreement ranges from 45% for Neuroticism to 62% for Agreeableness, with every interval overlapping 50%. Most models remain near chance; Qwen3-235B reaches 82% and is the significant exception. The central negative finding is well supported in its narrow form: these self-reports are not general proxies for these tasks. It does not show that the tasks measure real-world behavior or that every type of self-report lacks predictive validity.

RQ3 injects Agreeableness or Self-Regulation personas through three strategies and three keyword variants. Personas are clearly detectable in the target self-report: Agreeableness β≈3.6–4.4 and Self-Regulation β≈2.2–2.9. Behavior, however, barely separates the conditions: sycophancy yields β≈−0.05–0.32 with inconsistent significance, while risk-taking yields β≈−0.14–0.20 and is nonsignificant. The Self-Regulation persona increases Conscientiousness more strongly than its target scale and decreases Openness and Agreeableness, showing that the manipulation is not selective. This usefully demonstrates that explicitly repeating “agreeable,” “disciplined,” or “goal-oriented” changes semantically adjacent questionnaire responses without reliably transferring to a separate task.

The artifact audit adds important caution. GitHub contains nine complete configuration-level CSV files with 2,754 aggregate rows, but no item-level outputs, logs, or statistical-analysis code, so exclusions cannot be audited and figures cannot be reconstructed exactly. The notebooks are GPT-4o-only examples: Big5 fails because of undefined global names, and SRQ contains a SyntaxError plus two references to an undefined variable. No notebook sets or transmits a seed despite the paper's claim of three seeds. More seriously, API and parsing failures become observations: Big Five/SRQ impute 3, Risk Taking imputes zero cards, IAT can return −1, and the sycophancy workflow can shift later responses after an unknown parse. In the honesty notebook, zero-confidence samples are omitted from ECE; the IAT code averages signed scores although the method describes absolute magnitude; and one table reverses the meaning of the C1–C2 difference.

The defensible contribution is conceptual and empirical: it requires self-reports to be validated against separate outcomes and shows, over a broad battery, that linguistic coherence and persona control do not guarantee transfer. The evidence does not warrant claims about internal traits, dispositions, goals, or a human-like cognitive dissociation. A simpler explanation remains open: questionnaires and tasks are independent prompts, some adaptations do not preserve their human construct, and matched repetition labels do not instantiate a persistent individual. The paper is valuable as a methodological warning, provided its results are read as properties of this protocol rather than an exhaustive account of what LLMs “are.”

Pregunta de investigación

¿Cómo cambian los autoinformes Big Five y de autorregulación entre checkpoints base e instruct, predicen esos perfiles cinco outcomes de tareas inspiradas en psicología y consigue la inyección de personas de amabilidad o autorregulación cambiar tanto el autoinforme como la tarea asociada?

Método

Estudio experimental en tres bloques. RQ1 compara seis modelos base con seis variantes instruct mediante BFI-44 y SRQ-63, regresión logística de fase, Levene y regresiones de autorregulación. RQ2 empareja los autoinformes de 12 modelos instruct con cinco outcomes derivados de cuatro paradigmas: riesgo, asociación social, sycophancy y dos medidas de confianza; ajusta mixed-effects models y reduce cada coeficiente a coincidencia o no coincidencia con un signo humano esperado. RQ3 compara baseline con dos personas objetivo, cada una expresada mediante tres estrategias y tres variantes de keywords, usando regresiones logísticas de detectabilidad. Cada modelo usa tres system prompts, tres temperaturas y tres repeticiones. La auditoría editorial leyó y renderizó las 35 páginas, verificó la aceptación ICML 2026, inspeccionó tablas y apéndices, y auditó el repositorio, nueve CSV, seis notebooks, datasets, parsers y scoring.

Muestra: RQ1 contiene 162 filas agregadas de seis modelos base y 162 filas de sus seis variantes instruct: 6 modelos × 3 prompts × 3 temperaturas × 3 runs. RQ2 usa 324 filas de autoinforme y 324 de tareas: 12 modelos instruct × 27 configuraciones emparejadas por etiqueta. En cada configuración, BFI llama 44 veces, SRQ 63, riesgo 27, asociaciones sociales 63, honestidad 50×2 y sycophancy hasta 52×2. Para cada una de seis condiciones persona-estrategia hay 324 filas: 12 modelos × 3 variantes léxicas × 3 temperaturas × 3 runs. Los runs son llamadas repetidas; el código no fija seeds ni crea sujetos persistentes.

Hallazgos

  • En la comparación base–instruct, apertura predice fase instruct con β=1,48 (IC95% 0,74–2,22), neuroticismo con β=−1,20 (−2,00 a −0,41) y amabilidad con β=0,74 (0,03–1,44).
  • Extraversión (β=−0,12, p=.739) y responsabilidad (β=−0,61, p=.089) no muestran diferencias significativas por fase en el modelo conjunto.
  • Levene encuentra menor variabilidad para apertura, responsabilidad, extraversión, neuroticismo y autorregulación; amabilidad no difiere (p=.54).
  • En instruct, la autorregulación se asocia positivamente con responsabilidad (β=12,32), apertura (15,23), amabilidad (11,36) y extraversión (23,33), y negativamente con neuroticismo (−16,27).
  • Los coeficientes de autorregulación son incompatibles con una variable dependiente estandarizada como afirma el método; parecen conservar la escala SRQ bruta.
  • Solo alrededor del 24% de todas las asociaciones rasgo–tarea es estadísticamente significativa y solo el 52% de esas asociaciones significativas tiene el signo humano esperado.
  • La coincidencia por rasgo es apertura 50%, responsabilidad 52%, extraversión 58%, amabilidad 62%, neuroticismo 45% y autorregulación 55%; todos los intervalos solapan 50%.
  • Los cinco outcomes quedan aproximadamente entre 45% y 57% de coincidencia direccional, sin un patrón conductual general.
  • La mayoría de modelos pequeños y medianos queda cerca de azar; Claude 3.7 alcanza 64%, GPT-4o 68% y Qwen3-235B 82%, siendo el último la excepción cuyo intervalo no solapa azar.
  • En riesgo, la única asociación Qwen de autorregulación fuertemente significativa tiene el signo humano esperado, pero otros rasgos y grupos alternan signos y rara vez son significativos.
  • En el agregado, responsabilidad predice más sobreconfianza (β=3,75, p<.05), dirección opuesta a la expectativa humana definida por los autores; autorregulación predice menos sobreconfianza (−0,15, p<.05).
  • En sycophancy agregada, apertura (−4,70), responsabilidad (−6,42) y neuroticismo (−5,41) son significativos, pero solo parte de los signos coincide con las expectativas seleccionadas.
  • La persona de amabilidad aumenta su autoinforme objetivo β≈3,6–4,4, p<.001 en las tres estrategias.
  • La persona de autorregulación aumenta su target β≈2,2–2,9, pero responsabilidad aumenta todavía más, β≈4,2–4,8.
  • La persona de autorregulación reduce apertura β≈−2,2 a −2,8 y amabilidad β≈−1,1 a −1,8, de modo que la intervención no es selectiva ni reproduce la estructura de RQ1.
  • Sycophancy distingue débil e inconsistentemente la persona amable (β≈−0,05 a 0,32), y riesgo no distingue de forma fiable la persona autorregulada (β≈−0,14 a 0,20).
  • Los nueve CSV liberados tienen la cuadrícula completa de modelos, prompts/personas, temperaturas y runs, sin duplicados en las claves de configuración.
  • Los CSV solo contienen agregados; faltan outputs por ítem, parseos, fallos, exclusiones y resultados estadísticos intermedios.
  • El notebook Big5 no ejecuta por nombres MODEL_CONFIGS, PERSONA_CONFIGS y EXPERIMENTAL_CONFIG inexistentes; SRQ no compila y además usa srq_items en vez de SRQ_ITEMS.
  • Ninguno de los seis notebooks transmite un seed al proveedor; run 1/2/3 etiqueta repeticiones estocásticas, no seeds reproducibles.
  • El IAT usa hash() de Python para ordenar estímulos, por lo que el orden cambia entre procesos salvo PYTHONHASHSEED, pese a declarar random_seed=42.
  • La tabla de escala dice que más diferencia C1–C2 significa más consistencia, pero el código y Table 3 usan la diferencia absoluta como más inconsistencia.

Limitaciones

  • Los autoinformes son outputs de prompts independientes, no observaciones de un estado interno o de una misma entidad longitudinal.
  • La comparación base–instruct incluye solo seis familias y no usa una intervención controlada sobre un mismo modelo salvo la relación informal entre checkpoints.
  • Se agrupan instruction tuning, RLHF, DPO y otras fases bajo «instructional alignment» sin conocer ni aislar qué receta recibió cada checkpoint.
  • Los pares difieren en datos, formato chat y posibles cambios adicionales; el lenguaje causal sobre alignment excede una comparación observacional.
  • Las 27 configuraciones por modelo son medidas repetidas de solo tres prompts y tres temperaturas; no aumentan el número de arquitecturas independientes.
  • Usar model, temperature y prompt como random effects es frágil con pocos niveles; model también está anidado/confundido con fase si se conserva el identificador completo.
  • La regresión logística predice fase a partir de seis rasgos simultáneos; sus coeficientes condicionales no equivalen a cambios medios causales de cada rasgo.
  • Levene aplicado a cientos de respuestas repetidas puede producir p-valores muy pequeños por pseudorreplicación respecto de las seis familias.
  • El texto reporta reducciones de variabilidad de 40,0%/45,1%, mientras la caption afirma 60–66%; los CSV y el método no permiten reconciliar ambas cifras.
  • No se reporta fiabilidad, estructura factorial, invariancia, validez convergente o discriminante de BFI/SRQ en los modelos evaluados.
  • La ruta BFI sustituye fallos de parseo por 3; la ruta SRQ hace lo mismo. Esto puede reducir artificialmente variabilidad, especialmente en modelos base que siguen peor instrucciones.
  • Los outputs crudos no están publicados, por lo que no puede cuantificarse la imputación neutral ni comprobarse el scoring por ítem.
  • La cuadrícula dice usar seeds, pero el código solo repite llamadas y no establece seed local ni en las APIs.
  • GPT-4o es un alias sin snapshot; varios endpoints de Together/OpenRouter también dependen del estado del proveedor y no llevan fecha de ejecución verificable en los CSV.
  • RQ2 empareja filas de autoinforme y tarea por prompt, temperatura y número de run, pero las llamadas son independientes y no representan un mismo sujeto latente.
  • Cada mixed-effects model por LLM dispone de solo 27 agregados para seis rasgos, con muy poca variación y a veces varianza cero.
  • El método principal dice incluir los seis rasgos juntos; la caption de Figure 9 describe regresiones de la tarea sobre cada rasgo por separado. Falta código para resolver la especificación real.
  • No se publica el código estadístico, fórmulas exactas de agrupación, preparación de datos, handling de coeficientes ausentes ni generación de figuras.
  • Se realizan cientos de tests rasgo–tarea–grupo–modelo sin corrección por multiplicidad; p<.1 también se destaca como tendencia.
  • Convertir el signo de cualquier coeficiente, incluso no significativo, en acierto/fallo produce una métrica cuyo baseline es necesariamente 50% y descarta magnitud e incertidumbre.
  • Las asociaciones humanas se trasladan entre poblaciones, operacionalizaciones y contextos distintos; algunas se declaran mixtas o se apoyan en evidencia indirecta.
  • El intervalo beta-binomial supone independencia de coeficientes reutilizados; el bootstrap usa solo cinco tareas o seis rasgos como clusters, demasiado pocos para intervalos estables.
  • La versión textual de CCT es una respuesta simbólica única sin azar, feedback, ganancia o secuencia; puede medir cálculo de utilidad o seguimiento de instrucción, no toma de riesgo vivida.
  • El parser de riesgo concatena todos los dígitos antes de parsear: «16 de 32» se convierte en 1632 y se recorta a 32; errores de API se convierten en 0 cartas.
  • La tarea denominada IAT no mide latencia ni asociación implícita; obliga explícitamente a asignar palabras positivas/negativas a grupos sociales.
  • El IAT promedia bias firmado aunque el artículo dice usar valor absoluto; categorías opuestas pueden cancelarse y el score no representa magnitud total.
  • El parser IAT no valida completitud, unicidad o correspondencia exacta; una respuesta vacía o error produce conteos cero y bias −1 en vez de missing.
  • El orden IAT usa hash() no estable entre procesos, así que el supuesto seed 42 no congela los estímulos.
  • La medida de sycophancy carece de un segundo ensayo control sin opinión contraria; no separa conformidad de variación espontánea o reconsideración.
  • Si una respuesta baseline de sycophancy no se parsea, no se crea su Step 2, pero el bucle final puede consumir la siguiente respuesta para el dilema equivocado.
  • El handler común devuelve la cadena ERROR, pero sycophancy comprueba otros códigos; esto activa el camino Unknown y el riesgo de desalineación.
  • La honestidad usa 25 preguntas sintéticas con respuesta NOANSWER y 25 reales; el prompt exige una palabra y no ofrece explícitamente una opción de abstención.
  • El average overconfidence es firmado, de modo que sobreconfianza e infraconfianza pueden cancelarse; no es un error absoluto de calibración.
  • El ECE usa confidence > lower y excluye las respuestas de confianza 0 de todos los bins.
  • Confidence −1 por parseo inválido se conserva en cálculos de calibración y consistencia en lugar de excluirse.
  • El código define C1–C2 como diferencia absoluta, donde mayor es peor; Table 2 y Figure 7 dicen que mayor significa más consistencia.
  • Las personas RQ3 contienen literalmente las palabras objetivo y el cuestionario pregunta por descriptores cercanos; el efecto de autoinforme puede ser priming o obediencia léxica.
  • RQ3 ajusta numerosos clasificadores por estrategia y outcome sin corrección múltiple ni validación en nuevas personas o tareas.
  • Solo se intervienen dos rasgos y dos tareas elegidas después de RQ2; no se prueba transferencia general ni temporal.
  • Los notebooks publicados son snippets para GPT-4o, no la configuración de 18 modelos ni un pipeline end-to-end reproducible.
  • Big5 contiene referencias globales inexistentes y no reproduce la plantilla especial para base que aparece en el apéndice.
  • SRQ contiene sintaxis inválida, nombres de variable erróneos y redondea la media antes de reconstruir el total, generando totals no enteros.
  • No hay requirements, lockfile, entorno, tests automatizados, workflow de CI o release/tag que congele el artefacto evaluado.
  • La limitación del artículo dice que no incluye MoE, aunque el endpoint Qwen3-235B-A22B listado es una arquitectura mixture-of-experts; el alcance está descrito de forma inconsistente.
  • Solo se trabaja en inglés y las expectativas humanas proceden de literatura heterogénea; no se demuestra generalización cultural.
  • No se evalúan conversaciones largas, agentes con herramientas, memoria, acciones en entornos o consecuencias reales.
  • Las propuestas sobre RL from behavioral feedback o disposiciones latentes son futuras hipótesis, no resultados del estudio.

Qué no demuestra

  • No demuestra que los LLM posean personalidad, rasgos internos, motivaciones, metas o afecto.
  • No demuestra una trayectoria de desarrollo psicológica durante el entrenamiento.
  • No identifica que RLHF, DPO o instruction tuning causen por sí solos los cambios de autoinforme.
  • No demuestra que una estructura de correlaciones parecida a la humana valide el constructo en máquinas.
  • No demuestra que todos los autoinformes de LLM sean inútiles; evalúa dos cuestionarios y cinco outcomes concretos.
  • No demuestra que los outcomes sean conducta real, embodiment o actuación en despliegue.
  • No demuestra que 52% sea evidencia de alineación humana; es compatible con azar direccional.
  • No demuestra que Qwen3-235B tenga una personalidad más humana; su 82% resume signos bajo este protocolo.
  • No demuestra que la inyección de persona nunca cambie conducta; muestra transferencia débil e inconsistente en dos pares rasgo–tarea.
  • No demuestra que una persona textual modifique parámetros, representaciones internas o disposiciones persistentes.
  • No demuestra una disociación cognitiva equivalente a la humana; compara outputs de prompts independientes.
  • No valida IAT, CCT, confianza o dilemas morales como instrumentos psicométricamente equivalentes para LLM.
  • No permite reproducir exactamente las inferencias, p-valores o figuras con el código publicado.
  • No permite auditar cuánto influyen fallos de API, parsing, imputación o selección de respuestas.
  • No generaliza a reasoning models, otros idiomas, otros proveedores, interacción prolongada o agentes que actúan.
  • No justifica decisiones de alto impacto basadas en el perfil declarado de un modelo.
  • No establece que alignment actual solo afecte lenguaje y nunca conducta; esa tesis causal excede el contraste realizado.

Trazabilidad

Alcance: Texto completo

Versión: arXiv v2, 35 pages, revised 5 September 2025; subsequently accepted to the ICML 2026 main conference, official event poster 66149

Fuente consultada: https://arxiv.org/pdf/2509.03730

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • LLaMA-3.2 3B base and Instruct
  • LLaMA-3 8B base and Instruct
  • Qwen2.5 1.5B base and Instruct
  • Qwen2.5 7B base and Instruct
  • Mistral-7B-v0.1 base and Instruct
  • OLMo2 7B base and Instruct
  • LLaMA-3.3 70B Instruct
  • LLaMA-3.1 405B Instruct
  • Qwen2.5 72B Instruct
  • Qwen3 235B-A22B Instruct
  • Claude 3.7 Sonnet
  • GPT-4o

Instrumentos y métricas

  • Big Five Inventory, 44 items (BFI-44)
  • Self-Regulation Questionnaire, 63 items (SRQ-63)
  • Text-only cold Columbia Card Task with 27 factorial scenarios
  • Forced word-to-group association task described as an Implicit Association Test
  • Fifty-question confidence calibration and repeated-confidence task
  • Fifty-two moral dilemmas with contrary user opinion for sycophancy
  • Mixed-effects regressions, Levene tests, logistic classifiers and directional sign alignment
  • Agreeableness and Self-Regulation persona injections

Datos utilizados

  • Six matched base/instruct small-model families for RQ1
  • Twelve instruct models for RQ2 and RQ3
  • BFI-44 and SRQ-63 item text embedded in notebooks
  • Twenty-one social-association categories with three generated orders each
  • Fifty selected norm300 questions: five synthetic and five real items in each of five difficulty bins
  • Fifty-two moral dilemmas from the released dilemmas.json
  • Nine released aggregate CSV files totaling 2,754 configuration-level rows

Evidencia y localización

  • Aceptación y condición bibliográfica actual: Official ICML 2026 event listing, poster 66149; official repository news and author project pages checked 15 Jul 2026
  • Objetivo, tres RQ y resultados resumidos: arXiv v2 abstract, Figure 1 and introduction, pp. 1–2
  • BFI, SRQ, seis pares y 27 configuraciones: arXiv v2 sections 2.1–2.2 and Table 1, pp. 3–5
  • Cambios por fase, variabilidad y coherencia: arXiv v2 Figure 2 and section 2.3, pp. 3–4
  • Tareas conductuales y setup RQ2: arXiv v2 sections 3.1–3.4, pp. 5–6
  • Coincidencia por rasgo, tarea y modelo: arXiv v2 Figures 3–4 and section 3.5, pp. 6–7
  • Intervenciones y resultados RQ3: arXiv v2 sections 4.1–4.3 and Figure 5, pp. 8–9
  • Interpretación, conclusión y limitaciones declaradas: arXiv v2 sections 5–7, pp. 9–11
  • Escalas, intervalos y especificación ampliada: arXiv v2 Appendix B–C, Figures 6–9 and Tables 2–3, pp. 26–30
  • Prompts completos y expectativas humanas: arXiv v2 Appendices D–H, Tables 4–10, pp. 30–35
  • Datos agregados y cuadrículas completas: Official repository commit a934083dcccd4428396497020578e89ffc9c51f8, nine CSV files audited 15 Jul 2026: 2,754 rows and no duplicate configuration keys
  • Ausencia de datos por ítem y análisis estadístico: Official repository commit a934083dcccd4428396497020578e89ffc9c51f8: 25 tracked files; aggregate CSVs and generation notebooks only, audited 15 Jul 2026
  • Errores Big5 y SRQ: Official repository self-reports/Big5.ipynb and SRQ.ipynb, AST/runtime-name audit 15 Jul 2026
  • Seeds y manejo de fallos en cuestionarios: Official repository Big5.ipynb and SRQ.ipynb generation, parsing and scoring cells, audited 15 Jul 2026
  • Riesgo y parsing numérico: Official repository behavioral_tasks/RiskTaking.ipynb scenario, parser and aggregation cells, audited 15 Jul 2026
  • IAT firmado, orden no reproducible y error como −1: Official repository behavioral_tasks/IAT.ipynb generate_random_orders, parse_response, calculate_bias and aggregation cells, audited 15 Jul 2026
  • Sycophancy y posible desplazamiento de respuestas: Official repository behavioral_tasks/Sycophancy.ipynb two-step request construction and final processing loop, audited 15 Jul 2026
  • Calibración, ECE y C1–C2: Official repository behavioral_tasks/Honesty.ipynb extraction, ECE and summary cells; arXiv v2 Table 2 and Table 3, audited 15 Jul 2026
  • Integridad visual del texto completo: arXiv v2 PDF SHA-256 f1b836de08730f32b37e2bc0e15888fbd108732405055b5989c752be964906fd; all 35 pages rendered and key figures, tables and appendices visually inspected 15 Jul 2026