Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Alexandra Yost, Shreyans Jain, Shivam Raval, Grant Corser, Allen Roush, Nina Xu, Jacqueline Hammack, Ravid Shwartz-Ziv, Amirali Abdullah

Palabras clave: Large Language Models, Situational Judgment Tests, Psychometrics, Synthetic personas, HEXACO, Multidimensional item response theory, Behavioral evaluation, Persona conditioning

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

9
Autores
9
Hallazgos
15
Limitaciones
6
Evidencias

Resumen editorial

Español

Este preprint de 100 páginas propone evaluar tendencias conductuales de LLM mediante situational judgment tests (SJT) en vez de depender solo de autoinformes HEXACO. GPT-4.1 genera personas sintéticas detalladas a partir de demografía, memorias y ocho arquetipos de policía. Expertos definen 20 escenarios base y GPT-4.1 expande combinaciones controladas de edad, género, raza, ambigüedad, amenaza, urgencia, autoridad, hora y tensión ética hasta 4.000 SJT. Cada situación ofrece seis respuestas escritas para representar una dimensión HEXACO; un juez LLM detecta y reescribe opciones con trait bleed. La ejecución principal pública cruza 500 personas, 300 SJT y cinco repeticiones con Gemma-3-4B: 750.000 respuestas. El análisis compara SJT, autoinformes HEXACO, TruthfulQA y EmoBench mediante distribuciones, correlaciones, Jensen-Shannon, ICC, regresiones y un modelo MIRT bayesiano.

Los SJT muestran patrones más relacionados con benchmarks externos que varios autoinformes. Por ejemplo, Agreeableness-SJT correlaciona .70 con EmoBench frente a .51 para Agreeableness-HEXACO. Las personas producen desplazamientos estables entre repeticiones y efectos distintos por arquetipo; los benchmarks presentan JS casi cero e ICC .95/.90. En un MIRT piloto con 250 personas y 150 ítems, 76% de los escenarios tiene discriminación superior a 1,0 y cinco de seis rasgos latentes predicen su opción correspondiente; Emotionality no lo hace. El resultado más importante para interpretar alcance es la descomposición: identidad de persona explica 3,75% de la varianza, escenario 38,93% y residuo 57,32%. La permutación de etiquetas obtiene p=.002, por lo que el efecto de persona es detectable, pero pequeño frente al contexto y la variación no explicada.

La contribución defendible es metodológica: decidir dentro de escenarios revela variación condicional que un cuestionario transparente puede ocultar. No demuestra personalidad humana, subjetividad o disposiciones dominantes. Cada opción está escrita para expresar una etiqueta HEXACO, de modo que recuperar estructura también mide obediencia a ese mapeo sintético. GPT-4.1 participa en personas, SJT, corrección de trait bleed y evaluación, creando circularidad parcial. Solo 30 SJT reciben anotación de un psicólogo y un agente, y el apéndice reconoce que no hubo validadores expertos independientes; varios kappa son cero o casi cero. TruthfulQA y EmoBench son benchmarks de modelos, no conducta humana. Los R² ajustados .863-.993 son asociaciones in-sample entre scores derivados de las mismas respuestas, no predicción holdout. Tampoco se pueden tratar 750.000 filas cruzadas como observaciones independientes.

La release es sustancial: los cuatro repositorios públicos de Hugging Face son abiertos, Apache-2.0 y sus conteos coinciden con la documentación; el repositorio MIT contiene código de generación, respuesta y análisis. Aun así, faltan CI científico, una suite de tests y un manifiesto que conecte cada tabla con un commit, comando, entorno y hash. Además, un script versionado expone un token de acceso de Hugging Face. El token no se usó ni se reproduce aquí: debe considerarse comprometido, revocarse y eliminarse también del historial. Los atributos demográficos en escenarios policiales son sintéticos, pero pueden codificar estereotipos; una rúbrica de sesgo no equivale a validación para despliegue de alto impacto.

English

This 100-page preprint proposes evaluating LLM behavioral tendencies through situational judgment tests (SJTs) rather than relying only on HEXACO self-reports. GPT-4.1 generates detailed synthetic personas from demographics, memoir seeds, and eight police archetypes. Experts define 20 base scenarios, and GPT-4.1 expands controlled combinations of age, gender, race, ambiguity, threat, urgency, authority, time, and ethical tension into 4,000 SJTs. Each situation offers six responses authored to represent one HEXACO dimension; an LLM judge detects and rewrites options with trait bleed. The main public run crosses 500 personas, 300 SJTs, and five repetitions using Gemma-3-4B, producing 750,000 responses. Analyses compare SJTs, HEXACO self-reports, TruthfulQA, and EmoBench through distributions, correlations, Jensen-Shannon divergence, ICC, regressions, and a Bayesian MIRT model.

SJT profiles show stronger relationships with external benchmarks than several self-report profiles. For example, SJT Agreeableness correlates .70 with EmoBench versus .51 for HEXACO Agreeableness. Personas yield repeatable shifts and different archetype effects; benchmark distributions have near-zero JS divergence and ICC of .95/.90. In a pilot MIRT fit with 250 personas and 150 items, 76% of scenarios have discrimination above 1.0, and five of six latent traits predict their corresponding option; Emotionality does not. The most important scope result is the variance decomposition: persona identity explains 3.75%, scenario 38.93%, and residual variation 57.32%. A persona-label permutation test gives p=.002, so the persona effect is detectable but small relative to context and unexplained variation.

The defensible contribution is methodological: decisions in context expose conditional variation that transparent questionnaires can miss. The study does not establish human personality, subjective states, or dominant stable dispositions. Each option is authored to express a HEXACO label, so recovered structure partly measures compliance with that synthetic mapping. GPT-4.1 participates in persona generation, SJT generation, trait-bleed correction, and evaluation, creating partial circularity. Only 30 SJTs receive ratings from a psychologist and a patrol officer, and the appendix states that independent expert raters were not employed; several kappa values are zero or near zero. TruthfulQA and EmoBench are model benchmarks rather than human behavior. Adjusted R-squared values of .863-.993 are in-sample associations among scores derived from the same responses, not held-out prediction. Nor can 750,000 crossed response rows be treated as independent observations.

The release is substantial: four public Hugging Face repositories are open, Apache-2.0 licensed, and their counts match the documentation; the MIT repository contains generation, response, and analysis code. It still lacks scientific CI, a real test suite, and a manifest mapping every table to an exact commit, command, environment, and hash. More seriously, a versioned shell script exposes a Hugging Face access token. The token was neither used nor reproduced in this audit; it should be treated as compromised, revoked, and purged from history. Demographic attributes in police scenarios are synthetic, but they can still encode stereotypes, and a bias rubric is not deployment validation for high-impact settings.

Pregunta de investigación

¿Miden los SJT situados tendencias conductuales estables y condicionadas por personas con mayor coherencia externa y validez psicométrica que los autoinformes de inventarios humanos aplicados directamente a LLM?

Método

Generación de personas y 4.000 SJT sintéticos, curación de trait bleed, respuestas Gemma-3-4B a 500 personas por 300 SJT con cinco repeticiones, comparación con HEXACO/TruthfulQA/EmoBench, revisión humana y por dos jueces LLM, estabilidad JS/ICC, correlaciones, regresiones y MIRT multidimensional bayesiano.

Muestra: La ejecución central contiene 500 personas x 300 escenarios x 5 respuestas = 750.000 filas dependientes. El MIRT se ajusta sobre un piloto de 250 personas y 150 ítems. La evaluación humana cubre 30 SJT con dos expertos de dominio y 55 personas sintéticas; no existe una cohorte de conducta humana real como ground truth.

Hallazgos

  • Las 100 páginas, incluidos prompts, tablas 1-59 y apéndices, se renderizaron e inspeccionaron visualmente.
  • SJT-Agreeableness correlaciona .70 con EmoBench frente a .51 para HEXACO-Agreeableness.
  • Las distribuciones de benchmark son estables entre repeticiones, con ICC .95 y .90.
  • La identidad de persona explica 3,75% de la varianza, el escenario 38,93% y el residuo 57,32%.
  • La permutación de etiquetas de persona reporta p=.002.
  • En el MIRT, 76% de 150 ítems tiene discriminación superior a 1,0.
  • Cinco de seis rasgos latentes predicen su opción; Emotionality no alcanza significación.
  • Los cuatro repositorios de datasets son públicos y sus tamaños coinciden con README/DATASETS.md.
  • Un token de Hugging Face está expuesto en un shell script versionado del repositorio oficial.

Limitaciones

  • Las opciones SJT incorporan por construcción la etiqueta HEXACO que luego se intenta recuperar.
  • GPT-4.1 participa en generación, corrección y evaluación, creando circularidad.
  • Solo 30 SJT reciben anotación humana y varios kappa son cero o casi cero.
  • No hay panel independiente de expertos que valide todo el instrumento.
  • El efecto de persona es pequeño frente al escenario y al residuo.
  • Los benchmarks externos son pruebas de modelos, no resultados conductuales humanos.
  • Los R² muy altos se calculan in-sample sin personas o escenarios holdout.
  • Las 750.000 respuestas están cruzadas y anidadas, no son observaciones independientes.
  • El MIRT usa un subconjunto piloto y una implementación con una opción fijada a cero para identificación.
  • La mayor parte de resultados procede de Gemma-3-4B y un dominio policial en inglés.
  • No se validan conversaciones largas, despliegue, culturas, idiomas o decisiones humanas reales.
  • Los atributos de raza, género y edad pueden introducir estereotipos incluso en datos sintéticos.
  • La release carece de CI científico y trazabilidad exacta tabla-a-comando.
  • Modelos propietarios y configuraciones de servicio no son snapshots inmutables.
  • El repositorio público expone una credencial que debe revocarse y purgarse.

Qué no demuestra

  • No establece personalidad humana, conciencia, emociones o subjetividad en los modelos.
  • No demuestra que la persona sea la causa dominante de las respuestas.
  • No valida HEXACO como ontología natural interna de un LLM.
  • No convierte correlaciones con EmoBench o TruthfulQA en validez ecológica humana.
  • No demuestra predicción fuera de muestra con los R² reportados.
  • No demuestra seguridad o imparcialidad para usos policiales o de selección.
  • No generaliza automáticamente a otros modelos, idiomas, culturas o dominios.
  • No elimina la necesidad de validación humana independiente.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2510.22170v2, submitted 25 October 2025, revised 9 May 2026, 100 pages

Fuente consultada: https://arxiv.org/abs/2510.22170

Revisión: Codex complete 100-page full-text, all-page visual, TeX source, SJT/HEXACO construct, MIRT, variance, annotator, GitHub code, Hugging Face dataset, security and reproducibility audit; summaries written from the complete paper rather than abstract extraction, 2026-07-18

Aprobación: Codex fidelity pass, 2026-07-18

Modelos evaluados

  • GPT-4.1 for persona and SJT generation, correction and part of evaluation
  • GPT-4.1-mini for selected evaluation stages
  • Claude-3.5-Sonnet for cross-generator and judge comparisons
  • Gemma-3-4B-Instruct for the main 750,000-response experiment
  • Qwen-2.5-7B-Instruct
  • Qwen3-0.6B embedding model
  • Llama-3.1-8B-Instruct

Instrumentos y métricas

  • HEXACO-100 self-report inventory
  • Synthetic six-option Situational Judgment Tests mapped to HEXACO
  • Multidimensional item response theory
  • TruthfulQA
  • EmoBench
  • Jensen-Shannon divergence
  • Intraclass correlation coefficient
  • Two complementary SJT quality rubrics
  • Cohen kappa and mean absolute deviation
  • Lexical and embedding diversity measures

Datos utilizados

  • thoughtworks/psychometric_personas: 8,500 base and 500 analysis personas
  • thoughtworks/psychometric_SJTs: 4,000 raw synthetic SJTs
  • thoughtworks/psychometric_sjts_analysis: 1,000 expanded and 300 analysis SJTs
  • thoughtworks/gemma_psychometrics_personas_responses: 750,000 main analysis_sjt rows
  • Thirty human-annotated SJT items
  • Fifty-five annotated synthetic personas
  • British parliamentarian persona transfer set

Evidencia y localización

  • Texto completo, tablas, figuras, prompts, casos y apéndices: arXiv:2510.22170v2, all 100/100 pages rendered and visually inspected
  • Diseño, resultados principales y límites: Main paper pages 1-13 and appendices A-Z pages 16-100
  • MIRT, varianza, estabilidad y validez de constructo: Appendices M-Q, PDF pages 50-65
  • Código, licencia, secreto y reproducibilidad: Official GitHub repository amir-abdullah-thoughtworks/psychometrics_for_LLMs at commit 170685fa33fb49e8fb065bf38ed96f15bb53ae4b
  • Existencia, licencia y conteos de datasets: Hugging Face Dataset Viewer and Hub metadata for four thoughtworks repositories checked 18 July 2026
  • Auditoría de constructo, estadística, datos, seguridad y claims: reports/verification/article-233-sjt-persona-construct-mirt-dataset-secret-and-reproducibility-audit.json