Este preprint de 100 páginas propone evaluar tendencias conductuales de LLM mediante situational judgment tests (SJT) en vez de depender solo de autoinformes HEXACO. GPT-4.1 genera personas sintéticas detalladas a partir de demografía, memorias y ocho arquetipos de policía. Expertos definen 20 escenarios base y GPT-4.1 expande combinaciones controladas de edad, género, raza, ambigüedad, amenaza, urgencia, autoridad, hora y tensión ética hasta 4.000 SJT. Cada situación ofrece seis respuestas escritas para representar una dimensión HEXACO; un juez LLM detecta y reescribe opciones con trait bleed. La ejecución principal pública cruza 500 personas, 300 SJT y cinco repeticiones con Gemma-3-4B: 750.000 respuestas. El análisis compara SJT, autoinformes HEXACO, TruthfulQA y EmoBench mediante distribuciones, correlaciones, Jensen-Shannon, ICC, regresiones y un modelo MIRT bayesiano.
Los SJT muestran patrones más relacionados con benchmarks externos que varios autoinformes. Por ejemplo, Agreeableness-SJT correlaciona .70 con EmoBench frente a .51 para Agreeableness-HEXACO. Las personas producen desplazamientos estables entre repeticiones y efectos distintos por arquetipo; los benchmarks presentan JS casi cero e ICC .95/.90. En un MIRT piloto con 250 personas y 150 ítems, 76% de los escenarios tiene discriminación superior a 1,0 y cinco de seis rasgos latentes predicen su opción correspondiente; Emotionality no lo hace. El resultado más importante para interpretar alcance es la descomposición: identidad de persona explica 3,75% de la varianza, escenario 38,93% y residuo 57,32%. La permutación de etiquetas obtiene p=.002, por lo que el efecto de persona es detectable, pero pequeño frente al contexto y la variación no explicada.
La contribución defendible es metodológica: decidir dentro de escenarios revela variación condicional que un cuestionario transparente puede ocultar. No demuestra personalidad humana, subjetividad o disposiciones dominantes. Cada opción está escrita para expresar una etiqueta HEXACO, de modo que recuperar estructura también mide obediencia a ese mapeo sintético. GPT-4.1 participa en personas, SJT, corrección de trait bleed y evaluación, creando circularidad parcial. Solo 30 SJT reciben anotación de un psicólogo y un agente, y el apéndice reconoce que no hubo validadores expertos independientes; varios kappa son cero o casi cero. TruthfulQA y EmoBench son benchmarks de modelos, no conducta humana. Los R² ajustados .863-.993 son asociaciones in-sample entre scores derivados de las mismas respuestas, no predicción holdout. Tampoco se pueden tratar 750.000 filas cruzadas como observaciones independientes.
La release es sustancial: los cuatro repositorios públicos de Hugging Face son abiertos, Apache-2.0 y sus conteos coinciden con la documentación; el repositorio MIT contiene código de generación, respuesta y análisis. Aun así, faltan CI científico, una suite de tests y un manifiesto que conecte cada tabla con un commit, comando, entorno y hash. Además, un script versionado expone un token de acceso de Hugging Face. El token no se usó ni se reproduce aquí: debe considerarse comprometido, revocarse y eliminarse también del historial. Los atributos demográficos en escenarios policiales son sintéticos, pero pueden codificar estereotipos; una rúbrica de sesgo no equivale a validación para despliegue de alto impacto.