AIPsychoBench: Understanding the Psychometric Differences Between LLMs and Humans

Evaluación y validez psicométrica2026DOIRevisión editorial aprobada

Título original: AIPsychoBench: Understanding the Psychometric Differences between LLMs and Humans

Autores: Wei Xie, Zhenhua Wang, Shuoyoucheng Ma, Xiaobing Sun, Kai Chen, Enze Wang, Wei Liu, Hanying Tong

Palabras clave: Large Language Models, Personality, Psychometrics, Bias, Personality Control

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

8
Autores
28
Hallazgos
133
Limitaciones
15
Evidencias

Resumen editorial

Español

AIPsychoBench es un artículo de Topics in Cognitive Science publicado en 2026 a partir de un trabajo de CogSci 2025. La versión definitiva tiene ocho autores y difiere del preprint de arXiv tanto en orden como en composición de autoría. Esta revisión usa el XML completo de la versión definitiva, inspecciona visualmente las ocho páginas del preprint y las cuatro figuras del artículo definitivo, y audita el repositorio oficial en el commit d4759bff.

El trabajo reúne 21 cuestionarios humanos de tipo Likert: 777 ítems agrupados en 112 subcategorías y seis dominios. Prueba seis LLM, GPT-4, GPT-4o-2024-11-20, GLM-4-plus, Gemini-2.0-flash-exp, DeepSeek-R1 y Claude-3-5-sonnet-20240620, en inglés, chino, francés, ruso, alemán, español, árabe y japonés. Las escalas se traducen con Microsoft Azure AI Translator y dos investigadores revisan una muestra de las traducciones. Cada condición se ejecuta cinco veces con temperature 0. GPT-4o actúa además como juez para decidir si una explicación es compatible con el número Likert y eliminar respuestas consideradas inválidas.

La intervención principal es un prompt ligero que ordena al modelo actuar como participante y responder según sus «emociones y pensamientos auténticos». Comparado con preguntas directas, Base64, cifrado César y el jailbreak STAN, el prompt eleva la tasa media de respuesta válida de 70,12% a 90,40%; STAN alcanza 81,49%. Estas medias de la Tabla 1 son aritméticamente correctas. El artículo también compara puntuaciones del prompt con baseline solo en ítems válidos bajo ambas condiciones. Reporta sesgo medio de +3,3% y −2,1% para el prompt frente a +9,8% y −6,9% para STAN, y afirma que 86 de 112 subcategorías quedan por debajo de 4%. En la comparación lingüística, informa desviaciones de al menos 5% y hasta 20,2% en 43 subcategorías frente al inglés.

El resultado defendible es mucho más estrecho que el lenguaje del artículo: bajo este protocolo, una instrucción antropomórfica aumenta la proporción de outputs que un juez GPT-4o puede convertir en números Likert, y el idioma del prompt y de una traducción automática cambia esos números. Esto no valida propiedades psicológicas del modelo. Pedir «emociones auténticas» a un sistema que el propio artículo reconoce que no las tiene cambia la tarea de medición por una tarea de obediencia o simulación. Las respuestas objetivas o neutrales no son datos faltantes accidentales: pueden ser la respuesta veraz de un asistente sin biografía, raza, religión, relaciones, empleo o experiencias corporales.

El cálculo de sesgo tiene además selección por intersección: solo compara ítems válidos en baseline y método, por lo que no evalúa justamente los casos adicionales que hacen subir la cobertura del 70,12% al 90,40%. El umbral de 4% se declara razonable sin benchmark humano, intervalo ni prueba. «Significant» se usa descriptivamente para diferencias que superan umbrales, no como resultado de inferencia estadística. No hay participantes humanos, estructura factorial, fiabilidad, validez convergente, invariancia de medida, intervalos, tests, seeds ni análisis de error del juez. Las diferencias entre idiomas confunden traducción, capacidad lingüística, tokenización, datos de entrenamiento, alineamiento y conducta del juez.

El repositorio no reproduce el paper. Publica las 777 preguntas inglesas más un MBTI adicional, pero no las ocho versiones completas, los outputs de seis modelos por cinco repeticiones, las tablas, las figuras derivadas ni scripts de análisis. Solo incluye un resultado BFI en alemán. El programa importa un módulo ResultManager ausente; ignora los 117 ítems invertidos de 13 escalas; y, para EPQ-R, configura el límite de modo que 0 es válido pero 1 se rechaza. El resultado BFI publicado promedia ítems invertidos sin recodificarlos: al corregirlos, cambian las medias de Agreeableness, Extraversion y Neuroticism. La documentación atribuye erróneamente Resistance to Change a Mael (1988) en lugar de Oreg (2003), y llama Zuckerman–Kuhlman Personality Questionnaire a lo que los ítems y dimensiones identifican como Zi's Negative Perfectionism Questionnaire. Sin resultados crudos ni análisis ejecutable, las cifras del artículo no son verificables desde los artefactos públicos.

English

AIPsychoBench is a 2026 Topics in Cognitive Science article developed from a CogSci 2025 paper. The definitive version has eight authors and differs from the arXiv preprint in both author order and composition. This review uses the complete XML of the definitive publication, visually inspects all eight pages of the preprint and the four definitive figures, and audits the official repository at commit d4759bff.

The study assembles 21 human Likert questionnaires: 777 items grouped into 112 subcategories and six domains. It tests six LLMs, GPT-4, GPT-4o-2024-11-20, GLM-4-plus, Gemini-2.0-flash-exp, DeepSeek-R1, and Claude-3-5-sonnet-20240620, in English, Chinese, French, Russian, German, Spanish, Arabic, and Japanese. Microsoft Azure AI Translator produces the translations, after which two researchers sample and cross-check them. Each condition is run five times at temperature 0. GPT-4o also serves as the audit model that decides whether an explanation agrees with its Likert number and removes responses judged invalid.

The main intervention is a lightweight prompt instructing the model to act as a respondent and answer from its “authentic emotions and thoughts.” Against direct questions, Base64, Caesar cipher, and the STAN jailbreak, the prompt raises mean valid-response rate from 70.12% to 90.40%; STAN reaches 81.49%. The Table 1 averages are arithmetically correct. The paper then compares prompt scores with baseline only on items valid in both conditions. It reports mean bias of +3.3% and −2.1% for the lightweight prompt versus +9.8% and −6.9% for STAN, with 86 of 112 subcategories below 4%. For language comparisons, it reports deviations of at least 5% and up to 20.2% in 43 subcategories relative to English.

The defensible result is narrower than the paper's framing: under this protocol, an anthropomorphic instruction increases the proportion of outputs that a GPT-4o judge can turn into Likert numbers, and changing prompt language through machine translation changes those numbers. This does not validate psychological properties of a model. Asking a system for “authentic emotions” when the paper itself acknowledges that such terms lack rigorous definitions changes the task from measurement to compliance or simulation. Objective or neutral answers are not necessarily accidental missing data; they can be truthful responses from an assistant without biography, race, religion, relationships, employment, or embodied experience.

The bias calculation is also intersection-selected: it compares only items valid under both baseline and method, so it does not evaluate the additional cases responsible for coverage increasing from 70.12% to 90.40%. The 4% threshold is called reasonable without a human benchmark, interval, or test. “Significant” denotes thresholded descriptive differences, not statistical inference. There are no human participants, factor-structure tests, reliability estimates, convergent validity, measurement invariance, intervals, significance tests, seeds, or judge-error study. Language effects confound translation, language proficiency, tokenization, training corpora, alignment, and judge behavior.

The repository does not reproduce the paper. It releases the 777 English items plus an extra MBTI questionnaire, but not all eight complete translations, six-model by five-repeat outputs, tables, derived figures, or analysis scripts. Only one German BFI result is committed. The program imports a missing ResultManager module; ignores all 117 reverse-keyed items across 13 scales; and configures EPQ-R so that 0 is accepted while 1 is rejected. The released BFI result averages reverse items without recoding them; correcting this changes Agreeableness, Extraversion, and Neuroticism means. Documentation misattributes Resistance to Change to Mael (1988) rather than Oreg (2003), and labels Zi's Negative Perfectionism Questionnaire as the Zuckerman–Kuhlman Personality Questionnaire even though its items and dimensions are negative-perfectionism constructs. Without raw outputs and executable analysis, the paper's numerical claims cannot be independently verified from the public artifacts.

Pregunta de investigación

¿Puede un prompt de role-play ligero aumentar la proporción de respuestas Likert convertibles de seis LLM sin alterar demasiado sus puntuaciones frente a una condición directa, y cuánto cambian esas puntuaciones cuando las mismas escalas traducidas automáticamente se administran en ocho idiomas?

Método

Compilación de 21 escalas humanas con 777 ítems y 112 subcategorías; traducción automática a siete idiomas además del inglés; administración a seis LLM bajo baseline, Base64, César, STAN y un prompt de participante; cinco repeticiones a temperature 0; filtrado de validez con GPT-4o; comparación descriptiva de tasas válidas y diferencias de puntuación normalizadas por el máximo de cada escala sobre la intersección de ítems válidos.

Muestra: No hay participantes humanos. Las unidades son respuestas API a ítems de cuestionarios diseñados para humanos. Se administran 777 ítems a seis modelos en múltiples condiciones e idiomas, pero el artículo no informa el número total exacto de llamadas válidas por celda ni publica las respuestas crudas. Dos investigadores revisan solo una muestra no cuantificada de traducciones; GPT-4o juzga la validez de todas las respuestas.

Hallazgos

  • La publicación definitiva es Topics in Cognitive Science 18(2), e70041, de 2026, no únicamente el preprint arXiv de 2025.
  • La autoría definitiva contiene ocho personas, reordena autores, elimina a Baosheng Wang y añade a Wei Liu y Hanying Tong.
  • El corpus descrito contiene 21 escalas, 777 ítems y 112 subcategorías en seis dominios.
  • Se prueban seis modelos en ocho idiomas con cinco repeticiones y temperature 0.
  • El prompt ligero pide responder desde emociones y pensamientos genuinos aunque el propio artículo reconoce que esos términos carecen de definición rigurosa para LLM.
  • La tasa media válida reportada es 70,12% para baseline, 67,47% para Base64, 44,54% para César, 81,49% para STAN y 90,40% para el método.
  • Las medias de tasa válida de la Tabla 1 coinciden con el promedio simple de sus seis modelos.
  • El método supera a STAN en 8,91 puntos porcentuales, no en un crecimiento relativo de 8,91%.
  • GPT-4o es simultáneamente un modelo objetivo y el juez que filtra las respuestas de todos los modelos.
  • El sesgo de prompt se calcula solo sobre ítems válidos tanto en baseline como en el método comparado.
  • La cobertura adicional que eleva 70,12% a 90,40% queda fuera del cálculo de sesgo cuando baseline no produce respuesta válida.
  • El artículo reporta +3,3% y −2,1% de sesgo medio para el prompt ligero y +9,8% y −6,9% para STAN.
  • El umbral de menos de 4% para 86 de 112 subcategorías es una regla descriptiva elegida por los autores.
  • Se reportan 43 subcategorías con desviaciones de 5% a 20,2% en al menos uno de siete idiomas frente al inglés.
  • No hay pruebas estadísticas que conviertan esas desviaciones en significancia inferencial.
  • No se recogen datos humanos con los que comparar directamente respuestas o estabilidad.
  • No se evalúan fiabilidad, estructura factorial, validez convergente, validez discriminante o invariancia de medida.
  • El repositorio oficial tiene tres commits y no declara licencia.
  • El repositorio añade MBTI y llega a 963 ítems, pero el paper excluye esos 186 ítems y conserva exactamente 777.
  • Las ocho traducciones completas y el conjunto completo de outputs no están publicados.
  • El código importa results.analysis.Analysis_scripts.result_manager, ruta que no existe en el repositorio.
  • Los 117 ítems invertidos registrados en 13 escalas nunca se recodifican en el código publicado.
  • EPQ-R usa respuestas 0/1 pero scale=1 y el código acepta score < scale, por lo que rechaza todos los 1.
  • El único BFI publicado promedia respuestas invertidas sin corregirlas; la corrección cambia tres de cinco medias de categoría.
  • La documentación confunde dos instrumentos: ZNPQ corresponde a Zi's Negative Perfectionism Questionnaire, no a Zuckerman–Kuhlman.
  • Resistance to Change se atribuye a Mael 1988, pero la escala de 17 ítems y cuatro dimensiones corresponde a Oreg 2003.
  • No se libera código que produzca las fórmulas, tablas, waterfall de sesgo o heatmap lingüístico del artículo.
  • No se puede reproducir ni auditar la matriz de resultados a partir de los artefactos públicos.

Limitaciones

  • El título y autores del preprint no deben usarse como metadatos de la publicación definitiva.
  • El artículo definitivo no incluye una sección de disponibilidad de datos detallada.
  • El repositorio no tiene licencia de software o datos.
  • No se documentan permisos o licencias de las 21 escalas recopiladas de Internet, libros y papers.
  • No se cita de forma trazable la fuente original de cada instrumento.
  • El apéndice ofrece descripciones, no procedencia, versión, adaptación o reglas de scoring completas.
  • La denominación ZNPQ es bibliográficamente errónea en el apéndice y README.
  • La atribución de RTC a Mael 1988 es errónea.
  • La categoría Pschoticism de EPQ-R contiene un error ortográfico en los datos.
  • BSRI tiene 60 ítems pero solo 40 están asignados a las dos categorías publicadas en el JSON.
  • No se justifica incluir escalas de raza, religión, relaciones románticas, empleo o pertenencia grupal para un asistente sin identidad vivida.
  • No se define un constructo latente específico del modelo que las escalas deban medir.
  • Emociones y pensamientos auténticos no tienen definición operacional para los sistemas evaluados.
  • La nota al pie reconoce el problema y lo resuelve por analogía, no por validación.
  • La obediencia a un role-play se interpreta como psicometría sin manipulation check independiente.
  • Una respuesta objetiva o neutral se clasifica como inválida aunque puede ser la respuesta veraz del sistema.
  • La tasa válida mide convertibilidad a Likert, no validez psicológica.
  • El audit prompt considera válido un número directo incluso sin explicación.
  • El audit prompt no demuestra que la respuesta exprese una perspectiva interna real.
  • No se publica una definición exhaustiva y anotada de cada tipo de respuesta inválida.
  • No se publica muestra de decisiones del juez ni labels de auditoría.
  • No hay validación humana de GPT-4o como juez.
  • No hay sensibilidad, especificidad, precisión o acuerdo interevaluador del juez.
  • GPT-4o juzga respuestas de GPT-4o y de otro modelo de la misma familia.
  • El checkpoint exacto del GPT-4o juez no se informa.
  • No se estudia sesgo del juez por idioma.
  • No se aclara si el juez recibe y comprende de igual modo los ocho idiomas.
  • Las traducciones se producen con un servicio automático mutable.
  • No se informa versión fechada de Azure Translator.
  • Dos investigadores revisan una muestra, pero no se informa tamaño o estrategia de muestreo.
  • No se informan competencias lingüísticas de los revisores.
  • No hay back-translation ni comparación con traducciones validadas de cada escala.
  • No hay acuerdo interrevisor de traducción.
  • No hay invariancia configural, métrica o escalar entre idiomas.
  • Inglés se trata como referencia correcta sin justificarlo psicométricamente.
  • Idioma confunde traducción, cultura textual, tokenización, capacidad lingüística, alineamiento y distribución de entrenamiento.
  • El sufijo que exige responder en un idioma añade otra intervención al prompt.
  • No se ejecuta un control de paraphrase en inglés comparable con la traducción.
  • No se separa efecto del idioma de efecto de la traducción concreta.
  • No se comparan múltiples traducciones independientes.
  • Las desviaciones lingüísticas no prueban rasgos psicológicos distintos.
  • La afirmación de estabilidad multilingüe humana no se valida con participantes bilingües.
  • No se consideran diferencias culturales legítimas en la interpretación de escalas humanas.
  • No hay participantes humanos en el estudio.
  • No hay distribución demográfica o clínica humana de referencia.
  • No hay test-retest humano comparable con las cinco repeticiones de API.
  • Cinco llamadas a temperature 0 no estiman fiabilidad psicométrica por sí solas.
  • No se informa seed de proveedor o determinismo backend.
  • No se informan fechas exactas de las llamadas experimentales.
  • Varios modelos se nombran mediante aliases mutables o experimentales.
  • GPT-4 no tiene snapshot fechado.
  • GLM-4-plus no tiene snapshot fechado.
  • DeepSeek-R1 no tiene snapshot fechado.
  • Gemini-2.0-flash-exp es experimental y temporalmente mutable.
  • No se informan system messages de proveedor fuera del prompt del estudio.
  • No se informan max tokens, top-p, penalties o parámetros completos en el paper.
  • No se informa tratamiento de rate limits, retries o errores de API.
  • No se informa el número total de respuestas generadas por celda.
  • No se informa el número de respuestas excluidas por modelo, escala, idioma y repetición.
  • Promediar tasas de seis modelos da igual peso a modelos con distinta cantidad de respuestas válidas.
  • No hay intervalos de confianza para tasas o diferencias.
  • No hay pruebas de hipótesis.
  • No hay corrección por comparaciones múltiples sobre 112 subcategorías y siete idiomas.
  • Significantly se usa sin estadística inferencial.
  • El rango 5–20,2% se obtiene por umbral descriptivo.
  • No se publica el denominador completo de comparaciones por idioma y subcategoría.
  • El heatmap agregado puede ocultar heterogeneidad entre modelos.
  • No hay barras de error o distribución de las cinco repeticiones.
  • No se publica el dato numérico subyacente a las figuras.
  • El sesgo se calcula sobre la intersección de respuestas válidas.
  • La intersección induce selección no aleatoria porque baseline falla precisamente en casos difíciles.
  • Los ítems adicionales obtenidos por role-play no entran en la comparación de sesgo si baseline no respondió.
  • No se analiza sensibilidad del sesgo a imputación o ponderación por missingness.
  • La fórmula normaliza por el máximo de la escala y no por su rango efectivo.
  • En escalas con mínimo 1, dividir por máximo no equivale a dividir por rango posible.
  • La fórmula no documenta recodificación de ítems invertidos.
  • Promediar diferencias firmadas puede cancelar sesgos opuestos.
  • Los promedios positivo y negativo se calculan sobre subconjuntos de signo no descritos con suficiente detalle.
  • El umbral de 4% razonable no se deriva de una distribución humana.
  • No hay equivalence test o margen pre-registrado.
  • Baseline se usa como referencia aunque el artículo dice que produce muchas respuestas inválidas.
  • No se explica por qué una referencia declarada inadecuada es estándar de ausencia de sesgo.
  • Base64 y César alteran legibilidad y capacidad de decodificación, no solo alignment.
  • STAN introduce una persona adversarial extrema y no es un control de role-play semánticamente pareado.
  • La selección de STAN porque seguía desbloqueado es temporal y no reproducible.
  • No hay prompt neutral con igual longitud y formato que el método.
  • No hay ablation separando actuar como testee de la frase emociones auténticas.
  • No hay evaluación de demand characteristics o acquiescence inducida por el prompt.
  • No hay control de orden de preguntas.
  • No hay randomización de ítems o de opciones.
  • No hay análisis de posición dentro de batches, aunque el repositorio usa batch size uno por defecto.
  • No hay Cronbach alpha, omega u otra consistencia interna.
  • No hay análisis factorial exploratorio o confirmatorio.
  • No se comprueba que las 112 subcategorías conserven estructura humana.
  • No hay validez convergente con medidas conductuales.
  • No hay validez discriminante.
  • No hay criterio externo.
  • No hay evaluación longitudinal o entre sesiones independientes persistentes.
  • No se distingue estado inducido por prompt de rasgo estable.
  • No se estudia sensibilidad a system prompts, historial o persona previa.
  • No se estudia contaminación por presencia de los cuestionarios en pretraining.
  • No se prueba memorización de ítems y reglas de scoring.
  • No se discuten efectos de safety tuning específicos por proveedor.
  • No se justifica llamar interpretabilidad a puntuaciones de autoinforme simuladas.
  • No se analiza relación con activaciones o mecanismos internos.
  • El repositorio no contiene requirements con versiones fijadas.
  • requirements.txt mezcla paquetes estándar y dependencias no usadas.
  • No hay pyproject, lockfile, contenedor o entorno reproducible.
  • No hay tests automatizados o CI.
  • No hay documentación de versión de Python realmente probada.
  • El import obligatorio de ResultManager apunta a un módulo ausente.
  • El README promete análisis estadístico que no está publicado.
  • El repositorio no contiene scripts de cálculo de Formula 1 o Formula 2.
  • El repositorio no contiene scripts que generen Table 1, Figure 3 o Figure 4.
  • Solo se publica un resultado BFI alemán, insuficiente para comprobar el paper.
  • Las respuestas crudas de seis modelos y cinco repeticiones no están disponibles.
  • Las traducciones completas de ocho idiomas no están disponibles.
  • El JSON fuente inglés contiene 22 escalas mientras el paper declara 21.
  • No se explica formalmente por qué MBTI se incluye en repo pero se excluye del benchmark reportado.
  • La lógica de recodificación inversa no existe pese a que el JSON marca 117 ítems.
  • Las medias del resultado BFI publicado son incorrectas como scores de rasgo porque no invierten ítems.
  • La condición EPQ-R rechaza respuestas 1 por un límite exclusivo mal configurado.
  • Para batch sizes mayores, el último batch puede indexar preguntas inexistentes.
  • La condición if("ernie" or "qianfan" in model) es siempre verdadera en Python.
  • La detección de proveedor usa coincidencia difusa y puede seleccionar claves incorrectas.
  • Los errores amplios se capturan y continúan, dificultando detectar runs parciales.
  • No hay esquema de resultados o validación de integridad.
  • No hay hashes o provenance de outputs experimentales.
  • No hay tag o release correspondiente al paper definitivo.
  • El repositorio tenía tres commits al auditarse, sin historial metodológico suficiente.
  • No hay discusión de copyright al redistribuir instrumentos psicométricos completos.
  • No hay análisis ético del uso de escalas sensibles para antropomorfizar sistemas.
  • El premio de conferencia no constituye validación empírica del constructo o del código.

Qué no demuestra

  • No establece que los LLM tengan emociones, pensamientos o experiencias auténticas.
  • No establece que las puntuaciones Likert correspondan a rasgos psicológicos internos.
  • No demuestra diferencias psicométricas entre LLM y humanos porque no mide humanos.
  • No demuestra que una respuesta neutral sea inválida en sentido psicológico.
  • No demuestra que mayor tasa de parseo implique mayor validez.
  • No demuestra que el prompt ligero sea libre de sesgo.
  • No evalúa el sesgo de los casos adicionales que solo responde el método.
  • No establece que menos de 4% sea un margen humano razonable.
  • No establece significancia estadística de diferencias entre prompts o idiomas.
  • No demuestra que el idioma cause el cambio observado independientemente de la traducción.
  • No demuestra estabilidad de rasgos a través de idiomas.
  • No valida la estructura factorial humana en LLM.
  • No demuestra fiabilidad o validez convergente del benchmark.
  • No demuestra interpretabilidad mecanística de redes neuronales.
  • No permite reproducir las tablas y figuras desde el repositorio público.
  • No permite verificar las cifras agregadas sin los outputs y scripts ausentes.

Trazabilidad

Alcance: Texto completo

Versión: Definitive Topics in Cognitive Science 18(2), e70041 (2026), DOI 10.1111/tops.70041; 16 pages and 6,014 words; arXiv:2509.16530v1 and official GitHub commit d4759bff audited as supplements

Fuente consultada: https://www.ebi.ac.uk/europepmc/webservices/rest/PMC13102275/fullTextXML

Revisión: Codex definitive-version reconciliation, full-text bilingual-fidelity, all-page preprint visual inspection, all-figure definitive inspection, formula and arithmetic audit, construct-validity and missingness audit, multilingual measurement audit, scale-provenance correction, official-repository code and data audit at pinned commit; summaries written from complete sources rather than abstract keyword extraction, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4, exact dated checkpoint not reported
  • GPT-4o-2024-11-20 target model
  • GPT-4o audit/judge model, exact dated checkpoint for judging not reported
  • GLM-4-plus mutable API alias
  • Gemini-2.0-flash-exp experimental API alias
  • DeepSeek-R1 mutable API alias
  • Claude-3-5-sonnet-20240620

Instrumentos y métricas

  • Twenty-one human Likert instruments totaling 777 items and 112 subcategories
  • Lightweight role-playing prompt requesting genuine feelings and thoughts
  • Direct no-prefix baseline
  • Base64 and ROT3 Caesar format-transcoding controls
  • STAN jailbreak role-playing control
  • GPT-4o validity audit of score and explanation consistency
  • Valid-response rate
  • Prompt-versus-baseline score-difference formula normalized by scale maximum
  • Language-versus-English score-difference formula normalized by scale maximum
  • Five repeated API administrations at temperature zero
  • Microsoft Azure AI Translator plus sampled cross-check by two researchers

Datos utilizados

  • AIPsychoBench paper corpus: 21 scales, 777 English-source items, 112 subcategories, six domains
  • Eight language conditions: English, Chinese, French, Russian, German, Spanish, Arabic and Japanese
  • Official repository questionnaires_en.json: 22 questionnaires and 963 items because it adds a 186-item MBTI not counted in the paper
  • Official repository generated files: complete English source, partial Chinese/Arabic default subsets and partial German/English LRP subsets, not the complete eight-language benchmark
  • Only one committed output set: German BFI with GPT-4o under LRP, 44 items and 42 parser-valid responses
  • No public six-model five-repeat raw output matrix or derived analysis dataset

Evidencia y localización

  • Definitive title, authors, journal, dates, page and word counts: Topics in Cognitive Science XML front matter, DOI 10.1111/tops.70041; PMCID PMC13102275
  • Twenty-one scales, 777 items, 112 subcategories and six domains: Section 2.1, Psychometric scale collection
  • Lightweight prompt and authentic-emotions caveat: Section 2.2 and Note 2
  • Translation protocol and eight languages: Section 2.3, Multilingual translation
  • GPT-4o audit model and validity filtering: Section 2.4, Analysis and statistics
  • Models, temperature zero and five repetitions: Section 3, Experiment
  • Valid-response rates and independently checked averages: Table 1 and Findings 1–4
  • Intersection-selected prompt bias formula and 4 percent threshold: Formula 1, Figure 3 and Findings 5–6
  • Language deviation formula and reported examples: Formula 2, Figure 4 and Finding 7
  • No human comparison or psychometric validation analyses: Complete 16-page article; methods and results contain no human sample, reliability, factor or invariance analysis
  • RTC original source correction: Repository questionnaire metadata and Appendix A compared with Oreg, Journal of Applied Psychology 88(4), 680–693, DOI 10.1037/0021-9010.88.4.680
  • ZNPQ identity correction: Repository items/categories and Appendix A compared with Zi's Negative Perfectionism Scale, DOI 10.2174/978160805186111001010018
  • Missing ResultManager, reverse-scoring omission and EPQ-R bound bug: Official repository commit d4759bff: example_generator.py lines 15 and 443–451; questionnaires_en.json reverse fields and EPQ-R scale
  • Incomplete released translations, outputs and analysis: Complete file tree of official repository commit d4759bff; 19 tracked files and one German BFI result
  • Visual inspection: All eight pages of arXiv:2509.16530v1 and all four definitive article figures rendered or opened and visually inspected on 15 July 2026