Comparing chatbots to psychometric tests in hiring: reduced social desirability bias, but lower predictive validity

Aplicaciones, sesgos y seguridad2025Frontiers (Psychology)Revisión editorial aprobada

Autores: Danilo Dukanovic, Dario Krpan

Palabras clave: AI personality assessment, Hiring, Chatbots, Big Five, Social desirability bias, Psychometric validity, Predictive validity, Propensity score matching, Algorithmic hiring, Reproducibility

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
20
Hallazgos
45
Limitaciones
13
Evidencias

Resumen editorial

Español

Comparing chatbots to psychometric tests in hiring compara una evaluación conversacional de Big Five con un cuestionario tradicional y pregunta si el chatbot ofrece validez psicométrica, menor susceptibilidad a deseabilidad social y asociación con resultados profesionales. No estudia una personalidad interna del LLM: un sistema comercial basado en OpenAI puntúa respuestas de personas. El diseño es transversal y cuasiexperimental. De 264 personas que iniciaron la encuesta, 159 completaron también el chatbot: 114 controles y 45 candidatos. Los 45 candidatos proceden de un único banco, dos sesiones de una hora y dos puestos; los controles proceden de clientes o prospectos de Recrewty y LinkedIn, con sectores variados. Antes del matching, candidatos y controles difieren en edad, educación, nivel profesional e industria. Los autores prueban varios métodos de propensity-score matching y eligen caliper 0,25, que conserva 33 parejas, N=66. El sistema se construyó en Fabrile con Ingram, Recrewty y los autores. El artículo lo llama 'ChatGPT 4.0 API', dice que fue fine-tuned con datos existentes y el suplemento revela que disponía de medias y desviaciones de rasgos/facetas previas. No identifica modelo/API exactos, snapshot, system prompt, rúbrica de scoring, dataset de fine-tuning, separación train/evaluación, temperatura, seed, retries ni pipeline. Formula al menos 15 preguntas, una por faceta, con follow-up opcional. Las preguntas publicadas son transparentes y dirigidas: piden recordar cuándo la persona ayudó, terminó una tarea, fue responsable, sintió ansiedad o resolvió algo creativamente. Por eso no demuestran extracción encubierta de patrones auténticos ni resistencia a gaming. Como benchmarks se usan un Big Five plus Two serbio corto de 50 ítems y Marlowe-Crowne de 13 ítems. Hay 21 valores ausentes imputados con la media del ítem. El CFA del cuestionario Big Five, con solo 159 casos y 50 ítems, da CFI 0,705 y TLI 0,690, aunque el paper lo llama aceptable apoyándose en RMSEA 0,074 y GFI 0,968. El CFA del chatbot sobre 15 facetas da CFI 0,905, TLI 0,875, RMSEA 0,078 y GFI 0,880. La fiabilidad es buena para Extraversión (alpha 0,80) y Neuroticismo (0,85), baja para Amabilidad (0,58) y modesta para Responsabilidad (0,67) y Apertura (0,64). La convergencia con el test tradicional es r=0,443 para Extraversión, 0,449 para Responsabilidad, 0,362 para Apertura, 0,256 para Amabilidad y solo 0,089 no significativa para Neuroticismo. La validez discriminante falla: AI-Amabilidad correlaciona más con Extraversión tradicional (0,342) y Neuroticismo (-0,272) que con Amabilidad (0,256), y hay más cruces. La llamada validez sustantiva usa correlaciones faceta-total donde el total incluye la misma faceta y discriminación por grupos extremos definidos con ese composite; son pruebas circulares/part-whole, no validación independiente de contenido. Los scores AI no predicen ni añaden valor útil para educación o nivel de puesto. Además, educación y job level son datos concurrentes, no desempeño futuro, decisión de contratación, retención o evaluación de supervisor; llamarlos predictive validity o real-world outcomes exagera el criterio. El claim principal de menor deseabilidad social no queda demostrado. En las 33 parejas, algunos tests tradicionales cambian entre candidatos y controles y las cinco regresiones AI no son significativas. Pero significativo en un método y no significativo en otro no prueba que los efectos difieran. No hay interacción tratamiento×método, test formal de diferencia, equivalencia/no inferioridad, potencia para aceptar el null ni un indicador común de deseabilidad social aplicado a ambos. Marlowe-Crowne solo se mide como cuestionario humano; para AI se infiere bias a partir de diferencias en Big Five. Los efectos AI son muy imprecisos: estimación(SE) -0,133(4,643) Apertura, 0,007(1,976) Responsabilidad, -2,405(2,702) Extraversión, 1,817(1,754) Amabilidad y 2,675(10,236) Neuroticismo. Sus intervalos aproximados permiten efectos relevantes en ambas direcciones. Tampoco se aísla el contexto de selección: todos los candidatos comparten banco, roles, sesiones, recruiter y fuente, mientras los controles no. Los scores AI de O/C/E/A tienen medias 73,7-80,5, fuerte sesgo negativo y techo cercano a 90; esa compresión, quizá influida por priors no documentados, puede ocultar diferencias. La auditoría descubre contradicciones publicadas que bloquean una lectura de significación fiable. Openness aparece con 0,448 y SE 0,597 pero lleva asterisco p<0,05, aritméticamente incompatible. El HAC 0,640(SE 0,173) está bajo la columna Amabilidad aunque el texto lo llama Extraversión. La tabla de educación AI muestra Apertura 0,05138(SE 0,02374), ratio ~2,16, aunque el texto dice que todo es no significativo. El suplemento imprime Shapiro-Wilk W=2,038, imposible porque W<=1; el modelo de nivel laboral da treatment -19,720 con SE 1511; y la figura captioned Neuroticism contiene el título interno Extraversion_AI. Sin datos ni código no puede resolverse cuál resultado es correcto. No se encontró repositorio, dataset, scripts, prompts o release reproducible específico del artículo en la página oficial ni en búsquedas públicas dirigidas de GitHub, OSF y Zenodo. El data statement solo promete disponibilidad bajo petición y parte del sistema permanece propietaria. La conclusión fiel es más limitada: en esta muestra pequeña no se detectó una diferencia candidato-control en los cinco scores AI y el chatbot no mostró validez predictiva/incremental; sí hubo convergencia moderada para algunas dimensiones y fallos claros para otras. No se demuestra reducción de bias. Antes de uso laboral hacen falta modelo/prompt/scoring congelados e inspeccionables, preregistro, manipulación within-person o randomización multi-sede, medida común directa de faking, interacción y equivalence tests, inferencia por parejas/sedes, outcomes prospectivos de desempeño, invariance/test-retest/subgrupos/adverse impact y artefactos reproducibles.

English

Comparing chatbots to psychometric tests in hiring compares a conversational Big Five assessment with a traditional questionnaire and asks whether the chatbot offers psychometric validity, reduced susceptibility to social desirability, and association with professional outcomes. It does not study a personality inside the LLM: a commercial OpenAI-based system scores human responses. The design is cross-sectional and quasi-experimental. Of 264 people entering the survey, 159 also completed the chatbot: 114 controls and 45 candidates. All 45 candidates came from one bank, two one-hour sessions and two roles; controls came from Recrewty clients or prospects and LinkedIn across multiple sectors. Before matching, groups differed in age, education, job level and industry. The authors explore several propensity-score methods and select a 0.25 caliper retaining 33 pairs, N=66. The system was built on Fabrile with Ingram, Recrewty and the authors. The article calls it a 'ChatGPT 4.0 API', says it was fine-tuned with existing data, and the supplement reveals that it had prior trait/facet means and standard deviations. It does not identify the exact API model, snapshot, system/scoring prompt, scoring rubric, fine-tuning dataset, training/evaluation separation, temperature, seed, retry policy or pipeline. It asks at least 15 questions, one per facet, with optional follow-ups. The published questions are transparent and leading: they ask when a person helped someone, completed a task, behaved responsibly, felt anxious or solved something creatively. They therefore do not demonstrate covert extraction of authentic patterns or resistance to gaming. Benchmarks are a 50-item Serbian Big Five plus Two short form and a 13-item Marlowe-Crowne scale. Twenty-one missing item responses are mean-imputed. The questionnaire Big Five CFA, using only 159 cases for 50 items, yields CFI 0.705 and TLI 0.690, although the paper calls it acceptable by emphasizing RMSEA 0.074 and GFI 0.968. The chatbot CFA over 15 facets yields CFI 0.905, TLI 0.875, RMSEA 0.078 and GFI 0.880. Reliability is good for Extraversion (alpha 0.80) and Neuroticism (0.85), poor for Agreeableness (0.58), and modest for Conscientiousness (0.67) and Openness (0.64). Convergence with traditional tests is r=0.443 for Extraversion, 0.449 for Conscientiousness, 0.362 for Openness, 0.256 for Agreeableness and only 0.089, non-significant, for Neuroticism. Discriminant validity is problematic: AI Agreeableness correlates more with traditional Extraversion (0.342) and Neuroticism (-0.272) than with Agreeableness (0.256), with other cross-trait associations. Claimed substantive validity uses facet-total correlations where the total contains that facet and extreme-group discrimination defined by the same composite; these are circular part-whole checks, not independent content validation. AI scores provide no useful prediction or incremental value for education or job level. Education and job level are concurrent demographics, not future performance, hiring decisions, retention or supervisor ratings; calling them predictive validity or real-world outcomes overstates the criterion. The headline lower-social-desirability claim is not established. Within 33 matched pairs, some traditional-test outcomes differ between candidates and controls while all five AI regressions are non-significant. But significance in one method and non-significance in another does not show that effects differ. There is no treatment-by-method interaction, formal difference test, equivalence/non-inferiority test, power for accepting the null, or shared social-desirability indicator applied to both. Marlowe-Crowne is only measured as a human questionnaire; AI bias is inferred from Big Five group differences. AI effects are highly imprecise: estimate(SE) -0.133(4.643) for Openness, 0.007(1.976) for Conscientiousness, -2.405(2.702) for Extraversion, 1.817(1.754) for Agreeableness and 2.675(10.236) for Neuroticism. Approximate intervals allow meaningful effects in either direction. Selection context is not isolated: every candidate shares bank, roles, sessions, recruiter and source, unlike controls. AI O/C/E/A means are 73.7-80.5 with strong negative skew and ceilings near 90; such compression, potentially influenced by undocumented priors, can hide group differences. The audit also finds published contradictions that block reliable significance interpretation. Openness is printed as 0.448 with SE 0.597 yet marked p<0.05, which is arithmetically incompatible. HAC 0.640(SE 0.173) appears under Agreeableness while prose calls it Extraversion. The AI education table shows Openness 0.05138(SE 0.02374), ratio about 2.16, while prose says every effect is non-significant. The supplement prints impossible Shapiro-Wilk W=2.038; the job-level model reports treatment -19.720 with SE 1511; and a figure captioned Neuroticism has an internal Extraversion_AI title. Without data or code, the correct results cannot be recovered. No article-specific repository, dataset, scripts, prompts or reproducible release was found on the official page or in targeted public GitHub, OSF and Zenodo searches. The data statement only promises access on request and part of the system remains proprietary. The faithful conclusion is narrower: this small sample detected no candidate-control difference in five AI scores and found no predictive or incremental AI validity, with moderate convergence for selected dimensions and clear failures for others. It does not show reduced bias. Employment use would require a frozen inspectable model/prompt/scoring specification, preregistration, within-person manipulation or multi-site randomization, a common direct faking measure, interaction and equivalence tests, pair/site-aware inference, prospective performance outcomes, invariance/test-retest/subgroup/adverse-impact studies, and reproducible artifacts.

Pregunta de investigación

¿Puede un chatbot basado en LLM inferir facetas Big Five con estructura, contenido y validez externa aceptables, predecir resultados profesionales y mostrar menor distorsión por deseabilidad social que un cuestionario tradicional en un contexto de selección?

Método

Estudio transversal cuasiexperimental de 159 personas que completan un Big Five serbio de 50 ítems, Marlowe-Crowne de 13 ítems y un chatbot Fabrile/OpenAI con 15 preguntas abiertas dirigidas a facetas. Se aplican CFA, alpha, correlaciones faceta-total y AI-test, tests demográficos, regresiones multinomiales/logísticas y propensity-score matching. Para H2 se eligen 33 parejas con caliper 0,25 y se comparan por regresiones separadas scores tradicionales y AI con covariables. La auditoría leyó y renderizó las 17 páginas del VOR y las 21 del suplemento oficial, verificó preguntas, tablas, aritmética, alcance de constructos, confusión, reproducibilidad y disponibilidad pública de código/datos.

Muestra: 264 personas iniciaron la encuesta y 159 terminaron el chatbot, por lo que se excluyen 105 (39,8 %) sin análisis de attrition: 114 controles y 45 candidatos. Todos los candidatos son de un banco y dos sesiones para Director of Exposition y Affluent Associate. El matching final retiene 33 pares, N=66. Los grupos iniciales difieren en edad, educación, nivel de puesto e industria. Hay 21 respuestas de ítem imputadas con media y siete edades reconstruidas desde año de nacimiento.

Hallazgos

  • El CFA Big Five tradicional reporta CFI 0,705 y TLI 0,690, muy bajos pese a la interpretación favorable del paper.
  • El CFA chatbot reporta CFI 0,905, TLI 0,875, RMSEA 0,078 y GFI 0,880.
  • Alpha es 0,80 para Extraversión y 0,85 para Neuroticismo, pero 0,58 para Amabilidad, 0,67 para Responsabilidad y 0,64 para Apertura.
  • La convergencia AI-test es moderada para E 0,443, C 0,449 y O 0,362, débil para A 0,256 y ausente para N 0,089.
  • AI-Amabilidad correlaciona más con Extraversión 0,342 y Neuroticismo -0,272 que con Amabilidad 0,256.
  • Las correlaciones faceta-total de substantive validity contienen la faceta en el total y están infladas por part-whole.
  • Los AI scores no aportan validez incremental útil para educación o nivel profesional.
  • Educación y nivel de puesto son criterios concurrentes, no outcomes futuros de desempeño o contratación.
  • En las 33 parejas no se detectan diferencias significativas en los cinco scores AI.
  • No se prueba que los efectos tratamiento difieran entre AI y tests tradicionales.
  • No se realiza equivalence testing ni se mide deseabilidad social directamente en el chatbot.
  • Los intervalos implícitos de los efectos AI son amplios y admiten diferencias prácticamente relevantes.
  • Todos los candidatos de un solo banco dejan selección confundida con organización, roles, sesiones y fuente.
  • Las preguntas chatbot son explícitas y socialmente transparentes, por lo que pueden ser gameadas.
  • Los scores AI presentan medias altas y techo, posible explicación alternativa del null entre grupos.
  • Varias tablas contradicen texto, asteriscos o identidad de trait; una estadística W es imposible.
  • No se publica modelo exacto, prompts/scoring, fine-tuning data, parámetros, código ni raw data.
  • No se encontró artefacto reproducible público específico del artículo al 16 de julio de 2026.
  • El resultado negativo sobre validez predictiva/incremental es informativo y debe conservarse sin convertir el null de bias en evidencia positiva.
  • El estudio evalúa scores de humanos mediados por AI, no personalidad interna del LLM.

Limitaciones

  • Diseño transversal y no aleatorizado.
  • Solo 45 candidatos y 33 pares en H2.
  • Todos los candidatos pertenecen a un banco, dos sesiones y dos roles.
  • Control reclutado por fuentes y sectores diferentes.
  • Matching no elimina confusión por banco, site, recruiter, sesión o rol.
  • El caliper se elige tras explorar alternativas y conservar el N recomendado.
  • No hay preregistro ni análisis confirmatorio separado.
  • Se infiere diferencia entre métodos a partir de patrones de significación separados.
  • Falta interacción tratamiento por método o test directo de coeficientes.
  • Falta equivalence/non-inferiority testing para los nulls AI.
  • No hay medida Marlowe-Crowne o faking común aplicada al output AI.
  • Los intervalos de tratamiento AI son muy amplios.
  • Ceiling y skew en scores AI pueden ocultar diferencias.
  • Priors de media/SD entran al chatbot de forma no documentada.
  • Preguntas revelan la faceta y presuponen conductas deseables.
  • No hay modelo exacto ni snapshot de API.
  • No hay system/scoring prompt, rúbrica ni parámetros de sampling.
  • Fine-tuning dataset y separación train/test no se describen.
  • No se evalúa estabilidad estocástica, test-retest o cambio de versión.
  • CFA tradicional tiene CFI/TLI muy pobres.
  • CFA chatbot tiene TLI/GFI por debajo de 0,90.
  • Fiabilidad baja/modesta en tres de cinco traits AI.
  • Validez discriminante deficiente.
  • Neuroticismo carece de convergencia.
  • Facet-total y extreme groups son circulares.
  • Educación/job level no son job performance futuro.
  • No hay outcomes de contratación, supervisor, productividad, retención o adverse impact.
  • 105 de 264 no completan chatbot y no hay análisis de attrition.
  • Se imputan 21 missing values con medias sin sensitivity analysis.
  • Regresiones N=66 incluyen múltiples covariables y pueden estar sobreajustadas.
  • No se reporta inferencia cluster/pair-aware tras matching.
  • Durbin-Watson/HAC sobre filas cross-sectional no ataca la dependencia natural de pares/site.
  • No hay corrección por multiplicidad.
  • Asterisco de Openness 0,448/SE 0,597 es incompatible con p<0,05.
  • HAC 0,640 aparece en columna A pero texto lo atribuye a E.
  • AI Openness educación 0,05138/SE 0,02374 contradice la afirmación all non-significant.
  • Shapiro-Wilk W=2,038 es imposible.
  • Job-level treatment SE=1511 indica modelo inestable/separado.
  • Figura Neuroticism lleva título interno Extraversion_AI.
  • Raw data, transcripts, código, prompts y release no están enlazados.
  • El data statement es disponibilidad futura bajo petición, no release persistente.
  • La primera autoría tiene conflicto comercial declarado con Recrewty.
  • Parte del método/producto permanece propietaria.
  • No hay replicación independiente, multi-site ni validación externa.
  • No se estudia fairness por género, edad, educación, idioma u otros subgrupos.

Qué no demuestra

  • No demuestra que el chatbot reduzca deseabilidad social o faking.
  • No demuestra que el efecto de selección sea menor en AI que en cuestionarios.
  • No demuestra diferencia estadística entre ambos métodos.
  • No demuestra equivalencia entre candidatos y controles.
  • No demuestra causalidad del contexto de selección.
  • No separa banco, puesto, sesión, recruiter y fuente del tratamiento.
  • No demuestra validez predictiva para desempeño laboral futuro.
  • No demuestra validez y fiabilidad aceptables en los cinco traits.
  • No demuestra resistencia a gaming de preguntas transparentes.
  • No aporta validación de contenido independiente.
  • No permite reproducir el scoring del chatbot.
  • No permite decidir qué versión contradictoria de los resultados es correcta.
  • No demuestra disponibilidad pública de datos/código.
  • No generaliza más allá del banco, roles, lengua, región y sistema evaluados.
  • No demuestra fairness o ausencia de adverse impact.
  • No demuestra personalidad, rasgo estable o estado mental dentro del LLM.

Trazabilidad

Alcance: Texto completo

Versión: Frontiers in Psychology version of record, volume 16 article 1564979, published 25 April 2025; audited with the official supplementary DOCX rendered to 21 pages; public code, data and model-artifact searches completed 16 July 2026

Fuente consultada: https://doi.org/10.3389/fpsyg.2025.1564979

Revisión: Codex complete bilingual fidelity pass using the full 17-page Frontiers version of record and official supplementary DOCX rendered to 21 pages, complete all-page visual inspection, DOI and metadata verification, question/transcript/table/arithmetic/construct audit, causal and statistical review of the social-desirability claim, and targeted public code/data/model-artifact searches; summaries written from full evidence rather than abstract keywords, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Unspecified OpenAI model described as ChatGPT 4.0 API
  • Custom Fabrile chatbot developed with Ingram Technologies and Recrewty
  • Five-factor confirmatory factor analysis with MLR
  • Multinomial logistic regression
  • Binary logistic regression
  • Ordinary linear regression
  • HAC standard-error regression
  • Robust regression using robustbase
  • Propensity-score matching with nearest-neighbor, caliper, full and optimal variants

Instrumentos y métricas

  • 50-item Serbian Big Five plus Two short form
  • 13-item short Marlowe-Crowne Social Desirability Scale
  • 15 chatbot Big Five facet questions with optional follow-ups
  • Confirmatory factor analysis
  • Cronbach alpha
  • Facet-total correlation
  • Extreme-group discrimination index
  • Convergent and discriminant correlation matrix
  • Education and dichotomized job level as concurrent criteria
  • Propensity-score matching
  • Shapiro-Wilk, Mardia, Durbin-Watson and VIF diagnostics

Datos utilizados

  • Study survey and chatbot responses: 159 completers from Serbia and Montenegro; not publicly linked
  • Professional-selection group: 45 candidates from one bank, two sessions and two roles
  • Control group: 114 professionals recruited through Recrewty contacts and LinkedIn
  • Matched analysis subset: 33 treated-control pairs, N=66
  • Prior Big Five facet means and standard deviations from Smederevac/Colovic-related work supplied to the chatbot; exact scoring use not documented
  • Official supplementary DOCX with questions, one transcript, tables and figures

Evidencia y localización

  • Metadatos, abstract, pregunta y claims principales: Frontiers in Psychology version of record pages 1-4; DOI 10.3389/fpsyg.2025.1564979
  • Chatbot, preguntas por faceta, modelo ambiguo y fine-tuning: Version of record pages 5-6; official supplement rendered pages 4-13
  • Muestra, un banco, dos sesiones y attrition: Version of record pages 6-8; Table 1 and Procedure
  • CFA y fiabilidad tradicional/chatbot: Version of record pages 8-10; Tables 2, 4 and 5
  • Convergencia, discriminación y validez externa: Version of record pages 9-11; Tables 6-8
  • Propensity matching y balance: Version of record pages 11-12; Tables 9-11
  • Regresiones tradicionales, HAC y contradicción de trait: Version of record pages 12-13, Table 12; official supplement rendered page 17, Table 7
  • Nulls AI y amplitud de error estándar: Version of record page 13; official supplement rendered pages 17-18, Table 8
  • Errores de tablas, W imposible, modelo inestable y figura mal rotulada: Official supplement rendered pages 14-21, Tables 2-8 and Figures 1-5
  • Limitaciones, datos, conflicto y material propietario: Version of record pages 15-16, Limitations, Data availability and Conflict of interest
  • Búsqueda de reproducibilidad pública: Official article links plus targeted GitHub, OSF and Zenodo searches completed 16 July 2026; no article-specific reproducible release found
  • Informe integral de validez y reproducibilidad: reports/verification/article-208-chatbot-hiring-bias-validity-and-reproducibility-audit.json
  • Inspección visual completa: All 17 version-of-record pages and all 21 pages rendered from the official supplementary DOCX visually inspected on 16 July 2026