Comparing chatbots to psychometric tests in hiring compara una evaluación conversacional de Big Five con un cuestionario tradicional y pregunta si el chatbot ofrece validez psicométrica, menor susceptibilidad a deseabilidad social y asociación con resultados profesionales. No estudia una personalidad interna del LLM: un sistema comercial basado en OpenAI puntúa respuestas de personas. El diseño es transversal y cuasiexperimental. De 264 personas que iniciaron la encuesta, 159 completaron también el chatbot: 114 controles y 45 candidatos. Los 45 candidatos proceden de un único banco, dos sesiones de una hora y dos puestos; los controles proceden de clientes o prospectos de Recrewty y LinkedIn, con sectores variados. Antes del matching, candidatos y controles difieren en edad, educación, nivel profesional e industria. Los autores prueban varios métodos de propensity-score matching y eligen caliper 0,25, que conserva 33 parejas, N=66. El sistema se construyó en Fabrile con Ingram, Recrewty y los autores. El artículo lo llama 'ChatGPT 4.0 API', dice que fue fine-tuned con datos existentes y el suplemento revela que disponía de medias y desviaciones de rasgos/facetas previas. No identifica modelo/API exactos, snapshot, system prompt, rúbrica de scoring, dataset de fine-tuning, separación train/evaluación, temperatura, seed, retries ni pipeline. Formula al menos 15 preguntas, una por faceta, con follow-up opcional. Las preguntas publicadas son transparentes y dirigidas: piden recordar cuándo la persona ayudó, terminó una tarea, fue responsable, sintió ansiedad o resolvió algo creativamente. Por eso no demuestran extracción encubierta de patrones auténticos ni resistencia a gaming. Como benchmarks se usan un Big Five plus Two serbio corto de 50 ítems y Marlowe-Crowne de 13 ítems. Hay 21 valores ausentes imputados con la media del ítem. El CFA del cuestionario Big Five, con solo 159 casos y 50 ítems, da CFI 0,705 y TLI 0,690, aunque el paper lo llama aceptable apoyándose en RMSEA 0,074 y GFI 0,968. El CFA del chatbot sobre 15 facetas da CFI 0,905, TLI 0,875, RMSEA 0,078 y GFI 0,880. La fiabilidad es buena para Extraversión (alpha 0,80) y Neuroticismo (0,85), baja para Amabilidad (0,58) y modesta para Responsabilidad (0,67) y Apertura (0,64). La convergencia con el test tradicional es r=0,443 para Extraversión, 0,449 para Responsabilidad, 0,362 para Apertura, 0,256 para Amabilidad y solo 0,089 no significativa para Neuroticismo. La validez discriminante falla: AI-Amabilidad correlaciona más con Extraversión tradicional (0,342) y Neuroticismo (-0,272) que con Amabilidad (0,256), y hay más cruces. La llamada validez sustantiva usa correlaciones faceta-total donde el total incluye la misma faceta y discriminación por grupos extremos definidos con ese composite; son pruebas circulares/part-whole, no validación independiente de contenido. Los scores AI no predicen ni añaden valor útil para educación o nivel de puesto. Además, educación y job level son datos concurrentes, no desempeño futuro, decisión de contratación, retención o evaluación de supervisor; llamarlos predictive validity o real-world outcomes exagera el criterio. El claim principal de menor deseabilidad social no queda demostrado. En las 33 parejas, algunos tests tradicionales cambian entre candidatos y controles y las cinco regresiones AI no son significativas. Pero significativo en un método y no significativo en otro no prueba que los efectos difieran. No hay interacción tratamiento×método, test formal de diferencia, equivalencia/no inferioridad, potencia para aceptar el null ni un indicador común de deseabilidad social aplicado a ambos. Marlowe-Crowne solo se mide como cuestionario humano; para AI se infiere bias a partir de diferencias en Big Five. Los efectos AI son muy imprecisos: estimación(SE) -0,133(4,643) Apertura, 0,007(1,976) Responsabilidad, -2,405(2,702) Extraversión, 1,817(1,754) Amabilidad y 2,675(10,236) Neuroticismo. Sus intervalos aproximados permiten efectos relevantes en ambas direcciones. Tampoco se aísla el contexto de selección: todos los candidatos comparten banco, roles, sesiones, recruiter y fuente, mientras los controles no. Los scores AI de O/C/E/A tienen medias 73,7-80,5, fuerte sesgo negativo y techo cercano a 90; esa compresión, quizá influida por priors no documentados, puede ocultar diferencias. La auditoría descubre contradicciones publicadas que bloquean una lectura de significación fiable. Openness aparece con 0,448 y SE 0,597 pero lleva asterisco p<0,05, aritméticamente incompatible. El HAC 0,640(SE 0,173) está bajo la columna Amabilidad aunque el texto lo llama Extraversión. La tabla de educación AI muestra Apertura 0,05138(SE 0,02374), ratio ~2,16, aunque el texto dice que todo es no significativo. El suplemento imprime Shapiro-Wilk W=2,038, imposible porque W<=1; el modelo de nivel laboral da treatment -19,720 con SE 1511; y la figura captioned Neuroticism contiene el título interno Extraversion_AI. Sin datos ni código no puede resolverse cuál resultado es correcto. No se encontró repositorio, dataset, scripts, prompts o release reproducible específico del artículo en la página oficial ni en búsquedas públicas dirigidas de GitHub, OSF y Zenodo. El data statement solo promete disponibilidad bajo petición y parte del sistema permanece propietaria. La conclusión fiel es más limitada: en esta muestra pequeña no se detectó una diferencia candidato-control en los cinco scores AI y el chatbot no mostró validez predictiva/incremental; sí hubo convergencia moderada para algunas dimensiones y fallos claros para otras. No se demuestra reducción de bias. Antes de uso laboral hacen falta modelo/prompt/scoring congelados e inspeccionables, preregistro, manipulación within-person o randomización multi-sede, medida común directa de faking, interacción y equivalence tests, inferencia por parejas/sedes, outcomes prospectivos de desempeño, invariance/test-retest/subgrupos/adverse impact y artefactos reproducibles.
Pregunta de investigación
¿Puede un chatbot basado en LLM inferir facetas Big Five con estructura, contenido y validez externa aceptables, predecir resultados profesionales y mostrar menor distorsión por deseabilidad social que un cuestionario tradicional en un contexto de selección?