Este estudio evalúa si GPT-3.5 y GPT-4 pueden puntuar personalidad y desempeño de entrevista a partir de respuestas obtenidas en entrevistas de vídeo asíncronas. Aunque el título habla de vídeo, los modelos solo reciben transcripciones producidas por Google Speech-to-Text, las preguntas y, en la condición principal, información sobre el factor o la faceta que activa cada pregunta. La muestra final comprende 685 participantes que respondieron ocho preguntas para cuatro facetas de Extraversión y cuatro de Responsabilidad/Conscientiousness en una vacante ficticia de management trainee. Como criterios se usan el HEXACO-60 autorreportado, puntuaciones de cuatro observadores entrenados y cinco valoraciones de entrevista realizadas por dos reclutadores por persona. Un modelo supervisado BoW-SBERT entrenado con validación cruzada de diez pliegues sirve de comparación.
El resultado positivo se concentra en la Extraversión aparente. Frente a observadores, GPT-4 alcanza R²=0,53 y GPT-3.5 R²=0,40, por encima del 0,36 de BoW-SBERT; GPT-4 también obtiene R² entre 0,32 y 0,61 en las cuatro facetas de Extraversión. La imagen cambia para Conscientiousness: GPT-4 explica 0,11 y GPT-3.5 0,08 de la varianza observada, frente a 0,23 del baseline; ambos LLM quedan por debajo de cero contra el autoinforme y también fallan en Prudence y Perfectionism. Más importante para contratación, todos los R² de las cuatro competencias y de la puntuación global de entrevista son negativos: los modelos rinden peor que asignar la media.
La fiabilidad se mide únicamente con correlación de Pearson. Al repetir exactamente el mismo texto, GPT-4 obtiene r=0,79 en Extraversión, 0,61 en Conscientiousness y 0,83 en entrevista; con una nueva entrevista 7-24 meses después, baja a 0,59, 0,39 y 0,85. Estas correlaciones no prueban acuerdo absoluto y la última mezcla inestabilidad del instrumento con cambios reales en las respuestas. Subir la temperatura eleva ligeramente el R² de Extraversión y reduce con fuerza la consistencia. Las puntuaciones están comprimidas y sesgadas hacia valores altos. El análisis de fairness compara diferencias por género y correlaciones con edad, educación y atractivo, pero no estudia invariancia de medida, igualdad del error, predicción diferencial ni impacto adverso; una asociación menor que la de observadores no basta para demostrar equidad.
La simulación de selección tampoco valida su uso. La magnitud llamada «accuracy» es en realidad recall o tasa de verdaderos positivos, y los empates permiten seleccionar más de K personas; al aumentar K, el solapamiento sube mecánicamente. No hay baseline aleatorio, especificidad, utilidad ni resultados laborales posteriores. La similitud semántica entre explicaciones y ítems HEXACO es asimismo relativa y parcialmente circular: el prompt revela los constructos y normaliza las distancias dentro de cada explicación.
La prepublicación enlaza un repositorio público con 11.522 respuestas textuales y ficheros de predicción en el commit b2a3a70, una aportación de transparencia real. Sin embargo, no contiene el código de llamadas a OpenAI, identificadores exactos de modelo, mensajes completos, baseline BoW-SBERT, análisis de temperatura/selección ni modelos mixtos. No hay README, licencia, dependencias, tests o CI; los pickles antiguos fallan con pandas 2.2.3. El único script lingüístico tiene rutas y variables rotas y no puede producir la figura publicada. Además, sus 685 identificadores enlazan directamente con un CSV de 710 filas que incluye demografía y puntuaciones psicométricas, sin una nota de gobernanza de reutilización.
La conclusión fiel es limitada pero útil: el GPT-4 histórico aproximó bien la Extraversión aparente a partir de texto en este escenario, pero no validó una evaluación general de personalidad ni decisiones de empleo. Conscientiousness, validez para desempeño, acuerdo de las puntuaciones, fairness y utilidad operativa quedan débiles o sin establecer. El propio estudio aporta evidencia en contra del despliegue directo: alta consistencia de la entrevista puede coexistir con R² negativo.