Can Large Language Models Assess Personality From Asynchronous Video Interviews? A Comprehensive Evaluation of Validity, Reliability, Fairness, and Rating Patterns

Evaluación y validez psicométrica2024IEEE XploreRevisión editorial aprobada

Autores: Tianyi Zhang, Antonis Koutsoumpis, Janneke K. Oostrom, Djurre Holtrop, Sina Ghassemi, Reinout E. de Vries

Palabras clave: GPT-3.5, GPT-4, Asynchronous Video Interviews, HEXACO, Personality Assessment, Personnel Selection, Psychometric Validity, Reliability, Fairness, Reproducibility

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
16
Hallazgos
26
Limitaciones
13
Evidencias

Resumen editorial

Español

Este estudio evalúa si GPT-3.5 y GPT-4 pueden puntuar personalidad y desempeño de entrevista a partir de respuestas obtenidas en entrevistas de vídeo asíncronas. Aunque el título habla de vídeo, los modelos solo reciben transcripciones producidas por Google Speech-to-Text, las preguntas y, en la condición principal, información sobre el factor o la faceta que activa cada pregunta. La muestra final comprende 685 participantes que respondieron ocho preguntas para cuatro facetas de Extraversión y cuatro de Responsabilidad/Conscientiousness en una vacante ficticia de management trainee. Como criterios se usan el HEXACO-60 autorreportado, puntuaciones de cuatro observadores entrenados y cinco valoraciones de entrevista realizadas por dos reclutadores por persona. Un modelo supervisado BoW-SBERT entrenado con validación cruzada de diez pliegues sirve de comparación.

El resultado positivo se concentra en la Extraversión aparente. Frente a observadores, GPT-4 alcanza R²=0,53 y GPT-3.5 R²=0,40, por encima del 0,36 de BoW-SBERT; GPT-4 también obtiene R² entre 0,32 y 0,61 en las cuatro facetas de Extraversión. La imagen cambia para Conscientiousness: GPT-4 explica 0,11 y GPT-3.5 0,08 de la varianza observada, frente a 0,23 del baseline; ambos LLM quedan por debajo de cero contra el autoinforme y también fallan en Prudence y Perfectionism. Más importante para contratación, todos los R² de las cuatro competencias y de la puntuación global de entrevista son negativos: los modelos rinden peor que asignar la media.

La fiabilidad se mide únicamente con correlación de Pearson. Al repetir exactamente el mismo texto, GPT-4 obtiene r=0,79 en Extraversión, 0,61 en Conscientiousness y 0,83 en entrevista; con una nueva entrevista 7-24 meses después, baja a 0,59, 0,39 y 0,85. Estas correlaciones no prueban acuerdo absoluto y la última mezcla inestabilidad del instrumento con cambios reales en las respuestas. Subir la temperatura eleva ligeramente el R² de Extraversión y reduce con fuerza la consistencia. Las puntuaciones están comprimidas y sesgadas hacia valores altos. El análisis de fairness compara diferencias por género y correlaciones con edad, educación y atractivo, pero no estudia invariancia de medida, igualdad del error, predicción diferencial ni impacto adverso; una asociación menor que la de observadores no basta para demostrar equidad.

La simulación de selección tampoco valida su uso. La magnitud llamada «accuracy» es en realidad recall o tasa de verdaderos positivos, y los empates permiten seleccionar más de K personas; al aumentar K, el solapamiento sube mecánicamente. No hay baseline aleatorio, especificidad, utilidad ni resultados laborales posteriores. La similitud semántica entre explicaciones y ítems HEXACO es asimismo relativa y parcialmente circular: el prompt revela los constructos y normaliza las distancias dentro de cada explicación.

La prepublicación enlaza un repositorio público con 11.522 respuestas textuales y ficheros de predicción en el commit b2a3a70, una aportación de transparencia real. Sin embargo, no contiene el código de llamadas a OpenAI, identificadores exactos de modelo, mensajes completos, baseline BoW-SBERT, análisis de temperatura/selección ni modelos mixtos. No hay README, licencia, dependencias, tests o CI; los pickles antiguos fallan con pandas 2.2.3. El único script lingüístico tiene rutas y variables rotas y no puede producir la figura publicada. Además, sus 685 identificadores enlazan directamente con un CSV de 710 filas que incluye demografía y puntuaciones psicométricas, sin una nota de gobernanza de reutilización.

La conclusión fiel es limitada pero útil: el GPT-4 histórico aproximó bien la Extraversión aparente a partir de texto en este escenario, pero no validó una evaluación general de personalidad ni decisiones de empleo. Conscientiousness, validez para desempeño, acuerdo de las puntuaciones, fairness y utilidad operativa quedan débiles o sin establecer. El propio estudio aporta evidencia en contra del despliegue directo: alta consistencia de la entrevista puede coexistir con R² negativo.

English

This study evaluates whether GPT-3.5 and GPT-4 can score personality and interview performance from responses elicited in asynchronous video interviews. Despite the video framing, the models receive only Google Speech-to-Text transcripts, the interview questions and, in the primary condition, information identifying the factor or facet targeted by each question. The final sample contains 685 participants answering eight questions for four Extraversion and four Conscientiousness facets in a fictional management-trainee application. Criteria are HEXACO-60 self-reports, ratings by four trained observers, and five interview ratings provided by two professional recruiters per participant. A ten-fold cross-validated supervised BoW-SBERT model serves as the comparator.

The positive result is concentrated in apparent Extraversion. Against observer ratings, GPT-4 reaches R²=.53 and GPT-3.5 .40, above BoW-SBERT's .36; GPT-4 also obtains R² values from .32 to .61 across the four Extraversion facets. The picture reverses for Conscientiousness: GPT-4 explains .11 and GPT-3.5 .08 of observer variance versus .23 for the baseline; both LLMs are below zero against self-report and also fail on Prudence and Perfectionism. Most importantly for hiring, every R² for the four recruiter-rated competencies and overall interview performance is negative, so the models perform worse than assigning the mean.

Reliability is measured only with Pearson correlation. When exactly the same text is scored twice, GPT-4 obtains r=.79 for Extraversion, .61 for Conscientiousness and .83 for interview performance; with a new interview 7-24 months later, the values are .59, .39 and .85. These correlations do not test absolute agreement, and the latter combines instrument inconsistency with genuine changes in responses. Raising temperature slightly increases observer-Extraversion R² while sharply reducing consistency. Scores are compressed and skew high. The fairness analysis compares gender differences and correlations with age, education and attractiveness, but it does not test measurement invariance, equal error, differential prediction or adverse impact; lower association than human observers is not sufficient evidence of fairness.

The candidate-selection simulation does not validate operational use. Its quantity labeled “accuracy” is actually recall or true-positive rate, and ties allow the selected set to exceed K; overlap therefore rises mechanically as K grows. There is no random-ranking baseline, specificity, decision utility or prospective workplace outcome. Semantic similarity between explanations and HEXACO items is also relative and partly circular because the prompt discloses the constructs and distances are normalized within each explanation.

The author preprint links a public repository containing 11,522 model-answer files and prediction artifacts at commit b2a3a70, a meaningful transparency contribution. It does not contain the OpenAI request code, exact model identifiers, complete messages, BoW-SBERT training, temperature/selection analyses or mixed-effects models. There is no README, license, dependency manifest, test suite or CI, and legacy pickles fail under pandas 2.2.3. The sole linguistic-analysis script has broken paths and variables and cannot produce the published figure. Its 685 output identifiers also link directly to a 710-row CSV containing demographics and psychometric ratings, without a reuse-governance note.

The faithful conclusion is narrow but useful: historical GPT-4 approximated apparent Extraversion well from text in this setting, but the study did not validate general personality assessment or employment decisions. Conscientiousness, job-performance validity, score agreement, fairness and operational utility remain weak or unestablished. The study itself supplies evidence against direct deployment: highly correlated interview scores can coexist with negative R².

Pregunta de investigación

¿Con qué validez, consistencia y asociaciones demográficas puntúan GPT-3.5 y GPT-4 la Extraversión, Conscientiousness y el desempeño de entrevista desde transcripciones de AVI, cómo se comparan con observadores y un baseline supervisado, y cómo cambian con temperatura y metainformación?

Método

Estudio de validación concurrente sobre 685 entrevistas simuladas para una vacante ficticia. Ocho preguntas activan cuatro facetas HEXACO de Extraversión y cuatro de Conscientiousness. GPT-3.5 y GPT-4 reciben solo transcripciones, puntúan de 1 a 5 a temperatura 1 y generan explicaciones. Se comparan por R² con autoinformes HEXACO-60, cuatro observadores entrenados y dos reclutadores por participante, además de un MLP BoW-SBERT en validación cruzada de diez pliegues. La consistencia se estima correlacionando dos ejecuciones del mismo texto y una nueva AVI de 145 personas tras 7-24 meses. Se analizan género, edad, educación y atractivo, temperatura 0-2, presencia de metainformación, solapamiento top-K y similitud semántica de explicaciones con HEXACO-60.

Muestra: 685 participantes finales de 947 reclutados: 231 hombres, 447 mujeres y 7 personas no binarias; edad media 31,08 años (DE 11,52). Se excluyeron 100 por corrupción, 28 por atención, 92 por variabilidad extrema en el inventario y 42 marcados manualmente como no conformes. Un subgrupo de 145 repitió la AVI 7-24 meses después (media 11,8; mediana 7).

Hallazgos

  • Frente a observadores, R² de GPT-3.5/GPT-4/BoW-SBERT es 0,40/0,53/0,36 para Extraversión y 0,08/0,11/0,23 para Conscientiousness.
  • Frente al autoinforme, Extraversión alcanza 0,10/0,18/0,09; ambos LLM tienen R² negativo en Conscientiousness y el baseline llega a 0,03.
  • GPT-4 explica R²=0,61 de Sociability, 0,58 de Social Boldness, 0,44 de Social Self-Esteem y 0,32 de Liveliness; falla en Prudence y Perfectionism.
  • Todos los R² para las cuatro competencias y la puntuación global de entrevista son negativos.
  • Al repetir el mismo texto, GPT-4 obtiene r=0,79/0,61/0,83 en Extraversión, Conscientiousness y entrevista; GPT-3.5, 0,68/0,48/0,75.
  • Con una nueva AVI 7-24 meses después, GPT-4 baja a 0,59/0,39 en personalidad y mantiene 0,85 en entrevista pese a que esta carece de validez concurrente; GPT-3.5 da 0,48/0,19/0,78.
  • La desviación estándar de GPT-4 es 0,55 en Extraversión y 0,41 en Conscientiousness, frente a 0,83/0,42 de observadores y 0,68/0,54 del autoinforme; existe compresión de rango.
  • Al subir temperatura de 0 a 2, el R² de Extraversión de GPT-4 aumenta aproximadamente de 0,48 a 0,57, mientras la correlación baja de cerca de 0,68 a 0,12.
  • Las diferencias de género de GPT-3.5 son d=-0,374/-0,308 y las de GPT-4 -0,312/-0,395 para Extraversión/Conscientiousness; estos efectos no identifican por sí solos sesgo de medición.
  • Las correlaciones de atractivo de GPT-4 son 0,118/0,068 frente a 0,246/0,154 de observadores, pero una menor asociación no prueba igualdad de error o validez entre grupos.
  • La métrica RECselect etiquetada como accuracy es recall; los empates expanden el conjunto seleccionado y la curva no mide exactitud clasificatoria global.
  • La afirmación textual de menos del 10 % para K<10 entra en tensión con un punto de recall de GPT-4 sin vacante superior al 60 % en K=5.
  • El artículo invierte la interpretación del test Shapiro-Wilk: llama no normales a resultados con p>0,05 y normales a los de p<0,05.
  • El repositorio libera 11.522 outputs, pero tres carpetas GPT-3.5 están incompletas (682, 673 y 682 ficheros) sin que el artículo publique esos n por condición.
  • El repositorio no permite regenerar llamadas o figuras y el script lingüístico no es ejecutable tal como está versionado.
  • Los 685 identificadores de output coinciden con workerId en el CSV de 710 filas, lo que permite enlazar perfiles derivados con demografía y medidas humanas.

Limitaciones

  • Los LLM solo procesan texto transcrito; no se evalúa la modalidad de vídeo o audio sugerida por el título.
  • Solo se estudian Extraversión y Conscientiousness activadas por preguntas transparentes; no se valida el HEXACO completo.
  • Los prompts revelan factores o facetas y piden razonar con HEXACO, por lo que parte de la alineación semántica es inducida.
  • No se identifican los snapshots exactos de GPT-3.5 y GPT-4, fechas de ejecución, payloads, retries o política de fallos.
  • Pearson r mide orden relativo, no acuerdo absoluto, error individual o intercambiabilidad de puntuaciones.
  • El intervalo retest varía entre 7 y 24 meses y mezcla cambio humano, nuevas respuestas e inestabilidad del modelo.
  • Los criterios de reclutadores tienen acuerdo modesto, ICC medio 0,56, y son impresiones concurrentes, no desempeño laboral futuro.
  • Todo R² laboral es negativo, por lo que la simulación top-K carece de una base de validez predictiva.
  • RECselect es recall aunque se denomina accuracy; no se reportan especificidad, FPR, utilidad, calibración o baseline aleatorio.
  • Los empates hacen L≥K y pueden inflar recall seleccionando muchos candidatos, a costa de precisión.
  • El análisis de fairness confunde diferencias de puntuación con sesgo y no evalúa invariancia, error por grupo, predicción diferencial o impacto adverso.
  • Observadores, autoinformes y reclutadores no son ground truths libres de sesgo y miden constructos parcialmente diferentes.
  • La interpretación publicada de Shapiro-Wilk usa la dirección de p equivocada.
  • Se excluyen 92 participantes por dispersión baja/alta del inventario, una selección sobre el patrón de respuesta sin sensibilidad reportada.
  • La normalización semántica fuerza una escala relativa 0-1 dentro de cada explicación; no ofrece similitud absoluta comparable.
  • No se muestran intervalos de incertidumbre ni repeticiones estocásticas suficientes para el barrido de temperatura.
  • La comparación de coste omite transcripción, desarrollo de prompts, ground truth, validación, reruns, gobernanza y coste del error.
  • El repositorio no tiene README, licencia, requirements/lockfile, tests, CI, tags ni releases.
  • No se libera el código de generación, baseline BoW-SBERT, temperatura, selección ni modelos mixtos.
  • bias_analysis.py calcula efectos descriptivos y correlaciones, pero no el modelo mixto descrito en el artículo.
  • linguistic_analysis.py sobrescribe la variable de modelo, usa una ruta inexistente y divide arrays nunca poblados; no reproduce Figura 8/Tabla III.
  • Los pickles heredados dependen de una versión antigua no documentada de pandas y fallan bajo pandas 2.2.3.
  • Tres condiciones GPT-3.5 tienen menos de 685 outputs y la gestión de missingness no está documentada en el artículo.
  • El OSF subyacente no está registrado, es mutable y corresponde principalmente al estudio supervisado anterior.
  • Los IDs permiten enlace fila a fila de outputs psicológicos con demografía y ratings sin una nota visible de reutilización, consentimiento o gobernanza.
  • Una vacante ficticia, inglés y una muestra seleccionada no garantizan generalización a empleos, idiomas, culturas o poblaciones reales.

Qué no demuestra

  • No demuestra que GPT-3.5 o GPT-4 evalúen válidamente la personalidad en general.
  • No demuestra predicción de desempeño laboral, contratación, retención o conducta futura.
  • No demuestra que el modelo analice vídeo, voz, expresión facial o señales audiovisuales.
  • No demuestra acuerdo absoluto o estabilidad individual por reportar correlaciones altas.
  • No demuestra fairness porque una correlación demográfica o de atractivo sea menor que la humana.
  • No demuestra que observadores o reclutadores sean criterios sin sesgo.
  • No demuestra que las explicaciones sean fieles al cálculo interno o que el modelo comprenda teoría psicológica.
  • No demuestra que GPT-4 supere generalmente a modelos supervisados: pierde en Conscientiousness.
  • No valida utilidad de selección; la llamada accuracy es recall bajo empates y todo R² laboral es negativo.
  • No permite regenerar los endpoints históricos, prompts y ejecuciones desde el repositorio.
  • No permite reproducir de extremo a extremo todas las tablas y figuras con el código liberado.
  • No demuestra que 50 euros sea el coste total de un sistema de evaluación responsable.
  • No generaliza automáticamente fuera de la vacante ficticia, el inglés, la muestra o las versiones de 2023.
  • No demuestra que un LLM posea personalidad, motivos, autoconocimiento o rasgos psicológicos estables.

Modelos evaluados

  • GPT-3.5 (exact API snapshot not reported)
  • GPT-4 (exact API snapshot not reported)
  • BoW-SBERT supervised regression baseline
  • SentenceTransformer all-MiniLM-L6-v2 (artifact linguistic script)

Instrumentos y métricas

  • HEXACO-60 self-report
  • HEXACO Behavioral Anchored Rating Scales (HEXACO-BARS)
  • Four job-related competencies and overall interview performance ratings
  • First-impression attractiveness rating
  • Coefficient of determination (R2)
  • Pearson repeated-score and long-interval retest correlation
  • Gender Cohen's d and demographic/attractiveness correlations

Datos utilizados

  • 685-person simulated asynchronous video interview dataset
  • 145-person repeat-interview subset
  • GitHub Tianyi-Zhang-TZ/LLMs_Personality at commit b2a3a703d15d6316ab3139f8fd0298fde96a23d3
  • OSF gsj46 underlying Prolific dataset and prior supervised-study materials

Evidencia y localización

  • Diseño, muestra, exclusiones, preguntas y criterios humanos: Version of record, pp. 1772-1773, Methodology section III-A
  • Prompts, modalidad solo textual, temperatura y baseline: Version of record, p. 1773, Figure 1, Figure 2 and sections III-B-C
  • R² por factor/faceta, medias, varianzas y resultados laborales negativos: Version of record, pp. 1775-1776, Figure 3 and section IV-A
  • Correlaciones de repetición y retest: Version of record, p. 1776, Table I and section IV-B
  • Género, edad, atractivo y educación: Version of record, pp. 1777-1778, Table II and section IV-C
  • Temperatura y selección de candidatos: Version of record, pp. 1778-1779, Figures 4-6 and sections IV-D-E
  • Metainformación y similitud lingüística: Version of record, pp. 1780-1782, Figures 7-8, Table III and sections IV-F-G
  • Límites y cautela de los propios autores: Version of record, pp. 1782-1783, Discussion, Limitations and Conclusion
  • Enlace al repositorio específico omitido en el VOR: Author preprint SHA-256 06ca97e7d7f8b0a9602a2cdff2484e41fa7c7c31b60ddef912cf0780539f833d, p. 2 footnote
  • Outputs, predicciones, cobertura y ausencia de pipeline: GitHub https://github.com/Tianyi-Zhang-TZ/LLMs_Personality at commit b2a3a703d15d6316ab3139f8fd0298fde96a23d3, audited 16 Jul 2026
  • Errores del script lingüístico y ausencia de modelos mixtos: GitHub commit b2a3a703d15d6316ab3139f8fd0298fde96a23d3: linguistic_analysis.py lines 11-114 and bias_analysis.py lines 16-124
  • Datos, código y suplemento del estudio supervisado anterior: OSF osf.io/gsj46 audited 16 Jul 2026; unregistered project, Supplemental Material.docx and codes.zip
  • Informe metodológico y de artefactos completo: reports/verification/article-210-avi-personality-validity-fairness-and-artifact-audit.json