LLM Questionnaire Completion for Automatic Psychiatric Assessment

Evaluación y validez psicométrica2024ACL AnthologyRevisión editorial aprobada

Autores: Gony Rosenman, Talma Hendler, Lior Wolf

Palabras clave: Large Language Models, Psychiatric Assessment, Mental Health, Depression (PHQ-8), PTSD (PCL-C), Psychological Interviews

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
17
Hallazgos
57
Limitaciones
16
Evidencias

Resumen editorial

Español

El artículo presenta LMIQ, un proceso para transformar transcripciones de entrevistas psicológicas en variables numéricas. Un LLM recibe una transcripción, adopta la perspectiva de la persona entrevistada y contesta preguntas con valores de 1 a 5. Las 135 respuestas resultantes alimentan un Random Forest que predice dos puntuaciones de autoinforme: PHQ-8 para síntomas depresivos y PCL-C para síntomas de estrés postraumático. El experimento principal usa las 275 entrevistas de E-DAIC y sus particiones predefinidas. Las variables incluyen 70 preguntas de salud mental, 25 de personalidad Big Five, 15 terapéuticas y 25 denominadas directas. Las preguntas no directas se generaron inicialmente con GPT-4 y se refinaron manualmente; el artículo no aporta una validación clínica o psicométrica de esos nuevos cuestionarios.

Con GPT-3.5 Turbo Instruct, LMIQ obtiene en prueba MSE 20,42 para PHQ y 192,93 para PTSD, frente a 24,16 y 195,55 al pedir al mismo modelo que complete únicamente los cuestionarios directos y sumar sus respuestas. Mixtral mejora los resultados principales hasta 18,05 y 163,75. Son errores de regresión sobre puntuaciones de cuestionarios, no medidas de diagnóstico clínico. El trabajo también compara con predicción directa de GPT-3.5, embeddings Ada-002, MentaLLaMA, TF-IDF y la media del conjunto. LMIQ-Mixtral es la mejor variante de la tabla principal, pero no se publican repeticiones, intervalos de confianza ni pruebas estadísticas que permitan cuantificar la estabilidad o significación de las diferencias.

La ablación matiza la tesis de que reunir todos los dominios sea lo más eficaz. Con GPT-3.5, las 135 variables no logran el mejor resultado en ninguna de las dos tareas de prueba: personalidad más preguntas directas obtiene MSE 20,26 en PHQ y 166,62 en PTSD, frente a 20,42 y 192,93 con todas las variables. Terapéutico más directo también mejora PTSD hasta 168,62 y salud mental más directo hasta 177,15. Las variantes sin preguntas directas son claramente peores. Esto apoya que las respuestas simuladas contienen señal predictiva, pero también muestra una fuerte dependencia de preguntas que aproximan directamente los instrumentos objetivo y que añadir todos los dominios puede perjudicar, especialmente en PTSD.

La auditoría del apéndice detecta un problema de fidelidad instrumental. El artículo declara ocho preguntas PHQ-8 más diecisiete PCL-C, pero la lista publicada bajo PHQ contiene nueve ítems porque añade «How likely are you to volunteer your time to help others?», que no pertenece al PHQ-8. Además, el PHQ-8 oficial pregunta por frecuencia durante las dos últimas semanas y puntúa 0–3; el prompt uniforme de LMIQ solicita acuerdo de 1 a 5 y elimina ese anclaje temporal. Por tanto, estas variables no son cumplimentaciones fieles del PHQ-8, sino aproximaciones ordinales generadas por un modelo. El PCL-C sí usa oficialmente 17 ítems de 1 a 5, aunque el artículo tampoco documenta con precisión cómo conserva sus anclajes de tiempo y experiencia. El propio trabajo reconoce que no valida las respuestas personificadas frente a respuestas humanas.

La contribución defendible es un estudio exploratorio que muestra que respuestas estructuradas generadas desde una entrevista pueden resultar más predictivas que varias representaciones textuales en una partición de benchmark. No demuestra diagnóstico automático ni validez clínica. Los objetivos son puntuaciones de autoinforme, no diagnósticos de profesionales; no se informan umbrales, sensibilidad, especificidad, calibración, análisis por subgrupos, incertidumbre ni evaluación prospectiva. Tampoco se publican código, datos derivados o configuración ejecutable, y no se detallan proveedor y versión exacta de Mixtral, snapshots, semillas, coste, fallos o reintentos. El envío de transcripciones sensibles a una API comercial se justifica mediante una mención general a desidentificación y cumplimiento, sin describir consentimiento para este tratamiento, revisión ética, retención, residencia, acuerdo de procesamiento o comprobaciones de reidentificación. En su estado actual, LMIQ debe entenderse como extracción experimental de variables para regresión sobre un benchmark, no como sistema listo para decisiones clínicas.

English

The paper presents LMIQ, a pipeline for transforming psychological-interview transcripts into numerical variables. An LLM receives a transcript, adopts the interviewee's perspective, and answers questions with values from 1 to 5. The resulting 135 responses feed a Random Forest that predicts two self-report scores: PHQ-8 for depressive symptoms and PCL-C for post-traumatic stress symptoms. The main experiment uses the 275 E-DAIC interviews and its predefined splits. Features comprise 70 mental-health questions, 25 Big Five personality questions, 15 therapeutic questions, and 25 questions called direct. The non-direct items were initially generated with GPT-4 and manually refined; the paper provides no clinical or psychometric validation of these new questionnaires.

With GPT-3.5 Turbo Instruct, LMIQ obtains test MSEs of 20.42 for PHQ and 192.93 for PTSD, compared with 24.16 and 195.55 when the same model is asked to complete only the direct questionnaires and its answers are summed. Mixtral improves the main results to 18.05 and 163.75. These are regression errors on questionnaire scores, not measures of clinical diagnosis. The paper also compares direct GPT-3.5 prediction, Ada-002 embeddings, MentaLLaMA, TF-IDF, and the dataset mean. LMIQ-Mixtral is the strongest variant in the main table, but no repeated runs, confidence intervals, or statistical tests are reported to quantify the stability or significance of the differences.

The ablation qualifies the claim that pooling every domain is most effective. With GPT-3.5, the 135-feature set is not the best test configuration for either task: personality plus direct questions reaches 20.26 PHQ MSE and 166.62 PTSD MSE, versus 20.42 and 192.93 with all features. Therapeutic plus direct also improves PTSD to 168.62 and mental health plus direct to 177.15. Variants without direct questions are substantially worse. This supports the presence of predictive signal in simulated answers, but it also reveals heavy dependence on questions that closely proxy the target instruments and shows that adding every domain can be harmful, especially for PTSD.

The appendix audit finds an instrument-fidelity problem. The paper declares eight PHQ-8 questions plus seventeen PCL-C questions, yet the published PHQ list contains nine items because it adds “How likely are you to volunteer your time to help others?”, which is not part of the PHQ-8. The official PHQ-8 asks about frequency during the past two weeks and uses 0–3 scoring; LMIQ's uniform prompt requests 1–5 agreement and removes that time anchor. These features are therefore not faithful PHQ-8 completions but model-generated ordinal proxies. The official PCL-C does use 17 items rated 1–5, although the paper likewise does not precisely document preservation of its time and stressful-experience anchors. The paper itself acknowledges that impersonated responses are not validated against human answers.

The defensible contribution is an exploratory study showing that structured responses generated from an interview can be more predictive than several text representations on one benchmark split. It does not establish automatic diagnosis or clinical validity. Targets are self-report severity scores rather than clinician diagnoses; thresholds, sensitivity, specificity, calibration, subgroup analysis, uncertainty, and prospective evaluation are absent. No code, derived data, or executable configuration is released, and the exact Mixtral provider/version, snapshots, seeds, cost, failures, and retries are not documented. Sending sensitive transcripts to a commercial API is justified with a general statement about de-identification and compliance, without documenting consent for this processing, ethics review, retention, residency, a processing agreement, or re-identification testing. In its present form, LMIQ should be understood as experimental feature extraction for benchmark regression, not a system ready for clinical decisions.

Pregunta de investigación

¿Puede un LLM, al personificar a la persona descrita en una entrevista psicológica y completar cuestionarios estructurados, producir variables que mejoren la predicción de sus puntuaciones PHQ-8 y PCL-C frente a representaciones textuales y predicciones directas?

Método

LMIQ combina la transcripción de cada entrevista con cuestionarios de cinco ítems por tema y pide al LLM respuestas enteras de 1 a 5 desde la perspectiva del entrevistado. Concatena 135 respuestas de cuatro dominios y entrena un RandomForestRegressor para predecir dos puntuaciones continuas. Evalúa GPT-3.5 Turbo Instruct y Mixtral sobre las particiones predefinidas de E-DAIC; selecciona n_estimators entre 100/200/300 y max_depth entre 10/20/30 en desarrollo, y compara MSE en prueba con predicción directa, suma de respuestas directas, análisis más embeddings, embeddings directos, MentaLLaMA, TF-IDF y media. Añade una comparación secundaria de PHQ en DAIC-WOZ y una ablación de dominios con GPT-3.5. La auditoría leyó y renderizó las trece páginas, verificó tablas y apéndices, contrastó PHQ-8 y PCL-C con documentación oficial y buscó artefactos públicos vinculados.

Muestra: E-DAIC aporta 275 entrevistas semiclínicas realizadas por un entrevistador virtual y puntuaciones asociadas de PHQ-8 y PCL-C. El artículo usa las particiones predefinidas, pero no presenta en el cuerpo principal un análisis demográfico, de representatividad, de potencia o de subgrupos. DAIC-WOZ se utiliza únicamente como comparación secundaria para PHQ y no constituye una validación clínica externa independiente del ecosistema DAIC.

Hallazgos

  • LMIQ convierte cada entrevista en un vector de 135 respuestas ordinales generadas por un LLM.
  • Con GPT-3.5, LMIQ obtiene MSE de prueba 20,42 en PHQ y 192,93 en PTSD.
  • Con Mixtral, LMIQ mejora a MSE 18,05 en PHQ y 163,75 en PTSD.
  • Mixtral es la mejor variante de la tabla principal en ambas puntuaciones.
  • La predicción directa de GPT-3.5 es peor: 33,42 en PHQ y 336,49 en PTSD.
  • Pedir a GPT-3.5 que personifique y sume solo los cuestionarios directos alcanza 24,16 y 195,55.
  • La ganancia de GPT-3.5 LMIQ frente a esa línea base directa es pequeña para PTSD.
  • Los embeddings Ada-002 directos obtienen 38,23 en PHQ y 389,65 en PTSD.
  • En DAIC-WOZ, LMIQ informa MAE 3,46 y RMSE 4,30 en prueba para PHQ.
  • Las comparaciones DAIC-WOZ mezclan sistemas y modalidades diferentes.
  • La configuración completa de 135 variables no es la mejor en ninguna tarea de prueba de la ablación GPT-3.5.
  • Personalidad más preguntas directas mejora PHQ a 20,26 y PTSD a 166,62.
  • Terapéutico más directo obtiene 168,62 en PTSD y salud mental más directo 177,15.
  • Todas las configuraciones sin preguntas directas rinden peor que las mejores combinaciones con preguntas directas.
  • Las variables de sueño dominan las importancias publicadas para PHQ y las de pánico para PTSD.
  • El apéndice enumera nueve preguntas bajo PHQ pese a declarar PHQ-8, incluida una pregunta sobre voluntariado ajena al instrumento.
  • La búsqueda dirigida no encontró código o implementación pública asociada al artículo.

Limitaciones

  • Se evalúa un único benchmark principal de 275 entrevistas.
  • DAIC-WOZ es un conjunto relacionado y no una cohorte clínica externa independiente.
  • Las particiones son fijas y no se publican repeticiones con otras semillas.
  • No se informan intervalos de confianza, desviaciones entre ejecuciones o pruebas estadísticas.
  • No hay análisis de potencia ni justificación del tamaño muestral.
  • Los objetivos son puntuaciones de autoinforme, no diagnósticos clínicos.
  • El lenguaje de precisión diagnóstica excede la variable realmente evaluada.
  • No se evalúan umbrales clínicos, sensibilidad, especificidad, calibración o utilidad de decisión.
  • No se proporcionan predicciones con incertidumbre o mecanismo de abstención.
  • No hay comparación con valoraciones de profesionales ni evaluación prospectiva.
  • No se examinan subgrupos demográficos, idiomas, culturas o desigualdades de rendimiento.
  • No se reporta robustez ante transcripciones incompletas, errores ASR, negación o contradicciones.
  • No se prueba generalización fuera de entrevistas DAIC.
  • Los cuestionarios de salud mental y terapia fueron generados por GPT-4 y refinados manualmente.
  • No se informa quién refinó los ítems, sus credenciales, acuerdo o protocolo.
  • Los cuestionarios nuevos carecen de validación clínica y psicométrica.
  • No se evalúan fiabilidad, estructura factorial, validez convergente o discriminante.
  • El prompt uniforme transforma todas las respuestas en una escala 1–5 de acuerdo.
  • El PHQ-8 oficial emplea frecuencia 0–3 durante las dos últimas semanas.
  • Se pierde el anclaje temporal de dos semanas del PHQ-8.
  • El apéndice lista nueve ítems bajo PHQ en lugar de ocho.
  • La pregunta sobre voluntariado añadida no pertenece al PHQ-8.
  • La contradicción deja incierto qué 25 variables directas se ejecutaron realmente.
  • El PCL-C es compatible con 1–5, pero no se documenta fielmente su anclaje contextual y temporal.
  • Las respuestas simuladas no se comparan ítem a ítem con las respuestas reales del entrevistado.
  • El propio artículo reconoce que no valida la personificación del LLM.
  • Las preguntas directas aproximan estrechamente los instrumentos objetivo.
  • La mejora puede depender de proxy scoring de síntomas ya presentes en la entrevista.
  • La ablación muestra que los dominios directos aportan gran parte de la señal útil.
  • Agregar todos los dominios empeora PTSD frente a tres combinaciones más pequeñas.
  • No se describe si se entrenó un regresor multiobjetivo o modelos separados.
  • La selección de hiperparámetros usa un único conjunto de desarrollo pequeño.
  • No se publican configuraciones finalmente elegidas por tarea y modelo.
  • La importancia por reducción de impureza puede sesgarse con variables correlacionadas.
  • No se aportan intervalos o estabilidad para las importancias de variables.
  • Las importancias predictivas no demuestran razonamiento clínico ni causalidad.
  • GPT-3.5 Turbo Instruct no se identifica mediante snapshot inmutable.
  • Los defaults del API se describen como consistentes y no sesgados sin evidencia.
  • No se documentan temperatura, top-p, fecha de ejecución o cambios de proveedor resueltos.
  • Mixtral se nombra de forma ambigua como 7Bx8 y no se especifican proveedor, checkpoint o cuantización.
  • No se identifica de forma reproducible el checkpoint MentaLLaMA.
  • No se publican semillas del Random Forest ni de ninguna generación.
  • No se informan respuestas inválidas, faltantes, reintentos o reglas de reparación.
  • No se informan coste, latencia o número de llamadas.
  • El texto es ambiguo entre una pregunta por sesión y cinco preguntas agrupadas.
  • No se publica el prompt usado para generar inicialmente los cuestionarios con GPT-4.
  • Los ítems finales solo están disponibles en el PDF y no como artefacto versionado.
  • No se publica código, lockfile, entorno, configuración ejecutable o datos derivados.
  • No puede verificarse que tablas y ablationes procedan de un pipeline reproducible.
  • Enviar transcripciones sensibles a la API de OpenAI crea un límite de confianza adicional.
  • La mención a desidentificación y cumplimiento no describe el procedimiento técnico.
  • No se reportan pruebas de reidentificación, minimización, retención o residencia de datos.
  • No se documentan consentimiento o aprobación ética específicos para el procesamiento con una API comercial.
  • No se describe acuerdo de procesamiento, acceso del proveedor o eliminación verificable.
  • No se proponen supervisión humana, límites de uso, monitorización o respuesta ante daño clínico.
  • No se evalúan alucinaciones, respuestas perjudiciales o fallos de atribución del LLM.
  • La sección de limitaciones no cubre la discrepancia PHQ-8 ni la dependencia de preguntas directas.

Qué no demuestra

  • No demuestra que el sistema diagnostique depresión o PTSD.
  • No sustituye una entrevista o valoración por un profesional de salud mental.
  • No valida clínicamente los cuestionarios generados con GPT-4.
  • No demuestra que el LLM reproduzca fielmente las respuestas del entrevistado.
  • No demuestra que las variables llamadas PHQ-8 constituyan una administración válida del PHQ-8.
  • No establece validez psicométrica de las respuestas de personalidad o terapia.
  • No prueba generalización a pacientes reales fuera de DAIC, otros idiomas o otros contextos.
  • No demuestra equidad entre grupos demográficos.
  • No establece superioridad estadísticamente significativa frente a cada línea base.
  • No demuestra que usar los 135 ítems sea mejor que subconjuntos más pequeños.
  • No separa el valor de preguntas directas del valor incremental de dominios más amplios.
  • No convierte importancias de Random Forest en explicaciones clínicas causales.
  • No ofrece calibración, incertidumbre o seguridad suficiente para decisiones clínicas.
  • No demuestra cumplimiento efectivo de privacidad o normativa sanitaria.
  • No permite una reproducción exacta con artefactos públicos.

Trazabilidad

Alcance: Texto completo

Versión: ACL Anthology 2024.findings-emnlp.23; Findings of ACL: EMNLP 2024; DOI 10.18653/v1/2024.findings-emnlp.23; pp. 403–415; CC BY 4.0

Fuente consultada: https://aclanthology.org/2024.findings-emnlp.23.pdf

Revisión: Codex full-text, visual, clinical-instrument, statistical, privacy and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-3.5 Turbo Instruct through the OpenAI API, exact snapshot and resolved defaults not reported
  • Mixtral 7Bx8 as named by the paper, provider, exact checkpoint and serving configuration not reported
  • GPT-4 used to generate initial custom questionnaire topics and items
  • MentaLLaMA 7B baseline, exact checkpoint not reported
  • OpenAI Ada-002 embedding baseline
  • RandomForestRegressor with development-set hyperparameter selection

Instrumentos y métricas

  • PHQ-8 depression self-report target
  • PCL-C 17-item DSM-IV PTSD self-report target
  • Seventy GPT-4-generated and manually refined mental-health items across fourteen topics
  • Twenty-five Big Five personality items across five traits
  • Fifteen therapeutic-domain items covering family history, trauma history and resilience
  • Twenty-five declared direct items combining PHQ-8 and PCL-C
  • Uniform 1–5 LLM response prompt
  • Mean squared error for E-DAIC
  • Mean absolute error and root mean squared error for DAIC-WOZ comparison
  • Random-forest impurity feature importance

Datos utilizados

  • E-DAIC: 275 semi-clinical interview transcripts with PHQ-8 and PCL-C scores and predefined train/development/test partitions
  • DAIC-WOZ predecessor benchmark for secondary PHQ-only comparison
  • LLM-generated 135-dimensional questionnaire-response vectors; not released
  • No public code or implementation linked by ACL, arXiv or the authors in the paper as of the 15 July 2026 audit

Evidencia y localización

  • Objetivo, LMIQ y afirmación principal: Findings of ACL: EMNLP 2024 paper, abstract and section 1, pp. 403–405
  • E-DAIC, 275 entrevistas y objetivos PHQ/PCL-C: Paper, section 3.1 and Figure 1, pp. 405–406
  • Dominios, 135 variables y generación/refinado de preguntas: Paper, section 3.2 and Table 1, pp. 405–406
  • Prompt de personificación y ambigüedad de agrupación: Paper, section 3.3 and Figure 1, p. 405; Appendix A, p. 411
  • Random Forest y búsqueda de hiperparámetros: Paper, section 3.2, pp. 405–406
  • Modelos y líneas base: Paper, sections 4.1–4.2, pp. 406–407
  • Resultados principales E-DAIC: Paper, Table 2 and section 5, p. 407
  • Comparación secundaria DAIC-WOZ: Paper, Table 3 and section 5, p. 407
  • Ablación de dominios: Paper, Table 4 and section 5.1, p. 408
  • Importancias para PHQ y PTSD: Paper, Tables 5–6 and section 5.2, p. 408
  • Limitaciones reconocidas y privacidad declarada: Paper, Limitations and Ethical Considerations, p. 409
  • Lista de preguntas y discrepancia de nueve ítems bajo PHQ-8: Paper, Appendix B.4, pp. 413–414; visual audit of rendered pages 11–12
  • PHQ-8 oficial: ocho ítems, dos semanas y frecuencia 0–3: CDC National Health Statistics Reports No. 172; checked 15 Jul 2026
  • PCL-C oficial: 17 ítems y escala 1–5: U.S. Department of Veterans Affairs National Center for PTSD, PCL handout DSM-IV; checked 15 Jul 2026
  • Metadatos, DOI, páginas y licencia: ACL Anthology 2024.findings-emnlp.23; DOI 10.18653/v1/2024.findings-emnlp.23; CC BY 4.0
  • Ausencia de implementación pública vinculada: ACL, arXiv, paper links, Papers with Code and targeted GitHub/web search; checked 15 Jul 2026