El artículo presenta LMIQ, un proceso para transformar transcripciones de entrevistas psicológicas en variables numéricas. Un LLM recibe una transcripción, adopta la perspectiva de la persona entrevistada y contesta preguntas con valores de 1 a 5. Las 135 respuestas resultantes alimentan un Random Forest que predice dos puntuaciones de autoinforme: PHQ-8 para síntomas depresivos y PCL-C para síntomas de estrés postraumático. El experimento principal usa las 275 entrevistas de E-DAIC y sus particiones predefinidas. Las variables incluyen 70 preguntas de salud mental, 25 de personalidad Big Five, 15 terapéuticas y 25 denominadas directas. Las preguntas no directas se generaron inicialmente con GPT-4 y se refinaron manualmente; el artículo no aporta una validación clínica o psicométrica de esos nuevos cuestionarios.
Con GPT-3.5 Turbo Instruct, LMIQ obtiene en prueba MSE 20,42 para PHQ y 192,93 para PTSD, frente a 24,16 y 195,55 al pedir al mismo modelo que complete únicamente los cuestionarios directos y sumar sus respuestas. Mixtral mejora los resultados principales hasta 18,05 y 163,75. Son errores de regresión sobre puntuaciones de cuestionarios, no medidas de diagnóstico clínico. El trabajo también compara con predicción directa de GPT-3.5, embeddings Ada-002, MentaLLaMA, TF-IDF y la media del conjunto. LMIQ-Mixtral es la mejor variante de la tabla principal, pero no se publican repeticiones, intervalos de confianza ni pruebas estadísticas que permitan cuantificar la estabilidad o significación de las diferencias.
La ablación matiza la tesis de que reunir todos los dominios sea lo más eficaz. Con GPT-3.5, las 135 variables no logran el mejor resultado en ninguna de las dos tareas de prueba: personalidad más preguntas directas obtiene MSE 20,26 en PHQ y 166,62 en PTSD, frente a 20,42 y 192,93 con todas las variables. Terapéutico más directo también mejora PTSD hasta 168,62 y salud mental más directo hasta 177,15. Las variantes sin preguntas directas son claramente peores. Esto apoya que las respuestas simuladas contienen señal predictiva, pero también muestra una fuerte dependencia de preguntas que aproximan directamente los instrumentos objetivo y que añadir todos los dominios puede perjudicar, especialmente en PTSD.
La auditoría del apéndice detecta un problema de fidelidad instrumental. El artículo declara ocho preguntas PHQ-8 más diecisiete PCL-C, pero la lista publicada bajo PHQ contiene nueve ítems porque añade «How likely are you to volunteer your time to help others?», que no pertenece al PHQ-8. Además, el PHQ-8 oficial pregunta por frecuencia durante las dos últimas semanas y puntúa 0–3; el prompt uniforme de LMIQ solicita acuerdo de 1 a 5 y elimina ese anclaje temporal. Por tanto, estas variables no son cumplimentaciones fieles del PHQ-8, sino aproximaciones ordinales generadas por un modelo. El PCL-C sí usa oficialmente 17 ítems de 1 a 5, aunque el artículo tampoco documenta con precisión cómo conserva sus anclajes de tiempo y experiencia. El propio trabajo reconoce que no valida las respuestas personificadas frente a respuestas humanas.
La contribución defendible es un estudio exploratorio que muestra que respuestas estructuradas generadas desde una entrevista pueden resultar más predictivas que varias representaciones textuales en una partición de benchmark. No demuestra diagnóstico automático ni validez clínica. Los objetivos son puntuaciones de autoinforme, no diagnósticos de profesionales; no se informan umbrales, sensibilidad, especificidad, calibración, análisis por subgrupos, incertidumbre ni evaluación prospectiva. Tampoco se publican código, datos derivados o configuración ejecutable, y no se detallan proveedor y versión exacta de Mixtral, snapshots, semillas, coste, fallos o reintentos. El envío de transcripciones sensibles a una API comercial se justifica mediante una mención general a desidentificación y cumplimiento, sin describir consentimiento para este tratamiento, revisión ética, retención, residencia, acuerdo de procesamiento o comprobaciones de reidentificación. En su estado actual, LMIQ debe entenderse como extracción experimental de variables para regresión sobre un benchmark, no como sistema listo para decisiones clínicas.