LLM vs Small Model? Large Language Model Based Text Augmentation Enhanced Personality Detection Model

Evaluación y validez psicométrica2024AAAI ProceedingsRevisión editorial aprobada

Título original: LLM vs Small Model? LLM-Based Text Augmentation for Personality Detection

Autores: Linmei Hu, Hongyu He, Duokang Wang, Ziwang Zhao, Yingxia Shao, Liqiang Nie

Palabras clave: personality detection, text augmentation, knowledge distillation, contrastive learning, psycho-linguistic analysis, social media, MBTI

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
28
Hallazgos
37
Limitaciones
27
Evidencias

Resumen editorial

Español

Este trabajo no evalúa la personalidad de un LLM: usa GPT-3.5 como generador de datos auxiliares para predecir en personas las cuatro dicotomías MBTI a partir de sus publicaciones. El método TAE pide a gpt-3.5-turbo-0301, con temperatura cero, tres análisis por publicación, semántico, de sentimiento y lingüístico, y los usa como positivos de una pérdida contrastiva que entrena un codificador BERT. También genera descripciones de cada etiqueta MBTI para construir etiquetas suaves mediante similitud coseno; en inferencia solo queda el modelo pequeño. En particiones 60/20/20 de Kaggle/PersonalityCafe, con 8.675 usuarios, y PANDORA/Reddit, con 9.067, TAE obtiene macro-F1 medio de 72,07 y 63,05. Las mejoras frente al mejor baseline de cada tabla son 0,72 y 1,04 puntos absolutos, equivalentes a los 1,01% y 1,68% relativos que cita el texto; frente a BERTmean son 5,83 y 6,53 puntos. La evidencia apoya que, en esta configuración, las representaciones entrenadas con análisis generados superan a BERTmean y a las variantes que concatenan esos textos. No permite atribuir por separado el efecto a conocimiento psicolingüístico: no hay validación humana de los análisis, las ablaciones son ejecuciones puntuales sin incertidumbre y retirar la información de etiquetas apenas cambia 72,07 a 72,02. Tampoco sustenta la afirmación general de que el razonamiento o el few-shot empeoren ChatGPT: CoT baja a 65,12, pero tres ejemplos suben de 66,89 a 67,74 y además usan otro snapshot con ventana de contexto mayor. El trabajo trata declaraciones MBTI ruidosas y muy desequilibradas como referencia, no analiza validez psicométrica, clases minoritarias, sesgo, privacidad ni transferencia entre dominios. No publica código, semillas, salidas de GPT, coste, intervalos ni pruebas estadísticas, por lo que la reproducibilidad y la solidez de unas ventajas pequeñas quedan limitadas.

English

This paper does not evaluate an LLM's personality: it uses GPT-3.5 as an auxiliary-data generator to predict four MBTI dichotomies for people from their posts. TAE asks gpt-3.5-turbo-0301 at temperature zero for three analyses of every post, semantic, sentiment, and linguistic, and uses them as positive pairs in a contrastive loss that trains a BERT encoder. It also generates descriptions of each MBTI label and derives cosine-similarity soft targets; only the small model is required at inference. On 60/20/20 splits of Kaggle/PersonalityCafe with 8,675 users and PANDORA/Reddit with 9,067, TAE reports average macro-F1 of 72.07 and 63.05. Its gains over the best baseline in each table are 0.72 and 1.04 absolute points, corresponding to the 1.01% and 1.68% relative improvements stated in the prose; gains over BERTmean are 5.83 and 6.53 points. The evidence supports that representations trained with generated analyses outperform BERTmean and variants that concatenate those texts in this setup. It does not isolate the effect as psycholinguistic knowledge: generated analyses receive no human validation, ablations are single values without uncertainty, and removing label information changes the average only from 72.07 to 72.02. Nor does it support the general claim that reasoning or few-shot prompting degrades ChatGPT: CoT falls to 65.12, but three-shot rises from 66.89 to 67.74 and uses a different, longer-context snapshot. The study treats noisy, severely imbalanced MBTI declarations as reference labels and does not examine psychometric validity, minority-class behavior, bias, privacy, or cross-domain transfer. It releases no code, seeds, GPT outputs, cost accounting, confidence intervals, or statistical tests, limiting reproduction and confidence in small performance margins.

Pregunta de investigación

¿Puede el conocimiento generado por un LLM, análisis semánticos, de sentimiento y lingüísticos de publicaciones, más descripciones de etiquetas MBTI, mejorar un modelo BERT pequeño para detectar tipos de personalidad declarados en redes sociales sin añadir coste de LLM durante la inferencia?

Método

TAE genera con gpt-3.5-turbo-0301 y temperatura cero tres textos de análisis por publicación. Un BERT base uncased codifica la publicación y cada aumento; InfoNCE los aproxima como pares positivos y usa otros pares del minibatch como negativos. Las representaciones de hasta 50 publicaciones por usuario se promedian. El mismo LLM redacta tres explicaciones para cada polo de las cuatro dimensiones MBTI; BERT las representa y su similitud coseno con el usuario produce una distribución que se combina con la etiqueta one-hot antes de una pérdida KL. La función total suma detección y contraste con lambda 1. El estudio compara macro-F1 por eje y promedio en Kaggle y PANDORA, ejecuta ablaciones solo en Kaggle, compara ChatGPT zero-shot, CoT y 3-shot, y ajusta lambda en validación.

Muestra: La unidad es el usuario, no el LLM. Kaggle contiene 8.675 usuarios divididos en 5.205 de entrenamiento, 1.735 de validación y 1.735 de prueba. PANDORA contiene 9.067 usuarios divididos en 5.440, 1.813 y 1.814. Cada usuario aporta como máximo 50 publicaciones; cada publicación y análisis se trunca a 70 palabras. Las prevalencias son muy desiguales: por ejemplo, S/N es 727/4.478 en entrenamiento de Kaggle y 610/4.830 en PANDORA. Las etiquetas proceden de tipos MBTI declarados en PersonalityCafe o extraídos de autodescripciones de Reddit, no de una evaluación clínica administrada por el estudio.

Hallazgos

  • El problema es clasificación de personalidad humana a partir de texto; el LLM actúa como generador de supervisión auxiliar y no como sujeto evaluado.
  • TAE genera para cada publicación tres análisis: semántico, de sentimiento y lingüístico.
  • El prompt de generación pide analizar características de un usuario y omitir un posible final truncado con puntos suspensivos.
  • La publicación y cada análisis forman pares positivos; otros pares del minibatch funcionan como negativos en InfoNCE.
  • BERT usa el estado CLS y una proyección MLP con tanh para el contraste.
  • La representación de usuario es la media de las representaciones BERT de sus publicaciones originales.
  • El LLM también describe semántica, sentimiento y lingística de cada polo MBTI para obtener representaciones de etiqueta.
  • Las etiquetas suaves combinan la similitud usuario-etiqueta con la etiqueta one-hot mediante alfa 4 y se optimizan con KL.
  • La pérdida final es Ldet + lambda Lcl; no contiene un término separado para destilación de logits del LLM.
  • En inferencia no se generan análisis: el coste del LLM queda en la preparación del entrenamiento.
  • Los dos conjuntos usan cuatro clasificadores binarios MBTI y muestran desequilibrio severo.
  • La partición declarada es 60/20/20 después de barajar, siguiendo D-DGCN.
  • TAE obtiene 72,07 de macro-F1 medio en Kaggle y 63,05 en PANDORA.
  • En Kaggle el mejor baseline es D-DGCN+l0 con 71,35; en PANDORA es D-DGCN con 62,01.
  • La prosa intercambia los nombres de esos dos baselines, aunque los valores y la tabla permiten reconstruir la comparación correcta.
  • Las ganancias sobre el mejor baseline son 0,72 y 1,04 puntos absolutos; 1,01% y 1,68% son mejoras relativas, no puntos de macro-F1.
  • Frente a BERTmean, TAE mejora 5,83 puntos en Kaggle y 6,53 en PANDORA.
  • Retirar el aumento lingüístico produce la mayor caída entre los tres tipos, de 72,07 a 71,07.
  • Retirar el aumento semántico deja 71,40 y retirar sentimiento 71,25; las diferencias entre los tres son pequeñas y no incluyen incertidumbre.
  • Retirar las descripciones de etiquetas deja 72,02, solo 0,05 puntos por debajo del modelo completo.
  • Eliminar todos los componentes reproduce BERTmean con 66,24 en Kaggle.
  • TAEConcat y TAEWS alcanzan 67,91 y 67,31: usar los textos generados como entrada mejora BERTmean, pero menos que el entrenamiento contrastivo.
  • ChatGPT zero-shot obtiene 66,89 en Kaggle, CoT 65,12 y 3-shot 67,74.
  • La afirmación textual de que CoT y few-shot disminuyen el rendimiento contradice la tabla: 3-shot mejora 0,85 puntos frente a zero-shot.
  • La comparación 3-shot cambia de gpt-3.5-turbo-0301 a gpt-3.5-turbo-16k-0613 por la longitud del contexto.
  • Lambda se busca entre 0,5 y 4 y alcanza el mejor valor de validación en 1 para ambos conjuntos.
  • El artículo no enlaza un repositorio ni publica artefactos de código o salidas generadas.
  • La versión final fue publicada en AAAI-24, volumen 38(16), páginas 18234-18242, con DOI 10.1609/aaai.v38i16.29782.

Limitaciones

  • No se reportan ejecuciones con distintas semillas, desviaciones, intervalos de confianza ni pruebas de significación.
  • Las ventajas de 0,72 y 1,04 puntos sobre el mejor baseline podrían estar dentro de la variación de entrenamiento no medida.
  • La prosa confunde mejora relativa con puntos absolutos y cambia los nombres de los mejores baselines entre datasets.
  • Las ablaciones se limitan a Kaggle y presentan una sola cifra por configuración.
  • El efecto de la información de etiquetas es de solo 0,05 puntos y no se demuestra que exceda el ruido experimental.
  • No se valida manualmente si los análisis generados son correctos, relevantes, consistentes o libres de alucinaciones.
  • No se compara la calidad de GPT-3.5 con aumentos humanos, reglas no generativas o modelos generadores distintos.
  • El prompt genera tres perspectivas en una sola respuesta; no se documenta cómo se separan, limpian o manejan respuestas mal formadas.
  • Otros ejemplos del minibatch pueden ser falsos negativos semánticos o pertenecer al mismo tipo MBTI.
  • La proximidad entre una publicación y su paráfrasis analítica no prueba que la representación aprendida sea específicamente de personalidad.
  • La similitud entre embeddings BERT de descripciones generadas y usuarios no valida relaciones psicológicas entre polos MBTI.
  • La motivación de etiquetas suaves reconoce que las dicotomías pierden posición en una escala, pero el conjunto no contiene puntuaciones continuas con las que comprobar esa neutralidad.
  • Las etiquetas MBTI son autodeclaradas o extraídas de autodescripciones, no verificadas mediante una administración controlada del instrumento.
  • No se estudia error de extracción de etiquetas en PANDORA ni cambios de tipo declarados por una misma persona.
  • El MBTI se usa como cuatro etiquetas binarias sin examinar fiabilidad, validez de constructo, estabilidad o adecuación para inferencia automatizada.
  • El artículo cita evidencia Big Five para fundamentar errores de cuestionario, pero la tarea y las etiquetas experimentales son MBTI.
  • Los conjuntos están muy desequilibrados y solo se reporta macro-F1 por eje; faltan resultados por clase, matrices de confusión y calibración.
  • Promediar cuatro macro-F1 oculta diferencias: en PANDORA TAE baja frente a D-DGCN en T/F y P/J pese a ganar en promedio.
  • No se reportan resultados desagregados por idioma, demografía, comunidad, actividad, longitud de historial u otros subgrupos.
  • No se evalúa equidad ni si el sistema amplifica estereotipos de personalidad presentes en GPT-3.5 o en las plataformas.
  • No hay evaluación cruzada: entrenar en PersonalityCafe y probar en Reddit, o viceversa, revelaría generalización de dominio.
  • No se compara con una partición temporal ni con usuarios o plataformas nuevas fuera de los benchmarks.
  • Aunque se sustituyen palabras que coinciden con etiquetas por <type>, no se auditan otras expresiones explícitas que puedan filtrar el tipo.
  • No se publica la semilla del barajado, los identificadores de cada partición ni controles de duplicados o solapamientos.
  • Truncar a 50 publicaciones y 70 palabras puede excluir información de forma desigual; no hay análisis de sensibilidad.
  • El estudio no informa cuántas llamadas a GPT se hicieron, tokens, coste, fallos, reintentos ni almacenamiento de respuestas.
  • Usar un snapshot retirado de GPT-3.5 y no publicar sus salidas impide regenerar exactamente el conjunto aumentado.
  • La comparación zero-shot, CoT y 3-shot no es limpia porque 3-shot usa otro snapshot con una ventana distinta.
  • El few-shot selecciona aleatoriamente tres ejemplos, pero no informa semilla, balance de clases ni sensibilidad a las demostraciones.
  • Una sola realización a temperatura cero no mide variación por backend, versiones del servicio o no determinismo residual.
  • La inferencia no usa LLM, pero el entrenamiento exige una generación masiva previa cuyo coste y huella no se comparan con la mejora.
  • No se publica código, configuración completa, checkpoints, prompts de clasificación, salidas generadas ni scripts de evaluación.
  • La formulación de la pérdida contrastiva y el manejo de tres positivos por publicación requieren decisiones de implementación no resolubles solo con las ecuaciones.
  • No se aclara si todos los baselines fueron reejecutados bajo exactamente las mismas particiones, preprocesamiento y semillas o si alguna cifra fue tomada de trabajos previos.
  • No existe una sección de limitaciones, impacto, ética o privacidad pese a inferir atributos psicológicos de usuarios de foros y Reddit.
  • No se discuten consentimiento, expectativas contextuales, anonimización, retención o uso secundario de publicaciones potencialmente sensibles.
  • La aplicación a diálogo o tratamiento psicológico se menciona como motivación, pero no se evalúa seguridad ni utilidad en esos contextos de alto riesgo.

Qué no demuestra

  • No demuestra que un LLM tenga personalidad, rasgos psicológicos o una identidad propia.
  • No evalúa la personalidad expresada por GPT-3.5; evalúa su utilidad como generador auxiliar y clasificador de personas.
  • No demuestra que MBTI sea una representación completa, continua o clínicamente válida de la personalidad.
  • No demuestra que las etiquetas autodeclaradas sean verdad objetiva sobre cada usuario.
  • No establece que los análisis generados contengan conocimiento psicolingüístico correcto.
  • No aísla si la mejora procede del contenido del LLM, de una paráfrasis, de regularización contrastiva o de más texto.
  • No demuestra que las descripciones de etiquetas contribuyan materialmente al rendimiento.
  • No demuestra una mejora estadísticamente fiable sobre el mejor baseline.
  • No establece un nuevo estado del arte robusto a semillas, particiones o datasets distintos.
  • No demuestra que CoT perjudique en general la detección de personalidad.
  • No demuestra que few-shot perjudique; la propia tabla muestra una mejora sobre zero-shot.
  • No permite comparar causalmente gpt-3.5-turbo-0301 con la condición 3-shot basada en 16k-0613.
  • No demuestra generalización entre PersonalityCafe y Reddit ni a otras plataformas.
  • No demuestra validez en otros idiomas, culturas, periodos o modelos de personalidad.
  • No establece rendimiento justo para clases minoritarias o grupos demográficos.
  • No demuestra ausencia de fuga de etiqueta, memorization, duplicados o contenido generado por bots.
  • No demuestra que la predicción sea apta para diagnóstico, selección laboral, educación, salud o personalización de alto impacto.
  • No demuestra que inferir personalidad sin consentimiento sea ético o compatible con las expectativas de los usuarios.
  • No permite reproducir exactamente las cifras sin las salidas históricas de GPT, el código y las particiones.
  • No demuestra que eliminar el LLM en inferencia elimine su coste, sesgos o dependencia del proceso de entrenamiento.

Trazabilidad

Alcance: Texto completo

Versión: AAAI-24 final proceedings paper, volume 38 issue 16, pp. 18234-18242, DOI 10.1609/aaai.v38i16.29782, 9 pages

Fuente consultada: https://ojs.aaai.org/index.php/AAAI/article/download/29782/31350

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, task-scope, psychometric, experimental-design, result-arithmetic, internal-consistency, reproducibility, privacy and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • TAE (Text Augmentation Enhanced personality detection model)
  • gpt-3.5-turbo-0301 como generador y clasificador zero-shot/CoT
  • gpt-3.5-turbo-16k-0613 para la condición 3-shot
  • bert-base-uncased como codificador de publicaciones, aumentos y etiquetas
  • SVM
  • XGBoost
  • BiLSTM
  • BERTconcat
  • BERTmean
  • AttRCNN
  • SN+Attn
  • Transformer-MD
  • TrigNet
  • D-DGCN
  • D-DGCN+l0
  • TAEConcat
  • TAEWS

Instrumentos y métricas

  • Cuatro dicotomías MBTI: I/E, S/N, T/F y P/J
  • Macro-F1 por dimensión y media no ponderada de las cuatro
  • Pérdida InfoNCE post-aumento con negativos en minibatch
  • Etiquetas suaves mediante similitud coseno, softmax y alfa 4
  • Pérdida KL multieje para detección
  • Ablaciones de aumentos semántico, de sentimiento, lingüístico y de etiquetas
  • Comparación zero-shot, chain-of-thought y 3-shot de ChatGPT
  • Barrido de lambda en validación

Datos utilizados

  • Kaggle MBTI / PersonalityCafe: 8.675 usuarios, 45-50 publicaciones por usuario
  • PANDORA / Reddit: 9.067 usuarios, decenas a cientos de publicaciones y etiquetas MBTI extraídas de autodescripciones

Evidencia y localización

  • Registro bibliográfico oficial: AAAI article 29782: authors, abstract, DOI 10.1609/aaai.v38i16.29782, published 24 Mar 2024, volume 38 issue 16, pp. 18234-18242
  • Fuente completa auditada: .cache/editorial-sources/article-092/source.pdf; official AAAI-24 PDF; 9 pages; sha256 a6a3b33927c4a1d4fcb7050c76325eae7432da1ec6046d94dd68d6085c2adc96
  • Objetivo y contribuciones declaradas: Full text pp. 18234-18235, Abstract and Introduction
  • El LLM como generador auxiliar: Full text pp. 18235-18236, Method and Generating Knowledgeable Post Augmentations
  • Prompt de análisis de publicaciones: Full text p. 18236, displayed instruction under Generating Knowledgeable Post Augmentations
  • Codificador contrastivo: Full text pp. 18236-18237, Equations 1-6
  • Descripciones y representaciones de etiquetas: Full text p. 18237, Equation 7
  • Etiquetas suaves y pérdida: Full text pp. 18237-18238, Equations 8-12
  • Composición de los datasets: Full text p. 18238, Datasets and Table 1
  • Partición 60/20/20: Full text p. 18238, Datasets paragraph
  • Desequilibrio por dimensión: Full text p. 18238, Table 1
  • Baselines: Full text p. 18238, Baselines section
  • Hiperparámetros y truncamiento: Full text p. 18239, Implementation Details
  • Resultados completos: Full text p. 18239, Table 2
  • Ganancias absolutas y relativas: Full text p. 18239, Table 2 and Overall Results; 72.07-71.35=0.72 and 63.05-62.01=1.04
  • Intercambio de nombres de baselines en la prosa: Full text p. 18239, Table 2 versus Overall Results lines naming D-DGCN and D-DGCN+l0
  • Ablaciones de componentes: Full text pp. 18239-18240, Table 3 and Ablation Study
  • Aporte mínimo de etiquetas: Full text p. 18239, Table 3: TAE 72.07 versus TAE without label 72.02
  • Comparación de concatenación, suma y contraste: Full text pp. 18239-18240, Table 3 and second half of Ablation Study
  • Resultados directos de ChatGPT: Full text p. 18240, Table 4: zero-shot 66.89, CoT 65.12, 3-shot 67.74
  • Contradicción few-shot: Full text p. 18240, Table 4 versus LLM Performance statement that both CoT and few-shot decreased
  • Cambio de snapshot en 3-shot: Full text p. 18240, LLM Performance: 0301 switched to 16k-0613 because input exceeded limit
  • Ajuste de lambda: Full text p. 18240, Figure 4 and Effect of Trade-Off Parameter
  • Conclusiones declaradas: Full text p. 18240, Conclusion
  • Ausencia de análisis de limitaciones y ética: Full 9-page paper structure: no limitations, ethics, privacy, fairness or broader-impact section
  • Ausencia de código enlazado: Full paper footnotes 1-5 and official AAAI record: dataset/platform/ChatGPT links only; no repository or software artifact link identified
  • Lectura y comprobación visual integral: All 9 pages rendered and inspected, including Figures 1-4, Tables 1-4, equations, footnotes, conclusion and references; checked 15 Jul 2026