Systematic Evaluation of GPT-3 for Zero-Shot Personality Estimation

Evaluación y validez psicométrica2023ACL AnthologyRevisión editorial aprobada

Autores: Adithya V Ganesan, Yash Kumar Lal, August Håkan Nilsson, H. Andrew Schwartz

Palabras clave: personality estimation, GPT-3, zero-shot learning, Big Five traits, social media analysis, human-level NLP, psychometrics

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
20
Hallazgos
35
Limitaciones
20
Evidencias

Resumen editorial

Español

El artículo evalúa si text-davinci-003 puede clasificar en zero-shot los cinco grandes rasgos a partir de 20 publicaciones de Facebook por persona. Parte de 202 participantes estadounidenses que habían consentido compartir publicaciones y responder una batería psicológica; tras exigir exactamente 20 posts del último año quedan 142 personas, con scores Big Five continuos de 1 a 5. Los autores convierten esos scores en dos o tres clases mediante cuantiles y comparan cuatro prompts: uno básico y tres que añaden una definición de manual, listas de palabras correlacionadas o dos ítems del cuestionario. El baseline trivial predice la clase más frecuente (MFC) y el comparador fuerte es WT-LEX, una regresión ridge supervisada sobre n-gramas y temas LDA entrenada previamente con datos de Facebook. En clasificación binaria, GPT-3 obtiene macro-F1 medio de 0,400 con el prompt básico, 0,419 con definición, 0,441 con palabras y 0,454 con ítems; MFC logra 0,379 y WT-LEX 0,518. El mejor prompt de GPT-3 supera a WT-LEX en responsabilidad (0,521 frente a 0,393) y extraversión (0,569 frente a 0,516), pero queda por debajo en apertura, amabilidad y neuroticismo. Al pasar de dos a tres clases, el macro-F1 medio del prompt de ítems cae de 0,454 a 0,230, cerca del MFC de tres clases citado como 0,212; esto respalda la conclusión explícita del trabajo de que el modelo no es adecuado para estimación fina o continua. Cambiar las parejas de ítems produce promedios de 0,430–0,454, sin una ventaja estable de una formulación. El análisis LIWC sugiere que GPT-3 capta mejor lenguaje social para extraversión, pero falla en asociaciones de procesos sociales y afecto con apertura. La evidencia corresponde a una única instantánea cerrada, una muestra pequeña y clasificación relativa al propio conjunto; no valida evaluación psicométrica individual ni uso clínico. La revisión del repositorio público confirma los prompts y las llamadas a text-davinci-003, pero no permite reproducción completa: faltan datos, predicciones, código de métricas, baseline, análisis estadístico y configuración lista para ejecutar; además, el PDF usa frequency_penalty=0,1 y el código público 0,0.

English

The paper evaluates whether text-davinci-003 can classify Big Five traits zero-shot from 20 Facebook posts per person. It starts with 202 US participants who consented to share posts and complete a psychological battery; requiring exactly 20 posts from the final year leaves 142 people with continuous Big Five scores from 1 to 5. The authors turn those scores into two or three classes using quantiles and compare four prompts: a basic prompt and three variants adding a textbook definition, correlated word lists, or two questionnaire items. The trivial baseline predicts the most frequent class (MFC), while the strong comparator is WT-LEX, a supervised ridge regression over n-grams and LDA topics previously trained on Facebook data. In binary classification, GPT-3 obtains mean macro-F1 of 0.400 with the basic prompt, 0.419 with a definition, 0.441 with word lists, and 0.454 with questionnaire items; MFC reaches 0.379 and WT-LEX 0.518. GPT-3’s best prompt exceeds WT-LEX on conscientiousness (0.521 versus 0.393) and extraversion (0.569 versus 0.516), but trails it on openness, agreeableness, and neuroticism. Moving from two to three classes lowers the item-prompt mean macro-F1 from 0.454 to 0.230, close to the three-class MFC reported as 0.212; this supports the paper’s explicit conclusion that the model is unsuitable for fine-grained or continuous estimation. Changing the item pairs yields averages from 0.430 to 0.454, with no stable advantage for one formulation. The LIWC analysis suggests that GPT-3 handles social language for extraversion better, but misses associations between social/affective language and openness. The evidence concerns one closed model snapshot, a small sample, and classification relative to this dataset; it does not validate individual psychometric assessment or clinical use. Inspection of the public repository confirms the prompts and text-davinci-003 calls but does not support complete reproduction: data, predictions, metric code, the baseline, statistical analyses, and a runnable configuration are absent; the PDF also sets frequency_penalty to 0.1 while the public code sets it to 0.0.

Pregunta de investigación

¿Qué conocimiento sobre los rasgos mejora la estimación zero-shot de personalidad con GPT-3, cómo se compara con un modelo léxico supervisado, cuánto empeora al aumentar la granularidad y mantiene sus predicciones al cambiar los ítems externos del prompt?

Método

Estudio de clasificación zero-shot sobre 142 usuarios estadounidenses con 20 posts de Facebook anonimizados y cinco scores Big Five. Los scores continuos [1,5] se discretizan por cuantiles en dos y tres clases. text-davinci-003 recibe los 20 posts cronológicos y un prompt BASIC, TEXTBOOK, WORDLIST o ITEMDESC; genera un único token a temperatura cero. Se calcula macro-F1 por rasgo y promedio y se compara con MFC y WT-LEX. Se permutan cuatro parejas de ítems positivos/negativos para analizar sensibilidad. Finalmente se comparan categorías LIWC mediante diferencias estandarizadas y log-odds en casos donde GPT-3 y WT-LEX discrepan. El anexo documenta prompts y parámetros; la revisión independiente inspeccionó además el repositorio público.

Muestra: De 202 participantes con resultados psicológicos y publicaciones de Facebook se retienen 142 usuarios estadounidenses con exactamente 20 posts del último año. El texto informa una proporción de género 79:18:3 (mujer:hombre:otros), edades de 21 a 66 años y mediana de 37. Cada persona aporta cinco scores Big Five en [1,5], después discretizados por cuantiles. No se informa distribución racial, educativa, socioeconómica o regional ni los umbrales exactos resultantes.

Hallazgos

  • En clasificación binaria, los promedios macro-F1 son 0,379 para MFC, 0,518 para WT-LEX, 0,400 para BASIC, 0,419 para TEXTBOOK, 0,441 para WORDLIST y 0,454 para ITEMDESC.
  • ITEMDESC es la mejor variante de GPT-3 en promedio, pero permanece 0,064 puntos por debajo de WT-LEX.
  • Por rasgo, ITEMDESC obtiene 0,342 en apertura, 0,521 en responsabilidad, 0,569 en extraversión, 0,488 en amabilidad y 0,349 en neuroticismo.
  • WT-LEX obtiene 0,492 en apertura, 0,393 en responsabilidad, 0,516 en extraversión, 0,609 en amabilidad y 0,578 en neuroticismo.
  • GPT-3 supera numéricamente a WT-LEX solo en responsabilidad y extraversión; su mayor déficit aparece en neuroticismo.
  • WORDLIST es la mejor variante GPT-3 para apertura, amabilidad y neuroticismo, mientras ITEMDESC lo es para responsabilidad y extraversión.
  • Las predicciones de GPT-3 están fuertemente sesgadas hacia alta apertura y bajo neuroticismo, según el análisis de los autores.
  • Combinar todos los tipos de conocimiento reduce el rendimiento por debajo de BASIC; el artículo no ofrece tabla ni configuración sistemática para ordenar o componer esa combinación.
  • Al pasar de dos a tres clases, ITEMDESC cae de un macro-F1 medio de 0,454 a 0,230.
  • En tres clases, los macro-F1 por rasgo son 0,141, 0,288, 0,240, 0,160 y 0,320 para apertura, responsabilidad, extraversión, amabilidad y neuroticismo.
  • El promedio de tres clases queda cerca del MFC de tres clases citado en el texto como 0,212, por lo que la utilidad se degrada al aumentar granularidad.
  • Cambiar las parejas de ítems de ITEMDESC da promedios 0,454, 0,448, 0,430 y 0,448; las diferencias globales son pequeñas.
  • Las variaciones por rasgo no son idénticas: por ejemplo, la mejor pareja de apertura alcanza 0,374 y la de amabilidad 0,523, mientras neuroticismo permanece entre 0,333 y 0,364.
  • Los factor loadings de las parejas alternativas, calculados en una muestra externa N=741, varían poco para la mayoría de los rasgos y se usan como explicación de la similitud global.
  • En extraversión, los casos donde solo GPT-3 acierta contienen más categorías NUMBER, SOCIAL, AFFILIATION y YOU que los demás casos comparados.
  • En apertura, los errores exclusivos de GPT-3 contienen más THEY, FOCUSPAST, AFFECT, ACHIEVE y SOCIAL que el conjunto de contraste.
  • El artículo interpreta esos patrones como una ventaja contextual para léxico social y una carencia al relacionar lenguaje afectivo/social con apertura; es un análisis asociativo de errores, no una prueba del mecanismo interno.
  • El paper informa aprobación de un comité institucional, consentimiento, certificación de los investigadores y anonimización de posts; recomienda supervisión clínica y análisis de disparidades antes de cualquier uso clínico.
  • El repositorio público contiene generador de prompts, cliente de OpenAI y plantillas, con Python 3.9.6 recomendado y dependencias openai 0.26.0 y pandas 1.5.2.
  • El repositorio no contiene datos, outputs, evaluación, baseline ni análisis de tablas, de modo que reproduce la emisión de consultas solo si se reconstruyen inputs privados y configuración, no los resultados publicados de extremo a extremo.

Limitaciones

  • La muestra efectiva es pequeña: 142 personas, con solo 20 posts cada una.
  • Todos los participantes son de Estados Unidos y la proporción de género 79:18:3 está muy desequilibrada; no se evalúa generalización cultural o lingüística.
  • El texto no caracteriza raza, educación, región, nivel socioeconómico, idioma, plataforma de uso o periodo exacto de recogida de la muestra efectiva.
  • Exigir exactamente 20 posts y limitarse al último año puede introducir sesgo de selección y descartar información longitudinal relevante.
  • Los cinco rasgos son continuos, pero la evaluación principal los reduce a sí/no mediante cuantiles; la propia sección de limitaciones reconoce que ello contradice el propósito descriptivo del Big Five.
  • Los umbrales de cuantiles son relativos a esta muestra, no puntos de corte psicométricos clínicos o normativos.
  • La caída a tres clases muestra que el resultado binario no se traslada a estimación fina; no se ejecuta la regresión continua que correspondería al constructo.
  • Solo se evalúa text-davinci-003, una única instantánea cerrada, sin comparación entre tamaños, familias o versiones del mismo proveedor.
  • Temperatura cero se presenta como reproducible, pero no se repiten consultas para medir estabilidad ni se documenta un identificador inmutable del backend.
  • La salida se restringe a un token y dos casos necesitaron añadir saltos de línea manualmente para producir una etiqueta válida; no se reporta sistemáticamente la tasa total de salidas inválidas.
  • La intervención manual post hoc en dos prompts reduce la pureza del protocolo uniforme y no está automatizada en el repositorio.
  • El PDF fija frequency_penalty=0,1, mientras src/gpt.py del repositorio público usa 0,0; esta discrepancia impide saber qué configuración produjo exactamente las tablas.
  • El repositorio publicado en un único commit de 2023 no incluye licencia, datos, configuración de ejemplo, archivo de entorno completo, outputs, hashes de prompts ni instrucciones experimentales detalladas.
  • No hay en el repositorio código de discretización, cálculo de macro-F1, pruebas de significación, WT-LEX, LIWC, factor loadings o generación de tablas y figuras.
  • El README solo indica crear un entorno e instalar dependencias; gpt.py importa un config.py ausente y requiere reconstruir rutas e inputs no documentados.
  • Los datos sensibles no se publican, comprensiblemente, pero tampoco se ofrece un conjunto sintético con el mismo esquema, estadísticas agregadas suficientes o respuestas cacheadas que permitan verificar el pipeline.
  • La comparación con WT-LEX depende de un modelo entrenado previamente en datos de Facebook distintos; el artículo no documenta en detalle compatibilidad de dominios, solapamiento posible, recalibración o procedencia de cada artefacto.
  • WT-LEX produce scores continuos y después se discretiza para la comparación, mientras GPT-3 predice etiquetas directamente; los sistemas no resuelven exactamente la misma tarea de origen.
  • Se informa significación frente a WT-LEX con símbolos, pero no se identifica en el texto principal la prueba estadística, unidad de remuestreo, intervalos de confianza o corrección por comparaciones múltiples.
  • Macro-F1 es la única métrica principal; faltan matrices de confusión, precisión/recall por clase, calibración, balanced accuracy e incertidumbre de las diferencias.
  • Se ensayan múltiples rasgos, prompts y formulaciones; no se ofrece un protocolo preregistrado ni separación entre exploración y confirmación.
  • ITEMDESC incorpora al prompt ítems del mismo instrumento que define el objetivo; es una elección razonable para describir el constructo, pero limita atribuir el resultado a comprensión espontánea de personalidad.
  • No se compara con estimadores humanos que lean los mismos 20 posts, por lo que la etiqueta de tarea ‘human-level’ no implica paridad humana.
  • El análisis LIWC selecciona casos según discrepancias de acierto y después describe categorías; no demuestra causalidad ni que esas categorías estén representadas en un supuesto espacio de embeddings de la API.
  • El artículo infiere que patrones de lenguaje están codificados en el embedding space de GPT-3, pero no accede ni analiza embeddings o activaciones de text-davinci-003.
  • La descripción atribuye la anonimización a un modelo NER de SciPy, aunque SciPy no es una biblioteca NER; no se aclara si se quiso decir spaCy ni se valida la eficacia de desidentificación.
  • El código público no contiene el pipeline de anonimización, por lo que ese componente de privacidad no puede auditarse.
  • Aunque se informa aprobación de un comité institucional, no se identifica institución, protocolo, fecha, gestión de retirada o riesgo residual de reidentificación de 20 posts concatenados.
  • No se evalúan disparidades por género, edad u otros grupos, pese a que el Ethics Statement recomienda hacerlo antes del uso aplicado.
  • No se prueban ataques de privacidad, memorización, inferencia de atributos sensibles o exposición accidental al enviar posts a una API comercial.
  • No se analiza coste exacto, latencia, tasa de error del servicio o dependencia de claves aportadas por distintas personas.
  • Las restricciones de coste y ventana impidieron explorar few-shot, historial más largo, sensibilidad al número de posts o aprendizaje en contexto.
  • Las listas WORDLIST incluyen términos potencialmente ofensivos y asociaciones culturales fechadas; no se examina si inducen estereotipos o sesgo demográfico.
  • La validación se limita a Facebook y a inglés, sin transferencia a conversación, otros géneros textuales, otras plataformas o periodos temporales.
  • No hay validación clínica, diagnóstica, de toma de decisiones, ni estudio del daño que producirían falsos positivos y falsos negativos en uso real.

Qué no demuestra

  • No demuestra que GPT-3 mida personalidad continua de forma válida; la mejor evidencia es clasificación binaria relativa a la muestra.
  • No valida text-davinci-003 como sustituto de un inventario Big Five administrado a personas.
  • No demuestra paridad con humanos ni con el estado del arte: el promedio queda por debajo de WT-LEX.
  • No demuestra un rendimiento robusto en tres clases, regresión o perfiles finos; precisamente observa una caída cercana al baseline trivial.
  • No prueba que GPT-3 posea personalidad, rasgos internos, autoconocimiento o comprensión psicológica humana.
  • No prueba que el modelo infiera causas, historia vital o estados clínicos a partir de publicaciones.
  • No demuestra estabilidad entre ejecuciones, actualizaciones del proveedor, paráfrasis amplias, longitudes de historial o idiomas.
  • No demuestra generalización fuera de 142 usuarios estadounidenses de Facebook.
  • No establece validez factorial, invariancia, fiabilidad test-retest, validez incremental o calibración psicométrica de las predicciones del modelo.
  • No prueba utilidad clínica, seguridad, beneficio terapéutico ni adecuación para selección laboral, publicidad o decisiones de alto impacto.
  • No demuestra ausencia de sesgo por género, edad, cultura, dialecto, raza o nivel socioeconómico.
  • No convierte correlaciones LIWC en una explicación causal del mecanismo de GPT-3.
  • No demuestra que las asociaciones se encuentren en el embedding space, porque el estudio observa etiquetas de salida y no representaciones internas.
  • No prueba que los prompts con ítems sean universalmente mejores; las variantes por rasgo producen ventajas distintas y el promedio cambia poco.
  • No demuestra que combinar más conocimiento mejore: el intento informado empeora frente al prompt básico.
  • No establece que el repositorio permita reproducir las tablas completas ni verificar todos los análisis.
  • No demuestra que la desidentificación elimine el riesgo de reidentificar textos sociales sensibles.
  • No autoriza interpretar los scores como diagnóstico, recomendación terapéutica o etiqueta estable de una persona.

Trazabilidad

Alcance: Texto completo

Versión: WASSA 2023 proceedings, pp. 390–400; code repository commit 231fdebfbaba17ecd3a1dd08f1a47b151fce3025

Fuente consultada: https://aclanthology.org/2023.wassa-1.34.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, metadata, dataset, Big-Five operationalization, prompt, baseline, metric, statistical-claim, privacy, ethics, code-reproducibility and evidence-level audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI text-davinci-003, described as GPT-3
  • WT-LEX: pretrained ridge regression over dimension-reduced n-grams and LDA topics from Park et al. (2015)
  • Most Frequent Class baseline
  • BASIC zero-shot prompt
  • TEXTBOOK trait-definition prompt
  • WORDLIST correlated-unigram prompt
  • ITEMDESC questionnaire-item prompt
  • Combined-knowledge prompt attempted but reported only narratively

Instrumentos y métricas

  • Mini-IPIP / four Big Five questionnaire items per trait in the source battery
  • Quantile discretization into binary and ternary labels
  • Macro-F1 per trait and mean across traits
  • LIWC language categories for error analysis
  • Cohen’s d for category-distribution differences
  • Log odds ratio with informative Dirichlet prior
  • External factor loadings for alternate item pairs

Datos utilizados

  • Consenting Facebook-post and psychological-assessment dataset described by Jose et al. (2022): 202 participants before filtering
  • Evaluation subset: 142 US users with exactly 20 posts from the final year and five Big Five scores
  • Kosinski et al. (2013) Facebook data used to train WT-LEX and an external N=741 subset used for item factor loadings
  • Trait-correlated unigram lists from Schwartz et al. (2013)
  • Private Facebook text and labels are not included in the public code repository

Evidencia y localización

  • Identidad, autores, abstract y disponibilidad de código: ACL proceedings PDF p. 1 (printed p. 390), title and abstract
  • Preguntas del estudio y marco Big Five: PDF pp. 1–2, Introduction and Background
  • Muestra inicial, filtro a 142, demografía, posts y scores: PDF p. 2 (printed p. 391), section 3 Dataset
  • Discretización binaria/ternaria y cuatro tipos de prompt: PDF p. 2, section 4 Experimental Design
  • Baseline WT-LEX y métrica macro-F1: PDF p. 3 (printed p. 392), Baseline and Evaluation
  • Resultados por rasgo y por tipo de conocimiento: PDF p. 3, Table 1 and section 5
  • Sesgo hacia apertura alta y neuroticismo bajo y combinación de conocimiento: PDF p. 3, Results discussion
  • Caída de dos a tres clases: PDF p. 4 (printed p. 393), Table 2 and Problem Framing
  • Sensibilidad a parejas de ítems: PDF p. 4, Table 3 and Consistency with Survey Items
  • Análisis de errores SOCIAL/AFFECT: PDF pp. 4, 9–10, Figure 1 and Appendix C Tables 5–6
  • Conclusión explícita sobre estimación dimensional: PDF pp. 4–5, Conclusion
  • Consentimiento, IRB, anonimización y advertencias clínicas: PDF p. 5 (printed p. 394), Ethics Statement
  • Limitaciones de discretización, coste y ventana de contexto: PDF p. 5, Limitations
  • Modelo y parámetros publicados en el paper: PDF p. 9 (printed p. 398), Appendix A.1
  • Plantillas binarias y ternarias completas: PDF p. 9, Appendix A.2
  • Definiciones, listas de palabras e ítems inyectados: PDF p. 10 (printed p. 399), Figure 2
  • Ítems alternativos, factor loadings y macro-F1: PDF p. 11 (printed p. 400), Tables 7–8
  • Alcance del código público y discrepancia de frequency_penalty: GitHub humanlab/gpt3-personality-estimation commit 231fdeb, README.md, requirements.txt and src/gpt.py; inspected 15 Jul 2026
  • Ausencia de datos y pipeline completo en el repositorio: Public repository file inventory: README.md, requirements.txt and three Python files only; inspected 15 Jul 2026
  • Inspección visual: All 11 PDF pages rendered and visually inspected, including Figures 1–2 and Tables 1–8; checked 15 Jul 2026