El artículo evalúa si text-davinci-003 puede clasificar en zero-shot los cinco grandes rasgos a partir de 20 publicaciones de Facebook por persona. Parte de 202 participantes estadounidenses que habían consentido compartir publicaciones y responder una batería psicológica; tras exigir exactamente 20 posts del último año quedan 142 personas, con scores Big Five continuos de 1 a 5. Los autores convierten esos scores en dos o tres clases mediante cuantiles y comparan cuatro prompts: uno básico y tres que añaden una definición de manual, listas de palabras correlacionadas o dos ítems del cuestionario. El baseline trivial predice la clase más frecuente (MFC) y el comparador fuerte es WT-LEX, una regresión ridge supervisada sobre n-gramas y temas LDA entrenada previamente con datos de Facebook. En clasificación binaria, GPT-3 obtiene macro-F1 medio de 0,400 con el prompt básico, 0,419 con definición, 0,441 con palabras y 0,454 con ítems; MFC logra 0,379 y WT-LEX 0,518. El mejor prompt de GPT-3 supera a WT-LEX en responsabilidad (0,521 frente a 0,393) y extraversión (0,569 frente a 0,516), pero queda por debajo en apertura, amabilidad y neuroticismo. Al pasar de dos a tres clases, el macro-F1 medio del prompt de ítems cae de 0,454 a 0,230, cerca del MFC de tres clases citado como 0,212; esto respalda la conclusión explícita del trabajo de que el modelo no es adecuado para estimación fina o continua. Cambiar las parejas de ítems produce promedios de 0,430–0,454, sin una ventaja estable de una formulación. El análisis LIWC sugiere que GPT-3 capta mejor lenguaje social para extraversión, pero falla en asociaciones de procesos sociales y afecto con apertura. La evidencia corresponde a una única instantánea cerrada, una muestra pequeña y clasificación relativa al propio conjunto; no valida evaluación psicométrica individual ni uso clínico. La revisión del repositorio público confirma los prompts y las llamadas a text-davinci-003, pero no permite reproducción completa: faltan datos, predicciones, código de métricas, baseline, análisis estadístico y configuración lista para ejecutar; además, el PDF usa frequency_penalty=0,1 y el código público 0,0.
Pregunta de investigación
¿Qué conocimiento sobre los rasgos mejora la estimación zero-shot de personalidad con GPT-3, cómo se compara con un modelo léxico supervisado, cuánto empeora al aumentar la granularidad y mantiene sus predicciones al cambiar los ítems externos del prompt?