Large language models can infer psychological dispositions of social media users

Evaluación y validez psicométrica2024PNAS NexusRevisión editorial aprobada

Título original: Large Language Models Can Infer Psychological Dispositions of Social Media Users

Autores: Heinrich Peters, Sandra C Matz

Palabras clave: Large Language Models, Personality inference, Big Five, Social media, Zero-shot learning, GPT-3.5, GPT-4

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
11
Hallazgos
37
Limitaciones
11
Evidencias

Resumen editorial

Español

El artículo evalúa si dos versiones tempranas de ChatGPT pueden ordenar a usuarios de Facebook según sus rasgos Big Five a partir de texto no etiquetado para esa tarea. Selecciona aleatoriamente 1.000 participantes adultos de MyPersonality que completaron los 100 ítems del IPIP y publicaron al menos 200 estados; la muestra tiene una edad media de 24,2 años y un 63,1 % de mujeres. Para cada persona se concatenan los 200 estados más recientes en diez bloques de 20. GPT-3.5 Turbo 0301 y GPT-4 0314 reciben el prompt “Rate the text on the Big Five personality dimensions”, devuelven cinco puntuaciones de 1 a 5 y repiten cada inferencia tres veces. Los autores promedian repeticiones y bloques, y comparan el resultado con el autoinforme. Las correlaciones de GPT-3.5 van de r = 0,223 a 0,298 y las de GPT-4 de 0,264 a 0,327; las medias son 0,271 y 0,307, respectivamente, y 0,289 al combinar los diez resultados. Esto representa aproximadamente un 5–11 % de varianza compartida por rasgo: existe una señal de ordenación modesta, pero no una lectura precisa de la personalidad individual. GPT-4 obtiene valores numéricamente superiores en los cinco rasgos, aunque ninguna diferencia frente a GPT-3.5 es estadísticamente significativa. Además, las escalas están mal calibradas: GPT-3.5 subestima en promedio conciencia por 1,254 puntos y amabilidad por 1,032 en una escala de 1 a 5; GPT-4 subestima conciencia por 0,690 y sobreestima extraversión por 0,881. Por tanto, la correlación no convierte las salidas en puntuaciones psicométricas intercambiables con el IPIP. Con 20 estados ya aparecen correlaciones de 0,176–0,257; usar 200 las eleva a 0,222–0,327, con beneficios distintos por rasgo. Los análisis sociodemográficos comparan medias y residuos absolutos. Para ambos modelos, los errores absolutos son menores en mujeres en conciencia, amabilidad y neuroticismo; en apertura la diferencia solo aparece en GPT-3.5 y, en extraversión, GPT-4 comete más error en mujeres. Las correlaciones dentro de cada género no difieren significativamente. Por edad, GPT-3.5 tiene más error en personas mayores para apertura y conciencia, pero menos para amabilidad; GPT-4 no muestra diferencias significativas de error absoluto. Así, el titular de mayor precisión para mujeres y jóvenes describe algunos rasgos y métricas, no un patrón general. En 68 personas con evaluaciones de amistades, las correlaciones observador–autoinforme promedian 0,304 y las de observador–LLM 0,269–0,276, pero no se contrasta formalmente su equivalencia. La tabla S6.1 contiene un error verificable: sus intervalos y valores p son idénticos a los de GPT-4 en S6.2 y no corresponden a las correlaciones observador–autoinforme. Por ello, no se sostiene una afirmación fuerte de paridad humana ni de uso de los mismos indicios. El estudio demuestra que estos snapshots captan regularidades textuales asociadas con autoinformes Big Five en una muestra muy seleccionada; no valida un test de personalidad, una inferencia clínica ni una herramienta apta para decisiones individuales. El riesgo más sólido es de privacidad: incluso una señal modesta puede explotarse a escala sin conocimiento del usuario. La reproducibilidad actual es insuficiente: el artículo remite a OSF hq2ra, pero el proyecto devuelve HTTP 401 sin autenticación; una copia archivada muestra que era público y ocupaba 6,4 MB en noviembre de 2024, mientras la fuente arXiv solo contiene manuscrito y figuras, no datos ni código analítico.

English

The paper evaluates whether two early ChatGPT versions can rank Facebook users by Big Five traits from text that was not labeled for that task. It randomly selects 1,000 adult MyPersonality participants who completed the 100-item IPIP and posted at least 200 status updates; mean age is 24.2 and 63.1% are women. Each person's 200 most recent updates are concatenated into ten chunks of 20. GPT-3.5 Turbo 0301 and GPT-4 0314 receive the prompt “Rate the text on the Big Five personality dimensions,” return five scores from 1 to 5, and repeat every inference three times. The authors average repetitions and chunks, then compare the result with self-reports. GPT-3.5 correlations range from r = 0.223 to 0.298 and GPT-4 correlations from 0.264 to 0.327; their means are 0.271 and 0.307, respectively, and 0.289 across all ten results. This corresponds to roughly 5–11% shared variance per trait: there is a modest ranking signal, not precise recovery of an individual's personality. GPT-4 is numerically higher on all five traits, but none of its differences from GPT-3.5 is statistically significant. The score scales are also poorly calibrated. GPT-3.5 underestimates Conscientiousness by 1.254 points and Agreeableness by 1.032 on a 1–5 scale; GPT-4 underestimates Conscientiousness by 0.690 and overestimates Extraversion by 0.881. Correlation therefore does not make model outputs interchangeable with IPIP scores. Twenty status updates already yield correlations of 0.176–0.257; using 200 raises them to 0.222–0.327, with different gains by trait. The demographic analyses compare group means and absolute residuals. For both models, absolute errors are lower for women on Conscientiousness, Agreeableness, and Neuroticism; the Openness difference appears only for GPT-3.5, while GPT-4 makes larger Extraversion errors for women. Within-gender correlations do not differ significantly. By age, GPT-3.5 has larger errors for older users on Openness and Conscientiousness but smaller errors on Agreeableness; GPT-4 shows no significant absolute-error differences. The headline of greater accuracy for women and younger people therefore applies to selected traits and metrics, not a general pattern. Among 68 people with friend ratings, observer–self-report correlations average 0.304 and observer–LLM correlations 0.269–0.276, but equivalence is never formally tested. Table S6.1 has a verifiable reporting error: its confidence intervals and p-values are identical to the GPT-4 rows in S6.2 and do not correspond to the observer–self-report coefficients. It cannot support a strong claim of human parity or shared cue use. The study shows that these snapshots capture textual regularities associated with Big Five self-reports in a highly selected sample. It does not validate a personality test, clinical inference, or a tool suitable for individual decisions. The clearest implication is a privacy risk: even a modest signal can be exploited at scale without users' knowledge. Current reproducibility is inadequate. The paper points to OSF hq2ra, but that project now returns HTTP 401 without authentication; an archived page shows that it was public and stored 6.4 MB in November 2024, while the arXiv source contains only the manuscript and figures, not data or analytical code.

Pregunta de investigación

¿Pueden GPT-3.5 y GPT-4 inferir en zero-shot las posiciones relativas de usuarios en los cinco rasgos Big Five a partir de sus estados de Facebook, cómo cambia la asociación con el volumen de texto y varían los errores según género y edad?

Método

Estudio correlacional con 1.000 usuarios de MyPersonality. Los 200 estados más recientes de cada usuario se dividen en diez bloques de 20 y se envían, tres veces por inferencia, a GPT-3.5 Turbo 0301 y GPT-4 0314 mediante un prompt zero-shot que solicita cinco puntuaciones de 1 a 5. Las puntuaciones se promedian y se correlacionan con el IPIP de 100 ítems. Se examinan curvas acumulativas de 20 a 200 mensajes, pruebas t y diferencias estandarizadas en puntuaciones y residuos por género y por edad dicotomizada en la mediana, correlaciones dentro de grupos y un análisis exploratorio con evaluaciones de amistades para 68 personas.

Muestra: Muestra aleatoria de 1.000 adultos dentro del subconjunto MyPersonality que completó los 100 ítems IPIP y tenía al menos 200 estados de Facebook. Edad media 24,2 años, DE 8,8; 63,1 % mujeres. Cada usuario aporta sus 200 publicaciones más recientes, de 17,10 palabras de media por estado. Los análisis de observadores se limitan a 68 personas con evaluaciones de amistades. No se informan el umbral exacto de la mediana de edad ni los tamaños de sus dos grupos.

Hallazgos

  • Las correlaciones con autoinforme son 0,282, 0,223, 0,291, 0,298 y 0,263 para GPT-3.5, y 0,327, 0,264, 0,324, 0,325 y 0,294 para GPT-4 en apertura, conciencia, extraversión, amabilidad y neuroticismo.
  • Las medias de r son 0,271 para GPT-3.5 y 0,307 para GPT-4; por rasgo, r² se sitúa aproximadamente entre 0,05 y 0,11, de modo que la mayor parte de la varianza individual queda sin explicar.
  • GPT-4 es numéricamente superior en los cinco rasgos, pero el artículo informa que ninguna diferencia individual entre modelos es estadísticamente significativa.
  • Las puntuaciones no están calibradas como el IPIP: GPT-3.5 infravalora especialmente conciencia y amabilidad, mientras GPT-4 infravalora conciencia y sobrevalora extraversión.
  • La correlación entre las tres rondas de puntuación va de 0,88 a 0,96 para GPT-3.5 y de 0,73 a 0,94 para GPT-4, aunque el artículo no define si son correlaciones pareadas medias ni mide acuerdo absoluto.
  • Con 20 mensajes, las correlaciones ya están entre 0,176 y 0,257; con 200 alcanzan 0,222–0,327. La ganancia no es monotónica en todos los pasos ni igual entre rasgos.
  • En ambos modelos, los residuos absolutos son menores para mujeres en conciencia, amabilidad y neuroticismo; apertura solo muestra esa diferencia en GPT-3.5 y extraversión muestra mayor error para mujeres en GPT-4.
  • Las correlaciones calculadas dentro de grupos de género o edad no difieren significativamente y estandarizar dentro de grupo no cambia significativamente las correlaciones globales.
  • Por edad, solo GPT-3.5 presenta mayor error absoluto en personas mayores para apertura y conciencia, y menor para amabilidad; GPT-4 no presenta diferencias significativas de error absoluto.
  • En el subconjunto de 68, las correlaciones medias con evaluaciones de amistades son 0,304 para autoinforme, 0,269 para GPT-3.5 y 0,276 para GPT-4, pero no se prueba que esas medias sean equivalentes ni diferentes.
  • La verificación de fuentes confirma el PDF y suplemento publicados y el paquete fuente de arXiv, pero no los datos o el código: OSF hq2ra era público en una captura de noviembre de 2024 y ahora exige autenticación.

Limitaciones

  • Las correlaciones de 0,22–0,33 son modestas y explican solo aproximadamente un 5–11 % de la varianza por rasgo; no justifican una inferencia precisa a nivel individual.
  • La correlación evalúa ordenación, no calibración. Las grandes diferencias de media y varianza frente al IPIP impiden interpretar directamente una puntuación LLM como puntuación psicométrica.
  • El autoinforme IPIP se trata como criterio, pero también contiene error de medición, sesgo de respuesta y varianza situacional; el estudio no informa fiabilidad del instrumento en esta muestra.
  • El trabajo es zero-shot respecto al prompt y no usa las etiquetas de la muestra para ajustar el modelo, pero no puede demostrar que los textos de MyPersonality, publicaciones derivadas o tareas de personalidad no aparecieran en los datos de entrenamiento.
  • La afirmación de que los modelos no fueron entrenados explícitamente para la tarea no es verificable en modelos propietarios con corpus y objetivos completos no publicados.
  • La muestra exige al menos 200 estados y participación voluntaria en MyPersonality, por lo que selecciona usuarios muy activos e interesados en tests psicológicos.
  • La muestra es joven, con media de 24,2 años, y mayoritariamente femenina; no representa a la población general ni necesariamente a usuarios actuales de redes sociales.
  • Los textos proceden de Facebook entre 2007 y 2012; lenguaje, plataforma, audiencia y normas de publicación han cambiado sustancialmente.
  • Solo se evalúan publicaciones de Facebook y un prompt en inglés; no hay evidencia para otras plataformas, idiomas, culturas o géneros textuales.
  • Doscientos estados equivalen en promedio a unas 3.420 palabras por persona, una huella textual considerable que no debe confundirse con inferencia desde unas pocas frases.
  • Los estados se agrupan en bloques de 20 y sus puntuaciones se promedian con igual peso pese a variar mucho en longitud; no se estudian alternativas de agregación por tokens o mensajes.
  • La curva de volumen acumula bloques de los 200 estados más recientes, pero no informa aleatorización del orden; volumen, periodo y contenido adicional pueden cambiar conjuntamente.
  • Solo se usa un prompt, un rol de sistema genérico y una escala de 1 a 5; la robustez frente a formulación, orden de rasgos, anclajes, ejemplos o formato no se evalúa.
  • No se informan temperatura, top-p, fecha exacta de llamadas, límites de salida, errores de API ni reglas para respuestas que no cumplieran el formato.
  • La estabilidad entre tres rondas se resume con correlaciones, que no detectan diferencias sistemáticas de nivel y no sustituyen a un ICC o una medida de acuerdo absoluto.
  • Promediar aritméticamente correlaciones entre rasgos no usa la transformación de Fisher y no convierte cinco constructos distintos en una única medida de exactitud.
  • La prueba utilizada para comparar las correlaciones dependientes de GPT-3.5 y GPT-4 sobre los mismos usuarios no se describe ni se reportan estadísticos o intervalos de esas diferencias.
  • La comparación con modelos supervisados usa resultados de otro estudio, con protocolos potencialmente distintos, y la media citada de 0,37 es superior a la media LLM de 0,29; no es una prueba directa de rendimiento similar.
  • Los análisis de género y edad muestran 80 entradas de valor p, 70 comparaciones distintas tras descontar autoinformes duplicados, sin una corrección explícita por multiplicidad; varios resultados marginales no sobrevivirían una corrección estricta.
  • Las columnas p de las tablas S4 y S5 imprimen todos los valores con signo negativo, algo matemáticamente imposible; el texto principal parece usar sus magnitudes, pero el error reduce la fiabilidad del suplemento.
  • El estudio usa categorías binarias de género y no explica cómo se obtuvo esa variable ni representa identidades no binarias o trans.
  • La edad se divide por la mediana, descartando información continua; no se informa el punto de corte ni el N de cada grupo y el significado de “joven” y “mayor” depende de una muestra de edad baja.
  • Los residuos absolutos dependen de la descalibración de cada modelo y rasgo; una diferencia de residuos no equivale por sí sola a sesgo en capacidad de ordenación.
  • Las diferencias de medias inferidas pueden reflejar estereotipos, diferencias reales de autoinforme, diferencias de expresión o descalibración. El diseño no identifica cuál de esas fuentes las produce.
  • El artículo afirma que no hay diferencias en correlaciones dentro de los grupos, pero no publica las correlaciones, intervalos, N o pruebas necesarias para auditar esa afirmación.
  • El benchmark de observadores solo tiene 68 personas, por lo que las estimaciones por cinco rasgos son imprecisas y sensibles a pocos casos.
  • Las amistades usan un IPIP de 10 ítems, solo dos por rasgo, mientras el autoinforme usa 100; su menor fiabilidad y las diferencias de instrumento dificultan la comparación.
  • Los observadores conocen a la persona y disponen de más indicios que los estados analizados por el LLM; no realizan la misma tarea con la misma información.
  • La tabla S6.1 asigna a las correlaciones observador–autoinforme exactamente los intervalos y valores p de GPT-4 en S6.2. Por ejemplo, r = 0,198 aparece con IC [0,179, 0,583], un intervalo que ni siquiera contiene el coeficiente.
  • No se realizan pruebas de equivalencia o diferencias entre observadores y LLM; que los coeficientes se solapen en rango no demuestra paridad humana.
  • La correlación entre juicios LLM y observadores no demuestra que usen los mismos indicios lingüísticos; esa afirmación requeriría análisis de cues o intervenciones.
  • El estudio no identifica qué palabras, temas, estilos o datos personales impulsan las predicciones, por lo que no distingue rasgo, demografía, tema y estereotipo.
  • El repositorio OSF citado como fuente de datos y código no es accesible sin autenticación en la verificación actual; no puede reproducirse el análisis desde los artefactos públicos disponibles.
  • La fuente arXiv contiene TeX y figuras, pero no datos, respuestas de API ni scripts analíticos. Además, su suplemento v2 ni siquiera incluye el análisis S6 añadido en la publicación final.
  • No hay preregistro ni separación declarada entre análisis confirmatorios y exploratorios, especialmente para las numerosas comparaciones sociodemográficas.
  • Los snapshots de marzo de 2023 están retirados y no pueden consultarse hoy mediante la API original; la replicación exacta depende de salidas conservadas que no están disponibles.
  • Aunque el estudio obtuvo aprobación IRB y los usuarios donaron datos a investigación, la aplicación del hallazgo a perfiles no consentidos plantea un riesgo distinto que el experimento no resuelve técnicamente.

Qué no demuestra

  • No valida las salidas de GPT-3.5 o GPT-4 como un test Big Five equivalente al IPIP ni como una medida apta para decisiones individuales.
  • No demuestra que pueda diagnosticarse personalidad, salud mental, riesgo, idoneidad laboral o respuesta a una intervención desde publicaciones sociales.
  • No prueba una comprensión humana o representación psicológica interna; una correlación puede surgir de regularidades léxicas, temáticas y demográficas.
  • No demuestra que los modelos nunca vieran MyPersonality o materiales derivados durante el entrenamiento.
  • No establece que GPT-4 sea mejor que GPT-3.5, porque las diferencias numéricas no fueron significativas.
  • No demuestra rendimiento igual al de modelos supervisados; la comparación procede de otro estudio y favorece numéricamente al benchmark supervisado.
  • No demuestra paridad con observadores humanos ni que humanos y LLM utilicen los mismos indicios.
  • No establece un sesgo general contra hombres o personas mayores: los patrones cambian por rasgo, modelo y métrica y las correlaciones dentro de grupo no difieren.
  • No identifica si las diferencias demográficas proceden del entrenamiento del modelo, de estereotipos, de la muestra o de diferencias reales de expresión en Facebook.
  • No demuestra que mujeres o personas jóvenes revelen su personalidad de forma intrínsecamente más fiel en internet.
  • No generaliza a modelos actuales, otros idiomas, nuevas plataformas, textos breves, conversaciones privadas o poblaciones clínicas.
  • No prueba que aumentar el contexto mejore indefinidamente la exactitud; la curva se aplana y fluctúa según rasgo.
  • No demuestra que el uso de perfiles psicológicos automáticos sea ético, consentido, seguro o legal; el propio artículo subraya riesgos de privacidad y manipulación.

Trazabilidad

Alcance: Texto completo

Versión: PNAS Nexus 3(6), pgae231; advance access 13 June 2024; PMC11211928.1; CC BY 4.0

Fuente consultada: https://pmc-oa-opendata.s3.amazonaws.com/PMC11211928.1/PMC11211928.1.pdf

Revisión: Codex full-text, visual, supplementary-table, arXiv-source and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-3.5 Turbo (gpt-3.5-turbo-0301)
  • GPT-4 (gpt-4-0314)

Instrumentos y métricas

  • International Personality Item Pool de 100 ítems
  • Big Five: apertura, conciencia, extraversión, amabilidad y neuroticismo
  • Versión IPIP de 10 ítems para evaluaciones de amistades
  • Correlación de Pearson con intervalos del 95 %
  • Correlación entre rondas de puntuación
  • Pruebas t entre grupos
  • Diferencias estandarizadas d
  • Residuos dirigidos y absolutos

Datos utilizados

  • MyPersonality Facebook dataset, actividad entre 2007 y 2012
  • 200 estados de Facebook por cada uno de 1.000 usuarios
  • Autoinformes IPIP Big Five de 100 ítems
  • Puntuaciones generadas por GPT-3.5 Turbo 0301 y GPT-4 0314
  • Evaluaciones de personalidad realizadas por amistades para 68 usuarios
  • Suplemento publicado pgae231_supplementary_data.pdf
  • Fuente arXiv 2309.08631v2
  • OSF hq2ra, declarado en el artículo pero no accesible públicamente en la verificación actual

Evidencia y localización

  • Pregunta, resultado general, implicaciones y licencia: Artículo, p. 1, Abstract, Significance Statement y aviso CC BY 4.0
  • Muestra, MyPersonality e IRB: Artículo, pp. 2–3, Methods, Data and sampling
  • IPIP, snapshots, prompt, bloques y tres repeticiones: Artículo, p. 2, Measures
  • Distribuciones y descalibración: Artículo, pp. 2–3, Figure 1; suplemento, p. 2, Table S1
  • Correlaciones por rasgo y comparación entre modelos: Artículo, pp. 3–4, Figure 2; suplemento, pp. 2–3, Tables S2–S3
  • Diferencias y residuos por género: Artículo, pp. 3–6, Figures 3–4; suplemento, p. 4, Table S4
  • Diferencias y residuos por edad: Artículo, pp. 4–6, Figures 3–4; suplemento, p. 5, Table S5
  • Benchmark de 68 observadores y error de intervalos: Artículo, pp. 4–5, Agreement with third-person observer ratings; suplemento, p. 6, Tables S6.1–S6.2
  • Comparación externa con supervisado, límites y privacidad: Artículo, pp. 5–7, Discussion, Limitations, Implications and Conclusion
  • Errores de signo en valores p y contenido de la versión previa: Suplemento publicado, Tables S4–S5; fuente arXiv 2309.08631v2, SI.tex
  • Disponibilidad actual de los artefactos: OSF hq2ra devuelve HTTP 401 el 15 July 2026; Wayback 20241125044504 muestra el proyecto público con 6.4 MB; el paquete arXiv contiene TeX y figuras