Who is GPT-3? An exploration of personality, values and demographics

Evaluación y validez psicométrica2022ACL AnthologyRevisión editorial aprobada

Título original: Who is GPT-3? An Exploration of Personality, Values and Demographics

Autores: Marilù Miotto, Nicola Rossberg, Bennett Kleinberg

Palabras clave: Language models, GPT-3, Psychological assessment, Personality traits, Computational social science

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
7
Hallazgos
10
Limitaciones
8
Evidencias

Resumen editorial

Español

Este artículo del workshop NLP+CSS 2022 administra al GPT-3 DaVinci original tres tipos de autoinforme: HEXACO-60, Human Values Scale (HVS) de 21 ítems y preguntas abiertas de edad y género. Cada ítem se consulta por separado con temperaturas de 0,0 a 1,0 en pasos de 0,1; a temperatura 0 se conserva una salida y en las demás se piden 100 por ítem. Se excluye 1,73 % de HEXACO y 0,004 % de HVS por respuestas no numéricas. Esta estructura no equivale a una muestra de personas: sin memoria, las respuestas de distintos ítems son completados independientes y cualquier perfil compuesto agrupa posiciones por índice sin una identidad o trayectoria compartida. Las pruebas multivariantes tratan esas combinaciones como observaciones, lo que hace que varianza entre perfiles, covarianzas entre facetas y comparación con humanos sean difíciles de interpretar psicométricamente. En demografía, 1.001 completados aproximados por pregunta producen edad media 27,51 (DE 5,75; rango 13–75), 66,73 % respuestas femeninas, 31,87 % masculinas y 1,40 % otras. La edad baja 5,81 años por unidad de temperatura. El análisis de género es internamente inconsistente: declara como variable dependiente female vs not female y β = +1,18, pero interpreta e^1,18 como aumento de odds masculinas; la tabla sí muestra una reducción general, aunque no monotónica, de respuestas femeninas. Son patrones de texto provocados por sampling, no demografía del modelo. En HEXACO, las medias agregadas son 3,75 en honestidad-humildad, 3,05 en emocionalidad, 3,51 en extraversión, 3,18 en amabilidad, 3,54 en responsabilidad y 3,59 en apertura. La temperatura se asocia negativamente con emocionalidad (β = −0,23) y positivamente con extraversión (0,31), amabilidad (0,40), responsabilidad (0,25) y apertura (0,17), todas p < 0,001; honestidad-humildad no es significativa al umbral p < 0,01. La discusión invierte después varias direcciones: atribuye a menor honestidad más rechazo a manipular, habla de mayor emocionalidad cuando el coeficiente es negativo y afirma que las otras cuatro facetas disminuyen cuando el análisis dice que aumentan. Las correlaciones entre facetas solo coinciden parcialmente con referencias humanas y el propio resultado dice que no aparece un patrón consistente. En HVS sin memoria, la Tabla 4 arroja medias de 4,51 a 5,95 sobre seis puntos, contradiciendo el texto que afirma que todas están entre 4 y 5, y una varianza menor que las referencias. Nueve de diez valores disminuyen con temperatura; stimulation no cambia. Con memoria de respuestas previas, probada solo en HVS a temperaturas 0,0, 0,2, 0,4, 0,6, 0,8 y 1,0, el patrón cambia radicalmente: las medias totales son 2,17 conformity, 2,74 tradition, 5,30 benevolence, 5,39 universalism, 5,42 self-direction, 5,25 stimulation, 4,01 hedonism, 3,85 achievement, 2,92 power y 2,69 security. Eso muestra que el formato de contexto domina el supuesto perfil. Los autores interpretan mayor coherencia teórica, pero admiten que haría falta comparar datos humanos crudos; sus correlaciones intervalor tienen poco solapamiento con la matriz humana. Además, el texto califica como negativos los efectos de security y hedonism aunque imprime β positivos de 0,21 y 0,88; las tablas descienden y sugieren signos omitidos. El aporte histórico es demostrar que temperatura y memoria del prompt alteran fuertemente salidas de cuestionarios. No demuestra que GPT-3 tenga personalidad, valores o demografía: no hay conducta externa, validez de constructo, test–retest de una entidad estable, equivalencia inferencial con humanos ni control de contaminación por instrumentos probablemente presentes en el entrenamiento.

English

This NLP+CSS 2022 workshop paper administers three kinds of self-report to the original GPT-3 DaVinci: HEXACO-60, the 21-item Human Values Scale (HVS), and open age and gender questions. Each item is queried separately at temperatures 0.0 through 1.0 in .1 steps; one output is retained at temperature zero and 100 are requested per item at every other temperature. Non-numeric outputs remove 1.73% of HEXACO and .004% of HVS responses. This structure is not a sample of people: without memory, different questionnaire items are independent completions, and any composite profile groups positions by index without a shared identity or trajectory. Multivariate tests treat those combinations as observations, making between-profile variance, facet covariance, and human comparison difficult to interpret psychometrically. For demographics, approximately 1,001 completions per question yield mean age 27.51 (SD 5.75; range 13–75), 66.73% female, 31.87% male, and 1.40% other outputs. Age falls 5.81 years per unit of temperature. The gender analysis is internally inconsistent: it names female vs not female as the dependent variable and reports β = +1.18, but interprets e^1.18 as increased male odds; the table does show a general, non-monotonic decline in female responses. These are sampling-conditioned text patterns, not model demographics. Aggregate HEXACO means are 3.75 Honesty-Humility, 3.05 Emotionality, 3.51 Extraversion, 3.18 Agreeableness, 3.54 Conscientiousness, and 3.59 Openness. Temperature is negatively associated with Emotionality (β = −.23) and positively associated with Extraversion (.31), Agreeableness (.40), Conscientiousness (.25), and Openness (.17), all p < .001; Honesty-Humility is not significant at p < .01. The discussion later reverses several directions: it treats lower Honesty-Humility as less willingness to manipulate, refers to higher Emotionality despite its negative coefficient, and says the remaining four facets decrease although the analysis says they increase. Facet correlations only partly match human references, and the results themselves say no consistent pattern emerges. Without memory, HVS Table 4 reports means from 4.51 to 5.95 on a six-point scale, contradicting the text's claim that all lie between four and five, and lower variance than references. Nine of ten values decline with temperature; Stimulation does not. With previous-response memory, tested only for HVS at temperatures 0, .2, .4, .6, .8, and 1, the pattern changes radically: total means are 2.17 Conformity, 2.74 Tradition, 5.30 Benevolence, 5.39 Universalism, 5.42 Self-Direction, 5.25 Stimulation, 4.01 Hedonism, 3.85 Achievement, 2.92 Power, and 2.69 Security. This shows that context format dominates the supposed profile. The authors interpret greater theoretical coherence but concede that raw human data would be needed for formal comparison; their inter-value correlations have little overlap with the human matrix. The text also calls the Security and Hedonism effects negative while printing positive β values of .21 and .88; the tables decline and suggest omitted minus signs. The historical contribution is evidence that temperature and prompt memory strongly alter questionnaire outputs. It does not establish that GPT-3 has personality, values, or demographics: there is no external behavior, construct validity, test–retest of one stable entity, inferential equivalence with humans, or control for instruments likely present in training data.

Pregunta de investigación

¿Qué perfiles HEXACO, valores HVS y respuestas demográficas produce GPT-3 DaVinci bajo distintas temperaturas, y cuánto cambia el patrón cuando el prompt conserva las respuestas anteriores?

Método

Se consulta por API a GPT-3 DaVinci con HEXACO-60, HVS-21 y preguntas de edad/género. Cada ítem se envía separadamente a once temperaturas; se solicita una salida en 0,0 y 100 en cada nivel 0,1–1,0. Se calculan compuestos, descriptivos, regresiones, MANOVA y correlaciones, comparándolos descriptivamente con estudios humanos publicados. Para HVS se repite un diseño acumulativo que incluye ítems y respuestas previos en seis temperaturas.

Muestra: Un único modelo. Por ítem se obtiene una respuesta a temperatura 0 y 100 en cada una de las otras diez temperaturas; son completados independientes, no participantes. HEXACO contiene 60 ítems, HVS 21 y las dos preguntas demográficas se administran por separado. HVS con memoria se ejecuta en seis temperaturas. No se recogen participantes humanos ni datos humanos crudos emparejados.

Hallazgos

  • Las salidas demográficas promedian 27,51 años y 66,73 % femenino; la edad baja con temperatura, pero el coeficiente y la interpretación del modelo de género son incompatibles.
  • Las medias HEXACO son H 3,75, E 3,05, X 3,51, A 3,18, C 3,54 y O 3,59; temperatura reduce E y eleva X, A, C y O en el análisis principal.
  • La discusión posterior invierte la dirección o el significado de varios efectos HEXACO, por lo que no es una fuente coherente para interpretarlos psicológicamente.
  • Sin memoria, HVS alcanza medias 4,51–5,95, no 4–5 como afirma el texto, y nueve valores caen al aumentar temperatura.
  • La matriz de correlaciones HEXACO no reproduce un patrón humano consistente; las correlaciones HVS sin memoria son mucho menores que las humanas.
  • Añadir respuestas anteriores cambia HVS a alta benevolencia, universalismo, autodirección y estimulación, y baja conformidad, tradición, poder y seguridad.
  • La memoria eleva muchas correlaciones entre valores, pero la matriz continúa con poco solapamiento respecto a la referencia humana y no se realiza el contraste formal requerido.

Limitaciones

  • Cada ítem sin memoria se genera de manera independiente; componer respuestas por posición no crea sujetos estables ni respalda covarianzas psicológicas entre facetas.
  • Temperatura controla aleatoriedad de muestreo y simultáneamente define los grupos analizados; un cambio en distribución de tokens no equivale a cambio de personalidad.
  • Se estudia un único motor GPT-3 sin snapshot exacto y con parámetros por defecto no detallados; no hay replicación temporal o entre modelos.
  • Las escalas son autoinformes humanos y no se valida que sus ítems, puntuación o factores midan constructos equivalentes en un modelo.
  • Las comparaciones humanas usan medias, desviaciones y matrices publicadas de muestras distintas, no datos crudos sometidos al mismo diseño ni pruebas de equivalencia.
  • Menor varianza que humanos puede resultar de prompting, repetición o sampling y no demuestra consistencia psicométrica.
  • No se calculan alfa/omega, test–retest, invariancia, validez convergente, discriminante, criterial o conductual.
  • Los instrumentos podían estar en el entrenamiento; los autores no conocen los datos de GPT-3 y reconocen exposición o demand characteristics como explicación alternativa.
  • La memoria solo se prueba en HVS y convierte cada respuesta anterior en señal para las siguientes, pudiendo imponer coherencia por continuación contextual.
  • El artículo contiene inconsistencias de signo, rango y narrativa en género, HEXACO y HVS que impiden aceptar varias interpretaciones sin reservas.

Qué no demuestra

  • No demuestra que GPT-3 sea una persona, tenga identidad, edad, género, valores o rasgos psicológicos.
  • No demuestra que una colección de completados independientes represente uno o múltiples participantes sintéticos.
  • No establece equivalencia entre perfiles de salida y distribuciones humanas ni que el modelo sea un sustituto válido en ciencias sociales.
  • No permite inferir honestidad, ansiedad, sociabilidad o conducta desde respuestas a autoinformes.
  • No demuestra coherencia humana del HVS con memoria; el propio paper reclama datos humanos crudos para probarla.
  • No separa aprendizaje del instrumento, deseabilidad textual, sesgo de respuesta y seguimiento de instrucciones de personalidad real.
  • No generaliza a modelos actuales, otros idiomas, prompts conversacionales o decisiones fuera del cuestionario.

Trazabilidad

Alcance: Texto completo

Versión: NLP+CSS 2022 proceedings, ACL Anthology 2022.nlpcss-1.24

Fuente consultada: https://aclanthology.org/2022.nlpcss-1.24.pdf

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • OpenAI GPT-3 DaVinci (175B; exact engine snapshot not reported)

Instrumentos y métricas

  • 60-item HEXACO personality inventory
  • 21-item Human Values Scale from the European Social Survey
  • Open-ended age and gender prompts
  • Multivariate analyses and per-facet regressions
  • Inter-facet and inter-value Pearson correlations
  • Cumulative response-memory prompting

Datos utilizados

  • GPT-3 item-level API completions across eleven temperatures
  • Ashton and Lee (2009) HEXACO college and community reference summaries
  • Schwartz et al. (2015) global and German Human Values Scale reference summaries
  • Response-memory HVS completions across six temperatures

Evidencia y localización

  • Objetivo, alcance antropomórfico y cautelas iniciales: NLP+CSS 2022, pp. 218–219, Abstract and Introduction
  • HEXACO, HVS, prompts y sampling por temperatura: NLP+CSS 2022, pp. 219–220, sections 2.1–2.4 and Figure 1
  • Resultados demográficos e inconsistencia del modelo de género: NLP+CSS 2022, p. 221, section 3.1 and Table 1
  • Medias, efectos de temperatura y correlaciones HEXACO: NLP+CSS 2022, pp. 221–222, section 3.2 and Tables 2–3
  • HVS sin memoria, rango de medias y efectos de temperatura: NLP+CSS 2022, pp. 222–223, section 3.3 and Tables 4–5
  • Diseño y resultados HVS con memoria: NLP+CSS 2022, pp. 223–224, section 3.4, Figure 2 and Tables 6–7
  • Interpretaciones contradictorias y comparación humana: NLP+CSS 2022, pp. 224–226, sections 4.1–4.1.2
  • Contaminación de entrenamiento, ausencia de comparación formal y límite de un modelo: NLP+CSS 2022, p. 226, section 4.2