The Personality Dimensions GPT-3 Expresses During Human-Chatbot Interactions

Personas, identidad y agentes2024ACMRevisión editorial aprobada

Autores: Nikola Kovačević, Christian Holz, Markus Gross, Rafael Wampfler

Palabras clave: text-davinci-002, Human-Chatbot Interaction, Perceived Personality, Exploratory Factor Analysis, Conversational Agents, Big Five, Psychometrics, Interrater Reliability, Descriptor Elicitation, Reproducibility

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
14
Hallazgos
24
Limitaciones
12
Evidencias

Resumen editorial

Español

Este estudio no mide una personalidad intrínseca de GPT-3. Investiga cómo personas, en su mayoría universitarias, percibieron la personalidad mostrada en conversaciones inglesas generadas por text-davinci-002 en octubre-noviembre de 2022. En el primer experimento, 86 participantes conversaron durante tres semanas con tres personajes y aportaron 9.267 autoinformes de tres adjetivos. El sistema inyectaba además uno de seis estados emocionales, cuatro tipos de inicio y los mensajes del usuario; el objeto observado es, por tanto, una conversación coproducida y condicionada por prompts, no el modelo aislado.

De 27.801 entradas se obtuvieron 2.999 términos únicos y después 147 descriptores mediante una cadena con decisiones importantes: reducción manual de frases, traducción manual de 104 términos, corrección con Merriam-Webster, eliminación de prefijos de negación, cribado con listas previas, clustering codicioso de sinónimos ordenado por frecuencia y un umbral t=10 elegido por codo. El resultado es un instrumento construido y curado, no una extracción neutral ni un resumen automático del lenguaje de los participantes. El suplemento oficial publica los 147 descriptores, sus cargas y su correspondencia Big Five, pero no las decisiones intermedias.

En un segundo estudio abierto se reclutaron 556 personas y se conservaron 425 tras excluir 131 (23,5 %): nueve por no usar las cuatro categorías y 122 por completar fuera de 8-25 minutos. Cada participante leyó un conjunto aleatorio distinto de tres conversaciones y puntuó una sola vez los 147 adjetivos para la personalidad global de ese conjunto. El análisis factorial exploratorio tiene KMO=0,896, pero las reglas de retención no señalan ocho factores: Kaiser sugiere 34 y el scree cuatro o seis. Los autores analizan cinco para compararlo con Big Five, diez para compararlo con un trabajo anterior y eligen ocho como valor intermedio e interpretable. Esa solución explica el 38,2 % de la varianza y no se confirma en otra muestra.

Los ocho factores se etiquetan subjetivamente como decencia, profundidad, inestabilidad, vitalidad, implicación, neuroticismo, utilidad y servilismo. Forman una taxonomía exploratoria plausible de percepciones, pero cada vector mezcla un rater y tres conversaciones distintas; la estructura puede incorporar contenido, prompts, usuarios, selección del conjunto y estilos de respuesta. No hay análisis multinivel, parallel analysis, split de confirmación, CFA, bootstrap de estabilidad ni replicación externa.

La cifra de fiabilidad más llamativa necesita una corrección esencial. El texto principal presenta alpha=0,78 para quienes vieron las mismas tres conversaciones, pero el apéndice muestra que sin restricción de orden es 0,57 en solo 23 pares. El 0,78 aparece únicamente al exigir además que la última conversación sea la misma y queda en nueve pares. El alpha=0,31 entre más de 80.000 pares sin ninguna conversación compartida no es fiabilidad interjueces del mismo objeto: es semejanza de perfiles ante estímulos diferentes y puede reflejar frecuencias generales de los adjetivos o estilos de respuesta.

La relación con Big Five tampoco es validación convergente. Tras comparar con listas previas, un psicólogo asignó manualmente 95 de los 147 adjetivos y 24 quedaron sin correspondencia; el “agreement” es el porcentaje de palabras de cada factor codificadas en cada rasgo, no una correlación con un instrumento Big Five administrado sobre los mismos estímulos. Del mismo modo, la comparación con asistentes de voz usa otro estudio, otras muestras y otros vocabularios; los solapamientos mensurables son 27-41 % y no aíslan un avance tecnológico.

La conclusión fiel es que participantes de 2022 organizaron sus percepciones de estas conversaciones concretas en varias dimensiones sociales, emocionales y funcionales interpretables. El trabajo aporta un diseño longitudinal poco común, identifica el modelo y los parámetros y publica las tablas completas. Pero no valida una personalidad estable de GPT-3, una taxonomía universal de ocho factores, el fracaso psicométrico de Big Five, independencia respecto del prompt o generalización a ChatGPT, GPT-4 o modelos actuales. Tampoco puede reproducirse numéricamente: las páginas oficiales y el registro ETH ofrecen PDFs, BibTeX y metadatos, pero no conversaciones, matriz de ratings, exclusiones, código, entorno o release inmutable.

English

This study does not measure an intrinsic GPT-3 personality. It investigates how mostly university participants perceived personality in English conversations generated by text-davinci-002 in October-November 2022. In the first experiment, 86 participants interacted for three weeks with three personas and supplied 9,267 three-adjective self-reports. The system also injected one of six emotional states, one of four conversation starts and the user's own messages; the observed object is therefore a prompt-conditioned, co-produced conversation rather than the model in isolation.

The 27,801 adjective entries yielded 2,999 unique terms and then 147 descriptors through consequential construction choices: manual phrase reduction, manual translation of 104 terms, Merriam-Webster correction, removal of negation prefixes, screening against prior lists, greedy frequency-ordered synonym clustering and an elbow-chosen t=10 cutoff. The result is a curated instrument, not a neutral extraction or automated summary of participant language. The official supplement publishes all descriptors, loadings and Big Five correspondences, but not the intermediate decisions.

A second open survey recruited 556 people and retained 425 after excluding 131 (23.5%): nine for not using all four categories and 122 for finishing outside 8-25 minutes. Each participant read a different random set of three conversations and rated all 147 adjectives once for the bundle's overall chatbot personality. Exploratory factor analysis reports KMO=.896, but the retention rules do not select eight factors: Kaiser suggests 34 and the scree plot four or six. The authors analyze five for Big Five comparison, ten for earlier-work comparison and choose eight as an intermediate, interpretable value. That solution explains 38.2% of variance and is not confirmed in another sample.

The factors are subjectively labeled decency, profoundness, instability, vibrancy, engagement, neuroticism, serviceability and subservience. They form a plausible exploratory taxonomy of perceptions, but each vector mixes one rater and three different conversations; covariance can incorporate content, prompts, users, bundle selection and response styles. There is no multilevel analysis, parallel analysis, confirmation split, CFA, stability bootstrap or external replication.

The most prominent reliability figure requires an important correction. The main text presents alpha=.78 for people who saw the same three conversations, but Appendix B shows .57 without an ordering restriction and only 23 rater pairs. The .78 value additionally requires the same conversation to appear last and is based on nine pairs. Alpha=.31 among more than 80,000 pairs sharing no conversation is not interrater reliability of the same object; it is profile similarity across different stimuli and can reflect adjective base rates or response styles.

Big Five agreement is not convergent validation either. After list matching, a psychologist manually assigned 95 of 147 adjectives and 24 remained unmatched; “agreement” is the percentage of a factor's words coded to each trait, not correlation with a Big Five instrument administered on the same stimuli. Comparison with voice assistants likewise uses another study, sample and vocabulary; measurable overlaps are 27-41% and do not isolate technological progress.

The faithful conclusion is that participants in 2022 organized perceptions of these particular conversations into several interpretable social, emotional and functional dimensions. The study contributes an unusual longitudinal design, identifies the model and settings and publishes complete tables. It does not validate a stable GPT-3 personality, a universal eight-factor taxonomy, psychometric failure of Big Five, prompt independence or generalization to ChatGPT, GPT-4 or current models. Numerical reproduction is also impossible: official pages and the ETH record expose PDFs, BibTeX and metadata, but no conversations, rating matrix, exclusions, code, environment or immutable release.

Pregunta de investigación

¿Qué vocabulario usan los participantes para describir la personalidad percibida de un chatbot basado en text-davinci-002 durante interacción prolongada, qué estructura factorial exploratoria aparece al puntuar ese vocabulario sobre conversaciones, y cómo se solapa lexicalmente con Big Five y un modelo previo de asistentes de voz?

Método

Diseño en dos etapas. Primero, 86 participantes interactuaron tres semanas con text-davinci-002 mediante tres personas, seis emociones aleatorias y cuatro inicios de conversación; produjeron 1.998 conversaciones y 9.267 informes de tres adjetivos. Una cadena manual, léxica y determinista redujo 27.801 entradas a 147 descriptores. Después, 556 personas hicieron una encuesta abierta; 425 quedaron tras exclusiones y cada una puntuó los 147 descriptores una vez después de leer tres conversaciones aleatorias. Se aplicó EFA con oblimin y soluciones de 5, 8 y 10 factores, scores ten Berge, Krippendorff alpha por pares y solapamiento lexical con Big Five y Völkel et al.

Muestra: Experimento de interacción: 86 personas, 42 mujeres y 44 hombres, 18-41 años (media 25,4; DE 3,9), mayoritariamente estudiantes de ETH/Universidad de Zúrich; 87 % con inglés C1+ y 58 % con experiencia en chatbots. Encuesta: 556 reclutados, 324 hombres, 230 mujeres y 2 other, 17-50 años (media 22,9; DE 3,6), mayoritariamente estudiantes ETH; 89 % C1+ y 59 % con experiencia. Se excluyeron 131 y quedaron 425.

Hallazgos

  • Se recopilaron 1.998 conversaciones, 9.267 autoinformes y 27.801 entradas de adjetivos; 2.999 términos únicos se redujeron a 147 descriptores.
  • Los cuatro términos postprocesados más frecuentes son polite 1.377 (6,98 %), talkative 1.341 (6,80 %), friendly 1.281 (6,49 %) y kind 1.264 (6,41 %).
  • KMO es 0,896, pero Kaiser sugiere 34 factores y el scree cuatro o seis; ocho se elige como valor intermedio para interpretación.
  • La solución de ocho factores explica el 38,2 %; las cargas van de -0,64 a 0,78 y ocho adjetivos quedan sin asignar por |loading|<0,25.
  • Las etiquetas autorales son decency, profoundness, instability, vibrancy, engagement, neuroticism, serviceability y subservience.
  • Las correlaciones moderadas mayores incluyen neuroticism-vibrancy 0,46, decency-neuroticism 0,39 y serviceability-vibrancy -0,38.
  • El alpha sin restricción es 0,57 para overlap=3 (23 pares), 0,50 para overlap=2, 0,34 para overlap=1 y 0,31 sin conversaciones compartidas.
  • El alpha=0,78 requiere overlap=3, misma última conversación y solo nueve pares.
  • El solapamiento Big Five más claro asocia decency-agreeableness, neuroticism-neuroticism y serviceability-conscientiousness.
  • Un psicólogo asignó manualmente 95 de los 147 descriptores a Big Five y 24 quedaron sin correspondencia.
  • Contra Völkel et al., los solapamientos son 41 % decency/approachable, 40 % vibrancy/social-entertaining y 27 % serviceability/serviceable.
  • El pie de Figura 1 dice 451 participantes, pero figura, abstract, método y 556-131 señalan 425.
  • El suplemento solo contiene tablas de descriptores/cargas/codificación Big Five y frecuencias top 100.
  • No se localizó un release de datos o código en las superficies oficiales ni mediante búsquedas por título/DOI.

Limitaciones

  • La unidad observada es percepción humana de conversaciones coproducidas, no personalidad intrínseca del modelo.
  • Personas, emociones inyectadas, inicios, mensajes del usuario y contenido quedan confundidos con text-davinci-002.
  • Cada rater resume tres conversaciones distintas en un único vector; no hay perfil independiente por conversación.
  • La matriz tiene 425 casos para 147 variables y conjuntos de estímulos heterogéneos.
  • Ocho factores no es la recomendación directa de Kaiser o scree; la selección es post hoc.
  • Solo se explica 38,2 % y no hay parallel analysis, MAP, CFA, bootstrap o réplica.
  • Las etiquetas factoriales son interpretaciones subjetivas.
  • El pipeline léxico incluye decisiones manuales, eliminación de negaciones y cribado con listas previas.
  • El clustering es codicioso y dependiente del orden; t=10 se fija por un codo visual.
  • Se elimina 23,5 % de la encuesta con reglas de estilo y tiempo sin sensibilidad pública.
  • El alpha=0,78 se basa en nueve pares y una condición adicional de orden.
  • Los pares sin conversaciones comunes no estiman fiabilidad del mismo objeto.
  • El solapamiento Big Five depende de asignación manual y no usa una medida validada sobre los mismos estímulos.
  • La comparación con asistentes de voz cruza estudios y vocabularios no equivalentes.
  • La independencia por persona/inicio se apoya en descripciones y gráficos, no equivalence tests.
  • La muestra está dominada por estudiantes; solo 8 % son angloparlantes nativos.
  • La interacción está incentivada con pagos, badges, leaderboard y lotería de CHF1.000.
  • Los ratings se basan en tres conversaciones cortas ficticias.
  • Solo se evalúa text-davinci-002 histórico y la generalización actual es incierta.
  • No están públicos conversaciones, ratings, exclusiones, clusters, traducciones o decisiones de limpieza.
  • No están públicos código, dependencias, seeds, randomización o pipeline de análisis.
  • El apéndice no reproduce el instrumento completo de la encuesta de ratings.
  • La cifra 451 del pie de Figura 1 contradice el n=425 analizado.
  • No hay preregistro, release inmutable o réplica independiente.

Qué no demuestra

  • No demuestra que GPT-3 o un LLM actual posea personalidad.
  • No valida ocho factores como taxonomía estable o universal de personalidad de chatbots.
  • No demuestra que Big Five sea psicométricamente inadecuado para todos los agentes LLM.
  • No demuestra que los factores repliquen en otra muestra, lengua, cultura o modelo.
  • No separa el efecto del modelo del prompt, usuario, contenido, bundle o rater.
  • No demuestra independencia respecto de persona o inicio por mostrar distribuciones parecidas.
  • No demuestra fiabilidad general de 0,78; esa cifra procede de nueve pares condicionados.
  • No aporta validez convergente Big Five mediante solapamiento lexical codificado.
  • No generaliza automáticamente a ChatGPT, GPT-4 o sistemas actuales.
  • No demuestra que GPT-3 sea más humano que asistentes de voz mediante una comparación entre estudios.
  • No demuestra una transición social de herramienta a compañero integral.
  • No valida el uso de los factores para controlar o comparar chatbots desplegados.
  • No permite reproducir numéricamente resultados, tablas y figuras con artefactos públicos.
  • No generaliza fuera de participantes mayoritariamente universitarios y conversaciones breves en inglés.

Modelos evaluados

  • OpenAI GPT-3 text-davinci-002 (October 2022 API version)
  • factor_analyzer exploratory factor analysis implementation

Instrumentos y métricas

  • Free-text three-adjective chatbot personality self-reports
  • 147-descriptor four-point perceived-personality rating inventory
  • Exploratory factor analysis with oblimin rotation
  • Kaiser-Meyer-Olkin sampling adequacy
  • Kaiser criterion and scree test
  • ten Berge factor-score projection
  • Pairwise Krippendorff alpha grouped by conversation overlap
  • Human-coded lexical correspondence with Big Five adjective lists

Datos utilizados

  • 1,998 human-text-davinci-002 conversations collected 7 October-6 November 2022 (not publicly released)
  • 9,267 three-adjective self-reports / 27,801 adjective entries (not publicly released)
  • 120 sampled conversation transcripts used by the rating survey (not publicly released)
  • 425 retained 147-descriptor rating vectors (not publicly released)
  • Official 10-page CGL supplemental tables

Evidencia y localización

  • Diseño, muestra, modelo, prompts y parámetros: Main paper pp. 5-8, sections 3.1-3.3 and Tables 1-2
  • Limpieza, traducción, negaciones, clustering y t=10: Main paper pp. 8-10, section 3.4, Algorithm 1 and Figure 3
  • Encuesta, exclusiones y tres conversaciones por rater: Main paper pp. 10-13, sections 4.1-4.4 and Figures 4-5
  • KMO, retención factorial y elección 5/8/10: Main paper pp. 13-14, section 4.5 and Figure 6
  • Varianza, cargas, factores, correlaciones y scores: Main paper pp. 14-16, sections 5.1-5.2 and Tables 3-4
  • Asignación Big Five y comparación lexical: Main paper pp. 15-18, sections 5.3-5.4 and Figure 8
  • Alpha condicionado y tamaños N: Main paper pp. 32-33, Appendix B and Table B.1
  • Limitaciones y generalización: Main paper pp. 18-23, sections 6.2-6.8 and Conclusion
  • 147 descriptores, cargas, codificación y top 100: Official CGL supplement SHA-256 b38eb56596f78511cc45a5d4d0ee9c663bc99c179929dbdab4332c65c8cf6f3d, all 10 pages inspected
  • Versiones y metadatos: SIPLAB PDF SHA-256 7cb1ec4e9b365fe93f6af5395dd6a784c048fdf62936e86c0c7cfd8ca38d72f2; CGL PDF SHA-256 cc086cc97081e3c0efa2acdfe4e94e60cc5720a3b57114c19a02d82527588df4; Crossref DOI 10.1145/3659626
  • Ausencia de datos y código públicos: SIPLAB, CGL, ETH Research Collection item 4eaf6ae0-e265-420d-bb5a-2f3c4b318c4b and GitHub title/DOI searches audited 16 Jul 2026
  • Informe completo: reports/verification/article-211-gpt3-perceived-personality-factor-and-artifact-audit.json