Big-Five Backstage: A Dramatic Dataset for Characters Personality Traits & Gender Analysis

Evaluación y validez psicométrica2024ACL AnthologyRevisión editorial aprobada

Autores: Marina Tiuleneva, Vadim A. Porvatov, Carlo Strapparava

Palabras clave: Big Five personality traits, character analysis, psycholinguistics, dramatic dialogue, dataset creation, fictional characters, computational personality analysis

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
20
Hallazgos
34
Limitaciones
16
Evidencias

Resumen editorial

Español

Big-Five Backstage publica un corpus de intervenciones de personajes de teatro en inglés, agregadas por personaje y etiquetadas con género binario y presencia/ausencia de cinco rasgos Big Five. El artículo parte de 178 archivos de Project Gutenberg, elimina obras no inglesas y en verso, conserva 400 obras de 132 autores y excluye personajes con menos de cinco líneas. Declara 3.265 textos, 3.419.136 palabras y 1.047,2 palabras por personaje. Las etiquetas de género se asignan manualmente, pero las de personalidad las produce GPT-3.5-turbo a partir del texto completo de cada personaje. Para validar esa anotación, se muestrea el 10 % y se reparte entre dos humanos ciegos a GPT; cada texto recibe la decisión de un solo humano, por lo que no existe acuerdo interanotador ni un ground truth consensuado. Frente a esas etiquetas humanas, GPT obtiene exactitudes de 0,872, 0,889, 0,894, 0,791 y 0,900 para extraversión, amabilidad, apertura, neuroticismo y responsabilidad; los F1 respectivos son 0,760, 0,903, 0,829, 0,781 y 0,886. Estas cifras apoyan que el modelo coincide con una anotación humana individual en esa muestra, con rendimiento desigual por rasgo; no validan que los personajes tengan esos rasgos ni que GPT los mida psicométricamente. El análisis usa 44 marcadores LIWC para género y 65 marcadores LIWC/MRC para personalidad, pruebas Mann–Whitney y Wilcoxon, d de Cohen y correlaciones punto-biseriales con α=0,05. Para género encuentra 32 marcadores significativos: varios siguen direcciones publicadas en textos humanos, pero con efectos mayores; otros se invierten, como el pronombre you, más frecuente en personajes femeninos. En autores con suficientes personajes, la relación entre efectos ficticios y humanos varía y el ejemplo de Strindberg alcanza r=0,8861. Para personalidad, 14 variables MRC y 48 LIWC se asocian con al menos un rasgo; cinco son significativas para los cinco rasgos y 24 para cuatro. Neuroticismo se relaciona especialmente con longitud y vocabulario afectivo negativo; responsabilidad con longitud de palabra y fonemas; extraversión con ocio; amabilidad con emociones positivas; y apertura con meaningfulness, ortografía y ocio. Sin embargo, se prueban cientos de combinaciones con α=0,05 sin corrección por comparaciones múltiples, las etiquetas analizadas proceden del propio GPT y no se informan tamaños de efecto completos ni incertidumbre. La auditoría del repositorio confirma una publicación útil bajo MIT con textos, etiquetas, variables LIWC/MRC, demografía, anotaciones humanas/GPT, notebook y tablas suplementarias. También descubre divergencias: los CSV actuales contienen 3.258 filas, no 3.265; normalizan 133 autores, no 132; y seis claves autor-obra-personaje están duplicadas. No hay manifiesto de dependencias, versión exacta de GPT, prompt ejecutable, semillas ni pipeline completo de extracción y análisis. El recurso es valioso para estudiar lenguaje dramático y sesgos de anotación, pero las etiquetas Big Five deben tratarse como predicciones débiles de GPT-3.5 validadas parcialmente, no como personalidad verdadera de personajes ni como evidencia directa sobre personas reales.

English

Big-Five Backstage releases a corpus of English theatre-character lines aggregated by character and labeled for binary gender and the presence or absence of five Big Five traits. The paper starts from 178 Project Gutenberg files, removes non-English and verse works, retains 400 plays by 132 authors, and excludes characters with fewer than five lines. It reports 3,265 texts, 3,419,136 words, and 1,047.2 words per character. Gender labels are assigned manually, but personality labels are produced by GPT-3.5-turbo from each character's full text. To validate those annotations, 10% of texts are sampled and distributed across two humans who are blind to GPT; each text receives only one human decision, so there is no inter-annotator agreement or consensus ground truth. Against those labels, GPT reaches accuracies of 0.872, 0.889, 0.894, 0.791, and 0.900 for Extraversion, Agreeableness, Openness, Neuroticism, and Conscientiousness; corresponding F1 scores are 0.760, 0.903, 0.829, 0.781, and 0.886. These figures support agreement with one human annotation on this sample, unevenly across traits; they do not validate that characters possess those traits or that GPT measures them psychometrically. The analysis uses 44 LIWC markers for gender and 65 LIWC/MRC markers for personality, Mann–Whitney and Wilcoxon tests, Cohen's d, and point-biserial correlations at α=0.05. For gender, 32 markers are significant: several follow directions previously reported for human texts but with larger effects, while others reverse, including you being more frequent in female fictional speech. Among authors with enough characters, correspondence between fictional and human effects varies; the Strindberg example reaches r=0.8861. For personality, 14 MRC and 48 LIWC variables associate with at least one trait; five are significant for all five traits and 24 for four. Neuroticism is especially linked to length and negative-affect vocabulary; Conscientiousness to word and phoneme length; Extraversion to leisure; Agreeableness to positive emotion; and Openness to meaningfulness, spelling, and leisure. However, hundreds of combinations are tested at α=0.05 without multiplicity correction, analyzed traits come from GPT's own labels, and complete effect sizes and uncertainty are not reported. The official-repository audit confirms a useful MIT-licensed release containing texts, labels, LIWC/MRC variables, demographics, human/GPT annotations, a notebook, and supplementary tables. It also reveals divergences: current CSV files contain 3,258 rows rather than 3,265, normalize to 133 authors rather than 132, and contain six duplicated author-play-character keys. There is no dependency manifest, exact GPT snapshot, executable prompt, seeds, or complete extraction and analysis pipeline. The resource is valuable for studying dramatic language and annotation bias, but its Big Five labels should be treated as partially validated GPT-3.5 predictions, not as true character personality or direct evidence about real people.

Pregunta de investigación

¿En qué medida el lenguaje atribuido a personajes teatrales reproduce o exagera patrones lingüísticos asociados con género y Big Five en textos humanos, y puede GPT-3.5 proporcionar etiquetas de personalidad suficientemente concordantes con una anotación humana parcial para construir un corpus exploratorio?

Método

Se extraen de Project Gutenberg las intervenciones de cada personaje en 400 obras teatrales inglesas y se concatenan por personaje, excluyendo quienes tienen menos de cinco líneas. El género se etiqueta manualmente y GPT-3.5-turbo asigna cinco etiquetas binarias Big Five. Un 10 % de los textos se distribuye entre dos anotadores humanos, uno por texto, para estimar accuracy, precision, recall y F1 de GPT. Se calculan 44 categorías LIWC para género y 51 LIWC más 14 MRC para personalidad. Mann–Whitney contrasta hombres y mujeres en todo el corpus, Wilcoxon compara autores, d de Cohen cuantifica diferencias y correlaciones punto-biseriales relacionan marcadores con etiquetas binarias al nivel global y de autor, usando α=0,05.

Muestra: El paper declara 3.265 textos de personajes procedentes de 400 obras y 132 autores, con 3.419.136 palabras y una media de 1.047,2. El CSV oficial auditado contiene 3.258 filas, 400 pares autor-obra y 133 valores de autor; seis claves autor-obra-personaje aparecen dos veces. Las etiquetas de género se reparten en 2.007 masculinas y 1.251 femeninas en el CSV. Aproximadamente el 10 % de textos se valida por humanos, pero cada texto recibe solo una anotación humana.

Hallazgos

  • GPT-3.5 alcanza accuracy de 0,872, 0,889, 0,894, 0,791 y 0,900 para extraversión, amabilidad, apertura, neuroticismo y responsabilidad.
  • Los F1 respectivos son 0,760, 0,903, 0,829, 0,781 y 0,886; extraversión tiene el F1 menor y neuroticismo la exactitud menor.
  • La validación compara cada predicción con una etiqueta humana individual, no con consenso ni una medida psicométrica del personaje.
  • La distribución publicada muestra mayor proporción de etiquetas positivas de amabilidad y menor de apertura y extraversión.
  • El análisis de género encuentra 32 marcadores lingüísticos significativos en el corpus completo.
  • BigWords, preposiciones, vocabulario de trabajo, números y palabras malsonantes siguen en personajes masculinos la dirección informada en personas, pero con efectos mayores.
  • Familia, hogar, procesos sociales, pronombres y negaciones son más frecuentes en personajes femeninos y también aparecen exagerados.
  • El pronombre you es un marcador invertido: aparece más en habla femenina ficticia, mientras el baseline humano citado lo asocia más con hombres.
  • El ejemplo de Strindberg muestra correlación r=0,8861 entre d humanos y ficticios para marcadores seleccionados, pero no representa a todos los autores.
  • En personalidad, 14 marcadores MRC y 48 LIWC tienen alguna correlación significativa.
  • Cinco marcadores son significativos para los cinco rasgos y 24 para cuatro rasgos.
  • Neuroticismo presenta la asociación positiva más fuerte con word count y con vocabulario negativo, ira y muerte.
  • Los personajes emocionalmente estables usan más puntuación, según la interpretación de las etiquetas binarias.
  • Responsabilidad se asocia con longitud de palabra y número de fonemas; los personajes no responsables con exclamaciones, comillas y disfluencias.
  • Extraversión se asocia con ocio; introversión con frases largas.
  • Amabilidad se asocia con emoción positiva y su polo negativo con emoción negativa e ira.
  • Apertura se asocia con meaningfulness, ortografía, longitud de palabra y ocio, y presenta más inversiones frente a baselines humanos.
  • El repositorio publica los datos y variables derivadas bajo licencia MIT, lo que mejora la auditabilidad del recurso.
  • El CSV oficial tiene 3.258 registros, siete menos que los 3.265 declarados por artículo y README.
  • El CSV contiene 133 valores de autor y seis claves autor-obra-personaje duplicadas, divergencias no documentadas en la versión publicada.

Limitaciones

  • Las etiquetas Big Five son inferencias de GPT-3.5, no autoinformes, observaciones longitudinales ni evaluaciones clínicas de personajes.
  • La ficción no ofrece ground truth objetivo sobre rasgos latentes; interpretación de texto y personalidad puede variar entre lectores.
  • Cada texto de validación tiene un solo anotador humano, por lo que no se calcula acuerdo entre humanos.
  • Dos anotadores reparten la muestra pero no etiquetan los mismos casos; diferencias personales quedan confundidas con los textos asignados.
  • No se informa el tamaño exacto por anotador, características de los anotadores, entrenamiento, adjudicación ni incertidumbre de métricas.
  • La muestra humana del 10 % puede no preservar autores, géneros, longitudes, épocas o prevalencias de rasgo.
  • No se especifica la instantánea exacta de gpt-3.5-turbo, temperatura, número de llamadas, manejo de errores ni semilla.
  • El prompt de anotación no aparece de forma ejecutable en el repositorio auditado.
  • La reducción de cada rasgo continuo a presencia/ausencia elimina intensidad, facetas y ambigüedad.
  • Accuracy depende de prevalencia y no se aportan intervalos, matrices de confusión o calibración.
  • Las métricas se calculan contra una etiqueta humana subjetiva llamada ground truth, una denominación demasiado fuerte.
  • El propio ejemplo de soledad muestra desacuerdo interpretativo plausible, no necesariamente un error inequívoco del modelo.
  • Las correlaciones entre lenguaje y personalidad se calculan sobre etiquetas producidas por el mismo LLM que el estudio pretende validar.
  • Se prueban 65 marcadores por cinco rasgos y múltiples análisis por autor con α=0,05 sin corrección por multiplicidad.
  • La afirmación de muchos marcadores significativos puede incluir falsos positivos y dependencias entre variables LIWC.
  • No se publican intervalos, estabilidad por bootstrap ni replicación por obra o autor.
  • Los textos de un mismo autor y obra no son independientes, pero las pruebas globales no modelan su estructura jerárquica.
  • Longitud, género dramático, época, autor, traducción y personaje pueden explicar asociaciones atribuidas a personalidad.
  • Las etiquetas de género son binarias y el artículo no explica casos ambiguos, personajes no humanos, disfraces o identidades no binarias.
  • Los baselines humanos proceden de estudios, corpus y épocas diferentes; coincidir en dirección no establece equivalencia.
  • Comparar solo signos de efectos significativos pierde magnitud, incertidumbre y diferencias de contexto.
  • El análisis por autores selecciona quienes tienen suficientes personajes y luego destaca top-10, introduciendo selección posterior.
  • El ejemplo r=0,8861 usa un subconjunto de marcadores significativos y no resume la distribución de autores.
  • LIWC es propietario y limita la reproducción completa aunque se publiquen columnas derivadas.
  • MRC y LIWC fueron desarrollados principalmente para inglés contemporáneo y pueden comportarse distinto con lenguaje teatral arcaico.
  • El corpus elimina obras en verso y no inglesas, por lo que no representa teatro o ficción en general.
  • Project Gutenberg sobrerrepresenta textos históricos de dominio público y ciertos cánones culturales.
  • El paper declara 3.265 muestras y 132 autores, mientras el artefacto actual contiene 3.258 filas y 133 autores.
  • Seis claves autor-obra-personaje duplicadas pueden sesgar conteos si se analizan como observaciones independientes.
  • No hay changelog o versión de dataset que explique las diferencias entre paper, README y CSV.
  • El repositorio carece de requirements, lockfile y pipeline completo para reconstruir extracción, anotación y figuras.
  • La licencia MIT del repositorio no documenta de forma individual las condiciones de cada texto fuente ni de LIWC/MRC.
  • No se evalúan sesgos de GPT por género, época, dialecto, longitud o estereotipo de personaje.
  • No se realiza evaluación ética del etiquetado de personalidad y género ni de posibles usos para perfilar autores o personas.

Qué no demuestra

  • No demuestra que los personajes ficticios tengan rasgos Big Five objetivamente verdaderos.
  • No demuestra validez psicométrica de GPT-3.5 como test de personalidad.
  • No demuestra equivalencia entre una predicción binaria desde texto y personalidad humana estable.
  • No demuestra consenso humano sobre las etiquetas, porque no hay solapamiento entre anotadores.
  • No demuestra que las métricas informadas generalicen fuera de la submuestra del 10 %.
  • No demuestra causalidad entre género o personalidad y uso lingüístico.
  • No demuestra que la ficción refleje personas reales; identifica coincidencias e inversiones bajo comparaciones heterogéneas.
  • No demuestra que los efectos sean universalmente más expresivos en ficción.
  • No demuestra que r=0,8861 represente a autores distintos de Strindberg o a todos los marcadores.
  • No demuestra que los cientos de resultados con p<0,05 sobrevivan una corrección por multiplicidad.
  • No demuestra independencia respecto de autor, obra, época, longitud o género dramático.
  • No demuestra que 3.265 sea el tamaño de la versión pública actual del corpus.
  • No permite reconstruir íntegramente el dataset y las figuras desde cero con el repositorio publicado.
  • No valida aplicaciones de perfilado de personas, evaluación de LLM o robótica mencionadas en la discusión.
  • No establece que las etiquetas sean seguras o apropiadas para decisiones sobre individuos reales.

Trazabilidad

Alcance: Texto completo

Versión: CogALex at LREC-COLING 2024 final paper, pp. 114-119, 6 pages; official Big-Five-Backstage repository main audited at commit cab452be63919474227cc3f441355a98b8bec84a; MIT dataset release present, published CSV contains 3,258 rows versus 3,265 reported in paper

Fuente consultada: https://aclanthology.org/2024.cogalex-1.13.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, psychometric, LLM-annotation, human-validation, LIWC-MRC, multiple-testing, dataset-artifact, reproducibility, bias, licensing and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-3.5-turbo, instantánea no especificada, como anotador de cinco rasgos binarios
  • Stanza para normalización y tokenización

Instrumentos y métricas

  • Definiciones Big Five de Mairesse y Walker para anotación binaria
  • LIWC-22, 51 variables usadas en el análisis de personalidad y 44 en género
  • MRC Psycholinguistic Database, 14 variables
  • Accuracy, precision, recall y F1 contra una etiqueta humana individual
  • Mann–Whitney U y Wilcoxon signed-rank
  • d de Cohen
  • Correlación punto-biserial y correlación entre efectos por autor

Datos utilizados

  • Big-Five Backstage, corpus de personajes teatrales de Project Gutenberg
  • Big-Five_Backstage.csv con texto y etiquetas binarias
  • Big-Five_Backstage_extended.csv con variables LIWC y MRC
  • BIG_5_human_and_GPT_annotated.xlsx con la submuestra de validación
  • authors_demographics.csv
  • Baselines psicolingüísticos humanos de Newman et al. y Mairesse y Walker

Evidencia y localización

  • Registro y abstract oficial: ACL Anthology 2024.cogalex-1.13; CogALex at LREC-COLING 2024, pp. 114-119
  • Fuente completa auditada: .cache/editorial-sources/article-100/source.pdf; official ACL PDF; 6 pages; sha256 9961f096dbdfb38b378dcecc4730970aeb373c93ee456d7e7b1f7d908cbc9fdc
  • Extracción y tamaño declarado: Full text pp. 114-115, sections 1 and 2.1
  • Anotación GPT y validación humana: Full text p. 115, section 2.2, example and Table 1
  • Distribución de etiquetas: Full text p. 115, Table 2
  • Pruebas y marcadores: Full text p. 116, section 3
  • Resultados de género: Full text pp. 116-117, section 4.1 and Figures 1-2
  • Resultados Big Five: Full text pp. 116-118, section 4.2 and Figure 3
  • Limitaciones reconocidas: Full text pp. 117-118, section 5
  • Interpretación y aplicaciones: Full text p. 118, section 6
  • Repositorio oficial: Official https://github.com/estiei/Big-Five-Backstage main, commit cab452be63919474227cc3f441355a98b8bec84a; checked 15 Jul 2026
  • Recuento del CSV publicado: Official dataset/Big-Five_Backstage.csv at audited commit: 3,258 parsed data rows, 400 author-play pairs, 133 author values, 2,007 M and 1,251 F labels
  • Claves duplicadas: Official CSV at audited commit: six repeated author-play-character keys across Baker, Denison and Galsworthy records
  • Artefactos abiertos: Official repository contains raw plays, base and extended CSVs, human/GPT annotation workbook, demographics, supplementary tables, notebook, utils.py and MIT license
  • Límites de reproducción: Official repository at audited commit has no dependency manifest, exact GPT snapshot, executable annotation prompt, seed or complete extraction/analysis pipeline
  • Comprobación visual integral: All 6 PDF pages rendered and visually inspected, including two tables, three figures, annotation example, methods, limitations, discussion and references; checked 15 Jul 2026