Big-Five Backstage publica un corpus de intervenciones de personajes de teatro en inglés, agregadas por personaje y etiquetadas con género binario y presencia/ausencia de cinco rasgos Big Five. El artículo parte de 178 archivos de Project Gutenberg, elimina obras no inglesas y en verso, conserva 400 obras de 132 autores y excluye personajes con menos de cinco líneas. Declara 3.265 textos, 3.419.136 palabras y 1.047,2 palabras por personaje. Las etiquetas de género se asignan manualmente, pero las de personalidad las produce GPT-3.5-turbo a partir del texto completo de cada personaje. Para validar esa anotación, se muestrea el 10 % y se reparte entre dos humanos ciegos a GPT; cada texto recibe la decisión de un solo humano, por lo que no existe acuerdo interanotador ni un ground truth consensuado. Frente a esas etiquetas humanas, GPT obtiene exactitudes de 0,872, 0,889, 0,894, 0,791 y 0,900 para extraversión, amabilidad, apertura, neuroticismo y responsabilidad; los F1 respectivos son 0,760, 0,903, 0,829, 0,781 y 0,886. Estas cifras apoyan que el modelo coincide con una anotación humana individual en esa muestra, con rendimiento desigual por rasgo; no validan que los personajes tengan esos rasgos ni que GPT los mida psicométricamente. El análisis usa 44 marcadores LIWC para género y 65 marcadores LIWC/MRC para personalidad, pruebas Mann–Whitney y Wilcoxon, d de Cohen y correlaciones punto-biseriales con α=0,05. Para género encuentra 32 marcadores significativos: varios siguen direcciones publicadas en textos humanos, pero con efectos mayores; otros se invierten, como el pronombre you, más frecuente en personajes femeninos. En autores con suficientes personajes, la relación entre efectos ficticios y humanos varía y el ejemplo de Strindberg alcanza r=0,8861. Para personalidad, 14 variables MRC y 48 LIWC se asocian con al menos un rasgo; cinco son significativas para los cinco rasgos y 24 para cuatro. Neuroticismo se relaciona especialmente con longitud y vocabulario afectivo negativo; responsabilidad con longitud de palabra y fonemas; extraversión con ocio; amabilidad con emociones positivas; y apertura con meaningfulness, ortografía y ocio. Sin embargo, se prueban cientos de combinaciones con α=0,05 sin corrección por comparaciones múltiples, las etiquetas analizadas proceden del propio GPT y no se informan tamaños de efecto completos ni incertidumbre. La auditoría del repositorio confirma una publicación útil bajo MIT con textos, etiquetas, variables LIWC/MRC, demografía, anotaciones humanas/GPT, notebook y tablas suplementarias. También descubre divergencias: los CSV actuales contienen 3.258 filas, no 3.265; normalizan 133 autores, no 132; y seis claves autor-obra-personaje están duplicadas. No hay manifiesto de dependencias, versión exacta de GPT, prompt ejecutable, semillas ni pipeline completo de extracción y análisis. El recurso es valioso para estudiar lenguaje dramático y sesgos de anotación, pero las etiquetas Big Five deben tratarse como predicciones débiles de GPT-3.5 validadas parcialmente, no como personalidad verdadera de personajes ni como evidencia directa sobre personas reales.
Pregunta de investigación
¿En qué medida el lenguaje atribuido a personajes teatrales reproduce o exagera patrones lingüísticos asociados con género y Big Five en textos humanos, y puede GPT-3.5 proporcionar etiquetas de personalidad suficientemente concordantes con una anotación humana parcial para construir un corpus exploratorio?