Inclusivity in Large Language Models: Personality Traits and Gender Bias in Scientific Abstracts

Aplicaciones, sesgos y seguridad2024aircconline.comRevisión editorial aprobada

Autores: Naseela Pervez, Alexander J. Titus

Palabras clave: Computation and Language, Artificial Intelligence, Large Language Models, Gender Bias, Scientific Writing

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
20
Hallazgos
32
Limitaciones
9
Evidencias

Resumen editorial

Español

El estudio pregunta si Claude 3 Opus, Gemini 1.5 Flash y Mistral AI Large preservan en una reescritura los patrones LIWC de resúmenes científicos humanos y si las diferencias entre textos de autoría exclusivamente masculina o femenina reaparecen o se amplifican. Parte de 3.390 abstracts tomados aleatoriamente de CORE: 418 se clasifican como female-only, 946 como male-only y 2.026 como mixed-gender mediante la biblioteca `gender-extractor`, que infiere género a partir de nombres. Cada modelo recibe el mismo prompt zero-shot para reescribir el abstract con parámetros por defecto. LIWC-22 extrae 35 indicadores léxicos, cognitivos, afectivos, sociales, culturales y motivacionales. Para cada indicador se calcula la correlación de Pearson entre el valor original y el reescrito sobre los 3.390 pares; para el análisis de género se excluye la mayoría mixta y se comparan 946 frente a 418 mediante t-tests independientes, por separado en originales y en cada modelo. Las correlaciones diagonales publicadas son positivas y van aproximadamente de 0,22 a 0,92: word count correlaciona 0,35 con Claude, 0,80 con Gemini y 0,86 con Mistral; discrepancy queda en 0,22 en los tres, mientras anxiety, ethnicity y technology superan con frecuencia 0,85. El paper informa p<0,05 para todas las correlaciones no NaN y concluye que los modelos conservan rasgos del texto humano. Esa lectura debe limitarse a covariación de recuentos LIWC en reescrituras del mismo contenido: no mide personalidad psicológica, equivalencia semántica ni ausencia de distorsión. En la tabla de género, los originales presentan, entre otras, t=-5,86 en word count, 3,93 en Tone, -6,74 en insight, -2,27 en cause, 3,82 en positive emotion, 5,70 en politeness y 2,61 en risk. En salidas LLM aparecen diferencias significativas nuevas o más claras para achievement, conflict y curiosity, mientras la diferencia de causation ya no resulta significativa. Estos cambios son descriptivos y potencialmente relevantes, pero el estudio no prueba directamente una amplificación: no compara el cambio LLM-menos-original entre grupos ni estima una interacción. El error más grave es que el texto interpreta los estadísticos t como razones: t=-5,86 se convierte en “5,86 veces más palabras”, t=-6,74 en “siete veces más palabras de insight” y t=5,70 en “cinco veces más cortesía”. Un estadístico t no es un cociente de medias; sin medias, desviaciones y tamaños de efecto no puede sostenerse ninguna afirmación de “veces más”. Tampoco se corrigen las numerosas comparaciones ni se publican p exactos, intervalos o datos. El prompt no contiene género ni nombres: el modelo solo ve el abstract, de modo que una diferencia heredada puede ser mera conservación de tema o estilo, no un estereotipo introducido por el modelo. La versión publicada reconoce desequilibrio de clases, confusión por disciplina y falta de análisis temporal. Sin el subconjunto CORE, salidas, código, versiones exactas de los modelos y resultados LIWC, no es posible recalcular el trabajo. La contribución defendible es un esquema exploratorio para comparar perfiles LIWC emparejados; la evidencia no basta para cuantificar magnitudes de sesgo ni afirmar que los LLM causan o amplifican una brecha de género.

English

The study asks whether Claude 3 Opus, Gemini 1.5 Flash, and Mistral AI Large preserve LIWC patterns from human scientific abstracts when rewriting them, and whether differences between exclusively male- and female-authored texts reappear or grow. It starts from 3,390 randomly selected CORE abstracts: 418 are classified as female-only, 946 as male-only, and 2,026 as mixed-gender through `gender-extractor`, which infers gender from names. Each model receives the same zero-shot rewrite prompt with default parameters. LIWC-22 extracts 35 lexical, cognitive, affective, social, cultural, and motive indicators. For each indicator, Pearson correlation compares the original and rewritten values over 3,390 pairs; the gender analysis excludes the mixed majority and compares 946 against 418 through independent t-tests, separately for originals and each model. Published diagonal correlations are positive and range roughly from 0.22 to 0.92: word count correlates 0.35 for Claude, 0.80 for Gemini, and 0.86 for Mistral; discrepancy is 0.22 for all three, while anxiety, ethnicity, and technology often exceed 0.85. The paper reports p<0.05 for every non-NaN correlation and concludes that models preserve human textual traits. This only establishes covariation of LIWC counts in rewrites of the same content; it does not measure psychological personality, semantic equivalence, or lack of distortion. In the gender table, originals show, among others, t=-5.86 for word count, 3.93 for Tone, -6.74 for insight, -2.27 for cause, 3.82 for positive emotion, 5.70 for politeness, and 2.61 for risk. LLM outputs show new or clearer significant differences for achievement, conflict, and curiosity, while causation is no longer significant. Those shifts are descriptively interesting, but the study never directly tests amplification: it does not compare LLM-minus-original change between groups or estimate an interaction. The most serious error is interpreting t statistics as ratios: t=-5.86 becomes '5.86 times more words,' t=-6.74 becomes 'seven times more insight words,' and t=5.70 becomes 'five times more polite.' A t statistic is not a ratio of means; without means, dispersions, and effect sizes, no 'times more' statement follows. The analysis also lacks multiplicity correction, exact p values, intervals, and released data. The prompt contains neither gender nor author names: the model sees only the abstract, so an inherited difference may reflect preservation of topic or style rather than a model-introduced stereotype. The published version acknowledges class imbalance, disciplinary confounding, and absence of longitudinal analysis. Without the CORE subset, generations, code, exact model versions, and LIWC outputs, the work cannot be recomputed. The defensible contribution is an exploratory paired-LIWC comparison scheme; the evidence does not quantify bias magnitudes or establish that LLMs cause or amplify a gender gap.

Pregunta de investigación

¿Hasta qué punto tres LLM conservan el perfil LIWC de abstracts científicos al reescribirlos, y reproducen, reducen o amplifican las diferencias observadas entre textos clasificados como de autoría exclusivamente masculina o femenina?

Método

Se muestrean aleatoriamente 3.390 abstracts de CORE y se infiere el género de sus autores con `gender-extractor`. Claude 3 Opus, Gemini 1.5 Flash y Mistral AI Large reescriben cada texto con un único prompt zero-shot y parámetros por defecto. LIWC-22 produce 35 indicadores. Para cada indicador se correlacionan mediante Pearson los 3.390 valores originales y reescritos. Para género se excluyen 2.026 trabajos mixtos y se ejecutan t-tests de dos muestras entre 946 male-only y 418 female-only en originales y en cada conjunto LLM. La auditoría editorial leyó y renderizó la publicación de 16 páginas, la comparó con arXiv v1, verificó tablas, DOI y venue, revisó la interpretación estadística y buscó sin encontrar código o datos asociados.

Muestra: 3.390 abstracts: 418 clasificados como escritos solo por mujeres, 946 solo por hombres y 2.026 por equipos mixtos. La correlación usa los 3.390 pares por modelo; los t-tests usan 1.364 originales y sus reescrituras, excluyendo el 59,8% mixto. Si todos los abstracts fueron procesados como se describe, el diseño comprende 3.390 originales y 10.170 reescrituras, pero los textos, identificadores y matrices no se publican.

Hallazgos

  • La versión publicada aparece en NLAI 2024 / CS & IT 14(22) con DOI 10.5121/csit.2024.142201 y añade limitaciones ausentes en arXiv v1.
  • La muestra se distribuye en 418 female-only, 946 male-only y 2.026 mixed-gender.
  • Las correlaciones diagonales LIWC originales-reescritura son positivas entre 0,22 y 0,92, salvo Segment NaN.
  • Word count correlaciona 0,35 con Claude, 0,80 con Gemini y 0,86 con Mistral.
  • Discrepancy es el indicador menos alineado, r=0,22 en los tres modelos.
  • Ethnicity alcanza 0,86/0,92/0,91 y technology 0,86/0,91/0,89 para Claude/Gemini/Mistral.
  • El paper declara p<0,05 para todas las correlaciones no NaN, sin corrección por multiplicidad.
  • En originales, t=-5,86 para word count indica una diferencia estandarizada, no una razón 5,86x.
  • En originales, insight t=-6,74, cause t=-2,27 y differ t=-3,20 muestran diferencias de signo negativo según el orden de grupos usado.
  • Tone t=3,93, positive tone t=3,88 y positive emotion t=3,82 tienen signo positivo en originales.
  • Politeness t=5,70 y risk t=2,61 resultan significativos en originales.
  • Achievement no es significativo en originales (t=-0,78) pero sí en Claude, Gemini y Mistral (-3,22/-2,15/-2,67).
  • Curiosity no es significativa en originales (1,06) pero sí en los tres LLM (3,75/2,60/2,66).
  • Conflict queda en -1,95 en originales y pasa a -2,53/-2,58/-2,00 en los tres LLM.
  • Cause es significativa en originales (-2,27) pero no en ninguna reescritura (-0,51/-1,56/-1,38).
  • La diferencia de Tone se reduce en magnitud en Claude, Gemini y Mistral (1,77/2,37/2,43) frente a 3,93 humana.
  • El paper interpreta repetidamente |t| como 'veces más', una inferencia matemáticamente inválida.
  • No se publican medias, desviaciones, grados de libertad, p exactos, Cohen d o intervalos que permitan estimar magnitud.
  • No hay prueba de interacción ni comparación del cambio reescrito-menos-original entre grupos.
  • No se encontró repositorio, dataset, salidas, código de API o matrices LIWC públicas asociadas.

Limitaciones

  • gender-extractor infiere género desde nombres y no mide identidad de género autoidentificada.
  • No se informa versión, cobertura cultural, umbral, tasas unknown ni validación de la inferencia de nombres.
  • El esquema reduce género a male/female y excluye identidades no binarias.
  • Un abstract con varios autores se atribuye a una categoría colectiva sin modelar número, orden o contribución autoral.
  • Se excluyen 2.026 trabajos mixtos, el 59,8% de la muestra, del análisis de género.
  • Los grupos están desequilibrados, 946 frente a 418; el paper lo reconoce pero no ajusta.
  • Disciplina, tema y jerga pueden explicar simultáneamente género inferido y LIWC; no hay controles por campo.
  • No se controla año de publicación, otra limitación reconocida en la versión publicada.
  • El muestreo se describe como aleatorio sin marco muestral, semilla, fecha, idioma o criterios de inclusión.
  • No se publican identificadores CORE, por lo que no pueden auditarse duplicados, campos o atribuciones.
  • Los modelos carecen de IDs exactos, fechas de consulta, proveedor/deployment y versiones de API.
  • Usar parámetros por defecto impide reproducir temperatura, top-p, longitud y comportamiento cambiante del servicio.
  • Solo se usa un prompt y no se evalúa sensibilidad a instrucciones alternativas.
  • LIWC-22 es propietario y no se libera la configuración de ejecución o diccionario exacto.
  • Los recuentos LIWC describen patrones de palabras; llamarlos personalidad del autor excede lo medido.
  • Una correlación positiva no implica igualdad de nivel, baja distorsión o fidelidad semántica.
  • Correlacionar reescrituras del mismo contenido favorece alineación por tema y vocabulario compartido.
  • Con n=3.390, significación p<0,05 puede coexistir con asociaciones débiles como r=0,22.
  • Se prueban decenas de correlaciones y al menos 35 t-tests por corpus sin corrección por comparaciones múltiples.
  • No se especifica versión del t-test, supuesto de varianzas iguales, diagnóstico de distribución o robustez.
  • Los estadísticos t se interpretan erróneamente como razones entre medias.
  • No hay medias ni dispersiones por grupo para comprobar dirección y magnitud.
  • Comparar qué tests son significativos no equivale a probar que dos efectos difieren.
  • Para demostrar amplificación haría falta una interacción o comparar cambios emparejados por género.
  • El prompt no incluye género ni nombres, por lo que el modelo no recibe directamente la categoría auditada.
  • Las diferencias en salidas pueden ser heredadas del contenido original en vez de introducidas por el modelo.
  • No se evalúan exactitud factual, preservación de significado, calidad, plagio o cambios de conclusiones.
  • No hay evaluación humana de estilo, inclusividad o daño percibido.
  • Solo se estudian abstracts; no se generaliza a manuscritos completos o procesos reales de revisión.
  • La referencia de Mistral AI Large apunta al trabajo de Mistral 7B y no documenta el modelo comercial usado.
  • La ausencia de datos, código y salidas impide reproducir cualquier coeficiente o t-statistic.
  • El estudio no mide citas, aceptación, visibilidad ni consecuencias para autores reales.

Qué no demuestra

  • No demuestra personalidad psicológica de autores o modelos a partir de LIWC.
  • No establece que un valor t de 5,86 signifique 5,86 veces más de una característica.
  • No prueba que los LLM conozcan o infieran correctamente el género de los autores.
  • No aísla género frente a disciplina, tema, periodo, idioma o composición del equipo.
  • No demuestra amplificación porque no contrasta directamente cambios de efecto entre original y reescritura.
  • No establece causalidad del LLM cuando las diferencias pueden venir del texto de entrada.
  • No cuantifica tamaños de efecto o relevancia práctica de las diferencias.
  • No prueba que una correlación LIWC alta preserve significado o calidad científica.
  • No generaliza a identidades no binarias, equipos mixtos, otras tareas o modelos actuales.
  • No demuestra efectos sobre publicación, citas, carrera, inclusión o discriminación real.

Trazabilidad

Alcance: Texto completo

Versión: NLAI 2024 / Computer Science & Information Technology vol. 14 no. 22, pages 1–16; DOI 10.5121/csit.2024.142201

Fuente consultada: https://aircconline.com/csit/papers/vol14/csit142201.pdf

Revisión: Codex published/full-text, visual and statistical-validity audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Claude 3 Opus, exact snapshot and API date not reported
  • Gemini 1.5 Flash, exact snapshot and API date not reported
  • Mistral AI Large, exact snapshot and API date not reported

Instrumentos y métricas

  • LIWC-22 proprietary dictionaries
  • 35 selected LIWC lexical, cognitive, affective, social, cultural and motive indicators
  • Pearson correlation on paired original/rewrite feature values
  • Independent two-sample t-tests for male-only versus female-only groups
  • gender-extractor name-based gender inference
  • Single zero-shot abstract-rewriting prompt

Datos utilizados

  • Unreleased random subset of 3,390 scientific abstracts from CORE
  • Unreleased 3,390 rewrites from each of Claude, Gemini and Mistral
  • Unreleased LIWC-22 feature matrices for original and rewritten texts
  • Published Table 2 correlation coefficients and Table 3 t statistics
  • arXiv:2406.19497v1 preserved as the earlier manuscript version

Evidencia y localización

  • Preguntas, motivación y marco LIWC: Published paper pp. 1–5, Introduction, Related Work and Sections 3.1–3.3
  • Muestra CORE y asignación de género: Published paper p. 4, Section 3.1 and Table 1
  • Modelos, prompt y parámetros por defecto: Published paper p. 5, Section 3.2
  • Correlaciones por indicador: Published paper pp. 6–9, Section 4.1, Table 2 and Figures 2–3
  • t-tests y afirmaciones de veces más: Published paper pp. 9–12, Section 4.2, Table 3 and Figure 4
  • Desequilibrio, disciplina, tiempo e interseccionalidad: Published paper pp. 12–13, Limitations and Future Works
  • Venue, DOI, fecha y versión publicada: AIRCC CS & IT volume 14 number 22 record and published PDF, checked 15 Jul 2026
  • Versión previa y diferencias editoriales: arXiv:2406.19497v1 full text compared with November 2024 publication
  • Ausencia de artefacto reproducible: Publisher/arXiv associated-material records and GitHub title/author search, checked 15 Jul 2026