El estudio pregunta si Claude 3 Opus, Gemini 1.5 Flash y Mistral AI Large preservan en una reescritura los patrones LIWC de resúmenes científicos humanos y si las diferencias entre textos de autoría exclusivamente masculina o femenina reaparecen o se amplifican. Parte de 3.390 abstracts tomados aleatoriamente de CORE: 418 se clasifican como female-only, 946 como male-only y 2.026 como mixed-gender mediante la biblioteca `gender-extractor`, que infiere género a partir de nombres. Cada modelo recibe el mismo prompt zero-shot para reescribir el abstract con parámetros por defecto. LIWC-22 extrae 35 indicadores léxicos, cognitivos, afectivos, sociales, culturales y motivacionales. Para cada indicador se calcula la correlación de Pearson entre el valor original y el reescrito sobre los 3.390 pares; para el análisis de género se excluye la mayoría mixta y se comparan 946 frente a 418 mediante t-tests independientes, por separado en originales y en cada modelo. Las correlaciones diagonales publicadas son positivas y van aproximadamente de 0,22 a 0,92: word count correlaciona 0,35 con Claude, 0,80 con Gemini y 0,86 con Mistral; discrepancy queda en 0,22 en los tres, mientras anxiety, ethnicity y technology superan con frecuencia 0,85. El paper informa p<0,05 para todas las correlaciones no NaN y concluye que los modelos conservan rasgos del texto humano. Esa lectura debe limitarse a covariación de recuentos LIWC en reescrituras del mismo contenido: no mide personalidad psicológica, equivalencia semántica ni ausencia de distorsión. En la tabla de género, los originales presentan, entre otras, t=-5,86 en word count, 3,93 en Tone, -6,74 en insight, -2,27 en cause, 3,82 en positive emotion, 5,70 en politeness y 2,61 en risk. En salidas LLM aparecen diferencias significativas nuevas o más claras para achievement, conflict y curiosity, mientras la diferencia de causation ya no resulta significativa. Estos cambios son descriptivos y potencialmente relevantes, pero el estudio no prueba directamente una amplificación: no compara el cambio LLM-menos-original entre grupos ni estima una interacción. El error más grave es que el texto interpreta los estadísticos t como razones: t=-5,86 se convierte en “5,86 veces más palabras”, t=-6,74 en “siete veces más palabras de insight” y t=5,70 en “cinco veces más cortesía”. Un estadístico t no es un cociente de medias; sin medias, desviaciones y tamaños de efecto no puede sostenerse ninguna afirmación de “veces más”. Tampoco se corrigen las numerosas comparaciones ni se publican p exactos, intervalos o datos. El prompt no contiene género ni nombres: el modelo solo ve el abstract, de modo que una diferencia heredada puede ser mera conservación de tema o estilo, no un estereotipo introducido por el modelo. La versión publicada reconoce desequilibrio de clases, confusión por disciplina y falta de análisis temporal. Sin el subconjunto CORE, salidas, código, versiones exactas de los modelos y resultados LIWC, no es posible recalcular el trabajo. La contribución defendible es un esquema exploratorio para comparar perfiles LIWC emparejados; la evidencia no basta para cuantificar magnitudes de sesgo ni afirmar que los LLM causan o amplifican una brecha de género.
Pregunta de investigación
¿Hasta qué punto tres LLM conservan el perfil LIWC de abstracts científicos al reescribirlos, y reproducen, reducen o amplifican las diferencias observadas entre textos clasificados como de autoría exclusivamente masculina o femenina?