El artículo estudia si representaciones fijas de textos de Reddit obtenidas con BERT, RoBERTa y OpenAI text-embedding-3-small permiten predecir etiquetas Big Five humanas y si esas representaciones pueden considerarse psicométricamente fiables y válidas. Parte de PANDORA, conserva 1.568 usuarios y declara 935.102 publicaciones después de filtrar idioma, longitud y duplicados. Compara regresión frente a un trabajo anterior y GPT-4o zero-shot, y clasificación binaria con cinco algoritmos, variables lingüísticas y combinaciones de variables. Como contribución computacional, la comparación es amplia y el artículo publica tablas por rasgo, un anexo de configuraciones y un repositorio de código que permite auditar parte del flujo.
Los resultados predictivos descriptivos favorecen a las representaciones de OpenAI: MSE medio 526,90 frente a 531,11 del BERT previo, 618,44 de RoBERTa y 765,647 de GPT-4o zero-shot; en clasificación, el BiLSTM con embeddings de OpenAI alcanza AUROC 0,82–0,83, RoBERTa 0,80–0,82 y BERT 0,73–0,75. Las variables lingüísticas solas quedan en 0,63–0,66 y añadirlas a embeddings no mejora de forma estable. Sin embargo, la afirmación de «45% menos error» invierte el denominador: 526,90 supone aproximadamente un 31,2% menos MSE que 765,647; 45,3% es cuánto mayor resulta el zero-shot respecto al modelo con embeddings. La ventaja de OpenAI frente al BERT previo es de solo 4,21 puntos de MSE y no se acompaña de intervalos, repetición o contraste estadístico. Además, el prompt zero-shot produce puntuaciones 1–5 mientras las etiquetas se describen en escala 0–100, sin una transformación reproducible que haga comparable esa tabla.
La principal conclusión psicométrica no está respaldada por el artefacto público. La Tabla 4 atribuye a «LLM embeddings» alfas de Cronbach entre 0,574 y 0,664, pero el cuaderno publicado reproduce exactamente esos cinco valores ejecutando cronbach_alpha sobre 134 variables lingüísticas estandarizadas LIWC/NRC/VADER; la línea que calcularía alfa sobre embeddings está comentada. Otro cuaderno exploratorio obtiene alfa −0,1725 sobre dimensiones seleccionadas del embedding y tampoco aparece en el artículo. Incluso si se hubiera calculado sobre coordenadas del vector, tratar dimensiones arbitrarias o componentes PCA como ítems intercambiables de una escala no demostraría consistencia interna del Big Five. Las correlaciones entre variables LIWC seleccionadas y componentes PCA muestran que el embedding contiene información léxica, no validez convergente con una medida independiente del rasgo; y comparar la matriz de correlaciones entre etiquetas y predicciones no constituye por sí solo validez convergente o discriminante.
El problema predictivo también sufre fuga por identidad y pseudorreplicación. Las etiquetas son de usuario, pero cada publicación se trata como muestra independiente; el código elimina el identificador de autor y realiza particiones aleatorias por fila, por lo que textos del mismo usuario pueden estar simultáneamente en entrenamiento, validación y prueba. El rendimiento puede reflejar estilo o identidad conocida y no generalización a personas nuevas. Aunque el artículo afirma validación de cinco pliegues, la ruta principal del código pasa kFold=False y el checkpoint incluido no documenta esa validación. El repositorio no incluye los datos, embeddings, entorno, licencia ni resultados suficientes para reconstruir las tablas; contiene además rutas absolutas y configuraciones inconsistentes con el manuscrito. En consecuencia, el trabajo aporta evidencia descriptiva de que embeddings de texto codifican señales útiles para predecir etiquetas PANDORA bajo este protocolo, pero no establece validez psicométrica, generalización a nuevos usuarios, utilidad clínica ni una medición fiable de personalidad.