Este preprint compara a diez estudiantes de posgrado en Psicología con cinco modelos de embeddings MPNet para recuperar el factor Big Five asignado oficialmente a ítems del Big Five Questionnaire italiano (BFQ) y del Big Five Inventory (BFI). Para BFQ se seleccionan 50 de 132 ítems, diez por factor; para BFI el método presenta el inventario de 44 ítems, pero resultados, porcentajes y gráficos usan ocho ítems por factor, 40 en total, sin explicar qué cuatro se excluyen. Los jueces italianos puntúan cada ítem frente a cada constructo con 0, 1 o 2. Aunque el paper llama a esto Content Validity Ratio, la clasificación final no usa el CVR publicado ni su umbral crítico: elige el constructo con más valoraciones positivas. Los modelos son paraphrase-multilingual-mpnet-base-v2 sobre italiano, all-mpnet-base-v2 sobre una traducción inglesa, SurveyBot3000, dwulff/mpnet-personality y una nueva variante de all-MPNet afinada por los autores. Para cada ítem, el algoritmo calcula su similitud coseno media con los demás ítems cuyas etiquetas teóricas ya se conocen, por factor, y elige el máximo tras softmax. Este método no es no supervisado: usa las etiquetas de todos los otros ítems del mismo benchmark y es una clasificación transductiva leave-one-item-out. Softmax no añade evidencia ni calibra probabilidades; conserva el mismo argmax. El resultado útil es descriptivo. En BFQ, la tabla final reporta humano 84%, MPNet multilingüe 64%, MPNet inglés 70%, SurveyBot 64%, Personality MPNet 72% y el modelo de los autores 80%. En BFI reporta humano 72%, multilingüe 77,5%, inglés 80%, SurveyBot 75%, Personality MPNet 97,5% y autores 82,5%. La ventaja del modelo personality sobre humanos en BFI equivale a 39/40 frente a 29/40 etiquetas recuperadas; no demuestra validez de contenido ni superioridad sobre expertos en construcción de tests. De hecho, la tarea evalúa recuperación de etiquetas oficiales, no si el conjunto cubre de forma representativa y exhaustiva el dominio del constructo. No se mide cobertura de facetas, relevancia, claridad, sesgo cultural o varianza irrelevante. La comparación de idiomas también está confundida: humanos y MPNet multilingüe ven italiano, mientras los modelos ingleses ven traducciones no documentadas; no hay un diseño cruzado que separe modelo, idioma y traducción. El nuevo modelo se entrena con pares IPIP pseudoetiquetados por el cross-encoder de ranking cross-encoder/ms-marco-MiniLM-L12-v2. El paper afirma que 3.250 ítems producen más de 15 millones de pares, pero combinaciones no ordenadas son 5.279.625 y pares ordenados sin identidad 10.559.250; con los 3.320 ítems mencionados en otro párrafo serían 5.509.540 o 11.019.080. También describe las salidas del cross-encoder como similitudes entre −1 y 1, mientras la tarjeta oficial muestra logits como 9,219 y −4,078. No explica normalización, clipping o función de pérdida. Los autores justifican no crear train/test porque BFI y BFQ exactos no aparecen en IPIP, pero eso no evalúa generalización del afinado, no evita casi duplicados entre inventarios y deja sin validación el aprendizaje sobre millones de pares dependientes. El suplemento prometido no está en el PDF ni se localizó fuera: faltan lista de ítems, gráficos S1–S16 y detalles de entrenamiento. Hay además contradicciones internas. El BFQ humano se describe repetidamente como 82%, aunque los cinco resultados por factor y la tabla suman 42/50=84%. El BFI humano suma 29/40=72,5%, no 72%. Se afirma que Personality MPNet elevó neuroticismo BFQ de 50% a 100%, pero el MPNet base ya figura con 100%. Se dice que el modelo de los autores mejora todos los constructos BFQ, aunque iguala al base en amabilidad y neuroticismo. “Significativo” se usa sin test, intervalo o repetición; 80% frente a 84% en BFQ son solo dos ítems. La conclusión fiel es que ciertos embeddings recuperan con alta exactitud las etiquetas Big Five de estos dos conjuntos bajo un procedimiento transductivo y que el modelo entrenado con correlaciones de inventarios obtiene 39/40 en el subconjunto BFI. El trabajo no valida automáticamente el contenido de un test, no demuestra objetividad ni robustez, y no establece una complementariedad híbrida porque no prueba ningún sistema que combine decisiones humanas y de modelo.
Pregunta de investigación
¿Con qué exactitud diez jueces y varios embeddings MPNet recuperan la etiqueta Big Five oficial de ítems BFQ/BFI, cómo influyen idioma y afinado, y qué límites tiene usar similitud semántica como ayuda a la validez de contenido?