Comparing Human Expertise and Large Language Models Embeddings in Content Validity Assessment of Personality Tests

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Nicola Milano, Michela Ponticorvo, Davide Marocco

Palabras clave: Large Language Models, Personality, Big Five, Psychometrics, Persona

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
14
Hallazgos
43
Limitaciones
11
Evidencias

Resumen editorial

Español

Este preprint compara a diez estudiantes de posgrado en Psicología con cinco modelos de embeddings MPNet para recuperar el factor Big Five asignado oficialmente a ítems del Big Five Questionnaire italiano (BFQ) y del Big Five Inventory (BFI). Para BFQ se seleccionan 50 de 132 ítems, diez por factor; para BFI el método presenta el inventario de 44 ítems, pero resultados, porcentajes y gráficos usan ocho ítems por factor, 40 en total, sin explicar qué cuatro se excluyen. Los jueces italianos puntúan cada ítem frente a cada constructo con 0, 1 o 2. Aunque el paper llama a esto Content Validity Ratio, la clasificación final no usa el CVR publicado ni su umbral crítico: elige el constructo con más valoraciones positivas. Los modelos son paraphrase-multilingual-mpnet-base-v2 sobre italiano, all-mpnet-base-v2 sobre una traducción inglesa, SurveyBot3000, dwulff/mpnet-personality y una nueva variante de all-MPNet afinada por los autores. Para cada ítem, el algoritmo calcula su similitud coseno media con los demás ítems cuyas etiquetas teóricas ya se conocen, por factor, y elige el máximo tras softmax. Este método no es no supervisado: usa las etiquetas de todos los otros ítems del mismo benchmark y es una clasificación transductiva leave-one-item-out. Softmax no añade evidencia ni calibra probabilidades; conserva el mismo argmax. El resultado útil es descriptivo. En BFQ, la tabla final reporta humano 84%, MPNet multilingüe 64%, MPNet inglés 70%, SurveyBot 64%, Personality MPNet 72% y el modelo de los autores 80%. En BFI reporta humano 72%, multilingüe 77,5%, inglés 80%, SurveyBot 75%, Personality MPNet 97,5% y autores 82,5%. La ventaja del modelo personality sobre humanos en BFI equivale a 39/40 frente a 29/40 etiquetas recuperadas; no demuestra validez de contenido ni superioridad sobre expertos en construcción de tests. De hecho, la tarea evalúa recuperación de etiquetas oficiales, no si el conjunto cubre de forma representativa y exhaustiva el dominio del constructo. No se mide cobertura de facetas, relevancia, claridad, sesgo cultural o varianza irrelevante. La comparación de idiomas también está confundida: humanos y MPNet multilingüe ven italiano, mientras los modelos ingleses ven traducciones no documentadas; no hay un diseño cruzado que separe modelo, idioma y traducción. El nuevo modelo se entrena con pares IPIP pseudoetiquetados por el cross-encoder de ranking cross-encoder/ms-marco-MiniLM-L12-v2. El paper afirma que 3.250 ítems producen más de 15 millones de pares, pero combinaciones no ordenadas son 5.279.625 y pares ordenados sin identidad 10.559.250; con los 3.320 ítems mencionados en otro párrafo serían 5.509.540 o 11.019.080. También describe las salidas del cross-encoder como similitudes entre −1 y 1, mientras la tarjeta oficial muestra logits como 9,219 y −4,078. No explica normalización, clipping o función de pérdida. Los autores justifican no crear train/test porque BFI y BFQ exactos no aparecen en IPIP, pero eso no evalúa generalización del afinado, no evita casi duplicados entre inventarios y deja sin validación el aprendizaje sobre millones de pares dependientes. El suplemento prometido no está en el PDF ni se localizó fuera: faltan lista de ítems, gráficos S1–S16 y detalles de entrenamiento. Hay además contradicciones internas. El BFQ humano se describe repetidamente como 82%, aunque los cinco resultados por factor y la tabla suman 42/50=84%. El BFI humano suma 29/40=72,5%, no 72%. Se afirma que Personality MPNet elevó neuroticismo BFQ de 50% a 100%, pero el MPNet base ya figura con 100%. Se dice que el modelo de los autores mejora todos los constructos BFQ, aunque iguala al base en amabilidad y neuroticismo. “Significativo” se usa sin test, intervalo o repetición; 80% frente a 84% en BFQ son solo dos ítems. La conclusión fiel es que ciertos embeddings recuperan con alta exactitud las etiquetas Big Five de estos dos conjuntos bajo un procedimiento transductivo y que el modelo entrenado con correlaciones de inventarios obtiene 39/40 en el subconjunto BFI. El trabajo no valida automáticamente el contenido de un test, no demuestra objetividad ni robustez, y no establece una complementariedad híbrida porque no prueba ningún sistema que combine decisiones humanas y de modelo.

English

This preprint compares ten graduate psychology students with five MPNet embedding models on recovery of the officially assigned Big Five factor for items from the Italian Big Five Questionnaire (BFQ) and the Big Five Inventory (BFI). For BFQ, 50 of 132 items are selected, ten per factor. The method introduces the 44-item BFI, but results, percentages, and plots use eight items per factor, 40 total, without explaining which four are excluded. Italian judges score each item against each construct as 0, 1, or 2. Although the paper calls this the Content Validity Ratio, final classification does not use the published CVR statistic or its critical threshold; it selects the construct receiving the most positive ratings. Models are paraphrase-multilingual-mpnet-base-v2 on Italian, all-mpnet-base-v2 on an English translation, SurveyBot3000, dwulff/mpnet-personality, and a new all-MPNet variant fine-tuned by the authors. For each item, the algorithm averages cosine similarity to all other items whose theoretical labels are already known, separately by factor, and selects the maximum after softmax. This is not unsupervised: it uses labels for every other benchmark item and is transductive leave-one-item-out classification. Softmax adds neither evidence nor calibrated probability; it preserves the same argmax. The useful result is descriptive. On BFQ the final table reports human 84%, multilingual MPNet 64%, English MPNet 70%, SurveyBot 64%, Personality MPNet 72%, and the authors’ model 80%. On BFI it reports human 72%, multilingual 77.5%, English 80%, SurveyBot 75%, Personality MPNet 97.5%, and the authors’ model 82.5%. Personality MPNet’s BFI advantage corresponds to recovering 39/40 labels versus 29/40 for humans; it does not establish content validity or superiority over test-construction experts. The task evaluates recovery of official labels, not whether an item set comprehensively and representatively covers a construct domain. Facet coverage, relevance, clarity, cultural bias, and construct-irrelevant variance are not measured. Language comparison is confounded: humans and multilingual MPNet see Italian, while English models see undocumented translations; no crossed design separates model, language, and translation. The new model is trained on IPIP pairs pseudo-labeled by the retrieval cross-encoder cross-encoder/ms-marco-MiniLM-L12-v2. The paper says 3,250 items yield more than 15 million pairs, but there are 5,279,625 unordered pairs and 10,559,250 ordered non-self pairs; with the 3,320 items mentioned elsewhere, counts would be 5,509,540 or 11,019,080. It also describes cross-encoder outputs as similarities from −1 to 1, while the official model card shows logits such as 9.219 and −4.078. No normalization, clipping, or loss details are given. The authors omit a train/test split because exact BFI and BFQ items are said not to occur in IPIP, but this does not evaluate fine-tuning generalization, rule out near-duplicate inventory items, or validate learning from millions of dependent pairs. Promised supplementary material is absent from the PDF and was not located elsewhere: the item list, Figures S1–S16, and training details are missing. Internal contradictions remain. Human BFQ is repeatedly described as 82%, while factor results and the final table sum to 42/50=84%. Human BFI sums to 29/40=72.5%, not 72%. Personality MPNet is said to raise BFQ Neuroticism from 50% to 100%, but base MPNet is already reported at 100%. The authors’ model is said to improve all BFQ constructs, although it ties base MPNet on Agreeableness and Neuroticism. “Significant” is used without a test, interval, or repeated sample; 80% versus 84% on BFQ is two items. The faithful conclusion is that some embeddings recover Big Five labels accurately on these two sets under a transductive procedure and that a model trained on inventory correlations reaches 39/40 on the BFI subset. The study does not automatically validate test content, demonstrate objectivity or robustness, or establish a hybrid advantage because no system combining human and model decisions is tested.

Pregunta de investigación

¿Con qué exactitud diez jueces y varios embeddings MPNet recuperan la etiqueta Big Five oficial de ítems BFQ/BFI, cómo influyen idioma y afinado, y qué límites tiene usar similitud semántica como ayuda a la validez de contenido?

Método

Diez estudiantes italianos puntúan cada ítem frente a cinco factores con escala 0–2 y se asigna el factor con más valoraciones positivas. Cinco sentence encoders clasifican cada ítem por su similitud media con todos los otros ítems ya etiquetados de cada factor, en leave-one-item-out transductivo. Se reporta accuracy total y por factor en 50 ítems BFQ y un subconjunto BFI implícito de 40. Una variante MPNet se afina con todos los pares IPIP pseudoetiquetados por un cross-encoder MS MARCO.

Muestra: Panel de diez estudiantes de posgrado en Psicología de la Universidad de Nápoles Federico II, 60% mujeres y 40% hombres. No se reportan experiencia psicométrica, entrenamiento, edades, fiabilidad interjueces, CVR por ítem, acuerdo, consentimiento o compensación. La evaluación automática contiene 50 BFQ y 40 BFI inferidos de las tablas.

Hallazgos

  • La fuente vigente es arXiv:2503.12080v1, enviada el 15 de marzo de 2025, con 34 páginas.
  • Las 34 páginas se renderizaron e inspeccionaron visualmente; la página 34 está en blanco.
  • El PDF vigente coincide byte a byte con la caché y tiene SHA-256 adccd496547b9527c4f504194b715111617311acede560444f3ba1b05ec4dd20.
  • BFQ: la tabla final reporta humano 84%, multilingüe 64%, MPNet inglés 70%, SurveyBot 64%, Personality MPNet 72% y modelo de autores 80%.
  • BFI: la tabla final reporta humano 72%, multilingüe 77,5%, MPNet inglés 80%, SurveyBot 75%, Personality MPNet 97,5% y modelo de autores 82,5%.
  • Personality MPNet recupera 39 de 40 etiquetas BFI implícitas.
  • El modelo de los autores recupera 40 de 50 BFQ y 33 de 40 BFI.
  • Los jueces recuperan 42 de 50 BFQ según la tabla por factores y 29 de 40 BFI.
  • El método automático usa las etiquetas conocidas de todos los ítems restantes para clasificar cada ítem.
  • El softmax no cambia qué constructo maximiza la similitud coseno media.
  • 3.250 ítems generan 5.279.625 pares no ordenados o 10.559.250 ordenados sin identidad, no más de 15 millones.
  • 3.320 ítems generarían 5.509.540 pares no ordenados o 11.019.080 ordenados sin identidad.
  • La tarjeta oficial del cross-encoder muestra logits fuera de [−1,1], contradiciendo el rango declarado.
  • No se localizó el suplemento prometido, el checkpoint nuevo, código o resultados a nivel de ítem.

Limitaciones

  • La tarea es recuperación de etiquetas de factor, no una evaluación completa de validez de contenido.
  • No se evalúan exhaustividad del dominio, cobertura de facetas, representatividad, claridad, relevancia o sesgo cultural.
  • Los ítems se comparan con etiquetas oficiales tratadas como verdad, limitación que los autores reconocen parcialmente.
  • Los jueces son estudiantes de posgrado; no se acredita experiencia como panel de especialistas en los dos instrumentos.
  • No se reporta entrenamiento de jueces, definiciones proporcionadas, orden, cegamiento o duración.
  • No se reporta acuerdo interjueces, kappa, ICC, distribución de ratings o incertidumbre.
  • La clasificación humana usa conteo de valoraciones positivas, no el CVR definido en la sección metodológica.
  • No se publican CVR por ítem ni se aplica el umbral crítico de un panel de diez jueces.
  • El BFQ usa una muestra estratificada de 50 ítems sin semilla ni lista reproducible.
  • El BFI se describe con 44 ítems pero resultados y gráficos implican 40; faltan cuatro sin explicación.
  • El algoritmo automático conoce las etiquetas de todos los demás ítems del benchmark.
  • Llamarlo no supervisado oculta que es una forma transductiva de propagación desde etiquetas.
  • No hay evaluación inductiva sobre un test completamente nuevo o constructos sin ítems ancla etiquetados.
  • Las similitudes de un ítem se promedian con grupos de tamaños potencialmente distintos en BFI.
  • Softmax produce números que suman uno pero no probabilidades calibradas de pertenencia.
  • No se reportan márgenes, entropía, top-2, calibración o casos ambiguos.
  • Solo se usa accuracy; no hay matrices numéricas, macro-F1, balanced accuracy o intervalos binomiales.
  • No hay tests de diferencias entre humanos y modelos o entre checkpoints.
  • “Significativo” se usa para cambios de puntos porcentuales sin inferencia estadística.
  • La comparación italiano-inglés confunde arquitectura, corpus de entrenamiento y traducción.
  • No se indica quién tradujo, desde qué versión, con qué control de calidad o si se usaron ítems ingleses oficiales.
  • Humanos e inglés MPNet no reciben exactamente el mismo texto.
  • El mejor modelo BFI puede haber visto ítems comunes o casi duplicados en inventarios de entrenamiento; no se audita solapamiento.
  • La propia tarjeta de dwulff/mpnet-personality advierte de rendimiento alto por memorización en ítems comunes.
  • Excluir coincidencias exactas BFQ/BFI de IPIP no excluye paráfrasis o casi duplicados.
  • El dataset IPIP se cuantifica de forma inconsistente como más de 3.320 y 3.250 ítems.
  • La cifra de más de 15 millones de pares contradice la fórmula combinatoria impresa.
  • Los pares comparten repetidamente los mismos ítems y no son observaciones independientes.
  • No se crea conjunto de entrenamiento, validación o test para el modelo de los autores.
  • La ausencia de ítems BFQ/BFI exactos no justifica omitir evaluación del propio afinado.
  • El cross-encoder MS MARCO está entrenado para ranking de pasajes, no validado aquí como juez de similitud psicológica.
  • Sus logits no están restringidos a [−1,1], en contra de la descripción metodológica.
  • No se explica cómo se transforman logits para entrenar coseno, ni pérdida, épocas, batch, seed o selección de checkpoint.
  • El modelo final se denomina Cross Encoder MPNet aunque en inferencia produce embeddings de bi-encoder.
  • El suplemento citado para ítems, gráficos y entrenamiento no forma parte del PDF disponible.
  • El BFQ humano aparece como 82% en prosa y 84% en tabla y suma por constructos.
  • El BFI humano aparece como 72%, aunque los cinco porcentajes equivalen a 29/40=72,5%.
  • El texto atribuye una mejora de neuroticismo BFQ de 50% a 100%, pero el base MPNet ya figura en 100%.
  • El modelo de los autores no mejora todos los factores BFQ; iguala al base en amabilidad y neuroticismo.
  • La Figura 4 se etiqueta como ratings de validadores aunque representa el modelo de los autores.
  • No se prueba ningún algoritmo híbrido que combine jueces y embeddings.
  • No se reporta réplica en otros instrumentos, idiomas, culturas o constructos fuera de Big Five.
  • No se localizó código, checkpoint de autores, datos derivados o publicación revisada por pares.

Qué no demuestra

  • No establece validez de contenido completa de BFQ o BFI.
  • No demuestra que los modelos descubran constructos sin etiquetas previas.
  • No demuestra superioridad general de IA sobre expertos psicométricos.
  • No demuestra que 97,5% generalice a ítems o tests nuevos.
  • No descarta memorización o solapamiento semántico con datos de entrenamiento.
  • No demuestra que el inglés sea intrínsecamente superior al italiano.
  • No demuestra significación estadística de diferencias de accuracy.
  • No demuestra probabilidades calibradas de pertenencia a constructo.
  • No valida el cross-encoder MS MARCO como generador de similitud psicológica.
  • No demuestra eficacia de un sistema híbrido humano-IA porque no se implementa ninguno.
  • No justifica sustituir paneles expertos en desarrollo de pruebas.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2503.12080v1, submitted 15 March 2025, 34 pages

Fuente consultada: https://arxiv.org/abs/2503.12080

Revisión: Codex complete bilingual full-text fidelity pass, current arXiv-version and byte-level PDF check, all-page visual inspection, label-recovery versus content-validity audit, CVR-procedure audit, transductive-label-use audit, pair-count reconstruction, official Hugging Face teacher-output verification, table/prose reconciliation, contamination and reproducibility assessment; summaries written from the full paper and tables rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • paraphrase-multilingual-mpnet-base-v2, called MPNet Multilingual/BERTMultilingual in the paper
  • sentence-transformers/all-mpnet-base-v2 on English translations
  • SurveyBot3000 MPNet from Hommel and Arslan
  • dwulff/mpnet-personality from Wulff and Mata
  • Authors’ all-MPNet bi-encoder fine-tuned on IPIP pairs using cross-encoder/ms-marco-MiniLM-L12-v2 pseudo-labels, called Cross Encoder MPNet

Instrumentos y métricas

  • Big Five Questionnaire, 132-item Italian instrument with 50 stratified items used
  • Big Five Inventory, described as 44 items but 40 implicitly evaluated
  • Three-level human relevance rating labeled as Content Validity Ratio
  • Cosine similarity to construct-labeled benchmark items
  • Softmax argmax assignment
  • Overall and construct-level label-recovery accuracy

Datos utilizados

  • 50 BFQ items: ten sampled items for each Big Five factor; exact list and random seed unavailable
  • 40 implied BFI items: eight per factor; selection from BFI-44 unexplained
  • International Personality Item Pool: stated as over 3,320 items and later as 3,250 items
  • Pseudo-labels from cross-encoder/ms-marco-MiniLM-L12-v2
  • No released item table, supplementary figures, training code, trained authors’ checkpoint or prediction matrix located

Evidencia y localización

  • Versión, título, autores y abstract: arXiv:2503.12080v1 metadata and pages 1–2 checked 15 July 2026
  • Instrumentos, muestreo y panel humano: Sections 2.1–2.2, pages 7–9
  • Modelos base y proceso de afinado: Sections 2.3–2.4, pages 9–14
  • Algoritmo transductivo de clasificación: Section 2.5, page 15
  • Resultados BFQ: Section 3.1, pages 16–21; final table, page 26
  • Resultados BFI: Section 3.2, pages 21–27; final table, pages 26–27
  • Limitaciones y conclusiones de autores: Discussion and Conclusion, pages 27–31
  • Rango real del cross-encoder MS MARCO: Official Hugging Face model card checked 15 July 2026; example scores 9.218911 and −4.0780287
  • Riesgo de memorización de Personality MPNet: Official dwulff/mpnet-personality Hugging Face model card checked 15 July 2026
  • Aritmética, inconsistencias y estado de artefactos: reports/verification/article-184-method-and-arithmetic-audit.json
  • Inspección visual completa: All 34 PDF pages rendered and visually inspected on 15 July 2026