El estudio compara la forma en que cuatro productos conversacionales disponibles en abril de 2024 responden a dos cuestionarios humanos de personalidad: ChatGPT-3.5, Gemini Advanced, Claude 3 Opus y Grok en modo Regular. Cada producto completa quince veces las 32 parejas del Open Extended Jungian Type Scales (OEJTS) y los 50 ítems IPIP Big-Five, siempre en chats nuevos. Los autores eliminan el punto medio, fuerzan cuatro opciones y convierten 1, 2, 3 y 4 en 1, 2, 4 y 5 para la puntuación original. Los prompts no son neutrales: piden al modelo «interpretar el papel de ti mismo», ser «100% honesto» y elegir obligatoriamente un número. Se analizan 60 administraciones por instrumento con MANOVA, ANOVA y frecuencias; no se evalúan conversaciones clínicas ni pacientes.
Bajo este protocolo aparecen diferencias grandes entre productos. En OEJTS, el MANOVA informa lambda de Wilks 0,130, F(12, 140,52)=13,63, p<0,001. Claude produce INTJ en 15/15 administraciones; el tipo modal de ChatGPT es ENTJ en 7/15, el de Gemini INFJ en 9/15 y el de Grok INFJ en 8/15. En Big Five, el MANOVA informa lambda 0,115, F(15, 143,95)=11,44, p<0,001 y eta cuadrado parcial 0,514. Gemini obtiene amabilidad 68,7±12,5 y responsabilidad 82,6±9,0, por debajo de los otros tres; Claude alcanza responsabilidad 97,1±1,0; Grok obtiene la mayor apertura, 95,0±1,4, pero también la mayor dispersión en estabilidad emocional, 81,1±20,4. El resultado defendible es que las salidas puntuadas de estas cuatro configuraciones difieren y algunas se repiten con bastante regularidad.
Eso no convierte las quince sesiones en quince personas ni en muestras independientes de una población de modelos. Son réplicas estocásticas del mismo producto, con pesos, alineamiento e interfaz compartidos. El cálculo de potencia y las pruebas inferenciales tratan cada administración como observación independiente, por lo que magnifican el tamaño muestral útil para inferir diferencias entre modelos. Tampoco se registran identificadores exactos de snapshot, temperatura, top-p, semilla, system prompts del proveedor, configuración de cuenta o días de ejecución. La sección de métodos anuncia un MANOVA de nueve variables, descriptivos con intervalos del 95% y comparaciones Bonferroni; los resultados presentan dos MANOVA separados, no muestran los intervalos, omiten la tabla post hoc y no proporcionan F, grados de libertad, p y efecto para cada ANOVA. Además, Levene resulta significativo en los cinco rasgos Big Five y no se ofrece una alternativa robusta ni una evaluación completa de supuestos.
La validez de constructo es el límite principal. OEJTS y Big Five fueron desarrollados para autoinforme humano y el artículo reconoce que no están validados en sistemas artificiales. No se prueban estructura factorial, invariancia, fiabilidad interna, convergencia entre instrumentos o correspondencia con conducta externa. Eliminar la neutralidad para «aumentar discriminación» y después concluir que los modelos no son neutrales introduce circularidad; tampoco se define una puntuación neutral ni se contrasta contra ella. La variación entre chats no descarta memorización o conocimiento de cuestionarios, y la instrucción de responder «como tú mismo» induce precisamente la actuación autorreferencial que se interpreta. Por ello, «personalidad» debe limitarse a un perfil de respuesta condicionado por este prompt y estas interfaces.
La auditoría de integridad encuentra dos contradicciones numéricas claras. Table 1 dice que Gemini eligió Sensing en 60% de 15 ensayos, es decir, nueve; Table 2 dice que produjo INFJ, que exige Intuition, en nueve de esos mismos quince: ambas afirmaciones no pueden ser simultáneamente ciertas. El abstract afirma que Claude obtuvo la mayor estabilidad emocional, pero Table 3 da 94,1 a Gemini y 93,2 a Claude. El abstract usa además la lambda 0,115 del análisis Big Five para resumir conjuntamente rasgos tipológicos y dimensionales, mientras OEJTS tiene lambda 0,130. El párrafo sobre supervisión interdisciplinar aparece duplicado literalmente en la discusión. El registro Zenodo enlazado existe y lista archivos XLSX y SAV, pero durante la auditoría el servicio devolvió 503 y no permitió inspeccionarlos; el registro no lista por separado transcripciones textuales pese a que el artículo promete «raw outputs». En ausencia de tareas clínicas, interacción prolongada, resultados terapéuticos o pruebas de seguridad, las recomendaciones sobre selección de modelos, emparejamiento con pacientes y evaluación clínica formal son propuestas de gobernanza, no conclusiones empíricas del experimento.