Large Language Models Demonstrate Distinct Personality Profiles

Evaluación y validez psicométrica2025PubMed CentralRevisión editorial aprobada

Autores: Thomas F Heston, Justin Gillette

Palabras clave: AI ethics, AI in mental health, AI psychometrics, Artificial intelligence in medicine, Generative AI, Personality assessment

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
20
Hallazgos
79
Limitaciones
17
Evidencias

Resumen editorial

Español

El estudio compara la forma en que cuatro productos conversacionales disponibles en abril de 2024 responden a dos cuestionarios humanos de personalidad: ChatGPT-3.5, Gemini Advanced, Claude 3 Opus y Grok en modo Regular. Cada producto completa quince veces las 32 parejas del Open Extended Jungian Type Scales (OEJTS) y los 50 ítems IPIP Big-Five, siempre en chats nuevos. Los autores eliminan el punto medio, fuerzan cuatro opciones y convierten 1, 2, 3 y 4 en 1, 2, 4 y 5 para la puntuación original. Los prompts no son neutrales: piden al modelo «interpretar el papel de ti mismo», ser «100% honesto» y elegir obligatoriamente un número. Se analizan 60 administraciones por instrumento con MANOVA, ANOVA y frecuencias; no se evalúan conversaciones clínicas ni pacientes.

Bajo este protocolo aparecen diferencias grandes entre productos. En OEJTS, el MANOVA informa lambda de Wilks 0,130, F(12, 140,52)=13,63, p<0,001. Claude produce INTJ en 15/15 administraciones; el tipo modal de ChatGPT es ENTJ en 7/15, el de Gemini INFJ en 9/15 y el de Grok INFJ en 8/15. En Big Five, el MANOVA informa lambda 0,115, F(15, 143,95)=11,44, p<0,001 y eta cuadrado parcial 0,514. Gemini obtiene amabilidad 68,7±12,5 y responsabilidad 82,6±9,0, por debajo de los otros tres; Claude alcanza responsabilidad 97,1±1,0; Grok obtiene la mayor apertura, 95,0±1,4, pero también la mayor dispersión en estabilidad emocional, 81,1±20,4. El resultado defendible es que las salidas puntuadas de estas cuatro configuraciones difieren y algunas se repiten con bastante regularidad.

Eso no convierte las quince sesiones en quince personas ni en muestras independientes de una población de modelos. Son réplicas estocásticas del mismo producto, con pesos, alineamiento e interfaz compartidos. El cálculo de potencia y las pruebas inferenciales tratan cada administración como observación independiente, por lo que magnifican el tamaño muestral útil para inferir diferencias entre modelos. Tampoco se registran identificadores exactos de snapshot, temperatura, top-p, semilla, system prompts del proveedor, configuración de cuenta o días de ejecución. La sección de métodos anuncia un MANOVA de nueve variables, descriptivos con intervalos del 95% y comparaciones Bonferroni; los resultados presentan dos MANOVA separados, no muestran los intervalos, omiten la tabla post hoc y no proporcionan F, grados de libertad, p y efecto para cada ANOVA. Además, Levene resulta significativo en los cinco rasgos Big Five y no se ofrece una alternativa robusta ni una evaluación completa de supuestos.

La validez de constructo es el límite principal. OEJTS y Big Five fueron desarrollados para autoinforme humano y el artículo reconoce que no están validados en sistemas artificiales. No se prueban estructura factorial, invariancia, fiabilidad interna, convergencia entre instrumentos o correspondencia con conducta externa. Eliminar la neutralidad para «aumentar discriminación» y después concluir que los modelos no son neutrales introduce circularidad; tampoco se define una puntuación neutral ni se contrasta contra ella. La variación entre chats no descarta memorización o conocimiento de cuestionarios, y la instrucción de responder «como tú mismo» induce precisamente la actuación autorreferencial que se interpreta. Por ello, «personalidad» debe limitarse a un perfil de respuesta condicionado por este prompt y estas interfaces.

La auditoría de integridad encuentra dos contradicciones numéricas claras. Table 1 dice que Gemini eligió Sensing en 60% de 15 ensayos, es decir, nueve; Table 2 dice que produjo INFJ, que exige Intuition, en nueve de esos mismos quince: ambas afirmaciones no pueden ser simultáneamente ciertas. El abstract afirma que Claude obtuvo la mayor estabilidad emocional, pero Table 3 da 94,1 a Gemini y 93,2 a Claude. El abstract usa además la lambda 0,115 del análisis Big Five para resumir conjuntamente rasgos tipológicos y dimensionales, mientras OEJTS tiene lambda 0,130. El párrafo sobre supervisión interdisciplinar aparece duplicado literalmente en la discusión. El registro Zenodo enlazado existe y lista archivos XLSX y SAV, pero durante la auditoría el servicio devolvió 503 y no permitió inspeccionarlos; el registro no lista por separado transcripciones textuales pese a que el artículo promete «raw outputs». En ausencia de tareas clínicas, interacción prolongada, resultados terapéuticos o pruebas de seguridad, las recomendaciones sobre selección de modelos, emparejamiento con pacientes y evaluación clínica formal son propuestas de gobernanza, no conclusiones empíricas del experimento.

English

The study compares how four conversational products available in April 2024 respond to two human personality questionnaires: ChatGPT-3.5, Gemini Advanced, Claude 3 Opus, and Grok in Regular mode. Each product completes the 32 Open Extended Jungian Type Scales (OEJTS) pairs and the 50 IPIP Big-Five items fifteen times in fresh chats. The authors remove the midpoint, force four response options, and map 1, 2, 3, and 4 onto the original 1, 2, 4, and 5 scoring scale. Prompts are not neutral: they tell the model to “play the role of yourself,” be “100% honest,” and return a mandatory number. Sixty administrations per instrument are analyzed with MANOVA, ANOVA, and frequencies; no clinical conversations or patients are evaluated.

Large product differences appear under this protocol. For OEJTS, the MANOVA reports Wilks' lambda 0.130, F(12, 140.52)=13.63, p<0.001. Claude returns INTJ in 15/15 administrations; ChatGPT's modal type is ENTJ in 7/15, Gemini's INFJ in 9/15, and Grok's INFJ in 8/15. For Big Five, the MANOVA reports lambda 0.115, F(15, 143.95)=11.44, p<0.001, and partial eta squared 0.514. Gemini scores 68.7±12.5 on Agreeableness and 82.6±9.0 on Conscientiousness, below the other three; Claude reaches 97.1±1.0 on Conscientiousness; Grok has the highest Openness, 95.0±1.4, but also the greatest dispersion in Emotional Stability, 81.1±20.4. The defensible result is that scored outputs from these four configurations differ and that some recur with substantial regularity.

Fifteen sessions do not make fifteen people or independent samples from a population of models. They are stochastic replicates of the same product sharing weights, alignment, and interface. The power calculation and inferential tests treat each administration as an independent observation, inflating the effective sample size for model-level inference. Exact snapshot identifiers, temperature, top-p, seed, provider system prompts, account configuration, and execution days are not recorded. Methods announce one nine-variable MANOVA, 95% confidence intervals, and Bonferroni comparisons; Results present two separate MANOVAs, show no intervals, omit the post-hoc table, and do not report F, degrees of freedom, p, and effect size for each ANOVA. Levene's test is also significant for all five Big Five traits, with no robust alternative or complete assumption assessment.

Construct validity is the main limitation. OEJTS and Big Five were developed for human self-report, and the paper acknowledges that they have not been validated in artificial systems. It tests no factor structure, measurement invariance, internal reliability, convergence between instruments, or correspondence with external behavior. Removing neutrality to “increase discrimination” and then concluding that models are non-neutral is circular; no neutral score is defined or tested. Variation across chats does not rule out memorization or prior exposure to questionnaire content, while the instruction to answer “as yourself” induces the very self-referential performance being interpreted. “Personality” should therefore be restricted to a prompt- and interface-conditioned response profile.

The integrity audit finds two clear numerical contradictions. Table 1 says Gemini selected Sensing in 60% of fifteen trials, nine trials, while Table 2 says it produced INFJ, which requires Intuition, in nine of those same fifteen; both cannot be true. The abstract says Claude had the highest Emotional Stability, but Table 3 gives Gemini 94.1 and Claude 93.2. The abstract also uses the 0.115 lambda from the Big Five analysis to summarize typological and dimensional traits together, whereas OEJTS has lambda 0.130. A paragraph on interdisciplinary oversight is duplicated verbatim in the discussion. The linked Zenodo record exists and lists XLSX and SAV files, but the service returned 503 during the audit and prevented inspection; the record lists no separate response transcripts despite the paper promising “raw outputs.” With no clinical task, sustained interaction, therapeutic outcome, or safety test, recommendations about model selection, patient matching, and formal clinical personality evaluation are governance proposals rather than empirical conclusions of this experiment.

Pregunta de investigación

¿Producen ChatGPT-3.5, Gemini Advanced, Claude 3 Opus y Grok-Regular perfiles de respuesta diferentes y repetibles cuando completan OEJTS e IPIP Big Five en chats nuevos, y pueden esos perfiles informar la evaluación previa al uso clínico?

Método

En abril de 2024 se administraron quince veces por producto dos cuestionarios divididos en bloques: 32 pares OEJTS y 50 ítems IPIP Big-Five. Cada administración comenzó en un chat nuevo y usó prompts idénticos que ordenaban responder como «uno mismo» en una escala forzada de cuatro puntos; el punto medio se eliminó y las categorías se mapearon a 1, 2, 4 y 5. Los autores calcularon puntuaciones por cuatro dimensiones OEJTS y cinco Big Five, tipologías modales, descriptivos, dos MANOVA reportados y ANOVA univariantes. La auditoría leyó y renderizó las 15 páginas, comprobó las tres tablas, todos los prompts y 40 referencias, contrastó PubMed/PMC y el JATS oficial, y revisó el registro del dataset Zenodo, cuya descarga devolvió 503.

Muestra: La muestra estadística consta de 15 administraciones repetidas por cada uno de cuatro productos, 60 por instrumento. La unidad observada es una ejecución estocástica en una sesión nueva, no una persona ni un modelo entrenado independientemente. Los cuatro productos son grupos fijos elegidos por accesibilidad y disposición a contestar; ChatGPT-4 fue excluido por negarse. No se informa cuántas cuentas, días, regiones, snapshots o configuraciones de muestreo participaron.

Hallazgos

  • Cada producto completó quince administraciones de OEJTS y quince de Big Five.
  • El MANOVA OEJTS reporta lambda de Wilks 0,130, F(12,140,52)=13,63 y p<0,001.
  • Claude 3 Opus fue clasificado INTJ en las quince administraciones OEJTS.
  • El tipo OEJTS modal de ChatGPT-3.5 fue ENTJ en 7/15 administraciones.
  • El tipo OEJTS publicado para Gemini Advanced fue INFJ en 9/15 administraciones.
  • El tipo OEJTS modal de Grok-Regular fue INFJ en 8/15 administraciones.
  • El MANOVA Big Five reporta lambda de Wilks 0,115, F(15,143,95)=11,44, p<0,001 y eta cuadrado parcial 0,514.
  • Gemini tuvo la menor extraversión Big Five, 42,5±12,0.
  • Gemini tuvo la menor amabilidad, 68,7±12,5, y responsabilidad, 82,6±9,0.
  • Claude tuvo la mayor responsabilidad, 97,1±1,0.
  • Gemini tuvo la mayor media de estabilidad emocional, 94,1±3,6, ligeramente por encima de Claude, 93,2±6,1.
  • Grok tuvo la mayor apertura o intelecto, 95,0±1,4.
  • Grok mostró la mayor dispersión de estabilidad emocional, 81,1±20,4.
  • Los ANOVA univariantes se describen como significativos para los cinco rasgos con eta cuadrado entre 0,193 y 0,738.
  • Levene fue significativo para los cinco rasgos Big Five, señalando varianzas diferentes entre productos.
  • Los perfiles OEJTS y Big Five no ofrecen una clasificación unitaria concordante.
  • El protocolo produce perfiles de respuesta diferenciables entre estas cuatro configuraciones.
  • El estudio no prueba ninguna tarea clínica, resultado terapéutico ni daño de seguridad.
  • Table 1 y Table 2 contienen una contradicción aritmética sobre Sensing/Intuition de Gemini.
  • El abstract contradice Table 3 al atribuir a Claude la mayor estabilidad emocional.

Limitaciones

  • Solo se evaluaron cuatro productos conversacionales.
  • Los productos se eligieron por accesibilidad y disposición a contestar, no mediante muestreo representativo.
  • ChatGPT-4 fue excluido porque rechazó responder, introduciendo selección por cumplimiento.
  • La exclusión elimina precisamente una conducta relevante para evitar antropomorfización.
  • No se proporcionan identificadores exactos de modelo o snapshot.
  • Gemini Advanced y Grok-Regular son etiquetas de producto, no versiones reproducibles del modelo subyacente.
  • No se declaran días y horas exactos de ejecución dentro de abril de 2024.
  • No se informa región, cuenta, plan o configuración de interfaz.
  • No se documentan system prompts o políticas internas del proveedor.
  • No se documentan temperatura, top-p, semilla ni otros parámetros de muestreo.
  • No se sabe si las plataformas cambiaron de snapshot durante las 15 repeticiones.
  • Prompts de usuario idénticos no implican condiciones completas idénticas entre proveedores.
  • Las quince sesiones son réplicas del mismo producto, no modelos entrenados independientemente.
  • Tratar sesiones como muestras independientes produce pseudorreplicación para inferencias entre modelos.
  • El cálculo de potencia usa 60 administraciones como si fueran unidades independientes.
  • No se justifica que n=15 por producto represente la variabilidad temporal o de usuario.
  • No se replica el estudio con cuentas, fechas, regiones o operadores distintos.
  • El prompt ordena explícitamente interpretar el papel de uno mismo.
  • El prompt ordena ser 100% honesto y no alucinar.
  • Las condiciones no son «unprompted» como afirma el abstract.
  • El punto medio neutral se elimina de ambos instrumentos.
  • La eliminación de neutralidad fuerza una dirección en cada respuesta.
  • Concluir ausencia de neutralidad después de impedir respuestas neutrales introduce circularidad.
  • No se define operacionalmente un perfil neutral.
  • No se contrasta cada modelo contra una puntuación neutral preespecificada.
  • El mapeo 1,2,3,4 a 1,2,4,5 altera intervalos y propiedades del instrumento original.
  • La referencia sobre uso de punto medio procede de encuestas humanas y no valida la modificación en LLM.
  • OEJTS fue diseñado para autoinforme humano y no está validado en sistemas artificiales.
  • IPIP Big Five fue diseñado para humanos y no está validado en sistemas artificiales.
  • No se evalúa estructura factorial en las respuestas de los modelos.
  • No se evalúa invariancia entre productos.
  • No se informa alfa, omega u otra consistencia interna por producto.
  • No se estudia fiabilidad test-retest con un intervalo temporal controlado.
  • No se evalúa convergencia entre OEJTS y Big Five con hipótesis predefinidas.
  • No se valida contra conducta externa o diálogo espontáneo.
  • No hay evaluación humana ciega de estilo o conducta.
  • Responder cuestionarios puede reflejar obediencia a instrucciones y estereotipos aprendidos.
  • No se prueba sensibilidad a paráfrasis del prompt.
  • No se prueba sensibilidad al orden de ítems u opciones.
  • No se prueba contaminación o memorización de los cuestionarios.
  • La variación entre administraciones no descarta memorización, en contra del argumento de la discusión.
  • La sección de métodos anuncia un MANOVA con nueve variables dependientes.
  • Los resultados presentan por separado un MANOVA OEJTS de cuatro variables y otro Big Five de cinco.
  • No se informa el MANOVA combinado de nueve variables descrito en métodos.
  • El abstract usa lambda 0,115 para resumir conjuntamente tipología y dimensiones, aunque OEJTS reporta 0,130.
  • No se reporta Box's M ni otra comprobación de homogeneidad de covarianzas.
  • No se informa evaluación de normalidad multivariante.
  • Las variables son discretas, acotadas y en algunos casos casi invariantes.
  • Levene es significativo para los cinco rasgos Big Five.
  • No se aplica una alternativa robusta ante heterocedasticidad.
  • No se muestran los intervalos de confianza del 95% prometidos en métodos.
  • No se publica la tabla de comparaciones post hoc Bonferroni prometida.
  • No se indican contrastes concretos que explican cada diferencia entre productos.
  • No se reportan F, grados de libertad, p y efecto de cada ANOVA univariante.
  • El rango de eta cuadrado se da sin tabla completa por rasgo.
  • No se aporta código de SPSS, sintaxis o archivo de resultados.
  • No se explica completamente el algoritmo de puntuación y clasificación en código reproducible.
  • Table 1 atribuye Sensing a Gemini en 60% de 15 administraciones.
  • Table 2 atribuye INFJ, que requiere Intuition, a Gemini en 9/15 administraciones.
  • Las dos cifras de Gemini no pueden coexistir en una muestra de quince.
  • El abstract dice que Claude tiene mayor estabilidad emocional.
  • Table 3 muestra estabilidad emocional mayor en Gemini, 94,1 frente a 93,2.
  • La discusión compara tamaños de efecto con subgrupos humanos sin una comparación estadística directa.
  • Un párrafo sobre supervisión interdisciplinar se duplica literalmente en la página 7.
  • El registro Zenodo solo lista un XLSX y un SAV y no una transcripción separada de respuestas textuales.
  • Zenodo devolvió 503 durante la auditoría y no permitió verificar los archivos enlazados.
  • No se evalúan prompts médicos o de salud mental.
  • No se evalúan conversaciones de varios turnos.
  • No participan pacientes, clínicos ni evaluadores de salud mental.
  • No se mide alianza terapéutica, confianza, satisfacción o resultado clínico.
  • No se evalúan errores diagnósticos, triaje, crisis o consejo dañino.
  • No se prueba que las puntuaciones predigan seguridad clínica.
  • No se prueba emparejamiento entre personalidad del modelo y preferencias del paciente.
  • La analogía con adaptar farmacoterapia no está respaldada por el diseño.
  • Las recomendaciones regulatorias exceden un experimento de cuestionario aislado.
  • El estudio es una instantánea de abril de 2024 y varios productos ya no representan sistemas actuales.
  • No se estudian otros idiomas, culturas o poblaciones de usuarios.
  • No se separan efectos de entrenamiento, alineamiento, interfaz y aleatoriedad.
  • No se cuantifica estabilidad después de actualizaciones del proveedor.

Qué no demuestra

  • No demuestra que los LLM tengan personalidad, emociones o autoconcepto humano.
  • No identifica rasgos internos independientes del prompt y la interfaz.
  • No demuestra neutralidad o ausencia de neutralidad mediante un contraste válido.
  • No valida OEJTS o Big Five para sistemas artificiales.
  • No demuestra invariancia psicométrica entre los cuatro productos.
  • No demuestra que quince chats sean muestras independientes de una población de modelos.
  • No permite atribuir diferencias a arquitectura en lugar de alineamiento, producto o muestreo.
  • No establece perfiles vigentes para versiones actuales de ChatGPT, Gemini, Claude o Grok.
  • No demuestra que las tipologías OEJTS sean estables fuera de este prompt.
  • No demuestra que los perfiles Big Five predigan conducta conversacional.
  • No descarta memorización o familiaridad con los ítems.
  • No demuestra seguridad, eficacia o adecuación terapéutica.
  • No demuestra que emparejar personalidad de modelo y paciente mejore resultados.
  • No justifica por sí solo evaluaciones clínicas de personalidad como requisito regulatorio.
  • No permite reproducir exactamente el experimento sin snapshots y parámetros de generación.

Trazabilidad

Alcance: Texto completo

Versión: Cureus 17(5):e84706 (23 May 2025); PMID 40551914; PMCID PMC12183331; DOI 10.7759/cureus.84706; CC BY 4.0

Fuente consultada: https://pmc.ncbi.nlm.nih.gov/articles/PMC12183331/

Revisión: Codex full-text, visual, psychometric, statistical-assumption, arithmetic-integrity, clinical-claim and source-transparency audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • ChatGPT-3.5 through the public ChatGPT product in April 2024; exact snapshot not reported
  • Gemini Advanced through the public product in April 2024; exact model identifier not reported
  • Claude 3 Opus through the public product in April 2024; exact snapshot not reported
  • Grok Regular Mode through the public product in April 2024; exact model identifier not reported
  • ChatGPT-4 attempted and excluded after refusing anthropomorphic questionnaire items

Instrumentos y métricas

  • Open Extended Jungian Type Scales v1.2: 32 paired items and four IE, SN, TF and JP dimensions
  • IPIP Big-Five Factor Markers: 50 items scored as Extraversion, Emotional Stability, Agreeableness, Conscientiousness and Intellect/Openness
  • Modified four-point forced-choice scale with original midpoint removed
  • Mapping from response categories 1, 2, 3, 4 to scores 1, 2, 4, 5
  • Modal OEJTS four-letter classification
  • One-way multivariate analysis of variance
  • Follow-up univariate ANOVA and declared Bonferroni comparisons
  • Wilks' lambda, Pillai's trace, Hotelling's trace and Roy's largest root
  • Partial eta squared and eta squared
  • Levene tests for equality of variance

Datos utilizados

  • 60 OEJTS administrations: 15 per conversational product
  • 60 IPIP Big-Five administrations: 15 per conversational product
  • Published aggregate Tables 1–3
  • Zenodo dataset 10.5281/zenodo.11087767 listing one XLSX and one SPSS SAV file
  • Official Europe PMC JATS XML for PMCID PMC12183331

Evidencia y localización

  • Diseño, productos y objetivos clínicos declarados: Cureus 17(5):e84706, abstract and introduction, pp. 1–2
  • Selección de productos y exclusión de ChatGPT-4: Paper, Study population, pp. 2–3
  • Instrumentos, eliminación de punto medio y mapeo de escala: Paper, Intervention, p. 3
  • Quince administraciones por producto e instrumento: Paper, Intervention and Sample size calculation, p. 3
  • Plan estadístico de nueve variables, intervalos y Bonferroni: Paper, Statistical analysis, p. 3
  • MANOVA y perfiles OEJTS: Paper, Results and Tables 1–2, pp. 4–5
  • Medias Big Five y MANOVA: Paper, Table 3 and Results, p. 5
  • Heterogeneidad de varianzas: Paper, final Results paragraph, p. 5
  • Contradicción Sensing de Gemini frente a INFJ: Paper, Tables 1–2, pp. 4–5; arithmetic integrity audit 15 Jul 2026
  • Contradicción de mayor estabilidad emocional: Paper, abstract p. 1 versus Table 3 p. 5; integrity audit 15 Jul 2026
  • Interpretación clínica y argumento de memorización: Paper, Discussion, pp. 5–7
  • Limitaciones reconocidas por los autores: Paper, Limitations, p. 7
  • Prompts completos OEJTS e IPIP: Paper, Appendices, pp. 8–13
  • Publicación, DOI, licencia y estado no retractado: PubMed PMID 40551914; PMCID PMC12183331; DOI 10.7759/cureus.84706; NCBI OA record; checked 15 Jul 2026
  • Texto estructurado oficial: .cache/editorial-sources/article-077/supplements/audit/PMC12183331-fulltext.xml; sha256 4c0efb186c61c8e29f426a2ba6c1c8f8eda4fc306b435ca682f299d216ec2bf5
  • Dataset registrado y fallo temporal de entrega: Zenodo 10.5281/zenodo.11087767 lists XLSX md5 11f3266b41a8c01d6e26d19fc2128a47 and SAV md5 d87f2844823a149957d177e879844b40; HTTP 503 during audit 15 Jul 2026
  • Lectura y comprobación visual integral: All 15 PDF pages rendered and inspected, including Tables 1–3, appendices and 40 references; checked 15 Jul 2026