Can ChatGPT Assess Human Personalities? A General Evaluation Framework

Evaluación y validez psicométrica2023ACL AnthologyRevisión editorial aprobada

Autores: Haocong Rao, Cyril Leung, Chunyan Miao

Palabras clave: Large Language Models, ChatGPT, Personality Assessment, Myers-Briggs Type Indicator (MBTI), AI Psychology

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
10
Hallazgos
23
Limitaciones
17
Evidencias

Resumen editorial

Español

El artículo propone convertir un cuestionario de 16Personalities en consultas sobre grupos: sustituye «tú» por «personas», «hombres», «artistas» o una profesión, cambia acuerdo/desacuerdo por correcto/incorrecto, permuta las siete opciones y promedia 15 ejecuciones. Compara text-davinci-003, gpt-3.5-turbo y gpt-4 mediante tres índices propios: proximidad entre ejecuciones (consistencia), proximidad entre orden fijo y permutado (robustez) y similitud entre dos pares de etiquetas de género, ponderada por consistencia (denominada fairness). ChatGPT y GPT-4 obtienen medias de consistencia ligeramente mayores que InstructGPT (0,918 y 0,921 frente a 0,905), robustez ligeramente menor (0,935 y 0,936 frente a 0,942) y una supuesta fairness mayor (0,776 y 0,778 frente a 0,753). Estos números muestran estabilidad relativa de respuestas bajo el protocolo, no capacidad para evaluar personalidades humanas ni equidad real. No se observa a ninguna persona ni se compara con autoinforme, conducta, distribuciones poblacionales o jueces humanos: el diseño elicita generalizaciones del modelo sobre grupos y a menudo reproduce estereotipos («contables» como Logistician, «artistas» como Campaigner, «matemáticos» como Architect). La escala es el test web 16Personalities, que añade Assertive/Turbulent y no equivale al MBTI oficial. Los índices usan una constante arbitraria, carecen de incertidumbre y no miden exactitud. El repositorio enlazado solo implementa una ejecución, depende del scoring vivo de un tercero y contiene dos scripts que no compilan. La contribución defendible es un protocolo para auditar qué estereotipos genera un LLM y cuánto cambian con el orden, siempre que no se confunda con evaluación psicológica.

English

The paper converts a 16Personalities questionnaire into group-level queries: it replaces “you” with labels such as “people,” “men,” “artists,” or an occupation, changes agreement/disagreement into correct/incorrect, permutes the seven response options, and averages 15 runs. It compares text-davinci-003, gpt-3.5-turbo, and gpt-4 with three custom indices: proximity across runs (consistency), proximity between fixed and permuted option orders (robustness), and similarity between two pairs of gender labels multiplied by consistency (called fairness). ChatGPT and GPT-4 have slightly higher mean consistency than InstructGPT (.918 and .921 versus .905), slightly lower robustness (.935 and .936 versus .942), and higher so-called fairness (.776 and .778 versus .753). These figures measure relative response stability under the protocol, not an ability to assess human personality or real fairness. No person is observed and no output is compared with self-report, behavior, population distributions, or human raters: the design elicits model generalizations about groups and often reproduces stereotypes (“accountants” as Logistician, “artists” as Campaigner, and “mathematicians” as Architect). The scale is the 16Personalities web test, which adds Assertive/Turbulent and is not equivalent to the official MBTI. The indices use an arbitrary constant, report no uncertainty, and do not measure accuracy. The linked repository implements only one run, depends on a live third-party scorer, and contains two scripts that do not compile. The defensible contribution is a protocol for auditing which stereotypes an LLM produces and how option order affects them, provided it is not mistaken for psychological assessment.

Pregunta de investigación

¿Puede un LLM producir perfiles cuantitativos de grupos mediante preguntas reformuladas de 16Personalities, y cuán repetibles son esas salidas, cuánto cambian al permutar el orden de opciones y cuán similares resultan entre etiquetas masculinas y femeninas?

Método

Se toman 60 afirmaciones en inglés del test web 16Personalities, con siete grados de respuesta y cinco ejes E/I, N/S, T/F, J/P y A/T. El sujeto se reemplaza por una etiqueta grupal y la instrucción pregunta si la generalización es correcta en vez de solicitar acuerdo. En cada prueba se permuta aleatoriamente el orden de las siete opciones y se consulta una vez cada ítem; se realizan N = 15 pruebas por sujeto y se promedian las puntuaciones devueltas por el sitio. Se comparan text-davinci-003, gpt-3.5-turbo y gpt-4 con configuración API por defecto. La consistencia transforma la distancia euclídea media de cada ejecución a su media mediante alpha = 100; la robustez aplica la misma transformación a la distancia entre resultados con orden fijo y permutado; la fairness combina la distancia entre Men/Women o Boys/Girls con las consistencias de ambos. También se exploran profesiones, nivel de ingresos, edad, educación y tres personas famosas, sin datos individuales adicionales.

Muestra: Quince ejecuciones de 60 preguntas por sujeto y modelo. Las tablas principales cubren nueve etiquetas para consistencia/robustez, dos pares de género para la métrica de fairness y perfiles descriptivos de grupos/profesiones. No hay participantes humanos, historias personales, observaciones conductuales ni etiquetas verdaderas de personalidad.

Hallazgos

  • La consistencia media es 0,905 para InstructGPT, 0,918 para ChatGPT y 0,921 para GPT-4. Las diferencias absolutas son pequeñas y no se acompañan de intervalos ni contraste estadístico.
  • La robustez media frente al orden de opciones es 0,942 para InstructGPT, 0,935 para ChatGPT y 0,936 para GPT-4. El resultado indica que ChatGPT/GPT-4 cambian algo más bajo esta perturbación superficial, no que sean globalmente menos robustos.
  • La métrica denominada fairness promedia 0,753, 0,776 y 0,778 respectivamente. GPT-4 supera a ChatGPT por solo 0,002 y no se estima incertidumbre; la medida no contrasta ninguna verdad o criterio de daño.
  • People y Men se etiquetan Commander en los tres modelos. Accountants se etiqueta Logistician y Mathematicians Architect en los tres, mientras que otras profesiones discrepan por modelo.
  • Las coincidencias con intuiciones sociales se usan como evidencia cualitativa, pero precisamente pueden ser estereotipos aprendidos: por ejemplo, artistas creativos/Campaigner, contables prácticos/Logistician y matemáticos racionales/Architect.
  • ChatGPT suele producir puntuaciones cercanas a 50, lo que puede elevar la similitud entre grupos y reducir distancias sin aportar mayor exactitud psicológica.
  • Permutar opciones cambia respuestas frecuentes en varios ítems. Promediar reduce la dependencia de un orden concreto, aunque no elimina sesgos semánticos, de formulación o de categoría social.
  • Al añadir etiquetas de fondo, los perfiles siguen patrones normativos: High-income people y Adults aparecen ENTJ-T; Master/PhD se clasifican INTJ-T o ENTJ-T; Children/Adolescents, ENFP-T. No hay datos que validen esas generalizaciones.
  • Cuando se pregunta por individuos famosos sin biografía, los modelos expresan incertidumbre. Esto contradice la idea de que el nombre por sí solo baste para una evaluación fiable y es una respuesta prudente, no un fallo a corregir mediante más inferencia especulativa.
  • Los autores advierten explícitamente que los resultados no deben emparejarse con poblaciones reales ni usarse en aplicaciones cuestionables, y reconocen la validez científica no establecida de MBTI.

Limitaciones

  • El estudio no evalúa la personalidad de ningún ser humano. Solo pregunta a un modelo si afirmaciones generalizadas sobre una etiqueta grupal son correctas; por tanto, mide representaciones o estereotipos del modelo.
  • Reemplazar un autoinforme («yo hago X») por una proposición universal («los artistas hacen X») cambia el constructo y la unidad de análisis. La puntuación resultante no conserva la validez del cuestionario original.
  • La instrucción de correct/incorrect invita a juzgar la veracidad de estereotipos sobre grupos. Una respuesta clara puede ser precisamente una generalización injustificada; neutralidad o rechazo pueden ser conductas más seguras.
  • La escala utilizada procede de 16Personalities y tiene cinco ejes, incluido Assertive/Turbulent. No es el MBTI oficial de cuatro dicotomías, aunque el artículo la denomina MBTI y cita manuales de MBTI.
  • No se comparan perfiles con autoinformes, distribuciones de población, registros conductuales, expertos, jueces humanos ni otra medida validada. No hay estimación de exactitud, validez convergente o validez de criterio.
  • Consistencia significa repetibilidad, no corrección. Un modelo puede repetir el mismo estereotipo y obtener una puntuación alta.
  • La robustez solo cubre el orden de siete opciones. No prueba estabilidad ante parafraseo, traducción, negación, contexto, system prompts, modelo actualizado o cambios temporales.
  • La métrica de fairness asume que Men/Women y Boys/Girls deberían producir perfiles idénticos y equipara similitud con equidad. No mide trato, error, oportunidad, calibración, daño ni desempeño por grupo.
  • Multiplicar por las consistencias de ambos grupos mezcla repetibilidad con similitud y puede cambiar el ranking sin relación directa con sesgo. La constante alpha = 100 se elige sin justificación o análisis de sensibilidad.
  • Las diferencias medias entre modelos son pequeñas (por ejemplo 0,002 entre GPT-4 y ChatGPT en fairness), pero no se publican desviaciones, intervalos, bootstrap, tests ni corrección por comparaciones múltiples.
  • Solo se usan dos pares binarios de género; se excluyen identidades no binarias y otras dimensiones. Aun para esos pares, una mayor similitud no demuestra menos estereotipo.
  • El perfil de grupos amplios puede ocultar heterogeneidad y esencializar profesión, edad, educación o ingresos. No se analiza interseccionalidad ni variación cultural.
  • Las versiones de API son alias móviles de 2023 y se usa configuración por defecto, sin fecha/semilla reproducible. El suplemento nombra ventanas de contexto, pero no fija snapshots inmutables.
  • La documentación dice conservar un contexto continuo del test, mientras Query_GPT.py envía cada ítem como una nueva conversación de un solo mensaje. Los protocolos de ChatGPT_lite y API no son equivalentes.
  • El scoring depende de enviar respuestas al endpoint vivo de 16Personalities y recuperar una sesión. El algoritmo propietario, la versión y posibles cambios del servicio no quedan congelados ni auditables.
  • El parser del repositorio busca subcadenas en respuestas libres. Si un ítem no coincide con ninguna expresión, no valida la longitud y las respuestas posteriores pueden desplazarse a preguntas equivocadas al construir el payload.
  • La conversión del repositorio asigna correct a −3 y wrong a +3 antes de consultar el servicio, pero no documenta la convención de signo. La fidelidad de ese mapeo al test externo no puede verificarse con los artefactos publicados.
  • El README declara que el código simplificado produce solo una ejecución y que el usuario debe adaptarlo para reproducir 15. El bucle de agregación está comentado, por lo que las tablas no se regeneran directamente.
  • En el commit público inspeccionado, Query_InsturctGPT.py y Crawler_16personalities.py fallan `py_compile` por errores de indentación. La ruta de scoring no es ejecutable sin corrección.
  • El repositorio solo aporta CSV de seis sujetos por modelo, mientras las tablas incluyen más profesiones, fondos y 15 ejecuciones. Faltan los artefactos crudos completos y el pipeline exacto de agregación.
  • Las explicaciones causales sobre RLHF, capacidad de razonamiento o comprensión de fondos se infieren de perfiles intuitivos sin ablations ni comparadores. Coincidir con un estereotipo del investigador no valida una evaluación.
  • Solo se evalúan tres modelos de una misma familia/proveedor y en inglés. Los resultados no generalizan a modelos actuales, otras arquitecturas, idiomas o culturas.
  • El diseño puede amplificar discriminación si se usa para inferir rasgos de grupos o individuos. La sección ética lo reconoce, exige revisión y prohíbe generalizar directamente los resultados.

Qué no demuestra

  • No demuestra que ChatGPT, GPT-4 o InstructGPT puedan evaluar la personalidad real de una persona o población.
  • No demuestra que una salida consistente sea verdadera, psicométricamente válida o libre de estereotipos.
  • No demuestra que ChatGPT/GPT-4 sean más justos que InstructGPT; solo puntúan algo más alto en una similitud definida por los autores.
  • No valida 16Personalities/MBTI para inferencia automática ni conserva su validez al reemplazar autoinforme por juicios sobre grupos.
  • No permite usar etiquetas de profesión, género, edad, ingresos o educación para tomar decisiones sobre individuos.
  • No aporta evidencia de estados mentales, motivaciones, psicología o percepciones internas del modelo más allá de sus respuestas generadas.

Trazabilidad

Alcance: Texto completo

Versión: Findings of EMNLP 2023 proceedings version, pp. 1184–1194; arXiv:2303.01248v3 supplement also reviewed

Fuente consultada: https://aclanthology.org/2023.findings-emnlp.84.pdf

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • InstructGPT (text-davinci-003)
  • ChatGPT (gpt-3.5-turbo)
  • GPT-4 (gpt-4)

Instrumentos y métricas

  • 16Personalities online test (60 statements, seven response levels)
  • Five 16Personalities axes: E/I, N/S, T/F, J/P, A/T
  • Custom Euclidean-distance consistency score
  • Custom fixed-vs-permuted option-order robustness score
  • Custom gender-label similarity score called fairness

Datos utilizados

  • General group labels: People, Men, Women, Boys, Girls
  • Occupation labels: Barbers, Accountants, Doctors, Artists, Mathematicians, Politicians and six supplementary professions
  • Background labels for income, age and education
  • Named-person probes: Barack Obama, Taylor Swift and Michael Jordan

Evidencia y localización

  • Objetivo, componentes y afirmaciones principales: Findings of EMNLP 2023 PDF, pp. 1184–1185, abstract and introduction
  • Permutación de opciones y promedio de ejecuciones: Findings PDF, pp. 1186–1188, sections 3.1 and 3.4
  • Sustitución del sujeto por grupos: Findings PDF, pp. 1186–1187, section 3.2
  • Cambio de acuerdo a corrección: Findings PDF, p. 1187, section 3.3 and Figure 2
  • Fórmulas de consistencia, robustez y fairness: Findings PDF, pp. 1188–1189, equations 2–5
  • Modelos, sujetos y quince ejecuciones: Findings PDF, p. 1189, Experimental Setups
  • Perfiles completos de grupos y profesiones: Findings PDF, p. 1189, Table 1
  • Resultados de consistencia, robustez y fairness: Findings PDF, p. 1190, Tables 2–3 and section 5
  • Perfiles por ingresos, edad y educación: Findings PDF, p. 1191, Table 4 and section 6
  • Incertidumbre ante individuos concretos: Findings PDF, p. 1191, Figure 6 and Assessment of Specific Individuals
  • Limitaciones, validez no establecida y advertencias éticas: Findings PDF, p. 1192, Limitations and Ethics Considerations
  • Modelos exactos, aliases y configuración por defecto: arXiv:2303.01248v3 supplementary materials, Appendix A
  • Test de 60 ítems y quinto eje A/T de 16Personalities: arXiv v3 supplementary materials, Appendix C.1
  • Código simplificado de una sola ejecución: Linked repository commit a50bac9ac6269aac175ef7b62b81c7c4f9f1f46b, README.md
  • Protocolos de consulta y conversaciones separadas por ítem: Linked repository commit a50bac9ac6269aac175ef7b62b81c7c4f9f1f46b, Query_GPT.py and Query_ChatGPT.py
  • Parser por subcadenas, scoring externo y agregación comentada: Linked repository commit a50bac9ac6269aac175ef7b62b81c7c4f9f1f46b, Crawler_16personalities.py
  • Errores de sintaxis reproducibles en dos scripts: Linked repository commit a50bac9ac6269aac175ef7b62b81c7c4f9f1f46b, Python py_compile of Query_InsturctGPT.py and Crawler_16personalities.py