El artículo propone convertir un cuestionario de 16Personalities en consultas sobre grupos: sustituye «tú» por «personas», «hombres», «artistas» o una profesión, cambia acuerdo/desacuerdo por correcto/incorrecto, permuta las siete opciones y promedia 15 ejecuciones. Compara text-davinci-003, gpt-3.5-turbo y gpt-4 mediante tres índices propios: proximidad entre ejecuciones (consistencia), proximidad entre orden fijo y permutado (robustez) y similitud entre dos pares de etiquetas de género, ponderada por consistencia (denominada fairness). ChatGPT y GPT-4 obtienen medias de consistencia ligeramente mayores que InstructGPT (0,918 y 0,921 frente a 0,905), robustez ligeramente menor (0,935 y 0,936 frente a 0,942) y una supuesta fairness mayor (0,776 y 0,778 frente a 0,753). Estos números muestran estabilidad relativa de respuestas bajo el protocolo, no capacidad para evaluar personalidades humanas ni equidad real. No se observa a ninguna persona ni se compara con autoinforme, conducta, distribuciones poblacionales o jueces humanos: el diseño elicita generalizaciones del modelo sobre grupos y a menudo reproduce estereotipos («contables» como Logistician, «artistas» como Campaigner, «matemáticos» como Architect). La escala es el test web 16Personalities, que añade Assertive/Turbulent y no equivale al MBTI oficial. Los índices usan una constante arbitraria, carecen de incertidumbre y no miden exactitud. El repositorio enlazado solo implementa una ejecución, depende del scoring vivo de un tercero y contiene dos scripts que no compilan. La contribución defendible es un protocolo para auditar qué estereotipos genera un LLM y cuánto cambian con el orden, siempre que no se confunda con evaluación psicológica.
Pregunta de investigación
¿Puede un LLM producir perfiles cuantitativos de grupos mediante preguntas reformuladas de 16Personalities, y cuán repetibles son esas salidas, cuánto cambian al permutar el orden de opciones y cuán similares resultan entre etiquetas masculinas y femeninas?