Este trabajo de COLING 2025 estudia patrones de respuesta multilingües de una única versión reproducible, gpt-4o-2024-05-13, con temperatura=1 y top-p=1. En cada condición el modelo completa cien veces el EPQR-A: 24 preguntas binarias que producen puntuaciones de 0 a 6 en Extraversión (E), Neuroticismo (N), Psicoticismo (P) y Mentira o deseabilidad social (L). El primer experimento usa adaptaciones publicadas en inglés, hebreo, portugués brasileño, eslovaco, español y turco, siempre con instrucciones en inglés. Las repeticiones permiten describir la distribución de salidas condicionadas por esos prompts, pero no son personas ni cien modelos independientes.
En las versiones originales, las medias difieren poco en escala absoluta pero varias comparaciones por pares son significativas. E va de 3,05 en inglés a 4,45 en eslovaco; N, de 1,19 en turco a 3,11 en inglés; P, de 0,57 en turco a 1,59 en eslovaco; y L, de 4,79 en español a 5,54 en portugués brasileño. El artículo interpreta estas diferencias como un posible efecto de cambio de idioma. La evidencia directa, sin embargo, solo establece que el mismo snapshot genera distribuciones EPQR-A distintas bajo cuestionarios y lenguas distintas; no identifica una personalidad interna ni reproduce Cultural Frame Switching humano.
El segundo experimento intenta separar idioma y traducción comparando las adaptaciones publicadas con traducciones automáticas desde inglés mediante Google Translate. La conclusión del texto es que las diferencias son mínimas y que E y N apuntan más al idioma que a la traducción. La propia Table 1 exige más cautela: 10 de los 20 contrastes original-traducción están marcados como significativos a p≤0,01. Incluyen tres escalas en hebreo, P en portugués brasileño, P y L en eslovaco, E, N y L en español y P en turco. Sin validación humana de las traducciones, equivalencia de medida o corrección por la gran cantidad de pruebas, el diseño no permite descartar la traducción ni separar con firmeza lengua, redacción e instrumento.
El tercer experimento usa el EPQR-A inglés y ordena a GPT-4o personificar a un nativo “típico” de Estados Unidos, Australia, Reino Unido, Canadá o Irlanda, reflejar normas culturales y explicar sus decisiones. Frente al inglés genérico, E sube de 3,05 a entre 4,75 y 5,97; N va de 1,05 en Australia a 3,70 en Reino Unido; P, de 0,70 en Reino Unido a 1,83 en Irlanda; y Canadá alcanza el mayor L, 5,22. Las explicaciones recurren a clichés sobre individualismo estadounidense, el fair go australiano, cortesía británica, armonía canadiense o sociabilidad irlandesa. El hallazgo sólido es sensibilidad al rol nacional explícitamente inducido; las comparaciones descriptivas con estudios humanos históricos no demuestran alineamiento entre personalidades humanas y del modelo.
La consistencia interna es desigual. En las condiciones de idioma, E y N suelen superar alfa 0,70, pero P nunca lo hace y llega a -0,049 en inglés y -0,258 en eslovaco; L oscila entre 0,073 y 0,861. En los roles nacionales, N supera 0,70 en los cinco países, mientras P queda entre 0,323 y 0,380 y L llega a -0,100 en Canadá. El artículo no publica datos, código, efectos, intervalos, p exactas ni corrección por comparaciones múltiples, y no prueba estructura factorial, invariancia o comportamiento externo. Su aportación útil es mostrar que idioma, versión traducida y persona cultural alteran los perfiles de salida de GPT-4o; “personalidad” debe entenderse aquí como puntuación psicométrica dependiente del prompt.