Este artículo de Allora Foundation evalúa si cuatro modelos GPT siguen plantillas de personalidad incluidas explícitamente en el system prompt. Un GPT-4o «character builder» genera diez agentes con valores Big Five de 1 a 5, un tipo MBTI, descripciones de cada rasgo, estilo, historia y conducta de trading. Después, GPT-4o-mini (2024-07-18), GPT-4o (2024-08-06), o1 (2024-12-17) y o3-mini (2025-01-31) responden una vez, pregunta a pregunta, a 50 ítems Big Five y 70 preguntas MBTI. Algunas condiciones exigen una breve justificación; GPT-4o también se compara con una versión afinada en 130 pares generados por GPT-4o para producir un estilo cripto «unhinged». La cifra agregada, que promedia 16 métricas normalizadas heterogéneas, es 0,63 para 4o-mini, 0,78 para 4o y o3-mini, y 0,79 para o1; con justificación pasa a 0,70, 0,72, 0,74 y 0,78, respectivamente. El GPT-4o afinado obtiene 0,76 sin justificación y 0,72 con ella. Estas diferencias no tienen intervalos ni tests inferenciales: la desviación publicada es dispersión entre métricas y no incertidumbre. La muestra tampoco representa uniformemente el espacio de personalidad: solo aparecen 5 de 16 tipos MBTI, cuatro agentes son ENTP, ocho de diez son intuitivos y dos agentes comparten exactamente los mismos cinco scores y tipo ISTJ. El resultado más claro es que modelos propietarios pueden obedecer una instrucción que les entrega el perfil y luego producir respuestas compatibles con él. No se prueba determinismo: no hay réplicas de una misma condición, temperatura, top-p, seed ni estabilidad temporal. Tampoco se separa memoria del prompt, reconocimiento semántico de los ítems y expresión conductual fuera del test. La inferencia de «razonamiento holístico» se apoya en que las respuestas individuales no caen en la diagonal perfecta; esa variación también es compatible con ruido, ambigüedad de ítems o cumplimiento imperfecto, y no hay baseline humano ni análisis causal. En la condición o1 con justificación, apertura falla de forma marcada: media objetivo 3,90 (SD 1,29) frente a 4,67 (SD 0,42). Hay además un error matemático: para MBTI el paper define el acuerdo observado de Cohen κ como TP/n y omite verdaderos negativos, por lo que ese κ no es el estándar binario. La afirmación de que el fine-tuning solo cambia el estilo se basa en una comparación de un único run y ejemplos escogidos; el texto incluso atribuye una diferencia a «Poisson noise» sin modelo probabilístico ni test. No se publica código, el dataset completo de 130 pares, respuestas, configuración API ni resultados por agente. ADI asigna DOI y ofrece el PDF, pero fue creada por Allora, declara centrarse inicialmente en trabajos del propio equipo y presenta la revisión por pares externa como una aspiración futura; los autores pertenecen a Allora Foundation. La evidencia debe tratarse como investigación interna publicada, no como validación independiente. No se evalúan usuarios, confianza, educación, salud, terapia, seguridad ni conducta de trading. La conclusión defendible es estrecha: bajo prompts que revelan directamente los objetivos, estos snapshots GPT generan patrones de cuestionario correlacionados con ellos, con un sesgo persistente hacia alta apertura.
Pregunta de investigación
¿Hasta qué punto cuatro snapshots GPT responden cuestionarios Big Five y MBTI de forma congruente con perfiles numéricos y narrativos incluidos en su system prompt, y cambian esos resultados al pedir justificaciones o afinar el estilo de GPT-4o?