Deterministic AI Agent Personality Expression through Standard Psychological Diagnostics

Evaluación y validez psicométrica2025allora.networkRevisión editorial aprobada

Autores: J. M. Diederik Kruijssen, Nicholas Emmons

Palabras clave: Machine Learning, Artificial Intelligence, Computers and Society, Human-Computer Interaction

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
17
Hallazgos
40
Limitaciones
22
Evidencias

Resumen editorial

Español

Este artículo de Allora Foundation evalúa si cuatro modelos GPT siguen plantillas de personalidad incluidas explícitamente en el system prompt. Un GPT-4o «character builder» genera diez agentes con valores Big Five de 1 a 5, un tipo MBTI, descripciones de cada rasgo, estilo, historia y conducta de trading. Después, GPT-4o-mini (2024-07-18), GPT-4o (2024-08-06), o1 (2024-12-17) y o3-mini (2025-01-31) responden una vez, pregunta a pregunta, a 50 ítems Big Five y 70 preguntas MBTI. Algunas condiciones exigen una breve justificación; GPT-4o también se compara con una versión afinada en 130 pares generados por GPT-4o para producir un estilo cripto «unhinged». La cifra agregada, que promedia 16 métricas normalizadas heterogéneas, es 0,63 para 4o-mini, 0,78 para 4o y o3-mini, y 0,79 para o1; con justificación pasa a 0,70, 0,72, 0,74 y 0,78, respectivamente. El GPT-4o afinado obtiene 0,76 sin justificación y 0,72 con ella. Estas diferencias no tienen intervalos ni tests inferenciales: la desviación publicada es dispersión entre métricas y no incertidumbre. La muestra tampoco representa uniformemente el espacio de personalidad: solo aparecen 5 de 16 tipos MBTI, cuatro agentes son ENTP, ocho de diez son intuitivos y dos agentes comparten exactamente los mismos cinco scores y tipo ISTJ. El resultado más claro es que modelos propietarios pueden obedecer una instrucción que les entrega el perfil y luego producir respuestas compatibles con él. No se prueba determinismo: no hay réplicas de una misma condición, temperatura, top-p, seed ni estabilidad temporal. Tampoco se separa memoria del prompt, reconocimiento semántico de los ítems y expresión conductual fuera del test. La inferencia de «razonamiento holístico» se apoya en que las respuestas individuales no caen en la diagonal perfecta; esa variación también es compatible con ruido, ambigüedad de ítems o cumplimiento imperfecto, y no hay baseline humano ni análisis causal. En la condición o1 con justificación, apertura falla de forma marcada: media objetivo 3,90 (SD 1,29) frente a 4,67 (SD 0,42). Hay además un error matemático: para MBTI el paper define el acuerdo observado de Cohen κ como TP/n y omite verdaderos negativos, por lo que ese κ no es el estándar binario. La afirmación de que el fine-tuning solo cambia el estilo se basa en una comparación de un único run y ejemplos escogidos; el texto incluso atribuye una diferencia a «Poisson noise» sin modelo probabilístico ni test. No se publica código, el dataset completo de 130 pares, respuestas, configuración API ni resultados por agente. ADI asigna DOI y ofrece el PDF, pero fue creada por Allora, declara centrarse inicialmente en trabajos del propio equipo y presenta la revisión por pares externa como una aspiración futura; los autores pertenecen a Allora Foundation. La evidencia debe tratarse como investigación interna publicada, no como validación independiente. No se evalúan usuarios, confianza, educación, salud, terapia, seguridad ni conducta de trading. La conclusión defendible es estrecha: bajo prompts que revelan directamente los objetivos, estos snapshots GPT generan patrones de cuestionario correlacionados con ellos, con un sesgo persistente hacia alta apertura.

English

This Allora Foundation paper tests whether four GPT models follow personality templates explicitly placed in the system prompt. A GPT-4o 'character builder' creates ten agents with 1–5 Big Five values, an MBTI type, detailed trait descriptions, style, backstory, and trading behavior. GPT-4o-mini (2024-07-18), GPT-4o (2024-08-06), o1 (2024-12-17), and o3-mini (2025-01-31) then answer one 50-item Big Five and one 70-question MBTI sequence per condition. Some conditions require a short motivation; GPT-4o is also compared with a version fine-tuned on 130 GPT-4o-generated pairs for an 'unhinged' crypto style. The aggregate score, an average of 16 heterogeneous normalized metrics, is .63 for 4o-mini, .78 for 4o and o3-mini, and .79 for o1; with motivations it becomes .70, .72, .74, and .78. Fine-tuned GPT-4o scores .76 without motivations and .72 with them. These differences have no intervals or inferential tests: the reported standard deviation is dispersion across metrics, not uncertainty. The sample does not uniformly span personality space: only five of sixteen MBTI types appear, four agents are ENTP, eight of ten are intuitive, and two agents share exactly the same five scores and ISTJ type. The clearest result is that proprietary models can obey an instruction that directly supplies a profile and then produce questionnaire answers compatible with it. Determinism is not tested: there are no repeated runs of the same condition, temperature, top-p, seed, or temporal-stability measurements. The design also does not separate prompt memory, semantic recognition of items, and behavior outside the test. The 'holistic reasoning' inference rests on individual responses not falling on a perfect diagonal; the same pattern is compatible with noise, item ambiguity, or imperfect instruction following, and there is no human baseline or causal test. In motivated o1, openness fails markedly: target mean 3.90 (SD 1.29) versus tested mean 4.67 (SD .42). There is also a mathematical error: for MBTI the paper defines Cohen's observed agreement as TP/n and omits true negatives, so its kappa is not standard binary kappa. The claim that fine-tuning only changes style is based on a single-run comparison and selected examples; the paper attributes one difference to 'Poisson noise' without a probability model or test. No code, full 130-pair dataset, responses, API configuration, or per-agent results are published. ADI assigns a DOI and hosts the paper, but it was created by Allora, says it initially focuses on work by its own team, and describes external peer-reviewed contributions as a future goal; both authors are at Allora Foundation. This is internally published research, not independent validation. The paper does not test users, trust, education, health care, therapy, safety, or trading behavior. The defensible conclusion is narrow: under prompts that directly disclose target profiles, these GPT snapshots generate questionnaire patterns correlated with those targets, with a persistent bias toward high openness.

Pregunta de investigación

¿Hasta qué punto cuatro snapshots GPT responden cuestionarios Big Five y MBTI de forma congruente con perfiles numéricos y narrativos incluidos en su system prompt, y cambian esos resultados al pedir justificaciones o afinar el estilo de GPT-4o?

Método

GPT-4o genera diez plantillas con cinco scores Big Five, un tipo MBTI compatible y descripciones conductuales. Cada plantilla se inserta en el system prompt de cuatro modelos. Por condición, el agente contesta secuencialmente 50 ítems Likert Big Five y 70 elecciones MBTI, con o sin una justificación. Se calculan MAE, RMSE, Pearson, Spearman y κ para Big Five, y F1, accuracy y un κ binario formulado incorrectamente para MBTI, tanto sobre scores finales como sobre respuestas. Las 16 métricas normalizadas se promedian. GPT-4o se compara además con un fine-tune de estilo entrenado en 130 pares sintéticos. No hay réplicas por condición.

Muestra: Diez agentes sintéticos, cuatro modelos base y diez condiciones experimentales. Cada condición usa los mismos diez perfiles y una sola administración de 50 preguntas Big Five y 70 MBTI por agente. A escala de test hay n=10 por dimensión; a escala de respuesta se agrupan ítems anidados en esos mismos diez agentes. Solo se cubren cinco tipos MBTI y la distribución está fuertemente sesgada.

Hallazgos

  • La media agregada de 16 métricas es 0,63 para 4o-mini, 0,78 para 4o, 0,78 para o3-mini y 0,79 para o1.
  • Al exigir motivación, las medias pasan a 0,70, 0,72, 0,74 y 0,78, respectivamente.
  • GPT-4o afinado obtiene 0,76 sin motivación y 0,72 con ella, frente a 0,78 y 0,72 del GPT-4o no afinado.
  • Las diferencias entre 0,78 y 0,79 no incluyen test de hipótesis, intervalo ni repetición que permita ordenar modelos con incertidumbre.
  • Para GPT-4o sin motivación, Big Five MAE es 0,44 en extraversión, 0,61 en amabilidad, 0,13 en responsabilidad, 0,04 en neuroticismo y 0,80 en apertura.
  • Para o1 sin motivación, las MAE Big Five son 0,38, 0,72, 0,20, 0,20 y 0,78.
  • La apertura es el fallo sistemático: en o1 motivado la media objetivo 3,90 pasa a 4,67 y la SD cae de 1,29 a 0,42.
  • Los autores observan más dispersión a escala de ítem que en el score final y la interpretan como razonamiento basado en personalidad.
  • Las matrices no diagonales solo muestran que las respuestas individuales no son copias perfectas del score objetivo; no identifican el mecanismo que produjo la variación.
  • El requerimiento de motivación mejora el agregado de 4o-mini, reduce los de 4o y o3-mini y apenas cambia o1.
  • Los ejemplos de justificación suelen ser semánticamente compatibles con el número, pero fueron seleccionados por los autores y no evaluados ciegamente.
  • El fine-tune cambia visiblemente el tono de cinco ejemplos hacia respuestas más crípticas y agresivas; no existe una medida formal de estilo sobre el conjunto completo.
  • Cuatro de diez agentes son ENTP, dos ENFP, dos ISTJ, uno INTJ y uno ENFJ; once tipos MBTI no aparecen.
  • Ocho de diez agentes son N y ningún perfil representa puntuaciones uniformemente bajas en los cinco rasgos.
  • Agent 2 y Agent 8 comparten exactamente Big Five 2/4/5/2/3 y tipo ISTJ, reduciendo la diversidad efectiva de los objetivos.
  • La fórmula MBTI de κ usa TP/n como acuerdo observado y un término de azar solo positivo; omite TN y no calcula el κ binario convencional.
  • No se publican respuestas completas, resultados MBTI por condición, datos por agente, configuración API ni código para recalcular las figuras.

Limitaciones

  • No hay múltiples generaciones de una misma combinación agente-modelo-test; el supuesto determinismo entre ejecuciones no se mide.
  • No se informan temperatura, top-p, seed, max tokens, retries, fecha de API ni otros parámetros de muestreo.
  • Los modelos son servicios propietarios y los snapshots pueden dejar de estar disponibles, sin outputs completos para preservación.
  • El system prompt contiene directamente los cinco valores Big Five, el tipo MBTI y explicaciones detalladas de cómo debe comportarse cada nivel.
  • El prompt ordena adherirse cuidadosamente a la personalidad; la tarea mide seguimiento de instrucciones con fuerte fuga del objetivo.
  • No existe baseline sin perfil, con perfil oculto, con etiquetas permutadas o con una narrativa sin valores numéricos.
  • Big Five y MBTI no son validaciones independientes porque ambos objetivos están incluidos simultáneamente en la plantilla.
  • Asignar a cada ítem el score global del rasgo como respuesta verdadera supone que todos los ítems deben igualar el latente, una simplificación no psicométrica.
  • Las respuestas están anidadas en diez agentes, pero las métricas a escala de respuesta las agrupan sin un modelo multinivel.
  • A escala de test solo hay diez puntos por rasgo, con valores repetidos y rango restringido para varias dimensiones.
  • No hay comparación con fiabilidad test-retest, variabilidad humana o distribución humana de respuestas por ítem.
  • El patrón no diagonal no distingue razonamiento holístico de ruido de muestreo, ambigüedad, sesgo de respuesta o cumplimiento imperfecto.
  • La afirmación sobre inteligencia y razonamiento compara cuatro modelos que difieren en múltiples aspectos sin manipulación factorial de esas capacidades.
  • Las etiquetas «baja/alta inteligencia» y «bajo/intermedio/alto razonamiento» se asignan cualitativamente y no se miden en el experimento.
  • El paper promedia 16 métricas con escalas, dependencias y significados distintos, dándoles el mismo peso sin justificación.
  • La desviación estándar del agregado es variación entre métricas y dimensiones, no error estándar, intervalo ni variabilidad entre runs.
  • Figura 7 usa percentiles entre solo cuatro o cinco dimensiones; el propio pie reconoce que las barras no son incertidumbre.
  • La fórmula de Cohen κ para MBTI es incorrecta porque el acuerdo observado debe incluir TP y TN y el azar debe incluir ambas clases.
  • No se especifica si F1 es de una clase, macro, micro o weighted; su valor depende de qué polo MBTI se trate como positivo.
  • Cohen κ no ponderado trata errores Likert adyacentes y extremos por igual; no se justifica frente a un κ ordinal.
  • No hay corrección por las numerosas comparaciones de modelos, condiciones, tests, escalas, rasgos y métricas.
  • Las expresiones «no estadísticamente significativo» y «Poisson noise» aparecen sin test, p, intervalo, likelihood o justificación de una distribución Poisson para scores ordinales acotados.
  • Solo cinco de dieciséis tipos MBTI están presentes y cuatro perfiles son ENTP; la afirmación de cobertura amplia no se sostiene para MBTI.
  • Las medias cercanas a 3 no demuestran una distribución plana o representativa de los cinco rasgos.
  • Dos perfiles tienen objetivos Big Five y MBTI idénticos; el estudio no separa el efecto de sus narrativas diferentes.
  • Las diez plantillas fueron generadas por un único GPT-4o bajo «controlled randomization» no especificada y luego seleccionadas sin seed ni registro del proceso.
  • No se publica la fuente o validación exacta de los 50 ítems Big Five ni de las 70 preguntas MBTI.
  • El título habla de diagnósticos psicológicos, pero los cuestionarios de rasgos y MBTI no constituyen diagnóstico clínico.
  • El propio paper reconoce MBTI como pseudocientífico; usarlo no demuestra generalización psicométrica.
  • El fine-tune exacto, hiperparámetros, épocas, loss, validación y 120 de los 130 ejemplos de entrenamiento no se publican.
  • Todos los pares de fine-tuning fueron generados por GPT-4o, sin comparación con datos humanos ni un control de igual volumen y distinto estilo.
  • La independencia entre estilo y personalidad se infiere de un único fine-tune de un único modelo y una sola administración por condición.
  • El estilo se juzga con cinco ejemplos seleccionados, sin anotadores, cegamiento, rúbrica, acuerdo o métrica cuantitativa.
  • No se evalúa personalidad percibida por humanos, persistencia multivuelta fuera del test ni conducta en tareas o tool calls.
  • La conducta de trading está en las plantillas, pero el paper declara que no la prueba.
  • No hay evaluación de utilidad, confianza, engagement, seguridad, manipulación, educación, terapia o salud pese a las aplicaciones propuestas.
  • No hay código, dataset completo, outputs, tablas de datos, licencia de artefactos o instrucciones de reproducción.
  • Los autores pertenecen a Allora Foundation y la revista ADI fue creada por Allora para publicar inicialmente trabajo del propio equipo.
  • La presentación de ADI describe contribuciones externas seleccionadas y revisadas por pares como una aspiración futura, sin documentar revisión independiente de este artículo.
  • No existe declaración formal de conflicto, financiación, disponibilidad de datos, aprobación ética o rol del patrocinador en el PDF.

Qué no demuestra

  • No demuestra determinismo o reproducibilidad entre ejecuciones.
  • No demuestra una personalidad interna, estable o consciente en ningún modelo.
  • No muestra personalidad emergente: los objetivos y sus descripciones se proporcionan directamente.
  • No valida un instrumento psicométrico para agentes de IA.
  • No prueba que las respuestas se produzcan por razonamiento holístico.
  • No demuestra causalmente que inteligencia o razonamiento expliquen las diferencias entre modelos.
  • No establece que o1 supere a GPT-4o u o3-mini con significación o estabilidad.
  • No demuestra independencia general entre estilo de comunicación y personalidad expresada.
  • No muestra cobertura amplia del espacio MBTI o Big Five.
  • No demuestra que la personalidad persista fuera de los cuestionarios o al priorizar otra tarea.
  • No evalúa comportamiento de trading, uso de herramientas o decisiones reales.
  • No demuestra que usuarios perciban los perfiles como naturales, distintos, fiables o atractivos.
  • No valida aplicaciones en educación, salud, terapia o atención al cliente.
  • No demuestra seguridad ni ausencia de manipulación o dependencia emocional.
  • No permite reproducir los resultados completos con los materiales publicados.
  • No constituye una validación editorial independiente de Allora Foundation.

Trazabilidad

Alcance: Texto completo

Versión: Allora Decentralized Intelligence 2, 15–39, final publisher PDF; DOI 10.70235/allora.0x20015

Fuente consultada: https://research.assets.allora.network/allora.0x20015.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, publisher-independence, prompt-leakage, psychometric-construct, test-retest, sampling, nested-unit, metric-formula, aggregation, inferential-statistics, model-version, fine-tuning, reproducibility, human-evaluation, product-claim, safety, ethics and evidence-level audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o-mini-2024-07-18
  • GPT-4o-2024-08-06
  • o1-2024-12-17
  • o3-mini-2025-01-31
  • GPT-4o character-builder agent
  • Fine-tuned GPT-4o variant with exact fine-tune identifier not reported

Instrumentos y métricas

  • 50-item Big Five questionnaire with 1–5 Likert responses and reverse scoring
  • 70-question binary MBTI questionnaire
  • MAE and RMSE
  • Pearson and Spearman correlations
  • Cohen kappa for Big Five response categories
  • F1 and accuracy for MBTI
  • Non-standard, incorrect binary Cohen kappa formula for MBTI
  • Aggregate mean of 16 normalized metrics
  • Qualitative inspection of selected motivations
  • Kernel-density visualization of ten o1-motivated scores per trait

Datos utilizados

  • Ten synthetic personality templates generated by GPT-4o
  • One Big Five response sequence and one MBTI response sequence per agent-model-condition
  • 130 GPT-4o-generated prompt-response pairs for communication-style fine-tuning; only ten are printed

Evidencia y localización

  • Identidad, DOI, afiliación y abstract completo: ADI final PDF p. 1 (journal p. 15) and Allora article record
  • Modelos y snapshots exactos: PDF p. 2 (journal p. 16), section 2.1
  • Plantilla con scores, MBTI y descripciones conductuales: PDF pp. 2, 18–22 (journal pp. 16, 32–36), sections 2.1 and Appendix A
  • Protocolos Big Five y scoring: PDF p. 3 (journal p. 17), section 2.2.1 and Equations 1–2
  • Protocolo MBTI y scoring: PDF p. 4 (journal p. 18), section 2.2.2 and Equations 3–4
  • Diez perfiles, duplicación y cobertura MBTI: PDF p. 5 (journal p. 19), Table 1
  • Diez condiciones y scores agregados: PDF p. 6 (journal p. 20), Table 2
  • Definiciones de métricas y error en κ MBTI: PDF pp. 5–6 (journal pp. 19–20), Equations 5–6
  • Unidad de análisis de test y respuesta: PDF p. 6 (journal p. 20), section 3.1
  • Resultados Big Five por modelo: PDF pp. 7–8 (journal pp. 21–22), Figures 1–2 and section 3.2
  • Resultados con motivación e inferencia de razonamiento: PDF pp. 9–11 (journal pp. 23–25), section 3.3 and Figures 3–4
  • Fine-tuning y ejemplos seleccionados: PDF pp. 12–13 (journal pp. 26–27), section 3.4 and Figures 5–6
  • Afirmación Poisson/significación sin test: PDF p. 13 (journal p. 27), end of section 3.4
  • Normalización y agregado de 16 métricas: PDF p. 14 (journal p. 28), section 3.5, Equation 7 and Figure 7
  • Barras son dispersión entre dimensiones, no incertidumbre: PDF p. 14 (journal p. 28), Figure 7 caption
  • Sesgo sistemático de apertura: PDF p. 15 (journal p. 29), Figure 8 and section 3.5
  • Limitaciones reconocidas y afirmaciones de aplicación: PDF pp. 16–17 (journal pp. 30–31), section 4
  • Preguntas completas de ambos tests: PDF pp. 23–25 (journal pp. 37–39), Appendix B
  • Fine-tune de 130 pares sintéticos y solo diez publicados: PDF p. 25 (journal p. 39), Appendix C and Table C.1
  • Inspección visual: All 25 pages of the final ADI PDF rendered and visually inspected, including eight figures, three main/appendix tables and equations; checked 15 Jul 2026
  • Ausencia de artefactos reproducibles enlazados: ADI article page, final PDF and targeted GitHub searches by exact title, distinctive prompt and DOI; checked 15 Jul 2026
  • Modelo editorial y falta de validación independiente documentada: Allora blog introducing ADI: initially focused on Allora Labs research and external selected peer-reviewed contributions described as a future pathway; checked 15 Jul 2026