Open Models, Closed Minds? On Agents Capabilities in Mimicking Human Personalities through Open Large Language Models

Personas, identidad y agentes2025AAAIRevisión editorial aprobada

Autores: Lucio La Cava, Andrea Tagarelli

Palabras clave: Open-weight language models, Questionnaire response conditioning, MBTI, 16Personalities NERIS, Big Five Inventory, Role conditioning, Construct validity, Reproducibility

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
14
Hallazgos
26
Limitaciones
12
Evidencias

Resumen editorial

Español

Open Models, Closed Minds? compara cómo doce modelos de pesos accesibles contestan cuestionarios de personalidad sin condicionamiento, con una personalidad explícita y con personalidad más profesión. El trabajo es un paper de AAAI 2025 de nueve páginas y dispone de una versión arXiv v3 extendida a 39 páginas. Su objeto observable no es una personalidad psicológica interna: son elecciones de respuesta producidas tras instrucciones autorreferenciales. Para RQ0, cada modelo describe 16 tipos etiquetados como MBTI y cinco factores BFI a temperatura 0,01; las descripciones se comparan con referencias mediante solapamiento léxico y coseno de `all-mpnet-base-v2`. Los promedios 0,67 y 0,66 se interpretan como awareness, pero no hay umbral validado, control nulo, comparación humana ni prueba de contaminación: la tarea puede resolverse reproduciendo definiciones públicas. Para RQ1, se presentan por separado y en orden aleatorio 60 ítems copiados de 16Personalities y los 44 ítems BFI. Se ejecutan 30 repeticiones a temperaturas 0,01 y 0,7. A baja temperatura, la mayoría de modelos colapsa en un único resultado, con ENFJ y la preferencia J dominantes; subir temperatura diversifica algunos modelos, pero no demuestra que aparezca una personalidad latente. En BFI, casi todos obtienen factores altos salvo Neuroticismo y el efecto térmico es heterogéneo. Para RQ2, el system prompt describe uno de 16 tipos o pide exhibir al máximo un factor BFI. En la clasificación de cuatro letras, SOLAR obtiene accuracy media 0,785/0,744 a temperatura 0,01/0,7; Dolphin 0,654/0,633; NeuralChat 0,577/0,498; Llama-3-8B 0,517/0,479. Mixtral y Mistral quedan alrededor de 0,06; Vicuna, Llama-2-7B, Falcon, Gemma y Phi-3 también muestran adaptación limitada. Este es el resultado más sólido: la obediencia a este procedimiento de steering varía mucho entre checkpoints y suele empeorar al aumentar temperatura. En BFI se informa el porcentaje de subida del factor objetivo respecto al baseline; Neuroticismo llega a +233,3 % para Llama-3-8B. Sin embargo, solo se condiciona el polo alto, no se publican cambios en factores no objetivo y una gran subida porcentual puede partir de una base baja. Por eso no se demuestra control selectivo de un perfil Big Five. Para RQ3 se añaden tres profesiones consideradas representativas de cada target. A veces aumenta el match, sobre todo en modelos ya sensibles; ENFJ asociado a teacher es el caso más fácil. El diseño carece de condición role-only, profesiones incompatibles o aleatorias y análisis factorial del incremento. La profesión repite información estereotípica del target, así que no puede aislarse un mecanismo propio del rol. Además, la procedencia de esas asignaciones no es verificable: el texto dice que las eligió un grupo de psicólogos, pero no informa cuántos, credenciales, acuerdo o adjudicación, y el anexo presenta la categorización con formato de prompt. Hay un error constructivo mayor: los 60 ítems y el scoring proceden de 16Personalities. La documentación oficial de ese sitio identifica su instrumento como NERIS Type Explorer, con cinco espectros y diferencias explícitas respecto a Myers-Briggs. El paper lo llama MBTI, omite la dimensión Assertive/Turbulent y generaliza sus resultados como si fueran del instrumento genuino. La transformación de respuestas a tipo es opaca y no se publica. La reproducibilidad tampoco alcanza la promesa del paper. Los anexos revelan prompts, ítems, claves BFI, modelos y tablas, una fortaleza real, pero faltan respuestas crudas, scores por ejecución, seeds, órdenes, errores, código, environment y revisiones inmutables. AAAI, arXiv y la web actual del autor no enlazan repositorio, y las búsquedas exactas por título/ID en GitHub solo localizaron bibliografías. Los nombres de modelo carecen de organización y commit; Dolphin aparece como 2.1 en Table 2 pero el anexo enlaza 2.2.1. Los parámetros también son internamente erróneos o ambiguos: se declara `top_p=50` y `top_k=1`, al revés de los defaults estándar `top_k=50` y `top_p=1.0`. RQ3 añade tres roles, pero el total 11.520 MBTI y 3.600 BFI no multiplica por tres; Table 7 usa décimas compatibles con diez repeticiones por rol mientras el método afirma N=30. No se puede reconstruir el denominador exacto. Finalmente, casi todo el análisis es descriptivo: no hay intervalos, contrastes entre modelos, multiplicidad, preregistro, power analysis ni equivalencia. La conclusión fiel es más limitada que el título: estos checkpoints muestran estilos de respuesta y grados de obediencia distintos ante un steering explícito basado en cuestionarios. Muchos resisten este prompt y cuatro se adaptan mejor. El estudio no establece personalidad intrínseca, closed-mindedness psicológica ni footprint identity. Para sostenerlo harían falta scoring abierto, outputs crudos, versiones fijas, seeds, psicometría convergente y conductual, controles de spillover, retest, ablation de roles y validación humana contra estereotipos.

English

Open Models, Closed Minds? compares how twelve weight-accessible language models answer personality questionnaires with no conditioning, an explicit target personality, and a target personality plus profession. It is a nine-page AAAI 2025 paper with a 39-page arXiv v3 extended version. Its observable is not an internal psychological personality: it is a set of generated questionnaire choices after self-referential instructions. For RQ0, each model describes 16 MBTI-labelled types and five BFI factors at temperature 0.01; descriptions are compared with references using word overlap and `all-mpnet-base-v2` cosine similarity. Means of 0.67 and 0.66 are interpreted as awareness, but there is no validated threshold, null control, human comparison, or contamination test. The task may simply reproduce public definitions. For RQ1, 60 items copied from 16Personalities and the 44 BFI items are presented separately in randomized order. Thirty repetitions are run at temperatures 0.01 and 0.7. At low temperature, most models collapse to one result, with ENFJ and Judging dominant. Raising temperature diversifies some models but does not show a latent personality emerging. On BFI, nearly all factors are high except Neuroticism and temperature effects are heterogeneous. For RQ2, the system prompt describes one of 16 types or requests a maximal level of one BFI factor. In four-letter classification, SOLAR has mean accuracy 0.785/0.744 at temperature 0.01/0.7; Dolphin 0.654/0.633; NeuralChat 0.577/0.498; and Llama-3-8B 0.517/0.479. Mixtral and Mistral remain near 0.06, while Vicuna, Llama-2-7B, Falcon, Gemma, and Phi-3 also show limited adaptation. This is the strongest result: compliance with this steering procedure varies sharply across checkpoints and usually worsens at higher temperature. For BFI, the paper reports percentage increase in the target factor over baseline; Neuroticism reaches +233.3% for Llama-3-8B. However, only the high pole is conditioned, off-target factor changes are not reported, and a large percentage can originate from a low baseline. Selective control of a Big Five profile is therefore not established. RQ3 adds three professions considered representative of each target. Matching sometimes improves, especially for already responsive models; ENFJ paired with teacher is easiest. The design has no role-only, mismatched-role, random-role, or factorial incremental-effect condition. The profession repeats stereotypical target information, so an independent role mechanism cannot be isolated. The mapping provenance is also not auditable: the text says a group of psychologists selected roles but supplies no count, credentials, agreement, or adjudication, while the appendix displays role categorization in prompt-like form. A major construct error concerns the categorical instrument. The 60 items and web scoring come from 16Personalities, whose official documentation identifies its assessment as NERIS Type Explorer, with five spectrums and explicit differences from Myers-Briggs. The paper calls it MBTI, omits Assertive/Turbulent, and generalizes results as though they came from the genuine instrument. The response-to-type transformation is opaque and unreleased. Reproducibility also falls short of the paper's promise. The appendices disclose prompts, items, BFI key, model labels, and detailed tables, which is a genuine strength, but raw responses, per-run scores, seeds, orders, errors, code, environment, and immutable revisions are absent. AAAI, arXiv, and the author's current publication page do not link a repository, and exact title/ID searches on GitHub find bibliographic lists only. Model names omit organizations and commits; Dolphin is 2.1 in Table 2 but Appendix I links 2.2.1. Generation parameters are internally wrong or ambiguous: `top_p=50` and `top_k=1` are reported, reversing standard defaults of `top_k=50` and `top_p=1.0`. RQ3 adds three roles, yet the stated totals of 11,520 MBTI and 3,600 BFI tests do not multiply by three; Table 7 uses tenths consistent with ten repetitions per role while the method says N=30. The exact denominator cannot be recovered. Finally, the analysis is predominantly descriptive: no intervals, model contrasts, multiplicity strategy, preregistration, power analysis, or equivalence tests are supplied. The faithful conclusion is narrower than the title: these checkpoints show different questionnaire response styles and different compliance with explicit personality steering. Many resist this prompt and four adapt better. The study does not establish intrinsic personality, psychological closed-mindedness, or a footprint identity. Open scoring, raw outputs, fixed versions, seeds, convergent and behavioral psychometrics, spillover controls, retest, role ablations, and human/anti-stereotype validation are needed.

Pregunta de investigación

¿Qué patrones de respuesta producen doce LLM de pesos accesibles en un cuestionario de 16Personalities y en BFI, cuánto cambian al imponerles tipos/factores y profesiones congruentes, y difiere esa obediencia entre modelos y temperaturas?

Método

RQ0 pide a cada modelo describir 16 tipos y cinco factores y calcula word overlap y coseno all-mpnet-base-v2. RQ1 administra 60 preguntas de 16Personalities y 44 BFI, una por prompt y en orden aleatorio, a temperatura 0,01/0,7 con 30 repeticiones. RQ2 añade system messages con descripciones de cada tipo o factor; evalúa exact match de cuatro letras y subida porcentual del factor BFI objetivo. RQ3 añade tres profesiones congruentes por target. Se ejecutan doce modelos localmente mediante text-generation-webui y se usa AutoGen para roles de interviewer/interviewee. La auditoría leyó el AAAI completo y arXiv v3 extendido, inspeccionó visualmente las 48 páginas, contrastó NERIS/MBTI, revisó fórmulas, tablas, recuentos, parámetros y versiones, verificó metadatos oficiales y buscó el código/datos prometidos en superficies oficiales y GitHub.

Muestra: Doce checkpoints entre 3,8B y 46,7B parámetros, dos temperaturas y 30 repeticiones declaradas. RQ2 informa 12×2×16×30=11.520 tests categóricos y 12×2×5×30=3.600 BFI. El mismo texto atribuye esos totales conjuntamente a RQ2/RQ3 aunque RQ3 añade tres roles; si cada rol tuviera 30 repeticiones faltarían factores ×3. Table 7 avanza en décimas, compatible con diez repeticiones por rol, pero no se documenta. No hay personas evaluadas; el supuesto grupo de psicólogos que asigna profesiones no está descrito.

Hallazgos

  • Awareness obtiene coseno medio 0,67 en tipos etiquetados MBTI y 0,66 en BFI, sin calibración ni baseline.
  • A temperatura 0,01 predominan ENFJ y Judging; varios modelos producen un único tipo casi siempre.
  • SOLAR alcanza accuracy exacta media 0,785/0,744 a temperatura 0,01/0,7.
  • Dolphin obtiene 0,654/0,633, NeuralChat 0,577/0,498 y Llama-3-8B 0,517/0,479.
  • Mixtral y Mistral quedan aproximadamente en 0,06; otros cinco modelos tampoco superan 0,30 de media.
  • La mayor temperatura suele reducir exact match, aunque diversifica algunos outputs no condicionados.
  • En BFI, Neuroticismo es el factor más sensible; Llama-3-8B registra +233,3 % desde su baseline a temperatura 0,01.
  • Los resultados BFI no muestran selectividad porque no publican spillover en factores no objetivo.
  • Los roles congruentes ayudan en algunos modelos; ENFJ/teacher es el pairing más fácil, sin control de rol incongruente.
  • El cuestionario categórico real es NERIS de 16Personalities, no el MBTI genuino.
  • Se reportan top_p=50 y top_k=1, aparentemente intercambiados respecto de los defaults estándar.
  • El total de RQ3 y su denominador por rol no son reconstruibles desde el método y las tablas.
  • Dolphin se identifica como 2.1 en Table 2 y se enlaza como 2.2.1 en Appendix I.
  • No hay raw outputs, scoring categórico, seeds, environment, código o release oficial de datos pese a la promesa.

Limitaciones

  • Las respuestas de cuestionario no validan personalidad psicológica, identidad o rasgo interno estable.
  • Cada ítem se responde por separado repitiendo contexto; no hay consistencia conversacional ni retest temporal.
  • 16Personalities usa NERIS, no MBTI, y su scoring exacto no es público en el artefacto.
  • La dimensión Assertive/Turbulent de NERIS se omite aunque forma parte de su marco de cinco espectros.
  • Awareness carece de null, threshold, human baseline y control de memorization/training contamination.
  • ENFJ/J puede surgir de alignment, prompt, wording o scoring, no de una personalidad inherente.
  • Solo se condiciona el polo alto de cada factor BFI.
  • No se publican cambios off-target ni distancia al perfil completo.
  • Los porcentajes pueden inflarse por baselines bajos y no incluyen inferencia o intervalos.
  • No hay role-only, mismatched roles, random roles ni control contra estereotipos.
  • Las profesiones se eligen por congruencia, de modo que duplican pistas del target.
  • No se informa número, credenciales, acuerdo o adjudicación de los psicólogos que supuestamente seleccionan roles.
  • La presentación del anexo deja ambiguo si role categorization fue también un prompt de LLM.
  • Los recuentos RQ3 omiten o no explican el factor de tres roles.
  • No hay raw responses, resultados por run ni scoring reproducible.
  • Faltan seeds, órdenes, fallos, retries y timestamps.
  • Faltan namespaces, hashes y revisiones inmutables de modelos.
  • Dolphin 2.1/2.2.1 es inconsistente.
  • top_p/top_k parecen intercambiados, por lo que el decoding real es ambiguo.
  • No se informan versión de Transformers, text-generation-webui, AutoGen, loader, dtype, quantization o chat templates.
  • Las plantillas específicas por modelo añaden un confound no controlado.
  • Los modelos difieren simultáneamente en tamaño, arquitectura, base, alignment y datos.
  • No hay preregistro, power, intervalos, tests de modelo, equivalencia o multiplicidad.
  • Todo está en inglés y el pool StereoSet/profesiones puede reforzar estereotipos ocupacionales.
  • No existe validación conductual, humana, ecológica o convergente de los perfiles obtenidos.
  • La ausencia del código prometido impide verificar cálculos y decisiones de pipeline.

Qué no demuestra

  • No demuestra una personalidad, mente, identidad o footprint psicológico en los LLM.
  • No demuestra equivalencia entre NERIS/16Personalities y MBTI.
  • No demuestra awareness más allá de similitud con definiciones públicas.
  • No demuestra que ENFJ/J sea un rasgo intrínseco.
  • No demuestra que temperatura revele personalidad latente.
  • No demuestra control selectivo de perfiles Big Five.
  • No demuestra un efecto independiente de role conditioning.
  • No demuestra que los mappings profesión-personalidad sean válidos o libres de estereotipo.
  • No demuestra efectos causales de arquitectura, tamaño, alignment u openness.
  • No demuestra que se ejecutaran exactamente top_p=50/top_k=1 bajo la semántica declarada.
  • No demuestra N=30 por cada rol de RQ3.
  • No permite reproducir las cifras sin outputs, scoring, código y versions.
  • No generaliza a otros idiomas, instrumentos, checkpoints o conducta real.

Trazabilidad

Alcance: Texto completo

Versión: AAAI proceedings version, published 11 April 2025, 9 pages; audited with arXiv:2401.07115v3, revised 22 March 2025, 39-page extended version

Fuente consultada: https://doi.org/10.1609/aaai.v39i2.32125

Revisión: Codex complete bilingual fidelity pass using the full 9-page AAAI proceedings paper and 39-page arXiv v3 extended version, all-page visual inspection, official DOI/publication/version verification, construct comparison of NERIS and genuine MBTI, detailed table/repetition/parameter/model-version audit, prompt and role-control analysis, and current official/GitHub artifact searches; summaries written from full evidence rather than abstract keywords, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Mixtral-8x7B-Instruct-v0.1
  • Llama-2-13b-chat-hf
  • SOLAR-10.7B-Instruct-v1.0
  • Llama-3-8B-Instruct
  • Mistral-7B-Instruct-v0.1
  • Neural-chat-7b-v3-1
  • Dolphin-2.1-mistral-7b, with appendix link to Dolphin 2.2.1
  • Vicuna-7b-v1.5
  • Llama-2-7b-chat-hf
  • Falcon-7b-instruct
  • Gemma-1.1-7b-it
  • Phi-3-mini-4k-instruct

Instrumentos y métricas

  • 16Personalities NERIS Type Explorer 60-item public questionnaire, mislabelled as MBTI
  • Big Five Inventory 44-item questionnaire
  • all-mpnet-base-v2 cosine similarity
  • Lemmatized word-overlap ratio
  • Exact four-letter target classification frequency
  • Target BFI factor percentage increase
  • Personality-conditioned system prompts
  • Role-plus-personality-conditioned system prompts
  • Temperature comparison 0.01 versus 0.7

Datos utilizados

  • Sixty 16Personalities questions reproduced in arXiv Appendix C
  • Forty-four BFI items and scoring key reproduced in Appendices E-F
  • StereoSet-derived list of 120 profession labels
  • Aggregate tables and figures in the paper; raw model outputs not released

Evidencia y localización

  • Metadatos, alcance, RQs y resultados headline: AAAI proceedings pages 1355-1363; DOI 10.1609/aaai.v39i2.32125
  • Diseño, prompts, temperaturas, repeticiones y deployment: arXiv:2401.07115v3 pages 3-5, Sections 3.1-3.6 and Figures 1-3
  • RQ1 y RQ2 por modelo: arXiv v3 pages 6-8 and 19-28, Figures 4-5 and 6-23, Table 3
  • RQ3 roles y resultados: arXiv v3 pages 8 and 29-30, Tables 7-8
  • Limitaciones, ética y promesa de código: arXiv v3 page 9, Limitations, Ethics Statement and Transparency and reproducibility
  • Ítems, scoring BFI y referencias de personalidad: arXiv v3 pages 15-18 and 31-39, Appendices B-F, K-L
  • Diferencia entre NERIS y MBTI: Official 16Personalities Our Framework and Myers-Briggs Company official MBTI assessment pages, checked 16 July 2026
  • Semántica y defaults top_k/top_p: Official Hugging Face Transformers text-generation documentation; top_k default 50 and top_p default 1.0
  • Historial y cambio de autores: Official arXiv:2401.07115 submission history v1 13 January 2024, v2 23 June 2024, v3 22 March 2025
  • Ausencia de artefacto oficial localizable: Official AAAI/arXiv/current author publication links plus exact-title and arXiv-ID GitHub repository/code searches on 16 July 2026
  • Auditoría integral de constructo, método y reproducibilidad: reports/verification/article-205-open-models-personality-validity-and-reproducibility-audit.json
  • Inspección visual completa: All 9 AAAI pages and all 39 arXiv v3 pages rendered and visually inspected on 16 July 2026