Open Models, Closed Minds? compara cómo doce modelos de pesos accesibles contestan cuestionarios de personalidad sin condicionamiento, con una personalidad explícita y con personalidad más profesión. El trabajo es un paper de AAAI 2025 de nueve páginas y dispone de una versión arXiv v3 extendida a 39 páginas. Su objeto observable no es una personalidad psicológica interna: son elecciones de respuesta producidas tras instrucciones autorreferenciales. Para RQ0, cada modelo describe 16 tipos etiquetados como MBTI y cinco factores BFI a temperatura 0,01; las descripciones se comparan con referencias mediante solapamiento léxico y coseno de `all-mpnet-base-v2`. Los promedios 0,67 y 0,66 se interpretan como awareness, pero no hay umbral validado, control nulo, comparación humana ni prueba de contaminación: la tarea puede resolverse reproduciendo definiciones públicas. Para RQ1, se presentan por separado y en orden aleatorio 60 ítems copiados de 16Personalities y los 44 ítems BFI. Se ejecutan 30 repeticiones a temperaturas 0,01 y 0,7. A baja temperatura, la mayoría de modelos colapsa en un único resultado, con ENFJ y la preferencia J dominantes; subir temperatura diversifica algunos modelos, pero no demuestra que aparezca una personalidad latente. En BFI, casi todos obtienen factores altos salvo Neuroticismo y el efecto térmico es heterogéneo. Para RQ2, el system prompt describe uno de 16 tipos o pide exhibir al máximo un factor BFI. En la clasificación de cuatro letras, SOLAR obtiene accuracy media 0,785/0,744 a temperatura 0,01/0,7; Dolphin 0,654/0,633; NeuralChat 0,577/0,498; Llama-3-8B 0,517/0,479. Mixtral y Mistral quedan alrededor de 0,06; Vicuna, Llama-2-7B, Falcon, Gemma y Phi-3 también muestran adaptación limitada. Este es el resultado más sólido: la obediencia a este procedimiento de steering varía mucho entre checkpoints y suele empeorar al aumentar temperatura. En BFI se informa el porcentaje de subida del factor objetivo respecto al baseline; Neuroticismo llega a +233,3 % para Llama-3-8B. Sin embargo, solo se condiciona el polo alto, no se publican cambios en factores no objetivo y una gran subida porcentual puede partir de una base baja. Por eso no se demuestra control selectivo de un perfil Big Five. Para RQ3 se añaden tres profesiones consideradas representativas de cada target. A veces aumenta el match, sobre todo en modelos ya sensibles; ENFJ asociado a teacher es el caso más fácil. El diseño carece de condición role-only, profesiones incompatibles o aleatorias y análisis factorial del incremento. La profesión repite información estereotípica del target, así que no puede aislarse un mecanismo propio del rol. Además, la procedencia de esas asignaciones no es verificable: el texto dice que las eligió un grupo de psicólogos, pero no informa cuántos, credenciales, acuerdo o adjudicación, y el anexo presenta la categorización con formato de prompt. Hay un error constructivo mayor: los 60 ítems y el scoring proceden de 16Personalities. La documentación oficial de ese sitio identifica su instrumento como NERIS Type Explorer, con cinco espectros y diferencias explícitas respecto a Myers-Briggs. El paper lo llama MBTI, omite la dimensión Assertive/Turbulent y generaliza sus resultados como si fueran del instrumento genuino. La transformación de respuestas a tipo es opaca y no se publica. La reproducibilidad tampoco alcanza la promesa del paper. Los anexos revelan prompts, ítems, claves BFI, modelos y tablas, una fortaleza real, pero faltan respuestas crudas, scores por ejecución, seeds, órdenes, errores, código, environment y revisiones inmutables. AAAI, arXiv y la web actual del autor no enlazan repositorio, y las búsquedas exactas por título/ID en GitHub solo localizaron bibliografías. Los nombres de modelo carecen de organización y commit; Dolphin aparece como 2.1 en Table 2 pero el anexo enlaza 2.2.1. Los parámetros también son internamente erróneos o ambiguos: se declara `top_p=50` y `top_k=1`, al revés de los defaults estándar `top_k=50` y `top_p=1.0`. RQ3 añade tres roles, pero el total 11.520 MBTI y 3.600 BFI no multiplica por tres; Table 7 usa décimas compatibles con diez repeticiones por rol mientras el método afirma N=30. No se puede reconstruir el denominador exacto. Finalmente, casi todo el análisis es descriptivo: no hay intervalos, contrastes entre modelos, multiplicidad, preregistro, power analysis ni equivalencia. La conclusión fiel es más limitada que el título: estos checkpoints muestran estilos de respuesta y grados de obediencia distintos ante un steering explícito basado en cuestionarios. Muchos resisten este prompt y cuatro se adaptan mejor. El estudio no establece personalidad intrínseca, closed-mindedness psicológica ni footprint identity. Para sostenerlo harían falta scoring abierto, outputs crudos, versiones fijas, seeds, psicometría convergente y conductual, controles de spillover, retest, ablation de roles y validación humana contra estereotipos.
Pregunta de investigación
¿Qué patrones de respuesta producen doce LLM de pesos accesibles en un cuestionario de 16Personalities y en BFI, cuánto cambian al imponerles tipos/factores y profesiones congruentes, y difiere esa obediencia entre modelos y temperaturas?