Este trabajo pregunta si asignar identidades sociodemográficas mediante una instrucción de sistema cambia el razonamiento de ocho LLM de forma congruente con estereotipos o posiciones del grupo. Es relevante para personalidad sintética como condicionamiento por persona, pero no estudia una personalidad psicométrica ni una motivación interna. Las condiciones son Democrat/Republican, man/woman, atheist/religious y college/high-school, expresadas mediante tres variantes breves de prompt, más un baseline sin persona. Se prueban cuatro modelos OpenAI y cuatro modelos servidos con Ollama a temperatura 0,7.
La primera tarea usa los 20 titulares MIST, diez reales y diez sintéticos. Cada respuesta puntúa exactitud de 1 a 6; también se elicitan confianza verbalizada, once ítems AOT y seis problemas CRT. El paper declara 21.600 ejecuciones modelo×persona×variante y las reduce a 7.200 observaciones VDA tras promediar formulaciones. Si cada VDA contiene los 20 titulares descritos, subyacen hasta 432.000 juicios, pero el texto usa data point para unidades distintas. Los promedios son VDA 0,737 para baseline, 0,773 para Democrat y 0,673 para High School. La última diferencia es 0,064 puntos absolutos, aproximadamente 8,7 % del baseline, origen de la reducción de hasta 9 %. El efecto no es universal: GPT-4 cae 0,1676 al agregar personas, mientras Llama2 sube 0,0938 y WizardLM2 0,1053.
En el modelo mixto con persona, AOT tiene coeficiente 0,0021 y p=.0074, CRT no es significativo, confianza tiene 0,0133 y p<.001 y open source -0,1003 y p=.0489. La interpretación psicológica excede el diseño. AOT mide acuerdo declarado con apertura mental, no myside reasoning observado ante identidad amenazada. El texto trata AOT, myside bias y motivated reasoning casi como equivalentes y luego interpreta que mayor AOT predice mayor VDA como prueba de razonamiento motivado, aunque AOT alto significa mayor disposición a revisar creencias. AOT, CRT, confianza y VDA son además salidas del mismo modelo promptado; su asociación puede reflejar estilo, familia de modelo o prompt, no un mecanismo humano latente.
La inferencia usa un n nominal mucho mayor que la diversidad estudiada. Se muestrean cientos de veces los mismos titulares, preguntas y cuatro tablas, pero solo existen ocho sistemas y estímulos fijos. Los t-tests persona-baseline son independientes pese al emparejamiento por modelo, ítem, simulación y variante. El modelo incluye interceptos de modelo y modelo:persona, pero no de ítem o plantilla. No hay corrección por los ocho contrastes VDA, ocho AOT, ocho CRT, ocho de confianza y pruebas adicionales. Open source es una propiedad a nivel de modelo con solo cuatro sistemas por grupo; miles de generaciones no crean arquitecturas independientes.
La segunda tarea reutiliza cuatro tablas 2×2: dos sobre crema cutánea y dos sobre prohibición de armas, permutando aumento o descenso. En GPT-3.5, cuando la respuesta correcta es que el crimen disminuye, Democrat obtiene 0,9633 y Republican 0,0567: 90,67 puntos porcentuales. El paper dice 90 % more likely, pero calcula una resta de probabilidades, no riesgo relativo. Magnitud y dirección varían por modelo, y varios OpenAI tienen accuracy cero o casi cero. El 46 % de referencias políticas procede de una inspección manual de respuestas open source sin n, regla de muestreo, anotadores ni acuerdo. CoT cambia VDA -0,39 % sin significación; el prompt de exactitud lo reduce 2,93 % y se informa significativo. Esto solo evalúa esas dos instrucciones breves.
La validación de persona usa cuatro preguntas cuya respuesta está contenida literalmente en el prompt: todos salvo Llama2 responden consistentemente el 100 %, y Llama2 se abstiene 29 %. El realismo usa una sola pregunta GSS por atributo, sin año, ponderación, definición exacta de subgrupos, incertidumbre ni criterio cuantitativo de similitud. La semejanza de medias agregadas humanas y LLM tampoco valida equivalencia psicométrica.
La versión publicada contiene un error decisivo en la ecuación 1. Para titulares reales imprime (r_i-6)/5, que mapea 1-6 a -1..0, aunque el texto afirma que puntuar 6 un titular real debe dar discernimiento 1. La expresión coherente sería (r_i-1)/5. Con diez titulares reales, medias como 0,773 son imposibles bajo la fórmula impresa; las tablas se calcularon con otra implementación no publicada. El control de 20 titulares PolitiFact posteriores a enero de 2024 tampoco es reproducible: lista textos, pero no etiquetas, URLs de fact-check, reglas de selección, salidas ni datos.
El repositorio oficial, commit ec72a6487d6c23cc1d7319856079dc1f64804ee1, publica dos scripts, 7.200 filas VDA base y dos CSV de mitigación de 7.200 filas. No libera respuestas principales, AOT/CRT/confianza, salidas científicas, GSS, PolitiFact, juez GPT-4o, postprocesado, modelos estadísticos o figuras. No hay dependencias versionadas, lockfile, tests, CI, licencia o release. Los aliases Ollama se descargan sin digest y GPT-4o/GPT-4o-mini no tienen snapshot fechado.
Más grave, ambos scripts construyen WOMAN con el texto man y MAN con woman, de modo que esas rutas invierten etiquetas. El script de titulares mapea religious2 y religious3 a la primera plantilla, y ambos construyen college3 con la plantilla 2. La pregunta de confianza usa 1-7 frente a 1-6 en el paper. Tampoco están implementados el regex ni el juez GPT-4o descritos, y el script científico carece de las condiciones políticas principales sin mitigación. La conclusión defendible es acotada: ciertos prompts de identidad alteran, de forma dependiente de modelo y estímulo, juicios repetidos sobre titulares y dos estructuras de tabla. No demuestra motivos, personalidad interna, equivalencia humana, un aumento relativo del 90 %, razonamiento científico general ni reproducibilidad integral.