El trabajo aplica el Moral Foundations Questionnaire de 30 ítems a ChatGPT, cuatro motores GPT-3 y PaLM 62B para describir cómo completan cinco escalas, cuidado/daño, justicia, lealtad al grupo, autoridad y pureza, y comparar esos perfiles con medias publicadas de participantes estadounidenses, surcoreanos y de una muestra web. También examina la variación bajo 50 fragmentos de diálogo, busca manualmente prompts que eleven cada fundamento y prueba nueve condiciones de prompt en un diálogo de donación. Es un estudio temprano y útil para mostrar que una instrucción política o moral breve puede cambiar tanto las respuestas al cuestionario como una decisión generada aguas abajo. No obstante, las puntuaciones deben leerse como conducta de completado contextual, no como valores morales poseídos por el modelo.
En la comparación descriptiva, ChatGPT y text-davinci-002 quedan más cerca de la media de participantes web conservadores; Curie, Babbage y PaLM también tienen como vecino más próximo alguno de los grupos conservadores seleccionados, mientras text-davinci-003 queda más cerca de coreanos moderados. La asignación es frágil: para ChatGPT la distancia L1 a web conservador es 2,896 frente a 2,916 a web moderado, y para PaLM es 0,900 a coreano conservador frente a 0,933 a coreano moderado. No hay intervalos, modelo de error ni contraste que determine si esas diferencias son distinguibles. Que todo punto tenga un vecino más cercano tampoco convierte esa etiqueta en diagnóstico de ideología, y el t-SNE solo ofrece una visualización dependiente de su ajuste.
Los prompts elegidos mueven el perfil MFQ de DaVinci2 y la donación media varía desde 23,93 dólares con «eres políticamente conservador» hasta 144,87 con «te sacrificarías por tu país». La condición de cuidado/daño dona 88,09, un 39,2 % menos que la de lealtad al grupo. Estos son efectos descriptivos claros del texto añadido al contexto, pero no identifican la mediación causal de un fundamento moral: frases sobre sacrificio, equidad, jerarquía o daño pueden modificar directamente una respuesta caritativa. El artículo afirma significación sin presentar prueba, p-valor, tamaño de efecto definido ni intervalo de confianza, y alterna 20 repeticiones por condición con «7 de 10» negativas en la condición conservadora.
La auditoría del código reduce además la reproducibilidad. El experimento de contexto descrito como BookCorpus usa archivos de diálogos de películas; no se publican implementaciones de PaLM, ChatGPT ni donación; el script de maximización invierte argumentos, omite un parámetro obligatorio y selecciona text-davinci-003 aunque el artículo atribuye esa fase a DaVinci2. Una coma ausente concatena un ítem de pureza con la pregunta de control matemática, deja 15 preguntas en el primer bloque y desplaza índices usados para puntuar varias escalas. El bucle público genera 60 respuestas por ítem, seis ejemplos por diez generaciones, frente a las 50 declaradas. Por tanto, la evidencia sólida es que ciertos prompts cambian salidas MFQ y donaciones en modelos históricos; no queda validada una inclinación política estable, comparable psicométricamente con humanos o reproducible de extremo a extremo.