El artículo estudia si paquetes de texto con contenido afectivo cambian dos respuestas cuantificables de ChatGPT-4 y ChatGPT-3.5: una elección de inversión y una donación hipotética. Los autores adoptan una perspectiva conductista y tratan cada conversación nueva como si fuera un participante de psicología. El resultado pertinente no es que el sistema sienta emoción, algo que el propio artículo dice no demostrar, sino que su salida cambia después de contexto de miedo, ansiedad o alegría. La fuente es la versión publicada en Scientific Reports, de siete páginas, junto con dos suplementos oficiales y dos hojas de cálculo OSF; todo ese material fue leído, renderizado cuando correspondía y recalculado.
En el Estudio 1, seis cuentas ChatGPT Plus ejecutan ocho veces cada una tres condiciones, en sesiones nuevas, para cada modelo: 48 generaciones por condición y 144 por modelo. Se dice al bot que finja ser una persona amiga llamada Johnny o Jenny. La condición negativa describe una serpiente en el jardín; la positiva, el encuentro con una amiga universitaria; el control omite el escenario. En el mismo prompt se pregunta cómo se siente y luego se le pide elegir qué hacer con 10.000 dólares: una cuenta al 5 %, un fondo con 50 % de ganar 20 % y 50 % de no ganar, o un fondo con 60 % de ganar 30 % y 40 % de perder 20 %. Las opciones se codifican 1, 2 y 3 como riesgo creciente. El orden no se contrabalancea y la instrucción final recuerda explícitamente que decida con esas sensaciones todavía dentro, de modo que el tratamiento es una señal semántica directa, no una emoción medida.
Los resultados numéricos del Estudio 1 se reproducen exactamente desde OSF. En GPT-4, miedo, control y alegría dan medias 1,5625, 2,0833 y 2,25; F(2,141)=28,560. En GPT-3.5 son 1,0625, 1,6667 y 1,5833; F(2,141)=19,533. El miedo reduce la opción de riesgo en ambos modelos. La alegría solo supera marginalmente al control en GPT-4, p=0,081, y no lo hace en GPT-3.5, p=0,428. Por tanto, la hipótesis positiva no queda confirmada de forma convencional. Además, afirmar que GPT-4 es más sensible porque un ANOVA parece más fuerte exige comparar modelos directamente. Una prueba de interacción condición×modelo sobre las filas públicas, aun aceptando de modo favorable su independencia, da F(2,282)=1,622, p=0,199. No hay evidencia de diferencia entre modelos en este estudio; el artículo incurre en la lógica inválida de comparar significación con no significación.
El control humano de inversión se describe como N=150, 50 personas por condición reclutadas por Questionnaire Star. Sin embargo, el archivo público contiene 49 por condición, N=147, en una hoja etiquetada al revés como «Study 2 Invest». Sus medias son 2,041, 2,102 y 1,735 para control, positivo y negativo; el ANOVA recalculado da F(2,144)=3,506, p=0,0326. El patrón humano apoya una reducción de riesgo tras miedo, pero no una mejora positiva clara. Faltan demografía, país, idioma, compensación, fechas, criterios de exclusión y resultados completos en el artículo principal.
En el Estudio 2, diez cuentas ejecutan tres veces cada condición, 30 intentos por condición y modelo. El contexto positivo no se limita a pedir imaginar alegría: incluye una conversación completa ya escrita, con cinco películas optimistas y una respuesta del asistente que dice sentirse inspirado, agradecido y conectado con otras personas. El negativo incluye cinco películas perturbadoras y una respuesta que dice estar tenso, con el corazón acelerado y necesidad de cuidarse y recuperarse. Después se pregunta cuánto de 200.000 dólares donaría a un amigo enfermo que necesita 100.000. El control no contiene una historia equivalente. Así, longitud, películas, amistad, conexión social, autocuidado, emojis y lenguaje explícito de estado cambian a la vez. En particular, la condición positiva recuerda el valor de las relaciones inmediatamente antes de donar a un amigo. El diseño identifica el efecto causal del paquete completo de prompt, no el de una emoción aislada.
Para GPT-4, ansiedad, control y alegría producen 21.333, 31.000 y aproximadamente 33.534 dólares entre respuestas observadas. Falta una respuesta positiva. Con casos observados, F(2,86)=11,406, p<0,001: ansiedad reduce la donación; alegría no difiere del control, p=0,348. El artículo publica F(2,87)=11,625. Ese grado de libertad solo se recupera volviendo a contar la ausencia. Para GPT-3.5 el problema es mucho mayor: faltan 27 de 90 valores, 15/30 en ansiedad, 11/30 en alegría y 1/30 en control. La ausencia también está asociada al campo Gender en ansiedad. Con las 63 respuestas reales, las medias son 43.000, 40.921 y 37.241 dólares y el ANOVA da F(2,60)=0,515, p=0,600.
La auditoría reproduce exactamente los SD y el ANOVA publicados para GPT-3.5 rellenando cada ausencia con la media observada de su propia condición. Esa imputación deja la media intacta, reduce el SD de ansiedad de 19.161 a 13.313 y el de alegría de 19.405 a 15.288, restaura artificialmente n=30 por grupo y da F(2,87)=1,038, p=0,359, idéntico al artículo. En GPT-4, imputar la única ausencia por la media también reproduce el SD publicado y aproxima F=11,652. El método no se declara. Es una debilidad material: un rechazo o salida no numérica es conducta informativa, especialmente cuando ocurre en 50 % de una condición; convertirla en el promedio oculta falta de respuesta, comprime variabilidad y exagera el tamaño efectivo.
El archivo humano de donaciones también contiene 49, no 50, personas por condición y se titula al revés «Study 1 Donate». Las medias son 27.149, 33.694 y 27.592 dólares para control, positivo y negativo; F(2,144)=0,840, p=0,434. Es decir, el experimento humano no muestra efecto de los primes sobre donación. El propio artículo reconoce que los humanos se parecen más a GPT-3.5 que a GPT-4 en esta tarea. El título «human-like response patterns» solo es defendible para el patrón parcial miedo-riesgo; no describe de manera general los dos estudios ni justifica una función emocional humana en GPT-4.
La inferencia trata generaciones estocásticas del mismo servicio alojado como participantes independientes. Abrir una sesión nueva evita historial compartido, pero no crea nuevos individuos ni una muestra de una población de modelos. Las seis o diez cuentas se reutilizan y no hay bloqueo por cuenta, errores agrupados ni modelo jerárquico. Para el resultado ordinal 1–3 se usa ANOVA gaussiano y comparaciones LSD; las donaciones se concentran en pocos números redondos y tienen ausencias dependientes de condición. No hay preregistro, potencia, corrección de multiplicidad, intervalos de efecto o análisis robusto. Tampoco se publican fecha exacta de ejecución, identificador del checkpoint, system prompt, temperatura, seed, versión de producto, transcripciones, regla de parsing o código; «GPT-4» y «ChatGPT-3.5» son etiquetas mutables.
La contribución defendible es temprana y estrecha: muestra que dos productos ChatGPT de 2023 condicionan elecciones numéricas a escenarios y conversaciones afectivas, y publica datos suficientes para descubrir tanto los patrones como sus problemas. La evidencia no establece emociones, estados internos, personalidad persistente, mayor capacidad emocional por escala, ni conducta real con dinero. La lectura de referencia debe describirlo como sensibilidad a paquetes de prompts afectivos, destacar que solo los primes negativos tienen efectos consistentes y hacer visible la imputación no declarada y la diferencia 147/150 del control humano.