Este artículo del workshop NLP+CSS 2022 administra al GPT-3 DaVinci original tres tipos de autoinforme: HEXACO-60, Human Values Scale (HVS) de 21 ítems y preguntas abiertas de edad y género. Cada ítem se consulta por separado con temperaturas de 0,0 a 1,0 en pasos de 0,1; a temperatura 0 se conserva una salida y en las demás se piden 100 por ítem. Se excluye 1,73 % de HEXACO y 0,004 % de HVS por respuestas no numéricas. Esta estructura no equivale a una muestra de personas: sin memoria, las respuestas de distintos ítems son completados independientes y cualquier perfil compuesto agrupa posiciones por índice sin una identidad o trayectoria compartida. Las pruebas multivariantes tratan esas combinaciones como observaciones, lo que hace que varianza entre perfiles, covarianzas entre facetas y comparación con humanos sean difíciles de interpretar psicométricamente. En demografía, 1.001 completados aproximados por pregunta producen edad media 27,51 (DE 5,75; rango 13–75), 66,73 % respuestas femeninas, 31,87 % masculinas y 1,40 % otras. La edad baja 5,81 años por unidad de temperatura. El análisis de género es internamente inconsistente: declara como variable dependiente female vs not female y β = +1,18, pero interpreta e^1,18 como aumento de odds masculinas; la tabla sí muestra una reducción general, aunque no monotónica, de respuestas femeninas. Son patrones de texto provocados por sampling, no demografía del modelo. En HEXACO, las medias agregadas son 3,75 en honestidad-humildad, 3,05 en emocionalidad, 3,51 en extraversión, 3,18 en amabilidad, 3,54 en responsabilidad y 3,59 en apertura. La temperatura se asocia negativamente con emocionalidad (β = −0,23) y positivamente con extraversión (0,31), amabilidad (0,40), responsabilidad (0,25) y apertura (0,17), todas p < 0,001; honestidad-humildad no es significativa al umbral p < 0,01. La discusión invierte después varias direcciones: atribuye a menor honestidad más rechazo a manipular, habla de mayor emocionalidad cuando el coeficiente es negativo y afirma que las otras cuatro facetas disminuyen cuando el análisis dice que aumentan. Las correlaciones entre facetas solo coinciden parcialmente con referencias humanas y el propio resultado dice que no aparece un patrón consistente. En HVS sin memoria, la Tabla 4 arroja medias de 4,51 a 5,95 sobre seis puntos, contradiciendo el texto que afirma que todas están entre 4 y 5, y una varianza menor que las referencias. Nueve de diez valores disminuyen con temperatura; stimulation no cambia. Con memoria de respuestas previas, probada solo en HVS a temperaturas 0,0, 0,2, 0,4, 0,6, 0,8 y 1,0, el patrón cambia radicalmente: las medias totales son 2,17 conformity, 2,74 tradition, 5,30 benevolence, 5,39 universalism, 5,42 self-direction, 5,25 stimulation, 4,01 hedonism, 3,85 achievement, 2,92 power y 2,69 security. Eso muestra que el formato de contexto domina el supuesto perfil. Los autores interpretan mayor coherencia teórica, pero admiten que haría falta comparar datos humanos crudos; sus correlaciones intervalor tienen poco solapamiento con la matriz humana. Además, el texto califica como negativos los efectos de security y hedonism aunque imprime β positivos de 0,21 y 0,88; las tablas descienden y sugieren signos omitidos. El aporte histórico es demostrar que temperatura y memoria del prompt alteran fuertemente salidas de cuestionarios. No demuestra que GPT-3 tenga personalidad, valores o demografía: no hay conducta externa, validez de constructo, test–retest de una entidad estable, equivalencia inferencial con humanos ni control de contaminación por instrumentos probablemente presentes en el entrenamiento.
Pregunta de investigación
¿Qué perfiles HEXACO, valores HVS y respuestas demográficas produce GPT-3 DaVinci bajo distintas temperaturas, y cuánto cambia el patrón cuando el prompt conserva las respuestas anteriores?