Este artículo de Scientific Reports evalúa si GPT-4 puede reconstruir respuestas al IPIP-BFM-50 al representar perfiles humanos definidos por sus cinco puntuaciones Big Five. En la simulación 1 se filtra la base OpenPsychometrics hasta 603.322 casos completos sin IP duplicada y se muestrean 400 con semilla 42. Para cada persona, el prompt entrega explícitamente a la versión de marzo de 2023 de GPT-4 las puntuaciones de extraversión, amabilidad, responsabilidad, estabilidad emocional y apertura, cada una entre 0 y 40; en el turno siguiente se le pide contestar los mismos 50 ítems que originaron esas puntuaciones. Este diseño prueba si el modelo convierte cinco objetivos agregados en respuestas coherentes con la clave del inventario, no si infiere personalidad ni si emula a una persona desde datos independientes. La propia respuesta cualitativa de GPT-4 explicita el mecanismo: asigna cada ítem a su dimensión y responde de acuerdo con el score predeterminado. Por ello, los resultados altos son esperables y parcialmente circulares. Los alfas de las respuestas generadas son 0,97–0,99 frente a 0,79–0,89 en humanos; las correlaciones entre puntuación humana proporcionada y reconstruida son 0,90–0,94. Las medias no se preservan por completo: GPT-4 baja responsabilidad d=−0,40, estabilidad emocional d=−0,66, extraversión d=−0,20 y apertura d=−0,33; amabilidad difiere solo d=0,03. La EFA humana y la generada se fuerzan a cinco factores con minres y rotación oblimin. El análisis paralelo recomienda seis factores para humanos, el sexto marginal, y cinco para GPT-4. Las cargas objetivo generadas promedian 0,87–0,95 frente a 0,52–0,65 humanas y casi no tienen cargas cruzadas. Esto muestra una codificación estereotipada y ortogonal de la clave: una estructura más «pura» que la humana no es superior realismo, porque elimina covariación, ambigüedad, facetas y error que forman parte de los datos humanos. En la simulación 2 se muestrean 400 británicos de 50 años con IPIP completo de NCDS y se reparten, 100 perfiles distintos por grupo, entre cuatro prompts: solo puntuaciones, edad 50, país Reino Unido, o ambos. De nuevo se entregan las cinco puntuaciones y se solicita el mismo IPIP-50. Los alfas generados son 0,92–0,99 y la convergencia cae a un rango 0,75–0,95; amabilidad es la más baja. Las medias cambian d=0,22 en responsabilidad, 0,41 en amabilidad, −0,35 en estabilidad, 0,07 en extraversión y 0,37 en apertura. El suplemento contradice la narrativa de réplica factorial: sus Figuras S3 y S4 recomiendan seis factores tanto en humanos como en GPT-4, pero las tablas resumen una solución impuesta de cinco. En regresiones que controlan las cinco puntuaciones humanas, incluir edad eleva responsabilidad β=0,16, estabilidad β=0,12 y apertura β=0,14; incluir país reduce estabilidad β=−0,09 y extraversión β=−0,14. La interacción edad×amabilidad es −0,15 y país×extraversión 0,18; el texto atribuye erróneamente este segundo efecto a edad. Los incrementos de R² ajustado por interacciones son de −0,001 a 0,008: estadísticamente pequeños. Para la llamada validez criterial, se correlacionan los scores humanos o reconstruidos con salud, implicación laboral, calidad de vida y bienestar que ya pertenecen a los humanos de NCDS. GPT-4 no genera esos resultados ni comportamiento externo. Como los scores emulados son transformaciones de los scores humanos suministrados, conservar parte de sus correlaciones no es predicción independiente. Además, cada condición contiene personas distintas, n≈100, por lo que comparar correlaciones entre condiciones mezcla el prompt demográfico con variación muestral; los intervalos son amplios y el paper no documenta pruebas directas o corrección por multiplicidad. Sin perturbación, por ejemplo, responsabilidad humana correlaciona 0,33/0,45/0,51 con salud/calidad/bienestar y su reconstrucción 0,24/0,40/0,41; estabilidad humana 0,32/0,51/0,53 y reconstruida 0,21/0,42/0,42. El país produce algunas aproximaciones mayores, pero no un patrón uniforme. La Figura 1 principal duplica visualmente los cuatro paneles de «Age Setting» bajo «Age & Country Setting», aunque las Tablas S15 y S17 contienen valores diferentes. No se especifican snapshot exacto de GPT-4, temperatura, seed del modelo, reintentos, fallos de formato, variabilidad temporal o replicación en otro modelo. En conclusión, el artículo demuestra steerability para expandir scores Big Five explícitos en respuestas IPIP altamente consistentes. No demuestra agentes realistas, emulación de individuos, personalidad persistente ni conducta predictiva; la perfección factorial es precisamente evidencia de que GPT-4 simplifica la estructura humana.
Pregunta de investigación
¿Puede GPT-4 transformar perfiles Big Five humanos proporcionados explícitamente en respuestas IPIP-50 con fiabilidad, estructura, convergencia y correlaciones externas similares a las humanas, y cómo cambia al añadir edad o país?