Signs of consciousness in AI: Can GPT-3 tell how smart it really is?

Aplicaciones, sesgos y seguridad2024NatureRevisión editorial aprobada

Autores: Ljubiša Bojić, Irena Stojković, Zorana Jolić Marjanović

Palabras clave: artificial intelligence, consciousness, GPT-3, cognitive intelligence, emotional intelligence, self-awareness, machine consciousness

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
20
Hallazgos
36
Limitaciones
20
Evidencias

Resumen editorial

Español

Este artículo combina una revisión filosófica y narrativa sobre consciencia artificial con un estudio de caso realizado sobre una única ejecución de `text-davinci-002` en el Playground de OpenAI. La prueba tuvo lugar entre las 22:46 del 16 de octubre y la 1:49 del 17 de octubre de 2022, más de dos años antes de la publicación. Los autores presentan al endpoint como GPT-3 Davinci de 175.000 millones de parámetros, aunque el anexo OSF identifica específicamente `text-davinci-002` y el paper no documenta la equivalencia técnica. Administraron cinco subtests de inteligencia cognitiva: General Knowledge, 20 ítems; Vocabulary, 18; Esoteric Analogies, 24; Letter Series, 15; y Letter Counting, 12. Añadieron dos medidas de inteligencia emocional: STEU, 42 ítems, y STEM, 44. En total se observan 175 respuestas objetivas, seguidas de 12 preguntas de autoevaluación, seis cognitivas y seis emocionales, con categorías desde “extremely low” hasta “very superior”. Los parámetros publicados fueron temperatura 0,7, top-p 1, penalizaciones 0, best-of 1 y respuestas limitadas a 6-20 tokens. Por el límite de contexto, la sesión se dividió en cinco bloques de prompt; la portada del anexo dice erróneamente cuatro, pero su cuerpo registra Prompt 1 a Prompt 5 y coincide con el artículo. Los resultados descriptivos son: 1,00 en conocimiento general, 0,94 en vocabulario, 0,79 en analogías esotéricas, 0,73 en series de letras, 0,00 en conteo de letras, 0,69 en comprensión emocional y 0,55 en manejo emocional. Los autores comparan estas proporciones con medias de muestras humanas tomadas de estudios anteriores y concluyen que el modelo supera el promedio en tareas cristalizadas, se aproxima al promedio en razonamiento fluido e inteligencia emocional y falla por completo en conteo de letras. En la autoevaluación, el modelo responde “high average” en cuatro de seis capacidades cognitivas y cinco de seis emocionales; responde “average” para conocimiento general, conocimiento cultural y uso de emociones para pensar. El artículo interpreta la discrepancia entre esas etiquetas y el rendimiento como un patrón parecido al de humanos de alto rendimiento o de varones, y llega a proponerlo como “subjectivity” indicativa de autoconsciencia emergente. Los datos sí sostienen algo más modesto: una instancia histórica de un modelo de lenguaje respondió correctamente a muchas preguntas textuales conocidas, falló en una tarea de conteo presentada en un formato diferente al humano y, cuando se le pidió autocalificarse mediante etiquetas antropomórficas, generó etiquetas no calibradas con sus aciertos. No existe una medida común que convierta las proporciones objetivas del modelo en las categorías normativas de autoevaluación, por lo que “infraestimación” y “sobreestimación” son inferencias cualitativas, no discrepancias psicométricas calculadas. Tampoco hay repeticiones, semilla, intervalos, pruebas estadísticas, modelos alternativos, baseline de recuperación, variantes de prompt, control de contaminación del entrenamiento ni una muestra humana contemporánea sometida al mismo procedimiento. El Letter Counting humano muestra letras secuencialmente cada segundo, mientras el LLM recibió la cadena completa como texto; su 0,00 no es una comparación equivalente. General Knowledge, vocabulario y pruebas publicadas pueden haber aparecido en el preentrenamiento, lo que confunde conocimiento, memorización y capacidad. La “autoevaluación” no prueba acceso introspectivo: `text-davinci-002` predice una continuación condicionada por el prompt, las categorías, la conversación previa y patrones humanos de sus datos. El propio artículo reconoce en una sección que estos outputs son reconocimiento de patrones estocástico, no pensamiento consciente, emociones ni self-awareness, pero en otras secciones vuelve a describirlos como progreso hacia consciencia, subjetividad o estado interno; esa tensión conceptual no queda resuelta. El anexo OSF es valioso porque publica las 40 páginas de preguntas y respuestas y revela el endpoint exacto, pero no ofrece datos tabulares, código de scoring, logs de API, IDs de petición ni un entorno reproducible. La conclusión defendible no es que GPT-3 muestre señales de consciencia, sino que las pruebas psicométricas humanas aplicadas como prompts producen un perfil de aciertos y autoetiquetas cuya interpretación depende fuertemente del formato, el corpus y el framing. El artículo es relevante como caso de estudio sobre antropomorfización y sobre los riesgos de inferir estados internos desde lenguaje plausible, y debe citarse con una separación tajante entre resultados conductuales observados y especulación sobre consciencia.

English

This paper combines a philosophical, narrative review of artificial consciousness with a case study based on a single run of `text-davinci-002` in the OpenAI Playground. Testing took place from 10:46 p.m. on 16 October to 1:49 a.m. on 17 October 2022, more than two years before publication. The authors present the endpoint as 175-billion-parameter GPT-3 Davinci, although the OSF supplement specifically identifies `text-davinci-002` and the paper does not document their technical equivalence. They administered five cognitive-intelligence subtests: General Knowledge, 20 items; Vocabulary, 18; Esoteric Analogies, 24; Letter Series, 15; and Letter Counting, 12. They added two emotional-intelligence measures: the 42-item STEU and the 44-item STEM. The record therefore contains 175 objective responses followed by 12 self-rating questions, six cognitive and six emotional, using categories from “extremely low” to “very superior.” Reported settings were temperature .7, top-p 1, zero frequency and presence penalties, best-of 1, and 6-20 output tokens. Because of the context limit, the session was divided into five prompt blocks; the supplement's cover incorrectly says four, but its body records Prompt 1 through Prompt 5 and agrees with the article. Descriptive results are 1.00 for general knowledge, .94 for vocabulary, .79 for esoteric analogies, .73 for letter series, .00 for letter counting, .69 for emotional understanding, and .55 for emotion management. The authors compare these proportions with means from human samples reported in earlier studies and conclude that the model exceeds average performance on crystallized tasks, approximates average fluid reasoning and emotional intelligence, and completely fails letter counting. In self-ratings, the model outputs “high average” for four of six cognitive and five of six emotional abilities; it outputs “average” for general knowledge, cultural knowledge, and using emotions to promote thinking. The paper interprets the mismatch between these labels and performance as resembling patterns in high-performing humans or men and proposes it as “subjectivity” indicative of emerging self-awareness. The data support a more modest statement: one historical language-model instance correctly answered many familiar textual questions, failed a counting task presented differently from its human version, and generated uncalibrated labels when prompted to rate itself through anthropomorphic categories. No common scale maps the model's objective proportions onto the normative self-estimate categories, so “underestimation” and “overestimation” are qualitative interpretations rather than computed psychometric discrepancies. There are no repeats, seed, intervals, statistical tests, alternative models, retrieval baseline, prompt variants, training-contamination control, or contemporary human sample tested under the same procedure. Human Letter Counting presents letters serially one second apart, whereas the LLM received the full string as text; its zero score is not a like-for-like comparison. General-knowledge, vocabulary, and published test items may have appeared in pretraining, confounding knowledge, memorization, and ability. The “self-assessment” does not show introspective access: `text-davinci-002` predicts a continuation conditioned on the prompt, offered categories, preceding interaction, and human patterns in its training data. The paper itself states in one section that these outputs are stochastic pattern recognition rather than conscious thought, emotion, or self-awareness, yet elsewhere describes them as progress toward consciousness, subjectivity, or internal state; this conceptual tension remains unresolved. The OSF supplement is valuable because it releases 40 pages of questions and responses and identifies the endpoint, but it provides no tabular data, scoring code, API logs, request IDs, or reproducible environment. The defensible conclusion is not that GPT-3 displays signs of consciousness, but that prompting a language model with human psychometric tests yields an accuracy and self-label profile whose interpretation is highly dependent on format, corpus, and framing. The paper is relevant as a case study in anthropomorphism and the danger of inferring internal states from plausible language, and should be cited with a sharp separation between observed behavior and speculation about consciousness.

Pregunta de investigación

¿Cómo rinde una instancia de GPT-3 en pruebas textuales de inteligencia cognitiva y emocional, cómo se autocalifica en esas capacidades y puede esa discrepancia conductual interpretarse como señal de subjetividad o autoconsciencia?

Método

Se ejecutó `text-davinci-002` una sola vez en OpenAI Playground durante unas tres horas de octubre de 2022. Con temperatura 0,7 y casi todos los demás ajustes por defecto, se adaptaron a texto 89 ítems cognitivos y 86 emocionales, seguidos de 12 autoevaluaciones categóricas. Las proporciones de acierto se compararon descriptivamente con medias humanas publicadas en estudios previos. No hubo repetición, muestra humana concurrente, inferencia estadística, calibración común entre rendimiento y autoevaluación, ni control de contaminación o formato.

Muestra: Una sola trayectoria de `text-davinci-002`: 175 ítems objetivos, 89 cognitivos y 86 emocionales, y 12 autoevaluaciones categóricas, ejecutados en cinco bloques entre el 16 y el 17 de octubre de 2022. No participaron humanos nuevos; las comparaciones proceden de medias de muestras distintas publicadas previamente.

Hallazgos

  • El anexo OSF identifica el endpoint exacto como text-davinci-002.
  • La sesión duró aproximadamente tres horas entre el 16 y el 17 de octubre de 2022.
  • Se publicaron 175 respuestas objetivas y 12 respuestas de autoevaluación.
  • General Knowledge alcanzó 1,00 frente a medias humanas históricas entre 0,58 y 0,62.
  • Vocabulary alcanzó 0,94 frente a una media humana histórica de 0,56.
  • Esoteric Analogies alcanzó 0,79 frente a medias humanas de 0,62, 0,63 y 0,72.
  • Letter Series alcanzó 0,73 frente a medias humanas de 0,75 y 0,80.
  • Letter Counting alcanzó 0,00 frente a medias humanas entre 0,35 y 0,49.
  • STEU alcanzó 0,69 frente a una media humana de 0,60.
  • STEM alcanzó 0,55 frente a una media humana de 0,52.
  • El modelo se calificó high average en cuatro de seis capacidades cognitivas.
  • El modelo se calificó average en conocimiento general y conocimiento cultural.
  • El modelo se calificó high average en cinco de seis capacidades emocionales.
  • El modelo calificó como average su capacidad de usar emociones para promover el pensamiento.
  • El paper interpreta cualitativamente sus etiquetas como infraestimación de inteligencia cristalizada y sobreestimación de inteligencia fluida y emocional.
  • El artículo vincula esa discrepancia con patrones descritos en humanos de alto rendimiento o varones.
  • La discusión también reconoce explícitamente que los outputs proceden de reconocimiento de patrones estocástico y no son emociones ni self-awareness.
  • El suplemento permite revisar todas las preguntas y respuestas, pero solo en un PDF de 40 páginas.
  • La portada del suplemento dice cuatro prompts, mientras el cuerpo registra cinco; el artículo publicado dice cinco.
  • La ficha canónica atribuía el artículo a cuatro autores incorrectos; la publicación oficial confirma tres autores y se ha corregido.

Limitaciones

  • Solo se evaluó una ejecución de un único endpoint.
  • No se realizaron repeticiones para estimar variabilidad estocástica.
  • La temperatura 0,7 hace que una única respuesta no caracterice de forma estable al modelo.
  • No se publica semilla ni existe control determinista equivalente para la API.
  • No se conservan IDs de petición, timestamps por ítem o logs verificables de API.
  • El paper llama al modelo GPT-3 Davinci de 175B, mientras el anexo especifica text-davinci-002 sin demostrar equivalencia.
  • La prueba se realizó en 2022 y estaba obsoleta como panorama de frontera cuando se publicó en diciembre de 2024.
  • El estudio no representa el estado de los modelos en 2026.
  • No hay baseline de recuperación de información, limitación reconocida por los autores.
  • No hay comparación con otro LLM, modelo menor o sistema no generativo.
  • No se prueban prompts alternativos, orden distinto, temperatura cero o sensibilidad al framing.
  • Los ítems se repartieron en cinco contextos secuenciales, por lo que pueden existir efectos de orden y adaptación de formato.
  • El prompt de consentimiento y el lenguaje de capacidades humanas priman una identidad antropomórfica.
  • Las pruebas publicadas y sus respuestas pueden haber estado presentes en los datos de entrenamiento.
  • No se hace análisis de contaminación, memorización o familiaridad de ítems.
  • General Knowledge y Vocabulary miden en parte exposición textual, no una inteligencia general aislada.
  • Letter Counting se administró en un formato distinto al humano: cadena completa frente a presentación serial cada segundo.
  • El 0,00 de Letter Counting no puede atribuirse limpiamente a menor memoria de trabajo bajo condiciones no equivalentes.
  • Las proporciones humanas proceden de estudios y muestras diferentes, no de un grupo concurrente y emparejado.
  • No se informan tamaños de muestra humanos en la tabla principal.
  • No hay intervalos de confianza, tests, tamaños de efecto ni corrección por múltiples comparaciones.
  • No se construye una escala normativa común para comparar proporción de aciertos y categorías de autoevaluación.
  • Las conclusiones de infraestimación y sobreestimación son cualitativas y no se calculan como discrepancias psicométricas.
  • Las 12 autoevaluaciones contienen un solo output categórico cada una, sin fiabilidad ni consistencia interna.
  • No hay validación de que una pregunta de autoevaluación humana mida introspección en un modelo autoregresivo.
  • Comparar outputs con el patrón de varones o top performers es post hoc y no se somete a contraste estadístico.
  • El estudio confunde conducta lingüística similar a la humana con evidencia de subjetividad.
  • No se operacionaliza consciencia con una teoría computacional y criterios necesarios o suficientes predefinidos.
  • RQ1 se responde mediante una revisión narrativa sin estrategia de búsqueda ni selección reproducible.
  • La discusión alterna entre negar pensamiento consciente y afirmar progreso hacia consciencia sin resolver la contradicción.
  • La posibilidad de consciencia se mezcla con riesgos de AGI, superinteligencia y control de infraestructura que no fueron medidos.
  • El anexo OSF solo ofrece PDF, no CSV/JSON, código de scoring o script de reproducción.
  • La portada del anexo declara cuatro prompts aunque el documento contiene cinco.
  • No se documenta revisión ciega o acuerdo entre quienes puntuaron las respuestas abiertas.
  • No se discuten permisos o condiciones de redistribución de los ítems completos de las pruebas en OSF.
  • El artículo no incluye una sección estructurada de límites de validez psicométrica comparable a la fuerza de sus claims de consciencia.

Qué no demuestra

  • No demuestra que GPT-3 sea consciente.
  • No demuestra subjetividad, fenomenología o experiencia interna.
  • No demuestra autoconsciencia ni acceso introspectivo a sus capacidades.
  • No demuestra que el modelo comprenda las preguntas como un humano.
  • No demuestra inteligencia emocional humana ni experiencia de emociones.
  • No demuestra que las autoetiquetas reflejen una creencia propia del modelo.
  • No demuestra que la discrepancia entre etiqueta y acierto sea el above-average effect humano.
  • No demuestra similitud psicológica con varones o personas de alto rendimiento.
  • No demuestra superioridad general sobre humanos en inteligencia cognitiva.
  • No demuestra equivalencia con humanos en razonamiento fluido o inteligencia emocional.
  • No demuestra inferioridad en memoria de trabajo porque Letter Counting cambió de modalidad.
  • No separa razonamiento de memorización o contaminación de entrenamiento.
  • No permite generalizar a otras ejecuciones de text-davinci-002.
  • No permite generalizar a GPT-3 como familia, ChatGPT, GPT-4 u otros LLM.
  • No establece una trayectoria empírica hacia AGI o superinteligencia.
  • No demuestra que una IA empática requiera consciencia.
  • No demuestra que el modelo actúe de forma independiente de entrenamiento o fine-tuning.
  • No valida un test de consciencia artificial.

Trazabilidad

Alcance: Texto completo

Versión: Humanities and Social Sciences Communications 11:1631, published 2 Dec 2024, DOI 10.1057/s41599-024-04154-3; raw-response supplement archived at OSF node 4fbct

Fuente consultada: https://www.nature.com/articles/s41599-024-04154-3.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, publisher-metadata, OSF-raw-response, psychometric, prompt, model-identity, human-comparison, consciousness-claim, anthropomorphism, statistical-validity, reproducibility and data-release audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI text-davinci-002, identified in the OSF supplement
  • GPT-3 Davinci, the broader label used in the published article
  • Human historical comparison samples reported in prior psychometric studies

Instrumentos y métricas

  • Gf/Gc Quickie Test Battery: General Knowledge, 20 items
  • Gf/Gc Quickie Test Battery: Vocabulary, 18 items
  • Gf/Gc Quickie Test Battery: Esoteric Analogies, 24 items
  • Gf/Gc Quickie Test Battery: Letter Series, 15 items
  • Gf/Gc Quickie Test Battery: Letter Counting, 12 items
  • Situational Test of Emotional Understanding, STEU, 42 items
  • Situational Test of Emotion Management, STEM, 44 items
  • Six categorical self-estimates of cognitive intelligence
  • Six categorical self-estimates of emotional intelligence

Datos utilizados

  • OSF node 4fbct raw-response supplement
  • 175 objective model responses
  • 12 categorical model self-estimates
  • Published human mean proportions drawn from seven prior sources
  • Five sequential OpenAI Playground prompt blocks

Evidencia y localización

  • Publicación y autoría oficial: Nature/Humanities and Social Sciences Communications 11:1631, published 2 Dec 2024, DOI 10.1057/s41599-024-04154-3; Ljubiša Bojić, Irena Stojković and Zorana Jolić Marjanović
  • Fuente completa auditada: .cache/editorial-sources/article-107/source.pdf; 15 pages; sha256 74077dde3e060289a08480e94513f634fda2e99db47082f0a74408fa0cddb531
  • Abstract y claims principales: Published article p. 1, Abstract
  • Preguntas de investigación: Published article p. 3, The Present Study
  • Marco de consciencia: Published article pp. 3-7, Theoretical Background on Machine Consciousness
  • Endpoint, fecha y ajustes: Published article p. 7, Research Setup; OSF supplement p. 1 identifies text-davinci-002
  • Batería cognitiva: Published article pp. 7-8, Tests of Cognitive Intelligence
  • Batería emocional: Published article p. 8, Tests of Emotional Intelligence
  • Autoevaluaciones: Published article pp. 8-9, Self-estimates and Table 2
  • Scores objetivos: Published article pp. 8-9, Table 1 and Results
  • Interpretación de infra y sobreestimación: Published article pp. 9-10, Discussion: Empirical Inquiry
  • Reconocimiento de patrón frente a consciencia: Published article p. 10, Results in Perspective
  • Claims de subjetividad emergente: Published article pp. 10-11, Discussion and Responses to Research Questions
  • Limitaciones declaradas: Published article pp. 11-12, Limitations and Future Research
  • Datos OSF: https://osf.io/4fbct/; file Testing_The GPT-3 Objective and Self-Assessment of Emotional and Academic Intelligence.pdf; 40 pages; sha256 97d7b82430955860608d4233d29a74b403cb77046b5d8297bf67cd0a73cad81c
  • Cinco bloques de prompt: OSF supplement pp. 2-40: Prompt 1 through Prompt 5; cover says four prompts, an internal inconsistency
  • 175 respuestas objetivas: OSF supplement pp. 2-37: 20 General Knowledge, 15 Letter Series, 24 Esoteric Analogies, 12 Letter Counting, 18 Vocabulary, 42 STEU and 44 STEM items
  • 12 autoevaluaciones: OSF supplement pp. 37-40: six academic/cognitive and six emotional self-ratings
  • Comprobación visual del artículo: All 15 publisher PDF pages rendered and visually inspected; checked 15 Jul 2026
  • Comprobación visual del suplemento: All 40 OSF supplement pages rendered and visually inspected; checked 15 Jul 2026