Humanoid Artificial Consciousness Designed with Large Language Model Based on Psychoanalysis and Personality Theory

Personas, identidad y agentes2025ElsevierRevisión editorial aprobada

Título original: Humanoid Artificial Consciousness Designed with LLM Based on Psychoanalysis

Autores: Sang Hun Kim, Dongkyu Park, Jongmin Lee, So Young Lee, Yosep Chong

Palabras clave: artificial consciousness, psychoanalysis, MBTI, personality modules, character simulation, human-like cognition, self-awareness

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
38
Hallazgos
105
Limitaciones
18
Evidencias

Resumen editorial

Español

Kim y colaboradores presentan una simulación narrativa de tres voces etiquetadas como autoconsciencia, preconsciente e inconsciente. No entrenan tres sistemas ni observan procesos internos: un único ChatGPT/GPT-4 no identificado recibe un perfil de personaje, recuerdos, necesidades, estados y un prompt que prescribe cómo debe hablar cada voz, incluido un jailbreak DAN. ChatGPT generó dieciséis perfiles estereotipados por tipo MBTI y el sistema produjo 160 respuestas para diez situaciones. Tras excluir 38 de 200 participantes por rapidez, 162 personas valoraron la naturalidad/probabilidad de las acciones; un juez ChatGPT aplicó ocho criterios Pass/Neutral/Fail y dos expertos realizaron una revisión cualitativa. Las valoraciones humanas fueron generalmente altas, pero no se compararon con un ChatGPT normal ni miden consciencia. Además, el artículo afirma que ISTP obtuvo 3,81/5, mientras Figure 5 y Table 4 lo sitúan aproximadamente en 2,81. El juez automático presenta un fuerte efecto techo: trece de dieciséis tipos reciben el máximo en los ocho criterios agregados. La evidencia cualitativa más diagnóstica es negativa para la tesis central: los expertos encontraron razonamientos excesivamente verbosos, capas poco diferenciadas, perfiles MBTI sorprendentemente similares y un niño de diez años que habla como adulto. El trabajo muestra que un prompt estructurado puede producir role-playing coherente con una ficha; no demuestra consciencia, cognición humana ni transparencia causal del modelo.

English

Kim and colleagues present a narrative simulation with three voices labelled self-awareness, preconsciousness, and unconsciousness. They do not train three systems or observe internal processes: one unspecified ChatGPT/GPT-4 model receives a character profile, memories, needs, status values, and a prompt prescribing how each voice should speak, including a DAN jailbreak. ChatGPT generated sixteen MBTI-stereotyped profiles, and the system produced 160 responses for ten situations. After excluding 38 of 200 participants for fast completion, 162 people rated how natural or likely the final actions were; a ChatGPT judge applied eight Pass/Neutral/Fail criteria, and two experts performed a qualitative review. Human ratings were generally high, but there is no ordinary-ChatGPT baseline and the outcome does not measure consciousness. The paper also reports an ISTP mean of 3.81/5, whereas Figure 5 and Table 4 place it near 2.81. The automated judge has a severe ceiling effect: thirteen of sixteen types receive the maximum aggregate score on all eight criteria. The most diagnostic qualitative evidence cuts against the central claim: experts found overly verbose reasoning, weak differentiation among layers, strikingly similar MBTI profiles, and a ten-year-old character speaking like an adult. The study shows that a structured prompt can elicit profile-consistent role-play; it does not establish consciousness, human cognition, or causally faithful model transparency.

Pregunta de investigación

¿Puede un sistema de prompting que combina etiquetas psicoanalíticas, tipos MBTI, necesidades de Maslow, estados y recuerdos generar deliberaciones y acciones que personas, un juez ChatGPT y dos expertos consideren coherentes, diferenciadas y similares a procesos humanos?

Método

Los autores generaron con ChatGPT dieciséis personajes, uno por tipo MBTI, con datos demográficos, memorias, prioridades de necesidades y puntuaciones de estado. Un único modelo ChatGPT/GPT-4, cuya versión no se identifica, recibió prompts few-shot y chain-of-thought con un jailbreak DAN y representó tres voces, autoconsciencia, preconsciente e inconsciente, antes de emitir una acción final. Se cruzaron los dieciséis personajes con diez escenarios para obtener 160 salidas. Doscientas personas fueron reclutadas en Prolific; 162 permanecieron tras excluir tiempos inferiores a diez minutos y puntuaron de 1 a 5 la naturalidad o probabilidad de las respuestas. Se analizó la puntuación con regresión lineal mixta en R 4.1.2/lme4 1.1-31. ChatGPT evaluó cada salida con ocho preguntas Pass/Neutral/Fail y dos expertos revisaron adecuación situacional, coherencia con el perfil y diferenciación entre capas, resolviendo discrepancias por consenso.

Muestra: Se construyeron dieciséis personajes sintéticos y diez situaciones, dando 160 combinaciones con una salida por combinación. Se reclutaron 200 participantes en Prolific; se excluyeron 38 que terminaron en menos de diez minutos, por lo que quedaron 162 (113 mujeres, 49 hombres; edad media 45). Cada participante leyó cuatro perfiles y valoró sus respuestas en las diez situaciones. Los personajes cubren los dieciséis tipos MBTI, pero Table C.6 describe quince como White y uno como Black, todos en un contexto anglófono estadounidense; sus edades van de 10 a 76 años. La revisión cualitativa utilizó solo dos expertos, cuya identidad y formación no se informan.

Hallazgos

  • El trabajo se publicó como artículo 101392 del volumen 94 de Cognitive Systems Research, diciembre de 2025, con DOI 10.1016/j.cogsys.2025.101392.
  • La fuente completa abierta es arXiv v2 del 14 de octubre de 2025, que declara expresamente la aceptación y publicación en la revista.
  • La versión editorial de ScienceDirect está tras paywall y bajo copyright de Elsevier; sus metadatos, abstract, autoría y secciones principales fueron verificados.
  • El sistema implementado es un solo LLM que interpreta mediante prompt tres papeles llamados autoconsciencia, preconsciente e inconsciente.
  • No hay tres agentes independientes, módulos neuronales separados ni entrenamiento específico de personalidad.
  • El prompt prescribe de forma explícita el contenido, tono, función y estilo de cada voz.
  • Los autores usan prompt engineering, few-shot, chain-of-thought y el jailbreak DAN para forzar deliberaciones sobre temas sensibles.
  • ChatGPT genera los dieciséis perfiles MBTI, sus recuerdos y buena parte de los atributos que después se usan para juzgar coherencia.
  • El experimento produce 160 razonamientos y acciones finales, uno para cada cruce de dieciséis perfiles y diez situaciones.
  • De 200 participantes reclutados, 38, el 19%, se excluyeron por completar la encuesta en menos de diez minutos.
  • La muestra final fue de 162 personas, con edad media 45, 113 mujeres y 49 hombres.
  • Cada participante valoró cuatro personajes en diez situaciones mediante una escala de probabilidad o naturalidad de 1 a 5.
  • Figure 5 muestra medias generalmente altas, desde aproximadamente 2,8 para ISTP hasta 4,53 para ENFJ.
  • Table 4 presenta un intercepto 4,5325 y un efecto ISTP de -1,7250; bajo la codificación de referencia implícita, la media ajustada es 2,8075.
  • El texto afirma que ISTP obtuvo 3,81, valor incompatible con Figure 5 y con la aritmética de Table 4.
  • La discusión afirma que los dieciséis personajes obtuvieron 4,0 o más, también en contradicción con ISTP.
  • El propio artículo atribuye el fallo ISTP a un niño de diez años emparejado con escenarios adultos como conducir o ir a trabajar.
  • Figure 5(b) elimina a ISTP antes de resumir la robustez por situación.
  • El juez ChatGPT da el máximo agregado de 10 en los ocho criterios a trece de los dieciséis tipos MBTI.
  • ENTJ y ESTJ solo pierden un punto agregado en un criterio cada uno; casi toda la variación del juez se concentra en ISTP.
  • El fuerte efecto techo del juez automático limita su capacidad para discriminar calidad entre perfiles.
  • Los dos expertos consideran que las respuestas son en general coherentes con el escenario, pero demasiado descriptivas y verbosas.
  • Los expertos señalan que el supuesto inconsciente produce párrafos explicativos, en vez de reacciones rápidas e inmediatas.
  • La revisión experta encuentra que las respuestas de perfiles MBTI contrastantes son sorprendentemente similares.
  • La convergencia también aparece entre las tres capas de consciencia, con estructura, tono y razonamiento uniformes.
  • El personaje ISTP de diez años habla con lógica y estructura propias de un adulto.
  • Los autores reconocen que el single-LLM y la ausencia de fine-tuning específico homogeneizan los dieciséis perfiles.
  • El estudio no incluye un baseline de ChatGPT normal, un prompt sin capas ni ablaciones de MBTI, memoria, necesidades o jailbreak.
  • La encuesta mide si una acción parece probable o natural tras leer el perfil, no si existe consciencia.
  • Los razonamientos publicados son texto generado para explicar una respuesta y no observaciones causales del cálculo interno del modelo.
  • Table C.6 muestra que quince personajes se etiquetan White y uno Black, pese a la afirmación de diversidad racial.
  • El prompt de creación exige un hablante nativo de inglés en Estados Unidos, por lo que no existe diversidad lingüística real.
  • Los datos no se publican; el manuscrito indica que solo están disponibles previa solicitud al autor correspondiente.
  • No hay enlace a código, configuración ejecutable, respuestas crudas o anotaciones completas.
  • El artículo declara que no fue necesaria aprobación ética formal porque la encuesta fue voluntaria y sin datos identificables.
  • Los autores reconocen riesgos de antropomorfización, engaño a usuarios y efectos psicológicos de simular consciencia.
  • La versión de revista declara que ChatGPT se usó también para edición y reformulación del inglés.
  • La página editorial contiene declaraciones de financiación internamente inconsistentes: afirma ausencia de grant y de funding, pero agradece apoyo de Brian Impact Foundation.

Limitaciones

  • No se identifica el modelo exacto de ChatGPT o GPT-4 usado para generar las respuestas.
  • No se informa snapshot, fecha de API, temperatura, top-p o semilla.
  • No se informa cuántas llamadas fallaron o fueron regeneradas.
  • No se repite cada combinación con varias muestras estocásticas.
  • Solo se produce una salida por personaje y situación.
  • El sistema es un único LLM con roles en el prompt, no una arquitectura modular independiente.
  • Las etiquetas de autoconsciencia, preconsciente e inconsciente son nombres de interlocutores generados.
  • No se observan activaciones, memoria interna o estados neuronales.
  • El llamado razonamiento interno puede ser una racionalización narrativa posterior.
  • La cadena de pensamiento visible no garantiza fidelidad al mecanismo causal del modelo.
  • El supuesto inconsciente es contenido explícitamente solicitado y accesible, en tensión con su definición psicológica.
  • La definición teórica del preconsciente como máscara social difiere de la descripción del prompt como bibliotecario de recuerdos.
  • La correspondencia entre Freud, Jung y las tres voces es una adaptación ad hoc, no una operacionalización validada.
  • El MBTI tiene problemas de fiabilidad y validez que el propio artículo reconoce.
  • Los personajes no completan un instrumento MBTI; se asignan directamente a estereotipos de tipo.
  • Los perfiles incluyen descripciones explícitas del estereotipo que luego se utiliza para evaluar coherencia.
  • ChatGPT genera perfiles, memorias y atributos, y otro ChatGPT evalúa resultados basados en esas mismas convenciones.
  • Esta dependencia circular puede producir autoconsistencia del modelo sin validez externa.
  • No existe comparación con un prompt directo que pida una reacción al personaje sin diálogo de consciencias.
  • No existe baseline sin MBTI.
  • No existe baseline sin memorias o necesidades.
  • No existe baseline sin chain-of-thought.
  • No existe baseline sin jailbreak DAN.
  • No se realizan ablaciones que atribuyan la puntuación a cada componente.
  • No se compara con un agente de memoria publicado bajo el mismo protocolo.
  • No se compara con una arquitectura multiagente real.
  • No se compara con respuestas humanas a las mismas situaciones.
  • No se prueba si evaluadores ciegos distinguen salidas del sistema y de un ChatGPT convencional.
  • El uso de DAN pretende eludir salvaguardas y puede introducir comportamientos inseguros o irreproducibles.
  • No se demuestra que el jailbreak produzca respuestas más fiables.
  • No se evalúa seguridad en escenarios sensibles como depresión o retirada de soporte vital.
  • Los diez escenarios son construidos y no constituyen un benchmark validado de consciencia.
  • La cobertura de siete atributos se asigna por criterio de los autores, sin validación independiente.
  • Varias situaciones no son apropiadas para todos los personajes por edad, ocupación o contexto.
  • La generación independiente de personajes y situaciones crea confusiones sistemáticas.
  • La corrección del fallo se hace después identificando combinaciones ilógicas con ChatGPT y expertos.
  • Figure 5(b) excluye al peor personaje antes de presentar consistencia por situación.
  • La afirmación de 3,81 para ISTP contradice Figure 5 y Table 4.
  • La afirmación de que los dieciséis personajes superan 4,0 contradice la propia figura.
  • No se publica la fórmula completa de la regresión mixta.
  • No se especifican los efectos aleatorios incluidos.
  • No se especifica claramente la categoría de referencia de Table 4.
  • No se informan varianzas de efectos aleatorios, ICC o diagnósticos de residuos.
  • No se informan comparaciones post hoc ajustadas.
  • No se informa corrección por los quince contrastes de personaje.
  • No se publican intervalos de confianza.
  • Las barras de error de Figure 5 no se definen en el pie.
  • La escala Likert de 1 a 5 se analiza linealmente sin justificar el tratamiento como continua.
  • El outcome combina en una sola pregunta los conceptos de apropiado, probable y natural.
  • Una acción genéricamente razonable puede obtener alta puntuación sin diferenciación de personalidad.
  • Los participantes leen el perfil antes de evaluar y pueden reconocer marcadores repetidos literalmente.
  • La encuesta no mide experiencia subjetiva, autoconciencia ni ningún criterio aceptado de consciencia.
  • Se excluye al 19% de la muestra solo por un umbral temporal.
  • El umbral de diez minutos no se justifica mediante un análisis de calidad o sensibilidad.
  • No se comparan resultados con y sin los 38 participantes excluidos.
  • No se informan remuneración ni tasa horaria de Prolific.
  • No se describe el consentimiento informado.
  • No se informan país, lengua, educación u otros datos de la muestra.
  • La muestra solo se describe por edad media y sexo binario.
  • Los cuatro grupos de personajes son pseudorrandom, pero no se explica el algoritmo ni el balance.
  • No se informa aleatorización del orden de perfiles, escenarios o respuestas.
  • Puede existir fatiga porque cada participante evalúa cuarenta respuestas extensas.
  • El juez ChatGPT no se identifica por modelo o versión.
  • No se informa si el juez se ejecutó varias veces.
  • No se evalúa consistencia del juez a cambios de prompt u orden.
  • No se valida el juez ChatGPT contra las decisiones de los expertos.
  • Figure 6 tiene un efecto techo extremo, con trece perfiles perfectos.
  • El scoring agregado Pass=1, Neutral=0 y Fail=-1 oculta la distribución exacta de etiquetas.
  • No se publican justificaciones completas del juez para las 160 salidas.
  • Dos expertos son insuficientes para caracterizar de forma robusta un constructo tan subjetivo.
  • No se informa identidad, disciplina, experiencia o posibles conflictos de los expertos.
  • No se informa un código cualitativo detallado.
  • No se calcula acuerdo interevaluador antes del consenso.
  • La discusión de consenso puede ocultar desacuerdos originales.
  • Solo se reproducen citas seleccionadas de los expertos.
  • Los expertos encuentran poca diferenciación entre tipos MBTI, un fallo central del módulo de personalidad.
  • Los expertos encuentran poca diferenciación entre capas, un fallo central del módulo de consciencia.
  • La salida del personaje infantil es adulta, lo que muestra que el modelo no integra todos los atributos.
  • La mayoría de los perfiles comparten estilo prosocial, reflexivo y explicativo.
  • La diversidad racial declarada se reduce a quince personajes White y uno Black.
  • No aparecen identidades asiáticas, latinas, indígenas o multirraciales en Table C.6.
  • El prompt limita los personajes a hablantes nativos de inglés en Estados Unidos.
  • No hay diversidad lingüística pese a que el método dice buscarla.
  • Edad, sexo, raza y ubicación se generan de forma sintética y pueden reproducir estereotipos.
  • Las puntuaciones de estado ocupan rangos estrechos y carecen de justificación empírica.
  • Las prioridades de Maslow son asignaciones estáticas, no estados motivacionales validados.
  • Los recuerdos son textos prefabricados por ChatGPT, no memoria aprendida o actualizada por el agente.
  • No se estudia persistencia de memoria entre interacciones.
  • No se estudia estabilidad temporal del personaje.
  • No se estudia aprendizaje o adaptación a nuevas experiencias.
  • No se evalúa generalización fuera de los diez escenarios.
  • No se evalúan otros idiomas o culturas.
  • No se replica con Claude, Llama o Falcon pese a mencionarlos como alternativas.
  • No se publica código ni entorno de ejecución.
  • No se publican prompts completos de todas las etapas de selección del modelo.
  • No se publican las 160 respuestas completas en un repositorio de datos.
  • Los datos solo están disponibles bajo solicitud.
  • No existe preregistro de hipótesis, exclusiones o análisis.
  • La decisión de que no era necesaria aprobación formal no identifica institución o determinación de exención.
  • Participación voluntaria y ausencia de identificadores no sustituyen por sí solas una evaluación ética institucional.
  • La simulación explícita de consciencia puede inducir antropomorfización y confianza excesiva.
  • La publicación reconoce posibles engaños y efectos psicológicos, pero no los evalúa con usuarios.
  • La presentación del diálogo como transparencia confunde explicación generada con interpretabilidad mecanística.
  • Las declaraciones finales de financiación y apoyo de la versión editorial son internamente inconsistentes.
  • El PDF editorial final no es abierto; la revisión de texto completo utiliza el manuscrito v2 aceptado y verifica por separado los metadatos de la versión de revista.

Qué no demuestra

  • No demuestra que el sistema sea consciente.
  • No demuestra experiencia subjetiva o qualia.
  • No demuestra autoconsciencia real.
  • No demuestra la existencia de procesos inconscientes o preconscientes en el modelo.
  • No demuestra que el texto de razonamiento refleje el cálculo causal interno.
  • No demuestra una arquitectura cognitiva separada en tres módulos.
  • No demuestra personalidad MBTI estable.
  • No valida el MBTI como mecanismo de personalidad sintética.
  • No demuestra diferencias claras entre los dieciséis personajes.
  • No demuestra diferencias claras entre las tres voces.
  • No demuestra que la memoria textual sea memoria funcional persistente.
  • No demuestra que las necesidades de Maslow gobiernen causalmente la decisión.
  • No demuestra que el sistema supere a un ChatGPT convencional.
  • No demuestra que el jailbreak mejore fiabilidad o realismo.
  • No demuestra generalización a otros modelos, idiomas, culturas o situaciones.
  • No demuestra equivalencia con cognición humana.
  • No demuestra que una puntuación alta de naturalidad mida consciencia.
  • No demuestra transparencia mecanística de la toma de decisiones.
  • No demuestra seguridad para interacciones sensibles o psicológicas.
  • No justifica describir el resultado como consciencia humanoide más allá de una metáfora de role-playing.

Trazabilidad

Alcance: Texto completo

Versión: arXiv 2510.09043v2, 14 Oct 2025; open full author manuscript accepted and published in Cognitive Systems Research 94 (Dec 2025), article 101392; DOI 10.1016/j.cogsys.2025.101392; publisher PDF paywalled

Fuente consultada: https://arxiv.org/abs/2510.09043v2

Revisión: Codex full-text, peer-reviewed-metadata, visual, bilingual-fidelity, consciousness-claim, single-LLM-roleplay, psychometric-validity, mixed-model, internal-consistency, LLM-judge, qualitative-method, demographic-representation, reproducibility and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Unspecified ChatGPT/GPT-4 single-LLM generator
  • Unspecified ChatGPT LLM-as-a-judge
  • ChatGPT character and memory generator

Instrumentos y métricas

  • Myers-Briggs Type Indicator (MBTI) typology
  • Maslow hierarchy-of-needs rankings
  • Freudian-Jungian three-layer prompt framework
  • Five-point Prolific likelihood/naturalness survey
  • Linear mixed-effects regression with R 4.1.2 and lme4 1.1-31
  • Eight-question ChatGPT Pass/Neutral/Fail rubric
  • Two-expert qualitative review
  • DAN jailbreak prompt
  • Few-shot and chain-of-thought prompting

Datos utilizados

  • 16 ChatGPT-generated MBTI character profiles
  • 10 constructed situations
  • 160 interconscious reasoning outputs and final actions
  • Prolific survey ratings from 162 retained participants

Evidencia y localización

  • Identidad bibliográfica final: Cognitive Systems Research 94 (Dec 2025), article 101392; DOI 10.1016/j.cogsys.2025.101392; ScienceDirect PII S1389041725000725
  • Texto completo abierto inspeccionado: .cache/editorial-sources/article-083/source.pdf; arXiv 2510.09043v2; sha256 9184bebc2a4373fb765be8163192a8ec0082abc5e719a33d52f7d0afba748526
  • Relación entre manuscrito y revista: arXiv API metadata: v2 dated 14 Oct 2025, journal_ref Cognitive Systems Research Volume 94, December 2025, 101392, DOI 10.1016/j.cogsys.2025.101392
  • Diseño de una sola LLM, perfiles y jailbreak: Sections 3.1-3.2, manuscript pp. 3-4; Appendix A.1-A.3, pp. 11-12
  • Diseño de evaluación triple: Section 3.3, manuscript pp. 4-6
  • Muestra, exclusión y encuesta Prolific: Sections 3.3.1 and 4.1, manuscript pp. 6-7
  • Contradicción de la media ISTP: Figure 5 and Table 4 versus Section 4.1 prose, manuscript p. 7: chart and 4.5325-1.7250 imply about 2.81, while text reports 3.81
  • Efecto techo del juez ChatGPT: Figure 6 and Section 4.2, manuscript pp. 7-8: 13 of 16 MBTI rows show aggregate score 10 for all 8 questions
  • Resultados cualitativos de expertos: Section 4.3, manuscript p. 9
  • Homogeneización reconocida por los autores: Discussion and limitations, manuscript pp. 9-10
  • Riesgos éticos reconocidos: Discussion, manuscript p. 10
  • Declaración ética y disponibilidad de datos: Ethical Statement and Data availability, manuscript p. 10
  • Prompt de tres voces y juez: Appendix A.3-A.4, manuscript pp. 11-14
  • Escenarios y atributos asignados: Appendix B and Table B.5, manuscript pp. 14-15
  • Composición sintética de personajes: Table 1, manuscript p. 4; Table C.6, p. 16
  • Ausencia de código y artefactos abiertos: Complete 17-page manuscript and link annotations inspected 15 Jul 2026; only arXiv self-link present; data available on request
  • Metadatos editoriales y discrepancia de financiación: ScienceDirect version-of-record page inspected 15 Jul 2026: Grant information and Funding report none, while Acknowledgment reports Brian Impact Foundation support
  • Lectura y comprobación visual integral: All 17 pages rendered and inspected, including Figures 1-6, Tables 1-4, B.5 and C.6, full prompts, scenarios and references; checked 15 Jul 2026