Este estudio no mide una personalidad intrínseca de GPT-3. Investiga cómo personas, en su mayoría universitarias, percibieron la personalidad mostrada en conversaciones inglesas generadas por text-davinci-002 en octubre-noviembre de 2022. En el primer experimento, 86 participantes conversaron durante tres semanas con tres personajes y aportaron 9.267 autoinformes de tres adjetivos. El sistema inyectaba además uno de seis estados emocionales, cuatro tipos de inicio y los mensajes del usuario; el objeto observado es, por tanto, una conversación coproducida y condicionada por prompts, no el modelo aislado.
De 27.801 entradas se obtuvieron 2.999 términos únicos y después 147 descriptores mediante una cadena con decisiones importantes: reducción manual de frases, traducción manual de 104 términos, corrección con Merriam-Webster, eliminación de prefijos de negación, cribado con listas previas, clustering codicioso de sinónimos ordenado por frecuencia y un umbral t=10 elegido por codo. El resultado es un instrumento construido y curado, no una extracción neutral ni un resumen automático del lenguaje de los participantes. El suplemento oficial publica los 147 descriptores, sus cargas y su correspondencia Big Five, pero no las decisiones intermedias.
En un segundo estudio abierto se reclutaron 556 personas y se conservaron 425 tras excluir 131 (23,5 %): nueve por no usar las cuatro categorías y 122 por completar fuera de 8-25 minutos. Cada participante leyó un conjunto aleatorio distinto de tres conversaciones y puntuó una sola vez los 147 adjetivos para la personalidad global de ese conjunto. El análisis factorial exploratorio tiene KMO=0,896, pero las reglas de retención no señalan ocho factores: Kaiser sugiere 34 y el scree cuatro o seis. Los autores analizan cinco para compararlo con Big Five, diez para compararlo con un trabajo anterior y eligen ocho como valor intermedio e interpretable. Esa solución explica el 38,2 % de la varianza y no se confirma en otra muestra.
Los ocho factores se etiquetan subjetivamente como decencia, profundidad, inestabilidad, vitalidad, implicación, neuroticismo, utilidad y servilismo. Forman una taxonomía exploratoria plausible de percepciones, pero cada vector mezcla un rater y tres conversaciones distintas; la estructura puede incorporar contenido, prompts, usuarios, selección del conjunto y estilos de respuesta. No hay análisis multinivel, parallel analysis, split de confirmación, CFA, bootstrap de estabilidad ni replicación externa.
La cifra de fiabilidad más llamativa necesita una corrección esencial. El texto principal presenta alpha=0,78 para quienes vieron las mismas tres conversaciones, pero el apéndice muestra que sin restricción de orden es 0,57 en solo 23 pares. El 0,78 aparece únicamente al exigir además que la última conversación sea la misma y queda en nueve pares. El alpha=0,31 entre más de 80.000 pares sin ninguna conversación compartida no es fiabilidad interjueces del mismo objeto: es semejanza de perfiles ante estímulos diferentes y puede reflejar frecuencias generales de los adjetivos o estilos de respuesta.
La relación con Big Five tampoco es validación convergente. Tras comparar con listas previas, un psicólogo asignó manualmente 95 de los 147 adjetivos y 24 quedaron sin correspondencia; el “agreement” es el porcentaje de palabras de cada factor codificadas en cada rasgo, no una correlación con un instrumento Big Five administrado sobre los mismos estímulos. Del mismo modo, la comparación con asistentes de voz usa otro estudio, otras muestras y otros vocabularios; los solapamientos mensurables son 27-41 % y no aíslan un avance tecnológico.
La conclusión fiel es que participantes de 2022 organizaron sus percepciones de estas conversaciones concretas en varias dimensiones sociales, emocionales y funcionales interpretables. El trabajo aporta un diseño longitudinal poco común, identifica el modelo y los parámetros y publica las tablas completas. Pero no valida una personalidad estable de GPT-3, una taxonomía universal de ocho factores, el fracaso psicométrico de Big Five, independencia respecto del prompt o generalización a ChatGPT, GPT-4 o modelos actuales. Tampoco puede reproducirse numéricamente: las páginas oficiales y el registro ETH ofrecen PDFs, BibTeX y metadatos, pero no conversaciones, matriz de ratings, exclusiones, código, entorno o release inmutable.