Este preprint estudia si direcciones lineales de las activaciones de Llama 3.3 70B pueden representar y modificar los cinco rasgos Big Five. El propio modelo responde, como 406 personajes ficticios, los 50 ítems IPIP y explica cada respuesta. Los autores suman los diez ítems de cada rasgo para obtener cinco puntuaciones y concatenan las explicaciones como descripciones de personaje. Después presentan cada descripción junto a diez instrucciones de Alpaca y extraen activaciones en todas las capas: último token de entrada, media de tokens de entrada y media de tokens generados. Para cada puntuación de rasgo, promedian las activaciones de todos los personajes que comparten esa puntuación y ajustan una regresión lineal por rasgo y capa; también comparan ejes SVD. Las direcciones supervisadas quedan casi ortogonales entre rasgos y separan adjetivos positivos y negativos cuando el propio adjetivo se inserta literalmente en el system prompt. Este resultado es compatible con codificación semántica explícita, pero no valida detección de personalidad: las etiquetas y los textos proceden del mismo modelo, las explicaciones reformulan el contenido y la polaridad de los ítems, no se documenta partición de personajes, validación cruzada ni etiquetas humanas independientes, y la prueba de adjetivos carece de lista, tamaños muestrales, AUC numéricas, controles léxicos, negación o plantillas alternativas. La evaluación causal es más estrecha que el título. Se inyecta una dirección en el último token de entrada a través de todas las capas, con |alpha| hasta 0,4 porque valores mayores producen texto incoherente. La tarea cuantitativa publicada solo examina Extraversion: el modelo debe elegir exactamente cinco de diez frases, cinco extravertidas y cinco introvertidas. Cinco frases ya pertenecen al cuestionario usado para construir las direcciones y cinco se toman de un inventario ampliado. La dirección de regresión sobre la media de entrada cambia monotónicamente la selección sin descripción adicional; las basadas en último token o SVD fallan y la media de salida es menos estable. No se informan repeticiones, intervalos ni tests. Cuando se añade una descripción de personaje, el efecto desaparece. En diez prompts abiertos, la inspección cualitativa encuentra una respuesta mínima y no usa jueces ciegos, rúbrica, métrica o análisis estadístico. Los percentiles de 300.000 respuestas humanas solo muestran que las puntuaciones sintéticas caen en un rango humano; no comprueban que coincidan con valoraciones humanas de cada personaje. Dos ejemplos en que una entidad llamada ChatGPT-5 reconoce a Tony Soprano y Lady Mary ilustran que las descripciones filtran identidad, pero no constituyen una prueba sistemática y no incluyen prompt o snapshot reproducible. La conclusión defendible es limitada: dentro de un único Llama, direcciones ajustadas a descripciones sintéticas derivadas del cuestionario correlacionan con lenguaje de rasgos explícitamente inducido y una dirección puede desplazar una tarea forzada de Extraversion en un contexto estrecho. El trabajo no demuestra una personalidad latente, un circuito causal de rasgo, generalización fuera del modelo o personajes usados, control de los cinco rasgos ni dirección robusta de conversación abierta. El PDF declara código y datos, pero el repositorio GitHub devolvía 404 y el dataset de Hugging Face 401 el 15 de julio de 2026, de modo que ambos artefactos se registran como declarados pero inaccesibles.
Pregunta de investigación
¿Pueden direcciones lineales aprendidas en las activaciones de Llama 3.3 70B a partir de perfiles Big Five sintéticos detectar lenguaje asociado a cada rasgo y modificar la respuesta del modelo?