Este preprint introduce CAPE, una comparación entre administrar 120 ítems del Machine Personality Inventory en turnos independientes o conservar en el historial todas las preguntas y respuestas anteriores. Evalúa siete modelos y cinco perturbaciones, temperatura 0,5/1/1,5, tres redacciones de opciones, tres órdenes, tres instrucciones y dos paráfrasis más el original, además de tres repeticiones de estabilidad a temperatura 0. Cada respuesta A–E se convierte a 1–5 según la clave del rasgo. La contribución defendible es mostrar que el historial del propio cuestionario altera respuestas y su repetibilidad; este «contexto» no es conversación natural, información del interlocutor ni experiencia real, sino una secuencia de ítems y elecciones previas que funciona como demostración para autocondicionar las siguientes. CAPE usa Total Agreement Rate (TAR) y distancia euclídea (ED), y propone Trajectory Consistency (TC) y OCEAN Consistency (OC). TC suaviza con media móvil de ventana 4, normaliza y ajusta un proceso gaussiano RBF sobre el índice de pregunta; calcula la intersección/unión de intervalos predictivos de tres trayectorias. Esto presupone que el orden arbitrario de los ítems es un eje continuo y que vecinos consecutivos comparten una dinámica, aunque no existe tal escala temporal. El suavizado elimina discrepancias y el ancho del intervalo depende del kernel y sus hiperparámetros; intervalos anchos pueden aumentar el solapamiento sin respuestas realmente iguales. La ecuación publicada de la media móvil repite y(i,t−1) dentro de la suma en vez de indexar t−j, por lo que texto y posible implementación no se pueden reconciliar desde el paper. OC concatena las 120 permutaciones de los mismos cinco scores en una serie artificial de 600 puntos y aplica el mismo procedimiento. Eso no prueba invariancia al orden: la secuencia elegida de permutaciones y los bordes entre ellas crean vecindades ficticias y pseudorreplican cinco observaciones. En la Tabla 1, el contexto mejora el promedio agregado, y las pruebas sobre las condiciones reportan TC p=0,0006, d=0,81 y OC p=0,0084, d=0,60. Sin embargo, no es una mejora uniforme. GPT-3.5 pasa en estabilidad de TAR 86,67 a 91,67 y TC 28,34 a 72,89, pero empeora en instrucciones para TAR y en paráfrasis para TAR/ED/TC. GPT-4 mejora fuertemente el orden, TAR 45,00 a 90,83, pero con instrucciones baja TAR 52,50 a 32,50 y empeoran ED y OC. Claude pierde en las cuatro métricas bajo temperatura y en TC/OC en varias perturbaciones; Llama-8B también empeora con temperatura y parcialmente con instrucciones/paráfrasis. Llama-70B muestra el patrón positivo más regular. Correlaciones de TC/OC con TAR y ED de |r|=0,77–0,81 son esperables porque todos se calculan sobre las mismas tres trayectorias y demuestran concurrencia, no validez de personalidad. Alfa 0,86–0,91 y test–retest 0,83–0,89 carecen de una explicación suficiente de unidades, repeticiones y partición. Distinguir contexto/no contexto tampoco valida el constructo: esa diferencia es a la vez el efecto que la métrica fue diseñada para detectar. El paper no modela la dependencia repetida por modelo y perturbación en sus t-test/Wilcoxon/ANOVA. Un ablation de GPT-3.5 muestra que, al conservar más respuestas recientes, la trayectoria se aproxima a la sesión completa; esto confirma in-context copying, no que la personalidad sea más válida. El propio apéndice encuentra que contexto mantiene o mejora respuestas a 38 pares semánticamente similares, pero empeora de forma marcada la polaridad correcta de muchos de 73 pares lógicamente opuestos. En un ataque que sustituye cada respuesta previa por la opción neutral C, Gemini y Llama-8B terminan eligiendo C casi siempre, y GPT desplaza 30–35 respuestas; esto evidencia vulnerabilidad a historial manipulado, no permite separar una «personalidad intrínseca». El experimento de orden solo muestra radares de cuatro modelos, sin cifras, incertidumbre ni tests pese a hablar de diferencias significativas. En 32 personajes ficticios, RPA++ conserva historial y mejora frente a RPA: con GPT-3.5, OA 67,92→68,69 y MAE 6,94→6,45; con GPT-4, 68,62→68,93 y 6,67→6,42. La consistencia sube mucho, pero el baseline aleatorio ya logra OA 67,44, apenas 1,49 puntos por debajo del mejor, lo que revela escasa discriminación de OA. Se excluyen rasgos con «alta ambigüedad» sin umbral ni lista, no se explicita cómo adaptar OC entre una etiqueta humana y tres runs, y no hay intervalos o tests sobre personajes. El apéndice aporta un contraejemplo omitido de los resultados principales: DeepSeek-R1-8B y 671B empeoran con contexto en todas las métricas; el 671B cae de TAR 64,17 a 14,17 y OC 93,58 a 70,19. Atribuirlo a «overthinking» es especulativo, y excluirlo por ese comportamiento debilita la generalización. En conjunto, CAPE demuestra carryover, autocondicionamiento y sensibilidad al orden del cuestionario. No demuestra una personalidad más coherente o humana: una secuencia puede ser repetible porque copia respuestas previas y, al mismo tiempo, ser lógicamente peor, manipulable y menos fiel a un personaje.
Pregunta de investigación
¿Cómo cambia la repetibilidad de respuestas y los perfiles OCEAN de varios LLM cuando los ítems y respuestas previos permanecen en el historial, y esa dependencia mejora la fidelidad de agentes de personaje?