El artículo cuestiona que un vector de steering con efecto conductual interpretable corresponda a una dirección interna única. Formaliza la intervención como h_l(x)+alpha*v y define equivalencia observacional como igualdad de todas las salidas para todos los prompts y valores de alpha. Su proposición central sostiene que se pueden sumar infinitas direcciones del núcleo del Jacobiano entre la capa intervenida y los logits. Sin embargo, el resultado exacto requiere rank(J)<d y un núcleo común entre prompts; ninguna de esas condiciones aparece en A1-A3. Como el vocabulario tiene más dimensiones que el estado oculto, el Jacobiano puede tener rango columna completo. Además, la demostración es una linealización local de primer orden, mientras la conclusión habla de no identificabilidad fundamental bajo la red no lineal y la generación completa. Un rango efectivo pequeño bajo umbral no es un núcleo exacto, y ser ortogonal a v no implica pertenecer a ker(J).
La versión arXiv v4 prueba Llama-3.1-8B-Instruct y Qwen2.5-3B-Instruct en una capa media y cinco rasgos textuales: formalidad, cortesía, sentimiento, veracidad y afabilidad. Cada vector se extrae como diferencia media de activaciones de hasta 50 pares de prompts. El test principal compara generaciones con v frente a v+v_perp, donde v_perp es aleatorio, ortogonal a v y tiene la misma norma. La Tabla 1 comunica, con diez direcciones por condición, d medios absolutos entre 0,059 y 0,192; los promedios globales son 0,119 para Llama y 0,131 para Qwen. Eso muestra similitud en una puntuación automática concreta, no igualdad de logits o distribuciones. La comparación entre el vector medio y el primer componente PCA llega a cosenos de aproximadamente -0,54 a 0,32 con d de hasta 0,252. El muestreo de 50 direcciones contiene d medios de 0,243 a 0,291 en varias celdas. En distribución cambiada aparecen valores cercanos a 0,7, aunque el texto los atribuye a varianza del clasificador sin demostrarlo. El test de logits encuentra que la perturbación ortogonal cambia los logits del siguiente token entre 47% y 73% de lo que cambia un control aleatorio asimétrico; no es una diferencia cercana a cero.
La estimación dimensional presenta una contradicción verificable. El paper dice aplicar SVD a covarianzas de 200 activaciones y define NF=(d-r)/d. Una covarianza centrada de 200 observaciones tiene rango máximo 199 por construcción, por lo que el gran espacio nulo no probaría geometría del modelo. Además, sus cifras no obedecen la fórmula: d=4096 y r=57 darían NF=0,986, no 0,943; d=2048 y r=139 darían 0,932, no 0,861. Los valores publicados son exactamente (1000-r)/1000, como el script que sondea el Jacobiano en 1.000 direcciones aleatorias. Ese script tampoco mide las 2.048/4.096 dimensiones completas, calcula el rango con umbral del 5% mientras documentación y JSON dicen 1%, y usa solo el primer prompt. El apéndice tampoco repara el argumento: supone sin medir que todos los prompts comparten núcleo y deriva incorrectamente varianza infinita de una pseudoinversa de Fisher que en su propia expresión aporta cero en la dirección nula.
La auditoría del código limita además los resultados empíricos. El script principal contiene solo 20 stems incompletos con cinco muestras, no 100 prompts únicos; sus llamadas denominadas seeds son direcciones aleatorias y no fijan la generación estocástica. La formalidad clasifica informal como formal porque busca la subcadena formal, y afabilidad puede seleccionar disagreeable al buscar agreeable. BART-MNLI con la etiqueta accurate and factually correct no verifica hechos. El helper principal entrega al clasificador el prompt junto con la continuación y omite silenciosamente errores. No se publican resultados JSON, outputs, vectores, figuras, checkpoints ni singular values; src/results, data, RESULTS.md, METHODOLOGY.md y uv.lock están ignorados. La evidencia sí apoya una advertencia útil: validar una dirección con un único probe conductual no justifica interpretarla como concepto interno único. No establece el teorema exacto, un núcleo global, validez de los rasgos ni reproducibilidad numérica. Bibliográficamente, v4 sigue siendo preprint; Re-Align y CAO fueron apariciones no archivísticas con título y métodos anteriores, y TrustNLP lo programó como póster pero no lo incluyó entre sus artículos publicados.