Letting Tutor Personas Speak Up for LLMs: Learning Steering Vectors from Dialogue via Preference Optimization

Inducción y control de rasgos2026ACL AnthologyRevisión editorial aprobada

Autores: Jaewook Lee, Alexander Scarlatos, Simon Woodhead, Andrew Lan

Palabras clave: Activation steering, Tutor personas, Preference optimization, Educational dialogue, Llama-3.1-8B-Instruct

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
6
Hallazgos
9
Limitaciones
3
Evidencias

Resumen editorial

Español

El artículo investiga cómo trasladar al comportamiento de un LLM las diferencias implícitas entre tutores humanos sin describirlas mediante un prompt de persona. Usa Question-Anchored-Tutoring-Dialogues-2k, conversaciones reales de apoyo matemático de la plataforma Eedi, y selecciona 21 tutores. Primero adapta Llama-3.1-8B-Instruct mediante LoRA para generar la respuesta de un tutor medio. Para cada contexto, la intervención humana real se trata como respuesta preferida y una muestra del modelo SFT como respuesta rechazada. Un objetivo inspirado en BiPO aprende una dirección de activación compartida v en la última capa y un coeficiente positivo delta_i por tutor, normalizado para que la media sea uno. En inferencia se suma alpha * delta_i * v a todos los tokens. Por tanto, no se aprende un vector con dirección distinta para cada persona: los 21 tutores se ordenan por intensidad sobre un único eje, con coeficientes entre 0,83 y 1,21.

El split es 80/10/10 dentro de cada tutor. La parte denominada validación se usa para optimizar el vector y los coeficientes y también para seleccionar el checkpoint; el test contiene diálogos nuevos de los mismos tutores. La evaluación compara cada generación con la respuesta humana mediante ROUGE-L, BLEU, similitud coseno de SentenceBERT y preferencia de un juez Prometheus-Eval. En el tramo medio de 1.971 turnos, la similitud coseno sube de 0,385 a 0,426 y el juez prefiere la versión dirigida en 58,7% de comparaciones, mientras ROUGE-L baja de 0,165 a 0,157 y BLEU de 0,019 a 0,018. En el tramo inicial, las tres métricas de similitud empeoran, coseno 0,392 a 0,321, ROUGE-L 0,285 a 0,206 y BLEU 0,070 a 0,041, aunque el juez da 57,1% de victorias. Agregado sobre 2.623 turnos, alpha=0,5 obtiene los mejores ROUGE-L (0,187), BLEU (0,028) y coseno (0,407), pero solo 53,9% de preferencia; alpha=1 eleva esa preferencia a 58,2% a costa de menor solapamiento léxico.

La interpretación cualitativa propone un continuo desde apoyo afectivo y andamiaje, pasando por instrucción diagnóstica, hasta asistencia breve orientada a terminar la tarea. Esa lectura se basa en tres preguntas seleccionadas y varios ejemplos, sin etiquetas pedagógicas sistemáticas, anotadores ciegos ni correlaciones. Además, imitar a un tutor no equivale a enseñar mejor: el propio extremo de coeficiente alto incluye respuestas confusas y de baja inversión pedagógica. El objetivo no mide corrección, aprendizaje, engagement ni bienestar del estudiante. Los mismos tutores están en las tres particiones y el corte es por diálogo, no por pregunta; el resultado demuestra imitación dentro de identidades conocidas, no inducción zero-shot de nuevos tutores.

La auditoría de datos confirma 1.971 conversaciones, 68.717 mensajes y 25 tutores reales en los CSV públicos. Los 21 retenidos son exactamente los que tienen al menos 14 conversaciones; cuatro con 1, 2, 5 y 7 quedan fuera sin que el criterio se explicite. Hay 67 conversaciones con dos a cuatro IDs de tutor y el paper no publica cómo resuelve esos relevos. Tampoco publica el split experimental. El repositorio enlazado corresponde a otro artículo de estudiantes simulados: contiene el framework SFT reutilizado, pero no el código del vector, las métricas, el juez, checkpoints, semillas, outputs ni resultados de este trabajo. No se especifican los checkpoints exactos de SentenceBERT o Prometheus, no hay evaluación humana, intervalos, significación o ejecuciones repetidas. La contribución respalda que una intervención unidimensional puede desplazar modestamente el estilo de Llama-3.1-8B hacia tutores ya observados; no valida personalidad psicológica, calidad pedagógica, interpretabilidad causal ni generalización a tutores nuevos.

English

This paper investigates how implicit differences among human tutors can be transferred into LLM behavior without describing a persona in the prompt. It uses Question-Anchored-Tutoring-Dialogues-2k, real math-support conversations from the Eedi platform, and selects 21 tutors. Llama-3.1-8B-Instruct is first adapted with LoRA to produce an average-tutor response. For each context, the real human tutor utterance is preferred and a sampled SFT response is rejected. A BiPO-inspired objective learns one shared activation direction v at the final layer and one positive, mean-normalized coefficient delta_i per tutor. Inference adds alpha * delta_i * v at every token position. The method therefore does not learn a separately oriented vector for each persona: all 21 tutors are ordered by strength on a single axis, with coefficients from 0.83 to 1.21.

Data are split 80/10/10 within each tutor. The portion called validation is used both to optimize the vector and coefficients and to select their checkpoint; test contains new dialogues from the same known tutors. Evaluation compares each generation with the human utterance using ROUGE-L, BLEU, SentenceBERT cosine similarity, and a Prometheus-Eval preference judge. In the 1,971 middle-stage turns, cosine rises from 0.385 to 0.426 and the judge prefers steering in 58.7% of comparisons, while ROUGE-L falls from 0.165 to 0.157 and BLEU from 0.019 to 0.018. In the early stage, all three similarity metrics worsen, cosine 0.392 to 0.321, ROUGE-L 0.285 to 0.206, and BLEU 0.070 to 0.041, although the judge gives steering a 57.1% win rate. Aggregated over 2,623 turns, alpha=0.5 has the best ROUGE-L (0.187), BLEU (0.028), and cosine (0.407), but only 53.9% judge preference; alpha=1 raises preference to 58.2% at the cost of lexical overlap.

The qualitative interpretation proposes a continuum from affective support and scaffolding, through diagnostic instruction, to brief task-completion assistance. That reading rests on three selected questions and several examples, without systematic pedagogical labels, blinded annotators, or correlations. Resembling a tutor is also not equivalent to better teaching: the high-coefficient end itself includes confusing and low-investment responses. The objective does not assess correctness, learning, engagement, or student welfare. Because the same tutors appear in all three partitions and the split is by dialogue rather than question, the result demonstrates within-identity imitation, not zero-shot induction of unseen tutors.

The data audit confirms 1,971 conversations, 68,717 messages, and 25 actual tutors in the public CSVs. The retained 21 are exactly those with at least 14 conversations; four tutors with 1, 2, 5, and 7 are omitted without an explicit selection rule. Sixty-seven conversations contain two to four tutor IDs, and the paper does not publish how these hand-offs are resolved. It also releases no experimental split. The linked repository belongs to a different simulated-student paper: it contains the reused SFT framework but not this work's vector training, metrics, judge, checkpoints, seeds, outputs, or results. Exact SentenceBERT and Prometheus checkpoints are unspecified, and there is no human evaluation, uncertainty, significance testing, or repeated runs. The contribution supports a modest one-dimensional shift of Llama-3.1-8B style toward already observed tutors; it does not validate psychological personality, pedagogical quality, causal interpretability, or generalization to new tutors.

Pregunta de investigación

¿Puede aprenderse directamente de diálogos humanos una intervención en el espacio de activaciones que desplace un LLM desde el comportamiento de un tutor medio hacia los estilos de tutores individuales conocidos?

Método

Se adapta Llama-3.1-8B-Instruct con LoRA a diálogos de 21 tutores de Eedi. Cada turno humano forma un par preferido frente a una respuesta muestreada del SFT. Un objetivo inspirado en BiPO aprende una única dirección v en la capa 32 y escalares positivos delta_i por tutor; la inferencia usa alpha * delta_i * v. El test compara con los turnos humanos mediante ROUGE-L, BLEU, coseno SentenceBERT y un juez Prometheus-Eval.

Muestra: Veintiún tutores conocidos y aproximadamente 1.957 conversaciones retenidas, divididas 80/10/10 dentro de cada tutor. El test agrega 2.623 turnos: 326 iniciales, 1.971 medios y 326 finales. Los datos públicos completos contienen 1.971 conversaciones, 68.717 mensajes y 25 tutores consentidos antes de la selección experimental.

Hallazgos

  • En turnos medios, el coseno sube 0,385→0,426 y el juez prefiere steering en 58,7%, mientras ROUGE-L y BLEU disminuyen levemente.
  • En turnos iniciales, coseno, ROUGE-L y BLEU empeoran de forma clara aunque el juez da 57,1% de victorias, mostrando desacuerdo entre métricas.
  • Agregado, alpha=0,5 maximiza ROUGE-L 0,187, BLEU 0,028 y coseno 0,407, con win rate 0,539; alpha=1 eleva win rate a 0,582 pero reduce solapamiento.
  • Los coeficientes 0,83–1,21 ordenan a tutores sobre una única dirección interpretada cualitativamente desde andamiaje y rapport hasta asistencia mínima.
  • El efecto se evalúa en diálogos nuevos de los mismos tutores, no en tutores no observados.
  • La auditoría recupera la selección implícita de 21 tutores y detecta 67 conversaciones con múltiples IDs de tutor sin preprocesado publicado.

Limitaciones

  • Un solo modelo, una capa, un dataset de matemáticas en inglés y los mismos tutores en train/validación/test.
  • Una dirección compartida con escalares positivos no representa diferencias multidimensionales ni direcciones opuestas entre tutores.
  • El split es por diálogo, no por tutor ni pregunta, y no se publica un manifiesto reproducible.
  • La parte llamada validación entrena el vector y selecciona su checkpoint, sin otro conjunto de ajuste para esa etapa.
  • No hay evaluación humana, resultados de aprendizaje, corrección pedagógica, incertidumbre, significación o varias semillas.
  • SentenceBERT y Prometheus-Eval no tienen checkpoint, prompt ni outputs exactos publicados.
  • El repositorio enlazado no contiene el pipeline específico de steering ni los resultados del paper.
  • Los datos están muy desequilibrados por tutor y 67 conversaciones implican varios tutores.
  • La tarjeta del dataset discrepa entre CC BY-NC y CC BY-NC-SA, y el uso de coeficientes individuales plantea riesgos de perfilado.

Qué no demuestra

  • Que se aprenda un vector distinto o una persona multidimensional por tutor.
  • Que los coeficientes representen personalidad psicológica, identidad estable o intenciones internas.
  • Que el método induzca la persona de un tutor nuevo sin ejemplos etiquetados.
  • Que imitar a un tutor mejore calidad pedagógica, corrección, engagement o aprendizaje.
  • Que todos los tramos mejoren; las tres métricas de similitud empeoran al inicio.
  • Que el eje cualitativo sea causal, disentangled o validado sistemáticamente.
  • Que los resultados sean estables entre semillas, jueces, prompts, modelos, materias o idiomas.
  • Que el artefacto público reproduzca los resultados de extremo a extremo.
  • Que los coeficientes se puedan usar sin riesgos de perfilado o reidentificación.
  • Que el trabajo valide personalidad sintética psicológica en lugar de imitación de estilo tutorial.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2602.07639v2, 15 pages; checked against BEA 2026 final publication, 15 pages, DOI 10.18653/v1/2026.bea-1.7

Fuente consultada: https://arxiv.org/abs/2602.07639

Revisión: Codex 15-page BEA-final visual, arXiv-version, public Eedi split/count/multi-tutor, shared-vector parameterization, automatic-metric, qualitative-validity, privacy/license and linked-artifact audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Llama-3.1-8B-Instruct
  • Unspecified SentenceBERT encoder
  • Unspecified Prometheus-Eval judge

Instrumentos y métricas

  • BiPO-inspired relative preference objective
  • Shared activation steering direction with tutor coefficients
  • ROUGE-L
  • BLEU
  • SentenceBERT cosine similarity
  • Prometheus-Eval pairwise win rate

Datos utilizados

  • Question-Anchored-Tutoring-Dialogues-2k
  • Eedi real tutor-student math dialogues

Evidencia y localización

  • Publicación, diseño, ecuaciones, métricas, resultados, ejemplos y limitaciones: BEA 2026 final paper, pp. 78-92; DOI 10.18653/v1/2026.bea-1.7
  • Versión, aceptación y apéndice técnico: arXiv:2602.07639v2, 15 pages
  • Selección de tutores, splits, diálogos multitutor, validez, métricas, privacidad, licencia y artefacto: reports/verification/article-263-bea-tutor-persona-shared-vector-seen-tutor-automatic-metric-data-and-artifact-audit.json