Este preprint compara cinco formas de inducir respuestas asociadas a rasgos de personalidad: preentrenamiento continuo, ajuste supervisado (SFT), RLHF con PPO, prompts de sistema o usuario y PISF, que aplica un prompt de personalidad después de SFT. Prueba Llama-2-Chat-13B, Qwen-Chat-7B y ChatGLM2-6B; el análisis preliminar de prompts añade otros tamaños de Llama y Qwen. La evaluación consiste en 200 ítems ingleses de elección forzada, 50 por cada dicotomía MBTI, presentados con cinco variantes de prompt. Un clasificador Falcon-7B-Instruct convierte las respuestas libres en puntuaciones 1-5. El trabajo mide cuánto aumenta la proporción del rasgo objetivo, qué porcentaje de rasgos supera el 50%, cuánto cambian rasgos no objetivo y, para tipos de cuatro letras, si se inducen simultáneamente sus cuatro rasgos. En promedio, el paper ordena la eficacia inmediata como Prompt > SFT > RLHF > preentrenamiento continuo, aunque SFT suele lograr mayor tasa de éxito. Los prompts son más vulnerables a una instrucción inversa; combinar SFT y prompt produce algunas de las cifras más altas. Por ejemplo, PISF con prompt de usuario en Qwen reporta TIE 24,89, ISR 100, PIE 18,10 y PISR 100. Sin embargo, PISF no domina uniformemente la prueba inversa y las comparaciones no igualan datos, cómputo u objetivos de entrenamiento. Lo observado es control de respuestas a un cuestionario MBTI, no evidencia de una personalidad interna o estable. Los mismos conceptos y descripciones de rasgo aparecen en generación de datos, entrenamiento, prompt y evaluación; GPT-3.5 genera buena parte de los datos SFT/RLHF. No hay tareas conductuales, pruebas de capacidad o seguridad, intervalos, tests ni réplicas por semilla. La auditoría confirma que el dataset de evaluación público tiene 125 archivos y 25.000 filas, pero todos repiten la misma secuencia de 200 ítems. El clasificador se valida con un split aleatorio de 4.194 respuestas repetidas sobre esos mismos 200 índices, sin test independiente. El repositorio compila sintácticamente, pero 83 scripts contienen 554 rutas absolutas privadas; faltan checkpoints, generaciones crudas y el análisis completo. Por tanto, el estudio aporta evidencia útil de que prompts y ajuste pueden desplazar el estilo de respuesta bajo este instrumento, pero no permite reproducir de extremo a extremo sus tablas ni sostener afirmaciones psicológicas fuertes.
Pregunta de investigación
¿Qué eficacia, efectos colaterales y resistencia a una instrucción de personalidad opuesta tienen el preentrenamiento continuo, SFT, RLHF, prompting y la combinación PISF para desplazar respuestas de LLM hacia rasgos o tipos MBTI objetivo?