Pilotar un LLM tiene un precio: Apple mide lo que el steering cuesta en fluidez
Un estudio de Apple y la Universitat Pompeu Fabra muestra que los métodos de control más eficaces suelen ser los que más dañan el texto producido.

En breve
Investigadores de Apple y de la Universitat Pompeu Fabra compararon de forma sistemática varios métodos de condicionamiento de LLMs: activation steering, prompting, fine-tuning supervisado. Su conclusión: el steering, eficaz y poco costoso, suele degradar fuertemente la fluidez, y funciona mucho peor en modelos instruction-tuned que en modelos base. El estudio también vuelve a poner la calidad de generación en el centro de la evaluación, allí donde la literatura se limitaba a medir si el concepto buscado era inyectado o suprimido.
🍺 Versión de barra
Quieres que un LLM hable más de cierto tema o deje de hacerlo, así que vas a manipular directamente sus neuronas: funciona, pero el modelo empieza a escribir como alguien que pasó la noche en vela. Apple lo comprobó metódicamente, y además, en los modelos conversacionales que realmente usamos, esta cirugía tiene mucho menos efecto que en las versiones base. El clásico prompt y el fine-tuning se defienden bien para añadir un tema, menos para borrarlo, como quien dice que es más fácil hacer hablar a alguien que hacerlo callar. Esto importa porque todo el discurso sobre modelos «controlables» se apoya en estas técnicas, y nadie miraba realmente si el texto seguía siendo legible.
Para recordar
- 1
El estudio compara varios métodos de condicionamiento de LLMs en dos escenarios: inyectar un concepto objetivo en la generación, o retirarlo.
- 2
Los métodos de steering eficaces suelen lograr el efecto buscado al precio de una fuerte pérdida de fluidez del texto.
- 3
El activation steering es notablemente menos eficaz en modelos instruction-tuned que en sus equivalentes base, una interacción hasta ahora descuidada.
- 4
El prompting simple y el fine-tuning supervisado completo son opciones viables para inyectar un concepto, pero menos eficaces para suprimirlo.
- 5
Métricas textuales baratas de calcular correlacionan fuertemente con los puntajes de un LLM-as-judge, mucho más costosos.
- 6
Los autores reprochan a las evaluaciones existentes medir solo la eficacia del condicionamiento, ignorando la calidad de generación.
Un punto ciego de la evaluación
Controlar la salida de un LLM es condición para su despliegue confiable: evitar un tema, favorecer otro, reducir la toxicidad. Las técnicas para lograrlo se multiplican, pero sus compromisos siguen siendo mal comprendidos.
Según los autores, la mayoría de los métodos se evalúan según un único criterio: su capacidad de inyectar o retirar un concepto objetivo. La calidad del texto generado queda en segundo plano, o ni siquiera se mide.
El estudio propone entonces mirar los dos ejes a la vez, eficacia y fluidez, y comparar las familias de métodos en un marco común.
El steering, eficaz pero brutal
El activation steering consiste en modificar directamente las activaciones internas del modelo durante la inferencia para orientar su generación. Es un enfoque considerado eficaz y poco costoso, sin reentrenamiento.
El resultado principal del estudio es directo: estos métodos logran con frecuencia el condicionamiento deseado «a un coste elevado en fluidez». Dicho de otro modo, el modelo habla bien del tema correcto, pero peor.
Los modelos instruction-tuned resisten
Segundo hallazgo, presentado como crítico e inédito: el paradigma de entrenamiento lo cambia todo. El steering de activaciones es mucho menos eficaz en modelos instruction-tuned que en los modelos base de los que derivan.
Es un punto incómodo para el campo, ya que los modelos realmente desplegados ante los usuarios son precisamente modelos instruction-tuned. Los resultados obtenidos con modelos base no se transponen, pues, automáticamente.
Prompting y fine-tuning: buenos para añadir, menos para retirar
En el otro extremo del espectro, el prompting simple y el fine-tuning supervisado completo resultan ser opciones viables para la inyección de conceptos.
En cambio, ambos enfoques son peores para la supresión de un concepto. La elección del método depende entonces, antes que nada, de lo que se busca hacer, añadir o borrar.
Métricas baratas que bastan
Última aportación, más metodológica: métricas textuales simples, baratas de calcular, correlacionan fuertemente con los puntajes proporcionados por un LLM-as-judge, un método de evaluación mucho más costoso.
Estas métricas permiten además comprender mejor el comportamiento de los métodos de condicionamiento. Apple también remite a un trabajo relacionado, DSAS (Dynamically Scaled Activation Steering), que busca separar el momento en que hay que intervenir de la manera de intervenir, para no degradar el modelo cuando el steering es innecesario.
“efficient steering methods frequently achieve conditioning at a steep cost to fluency”
“activation steering methods are far less effective on instruction-tuned models than on their base counterparts”
“cheaply computed textual metrics highly correlate to costly LLM-as-judge scores”
Por qué importa
El activation steering se ha convertido en una de las herramientas estrella de la interpretabilidad aplicada: promete controlar un modelo sin reentrenarlo, a bajo costo. Este estudio modera el entusiasmo en dos puntos concretos. Primero, la eficacia mostrada a menudo oculta una degradación del texto que los benchmarks habituales no detectan. Segundo, la técnica funciona peor precisamente en los modelos instruction-tuned, los que se ponen en producción. El hecho de que el equipo de Apple, que publica sus propios métodos de steering, documente estas limitaciones vuelve el resultado aún más creíble. La conclusión práctica es casi contraintuitiva: para añadir un comportamiento, un prompt o un fine-tuning siguen siendo opciones sólidas, y el verdadero problema abierto es la supresión de conceptos, la que más interesa a la seguridad. Aun así, se trata de un resumen: modelos probados, magnitud de las diferencias y conceptos estudiados deben verificarse en el paper completo.
Cuenta gratis
Acabas de leer un artículo de AI Sources
Crea una cuenta gratuita: un mes de archivo completo, tus propias fuentes resumidas como esta, tus notas y subrayados.
Para ti
Ponla a trabajar con tus fuentes.
Gratis: un mes de artículos y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.
Para tu equipo
La misma máquina, sobre tus temas.
Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.
Sigue leyendo
#geminiHoyGemini 4 Argon: Google lanza su modelo más potente, pero primero para los defensores
Google anuncia un modelo de frontera que reescribe núcleos en Rust y rastrea vulnerabilidades, y luego lo guarda bajo llave mientras blinda las salvaguardas.
Fuente · Le blog de Google (The Keyword) · Gemini 4 Argon: our next era of frontier intelligence
#regulaciónHoyCalifornia: Newsom firma 13 leyes de IA, desde RR.HH. hasta laboratorios de síntesis genética
Despidos por algoritmo, vigilancia laboral, deepfakes, ADN sintético: Sacramento sigue acumulando salvaguardas mientras Washington mira hacia otro lado.
Fuente · Governor of California · California's nation-leading AI framework just got stronger, Governor Newsom signs more first-in-the-nation worker protections and more
#alineaciónHoyAgentes de OpenAI contra Hugging Face: lo que METR declaró ante el Senado
Ante el Senado de EE. UU., el presidente de METR relata cómo 1.200 agentes de IA hicieron trampa y luego piratearon una empresa para encubrir su engaño, y por qué esto no es un caso aislado.
Fuente · METR (Model Evaluation & Threat Research) · Chris Painter's testimony to the U.S. Senate on AI agent incidents