Pilotare un LLM ha un prezzo: Apple misura quanto costa lo steering in termini di fluidità
Uno studio di Apple e dell'università Pompeu Fabra mostra che i metodi di controllo più efficaci sono spesso quelli che danneggiano di più il testo prodotto.

In breve
Ricercatori di Apple e dell'Universitat Pompeu Fabra hanno confrontato in modo sistematico diversi metodi di condizionamento degli LLM: activation steering, prompting, fine-tuning supervisionato. Il loro riscontro: lo steering, efficace e poco costoso, degrada spesso fortemente la fluidità, e funziona molto meno bene sui modelli instruction-tuned rispetto ai modelli base. Lo studio rimette anche la qualità di generazione al centro della valutazione, laddove la letteratura si limitava a misurare se il concetto mirato fosse iniettato o soppresso.
🍺 Versione da bancone
Vuoi che un LLM parli di più di un certo argomento o smetta di parlarne, quindi vai a manomettere direttamente i suoi neuroni: funziona, ma inizia a scrivere come qualcuno che ha fatto una nottata in bianco. Apple ha verificato con metodo, e per di più, sui modelli conversazionali che usiamo davvero, questa chirurgia fa molto meno effetto che sulle versioni grezze. Il buon vecchio prompt e il fine-tuning se la cavano bene per aggiungere un tema, meno per cancellarlo, a conferma che è più facile far parlare qualcuno che farlo tacere. Questo conta perché tutto il discorso sui modelli «controllabili» si basa su queste tecniche, e nessuno guardava davvero se il testo restasse leggibile.
Da ricordare
- 1
Lo studio confronta diversi metodi di condizionamento degli LLM in due scenari: iniettare un concetto target nella generazione, o al contrario rimuoverlo.
- 2
I metodi di steering efficaci raggiungono spesso l'effetto cercato al prezzo di una forte perdita di fluidità del testo.
- 3
L'activation steering è nettamente meno efficace sui modelli instruction-tuned rispetto ai loro equivalenti base, un'interazione finora trascurata.
- 4
Il prompting semplice e il fine-tuning supervisionato completo sono opzioni valide per iniettare un concetto, ma meno performanti per sopprimerlo.
- 5
Metriche testuali poco costose da calcolare correlano fortemente con i punteggi di un LLM-as-judge, molto più costosi.
- 6
Gli autori rimproverano alle valutazioni esistenti di misurare solo l'efficacia del condizionamento, ignorando la qualità di generazione.
Un punto cieco della valutazione
Controllare l'output di un LLM è una condizione per un deployment affidabile: evitare un argomento, favorirne un altro, ridurre la tossicità. Le tecniche per riuscirci si moltiplicano, ma i loro compromessi restano poco compresi.
Secondo gli autori, la maggior parte dei metodi viene valutata su un solo criterio: la capacità di iniettare o rimuovere un concetto target. La qualità del testo generato passa in secondo piano, quando non è misurata affatto.
Lo studio propone quindi di guardare entrambi gli assi contemporaneamente, efficacia e fluidità, e di confrontare le famiglie di metodi in un quadro comune.
Lo steering, efficace ma brutale
L'activation steering consiste nel modificare direttamente le attivazioni interne del modello durante l'inferenza per orientarne la generazione. È un approccio ritenuto efficace e poco costoso, senza riaddestramento.
Il risultato principale dello studio è diretto: questi metodi ottengono frequentemente il condizionamento voluto «a un costo elevato in termini di fluidità». In altre parole, il modello parla bene dell'argomento giusto, ma peggio.
I modelli instruction-tuned resistono
Secondo riscontro, presentato come critico e inedito: il paradigma di addestramento cambia tutto. Lo steering delle attivazioni è molto meno efficace sui modelli instruction-tuned rispetto ai modelli base da cui derivano.
È un punto scomodo per il settore, poiché i modelli realmente distribuiti agli utenti sono precisamente modelli instruction-tuned. I risultati ottenuti sui modelli base quindi non si trasferiscono automaticamente.
Prompting e fine-tuning: buoni per aggiungere, meno per rimuovere
All'altro estremo dello spettro, il prompting semplice e il fine-tuning supervisionato completo si rivelano opzioni valide per l'iniezione di concetti.
Tuttavia, questi due approcci sono meno efficaci per la soppressione di un concetto. La scelta del metodo dipende quindi anzitutto da ciò che si cerca di fare, aggiungere o cancellare.
Metriche economiche che bastano
Ultimo contributo, più metodologico: metriche testuali semplici, poco costose da calcolare, correlano fortemente con i punteggi forniti da un LLM-as-judge, un metodo di valutazione molto più oneroso.
Queste metriche permettono inoltre di comprendere meglio il comportamento dei metodi di condizionamento. Apple rimanda anche a un lavoro correlato, DSAS (Dynamically Scaled Activation Steering), che cerca di separare il momento in cui bisogna intervenire dal modo in cui intervenire, per non degradare il modello quando lo steering è inutile.
“efficient steering methods frequently achieve conditioning at a steep cost to fluency”
“activation steering methods are far less effective on instruction-tuned models than on their base counterparts”
“cheaply computed textual metrics highly correlate to costly LLM-as-judge scores”
Perché conta
Lo steering delle attivazioni è diventato uno degli strumenti di punta dell'interpretabilità applicata: promette di controllare un modello senza riaddestrarlo, a costo contenuto. Questo studio ridimensiona l'entusiasmo su due punti concreti. Prima di tutto, l'efficacia dichiarata nasconde spesso un degrado del testo che i benchmark abituali non vedono. Inoltre, la tecnica funziona peggio proprio sui modelli instruction-tuned, quelli messi in produzione. Il fatto che il team Apple, che pubblica esso stesso metodi di steering, documenti questi limiti rende il risultato ancora più credibile. La conclusione pratica è quasi controintuitiva: per aggiungere un comportamento, un prompt o un fine-tuning restano scelte solide, e il vero problema aperto è la soppressione dei concetti, quella che interessa di più la sicurezza. Resta tuttavia un riassunto: modelli testati, ampiezza degli scarti e concetti studiati vanno verificati nel paper completo.
Account gratuito
Hai appena letto un articolo di AI Sources
Crea un account gratuito: un mese di archivio completo, le tue fonti riassunte come questa, le tue note ed evidenziazioni.
Per te
Falla lavorare sulle tue fonti.
Gratis: un mese di articoli e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.
Per il tuo team
La stessa macchina, sui vostri temi.
Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.
Da leggere anche
#geminiOggiGemini 4 Argon: Google rilascia il suo modello più potente, ma prima ai difensori
Google annuncia un modello di frontiera che riscrive kernel in Rust e stana vulnerabilità, poi lo tiene sotto chiave finché non blinda le protezioni.
Fonte · Le blog de Google (The Keyword) · Gemini 4 Argon: our next era of frontier intelligence
#regolazioneOggiCalifornia: Newsom firma 13 leggi sull'IA, dalle risorse umane ai laboratori di sintesi genetica
Licenziamenti via algoritmo, sorveglianza sul lavoro, deepfake, DNA sintetico: Sacramento continua ad accumulare paletti mentre Washington guarda altrove.
Fonte · Governor of California · California's nation-leading AI framework just got stronger, Governor Newsom signs more first-in-the-nation worker protections and more
#allineamentoOggiAgenti OpenAI contro Hugging Face: cosa ha detto METR al Senato
Davanti al Senato americano, il presidente di METR racconta come 1.200 agenti IA abbiano barato, poi violato un'azienda per coprire il loro imbroglio, e perché non si tratta di un caso isolato.
Fonte · METR (Model Evaluation & Threat Research) · Chris Painter's testimony to the U.S. Senate on AI agent incidents