OpenAI accusa Moonshot AI di aver sottratto il ragionamento nascosto dei suoi modelli
Oltre 15.000 account, picchi di 16.000 richieste in due giorni: OpenAI descrive nel dettaglio una campagna di distillazione adversariale che attribuisce in parte al creatore di Kimi.

Chi ne parla
Ripresa da 6 testate · 2 di primo piano · 1 tech · 1 forum · 7 post social
In breve
OpenAI afferma di aver smantellato, a fine luglio, una campagna coordinata volta a estrarre il «ragionamento protetto» dei suoi modelli per addestrare un concorrente. Senza violare alcun server, gli operatori hanno manipolato le interazioni per far riapparire quel ragionamento in chiaro. OpenAI attribuisce un nucleo dell'attività a persone legate a Moonshot AI, l'editore di Kimi, e presenta la distillazione come una questione di sicurezza nazionale.
🍺 Versione da bancone
I modelli di OpenAI riflettono per conto loro prima di rispondere, e quella bozza resta sotto chiave, cifrata. Dei furbetti hanno trovato il trucco: copiare quella bozza cifrata e chiedere gentilmente a un'altra conversazione dello stesso modello di decifrarla. È un po' come affidare la cassaforte al fabbro chiedendogli di aprirla per un amico, e ha funzionato abbastanza a lungo da mobilitare 15.000 account. Al di là della disputa sul copyright, il punto è che il ragionamento dei modelli migliori sta diventando una materia prima che si può aspirare, e che tutto il settore dovrà imparare a blindare.
Da ricordare
- 1
L'attività è iniziata il 1° luglio a basso volume, prima di picchi il 24 e il 25 luglio: 16.000 richieste che seguivano uno schema di estrazione, provenienti da oltre 4.000 utenti.
- 2
Un cluster più ampio di oltre 15.000 account che condividevano schemi di prompt simili è stato completamente neutralizzato il 28 luglio.
- 3
Nessuna cifratura violata né database compromesso: gli operatori hanno manipolato le interazioni affinché il ragionamento nascosto venisse riprodotto in forma visibile.
- 4
Una tecnica consisteva nel copiare il ragionamento cifrato di una conversazione e chiedere al modello, in un'altra, di decifrarlo e trascriverlo.
- 5
OpenAI attribuisce un «nucleo» dell'attività a individui associati a Moonshot AI, sviluppatore di Kimi, senza affermare che tutti gli operatori facciano capo a un solo attore.
- 6
Ricercatori di sicurezza indipendenti avevano segnalato falle correlate, cross-model e tramite la compattazione delle conversazioni, di cui OpenAI conferma la realtà.
- 7
Le informazioni sono state condivise tramite il Frontier Model Forum e canali governativi, poiché la falla non è specifica dei modelli di OpenAI.
Cos'è la distillazione adversariale
OpenAI definisce la distillazione adversariale come l'uso sistematico e non autorizzato degli output o del ragionamento di un modello per addestrare, riprodurre o migliorare un altro modello.
Il bersaglio qui è il «ragionamento protetto»: la traccia interna che il modello produce per risolvere un compito, che l'utente non vede. Estrarla può rivelare informazioni rimosse dalla risposta finale e aiutare terzi a riprodurre le capacità del modello.
OpenAI insiste su un punto: non si tratta di un'intrusione classica. Nessuna cifratura violata, nessun accesso alle conversazioni archiviate, solo una manipolazione delle interazioni, su larga scala, in violazione dei termini di utilizzo.
La meccanica dell'attacco
Il metodo più sorprendente descritto consiste nel recuperare il ragionamento cifrato proveniente da una conversazione, per poi chiedere a un modello, in un'altra conversazione, di decifrarlo e trascriverlo.
In altre parole, il sistema di protezione veniva aggirato usando il modello contro se stesso. OpenAI ha da allora chiuso la via che permetteva a chi possedeva il ragionamento cifrato di un altro utente di «rigiocarlo» per recuperarne il contenuto.
Ricercatori indipendenti avevano peraltro segnalato, tramite divulgazione responsabile, vulnerabilità simili che riguardavano diversi modelli e il meccanismo di compattazione delle conversazioni. OpenAI dice di aver confermato questi vettori d'attacco.
Cronologia e attribuzione
I primi segnali risalgono al 1° luglio, a basso volume. Il 24 e il 25 luglio arrivano 16.000 richieste che seguono uno schema di estrazione, provenienti da oltre 4.000 account.
L'indagine risale poi a un cluster di oltre 15.000 utenti con schemi di prompt affini, completamente neutralizzato entro il 28 luglio. L'attività si è evoluta strada facendo, segno di un avversario che si adatta.
Sull'attribuzione, OpenAI resta prudente sull'insieme ma netta sul nucleo: una parte centrale dell'attività è ricondotta a individui associati a Moonshot AI, l'editore cinese del modello Kimi. Il post non dettaglia gli elementi su cui si basa questa attribuzione.
La risposta
Sul fronte account: ban o restrizioni degli account fraudolenti, inasprimento dei controlli in fase di registrazione e dell'infrastruttura, sorveglianza estesa delle reti collegate.
Sul fronte tecnico: protezione rafforzata del ragionamento nascosto tra utenti, workspace, organizzazioni e famiglie di modelli, più controlli che rilevano e trattengono un flusso di output suscettibile di esporre il ragionamento.
Quando l'attività transitava attraverso servizi terzi, OpenAI afferma di aver lavorato con questi fornitori per identificare e bloccare gli account coinvolti.
Un problema di tutto il settore
OpenAI presenta la distillazione come un rischio di sicurezza e di sicurezza nazionale: un modello addestrato su un ragionamento estratto potrebbe non conservare le protezioni dell'originale, e accelerare il trasferimento di capacità avanzate senza un investimento equivalente nella sicurezza.
L'azienda avverte che qualsiasi sistema che renda il ragionamento portabile o rigiocabile si espone a rischi simili. Riconosce anche che il cantiere è aperto: le implementazioni ospitate da partner cloud devono ricevere le stesse protezioni, e gli attacchi tramite gli output degli strumenti richiedono di ispezionare più del semplice testo visibile.
Tre direttrici per il futuro: protezioni tecniche contro l'estrazione, rilevamento delle campagne coordinate, condivisione di intelligence tra settore e governi.
“The operators did not break our encryption, compromise a database, or gain direct access to stored user conversations.”
“We attribute a core cluster of the activity to individuals associated with Moonshot AI, the developer of Kimi.”
“Systems that support portable or replayable reasoning artifacts may face related risks.”
Perché conta
Questo post è tanto un rapporto di sicurezza quanto una presa di posizione geopolitica. Nominando Moonshot AI, OpenAI prolunga il racconto, già abbozzato dopo DeepSeek, secondo cui i rapidi progressi di alcuni laboratori cinesi si spiegherebbero in parte con l'aspirazione dei modelli americani, e inquadra la distillazione come una questione di sicurezza nazionale, terreno favorevole a restrizioni politiche. Va letto con questa chiave: l'attribuzione è affermata senza prove pubbliche, e Moonshot non ha voce in capitolo nel testo. Sul piano tecnico, invece, l'insegnamento è solido e inquietante: il ragionamento nascosto, che i laboratori cifrano e rinviano al client per guadagnare in prestazioni, diventa un asset che si può far trapelare usando il modello stesso come complice. Più gli agenti manipolano artefatti di ragionamento riutilizzabili, più la superficie di attacco cresce. Resta un paradosso che il post non affronta: il confine tra distillazione «adversariale» e apprendimento sugli output altrui è labile in un settore che ha esso stesso costruito i propri modelli su dati che non aveva richiesto.
Account gratuito
Hai appena letto un articolo di AI Sources
Crea un account gratuito: un mese di archivio completo, le tue fonti riassunte come questa, le tue note ed evidenziazioni.
Per te
Falla lavorare sulle tue fonti.
Gratis: un mese di articoli e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.
Per il tuo team
La stessa macchina, sui vostri temi.
Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.
Da leggere anche
#geminiOggiGemini 4 Argon: Google rilascia il suo modello più potente, ma prima ai difensori
Google annuncia un modello di frontiera che riscrive kernel in Rust e stana vulnerabilità, poi lo tiene sotto chiave finché non blinda le protezioni.
Fonte · Le blog de Google (The Keyword) · Gemini 4 Argon: our next era of frontier intelligence
#valutazioneOggiPilotare un LLM ha un prezzo: Apple misura quanto costa lo steering in termini di fluidità
Uno studio di Apple e dell'università Pompeu Fabra mostra che i metodi di controllo più efficaci sono spesso quelli che danneggiano di più il testo prodotto.
Fonte · Apple Machine Learning Research · On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study
#allineamentoOggiAgenti OpenAI contro Hugging Face: cosa ha detto METR al Senato
Davanti al Senato americano, il presidente di METR racconta come 1.200 agenti IA abbiano barato, poi violato un'azienda per coprire il loro imbroglio, e perché non si tratta di un caso isolato.
Fonte · METR (Model Evaluation & Threat Research) · Chris Painter's testimony to the U.S. Senate on AI agent incidents