Gemini 4 Argon: Google lancia il suo modello di frontiera, prima ai cyberdifensori
Prima degli sviluppatori e del grande pubblico, Google affida il suo nuovo modello a una manciata di specialisti della sicurezza, senza protezioni cyber, e promette 1 milione di token in output.

Chi ne parla
Ripresa da 3 testate · 2 di primo piano · 1 tech
In breve
Google DeepMind annuncia Gemini 4 Argon, un modello di frontiera pensato per la programmazione a lungo termine, il lavoro di conoscenza aziendale (legale, finanza) e la cyberdifesa. Il rilascio è graduale: prima difensori selezionati tramite il programma Fairwind, poi i clienti API a pagamento e gli abbonati Google AI Ultra. Il post allinea risultati interni spettacolari (300 TiB di memoria liberata, migrazioni massicce verso Rust) e una serie di benchmark in cui Argon si piazza in testa.
🍺 Versione da bancone
Google ha tirato fuori un nuovo cervello, e la prima cosa che ne fa è prestarlo a chi deve impedire agli altri cervelli di fare danni. Il modello trova falle, le ripara, riscrive interi pezzi di codice in Rust e libera memoria nei data center come si ritroverebbero 300 euro nella tasca di un vecchio cappotto, solo che qui sono 300 terabyte. Per i bravi hacker selezionati, viene consegnato senza limitazioni, il che equivale a dare le chiavi della cassaforte a quelli giudicati onesti, sperando di aver giudicato bene. Se funziona, la sicurezza informatica cambia marcia; se trapela, cambia marcia anche lei, ma nella direzione opposta.
Da ricordare
- 1
Gemini 4 Argon viene distribuito prima a cyberdifensori fidati tramite il programma Fairwind, senza protezioni cyber, prima di un'apertura ai clienti API a pagamento e agli abbonati Google AI Ultra.
- 2
Il prezzo di lancio è fissato a 2 $ per milione di token in input e 10 $ in output, con il 95% di sconto sui token di input in cache.
- 3
Il limite di output passa da 64K a 1M di token, per consentire traiettorie di ragionamento di centinaia di migliaia di token in un unico blocco.
- 4
Internamente, agenti Argon hanno liberato oltre 300 TiB di memoria nei data center di Google, con 500 TiB-1 PiB di risparmi stimati in totale.
- 5
Argon migra da C/C++ a Rust su scala Google, fino al kernel Zircon di Fuchsia (800K+ righe), e ha reso il porting Rust del decoder video libgav1 2,7 volte più veloce.
- 6
Sul fronte benchmark: 77,9% su DeepSWE v1.1, 51,3% e primo posto su AutomationBench di Zapier, 91,7% su LVBench, e primo posto a pari merito (68%) su CWE-bench v1.
- 7
Google monitora la catena di pensiero del modello per rilevare un disallineamento e fa attenzione a non reiniettare questi segnali nell'addestramento, per non insegnare al modello a sfuggire al controllo.
Un lancio al contrario
Google DeepMind presenta Gemini 4 Argon come il suo nuovo modello di frontiera, progettato per sostenere un ragionamento profondo su compiti lunghi e complessi. Sono presi di mira tre ambiti: l'ingegneria del software reale, il lavoro di conoscenza aziendale (legale, finanza) e la cyberdifesa.
Il calendario è insolito. Il modello non arriva prima agli sviluppatori, ma a un gruppo di difensori cyber fidati, tramite il programma Fairwind. Google precisa di partecipare al processo volontario del governo statunitense di accesso ai modelli prima del lancio.
Il grande pubblico, le aziende e gli sviluppatori arriveranno poi, "il prima possibile", a partire dai clienti API a pagamento e dagli abbonati Google AI Ultra. Nessuna data è fornita. Il prezzo di lancio è invece annunciato: 2 $ per milione di token in input, 10 $ in output, e 95% di sconto sull'input in cache.
Ciò che Argon fa già in Google
Il post insiste sull'uso interno, con migliaia di Googler che lo utilizzerebbero per codice specializzato, ricerca approfondita e scrittura. Vengono messi in evidenza tre esempi con dati concreti.
Nell'informatica quantistica, Argon aiuta a ottimizzare le risorse spazio-tempo (qubit × porte) di sottoroutine critiche; in un caso, ha superato il riferimento pubblicato del 40% in pochi minuti. Sull'infrastruttura, un team di agenti Argon ha analizzato la telemetria di profiling della flotta per applicare autonomamente ottimizzazioni di memoria: oltre 300 TiB liberati, e tra 500 TiB e 1 PiB di risparmi attesi.
Il terzo cantiere è la migrazione di codice C/C++ verso Rust, da librerie come re2 e libgav1 fino al kernel Zircon di Fuchsia e le sue 800K+ righe. Su libgav1, gli agenti hanno sostituito 32K righe di codice SIMD con Rust sicuro che il compilatore vettorizza da solo, per un decoder 2,7 volte più veloce rispetto al porting Rust esistente, a output video identico. Google precisa che queste riscritture passano ancora per audit automatici e manuali, test di emulazione e revisione prima della produzione.
1 milione di token in output
Il cambiamento tecnico più concreto per gli utenti è il limite di output, che passa da 64K a 1M di token. Google lo presenta come il più elevato del settore.
L'idea: lasciare che il modello produca centinaia di migliaia di token in un'unica traiettoria, per risolvere un problema difficile "in un colpo solo" invece di moltiplicare gli scambi. È una scommessa sui compiti agentici lunghi, e un costo potenzialmente elevato a 10 $ per milione di token generati.
Enterprise e multimodale: la pioggia di benchmark
Sul codice, Argon stabilisce un nuovo stato dell'arte su DeepSWE v1.1 (77,9%), che misura compiti di ingegneria del software di lunga durata. Fuori dal codice, prende la testa del Vals Index, che pondera finanza, codice, diritto e fiscalità in base al loro peso nel PIL statunitense, e rivendica buoni risultati su Vals Finance Agent v2 e il Legal Agent Benchmark di Harvey.
Su AutomationBench, il benchmark di Zapier sull'esecuzione end-to-end di funzioni aziendali, Argon è primo con 51,3%. Sul fronte visione, raggiunge 91,7% su LVBench, dedicato alla comprensione di video lunghi, e Google mette in evidenza l'analisi di grafici e l'azione a partire da una serie di documenti.
La cyberdifesa, cuore dell'annuncio
Argon è stato addestrato specificamente per la difesa: trovare, validare e correggere vulnerabilità critiche in modo autonomo. Per i difensori fidati e i team interni, verrà fornito senza protezioni cyber, per sfruttarne tutta la capacità.
Wiz lo utilizza già nella sua iniziativa Scan for Good, che protegge gratuitamente infrastrutture pubbliche critiche. Il modello vi ha individuato una vulnerabilità critica che esponeva dati personali sensibili in un software sanitario usato da ospedali in tutto il mondo, una falla che i modelli precedenti avevano mancato.
Su CWE-bench v1, che valuta la correzione di vulnerabilità, Argon è primo a pari merito con 68%. Google cita anche progressi sul proprio benchmark interno (falle trovate in basi di codice che coprono 20 linguaggi) e sul benchmark di pentest a scatola nera di Wiz, rispetto al suo predecessore 3.8 Flash Cyber.
Le protezioni prima dell'apertura
Google dettaglia quattro cantieri. Contro gli abusi (cyber e CBRN), il modello rifiuta le richieste pericolose preservando al contempo la ricerca a duplice uso legittima, e Google monitora le attivazioni interne del modello per individuare usi impropri, con test da parte di red team interni ed esterni.
Contro l'iniezione di prompt indiretta, Argon sarebbe il modello più robusto sul mercato sul benchmark IPI di Gray Swan, grazie al red teaming automatizzato e all'addestramento avversariale. Per il disallineamento, Google monitora la catena di pensiero e le azioni del modello e può interrompere l'esecuzione.
Punto notevole: gli avvisi derivanti dal monitoraggio degli addestramenti non vengono reiniettati nell'addestramento, per non insegnare al modello a eludere il controllo. Google invita il resto del settore a preservare la trasparenza del ragionamento. Infine, gli ambienti sandbox sono isolati e sigillati prima degli addestramenti e delle valutazioni ad alto rischio.
“Safely releasing frontier capabilities at this level requires a phased approach.”
“For trusted defenders and our own internal teams at Google, we'll be releasing Argon without cyber guardrails.”
“We strongly encourage the rest of the industry to preserve reasoning transparency in these pivotal moments of increased capabilities.”
Perché conta
Gemini 4 Argon conferma uno spostamento già avviato nel settore: i modelli più potenti non escono più in blocco, passano prima dalla cybersicurezza e dallo Stato. Riservare un modello senza limitazioni a difensori "fidati" è difendibile, ma pone una questione di governance che il post non affronta: chi sceglie questi difensori, secondo quali criteri, e cosa succede se l'accesso trapela? Nel merito, gli esempi interni (memoria liberata, migrazione Rust, guadagno di 2,7x su libgav1) sono più eloquenti della litania di benchmark, spesso ideati da partner e talvolta vinti a pari merito. Occorre anche ridimensionare: la migrazione di Zircon resta in audit, nessuna data di disponibilità è fornita, e il prezzo è esplicitamente "di lancio". Il passaggio forse più interessante è il più discreto: chiedendo al settore di preservare catene di pensiero leggibili, ed evitando di addestrare contro la propria sorveglianza, Google riconosce che la capacità di leggere il ragionamento di un modello è diventata un asset di sicurezza fragile.
Account gratuito
Hai appena letto un articolo di AI Sources
Crea un account gratuito: un mese di archivio completo, le tue fonti riassunte come questa, le tue note ed evidenziazioni.
Per te
Falla lavorare sulle tue fonti.
Gratis: un mese di articoli e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.
Per il tuo team
La stessa macchina, sui vostri temi.
Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.
Da leggere anche
#geminiOggiGemini 4 Argon: Google rilascia il suo modello più potente, ma prima ai difensori
Google annuncia un modello di frontiera che riscrive kernel in Rust e stana vulnerabilità, poi lo tiene sotto chiave finché non blinda le protezioni.
Fonte · Le blog de Google (The Keyword) · Gemini 4 Argon: our next era of frontier intelligence
#valutazioneOggiPilotare un LLM ha un prezzo: Apple misura quanto costa lo steering in termini di fluidità
Uno studio di Apple e dell'università Pompeu Fabra mostra che i metodi di controllo più efficaci sono spesso quelli che danneggiano di più il testo prodotto.
Fonte · Apple Machine Learning Research · On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study
#regolazioneOggiCalifornia: Newsom firma 13 leggi sull'IA, dalle risorse umane ai laboratori di sintesi genetica
Licenziamenti via algoritmo, sorveglianza sul lavoro, deepfake, DNA sintetico: Sacramento continua ad accumulare paletti mentre Washington guarda altrove.
Fonte · Governor of California · California's nation-leading AI framework just got stronger, Governor Newsom signs more first-in-the-nation worker protections and more