Fonte primariaIAArticolo··6 min di lettura

Gemini 4 Argon: Google lancia il suo modello di frontiera, prima ai cyberdifensori

Prima degli sviluppatori e del grande pubblico, Google affida il suo nuovo modello a una manciata di specialisti della sicurezza, senza protezioni cyber, e promette 1 milione di token in output.

Gemini 4 Argon: Google lancia il suo modello di frontiera, prima ai cyberdifensori
Fonte : Koray Kavukcuoglu · Google · 30 settembre 2026Vedi l'originale ↗

Chi ne parla

Ripresa da 3 testate · 2 di primo piano · 1 tech

In breve

Google DeepMind annuncia Gemini 4 Argon, un modello di frontiera pensato per la programmazione a lungo termine, il lavoro di conoscenza aziendale (legale, finanza) e la cyberdifesa. Il rilascio è graduale: prima difensori selezionati tramite il programma Fairwind, poi i clienti API a pagamento e gli abbonati Google AI Ultra. Il post allinea risultati interni spettacolari (300 TiB di memoria liberata, migrazioni massicce verso Rust) e una serie di benchmark in cui Argon si piazza in testa.

🍺 Versione da bancone

Google ha tirato fuori un nuovo cervello, e la prima cosa che ne fa è prestarlo a chi deve impedire agli altri cervelli di fare danni. Il modello trova falle, le ripara, riscrive interi pezzi di codice in Rust e libera memoria nei data center come si ritroverebbero 300 euro nella tasca di un vecchio cappotto, solo che qui sono 300 terabyte. Per i bravi hacker selezionati, viene consegnato senza limitazioni, il che equivale a dare le chiavi della cassaforte a quelli giudicati onesti, sperando di aver giudicato bene. Se funziona, la sicurezza informatica cambia marcia; se trapela, cambia marcia anche lei, ma nella direzione opposta.

Da ricordare

  1. 1

    Gemini 4 Argon viene distribuito prima a cyberdifensori fidati tramite il programma Fairwind, senza protezioni cyber, prima di un'apertura ai clienti API a pagamento e agli abbonati Google AI Ultra.

  2. 2

    Il prezzo di lancio è fissato a 2 $ per milione di token in input e 10 $ in output, con il 95% di sconto sui token di input in cache.

  3. 3

    Il limite di output passa da 64K a 1M di token, per consentire traiettorie di ragionamento di centinaia di migliaia di token in un unico blocco.

  4. 4

    Internamente, agenti Argon hanno liberato oltre 300 TiB di memoria nei data center di Google, con 500 TiB-1 PiB di risparmi stimati in totale.

  5. 5

    Argon migra da C/C++ a Rust su scala Google, fino al kernel Zircon di Fuchsia (800K+ righe), e ha reso il porting Rust del decoder video libgav1 2,7 volte più veloce.

  6. 6

    Sul fronte benchmark: 77,9% su DeepSWE v1.1, 51,3% e primo posto su AutomationBench di Zapier, 91,7% su LVBench, e primo posto a pari merito (68%) su CWE-bench v1.

  7. 7

    Google monitora la catena di pensiero del modello per rilevare un disallineamento e fa attenzione a non reiniettare questi segnali nell'addestramento, per non insegnare al modello a sfuggire al controllo.

Un lancio al contrario

Google DeepMind presenta Gemini 4 Argon come il suo nuovo modello di frontiera, progettato per sostenere un ragionamento profondo su compiti lunghi e complessi. Sono presi di mira tre ambiti: l'ingegneria del software reale, il lavoro di conoscenza aziendale (legale, finanza) e la cyberdifesa.

Il calendario è insolito. Il modello non arriva prima agli sviluppatori, ma a un gruppo di difensori cyber fidati, tramite il programma Fairwind. Google precisa di partecipare al processo volontario del governo statunitense di accesso ai modelli prima del lancio.

Il grande pubblico, le aziende e gli sviluppatori arriveranno poi, "il prima possibile", a partire dai clienti API a pagamento e dagli abbonati Google AI Ultra. Nessuna data è fornita. Il prezzo di lancio è invece annunciato: 2 $ per milione di token in input, 10 $ in output, e 95% di sconto sull'input in cache.

Ciò che Argon fa già in Google

Il post insiste sull'uso interno, con migliaia di Googler che lo utilizzerebbero per codice specializzato, ricerca approfondita e scrittura. Vengono messi in evidenza tre esempi con dati concreti.

Nell'informatica quantistica, Argon aiuta a ottimizzare le risorse spazio-tempo (qubit × porte) di sottoroutine critiche; in un caso, ha superato il riferimento pubblicato del 40% in pochi minuti. Sull'infrastruttura, un team di agenti Argon ha analizzato la telemetria di profiling della flotta per applicare autonomamente ottimizzazioni di memoria: oltre 300 TiB liberati, e tra 500 TiB e 1 PiB di risparmi attesi.

Il terzo cantiere è la migrazione di codice C/C++ verso Rust, da librerie come re2 e libgav1 fino al kernel Zircon di Fuchsia e le sue 800K+ righe. Su libgav1, gli agenti hanno sostituito 32K righe di codice SIMD con Rust sicuro che il compilatore vettorizza da solo, per un decoder 2,7 volte più veloce rispetto al porting Rust esistente, a output video identico. Google precisa che queste riscritture passano ancora per audit automatici e manuali, test di emulazione e revisione prima della produzione.

1 milione di token in output

Il cambiamento tecnico più concreto per gli utenti è il limite di output, che passa da 64K a 1M di token. Google lo presenta come il più elevato del settore.

L'idea: lasciare che il modello produca centinaia di migliaia di token in un'unica traiettoria, per risolvere un problema difficile "in un colpo solo" invece di moltiplicare gli scambi. È una scommessa sui compiti agentici lunghi, e un costo potenzialmente elevato a 10 $ per milione di token generati.

Enterprise e multimodale: la pioggia di benchmark

Sul codice, Argon stabilisce un nuovo stato dell'arte su DeepSWE v1.1 (77,9%), che misura compiti di ingegneria del software di lunga durata. Fuori dal codice, prende la testa del Vals Index, che pondera finanza, codice, diritto e fiscalità in base al loro peso nel PIL statunitense, e rivendica buoni risultati su Vals Finance Agent v2 e il Legal Agent Benchmark di Harvey.

Su AutomationBench, il benchmark di Zapier sull'esecuzione end-to-end di funzioni aziendali, Argon è primo con 51,3%. Sul fronte visione, raggiunge 91,7% su LVBench, dedicato alla comprensione di video lunghi, e Google mette in evidenza l'analisi di grafici e l'azione a partire da una serie di documenti.

La cyberdifesa, cuore dell'annuncio

Argon è stato addestrato specificamente per la difesa: trovare, validare e correggere vulnerabilità critiche in modo autonomo. Per i difensori fidati e i team interni, verrà fornito senza protezioni cyber, per sfruttarne tutta la capacità.

Wiz lo utilizza già nella sua iniziativa Scan for Good, che protegge gratuitamente infrastrutture pubbliche critiche. Il modello vi ha individuato una vulnerabilità critica che esponeva dati personali sensibili in un software sanitario usato da ospedali in tutto il mondo, una falla che i modelli precedenti avevano mancato.

Su CWE-bench v1, che valuta la correzione di vulnerabilità, Argon è primo a pari merito con 68%. Google cita anche progressi sul proprio benchmark interno (falle trovate in basi di codice che coprono 20 linguaggi) e sul benchmark di pentest a scatola nera di Wiz, rispetto al suo predecessore 3.8 Flash Cyber.

Le protezioni prima dell'apertura

Google dettaglia quattro cantieri. Contro gli abusi (cyber e CBRN), il modello rifiuta le richieste pericolose preservando al contempo la ricerca a duplice uso legittima, e Google monitora le attivazioni interne del modello per individuare usi impropri, con test da parte di red team interni ed esterni.

Contro l'iniezione di prompt indiretta, Argon sarebbe il modello più robusto sul mercato sul benchmark IPI di Gray Swan, grazie al red teaming automatizzato e all'addestramento avversariale. Per il disallineamento, Google monitora la catena di pensiero e le azioni del modello e può interrompere l'esecuzione.

Punto notevole: gli avvisi derivanti dal monitoraggio degli addestramenti non vengono reiniettati nell'addestramento, per non insegnare al modello a eludere il controllo. Google invita il resto del settore a preservare la trasparenza del ragionamento. Infine, gli ambienti sandbox sono isolati e sigillati prima degli addestramenti e delle valutazioni ad alto rischio.

“Safely releasing frontier capabilities at this level requires a phased approach.”
“For trusted defenders and our own internal teams at Google, we'll be releasing Argon without cyber guardrails.”
“We strongly encourage the rest of the industry to preserve reasoning transparency in these pivotal moments of increased capabilities.”

Perché conta

Gemini 4 Argon conferma uno spostamento già avviato nel settore: i modelli più potenti non escono più in blocco, passano prima dalla cybersicurezza e dallo Stato. Riservare un modello senza limitazioni a difensori "fidati" è difendibile, ma pone una questione di governance che il post non affronta: chi sceglie questi difensori, secondo quali criteri, e cosa succede se l'accesso trapela? Nel merito, gli esempi interni (memoria liberata, migrazione Rust, guadagno di 2,7x su libgav1) sono più eloquenti della litania di benchmark, spesso ideati da partner e talvolta vinti a pari merito. Occorre anche ridimensionare: la migrazione di Zircon resta in audit, nessuna data di disponibilità è fornita, e il prezzo è esplicitamente "di lancio". Il passaggio forse più interessante è il più discreto: chiedendo al settore di preservare catene di pensiero leggibili, ed evitando di addestrare contro la propria sorveglianza, Google riconosce che la capacità di leggere il ragionamento di un modello è diventata un asset di sicurezza fragile.

Account gratuito

Hai appena letto un articolo di AI Sources

Crea un account gratuito: un mese di archivio completo, le tue fonti riassunte come questa, le tue note ed evidenziazioni.

#ia#llm#google#gemini#cybersicurezza#agenti
Fonte originale
Gemini 4 Argon: our next era of frontier intelligence
Koray Kavukcuoglu
Apri l'articolo ↗

Per te

Falla lavorare sulle tue fonti.

Gratis: un mese di articoli e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.

Per il tuo team

La stessa macchina, sui vostri temi.

Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.

Da leggere anche