Fonte primariaIAArticolo··6 min di lettura

Gemini 4 Argon: Google rilascia il suo modello più potente, ma prima ai difensori

Google annuncia un modello di frontiera che riscrive kernel in Rust e stana vulnerabilità, poi lo tiene sotto chiave finché non blinda le protezioni.

Gemini 4 Argon: Google rilascia il suo modello più potente, ma prima ai difensori
Fonte : Koray Kavukcuoglu · Google · 30 settembre 2026Vedi l'originale ↗

Chi ne parla

Ripresa da 40 testate · 6 di primo piano · 6 tech · 6 forum · 30 post social

In breve

Google svela Gemini 4 Argon, il suo nuovo modello di frontiera pensato per il codice lungo, il lavoro d'ufficio ad alto valore (diritto, finanza) e la cyberdifesa. Per ora è accessibile solo a difensori informatici selezionati tramite il Fairwind Program, prima di un'apertura graduale ai clienti API a pagamento e agli abbonati Google AI Ultra. L'annuncio combina benchmark in testa alla classifica, un prezzo di lancio aggressivo e un capitolo sicurezza insolitamente dettagliato.

🍺 Versione da bancone

Google ha costruito un'IA così brava a fare hacking che ha deciso di prestarla solo ai buoni, togliendole pure le sicurezze, perché i buoni, si sa, sono affidabili. Nel frattempo ha già liberato 300 TB di memoria nei data center di Google e riscritto codice vecchio di generazioni, roba tipo assumere uno stagista che ti sistema la cantina in un pomeriggio. Il resto del mondo, invece, aspetta un "presto" generico, parola che nella tech copre un periodo che va dalla prossima settimana all'era glaciale. Quello che conta: i modelli stanno diventando abbastanza bravi da trovare falle che nessuno aveva mai visto, e la domanda non è più se lo faranno, ma per chi.

Da ricordare

  1. 1

    Gemini 4 Argon viene distribuito prima a difensori informatici fidati tramite il Fairwind Program, nell'ambito del processo volontario di accesso pre-lancio del governo americano.

  2. 2

    Il prezzo di lancio è fissato a 2 dollari per milione di token in input e 10 dollari in output, con uno sconto del 95% sui token in cache.

  3. 3

    Il limite di output passa da 64K a 1 milione di token, per consentire ragionamenti e generazioni di centinaia di migliaia di token in un'unica sessione.

  4. 4

    Google rivendica il primo posto su DeepSWE v1.1 (77,9%), AutomationBench di Zapier (51,3%), LVBench (91,7%) e il Vals Index, oltre a un pareggio in vetta su CWE-bench v1 (68%).

  5. 5

    Internamente, agenti Argon stanno migrando da C/C++ a Rust, fino alle 800K+ righe del kernel Zircon di Fuchsia, e hanno liberato oltre 300 TiB di memoria nei data center.

  6. 6

    I difensori autorizzati ricevono una versione senza protezioni anti-cyber; insieme a Wiz, il modello ha trovato una falla critica in un software ospedaliero usato in tutto il mondo.

  7. 7

    Sul fronte sicurezza, Google monitora la catena di ragionamento del modello e invita l'industria a preservare la trasparenza del ragionamento per individuare il misalignment.

Un lancio in due tempi

Gemini 4 Argon viene presentato come il nuovo modello di frontiera di Google, progettato per sostenere un ragionamento profondo su compiti lunghi e articolati in più fasi. I suoi tre terreni d'elezione: l'ingegneria del software reale, il lavoro di conoscenza in azienda (diritto, finanza, fisco) e la cyberdifesa.

Ma il grande pubblico non vi ha ancora accesso. Il modello parte prima presso una cerchia di difensori informatici tramite il Fairwind Program, mentre Google partecipa al processo volontario di accesso pre-lancio istituito dal governo americano.

L'apertura avverrà poi a gradi, a partire dai clienti API a pagamento e dagli abbonati Google AI Ultra. Nessuna data viene fornita, solo un "rolling out soon". Il prezzo di lancio è invece già annunciato: 2 dollari per milione di token in input, 10 dollari in output, e il 95% di sconto sui token in cache.

Cosa fa già Argon in casa Google

Secondo Koray Kavukcuoglu, migliaia di dipendenti usano già Argon quotidianamente, dal debugging alla progettazione di algoritmi. Vengono forniti diversi esempi con numeri a supporto.

Nel calcolo quantistico, il modello ha ottimizzato le risorse spazio-temporali (qubit × porte) di una subroutine battendo il riferimento pubblicato del 40%, in pochi minuti. Sull'infrastruttura, un team di agenti Argon ha analizzato la telemetria di profiling dell'intera flotta e applicato ottimizzazioni di memoria in modo autonomo: oltre 300 TiB liberati, per un guadagno totale stimato tra 500 TiB e 1 PiB.

Il progetto più significativo è la migrazione da C/C++ a Rust, da librerie come re2 e libgav1 fino al kernel Zircon di Fuchsia (800K+ righe). Su libgav1, il decoder video open source di Google, gli agenti hanno sostituito 32K righe di codice SIMD con Rust sicuro che il compilatore vettorializza da solo, ottenendo un decoder 2,7 volte più veloce della porta Rust esistente, a parità di output video. Google precisa che queste riscritture passano attraverso audit automatizzati e manuali prima di ogni messa in produzione.

Un milione di token in output e benchmark in testa

Il cambiamento tecnico più rilevante è il limite di output, che passa da 64K a 1 milione di token. L'idea: lasciare che il modello rifletta e produca centinaia di migliaia di token in un'unica traiettoria per risolvere un problema difficile in un colpo solo.

Sul codice, Argon registra 77,9% su DeepSWE v1.1, che misura compiti di ingegneria del software di lunga durata. Al di fuori del codice, rivendica il primo posto nel Vals Index (ponderato in base al contributo di ciascun settore al PIL americano), in Vals Finance Agent v2, nel Legal Agent Benchmark di Harvey e in AutomationBench di Zapier (51,3%).

Google mette in evidenza anche la comprensione visiva applicata al lavoro d'ufficio: analisi di grafici, dettagli individuati in video lunghi, azioni derivate da serie di documenti. Su LVBench, dedicato ai video lunghi, il modello raggiunge il 91,7%.

La cyberdifesa come vetrina

Argon è stato addestrato appositamente per trovare, validare e correggere vulnerabilità in modo autonomo. Per i difensori fidati e i team interni, Google lo fornisce senza protezioni anti-cyber, per sfruttarne appieno le capacità.

Wiz lo utilizza già nella sua iniziativa Scan for Good, che protegge gratuitamente infrastrutture pubbliche critiche. Il modello avrebbe scoperto lì una falla critica che esponeva dati personali sensibili in un software sanitario usato da ospedali in tutto il mondo, falla sfuggita ai precedenti modelli di frontiera.

Su CWE-bench v1, che valuta la correzione di vulnerabilità, Argon è in parità al primo posto con il 68%. Google afferma inoltre progressi netti rispetto a 3.8 Flash Cyber, in particolare su un benchmark interno che copre 20 linguaggi e sul benchmark di pentest in scatola nera di Wiz, dove bisogna analizzare sistemi web in produzione senza codice sorgente.

Quattro cantieri di sicurezza prima dell'apertura

Contro gli usi malevoli (cyber e CBRN), il modello rifiuta le richieste pericolose preservando al contempo la ricerca legittima a duplice uso, in conformità con il Frontier Safety Framework. Google rafforza in particolare il monitoraggio delle attivazioni interne del modello per individuare abusi, con test condotti da red team interni ed esterni.

Contro le prompt injection indirette, Argon è presentato come il modello più resistente di Google, in testa al benchmark IPI di Gray Swan grazie al red teaming automatizzato e all'addestramento adversariale.

Contro il misalignment, Google monitora la catena di ragionamento e le azioni del modello, e può interrompere l'esecuzione. Lo stesso dispositivo è stato usato durante l'addestramento, evitando accuratamente di reiniettare le osservazioni nell'addestramento per non insegnare al modello ad aggirare il monitoraggio. Infine, gli ambienti sandbox vengono isolati e sigillati prima degli addestramenti e delle valutazioni ad alto rischio.

“Safely releasing frontier capabilities at this level requires a phased approach.”
“For trusted defenders and our own internal teams at Google, we'll be releasing Argon without cyber guardrails so they can leverage its full frontier-level cybersecurity defense capabilities.”
“We strongly encourage the rest of the industry to preserve reasoning transparency in these pivotal moments of increased capabilities while navigating alignment risks.”

Perché conta

Al di là della corsa ai punteggi, questo annuncio dice molto sullo stato dell'industria. Prima di tutto, la cyberdifesa diventa l'argomento di lancio di un modello di frontiera: non si vende più solo un assistente, si vende una capacità offensivo-difensiva giudicata troppo potente per essere distribuita liberamente, al punto da affidarla senza protezioni a partner scelti dalla stessa Google. È coerente, ma concentra un potere reale nelle mani di pochi attori che decidono chi è "affidabile". Poi, gli esempi interni (Rust, memoria, quantistica) sono più convincenti dei benchmark, molti dei quali recenti, settoriali o proprietari (Vals, Harvey, Zapier, benchmark interni di Google e Wiz), e alcuni punteggi non sono nemmeno quantificati nel post. Il prezzo di lancio molto basso e l'output a 1 milione di token puntano chiaramente agli usi agentici di lunga durata, dove ormai si gioca la concorrenza. Infine, l'appello esplicito a preservare la trasparenza del ragionamento è un segnale forte: Google ammette che il monitoraggio della chain-of-thought è uno dei pochi strumenti affidabili contro il misalignment, e che potrebbe scomparire se l'industria ottimizza male. Resta una domanda semplice: finché Argon è "presto" disponibile, tutto questo rimane una promessa.

Account gratuito

Hai appena letto un articolo di AI Sources

Crea un account gratuito: un mese di archivio completo, le tue fonti riassunte come questa, le tue note ed evidenziazioni.

#ia#llm#google#gemini#cybersecurity#agenti
Fonte originale
Gemini 4 Argon: our next era of frontier intelligence
Koray Kavukcuoglu
Apri l'articolo ↗

Per te

Falla lavorare sulle tue fonti.

Gratis: un mese di articoli e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.

Per il tuo team

La stessa macchina, sui vostri temi.

Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.

Da leggere anche