Fonte primariaIAArticolo··7 min di lettura

Mistral Large 4: un trilione di parametri, pesi aperti e la cyber in prima linea

Con «il Chonk», Mistral vuole dimostrare che un modello open-weight addestrato in Europa può competere con i grandi, soprattutto dove i modelli chiusi si rifiutano di lavorare.

Mistral Large 4: un trilione di parametri, pesi aperti e la cyber in prima linea
Fonte : Mistral AI · MistralVedi l'originale ↗

In breve

Mistral apre in preview pubblica Mistral Large 4 (ML4), un modello multimodale da 1.000 miliardi di parametri, di cui 52 miliardi attivi, addestrato da zero su 3.800 GPU NVIDIA Grace Blackwell nei propri datacenter europei. I pesi saranno pubblicati entro fine mese. Mistral rivendica il primo posto tra i modelli open-weight fuori dalla Cina, con un argomento centrale: la cybersecurity, dove i modelli chiusi spesso bloccano il lavoro dei difensori.

🍺 Versione da bancone

Mistral tira fuori un modello così enorme che se lo sono ribattezzato da soli «il Chonk», il che è praticamente l'unica cosa onesta che si possa dire di un trilione di parametri. Il pitch: dove Claude o GPT si rifiutano di aiutarti a riprodurre una falla di sicurezza, per principio, ML4 si rimbocca le maniche, e per di più te lo installi a casa tua. È un po' come il fabbro che finalmente accetta di aprirti la porta senza chiederti tre documenti di residenza. Per l'Europa, è soprattutto la prova che si può costruire questo tipo di macchina in casa, con GPU proprie, senza chiedere il permesso a nessuno.

Da ricordare

  1. 1

    ML4 è un modello Mixture-of-Experts nativamente multimodale da 1.000 miliardi di parametri, con 52 miliardi di parametri attivi, disponibile in preview API su Mistral Studio, pesi pubblicati entro fine mese.

  2. 2

    È stato addestrato da zero su 3.800 GPU NVIDIA Grace Blackwell nei datacenter europei di Mistral, con dati che coprono oltre 160 lingue, incluse tutte le lingue ufficiali dell'UE.

  3. 3

    In cybersecurity, si colloca nella top 5 mondiale dell'Artificial Analysis Cyber Index, raggiunge l'82% su un test di riproduzione e correzione di falle reali (miglior punteggio tra tutti i modelli) e risolve il 93% delle 40 prove di Cybench.

  4. 4

    Su questo stesso test di riproduzione di falle, Claude Opus 5.5 e GPT-6 Astra crollano quasi a zero perché rifiutano il compito, un argomento che Mistral mette al centro del suo discorso sulla sovranità.

  5. 5

    In coding agentico, ML4 ottiene 61,7% su DeepSWE v1.1, 28,3% su Terminal-Bench 4 e si classifica secondo in una valutazione umana alla cieca condotta con Surge AI (3,74/5), dietro Claude Opus 5 (4,22).

  6. 6

    Il modello supera GPT-6-Astra nel visual grounding su Dense 200 (42% contro 41%), e su compiti giuridici e finanziari valutati da vals.ai.

  7. 7

    ML4 è la prima tappa del Series D da 3 miliardi di euro di Mistral, e il suo run di reinforcement learning, ancora in corso, non mostra secondo l'azienda alcun segno di saturazione.

Un trilione di parametri, versione europea

Mistral lancia la preview pubblica di Mistral Large 4, ufficiosamente soprannominato «il Chonk». È il modello più grande nella storia dell'azienda: 1.000 miliardi di parametri totali, 52 miliardi attivi a ogni inferenza, e una multimodalità nativa.

Il modello è stato addestrato da zero su 3.800 GPU NVIDIA Grace Blackwell installate nei datacenter europei di Mistral. La preview gira sulla stessa infrastruttura. Mistral promette anche un deployment europeo gestito end-to-end, indipendente da altri fornitori di servizi digitali e soggetto al diritto europeo.

I pesi saranno pubblicati entro fine mese, accompagnati da dettagli sull'architettura, benchmark aggiuntivi e la metodologia di post-training. Fino ad allora, il modello è sottoposto a red-teaming con attori della cybersecurity, partner selezionati e autorità statali, che hanno accesso a una versione con moderazione ridotta e capacità cyber estese.

La cybersecurity come argomento di vendita

È l'angolo più enfatizzato dell'annuncio. Sull'Artificial Analysis Cyber Index, valutazione indipendente della capacità di trovare e correggere falle in software reale, ML4 figura nella top 5 mondiale e supera ampiamente i modelli open-weight sviluppati fuori dalla Cina.

Su uno dei test dell'indice, che consiste nel riprodurre una vulnerabilità reale di un software open source e poi correggerla, ML4 raggiunge l'82%, il miglior punteggio tra tutti i modelli. Claude Opus 5.5 e GPT-6 Astra ottengono un punteggio vicino allo zero, non per incapacità, ma perché rifiutano il compito.

Mistral ne trae un argomento di fondo: difendere un software spesso inizia col dimostrare che una falla esiste, e i filtri dei modelli chiusi bloccano proprio questo lavoro, mentre gli attaccanti riescono a fare jailbreak di quegli stessi modelli. Perdere l'accesso a una capacità nel pieno di un incidente diventa di per sé un rischio. Da qui la promessa di un modello distribuibile in cloud privato o on-premise, sotto le politiche dell'organizzazione stessa.

Codice, agenti e lavoro d'ufficio

In coding agentico, ML4 segna 61,7% su DeepSWE v1.1, 59,4% su SWE-Atlas-QnA e 28,3% su Terminal-Bench 4. Il suo Coding Agent Index del 49,8% lo colloca davanti a DeepSeek V4 Pro 0813 e Qwen3.8 Max. In una valutazione umana alla cieca condotta con Surge AI, finisce secondo su cinque (3,74/5), davanti a GLM-5.3, Kimi K3 e GLM-5.2, ma nettamente dietro a Claude Opus 5 (4,22).

Su AutomationBench, 657 workflow aziendali che coinvolgono Gmail, Google Sheets, Slack o Salesforce, raggiunge il 59,9%. Su AA-Briefcase, che valuta il lavoro intellettuale di lunga durata, ottiene 1.393 Elo, davanti a DeepSeek V4 Pro.

Sul fronte dei settori regolamentati, vals.ai lo giudica superiore a GPT-6-Astra su compiti giuridici e finanziari rappresentativi, e supera tutti i modelli open source sul Legal Agent benchmark di Harvey.

Visione, scienza e matematica

Mistral presenta ML4 come un salto nella comprensione delle immagini: documenti complessi, grafici, scene naturali, imagery satellitare gigapixel, disegni tecnici. Il modello combina visual grounding e capacità agentiche per zoomare, ispezionare e verificare fino a ottenere una risposta esatta. Su Dense 200, supera GPT-6-Astra, di misura (42% contro 41%).

In ambito scientifico, è annunciato allo stato dell'arte tra i modelli open-weight su SciCode-Verified e capace di generare in un solo passaggio una simulazione Hartree–Fock completa, un compito di chimica multi-step. In una valutazione umana interna, è preferito a GLM-5.3 in CAD e STEM, e si colloca allo stesso livello o appena dietro in finanza e codice.

Sicurezza del modello: il paradosso assunto

ML4 resiste al 93,3% degli attacchi del benchmark B3 di Lakera e satura i test interni di robustezza contro le prompt injection indirette. Sul KORA Benchmark, ottiene 1,691 su 2, il miglior punteggio misurato da Mistral tra i modelli open source.

Dettaglio notevole: nonostante le sue prestazioni in ambito cyber, il suo tasso medio di rifiuto sui prompt cyber malevoli di JailbreakBench, StrongREJECT e AgentHarm è superiore a quello di tutti gli altri modelli open source. Mistral rivendica quindi contemporaneamente un modello che accetta il lavoro difensivo e rifiuta maggiormente le richieste malevole, un equilibrio che solo l'uso reale permetterà di verificare.

Un RL su scala industriale, e il seguito

Il post-training si basa massicciamente sul reinforcement learning, tramite una libreria dove gli ambienti (chat, problemi scientifici, allineamento, fattualità, uso di strumenti a lungo termine) si combinano in uno stesso run. Una flotta di attori in autoscaling genera decine di migliaia di rollout in parallelo, con un addestramento asincrono e budget di diversi milioni di token per traiettoria.

Su circa 3.000 GPU, un run produce quasi 33 miliardi di token al giorno, di cui 16 miliardi sfruttabili per l'addestramento. Questo run è ancora in corso e, secondo Mistral, non satura: l'azienda promette miglioramenti rapidi nelle prossime settimane.

ML4 è presentato come la prima tappa del Series D da 3 miliardi di euro, la più grande raccolta di capitali mai realizzata da un'azienda tech europea. Servirà anche come base per una nuova generazione di modelli Mistral specializzati, addestrati con lo stesso ambiente offerto ai clienti tramite Mistral Forge.

“ML4 pushes the frontier of open-weight performance.”
“Defending software often starts with proving that a flaw is real, exactly the kind of work safety filters in closed models can block.”
“The model is showing no signs of saturation — there is substantial headroom ahead.”

Perché conta

ML4 è innanzitutto un segnale strategico: un laboratorio europeo addestra un modello da un trilione di parametri sulla propria infrastruttura, su suolo europeo, e conta di pubblicarne i pesi. Il posizionamento è abile. Piuttosto che pretendere di battere Claude o GPT ovunque, Mistral si misura soprattutto con gli open-weight cinesi (DeepSeek, Qwen, Kimi, GLM) e sceglie un terreno dove i modelli chiusi si autosabotano: la cybersecurity difensiva, frenata da rifiuti sistematici. L'argomento della sovranità diventa così operativo e non più solo politico. Bisogna comunque mantenere la testa fredda. I numeri sono autodichiarati, spesso su benchmark scelti dall'editore, l'architettura e la licenza non sono ancora note, e i pesi non sono ancora disponibili. La valutazione alla cieca di Surge AI ricorda anche il divario che resta con Claude Opus 5 nel codice. Infine, la promessa di un modello molto capace in ambito cyber, presto in open-weight, e già affidato in versione meno moderata ad autorità statali, pone una questione di doppio uso che l'annuncio affronta soprattutto tramite i tassi di rifiuto. Resta che se i pesi manterranno le promesse a fine mese, l'Europa disporrà per la prima volta di un modello aperto di primo piano.

#llm#mistral#open weights#cybersecurity#sovranità#europa
Fonte originale
Introducing Mistral Large 4
Mistral AI
Apri l'articolo ↗

Per te

Falla lavorare sulle tue fonti.

Gratis: un mese di articoli e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.

Per il tuo team

La stessa macchina, sui vostri temi.

Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.

Da leggere anche