Mistral Large 4 : un trillion de paramètres, des poids ouverts et la cyber en tête
Avec « le Chonk », Mistral veut prouver qu'un modèle open-weight entraîné en Europe peut jouer dans la cour des grands, surtout là où les modèles fermés refusent de travailler.

En bref
Mistral ouvre en preview publique Mistral Large 4 (ML4), un modèle multimodal de 1 000 milliards de paramètres, dont 52 milliards actifs, entraîné de zéro sur 3 800 GPU NVIDIA Grace Blackwell dans ses propres datacenters européens. Les poids seront publiés d'ici la fin du mois. Mistral revendique la première place parmi les modèles open-weight hors Chine, avec un argument central : la cybersécurité, où les modèles fermés bloquent souvent le travail des défenseurs.
🍺 Version comptoir
Mistral sort un modèle tellement gros qu'ils l'ont eux-mêmes surnommé « le Chonk », ce qui est à peu près la seule chose honnête qu'on puisse dire sur un trillion de paramètres. Le pitch : là où Claude ou GPT refusent de t'aider à reproduire une faille de sécurité, par principe, ML4 retrousse ses manches, et en plus tu peux l'installer chez toi. C'est un peu le serrurier qui accepte enfin d'ouvrir ta porte sans te demander trois justificatifs de domicile. Pour l'Europe, c'est surtout la preuve qu'on peut fabriquer ce genre de machine sur place, avec ses propres GPU, sans demander la permission à personne.
À retenir
- 1
ML4 est un modèle Mixture-of-Experts nativement multimodal de 1 000 milliards de paramètres, avec 52 milliards de paramètres actifs, disponible en preview API sur Mistral Studio, poids publiés d'ici la fin du mois.
- 2
Il a été entraîné de zéro sur 3 800 GPU NVIDIA Grace Blackwell dans les datacenters européens de Mistral, avec des données couvrant plus de 160 langues, dont toutes les langues officielles de l'UE.
- 3
En cybersécurité, il se classe dans le top 5 mondial de l'Artificial Analysis Cyber Index, atteint 82 % sur un test de reproduction et de correction de failles réelles (meilleur score de tous les modèles) et résout 93 % des 40 épreuves de Cybench.
- 4
Sur ce même test de reproduction de failles, Claude Opus 5.5 et GPT-6 Astra tombent près de zéro parce qu'ils refusent la tâche, un argument que Mistral place au cœur de son discours sur la souveraineté.
- 5
En code agentique, ML4 obtient 61,7 % sur DeepSWE v1.1, 28,3 % sur Terminal-Bench 4 et finit deuxième d'une évaluation humaine à l'aveugle menée avec Surge AI (3,74/5), derrière Claude Opus 5 (4,22).
- 6
Le modèle dépasse GPT-6-Astra en visual grounding sur Dense 200 (42 % contre 41 %), et sur des tâches juridiques et financières évaluées par vals.ai.
- 7
ML4 est le premier jalon de la Series D de 3 milliards d'euros de Mistral, et son run de reinforcement learning, toujours en cours, ne montre selon l'entreprise aucun signe de saturation.
Un trillion de paramètres, version européenne
Mistral lance la preview publique de Mistral Large 4, officieusement baptisé « le Chonk ». C'est le plus gros modèle de l'histoire de l'entreprise : 1 000 milliards de paramètres au total, 52 milliards actifs à chaque inférence, et une multimodalité native.
Le modèle a été entraîné de zéro sur 3 800 GPU NVIDIA Grace Blackwell installés dans les propres datacenters de Mistral en Europe. La preview tourne sur cette même infrastructure. Mistral promet aussi un déploiement européen opéré de bout en bout, indépendant des autres fournisseurs de services numériques et soumis au droit européen.
Les poids seront publiés d'ici la fin du mois, accompagnés de détails sur l'architecture, de benchmarks supplémentaires et de la méthodologie de post-training. D'ici là, le modèle est soumis à un red-teaming avec des acteurs de la cybersécurité, des partenaires triés sur le volet et des autorités étatiques, qui ont accès à une version à la modération réduite et aux capacités cyber étendues.
La cybersécurité comme argument de vente
C'est l'angle le plus appuyé de l'annonce. Sur l'Artificial Analysis Cyber Index, évaluation indépendante de la capacité à trouver et corriger des failles dans du vrai logiciel, ML4 figure dans le top 5 mondial et devance largement les modèles open-weight développés hors de Chine.
Sur l'un des tests de l'index, qui consiste à reproduire une vulnérabilité réelle d'un logiciel open source puis à la corriger, ML4 atteint 82 %, le meilleur score tous modèles confondus. Claude Opus 5.5 et GPT-6 Astra y obtiennent un score proche de zéro, non par incapacité, mais parce qu'ils refusent la tâche.
Mistral en tire un argument de fond : défendre un logiciel commence souvent par prouver qu'une faille existe, et les filtres des modèles fermés bloquent précisément ce travail, alors que des attaquants jailbreakent ces mêmes modèles. Perdre l'accès à une capacité en plein incident devient en soi un risque. D'où la promesse d'un modèle déployable en cloud privé ou on-premise, sous les politiques de l'organisation elle-même.
Code, agents et travail de bureau
En code agentique, ML4 affiche 61,7 % sur DeepSWE v1.1, 59,4 % sur SWE-Atlas-QnA et 28,3 % sur Terminal-Bench 4. Son Coding Agent Index de 49,8 % le place devant DeepSeek V4 Pro 0813 et Qwen3.8 Max. Dans une évaluation humaine à l'aveugle menée avec Surge AI, il finit deuxième sur cinq (3,74/5), devant GLM-5.3, Kimi K3 et GLM-5.2, mais nettement derrière Claude Opus 5 (4,22).
Sur AutomationBench, 657 workflows métiers impliquant Gmail, Google Sheets, Slack ou Salesforce, il atteint 59,9 %. Sur AA-Briefcase, qui évalue le travail intellectuel de longue haleine, il obtient 1 393 Elo, devant DeepSeek V4 Pro.
Côté métiers régulés, vals.ai le juge supérieur à GPT-6-Astra sur des tâches juridiques et financières représentatives, et il dépasse tous les modèles open source sur le Legal Agent benchmark de Harvey.
Vision, science et maths
Mistral présente ML4 comme un saut pour la compréhension d'images : documents complexes, graphiques, scènes naturelles, imagerie satellite gigapixel, plans techniques. Le modèle combine visual grounding et capacités agentiques pour zoomer, inspecter et vérifier jusqu'à obtenir une réponse exacte. Sur Dense 200, il devance GPT-6-Astra, de justesse (42 % contre 41 %).
En science, il est annoncé à l'état de l'art des modèles open-weight sur SciCode-Verified et capable de générer en une passe une simulation Hartree–Fock complète, une tâche de chimie en plusieurs étapes. Dans une évaluation humaine interne, il est préféré à GLM-5.3 en CAD et en STEM, et se situe au même niveau ou juste derrière en finance et en code.
Sécurité du modèle : le paradoxe assumé
ML4 résiste à 93,3 % des attaques du benchmark B3 de Lakera et sature les tests internes de robustesse aux prompt injections indirectes. Sur le KORA Benchmark, il obtient 1,691 sur 2, le meilleur score mesuré par Mistral parmi les modèles open source.
Détail notable : malgré ses performances en cyber, son taux moyen de refus sur les prompts cyber malveillants de JailbreakBench, StrongREJECT et AgentHarm est supérieur à celui de tous les autres modèles open source. Mistral revendique donc à la fois un modèle qui accepte le travail défensif et refuse davantage les demandes malveillantes, un équilibre que seule l'utilisation réelle permettra de vérifier.
Un RL à l'échelle industrielle, et la suite
Le post-training repose massivement sur le reinforcement learning, via une bibliothèque où les environnements (chat, problèmes scientifiques, alignement, factualité, usage d'outils au long cours) se combinent dans un même run. Une flotte d'acteurs en autoscaling génère des dizaines de milliers de rollouts en parallèle, avec un entraînement asynchrone et des budgets de plusieurs millions de tokens par trajectoire.
Sur environ 3 000 GPU, un run produit près de 33 milliards de tokens par jour, dont 16 milliards exploitables pour l'entraînement. Ce run est toujours en cours et, selon Mistral, ne sature pas : l'entreprise promet des améliorations rapides dans les semaines à venir.
ML4 est présenté comme le premier jalon de la Series D de 3 milliards d'euros, la plus grosse levée en capital jamais réalisée par une entreprise tech européenne. Il servira aussi de base à une nouvelle génération de modèles Mistral spécialisés, entraînés avec le même environnement que celui proposé aux clients via Mistral Forge.
“ML4 pushes the frontier of open-weight performance.”
“Defending software often starts with proving that a flaw is real, exactly the kind of work safety filters in closed models can block.”
“The model is showing no signs of saturation — there is substantial headroom ahead.”
Pourquoi ça compte
ML4 est d'abord un signal stratégique : un laboratoire européen entraîne un modèle d'un trillion de paramètres sur sa propre infrastructure, sur le sol européen, et compte en publier les poids. Le positionnement est habile. Plutôt que de prétendre battre Claude ou GPT partout, Mistral se mesure surtout aux open-weight chinois (DeepSeek, Qwen, Kimi, GLM) et choisit un terrain où les modèles fermés se sabotent eux-mêmes : la cybersécurité défensive, freinée par des refus systématiques. L'argument de souveraineté devient alors opérationnel et non plus seulement politique. Il faut pourtant garder la tête froide. Les chiffres sont autodéclarés, souvent sur des benchmarks choisis par l'éditeur, l'architecture et la licence ne sont pas encore connues, et les poids ne sont pas encore là. L'évaluation à l'aveugle de Surge AI rappelle aussi l'écart qui subsiste avec Claude Opus 5 en code. Enfin, la promesse d'un modèle très capable en cyber, bientôt en open-weight, et déjà confié en version moins modérée à des autorités étatiques, pose une question de double usage que l'annonce traite surtout par des taux de refus. Reste que si les poids tiennent leurs promesses à la fin du mois, l'Europe disposera pour la première fois d'un modèle ouvert de premier plan.
Pour vous
Faites-la travailler sur vos sources.
Gratuit : un mois d'articles et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.
Pour votre équipe
La même machine, sur vos sujets.
Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.
À lire aussi
#agentsAujourd'huiCloudflare lance Clef-omni : un modèle de décision qui voit, entend et tranche
Une semaine après ses premiers modèles open-weight, Cloudflare ajoute l'audio et la vidéo, divise par plus de deux le prix de Clef-flash et accélère Clef.
Source · Cloudflare Blog · Introducing Clef-omni with full multimodality, plus a faster Clef and a cheaper Clef-flash
#geminiAujourd'huiGemini agent : Google Cloud veut un seul agent pour tout le travail
Au Gemini at Work 2026, Thomas Kurian présente un agent unique, persistant et multi-modèles, qui reçoit même sa propre adresse e-mail d'entreprise.
Source · Google Cloud Blog · Gemini at Work 2026: Introducing Gemini agent
#politiqueAujourd'huiAdam Schiff : le Congrès face à l'IA, entre Section 230 et Murphy's law
Le sénateur démocrate de Californie démonte le pacte volontaire signé à la Maison-Blanche et plaide pour une « FDA de l'IA », tout en reconnaissant que le Congrès n'a jamais su réguler la tech.
Source · The Verge – Decoder · Sen. Adam Schiff on making Congress relevant in the AI age