Source primaireIAArticle··6 min de lecture

Gemini 4 Argon : Google lance son modèle frontière, d'abord aux cyberdéfenseurs

Avant les développeurs et le grand public, Google confie son nouveau modèle à une poignée de spécialistes de la sécurité, sans garde-fous cyber, et promet 1 million de tokens en sortie.

Gemini 4 Argon : Google lance son modèle frontière, d'abord aux cyberdéfenseurs
Source : Koray Kavukcuoglu · Google · 30 septembre 2026Voir l'original ↗

Qui en parle

Repris par 3 médias · 2 de premier rang · 1 tech

En bref

Google DeepMind annonce Gemini 4 Argon, un modèle frontière taillé pour le code au long cours, le travail de connaissance en entreprise (juridique, finance) et la cyberdéfense. Le déploiement est progressif : d'abord des défenseurs triés sur le volet via le programme Fairwind, puis les clients API payants et les abonnés Google AI Ultra. Le billet aligne des résultats internes spectaculaires (300 TiB de mémoire libérés, migrations massives vers Rust) et une batterie de benchmarks où Argon se place en tête.

🍺 Version comptoir

Google a sorti un nouveau cerveau, et la première chose qu'il en fait, c'est le prêter aux gens chargés d'empêcher les autres cerveaux de faire des bêtises. Le modèle trouve des failles, les répare, réécrit des pans entiers de code en Rust et libère de la mémoire dans les data centers comme on retrouverait 300 euros dans la poche d'un vieux manteau, sauf que là c'est 300 téraoctets. Pour les gentils hackers sélectionnés, il est livré sans bridage, ce qui revient à confier les clés du coffre à ceux qu'on a jugés honnêtes, en espérant avoir bien jugé. Si ça marche, la sécurité informatique change de vitesse ; si ça fuit, elle change aussi de vitesse, mais dans l'autre sens.

À retenir

  1. 1

    Gemini 4 Argon est d'abord déployé auprès de cyberdéfenseurs de confiance via le programme Fairwind, sans garde-fous cyber, avant une ouverture aux clients API payants et aux abonnés Google AI Ultra.

  2. 2

    Le prix d'introduction est fixé à 2 $ par million de tokens en entrée et 10 $ en sortie, avec 95 % de réduction sur les tokens d'entrée mis en cache.

  3. 3

    La limite de sortie passe de 64K à 1M tokens, pour permettre des trajectoires de raisonnement de plusieurs centaines de milliers de tokens d'un seul tenant.

  4. 4

    En interne, des agents Argon ont libéré plus de 300 TiB de mémoire dans les data centers de Google, avec 500 TiB à 1 PiB d'économies estimées au total.

  5. 5

    Argon migre du C/C++ vers Rust à l'échelle de Google, jusqu'au noyau Zircon de Fuchsia (800K+ lignes), et a rendu le portage Rust du décodeur vidéo libgav1 2,7 fois plus rapide.

  6. 6

    Côté benchmarks : 77,9 % sur DeepSWE v1.1, 51,3 % et première place sur AutomationBench de Zapier, 91,7 % sur LVBench, et une première place à égalité (68 %) sur CWE-bench v1.

  7. 7

    Google surveille la chaîne de pensée du modèle pour détecter un désalignement et prend soin de ne pas réinjecter ces signaux dans l'entraînement, pour ne pas apprendre au modèle à échapper au contrôle.

Un lancement à l'envers

Google DeepMind présente Gemini 4 Argon comme son nouveau modèle frontière, conçu pour soutenir un raisonnement profond sur des tâches longues et complexes. Trois terrains sont visés : l'ingénierie logicielle réelle, le travail de connaissance en entreprise (juridique, finance) et la cyberdéfense.

Le calendrier est inhabituel. Le modèle n'arrive pas d'abord chez les développeurs, mais chez un groupe de défenseurs cyber de confiance, via le programme Fairwind. Google indique participer au processus volontaire du gouvernement américain d'accès aux modèles avant leur sortie.

Le grand public, les entreprises et les développeurs viendront ensuite, « dès que possible », en commençant par les clients API payants et les abonnés Google AI Ultra. Aucune date n'est donnée. Le prix d'introduction est en revanche annoncé : 2 $ par million de tokens en entrée, 10 $ en sortie, et 95 % de remise sur l'entrée en cache.

Ce qu'Argon fait déjà chez Google

Le billet insiste sur l'usage interne, avec des milliers de Googlers qui l'utiliseraient pour du code spécialisé, de la recherche approfondie et de la rédaction. Trois exemples chiffrés sont mis en avant.

En informatique quantique, Argon aide à optimiser les ressources espace-temps (qubits × portes) de sous-routines critiques ; dans un cas, il a battu la référence publiée de 40 % en quelques minutes. Sur l'infrastructure, une équipe d'agents Argon a analysé la télémétrie de profilage de la flotte pour appliquer d'elle-même des optimisations mémoire : plus de 300 TiB libérés, et entre 500 TiB et 1 PiB d'économies attendues.

Le troisième chantier est la migration de code C/C++ vers Rust, des bibliothèques comme re2 et libgav1 jusqu'au noyau Zircon de Fuchsia et ses 800K+ lignes. Sur libgav1, les agents ont remplacé 32K lignes de code SIMD par du Rust sûr que le compilateur vectorise seul, pour un décodeur 2,7 fois plus rapide que le portage Rust existant, à sortie vidéo identique. Google précise que ces réécritures passent encore par audits automatiques et manuels, tests d'émulation et revue avant la production.

1 million de tokens en sortie

Le changement technique le plus concret pour les utilisateurs est la limite de sortie, qui passe de 64K à 1M tokens. Google la présente comme la plus élevée du secteur.

L'idée : laisser le modèle produire des centaines de milliers de tokens dans une seule trajectoire, pour résoudre un problème difficile « d'un coup » plutôt qu'en multipliant les allers-retours. C'est un pari sur les tâches agentiques longues, et un coût potentiellement élevé à 10 $ le million de tokens générés.

Entreprise et multimodal : la pluie de benchmarks

Sur le code, Argon établit un nouvel état de l'art sur DeepSWE v1.1 (77,9 %), qui mesure les tâches d'ingénierie logicielle longues. Hors code, il prend la tête du Vals Index, qui pondère finance, code, droit et fiscalité selon leur poids dans le PIB américain, et revendique de bons résultats sur Vals Finance Agent v2 et le Legal Agent Benchmark de Harvey.

Sur AutomationBench, le benchmark de Zapier sur l'exécution de bout en bout de fonctions métier, Argon est premier avec 51,3 %. Côté vision, il atteint 91,7 % sur LVBench, consacré à la compréhension de longues vidéos, et Google met en avant l'analyse de graphiques et l'action à partir d'une série de documents.

La cyberdéfense, cœur de l'annonce

Argon a été entraîné spécifiquement pour la défense : trouver, valider et corriger des vulnérabilités critiques de façon autonome. Pour les défenseurs de confiance et les équipes internes, il sera fourni sans garde-fous cyber, afin d'exploiter toute sa capacité.

Wiz l'utilise déjà dans son initiative Scan for Good, qui protège gratuitement des infrastructures publiques critiques. Le modèle y a repéré une vulnérabilité critique exposant des données personnelles sensibles dans un logiciel de santé utilisé par des hôpitaux dans le monde entier, une faille que les modèles précédents avaient manquée.

Sur CWE-bench v1, qui évalue la correction de vulnérabilités, Argon est premier à égalité avec 68 %. Google cite aussi des progrès sur son benchmark interne (des failles trouvées dans des bases de code couvrant 20 langages) et sur le benchmark de pentest en boîte noire de Wiz, face à son prédécesseur 3.8 Flash Cyber.

Les garde-fous avant l'ouverture

Google détaille quatre chantiers. Contre les abus (cyber et CBRN), le modèle refuse les requêtes dangereuses tout en préservant la recherche à double usage légitime, et Google surveille les activations internes du modèle pour repérer les détournements, avec des tests par des red teams internes et externes.

Contre l'injection de prompt indirecte, Argon serait le modèle le plus robuste du marché sur le benchmark IPI de Gray Swan, grâce au red teaming automatisé et à l'entraînement adversarial. Pour le désalignement, Google surveille la chaîne de pensée et les actions du modèle et peut stopper l'exécution.

Point notable : les alertes issues de la surveillance des entraînements ne sont pas réinjectées dans l'entraînement, pour ne pas apprendre au modèle à contourner le contrôle. Google appelle le reste du secteur à préserver la transparence du raisonnement. Enfin, les environnements sandbox sont isolés et scellés avant les entraînements et évaluations à haut risque.

“Safely releasing frontier capabilities at this level requires a phased approach.”
“For trusted defenders and our own internal teams at Google, we'll be releasing Argon without cyber guardrails.”
“We strongly encourage the rest of the industry to preserve reasoning transparency in these pivotal moments of increased capabilities.”

Pourquoi ça compte

Gemini 4 Argon confirme une bascule déjà amorcée dans le secteur : les modèles les plus puissants ne sortent plus d'un bloc, ils passent d'abord par la cybersécurité et par l'État. Réserver un modèle débridé à des défenseurs « de confiance » est défendable, mais pose une question de gouvernance que le billet n'aborde pas : qui choisit ces défenseurs, selon quels critères, et que se passe-t-il si l'accès fuit ? Sur le fond, les exemples internes (mémoire libérée, migration Rust, gain de 2,7x sur libgav1) sont plus parlants que la litanie de benchmarks, souvent conçus par des partenaires et parfois remportés à égalité. Il faut aussi relativiser : la migration de Zircon reste en audit, aucune date de disponibilité n'est donnée, et le prix est explicitement « d'introduction ». Le passage le plus intéressant est peut-être le plus discret : en demandant au secteur de préserver des chaînes de pensée lisibles, et en évitant d'entraîner contre sa propre surveillance, Google reconnaît que la capacité à lire le raisonnement d'un modèle est devenue un actif de sécurité fragile.

Compte gratuit

Vous venez de lire un article d'AI Sources

Créez un compte gratuit : un mois d'archives en entier, vos propres sources résumées comme celle-ci, vos notes et surlignages.

#ia#llm#google#gemini#cybersécurité#agents
Source originale
Gemini 4 Argon: our next era of frontier intelligence
Koray Kavukcuoglu
Source primaireBillet officiel de Google DeepMind, signé par l'un de ses dirigeants, annonçant le propre modèle de l'entreprise.
Ouvrir l'article ↗

Pour vous

Faites-la travailler sur vos sources.

Gratuit : un mois d'articles et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.

Pour votre équipe

La même machine, sur vos sujets.

Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.

À lire aussi