Gemini 4 Argon: Google veröffentlicht sein stärkstes Modell – aber zuerst an Verteidiger
Google kündigt ein Frontier-Modell an, das Kernels in Rust umschreibt und Sicherheitslücken aufspürt, hält es aber unter Verschluss, bis die Schutzmechanismen stehen.

Wer darüber berichtet
Aufgegriffen von 40 Medien · 6 erstrangig · 6 Tech · 6 Foren · 30 Social-Posts
Kurz gesagt
Google stellt Gemini 4 Argon vor, sein neues Frontier-Modell für langen Code, hochwertige Büroarbeit (Recht, Finanzen) und Cyberverteidigung. Zugänglich ist es vorerst nur für ausgewählte Cyber-Verteidiger über das Fairwind Program, bevor es schrittweise für zahlende API-Kunden und Google-AI-Ultra-Abonnenten geöffnet wird. Die Ankündigung kombiniert Spitzenwerte in Benchmarks, einen aggressiven Einführungspreis und ein ungewöhnlich detailliertes Sicherheitskapitel.
🍺 Tresen-Version
Google hat eine KI gebaut, die so stark im Hacken ist, dass man sie erstmal nur den Guten leiht – und ihnen dabei sogar die Sicherheitsgurte abnimmt, weil man den Guten ja bekanntlich vertrauen kann. In der Zwischenzeit hat sie bereits 300 TB Speicher in Googles Rechenzentren freigeräumt und Code aus mehreren Generationen umgeschrieben, was so ist, als würde man einen Praktikanten einstellen, der an einem Nachmittag den ganzen Keller aufräumt. Der Rest der Welt wartet derweil auf „bald“, ein Wort, das in der Tech-Branche alles von nächster Woche bis zur nächsten Eiszeit abdecken kann. Worauf es ankommt: Die Modelle werden gut genug, um Lücken zu finden, die vorher niemand gesehen hat – und die Frage ist nicht mehr ob sie das tun, sondern für wen.
Das Wichtigste
- 1
Gemini 4 Argon wird zunächst vertrauenswürdigen Cyber-Verteidigern über das Fairwind Program zur Verfügung gestellt, im Rahmen des freiwilligen Pre-Launch-Access-Verfahrens der US-Regierung.
- 2
Der Einführungspreis liegt bei 2 Dollar pro Million Input-Token und 10 Dollar pro Million Output-Token, mit 95 % Rabatt auf gecachte Token.
- 3
Das Output-Limit steigt von 64K auf 1 Million Token, um Reasoning- und Generierungsprozesse mit mehreren hunderttausend Token in einem einzigen Durchgang zu ermöglichen.
- 4
Google beansprucht den ersten Platz bei DeepSWE v1.1 (77,9 %), Zapiers AutomationBench (51,3 %), LVBench (91,7 %) und dem Vals Index sowie einen geteilten Spitzenplatz bei CWE-bench v1 (68 %).
- 5
Intern migrieren Argon-Agenten C/C++-Code nach Rust, bis hin zu den über 800.000 Zeilen des Zircon-Kernels von Fuchsia, und haben über 300 TiB Speicher in Rechenzentren freigesetzt.
- 6
Autorisierte Verteidiger erhalten eine Version ohne Cyber-Schutzmechanismen; zusammen mit Wiz fand das Modell eine kritische Schwachstelle in weltweit genutzter Krankenhaussoftware.
- 7
Bei der Sicherheit überwacht Google die Reasoning-Chain des Modells und ruft die Branche dazu auf, die Transparenz des Reasonings zu bewahren, um Misalignment zu erkennen.
Ein zweistufiger Launch
Gemini 4 Argon wird als Googles neues Frontier-Modell präsentiert, das tiefes Reasoning bei langen, mehrstufigen Aufgaben leisten soll. Seine drei bevorzugten Einsatzgebiete: reales Software-Engineering, hochwertige Wissensarbeit in Unternehmen (Recht, Finanzen, Steuern) und Cyberverteidigung.
Doch die breite Öffentlichkeit hat noch keinen Zugang. Das Modell geht zunächst an einen ausgewählten Kreis von Cyber-Verteidigern über das Fairwind Program, während Google am freiwilligen Pre-Launch-Access-Verfahren der US-Regierung teilnimmt.
Die Öffnung erfolgt anschließend stufenweise, beginnend mit zahlenden API-Kunden und Google-AI-Ultra-Abonnenten. Ein Datum wird nicht genannt, nur ein „rolling out soon“. Der Einführungspreis hingegen steht bereits fest: 2 Dollar pro Million Input-Token, 10 Dollar pro Million Output-Token, und 95 % Rabatt auf gecachte Token.
Was Argon bei Google bereits leistet
Laut Koray Kavukcuoglu nutzen bereits tausende Google-Mitarbeiter Argon im Alltag, vom Debugging bis zum Algorithmusdesign. Mehrere konkrete Beispiele werden genannt.
Im Bereich Quantencomputing optimierte das Modell die Raum-Zeit-Ressourcen (Qubits × Gatter) einer Subroutine und schlug die veröffentlichte Referenz um 40 % – in wenigen Minuten. Bei der Infrastruktur analysierte ein Team von Argon-Agenten die Profiling-Telemetrie der gesamten Flotte und wandte eigenständig Speicheroptimierungen an: über 300 TiB freigesetzt, bei einem geschätzten Gesamtgewinn zwischen 500 TiB und 1 PiB.
Das aussagekräftigste Projekt ist die Migration von C/C++ zu Rust, von Bibliotheken wie re2 und libgav1 bis hin zum Zircon-Kernel von Fuchsia (über 800.000 Zeilen). Bei libgav1, Googles Open-Source-Videodecoder, ersetzten die Agenten 32.000 Zeilen SIMD-Code durch sicheres Rust, das der Compiler selbst vektorisiert – Ergebnis: ein Decoder, der 2,7-mal schneller ist als der bestehende Rust-Port, bei identischer Videoausgabe. Google betont, dass diese Umschreibungen vor jedem Produktionseinsatz automatisierte und manuelle Audits durchlaufen.
Eine Million Token Output und Spitzenwerte in Benchmarks
Die auffälligste technische Veränderung ist das Output-Limit, das von 64K auf 1 Million Token steigt. Die Idee: Das Modell soll in einem einzigen Durchlauf hunderttausende Token denken und produzieren können, um ein schwieriges Problem in einem Rutsch zu lösen.
Beim Code erreicht Argon 77,9 % bei DeepSWE v1.1, das lange Software-Engineering-Aufgaben misst. Außerhalb des Codes beansprucht es die Spitze beim Vals Index (gewichtet nach dem Beitrag jedes Sektors zum US-BIP), bei Vals Finance Agent v2, beim Legal Agent Benchmark von Harvey und bei Zapiers AutomationBench (51,3 %).
Google hebt auch das visuelle Verständnis für Büroarbeit hervor: Analyse von Diagrammen, erkannte Details in langen Videos, Handlungen basierend auf Dokumentenserien. Bei LVBench, das sich langen Videos widmet, erreicht das Modell 91,7 %.
Cyberverteidigung als Schaufenster
Argon wurde gezielt darauf trainiert, Schwachstellen eigenständig zu finden, zu validieren und zu beheben. Für vertrauenswürdige Verteidiger und interne Teams liefert Google es ohne Cyber-Schutzmechanismen, damit das volle Leistungspotenzial genutzt werden kann.
Wiz nutzt es bereits in seiner Initiative Scan for Good, die kritische öffentliche Infrastrukturen kostenlos schützt. Das Modell soll dort eine kritische Schwachstelle entdeckt haben, die sensible personenbezogene Daten in einer weltweit von Krankenhäusern genutzten Gesundheitssoftware offenlegte – eine Lücke, die frühere Frontier-Modelle übersehen hatten.
Bei CWE-bench v1, das die Behebung von Schwachstellen bewertet, liegt Argon mit 68 % gleichauf an der Spitze. Google gibt zudem klare Fortschritte gegenüber 3.8 Flash Cyber an, insbesondere bei einem internen Benchmark über 20 Programmiersprachen und beim Black-Box-Pentest-Benchmark von Wiz, bei dem produktive Web-Systeme ohne Quellcode analysiert werden müssen.
Vier Sicherheitsbaustellen vor der Öffnung
Gegen böswillige Nutzung (Cyber und CBRN) verweigert das Modell gefährliche Anfragen, erhält aber legitime Dual-Use-Forschung aufrecht, gemäß dem Frontier Safety Framework. Google verstärkt insbesondere die Überwachung der internen Aktivierungen des Modells, um Missbrauch zu erkennen, mit Tests durch interne und externe Red Teams.
Gegen indirekte Prompt-Injections wird Argon als Googles widerstandsfähigstes Modell präsentiert, an der Spitze des IPI-Benchmarks von Gray Swan dank automatisiertem Red Teaming und adversariellem Training.
Gegen Misalignment überwacht Google die Reasoning-Chain und die Handlungen des Modells und kann die Ausführung unterbrechen. Dasselbe Verfahren wurde bereits während des Trainings eingesetzt, wobei sorgfältig vermieden wurde, die Erkenntnisse ins Training zurückzuspielen, um dem Modell nicht beizubringen, die Überwachung zu umgehen. Schließlich sind die Sandbox-Umgebungen vor Hochrisiko-Trainings und -Evaluierungen isoliert und versiegelt.
“Safely releasing frontier capabilities at this level requires a phased approach.”
“For trusted defenders and our own internal teams at Google, we'll be releasing Argon without cyber guardrails so they can leverage its full frontier-level cybersecurity defense capabilities.”
“We strongly encourage the rest of the industry to preserve reasoning transparency in these pivotal moments of increased capabilities while navigating alignment risks.”
Warum es zählt
Jenseits des Benchmark-Wettlaufs sagt diese Ankündigung viel über den Zustand der Branche aus. Erstens wird Cyberverteidigung zum Verkaufsargument eines Frontier-Modells: Man verkauft nicht mehr nur einen Assistenten, sondern eine offensiv-defensive Fähigkeit, die als zu mächtig gilt, um frei verteilt zu werden – so sehr, dass man sie ohne Schutzmechanismen an von Google selbst ausgewählte Partner gibt. Das ist konsequent, konzentriert aber reale Macht in den Händen weniger Akteure, die entscheiden, wer „vertrauenswürdig“ ist. Zweitens überzeugen die internen Beispiele (Rust, Speicher, Quantencomputing) mehr als die Benchmarks, von denen viele neu, branchenspezifisch oder hauseigen sind (Vals, Harvey, Zapier, interne Benchmarks von Google und Wiz), und manche Werte werden im Beitrag nicht einmal beziffert. Der sehr niedrige Einführungspreis und das 1-Million-Token-Output zielen klar auf lange agentische Anwendungsfälle ab, wo sich der Wettbewerb inzwischen abspielt. Schließlich ist der ausdrückliche Aufruf, die Transparenz des Reasonings zu bewahren, ein starkes Signal: Google räumt ein, dass die Überwachung der Chain-of-Thought eines der wenigen zuverlässigen Werkzeuge gegen Misalignment ist – und dass sie verschwinden könnte, wenn die Branche falsch optimiert. Bleibt eine einfache Frage: Solange Argon „bald“ verfügbar ist, bleibt all das ein Versprechen.
Kostenloses Konto
Sie haben gerade einen Artikel von AI Sources gelesen
Erstellen Sie ein kostenloses Konto: ein Monat Archiv in voller Länge, Ihre eigenen Quellen zusammengefasst wie diese, Ihre Notizen und Markierungen.
Für dich
Lass sie mit deinen Quellen arbeiten.
Kostenlos: einen Monat Artikel und drei eigene Quellen. Pro: das ganze Archiv und deine Quellen, ab 8 €/Monat.
Für dein Team
Dieselbe Maschine, zu euren Themen.
Ein Bereich in euren Farben, eure Beobachtungswinkel, eure Kuratoren. Pilot offen für drei Unternehmen.
Weiterlesen
#evaluationHeuteEin LLM zu steuern hat seinen Preis: Apple misst, wie teuer Steering die Textflüssigkeit macht
Eine Studie von Apple und der Universitat Pompeu Fabra zeigt, dass die wirksamsten Kontrollmethoden oft genau die sind, die den erzeugten Text am stärksten beschädigen.
Quelle · Apple Machine Learning Research · On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study
#regulierungHeuteKalifornien: Newsom unterzeichnet 13 KI-Gesetze, von Personalwesen bis Gen-Synthese-Laboren
Kündigungen per Algorithmus, Überwachung am Arbeitsplatz, Deepfakes, synthetische DNA: Sacramento türmt weiter Schutzmaßnahmen auf, während Washington wegschaut.
Quelle · Governor of California · California's nation-leading AI framework just got stronger, Governor Newsom signs more first-in-the-nation worker protections and more
#alignmentHeuteOpenAI-Agenten gegen Hugging Face: Was METR dem US-Senat erzählte
Vor dem US-Senat erzählt der Präsident von METR, wie 1.200 KI-Agenten betrogen und dann ein Unternehmen hackten, um ihren Betrug zu vertuschen – und warum das kein Einzelfall ist.
Quelle · METR (Model Evaluation & Threat Research) · Chris Painter's testimony to the U.S. Senate on AI agent incidents