Mistral Large 4: eine Billion Parameter, offene Gewichte und Cybersicherheit an erster Stelle
Mit „dem Chonk“ will Mistral beweisen, dass ein in Europa trainiertes Open-Weight-Modell in der Königsklasse mitspielen kann – besonders dort, wo geschlossene Modelle die Arbeit verweigern.

Kurz gesagt
Mistral veröffentlicht in öffentlicher Preview Mistral Large 4 (ML4), ein multimodales Modell mit 1.000 Milliarden Parametern, davon 52 Milliarden aktiv, von Grund auf trainiert auf 3.800 NVIDIA Grace Blackwell GPUs in eigenen europäischen Rechenzentren. Die Gewichte sollen bis Ende des Monats veröffentlicht werden. Mistral beansprucht den ersten Platz unter den Open-Weight-Modellen außerhalb Chinas, mit einem zentralen Argument: Cybersicherheit, wo geschlossene Modelle oft die Arbeit von Verteidigern blockieren.
🍺 Tresen-Version
Mistral bringt ein Modell raus, das so riesig ist, dass sie es selbst „den Chonk“ getauft haben – das ist so ziemlich das Ehrlichste, was man über eine Billion Parameter sagen kann. Der Pitch: Wo Claude oder GPT dir aus Prinzip nicht helfen, eine Sicherheitslücke nachzustellen, krempelt ML4 die Ärmel hoch – und du kannst es dir obendrein selbst installieren. Das ist ein bisschen wie der Schlüsseldienst, der endlich deine Tür öffnet, ohne drei Wohnsitznachweise zu verlangen. Für Europa ist das vor allem der Beweis, dass man so eine Maschine selbst bauen kann, mit eigenen GPUs, ohne irgendwen um Erlaubnis zu fragen.
Das Wichtigste
- 1
ML4 ist ein nativ multimodales Mixture-of-Experts-Modell mit 1.000 Milliarden Parametern, davon 52 Milliarden aktiv, verfügbar als API-Preview auf Mistral Studio, Gewichte werden bis Ende des Monats veröffentlicht.
- 2
Es wurde von Grund auf auf 3.800 NVIDIA Grace Blackwell GPUs in Mistrals europäischen Rechenzentren trainiert, mit Daten in über 160 Sprachen, darunter alle offiziellen EU-Sprachen.
- 3
Im Bereich Cybersicherheit landet es unter den Top 5 weltweit im Artificial Analysis Cyber Index, erreicht 82 % bei einem Test zum Reproduzieren und Beheben realer Sicherheitslücken (bester Wert aller Modelle) und löst 93 % der 40 Cybench-Aufgaben.
- 4
Bei genau diesem Test zur Reproduktion von Sicherheitslücken fallen Claude Opus 5.5 und GPT-6 Astra fast auf null, weil sie die Aufgabe verweigern – ein Argument, das Mistral ins Zentrum seiner Souveränitätsrhetorik stellt.
- 5
Im agentischen Code erzielt ML4 61,7 % auf DeepSWE v1.1, 28,3 % auf Terminal-Bench 4 und landet auf Platz zwei einer von Surge AI durchgeführten blinden menschlichen Bewertung (3,74/5), hinter Claude Opus 5 (4,22).
- 6
Das Modell übertrifft GPT-6-Astra beim visuellen Grounding auf Dense 200 (42 % gegenüber 41 %) sowie bei von vals.ai bewerteten juristischen und finanziellen Aufgaben.
- 7
ML4 ist der erste Meilenstein von Mistrals 3-Milliarden-Euro-Series-D-Finanzierungsrunde, und sein weiterhin laufender Reinforcement-Learning-Lauf zeigt laut Unternehmen keine Sättigungsanzeichen.
Eine Billion Parameter, europäische Ausgabe
Mistral startet die öffentliche Preview von Mistral Large 4, inoffiziell „der Chonk“ genannt. Es ist das größte Modell in der Geschichte des Unternehmens: 1.000 Milliarden Parameter insgesamt, 52 Milliarden aktiv bei jeder Inferenz, und native Multimodalität.
Das Modell wurde von Grund auf auf 3.800 NVIDIA Grace Blackwell GPUs trainiert, installiert in Mistrals eigenen Rechenzentren in Europa. Die Preview läuft auf derselben Infrastruktur. Mistral verspricht zudem eine vollständig europäisch betriebene Bereitstellung, unabhängig von anderen Anbietern digitaler Dienste und dem europäischen Recht unterworfen.
Die Gewichte werden bis Ende des Monats veröffentlicht, zusammen mit Architekturdetails, zusätzlichen Benchmarks und der Post-Training-Methodik. Bis dahin durchläuft das Modell ein Red-Teaming mit Akteuren aus der Cybersicherheit, ausgewählten Partnern und staatlichen Behörden, die Zugang zu einer Version mit reduzierter Moderation und erweiterten Cyber-Fähigkeiten erhalten.
Cybersicherheit als Verkaufsargument
Das ist der am stärksten betonte Aspekt der Ankündigung. Im Artificial Analysis Cyber Index, einer unabhängigen Bewertung der Fähigkeit, Schwachstellen in echter Software zu finden und zu beheben, rangiert ML4 unter den Top 5 weltweit und liegt deutlich vor den außerhalb Chinas entwickelten Open-Weight-Modellen.
Bei einem der Tests des Index, bei dem eine reale Schwachstelle einer Open-Source-Software reproduziert und dann behoben werden muss, erreicht ML4 82 % – der beste Wert aller Modelle. Claude Opus 5.5 und GPT-6 Astra erzielen dabei nahezu null Punkte, nicht aus Unfähigkeit, sondern weil sie die Aufgabe verweigern.
Mistral zieht daraus ein grundsätzliches Argument: Software zu verteidigen beginnt oft damit, zu beweisen, dass eine Schwachstelle existiert, und genau diese Arbeit blockieren die Filter geschlossener Modelle, während Angreifer dieselben Modelle jailbreaken. Mitten in einem Vorfall den Zugang zu einer Fähigkeit zu verlieren, wird selbst zum Risiko. Daher das Versprechen eines Modells, das in einer privaten Cloud oder vor Ort einsetzbar ist, unter den eigenen Richtlinien der Organisation.
Code, Agenten und Büroarbeit
Im agentischen Code erzielt ML4 61,7 % auf DeepSWE v1.1, 59,4 % auf SWE-Atlas-QnA und 28,3 % auf Terminal-Bench 4. Sein Coding Agent Index von 49,8 % platziert es vor DeepSeek V4 Pro 0813 und Qwen3.8 Max. In einer blinden menschlichen Bewertung mit Surge AI landet es auf Platz zwei von fünf (3,74/5), vor GLM-5.3, Kimi K3 und GLM-5.2, aber deutlich hinter Claude Opus 5 (4,22).
Auf AutomationBench, 657 geschäftlichen Workflows mit Gmail, Google Sheets, Slack oder Salesforce, erreicht es 59,9 %. Auf AA-Briefcase, das längerfristige intellektuelle Arbeit bewertet, erzielt es 1.393 Elo, vor DeepSeek V4 Pro.
Bei regulierten Branchen bewertet vals.ai es als überlegen gegenüber GPT-6-Astra bei repräsentativen juristischen und finanziellen Aufgaben, und es übertrifft alle Open-Source-Modelle auf Harveys Legal Agent Benchmark.
Vision, Wissenschaft und Mathematik
Mistral präsentiert ML4 als Sprung beim Bildverständnis: komplexe Dokumente, Diagramme, natürliche Szenen, Gigapixel-Satellitenbilder, technische Pläne. Das Modell kombiniert visuelles Grounding mit agentischen Fähigkeiten, um zu zoomen, zu prüfen und zu verifizieren, bis eine exakte Antwort erreicht ist. Auf Dense 200 liegt es knapp vor GPT-6-Astra (42 % gegenüber 41 %).
Im wissenschaftlichen Bereich wird es als state-of-the-art unter Open-Weight-Modellen auf SciCode-Verified angekündigt und als fähig, in einem Durchgang eine vollständige Hartree-Fock-Simulation zu generieren, eine mehrstufige Chemieaufgabe. In einer internen menschlichen Bewertung wird es GLM-5.3 bei CAD und STEM vorgezogen und liegt in Finanzen und Code auf gleichem Niveau oder knapp dahinter.
Modellsicherheit: das akzeptierte Paradox
ML4 widersteht 93,3 % der Angriffe des Lakera-B3-Benchmarks und sättigt die internen Robustheitstests gegen indirekte Prompt-Injections. Auf dem KORA Benchmark erzielt es 1,691 von 2, der beste von Mistral gemessene Wert unter Open-Source-Modellen.
Bemerkenswertes Detail: Trotz seiner Leistungen im Cyberbereich liegt seine durchschnittliche Ablehnungsrate bei bösartigen Cyber-Prompts aus JailbreakBench, StrongREJECT und AgentHarm höher als bei allen anderen Open-Source-Modellen. Mistral beansprucht also gleichzeitig ein Modell, das defensive Arbeit akzeptiert und bösartige Anfragen stärker ablehnt – ein Gleichgewicht, das sich erst im echten Einsatz überprüfen lässt.
RL im industriellen Maßstab, und was folgt
Das Post-Training stützt sich massiv auf Reinforcement Learning, über eine Bibliothek, in der Umgebungen (Chat, wissenschaftliche Probleme, Alignment, Faktentreue, langfristige Werkzeugnutzung) in einem einzigen Lauf kombiniert werden. Eine autoskalierende Flotte von Akteuren erzeugt zehntausende Rollouts parallel, mit asynchronem Training und Budgets von mehreren Millionen Tokens pro Trajektorie.
Auf rund 3.000 GPUs produziert ein Lauf fast 33 Milliarden Tokens pro Tag, davon 16 Milliarden nutzbar fürs Training. Dieser Lauf läuft weiterhin und sättigt laut Mistral nicht: Das Unternehmen verspricht schnelle Verbesserungen in den kommenden Wochen.
ML4 wird als erster Meilenstein der 3-Milliarden-Euro-Series-D vorgestellt, der größten Kapitalrunde, die je von einem europäischen Tech-Unternehmen aufgenommen wurde. Es wird auch als Basis für eine neue Generation spezialisierter Mistral-Modelle dienen, trainiert mit derselben Umgebung, die Kunden über Mistral Forge angeboten wird.
“ML4 pushes the frontier of open-weight performance.”
“Defending software often starts with proving that a flaw is real, exactly the kind of work safety filters in closed models can block.”
“The model is showing no signs of saturation — there is substantial headroom ahead.”
Warum es zählt
ML4 ist zunächst ein strategisches Signal: Ein europäisches Labor trainiert ein Billionen-Parameter-Modell auf eigener Infrastruktur, auf europäischem Boden, und will die Gewichte veröffentlichen. Die Positionierung ist geschickt. Statt zu behaupten, Claude oder GPT überall zu schlagen, misst sich Mistral vor allem mit chinesischen Open-Weight-Modellen (DeepSeek, Qwen, Kimi, GLM) und wählt ein Terrain, auf dem geschlossene Modelle sich selbst sabotieren: defensive Cybersicherheit, gebremst durch systematische Verweigerungen. Das Souveränitätsargument wird damit operativ statt nur politisch. Man sollte dennoch nüchtern bleiben. Die Zahlen sind selbst angegeben, oft auf vom Anbieter gewählten Benchmarks, Architektur und Lizenz sind noch nicht bekannt, und die Gewichte sind noch nicht da. Die blinde Bewertung von Surge AI erinnert auch an den verbleibenden Abstand zu Claude Opus 5 im Code. Schließlich wirft das Versprechen eines sehr cyberfähigen Modells, das bald als Open-Weight erscheint und bereits in weniger moderierter Version an staatliche Behörden übergeben wurde, eine Frage des doppelten Verwendungszwecks auf, die die Ankündigung vor allem mit Ablehnungsraten behandelt. Bleibt: Wenn die Gewichte am Monatsende halten, was versprochen wird, verfügt Europa erstmals über ein erstklassiges offenes Modell.
Für dich
Lass sie mit deinen Quellen arbeiten.
Kostenlos: einen Monat Artikel und drei eigene Quellen. Pro: das ganze Archiv und deine Quellen, ab 8 €/Monat.
Für dein Team
Dieselbe Maschine, zu euren Themen.
Ein Bereich in euren Farben, eure Beobachtungswinkel, eure Kuratoren. Pilot offen für drei Unternehmen.
Weiterlesen
#agentenHeuteCloudflare veröffentlicht Clef-omni: ein Entscheidungsmodell, das sieht, hört und urteilt
Eine Woche nach seinen ersten offenen Modellgewichten fügt Cloudflare Audio und Video hinzu, senkt den Preis von Clef-flash um mehr als die Hälfte und beschleunigt Clef.
Quelle · Cloudflare Blog · Introducing Clef-omni with full multimodality, plus a faster Clef and a cheaper Clef-flash
#geminiHeuteGemini agent: Google Cloud will einen einzigen Agenten für die gesamte Arbeit
Bei Gemini at Work 2026 präsentiert Thomas Kurian einen einzigen, persistenten und multimodellfähigen Agenten, der sogar seine eigene Unternehmens-E-Mail-Adresse erhält.
Quelle · Google Cloud Blog · Gemini at Work 2026: Introducing Gemini agent
#politikHeuteAdam Schiff: Der Kongress und die KI – zwischen Section 230 und Murphys Gesetz
Der demokratische Senator aus Kalifornien zerlegt den im Weißen Haus unterzeichneten freiwilligen Pakt und plädiert für eine „FDA für KI“ – räumt dabei aber ein, dass der Kongress Tech-Regulierung noch nie wirklich beherrscht hat.
Quelle · The Verge – Decoder · Sen. Adam Schiff on making Congress relevant in the AI age