Jev: das Modell, das für den Aufruf durch Code gebaut wurde, nicht durch Menschen
Diogo Almeida, ehemals OpenAI, erklärt, warum er eine neue Klasse von „System-One“-Modellen geschaffen hat — und warum er öffentliche Benchmarks, Refusals und Pretraining ablehnt.
Kurz gesagt
In einem über zweistündigen Interview im Latent-Space-Studio erläutert der Gründer von TypeSafe die These hinter Jev: ein Modell, dessen Konsument der Code ist, optimiert auf „Intelligenz pro Dollar“, ohne Chain-of-Thought oder Refusals. Dabei zerlegt er RLHF, öffentliche Benchmarks und die Debatte um das „Pacing“ der Frontier-Modelle und erzählt, warum er OpenAI verließ, nachdem er InstructGPT vorangetrieben hatte.
🍺 Tresen-Version
Seit drei Jahren wird uns erzählt, KI werde unser Büro-Kollege. Er hält das für eine Fehlbesetzung: KI ist kein Praktikant, sondern eine ziemlich begabte Datenbank, die man aus einer Schleife heraus eine Million Mal am Tag aufruft. Daher ein Modell, das nicht plaudert, nichts verweigert, nicht laut nachdenkt und einfach drei Dinge zurückgibt: einen unscharfen Bool, einen Score, eine Auswahl. Wenn das funktioniert, kommt die KI-Revolution nicht als genialer Chatbot, sondern als banale Software, die plötzlich ganz allein die richtigen Entscheidungen trifft.
Das Wichtigste
- 1
Jev gehört zu einer Modellklasse, die TypeSafe „System One“, „Machine Native“ oder „Large Programmable“ nennt: Konsument der Ausgabe ist Code, kein Mensch.
- 2
Nur drei Primitiven — nule (von Bernoulli abgeleitet), score und choice — entsprechen einem if, einer Sortierung/Schwelle und einem switch über ein enum.
- 3
Das Modell ist auf „Intelligenz pro Dollar“ optimiert (daher der Name, in Anlehnung an das Jevons-Paradoxon), nicht auf Geschwindigkeit oder Rankings.
- 4
Almeida bezeichnet sich als „extrem gegen öffentliche Benchmarks“: zu leicht manipulierbar, sie sollten interner Evaluierung durch Entwickler an ihren eigenen Workflows Platz machen.
- 5
Keine Refusals in der API: „refusal is obviously a type error“ — ein zufälliges Refusal in einer im Hintergrund laufenden Abhängigkeit bricht die Software.
- 6
Die Daten sind vollständig synthetisch, und das Unternehmen weigert sich, mit Nutzerdaten zu trainieren, um nicht auf die Gegenwart zu overfitten.
- 7
Genannte Zahlen: über 1.000 Milliarden Tokens pro Tag durchgesetzt, auch nachts, 100.000 Personen im Discord, und praktisch kein Umsatz vor dem Launch.
Kapitel
Cold Open: das Rätsel der Automatisierung
Wie kann eine KI, die anspruchsvolle Mathematikprobleme löst, immer noch nicht die grundlegendsten Aufgaben automatisieren? Der Automatisierungsmotor existiert, es fehlen die Steckdosen.
Launch-Woche: „never been worse“
Gemütszustand des Gründers nach einem Launch, der die Timeline sättigte, und die Entscheidung, Discord-Town-Halls vor Investorengesprächen zu priorisieren.
Was ist Jev?
Definition der neuen Modellklasse: System One, Machine Native, Large Programmable, mit Code als Konsument und Intelligenz pro Dollar als Metrik.
RLHF, Mode Collapse und LeCuns Folie
Das Mode Dropping von RLHF erklärt, warum die von LeCun vorhergesagte Fehlerakkumulation sich nicht bestätigt — um den Preis einer zerstörten Kalibrierung.
Warum Jev niemals ablehnt
Refusal als Typfehler in einer API; Unterscheidung zwischen Capability-Alignment und Safety-Alignment; Intelligenz als Datenbank statt Kollege.
Anti-öffentliche-Benchmarks
Warum öffentliche Benchmarks unkontrollierbar und manipulierbar sind, und was sie ersetzen sollte: Vibes, Vertrauen, dann Evaluation im tatsächlichen Workflow.
Die „bitterste Lektion“: Daten zuerst
Daten zählen mehr als Compute, RLCD als neuer North Star, und die Obsession, „Data People“ einzustellen.
Determinismus gegen Robustheit
Vorerst kein Seed: die richtige Eigenschaft wäre Robustheit, getestet durch Einschleusen von UUIDs in Prompts.
Modellversionen und LTS
Zusage, ein deployetes Modell nicht zu ändern, keine Zusage zu langfristigem Support, und die Annahme eines LTS für Jev 1.13.0.
API-Design: nule, score, choice
Ursprung der Namen, Ablehnung bestehender Typen, und Entsprechung zu if, Schwelle und switch über ein enum.
Wie man seine Anfragen strukturiert
Zerlegen bis zur minimalen semantischen Einheit, strukturiertes JSON statt Templates verwenden, viele Fragen parallel stellen.
System 1 gegen System 2
Warum pretrainierte LLMs grundlegend System-One-Denker sind, und was RLVR gebracht hat — mit seiner fraktalen Fragilität.
Vor dem Launch: mehr als die Hälfte verstand es nicht
Rückblick auf eine enttäuschende Validierungsphase, das Fehlen von Umsatz und das Hinterfragen des Product-Market-Fit-Begriffs.
Anwendungsfamilien und Coding Agents
Dark Data, Echtzeit, Verifikation, Smart Software — und die Kritik an der „Tyrannei des KV-Caches“ in Coding Agents.
Die Debatte über das Abbremsen der Frontier
Die gemeinsame Erklärung der Labs setzt seiner Ansicht nach voraus, dass immer mehr RLVR nötig ist — eine Annahme, die er für nicht universell hält.
Von InstructGPT zum Abschied von OpenAI
Der Kampf um den Rollout von InstructGPT, das an Sam Altman geschickte Dokument, und die Gründung von TypeSafe mit Eric und dann Sasha.
Die Baustellen, die er anderen überlässt
Intelligente Videospiele und die Neugestaltung von Coding Agents jenseits des KV-Caches: zwei Richtungen, die er sich von anderen erforscht wünscht.
Eine neue Modellklasse: Code als Kunde
Ausgangspunkt ist ein Gegensatz der Aufgaben. Pretraining optimiert die Autovervollständigung des Internets, RLHF optimiert die Antwort an einen Menschen, RLVR optimiert überprüfbare Outputs. TypeSafe beansprucht ein viertes Ziel, RLCD genannt: Outputs erzeugen, die direkt von Code konsumiert werden. Daher der Firmenname TypeSafe.
Konkret schreibt Jev keinen Fließtext. Er stellt drei Primitiven zur Verfügung: nule (abgeleitet von der Bernoulli-Wahrscheinlichkeit, ein kontinuierlicher Bool), score und choice. Almeida beschreibt sie als bewusst neue Typen, die nicht mit einem bool, int oder Function Call verwechselt werden dürfen.
Die Entsprechung zum Code ist explizit: ein nule speist ein if, ein score eine Sortierung oder Schwelle, ein choice einen switch über ein enum. „Es wird weitere Typen geben, und sie werden Programmierprimitiven entsprechen“, kündigt er an.
Der Name Jev kommt vom Jevons-Paradoxon. Die interne Markenlogik ist klar: Jev bezeichnet die Modellfamilie, die auf der Frontier von Intelligenz pro Dollar bleibt. Nicht die absolut intelligenteste — die intelligenteste zu einem gegebenen Preis.
Der Prozess gegen RLHF: Mode Collapse und Kalibrierung
Das ist der technischste Teil des Interviews, und er kommt von jemandem, der an InstructGPT gearbeitet hat. Laut Almeida hat niemand die Nebenwirkungen von RLHF betrachtet, insbesondere das Mode Dropping: Das Modell gibt die Minderheitsmodi der Verteilung auf, um nur das Sicherste zu produzieren.
Damit erklärt er ein bekanntes Paradox. Yann LeCuns berühmte Folie über die Fehlerakkumulation mit zunehmender Sequenzlänge sei, so sagt er, „mathematisch offensichtlich, aber empirisch offensichtlich falsch“. Der Grund: Um bei langen Ketten nicht zu entgleisen, werden RLHF-Modelle ultra-konservativ und verlieren ihre Kalibrierung.
Diese gebrochene Kalibrierung sei für ihn „ein Gift“ in den Wahrscheinlichkeitsverteilungen über Zeichenketten — und der Grund, warum man schlechte Entscheidungen trifft, wenn man Textmodelle überlastet.
Er hält LeCun für einen der treffsichersten Kommentatoren der Branche, will sich aber zu JEPA nicht festlegen: „sehr schöne frühe Forschung“, aber für ihn noch nicht pragmatisch.
Weder Refusals noch Benchmarks: die Plattform-Doktrin
Zum Thema Sicherheit ist die Haltung eindeutig. Almeida ist nicht gegen Sicherheit als Prinzip, hält aber Safety Alignment für nicht ausgerichtet auf die Nutzer einer API. Ein Refusal sei „ein type error“: akzeptabel in einem Consumer-Produkt, unsinnig in einer Abhängigkeit, die im Hintergrund läuft.
Seine Analogie kehrt mehrfach wieder: „Intelligenz wird eher einer Datenbank ähneln als einem Kollegen.“ Und es sei nicht Aufgabe der Datenbank-Engine, die nachgelagerte Nutzung zu beurteilen. Zum militärischen Einsatz räumt er eine persönliche Präferenz ein, weigert sich aber, sie in die Technologieschicht einzuschreiben, mit der Begründung, dass jede Überanpassung „die Intelligenz zerbricht“.
Gleiche Logik bei öffentlichen Benchmarks. Er erinnert daran, dass früher jedes Labor ein eigenes Team hatte, das Daten sammelte, die MMLU ähnelten. Seine Schlussfolgerung: „langfristig braucht man Vibes und Vertrauen“, dann eine Evaluation im tatsächlichen Workflow. Intern existieren Evals — die Disziplin besteht darin, sie nicht zu manipulieren.
Die Kosten dieser Haltung waren real: bei der vorherigen Finanzierungsrunde glaubte ihnen niemand, weil sie keine Zahlen vorweisen konnten. Er sagt, er sei aus Prinzip dabei geblieben. Er bezeichnet sich auch als „anti-Demos“, selbst bei schmeichelhaften Demos aus seiner eigenen Community.
Zuverlässigkeit, Versionen, GPUs: die Versprechen an Entwickler
Kein Seed, vorerst kein Determinismus. Er hält Determinismus für Unit-Tests interessant, meint aber, die eigentlich wünschenswerte Eigenschaft sei Robustheit: semantisch identische Eingaben, ähnliche Ausgaben. Ihr hauseigener Test besteht darin, UUIDs in Prompts einzuschleusen und die Stabilität der Antworten zu prüfen.
Bei Versionen ist die Zusage klar: „wir werden unsere Modelle nach dem Deployment nicht ändern“. Andererseits gibt es kein Versprechen zu langfristigem Support — sie planen, deutlich schneller zu iterieren als übliche Anbieter, mit der Annahme eines temporären LTS für die stark genutzte Version Jev 1.13.0.
Der Kontext ist eine anhaltende GPU-Knappheit. Das ist auch das ökonomische Argument ihrer Positionierung: weniger Intelligenz pro Dollar bedeutet mehr GPU für dasselbe Ergebnis. Erklärtes Ziel ist nicht das Onboarding von Großkunden, sondern das Werkzeug in möglichst viele Hände zu bringen.
Fine-Tuning ist nicht ausgeschlossen, aber nicht vorgesehen: er fürchtet den Schrotflinten-Effekt und setzt lieber auf Kalibrierung und Kaskaden von Modellen unterschiedlicher Größe.
Wie man es benutzt, laut seinem Schöpfer
Sein Hauptrat lässt sich in einem Wort zusammenfassen: zerlegen. Viele kleine, unabhängige Fragen stellen statt einer großen, bis hinunter zur feinsten semantischen Einheit. Sein Beispiel: nicht fragen „soll ich hier ablehnen?“, sondern jede mögliche Refusal-Situation separat abfragen.
Der Vorteil liegt im Software-Engineering. Jede Frage wird messbar, jeder Bug wird durch Hinzufügen einer Frage oder Anpassen einer Schwelle behoben, und der Fall wird zu einem permanenten Test, geschützt vor Context Rot. Er fasst zusammen: „das ist Machine Learning ohne Machine Learning“.
Zweiter Rat: aufhören, alles in Zeichenketten zu packen. State, Anweisungen und Kriterien vertragen strukturiertes JSON. System-Messages beschreibt er als „üble globale Variablen“, in die man alles stapelt und hofft, dass jede Anweisung durchkommt.
Bei den Anwendungsfällen unterscheidet er vier große Familien: Dark Data, die Unternehmen aus Kostengründen bislang nicht durch LLMs schicken wollten, Coding Agents, Echtzeit-Assistenten und die systematische Überprüfung von LLM-Aufrufen. Computer Use kam dagegen überraschend.
OpenAI, der KI-Winter und die Debatte um das „Pacing“
Der biografische Teil beleuchtet den Rest. Almeida erzählt, wie er dafür kämpfte, InstructGPT auszurollen, mit einem von ihm selbst geschriebenen, nie veröffentlichten Algorithmus, und wie er dann feststellte, dass das Ergebnis vor allem für Copywriting genutzt wurde. Daraus seine Frage: was fehlt zwischen „sehr intelligent“ und „schafft Wert“?
Seine Antwort: in einer KI-Wirtschaftsrevolution wird die überwiegende Mehrheit der Aufrufe von Code kommen, nicht von Menschen — und die gesamte Optimierung ging in Richtung Menschen. Er sagt, er habe ein Dokument geschrieben, mit Sam Altman darüber gesprochen, der ihm riet, es zu tun, angenommen, dass Anthropic es bereits mache, und schließlich TypeSafe mit Eric und dann Sasha gegründet.
Sein angegebener Antrieb ist die Angst vor einem KI-Winter, für den er sich persönlich verantwortlich fühlen würde, sowohl für die RLHF-Richtung als auch dafür, nicht alles auf sie gesetzt zu haben. Sein Ziel ist keine Punktzahl, sondern eine makroökonomische Kennzahl: 3 % Wachstum der gesamten Faktorproduktivität in fünf Jahren.
Zur gemeinsamen Erklärung der Labs für ein Abbremsen spricht er von einem Taschenspielertrick: sie setze voraus, dass alle immer mehr RLVR betreiben müssen, indem man Modelle frei agieren lässt. Für seine Modellform gilt: „null ist die optimale Menge“. Der Host fügt eine andere, nüchternere Lesart hinzu: politische Positionierung im Hinblick auf 2028.
“Refusal is just like obviously a type error.”
“I think intelligence will be more like a database than a coworker.”
“If you gave me a billion dollars I wouldn't pre-train.”
Warum es zählt
Seit drei Jahren lautet der Produkt-Konsens der KI-Branche: der Agent, oder der digitale Kollege. Almeida schlägt genau das Gegenteil vor — eine banalisierte, unsichtbare Intelligenz, die von Programmen aufgerufen, wie eine Datenbankabfrage abgerechnet und nach ihrer Zuverlässigkeit statt nach roher Intelligenz beurteilt wird. Das ist eine kohärente, technisch begründete These, und sie erklärt eine unangenehme Tatsache: die Software von 2026 sieht immer noch aus wie die von 2019, nur mit einer seitlichen Chatbox mehr. Eine Spannung bleibt jedoch bestehen. Öffentliche Benchmarks, Demos und Determinismus im Namen der ingenieurstechnischen Reinheit abzulehnen, macht die Behauptungen des Unternehmens auch von außen unüberprüfbar — genau in dem Moment, in dem „Intelligenz pro Dollar“ zu einem kommerziellen Argument wird. Das Versprechen, ein deployetes Modell niemals zu ändern, ist dagegen verbindlich: dort wird man es einhalten müssen.
Weiterlesen

99 % oder 0 %: Vier Experten wetten über das Ende der Welt
Steven Bartlett lässt vier Experten ihre Aussterbewahrscheinlichkeit auf einen Umschlag schreiben. Die Antworten reichen von 99 % bis null, und die anschließende Debatte ist die aufschlussreichste, die wir zu diesem Thema gehört haben.
Quelle · The Diary Of A CEO · AI Emergency: The AI Labs Are Lying To Everyone, He Says 99% Chance Of Extinction | Roman Yampolskiy
#forschungHeuteOpenAI verkündet gelöste Navier–Stokes-Gleichungen und gründet Mathematiker-Komitee
In ein und demselben Blogbeitrag: ein internes Modell, das angeblich über 100 offene Probleme geknackt hat, und eine unabhängige Expertengruppe, die die entstehende Schockwelle managen soll.
Quelle · OpenAI · Advisory Group on Mathematics and Artificial Intelligence
#agiHeuteOpenAI fordert weltweite Standards vor der KI-Selbstverbesserung
Das Labor verlangt einen internationalen technischen Rahmen für den Moment, in dem KI selbst KI-Forschung betreibt — und fordert die USA auf, die Feder in die Hand zu nehmen.
Quelle · OpenAI · Building standards for the next phase of AI