PrimärquelleKIArtikel··5 Min. Lesezeit

Beam: Reflection bringt ein offenes 501B-MoE-Modell mit massivem RL an den Start

Mit 501 Milliarden Parametern, 23 Milliarden aktiven Parametern und 100 Millionen Reinforcement-Learning-Rollouts will Reflection beweisen, dass der Westen im Open-Weight-Rennen noch mitzählt.

Beam: Reflection bringt ein offenes 501B-MoE-Modell mit massivem RL an den Start
Quelle : Reflection · ReflectionOriginal ansehen ↗

Kurz gesagt

Reflection stellt Beam vor, sein erstes Open-Weight-Modell: ein Mixture-of-Experts mit 501B Parametern (23B aktiv), zugeschnitten auf Code und Agenten, dessen Gewichte diesen Monat unter Apache-2.0-Lizenz erscheinen sollen. In roher Kapazität schlägt es die besten offenen chinesischen Modelle nicht, beansprucht aber eine 3- bis 4-fach höhere Inferenz-Effizienz bei vergleichbaren Modellen. Der Beitrag beschreibt vor allem eine außergewöhnliche RL-Kampagne und die gesamte Infrastruktur, die sie ermöglicht hat.

🍺 Tresen-Version

Reflection bringt ein offenes Modell heraus, das nicht der Klassenbeste ist, und steht dazu: Das Argument lautet, es komme fast genauso weit bei drei- bis viermal weniger Rechenaufwand. Es ist ein bisschen wie das Auto, das den Grand Prix nicht gewinnt, aber die Strecke Paris–Marseille mit halbem Tank schafft. Dafür haben sie 10.500 GPUs einen Monat lang laufen lassen, nur um ihm beizubringen, besser nachzudenken – eine ziemlich eigenwillige Definition von Sparsamkeit. Wenn die Gewichte wirklich unter Apache 2.0 veröffentlicht werden, haben Unternehmen, die ein leistungsstarkes, selbst hostbares und nicht-chinesisches Code-Modell wollen, endlich eine ernsthafte Option.

Das Wichtigste

  1. 1

    Beam ist ein spärliches MoE-Modell mit 501 Milliarden Parametern, davon 23 Milliarden aktiv pro Token, vortrainiert auf 23,8 Billionen Tokens, mit einem auf 1M Tokens erweiterten effektiven Kontext.

  2. 2

    Die RL-Phase beanspruchte 10.500 NVIDIA-GB300-GPUs über vier Wochen, mehr als 100 Millionen Rollouts, rund 1,3 Milliarden Sandboxes und fast eine Million Umgebungen.

  3. 3

    Bei Agentic-Coding-Benchmarks erzielt Beam 80,9 auf SWE-bench Verified und 80,1 auf Terminal Bench 2.1, liegt dabei hinter GLM 5.3, Kimi K3, Qwen 3.8 Max und DeepSeek V4.1 Flash auf letzterem.

  4. 4

    Reflection beansprucht Reasoning-Werte vergleichbar mit GLM 5.2 bei 3- bis 4-fach weniger Inferenz-Rechenaufwand, laut einer selbst als grob bezeichneten FLOPs-Schätzung.

  5. 5

    Die Fähigkeiten zeigten kein Plateau, je mehr RL-Rechenleistung eingesetzt wurde, und Web-Navigationsfähigkeiten entstanden, obwohl keine Browsing-Aufgaben im Training enthalten waren.

  6. 6

    Die Gewichte, der technische Bericht und die Model Card sollen diesen Monat unter Apache-2.0-Lizenz veröffentlicht werden; derzeit ist das Modell im Early Access über eine Warteliste verfügbar.

Ein Arbeitspferd statt ein Champion

Reflection präsentiert Beam als sein erstes Open-Weight-Modell, konzipiert für Code, Reasoning und agentische Workloads. Die Architektur ist ein Mixture-of-Experts: 501 Milliarden Parameter insgesamt, aber nur 23 Milliarden werden pro Token aktiviert.

Die Positionierung ist bewusst gewählt. Beam bezeichnet sich als konkurrenzfähig mit GLM 5.2 und nahe an Qwen 3.8-Max bei Code- und agentischen Aufgaben, räumt aber ein, dass Kimi K3 in roher Kapazität vorn bleibt. Das Argument ist die Effizienz bei der Inferenz.

Die veröffentlichten Zahlen bestätigen dieses nuancierte Bild: 80,9 auf SWE-bench Verified, 77,2 auf SWE Bench Pro v2-Hard, aber nur 44,4 auf DeepSWE gegenüber 68,0 bei Kimi K3 und 74,2 bei DeepSeek V4.1 Flash. Der Effizienzvergleich beruht auf einer Schätzung (2 × aktive Parameter × generierte Tokens), die Prefill und Servicekosten ausschließt.

RL als Haupt-Skalierungsachse

Im Kern des Beitrags steht das Reinforcement Learning. Reflection setzte 10.500 GB300-GPUs vier Wochen lang ein, um mehr als 100 Millionen Rollouts mit Kontexten von bis zu 256K Tokens zu generieren. Zum Vergleich: Laut dem Labor wurde Inkling mit 30 Millionen Rollouts trainiert und MiMo mit 753.000.

Das Labor erklärt, dass sich die Werte bei Terminal-Bench, HLE und DeepSWE mit zunehmender RL-Rechenleistung stetig verbesserten, ohne sichtbares Plateau. Es nutzte vollständig asynchrone Policy-Gradients mit neuen Algorithmen, um auch beim Lernen aus über einen Tag alten Interaktionen stabil zu bleiben – entsprechend 107 Gewichtsversionen im Rückstand.

Eine steuerbare Längenstrafe brachte dem Modell zunächst bei, Aufgaben mit weniger Tokens zu lösen, bevor agentische Fähigkeiten längere Antworten rechtfertigten. Der Nutzer behält über einen Reasoning-Effort-Parameter die Kontrolle.

Generalisierung und Umgebungen

Trainiert auf Reasoning, Softwareentwicklung und Terminal, hat Beam Fortschritte bei der Web-Navigation gemacht, ohne je Browsing-Aufgaben erhalten zu haben. Mit Webzugang lernte es von selbst, andere LLMs zu befragen und OCR-APIs zu nutzen, um Dokumente zu lesen.

Dieses RL stützt sich auf fast eine Million Umgebungen, größtenteils synthetisch, ergänzt durch Anbieterdaten und Open-Source-Daten. Sie wurden gefiltert, um weder trivial noch unlösbar noch hackbar zu sein. Laut Reflection führte jeder Kompromiss bei der Aufgabenqualität zu einem Fähigkeiten-Plateau.

Eine selbst gebaute Infrastruktur

Die RL-Plattform unterstützte im Durchschnitt 110.000 gleichzeitige Rollouts und bis zu 170.000 gleichzeitige Sandboxes, verteilt auf über 20 Cluster, zwei Clouds und vier Regionen. Neue Gewichte erreichten die Inferenz-Flotte im Median in etwa 12 Sekunden, und 71 Inferenz-Zwischenfälle wurden absorbiert, ohne das Training zu stoppen.

Das Pretraining lief in weniger als vier Wochen auf 6.144 GB300-NVL72-GPUs, mit einem selbst entwickelten Kubernetes-Scheduler und einem System zur Erkennung stiller Datenkorruption. Ergebnis: nur neun halbautomatische Rewinds und ein Goodput von 92,3 % am Ende des Laufs.

Daten, Architektur und Alignment

Die 23,8 Billionen Tokens stammen aus dem Web, öffentlichen Quellen und proprietär lizenzierten Datensätzen. Rund 95 % der Rohtokens werden aussortiert, doch Reflection behauptet, 1,8 Billionen hochwertige Tokens zu gewinnen, die herkömmliche Filter verworfen hätten, darunter 87 % seines kuratierten Web-Codes.

Die Architektur kombiniert verschachtelte lokale und globale Attention, fein geroutete Experten und mehrere von DeepSeek inspirierte Load-Balancing-Mechanismen. Die Auslastung des am stärksten beanspruchten Experten übersteigt am Ende des Pretrainings nicht das 1,04-fache des Durchschnitts, über 52 Schichten hinweg.

In Sachen Sicherheit wurde ein zweites Modell speziell auf Alignment trainiert und anschließend per On-Policy-Distillation mit mehreren Lehrermodellen mit dem RL-Modell verschmolzen. Reflection verspricht, seine Sicherheitsevaluierungen zu veröffentlichen und die entsprechenden Tools offen zu legen.

“Beam advances the Western open-weight frontier and is competitive with larger open models like GLM 5.2 and approaching Qwen 3.8-Max on coding and agentic tasks.”
“We believe this is one of the largest scale RL runs conducted by any open lab to date.”
“Throughout Beam's development, we found that compromises in data quality led to capability plateaus and other training issues.”

Warum es zählt

Beam erscheint in einer Open-Weight-Landschaft, die weitgehend von chinesischen Laboren dominiert wird (Qwen, Kimi, GLM, DeepSeek), und Reflection präsentiert es explizit als Fortschritt der „westlichen“ offenen Grenze. Das ist der eigentliche Punkt: Unternehmen ein unter Apache 2.0 hostbares Code-Modell anzubieten, ohne von einem chinesischen Anbieter abhängig zu sein. Der Beitrag ist zudem von seltener Transparenz, was die Mechanik des RL im großen Maßstab, die Infrastruktur und die Datenkuratierung betrifft, was ihn zu einer wertvollen Lektüre für alle macht, die Modelle trainieren. Man sollte jedoch einen kühlen Kopf bewahren: Die Gewichte sind noch nicht veröffentlicht, die Benchmarks zeigen Beam hinter mehreren offenen Konkurrenten bei Terminal Bench und DeepSWE, und das zentrale Effizienzargument beruht auf einer theoretischen FLOPs-Schätzung, nicht auf gemessenen Inferenzkosten. Die Behauptung eines „plateaufreien“ Fortschritts ist wissenschaftlich die interessanteste – und muss am meisten überprüft werden, sobald der technische Bericht vorliegt.

#llm#open source#reinforcement learning#agents#code#reflection
Originalquelle
Introducing Beam: Reflection's 501B open-weight model
Reflection
Artikel öffnen ↗

Für dich

Lass sie mit deinen Quellen arbeiten.

Kostenlos: einen Monat Artikel und drei eigene Quellen. Pro: das ganze Archiv und deine Quellen, ab 8 €/Monat.

Für dein Team

Dieselbe Maschine, zu euren Themen.

Ein Bereich in euren Farben, eure Beobachtungswinkel, eure Kuratoren. Pilot offen für drei Unternehmen.

Weiterlesen