Beam: Reflection lancia un MoE aperto da 501B puntando sull'RL massiccio
Con 501 miliardi di parametri, 23 miliardi attivi e 100 milioni di rollout di reinforcement learning, Reflection vuole dimostrare che l'Occidente può ancora contare nell'open-weight.

In breve
Reflection svela Beam, il suo primo modello open-weight: un Mixture-of-Experts da 501B parametri (23B attivi) tagliato per il codice e gli agenti, i cui pesi usciranno questo mese sotto licenza Apache 2.0. Non batte i migliori modelli aperti cinesi in capacità bruta, ma rivendica un'efficienza d'inferenza 3-4 volte superiore a parità di modello. Il post dettaglia soprattutto una campagna di RL fuori norma e tutta l'infrastruttura che l'ha resa possibile.
🍺 Versione da bancone
Reflection lancia un modello aperto che non è il più forte della classe, e lo ammette: il suo argomento è che arriva quasi altrettanto lontano consumando tre-quattro volte meno calcolo. È un po' l'auto che non vince il Gran Premio ma che fa Milano-Roma con mezzo pieno. Per riuscirci, hanno fatto girare 10.500 GPU per un mese solo per insegnargli a ragionare meglio, il che resta una definizione piuttosto particolare di sobrietà. Se i pesi escono davvero sotto Apache 2.0, le aziende che vogliono un modello di codice potente, ospitabile in casa propria e non cinese avranno finalmente un'opzione seria.
Da ricordare
- 1
Beam è un MoE sparse da 501 miliardi di parametri di cui 23 miliardi attivi per token, pre-addestrato su 23,8 trilioni di token, con un contesto effettivo esteso a 1M di token.
- 2
La fase di RL ha mobilitato 10.500 GPU NVIDIA GB300 per quattro settimane, oltre 100 milioni di rollout, circa 1,3 miliardi di sandbox e quasi un milione di ambienti.
- 3
Sui benchmark di agentic coding, Beam ottiene 80,9 su SWE-bench Verified e 80,1 su Terminal Bench 2.1, dietro GLM 5.3, Kimi K3, Qwen 3.8 Max e DeepSeek V4.1 Flash su quest'ultimo.
- 4
Reflection rivendica punteggi di ragionamento comparabili a GLM 5.2 con 3-4 volte meno calcolo d'inferenza, secondo una stima in FLOPs che essa stessa qualifica come approssimativa.
- 5
Le capacità non hanno mostrato alcun plateau all'aumentare del calcolo RL, e sono emerse competenze di navigazione web senza task di browsing nell'addestramento.
- 6
I pesi, il rapporto tecnico e la model card saranno pubblicati questo mese sotto licenza Apache 2.0; il modello è per ora in accesso anticipato su lista d'attesa.
Un modello di lavoro più che un campione
Reflection presenta Beam come il suo primo modello open-weight, pensato per il codice, il ragionamento e i carichi di lavoro agentici. L'architettura è una Mixture-of-Experts: 501 miliardi di parametri totali, ma solo 23 miliardi sollecitati a ogni token.
Il posizionamento è assunto. Beam si dice competitivo con GLM 5.2 e vicino a Qwen 3.8-Max su codice e task agentici, pur riconoscendo che Kimi K3 resta avanti in capacità bruta. L'argomento è l'efficienza in inferenza.
I numeri pubblicati confermano questo quadro sfumato: 80,9 su SWE-bench Verified, 77,2 su SWE Bench Pro v2-Hard, ma 44,4 su DeepSWE contro 68,0 di Kimi K3 e 74,2 di DeepSeek V4.1 Flash. Il confronto di efficienza si basa su una stima (2 × parametri attivi × token generati) che esclude il prefill e i costi di servizio.
L'RL come asse di scaling principale
Il cuore del post riguarda il reinforcement learning. Reflection ha mobilitato 10.500 GPU GB300 per quattro settimane per generare oltre 100 milioni di rollout, con contesti fino a 256K token. Per confronto, il laboratorio indica che Inkling è stato addestrato su 30 milioni di rollout e MiMo su 753.000.
Il laboratorio afferma che i punteggi su Terminal-Bench, HLE e DeepSWE hanno continuato a progredire con il calcolo RL, senza plateau visibile. Ha utilizzato policy gradient interamente asincroni, con nuovi algoritmi per restare stabile anche apprendendo da interazioni vecchie di più di un giorno, ossia 107 versioni di pesi in ritardo.
Una penalità di lunghezza controllabile ha prima insegnato al modello a risolvere i task con meno token, prima che le capacità agentiche giustificassero risposte più lunghe. L'utente mantiene il controllo tramite un parametro di reasoning effort.
Generalizzazione e ambienti
Addestrato su ragionamento, ingegneria del software e terminale, Beam è progredito nella navigazione web senza aver mai avuto task di browsing. Con accesso al web, ha imparato da solo a interrogare altri LLM e a usare API di OCR per leggere documenti.
Questo RL si basa su quasi un milione di ambienti, in maggioranza sintetici, completati da dati di fornitori e dall'open source. Sono stati filtrati per non essere né banali né impossibili, né hackabili. Secondo Reflection, ogni compromesso sulla qualità dei task si traduceva in un plateau di capacità.
Un'infrastruttura costruita in casa
La piattaforma RL ha sostenuto in media 110.000 rollout simultanei e fino a 170.000 sandbox concorrenti, su oltre 20 cluster, due cloud e quattro regioni. I nuovi pesi raggiungevano la flotta di inferenza in circa 12 secondi mediani, e 71 incidenti di inferenza sono stati assorbiti senza fermare l'addestramento.
Il pre-addestramento ha girato in meno di quattro settimane su 6.144 GPU GB300 NVL72, con uno scheduler Kubernetes proprietario e un sistema di rilevamento della corruzione silenziosa dei dati. Risultato: solo nove rewind semi-automatici e un goodput del 92,3% a fine run.
Dati, architettura e allineamento
I 23,8 trilioni di token provengono dal web, da fonti pubbliche e da dataset con licenza proprietaria. Circa il 95% dei token grezzi viene eliminato, ma Reflection afferma di recuperare 1,8 trilioni di token di qualità che filtri classici avrebbero scartato, di cui l'87% del suo codice web curato.
L'architettura combina attenzione locale e globale intrecciate, esperti finemente instradati e diversi meccanismi di load balancing ispirati a DeepSeek. Il carico dell'esperto più sollecitato non supera 1,04 volte la media a fine pre-addestramento, su 52 layer.
Sul fronte sicurezza, un secondo modello è stato addestrato specificamente sull'allineamento, poi fuso con il modello RL tramite distillazione on-policy multi-insegnante. Reflection promette di pubblicare le sue valutazioni di sicurezza e di aprirne gli strumenti.
“Beam advances the Western open-weight frontier and is competitive with larger open models like GLM 5.2 and approaching Qwen 3.8-Max on coding and agentic tasks.”
“We believe this is one of the largest scale RL runs conducted by any open lab to date.”
“Throughout Beam's development, we found that compromises in data quality led to capability plateaus and other training issues.”
Perché conta
Beam arriva in un panorama open-weight largamente dominato dai laboratori cinesi (Qwen, Kimi, GLM, DeepSeek), e Reflection lo presenta esplicitamente come un avanzamento della frontiera aperta «occidentale». Questa è la vera posta in gioco: offrire alle aziende un modello di codice ospitabile sotto Apache 2.0 senza dipendere da un fornitore cinese. Il post è anche di una trasparenza rara sulla meccanica dell'RL su larga scala, sull'infrastruttura e sulla curation dei dati, il che lo rende una lettura preziosa per chiunque addestri modelli. Bisogna però mantenere la lucidità: i pesi non sono ancora pubblicati, i benchmark mostrano Beam dietro diversi concorrenti aperti su Terminal Bench e DeepSWE, e l'argomento centrale dell'efficienza si basa su una stima teorica dei FLOPs, non su un costo d'inferenza misurato. L'affermazione di una progressione «senza plateau» è la più interessante scientificamente, e la più da verificare una volta disponibile il rapporto tecnico.
Per te
Falla lavorare sulle tue fonti.
Gratis: un mese di articoli e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.
Per il tuo team
La stessa macchina, sui vostri temi.
Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.
Da leggere anche
#agentiOggiCloudflare lancia Clef-omni: un modello di decisione che vede, sente e decide
Una settimana dopo i primi modelli open-weight, Cloudflare aggiunge audio e video, dimezza abbondantemente il prezzo di Clef-flash e accelera Clef.
Fonte · Cloudflare Blog · Introducing Clef-omni with full multimodality, plus a faster Clef and a cheaper Clef-flash
#geminiOggiGemini agent: Google Cloud vuole un unico agente per tutto il lavoro
Al Gemini at Work 2026, Thomas Kurian presenta un agente unico, persistente e multi-modello, che riceve persino un proprio indirizzo e-mail aziendale.
Fonte · Google Cloud Blog · Gemini at Work 2026: Introducing Gemini agent
#politicaOggiAdam Schiff: il Congresso di fronte all'IA, tra Sezione 230 e legge di Murphy
Il senatore democratico della California smonta il patto volontario firmato alla Casa Bianca e si batte per una «FDA dell'IA», pur riconoscendo che il Congresso non ha mai saputo regolamentare la tech.
Fonte · The Verge – Decoder · Sen. Adam Schiff on making Congress relevant in the AI age