Source primaireIAArticle··5 min de lecture

Beam : Reflection lance un MoE ouvert de 501B misant sur le RL massif

Avec 501 milliards de paramètres, 23 milliards actifs et 100 millions de rollouts de reinforcement learning, Reflection veut prouver que l'Occident peut encore compter dans l'open-weight.

Beam : Reflection lance un MoE ouvert de 501B misant sur le RL massif
Source : Reflection · ReflectionVoir l'original ↗

En bref

Reflection dévoile Beam, son premier modèle open-weight : un Mixture-of-Experts de 501B paramètres (23B actifs) taillé pour le code et les agents, dont les poids sortiront ce mois-ci sous licence Apache 2.0. Il ne bat pas les meilleurs modèles ouverts chinois en capacité brute, mais revendique une efficacité d'inférence 3 à 4 fois supérieure à modèle comparable. Le billet détaille surtout une campagne de RL hors norme et toute l'infrastructure qui l'a rendue possible.

🍺 Version comptoir

Reflection sort un modèle ouvert qui n'est pas le plus fort de la classe, et qui l'assume : son argument, c'est qu'il arrive presque aussi loin en consommant trois à quatre fois moins de calcul. C'est un peu la voiture qui ne gagne pas le Grand Prix mais qui fait Paris-Marseille avec un demi-plein. Pour y arriver, ils ont fait tourner 10 500 GPU pendant un mois juste pour lui apprendre à mieux réfléchir, ce qui reste une définition assez particulière de la sobriété. Si les poids sortent vraiment sous Apache 2.0, les entreprises qui veulent un modèle de code puissant, hébergeable chez elles et pas chinois auront enfin une option sérieuse.

À retenir

  1. 1

    Beam est un MoE sparse de 501 milliards de paramètres dont 23 milliards actifs par token, pré-entraîné sur 23,8 trillions de tokens, avec un contexte effectif étendu à 1M de tokens.

  2. 2

    La phase de RL a mobilisé 10 500 GPU NVIDIA GB300 pendant quatre semaines, plus de 100 millions de rollouts, environ 1,3 milliard de sandboxes et près d'un million d'environnements.

  3. 3

    Sur les benchmarks d'agentic coding, Beam affiche 80,9 sur SWE-bench Verified et 80,1 sur Terminal Bench 2.1, derrière GLM 5.3, Kimi K3, Qwen 3.8 Max et DeepSeek V4.1 Flash sur ce dernier.

  4. 4

    Reflection revendique des scores de raisonnement comparables à GLM 5.2 avec 3 à 4 fois moins de calcul d'inférence, selon une estimation en FLOPs qu'elle qualifie elle-même d'approximative.

  5. 5

    Les capacités n'ont montré aucun plateau à mesure que le calcul RL augmentait, et des compétences de navigation web sont apparues sans tâches de browsing dans l'entraînement.

  6. 6

    Les poids, le rapport technique et la model card seront publiés ce mois-ci sous licence Apache 2.0 ; le modèle est pour l'instant en accès anticipé sur liste d'attente.

Un modèle de travail plutôt qu'un champion

Reflection présente Beam comme son premier modèle open-weight, conçu pour le code, le raisonnement et les workloads agentiques. L'architecture est un Mixture-of-Experts : 501 milliards de paramètres au total, mais seulement 23 milliards sollicités à chaque token.

Le positionnement est assumé. Beam se dit compétitif avec GLM 5.2 et proche de Qwen 3.8-Max sur le code et les tâches agentiques, tout en reconnaissant que Kimi K3 reste devant en capacité brute. L'argument, c'est l'efficacité à l'inférence.

Les chiffres publiés confirment ce tableau nuancé : 80,9 sur SWE-bench Verified, 77,2 sur SWE Bench Pro v2-Hard, mais 44,4 sur DeepSWE contre 68,0 pour Kimi K3 et 74,2 pour DeepSeek V4.1 Flash. La comparaison d'efficacité repose sur une estimation (2 × paramètres actifs × tokens générés) qui exclut le prefill et les coûts de service.

Le RL comme axe de scaling principal

Le cœur du billet porte sur le reinforcement learning. Reflection a mobilisé 10 500 GPU GB300 pendant quatre semaines pour générer plus de 100 millions de rollouts, avec des contextes jusqu'à 256K tokens. Pour comparaison, le labo indique qu'Inkling a été entraîné sur 30 millions de rollouts et MiMo sur 753 000.

Le labo affirme que les scores sur Terminal-Bench, HLE et DeepSWE ont continué de progresser avec le calcul RL, sans plateau visible. Il a utilisé des policy gradients entièrement asynchrones, avec de nouveaux algorithmes pour rester stable même en apprenant sur des interactions vieilles de plus d'un jour, soit 107 versions de poids en retard.

Une pénalité de longueur contrôlable a d'abord appris au modèle à résoudre les tâches avec moins de tokens, avant que les capacités agentiques ne justifient des réponses plus longues. L'utilisateur garde la main via un paramètre de reasoning effort.

Généralisation et environnements

Entraîné sur du raisonnement, du génie logiciel et du terminal, Beam a progressé en navigation web sans jamais avoir eu de tâches de browsing. Avec un accès au web, il a appris de lui-même à interroger d'autres LLM et à utiliser des API d'OCR pour lire des documents.

Ce RL repose sur près d'un million d'environnements, majoritairement synthétiques, complétés par des données de fournisseurs et de l'open source. Ils ont été filtrés pour n'être ni triviaux ni impossibles, ni hackables. Selon Reflection, chaque compromis sur la qualité des tâches se traduisait par un plateau de capacités.

Une infrastructure construite maison

La plateforme RL a soutenu en moyenne 110 000 rollouts simultanés et jusqu'à 170 000 sandboxes concurrentes, sur plus de 20 clusters, deux clouds et quatre régions. Les nouveaux poids atteignaient la flotte d'inférence en environ 12 secondes en médiane, et 71 incidents d'inférence ont été absorbés sans arrêter l'entraînement.

Le pré-entraînement a tourné en moins de quatre semaines sur 6 144 GPU GB300 NVL72, avec un ordonnanceur Kubernetes maison et un système de détection de corruption silencieuse des données. Résultat : neuf rewinds semi-automatiques seulement et un goodput de 92,3 % en fin de run.

Données, architecture et alignement

Les 23,8 trillions de tokens proviennent du web, de sources publiques et de jeux de données sous licence propriétaire. Environ 95 % des tokens bruts sont éliminés, mais Reflection affirme récupérer 1,8 trillion de tokens de qualité que des filtres classiques auraient écartés, dont 87 % de son code web curé.

L'architecture combine attention locale et globale entrelacées, experts finement routés et plusieurs mécanismes de load balancing inspirés de DeepSeek. La charge de l'expert le plus sollicité ne dépasse pas 1,04 fois la moyenne en fin de pré-entraînement, sur 52 couches.

Côté sécurité, un second modèle a été entraîné spécifiquement sur l'alignement, puis fusionné avec le modèle RL par distillation on-policy multi-enseignants. Reflection promet de publier ses évaluations de sécurité et d'en ouvrir les outils.

“Beam advances the Western open-weight frontier and is competitive with larger open models like GLM 5.2 and approaching Qwen 3.8-Max on coding and agentic tasks.”
“We believe this is one of the largest scale RL runs conducted by any open lab to date.”
“Throughout Beam's development, we found that compromises in data quality led to capability plateaus and other training issues.”

Pourquoi ça compte

Beam arrive dans un paysage open-weight largement dominé par les labos chinois (Qwen, Kimi, GLM, DeepSeek), et Reflection le présente explicitement comme une avancée de la frontière ouverte « occidentale ». C'est l'enjeu réel : offrir aux entreprises un modèle de code hébergeable sous Apache 2.0 sans dépendre d'un fournisseur chinois. Le billet est aussi d'une transparence rare sur la mécanique du RL à grande échelle, l'infrastructure et la curation des données, ce qui en fait une lecture précieuse pour quiconque entraîne des modèles. Il faut pourtant garder la tête froide : les poids ne sont pas encore publiés, les benchmarks montrent Beam derrière plusieurs concurrents ouverts sur Terminal Bench et DeepSWE, et l'argument central d'efficacité repose sur une estimation théorique des FLOPs, pas sur un coût d'inférence mesuré. L'affirmation d'une progression « sans plateau » est la plus intéressante scientifiquement, et la plus à vérifier une fois le rapport technique disponible.

#llm#open source#reinforcement learning#agents#code#reflection
Source originale
Introducing Beam: Reflection's 501B open-weight model
Reflection
Source primaireBillet officiel de Reflection annonçant et détaillant son propre modèle Beam.
Ouvrir l'article ↗

Pour vous

Faites-la travailler sur vos sources.

Gratuit : un mois d'articles et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.

Pour votre équipe

La même machine, sur vos sujets.

Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.

À lire aussi