Fuente primariaIAArtículo··5 min de lectura

Beam: Reflection lanza un MoE abierto de 501B apostando por el RL masivo

Con 501.000 millones de parámetros, 23.000 millones activos y 100 millones de rollouts de reinforcement learning, Reflection quiere demostrar que Occidente todavía puede competir en el open-weight.

Beam: Reflection lanza un MoE abierto de 501B apostando por el RL masivo
Fuente : Reflection · ReflectionVer el original ↗

En breve

Reflection presenta Beam, su primer modelo open-weight: un Mixture-of-Experts de 501B parámetros (23B activos) pensado para código y agentes, cuyos pesos saldrán este mes bajo licencia Apache 2.0. No supera a los mejores modelos abiertos chinos en capacidad bruta, pero reivindica una eficiencia de inferencia de 3 a 4 veces superior a modelos comparables. El artículo detalla sobre todo una campaña de RL fuera de lo común y toda la infraestructura que la hizo posible.

🍺 Versión de barra

Reflection saca un modelo abierto que no es el más fuerte de la clase, y lo asume: su argumento es que llega casi tan lejos consumiendo de tres a cuatro veces menos cómputo. Es un poco como el coche que no gana el Gran Premio pero hace Madrid-Barcelona con medio depósito. Para lograrlo, hicieron funcionar 10.500 GPU durante un mes solo para enseñarle a razonar mejor, lo cual sigue siendo una definición bastante particular de sobriedad. Si los pesos realmente salen bajo Apache 2.0, las empresas que quieran un modelo de código potente, autoalojable y no chino tendrán por fin una opción seria.

Para recordar

  1. 1

    Beam es un MoE disperso de 501.000 millones de parámetros, de los cuales 23.000 millones están activos por token, preentrenado con 23,8 billones de tokens, con un contexto efectivo extendido a 1M de tokens.

  2. 2

    La fase de RL movilizó 10.500 GPU NVIDIA GB300 durante cuatro semanas, más de 100 millones de rollouts, cerca de 1.300 millones de sandboxes y casi un millón de entornos.

  3. 3

    En los benchmarks de agentic coding, Beam obtiene 80,9 en SWE-bench Verified y 80,1 en Terminal Bench 2.1, por detrás de GLM 5.3, Kimi K3, Qwen 3.8 Max y DeepSeek V4.1 Flash en este último.

  4. 4

    Reflection reivindica puntuaciones de razonamiento comparables a GLM 5.2 con 3 a 4 veces menos cómputo de inferencia, según una estimación en FLOPs que la propia empresa califica de aproximada.

  5. 5

    Las capacidades no mostraron ninguna meseta a medida que aumentaba el cómputo de RL, y surgieron habilidades de navegación web sin tareas de browsing en el entrenamiento.

  6. 6

    Los pesos, el informe técnico y la model card se publicarán este mes bajo licencia Apache 2.0; el modelo está por ahora en acceso anticipado con lista de espera.

Un modelo de trabajo más que un campeón

Reflection presenta Beam como su primer modelo open-weight, diseñado para código, razonamiento y cargas de trabajo agénticas. La arquitectura es un Mixture-of-Experts: 501.000 millones de parámetros en total, pero solo 23.000 millones se activan en cada token.

El posicionamiento es asumido. Beam se dice competitivo con GLM 5.2 y cercano a Qwen 3.8-Max en código y tareas agénticas, al tiempo que reconoce que Kimi K3 sigue por delante en capacidad bruta. El argumento es la eficiencia en inferencia.

Las cifras publicadas confirman este cuadro matizado: 80,9 en SWE-bench Verified, 77,2 en SWE Bench Pro v2-Hard, pero 44,4 en DeepSWE frente a 68,0 de Kimi K3 y 74,2 de DeepSeek V4.1 Flash. La comparación de eficiencia se basa en una estimación (2 × parámetros activos × tokens generados) que excluye el prefill y los costes de servicio.

El RL como eje principal de escalado

El núcleo del artículo trata sobre el reinforcement learning. Reflection movilizó 10.500 GPU GB300 durante cuatro semanas para generar más de 100 millones de rollouts, con contextos de hasta 256K tokens. A modo de comparación, el laboratorio indica que Inkling fue entrenado con 30 millones de rollouts y MiMo con 753.000.

El laboratorio afirma que las puntuaciones en Terminal-Bench, HLE y DeepSWE siguieron progresando con el cómputo de RL, sin meseta visible. Utilizó policy gradients totalmente asíncronos, con nuevos algoritmos para mantenerse estable incluso aprendiendo de interacciones de más de un día de antigüedad, es decir, 107 versiones de pesos de retraso.

Una penalización de longitud controlable enseñó primero al modelo a resolver tareas con menos tokens, antes de que las capacidades agénticas justificaran respuestas más largas. El usuario conserva el control mediante un parámetro de reasoning effort.

Generalización y entornos

Entrenado en razonamiento, ingeniería de software y terminal, Beam progresó en navegación web sin haber tenido nunca tareas de browsing. Con acceso a la web, aprendió por sí mismo a consultar otros LLM y a usar APIs de OCR para leer documentos.

Este RL se apoya en casi un millón de entornos, mayoritariamente sintéticos, complementados con datos de proveedores y de código abierto. Fueron filtrados para no ser triviales ni imposibles, ni explotables (hackeables). Según Reflection, cada concesión en la calidad de las tareas se traducía en una meseta de capacidades.

Una infraestructura construida internamente

La plataforma de RL sostuvo en promedio 110.000 rollouts simultáneos y hasta 170.000 sandboxes concurrentes, en más de 20 clústeres, dos nubes y cuatro regiones. Los nuevos pesos llegaban a la flota de inferencia en unos 12 segundos de mediana, y se absorbieron 71 incidentes de inferencia sin detener el entrenamiento.

El preentrenamiento se ejecutó en menos de cuatro semanas sobre 6.144 GPU GB300 NVL72, con un orquestador Kubernetes propio y un sistema de detección de corrupción silenciosa de datos. Resultado: solo nueve rewinds semiautomáticos y un goodput del 92,3% al final del run.

Datos, arquitectura y alineamiento

Los 23,8 billones de tokens provienen de la web, de fuentes públicas y de conjuntos de datos bajo licencia propietaria. Alrededor del 95% de los tokens brutos se elimina, pero Reflection afirma recuperar 1,8 billones de tokens de calidad que filtros convencionales habrían descartado, de los cuales el 87% es código web curado propio.

La arquitectura combina atención local y global entrelazadas, expertos finamente enrutados y varios mecanismos de load balancing inspirados en DeepSeek. La carga del experto más solicitado no supera 1,04 veces la media al final del preentrenamiento, en 52 capas.

En cuanto a seguridad, se entrenó un segundo modelo específicamente para el alineamiento, que luego se fusionó con el modelo de RL mediante destilación on-policy multi-maestro. Reflection promete publicar sus evaluaciones de seguridad y abrir sus herramientas.

“Beam advances the Western open-weight frontier and is competitive with larger open models like GLM 5.2 and approaching Qwen 3.8-Max on coding and agentic tasks.”
“We believe this is one of the largest scale RL runs conducted by any open lab to date.”
“Throughout Beam's development, we found that compromises in data quality led to capability plateaus and other training issues.”

Por qué importa

Beam llega a un panorama open-weight dominado en gran medida por los laboratorios chinos (Qwen, Kimi, GLM, DeepSeek), y Reflection lo presenta explícitamente como un avance de la frontera abierta «occidental». Ahí está el verdadero interés: ofrecer a las empresas un modelo de código autoalojable bajo Apache 2.0 sin depender de un proveedor chino. El artículo también destaca por una transparencia poco habitual sobre la mecánica del RL a gran escala, la infraestructura y la curación de datos, lo que lo convierte en una lectura valiosa para cualquiera que entrene modelos. Aun así, hay que mantener la cabeza fría: los pesos todavía no se han publicado, los benchmarks muestran a Beam por detrás de varios competidores abiertos en Terminal Bench y DeepSWE, y el argumento central de eficiencia se basa en una estimación teórica de FLOPs, no en un coste de inferencia medido. La afirmación de un progreso «sin meseta» es la más interesante científicamente, y la que más habrá que verificar cuando esté disponible el informe técnico.

#llm#open source#reinforcement learning#agents#código#reflection
Fuente original
Introducing Beam: Reflection's 501B open-weight model
Reflection
Abrir el artículo ↗

Para ti

Ponla a trabajar con tus fuentes.

Gratis: un mes de artículos y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.

Para tu equipo

La misma máquina, sobre tus temas.

Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.

Sigue leyendo