Fuente primariaIAArtículo··7 min de lectura

Mistral Large 4: un billón de parámetros, pesos abiertos y la ciberseguridad en primer plano

Con «el Chonk», Mistral quiere demostrar que un modelo open-weight entrenado en Europa puede jugar en las grandes ligas, sobre todo allí donde los modelos cerrados se niegan a trabajar.

Mistral Large 4: un billón de parámetros, pesos abiertos y la ciberseguridad en primer plano
Fuente : Mistral AI · MistralVer el original ↗

En breve

Mistral lanza en vista previa pública Mistral Large 4 (ML4), un modelo multimodal de 1 billón de parámetros, de los cuales 52 mil millones activos, entrenado desde cero en 3.800 GPU NVIDIA Grace Blackwell en sus propios centros de datos europeos. Los pesos se publicarán antes de fin de mes. Mistral reivindica el primer puesto entre los modelos open-weight fuera de China, con un argumento central: la ciberseguridad, donde los modelos cerrados suelen bloquear el trabajo de los defensores.

🍺 Versión de barra

Mistral saca un modelo tan grande que ellos mismos lo apodaron «el Chonk», que es más o menos lo único honesto que se puede decir sobre un billón de parámetros. El discurso: donde Claude o GPT se niegan a ayudarte a reproducir un fallo de seguridad, por principio, ML4 se arremanga, y encima puedes instalarlo en tu casa. Es un poco como el cerrajero que por fin accede a abrirte la puerta sin pedirte tres justificantes de domicilio. Para Europa, es sobre todo la prueba de que se puede fabricar este tipo de máquina en casa, con sus propias GPU, sin pedirle permiso a nadie.

Para recordar

  1. 1

    ML4 es un modelo Mixture-of-Experts nativamente multimodal de 1 billón de parámetros, con 52 mil millones de parámetros activos, disponible en vista previa API en Mistral Studio, pesos publicados antes de fin de mes.

  2. 2

    Fue entrenado desde cero en 3.800 GPU NVIDIA Grace Blackwell en los centros de datos europeos de Mistral, con datos que cubren más de 160 idiomas, incluidas todas las lenguas oficiales de la UE.

  3. 3

    En ciberseguridad, se sitúa entre los 5 mejores del mundo en el Artificial Analysis Cyber Index, alcanza un 82 % en una prueba de reproducción y corrección de fallos reales (mejor puntuación de todos los modelos) y resuelve el 93 % de las 40 pruebas de Cybench.

  4. 4

    En esa misma prueba de reproducción de fallos, Claude Opus 5.5 y GPT-6 Astra caen cerca de cero porque se niegan a realizar la tarea, un argumento que Mistral coloca en el centro de su discurso sobre la soberanía.

  5. 5

    En código agéntico, ML4 obtiene 61,7 % en DeepSWE v1.1, 28,3 % en Terminal-Bench 4 y queda segundo en una evaluación humana a ciegas realizada con Surge AI (3,74/5), detrás de Claude Opus 5 (4,22).

  6. 6

    El modelo supera a GPT-6-Astra en visual grounding en Dense 200 (42 % frente a 41 %), y en tareas jurídicas y financieras evaluadas por vals.ai.

  7. 7

    ML4 es el primer hito de la Serie D de 3.000 millones de euros de Mistral, y su ejecución de reinforcement learning, aún en curso, no muestra según la empresa ningún signo de saturación.

Un billón de parámetros, versión europea

Mistral lanza la vista previa pública de Mistral Large 4, bautizado extraoficialmente «el Chonk». Es el modelo más grande de la historia de la empresa: 1 billón de parámetros en total, 52 mil millones activos en cada inferencia, y una multimodalidad nativa.

El modelo fue entrenado desde cero en 3.800 GPU NVIDIA Grace Blackwell instaladas en los propios centros de datos de Mistral en Europa. La vista previa funciona sobre esa misma infraestructura. Mistral promete también un despliegue europeo operado de principio a fin, independiente de otros proveedores de servicios digitales y sujeto al derecho europeo.

Los pesos se publicarán antes de fin de mes, junto con detalles sobre la arquitectura, benchmarks adicionales y la metodología de post-entrenamiento. Mientras tanto, el modelo está sometido a un red-teaming con actores de la ciberseguridad, socios seleccionados y autoridades estatales, que tienen acceso a una versión con moderación reducida y capacidades cyber ampliadas.

La ciberseguridad como argumento de venta

Es el ángulo más marcado del anuncio. En el Artificial Analysis Cyber Index, evaluación independiente de la capacidad para encontrar y corregir fallos en software real, ML4 figura entre los 5 mejores del mundo y supera ampliamente a los modelos open-weight desarrollados fuera de China.

En una de las pruebas del índice, que consiste en reproducir una vulnerabilidad real de un software open source y luego corregirla, ML4 alcanza el 82 %, la mejor puntuación de todos los modelos. Claude Opus 5.5 y GPT-6 Astra obtienen allí una puntuación cercana a cero, no por incapacidad, sino porque se niegan a realizar la tarea.

Mistral extrae de ello un argumento de fondo: defender un software a menudo empieza por probar que existe un fallo, y los filtros de los modelos cerrados bloquean precisamente ese trabajo, mientras que los atacantes sí logran hacer jailbreak a esos mismos modelos. Perder el acceso a una capacidad en plena crisis se convierte en sí mismo en un riesgo. De ahí la promesa de un modelo desplegable en nube privada o on-premise, bajo las políticas de la propia organización.

Código, agentes y trabajo de oficina

En código agéntico, ML4 muestra 61,7 % en DeepSWE v1.1, 59,4 % en SWE-Atlas-QnA y 28,3 % en Terminal-Bench 4. Su Coding Agent Index de 49,8 % lo coloca por delante de DeepSeek V4 Pro 0813 y Qwen3.8 Max. En una evaluación humana a ciegas realizada con Surge AI, queda segundo de cinco (3,74/5), por delante de GLM-5.3, Kimi K3 y GLM-5.2, pero claramente por detrás de Claude Opus 5 (4,22).

En AutomationBench, 657 flujos de trabajo empresariales que implican Gmail, Google Sheets, Slack o Salesforce, alcanza el 59,9 %. En AA-Briefcase, que evalúa el trabajo intelectual de larga duración, obtiene 1.393 Elo, por delante de DeepSeek V4 Pro.

En cuanto a sectores regulados, vals.ai lo juzga superior a GPT-6-Astra en tareas jurídicas y financieras representativas, y supera a todos los modelos open source en el Legal Agent benchmark de Harvey.

Visión, ciencia y matemáticas

Mistral presenta ML4 como un salto en la comprensión de imágenes: documentos complejos, gráficos, escenas naturales, imágenes satelitales gigapíxel, planos técnicos. El modelo combina visual grounding y capacidades agénticas para hacer zoom, inspeccionar y verificar hasta obtener una respuesta exacta. En Dense 200, supera a GPT-6-Astra, por poco (42 % frente a 41 %).

En ciencia, se anuncia como el estado del arte entre los modelos open-weight en SciCode-Verified y capaz de generar en una sola pasada una simulación Hartree–Fock completa, una tarea de química de varios pasos. En una evaluación humana interna, se le prefiere frente a GLM-5.3 en CAD y en STEM, y se sitúa al mismo nivel o justo por detrás en finanzas y código.

Seguridad del modelo: la paradoja asumida

ML4 resiste el 93,3 % de los ataques del benchmark B3 de Lakera y satura las pruebas internas de robustez frente a prompt injections indirectas. En el KORA Benchmark, obtiene 1,691 sobre 2, la mejor puntuación medida por Mistral entre los modelos open source.

Detalle notable: a pesar de su rendimiento en ciber, su tasa media de rechazo ante prompts cyber maliciosos de JailbreakBench, StrongREJECT y AgentHarm es superior a la de todos los demás modelos open source. Mistral reivindica así un modelo que a la vez acepta el trabajo defensivo y rechaza más las solicitudes maliciosas, un equilibrio que solo el uso real permitirá verificar.

Un RL a escala industrial, y lo que viene

El post-entrenamiento se apoya masivamente en reinforcement learning, mediante una biblioteca donde los entornos (chat, problemas científicos, alineación, factualidad, uso de herramientas a largo plazo) se combinan en una misma ejecución. Una flota de actores en autoscaling genera decenas de miles de rollouts en paralelo, con un entrenamiento asíncrono y presupuestos de varios millones de tokens por trayectoria.

Con unas 3.000 GPU, una ejecución produce cerca de 33.000 millones de tokens por día, de los cuales 16.000 millones son aprovechables para el entrenamiento. Esta ejecución sigue en curso y, según Mistral, no se satura: la empresa promete mejoras rápidas en las próximas semanas.

ML4 se presenta como el primer hito de la Serie D de 3.000 millones de euros, la mayor ronda de capital jamás realizada por una empresa tecnológica europea. Servirá también de base para una nueva generación de modelos Mistral especializados, entrenados con el mismo entorno que el ofrecido a los clientes a través de Mistral Forge.

“ML4 pushes the frontier of open-weight performance.”
“Defending software often starts with proving that a flaw is real, exactly the kind of work safety filters in closed models can block.”
“The model is showing no signs of saturation — there is substantial headroom ahead.”

Por qué importa

ML4 es ante todo una señal estratégica: un laboratorio europeo entrena un modelo de un billón de parámetros en su propia infraestructura, en suelo europeo, y planea publicar los pesos. El posicionamiento es hábil. En lugar de pretender superar a Claude o GPT en todo, Mistral se mide sobre todo con los open-weight chinos (DeepSeek, Qwen, Kimi, GLM) y elige un terreno donde los modelos cerrados se sabotean a sí mismos: la ciberseguridad defensiva, frenada por negativas sistemáticas. El argumento de soberanía se vuelve entonces operativo y no solo político. Aun así, conviene mantener la cabeza fría. Las cifras son autodeclaradas, a menudo en benchmarks elegidos por el propio editor, la arquitectura y la licencia todavía no se conocen, y los pesos aún no están disponibles. La evaluación a ciegas de Surge AI también recuerda la distancia que persiste con Claude Opus 5 en código. Por último, la promesa de un modelo muy capaz en ciber, pronto en open-weight, y ya confiado en versión menos moderada a autoridades estatales, plantea una cuestión de doble uso que el anuncio aborda sobre todo mediante tasas de rechazo. Queda que, si los pesos cumplen sus promesas a fin de mes, Europa dispondrá por primera vez de un modelo abierto de primer nivel.

#llm#mistral#open weights#ciberseguridad#soberanía#europa
Fuente original
Introducing Mistral Large 4
Mistral AI
Abrir el artículo ↗

Para ti

Ponla a trabajar con tus fuentes.

Gratis: un mes de artículos y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.

Para tu equipo

La misma máquina, sobre tus temas.

Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.

Sigue leyendo