Fuente primariaIAArtículo··6 min de lectura

Gemini 4 Argon: Google lanza su modelo frontera, primero a los ciberdefensores

Antes que a los desarrolladores y al gran público, Google confía su nuevo modelo a un puñado de especialistas en seguridad, sin barreras cibernéticas, y promete 1 millón de tokens de salida.

Gemini 4 Argon: Google lanza su modelo frontera, primero a los ciberdefensores
Fuente : Koray Kavukcuoglu · Google · 30 de septiembre de 2026Ver el original ↗

Quién habla de ello

Retomada por 3 medios · 2 de primer nivel · 1 tech

En breve

Google DeepMind anuncia Gemini 4 Argon, un modelo frontera diseñado para el código de largo recorrido, el trabajo de conocimiento empresarial (legal, finanzas) y la ciberdefensa. El despliegue es progresivo: primero defensores cuidadosamente seleccionados a través del programa Fairwind, luego los clientes de pago de la API y los suscriptores de Google AI Ultra. El artículo combina resultados internos espectaculares (300 TiB de memoria liberada, migraciones masivas a Rust) y una batería de benchmarks donde Argon se sitúa en cabeza.

🍺 Versión de barra

Google ha sacado un nuevo cerebro, y lo primero que hace con él es prestárselo a la gente encargada de impedir que otros cerebros hagan tonterías. El modelo encuentra fallos, los repara, reescribe secciones enteras de código en Rust y libera memoria en los centros de datos como quien se encuentra 300 euros en el bolsillo de un abrigo viejo, salvo que aquí son 300 terabytes. Para los hackers buenos seleccionados, se entrega sin restricciones, lo cual equivale a dar las llaves de la caja fuerte a quienes se ha juzgado honestos, esperando haber juzgado bien. Si funciona, la seguridad informática cambia de marcha; si se filtra, también cambia de marcha, pero en sentido contrario.

Para recordar

  1. 1

    Gemini 4 Argon se despliega primero entre ciberdefensores de confianza a través del programa Fairwind, sin barreras cibernéticas, antes de abrirse a los clientes de pago de la API y a los suscriptores de Google AI Ultra.

  2. 2

    El precio de lanzamiento se fija en 2 $ por millón de tokens de entrada y 10 $ de salida, con un 95% de descuento en los tokens de entrada en caché.

  3. 3

    El límite de salida pasa de 64K a 1M de tokens, para permitir trayectorias de razonamiento de varios cientos de miles de tokens de una sola vez.

  4. 4

    Internamente, agentes Argon liberaron más de 300 TiB de memoria en los centros de datos de Google, con un ahorro estimado total de entre 500 TiB y 1 PiB.

  5. 5

    Argon migra de C/C++ a Rust a escala de Google, hasta el núcleo Zircon de Fuchsia (más de 800K líneas), y ha hecho que el porting en Rust del decodificador de vídeo libgav1 sea 2,7 veces más rápido.

  6. 6

    En benchmarks: 77,9% en DeepSWE v1.1, 51,3% y primer puesto en AutomationBench de Zapier, 91,7% en LVBench, y primer puesto empatado (68%) en CWE-bench v1.

  7. 7

    Google supervisa la cadena de pensamiento del modelo para detectar desalineación y tiene cuidado de no reinyectar esas señales en el entrenamiento, para no enseñarle al modelo a eludir el control.

Un lanzamiento al revés

Google DeepMind presenta Gemini 4 Argon como su nuevo modelo frontera, diseñado para sostener un razonamiento profundo en tareas largas y complejas. Se apunta a tres frentes: la ingeniería de software real, el trabajo de conocimiento empresarial (legal, finanzas) y la ciberdefensa.

El calendario es inusual. El modelo no llega primero a los desarrolladores, sino a un grupo de defensores cibernéticos de confianza, a través del programa Fairwind. Google indica que participa en el proceso voluntario del gobierno estadounidense de acceso a modelos antes de su lanzamiento.

El gran público, las empresas y los desarrolladores llegarán después, "lo antes posible", comenzando por los clientes de pago de la API y los suscriptores de Google AI Ultra. No se da ninguna fecha. En cambio, sí se anuncia el precio de lanzamiento: 2 $ por millón de tokens de entrada, 10 $ de salida, y un 95% de descuento en la entrada en caché.

Lo que Argon ya hace en Google

El artículo insiste en el uso interno, con miles de Googlers que lo utilizarían para código especializado, investigación profunda y redacción. Se destacan tres ejemplos con cifras.

En computación cuántica, Argon ayuda a optimizar los recursos de espacio-tiempo (qubits × puertas) de subrutinas críticas; en un caso, superó la referencia publicada en un 40% en pocos minutos. En infraestructura, un equipo de agentes Argon analizó la telemetría de perfilado de la flota para aplicar por sí mismo optimizaciones de memoria: más de 300 TiB liberados, y entre 500 TiB y 1 PiB de ahorros esperados.

El tercer proyecto es la migración de código C/C++ a Rust, desde bibliotecas como re2 y libgav1 hasta el núcleo Zircon de Fuchsia y sus más de 800K líneas. En libgav1, los agentes reemplazaron 32K líneas de código SIMD por Rust seguro que el compilador vectoriza por sí solo, logrando un decodificador 2,7 veces más rápido que el porting en Rust existente, con una salida de vídeo idéntica. Google precisa que estas reescrituras siguen pasando por auditorías automáticas y manuales, pruebas de emulación y revisión antes de producción.

1 millón de tokens de salida

El cambio técnico más concreto para los usuarios es el límite de salida, que pasa de 64K a 1M de tokens. Google lo presenta como el más alto del sector.

La idea: dejar que el modelo produzca cientos de miles de tokens en una sola trayectoria, para resolver un problema difícil "de una sola vez" en lugar de multiplicar los intercambios. Es una apuesta por las tareas agénticas largas, y un coste potencialmente elevado a 10 $ el millón de tokens generados.

Empresa y multimodal: la lluvia de benchmarks

En código, Argon establece un nuevo estado del arte en DeepSWE v1.1 (77,9%), que mide tareas de ingeniería de software largas. Fuera del código, encabeza el Vals Index, que pondera finanzas, código, derecho y fiscalidad según su peso en el PIB estadounidense, y reivindica buenos resultados en Vals Finance Agent v2 y el Legal Agent Benchmark de Harvey.

En AutomationBench, el benchmark de Zapier sobre la ejecución de extremo a extremo de funciones empresariales, Argon es primero con un 51,3%. En visión, alcanza un 91,7% en LVBench, dedicado a la comprensión de vídeos largos, y Google destaca el análisis de gráficos y la acción a partir de una serie de documentos.

La ciberdefensa, núcleo del anuncio

Argon fue entrenado específicamente para la defensa: encontrar, validar y corregir vulnerabilidades críticas de forma autónoma. Para los defensores de confianza y los equipos internos, se entregará sin barreras cibernéticas, para explotar toda su capacidad.

Wiz ya lo utiliza en su iniciativa Scan for Good, que protege gratuitamente infraestructuras públicas críticas. El modelo detectó allí una vulnerabilidad crítica que exponía datos personales sensibles en un software de salud utilizado por hospitales en todo el mundo, un fallo que los modelos anteriores habían pasado por alto.

En CWE-bench v1, que evalúa la corrección de vulnerabilidades, Argon está empatado en primer lugar con un 68%. Google también cita avances en su benchmark interno (fallos encontrados en bases de código que cubren 20 lenguajes) y en el benchmark de pentest de caja negra de Wiz, frente a su predecesor 3.8 Flash Cyber.

Las barreras antes de la apertura

Google detalla cuatro frentes de trabajo. Contra los abusos (cibernéticos y CBRN), el modelo rechaza las solicitudes peligrosas al tiempo que preserva la investigación legítima de doble uso, y Google supervisa las activaciones internas del modelo para detectar usos indebidos, con pruebas de equipos rojos internos y externos.

Contra la inyección de prompt indirecta, Argon sería el modelo más robusto del mercado en el benchmark IPI de Gray Swan, gracias al red teaming automatizado y al entrenamiento adversarial. Para la desalineación, Google supervisa la cadena de pensamiento y las acciones del modelo y puede detener la ejecución.

Un punto notable: las alertas procedentes de la supervisión de los entrenamientos no se reinyectan en el entrenamiento, para no enseñarle al modelo a eludir el control. Google pide al resto del sector que preserve la transparencia del razonamiento. Por último, los entornos sandbox están aislados y sellados antes de los entrenamientos y evaluaciones de alto riesgo.

“Safely releasing frontier capabilities at this level requires a phased approach.”
“For trusted defenders and our own internal teams at Google, we'll be releasing Argon without cyber guardrails.”
“We strongly encourage the rest of the industry to preserve reasoning transparency in these pivotal moments of increased capabilities.”

Por qué importa

Gemini 4 Argon confirma un cambio que ya estaba en marcha en el sector: los modelos más potentes ya no se lanzan de golpe, pasan primero por la ciberseguridad y por el Estado. Reservar un modelo sin restricciones a defensores "de confianza" es defendible, pero plantea una cuestión de gobernanza que el artículo no aborda: ¿quién elige a esos defensores, con qué criterios, y qué pasa si el acceso se filtra? En el fondo, los ejemplos internos (memoria liberada, migración a Rust, ganancia de 2,7x en libgav1) son más elocuentes que la letanía de benchmarks, a menudo diseñados por socios y a veces ganados empatados. También hay que relativizar: la migración de Zircon sigue en auditoría, no se da fecha de disponibilidad, y el precio es explícitamente "de lanzamiento". El pasaje más interesante es quizás el más discreto: al pedir al sector que preserve cadenas de pensamiento legibles, y al evitar entrenar en contra de su propia supervisión, Google reconoce que la capacidad de leer el razonamiento de un modelo se ha convertido en un activo de seguridad frágil.

Cuenta gratis

Acabas de leer un artículo de AI Sources

Crea una cuenta gratuita: un mes de archivo completo, tus propias fuentes resumidas como esta, tus notas y subrayados.

#ia#llm#google#gemini#ciberseguridad#agentes
Fuente original
Gemini 4 Argon: our next era of frontier intelligence
Koray Kavukcuoglu
Abrir el artículo ↗

Para ti

Ponla a trabajar con tus fuentes.

Gratis: un mes de artículos y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.

Para tu equipo

La misma máquina, sobre tus temas.

Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.

Sigue leyendo