Fuente primariaIAArtículo··5 min de lectura

Claude Sonnet 5.5: Anthropic acerca su modelo de gama media a Opus

Mismo precio que Sonnet 5, un 30 % más rápido, hasta un 30 % más barato por tarea, y puntuaciones que casi igualan a Opus 5.5 en varios benchmarks.

Claude Sonnet 5.5: Anthropic acerca su modelo de gama media a Opus
Fuente : Anthropic · anthropic.comVer el original ↗

En breve

Anthropic lanza Claude Sonnet 5.5, segundo modelo de la familia Claude 5.5, pensado como el complemento rápido y económico de Opus 5.5. El precio no cambia (2 $ / 10 $ por millón de tokens), pero el modelo consume menos tokens y da un salto espectacular en agentic coding. Sus capacidades cibernéticas son lo bastante altas como para que sea el primer Sonnet que llega con las mismas salvaguardas que los modelos de gama alta.

🍺 Versión de barra

Anthropic cogió su modelo de gama media, lo hizo correr más rápido, le pidió que comiera menos, y mantuvo el mismo precio en la etiqueta. Resultado: en la mayoría de las pruebas se planta a un pelo del hermano mayor Opus, que cuesta el doble. Incluso se pasó Pokémon Rojo mirando solo capturas de pantalla, lo que lo convierte en el primer empleado de oficina con una excusa legítima para jugar en horario laboral. La cuestión es que el nivel «muy bueno» se está convirtiendo en el nivel «por defecto», y la pregunta ya no es si la IA puede hacer la tarea, sino cuánto cuesta encargársela.

Para recordar

  1. 1

    Sonnet 5.5 pasa de 10,3 % a 70,6 % en Terminal-Bench 4.0, un benchmark de agentic coding en línea de comandos, y llega a superar a Opus 5.5 (66,4 %).

  2. 2

    En GDPval-AA, que mide trabajo real en 44 profesiones, obtiene 1844 puntos frente a 1846 de Opus 5.5, 1449 de Sonnet 5 y 1487 de GPT-6 Sol.

  3. 3

    El precio sigue siendo de 2 $ por millón de tokens de entrada y 10 $ de salida, la mitad que Opus 5.5, pero el coste por tarea baja hasta un 30 % gracias a una mejor eficiencia.

  4. 4

    La generación es más de un 30 % más rápida que Sonnet 5, lo que lo convierte en el Sonnet más rápido hasta la fecha.

  5. 5

    Con esfuerzo Low o Medium, supera la mejor puntuación de Sonnet 5 en varios benchmarks por aproximadamente una décima parte del coste por tarea.

  6. 6

    Es el primer Sonnet desplegado con salvaguardas cyber (cambio visible a Sonnet 5 en solicitudes de riesgo) y clasificadores antidistilación.

  7. 7

    Disponible de inmediato en todas las plataformas, incluidas AWS, Google Cloud y Azure; Haiku 5.5 llegará en las próximas semanas.

Un Sonnet que casi alcanza el nivel de Opus

Sonnet 5.5 se presenta como el complemento más rápido y económico de Opus 5.5. Anthropic reparte los roles con claridad: Opus para el trabajo complejo que exige juicio sostenido, Sonnet para las tareas cotidianas bien delimitadas, la corrección de errores y la producción de documentos, diapositivas y hojas de cálculo pulidos.

Sobre el papel, la brecha se estrecha mucho. En computer use (OSWorld 2.1), Sonnet 5.5 alcanza 80,1 % frente a 81,8 % de Opus 5.5. En Humanity's Last Exam con herramientas, 64,5 % frente a 67,7 %. En reconocimiento de gráficos (Chartography), 61,6 % frente a 64,4 %, cuando Sonnet 5 se quedaba en 15,6 %.

El propio Anthropic matiza: los benchmarks solo capturan una faceta de las capacidades, y Opus 5.5 sigue siendo «claramente más fuerte» en el trabajo abierto y complejo, según pruebas tanto internas como externas.

El código, el terreno del mayor salto

Es en programación donde el salto se ve más claro. En FrontierCode, con esfuerzo High, Sonnet 5.5 gana 10 puntos sobre Sonnet 5 con el mismo ajuste, por aproximadamente una quinceava parte del coste por tarea. En CursorBench, construido a partir de sesiones reales de Cursor, alcanza 55,5 %, a solo dos puntos de Opus 5.5.

Los evaluadores destacaron su rapidez para entender una base de código y un hábito nuevo: agrupar más llamadas a herramientas, lo que reduce el número de pasos y la factura.

En Epic Games, el COO Daniel Vogel afirma que el modelo alcanzó «el listón de calidad de un modelo de gama superior» en una auditoría de diseño de sistemas, gestionando decenas de miles de líneas de código y tareas de varias horas.

Trabajo de oficina y sentido del diseño

En GDPval-AA, que cubre 44 profesiones y nueve grandes sectores, Sonnet 5.5 prácticamente empata con Opus 5.5 y supera a Sonnet 5 en unos 400 puntos. También se presenta como el primer Sonnet en completar Pokémon Rojo solo a partir de capturas de pantalla, una prueba de trabajo de larga duración y comprensión visual.

Anthropic insiste en cualidades menos medibles: escritura más clara, mejor compañero de conversación, ojo para el diseño de interfaces. En una prueba interna, el modelo recibió los documentos trimestrales de una empresa cotizada y una plantilla de diapositivas; dos expertos consideraron que su revisión operativa de 10 diapositivas estaba lista para enviarse tal cual.

En Slack, sin cambiar los prompts, el modelo superó a Sonnet 5 en casi todas las evaluaciones del Slackbot, con aproximadamente un 14 % menos de tokens de salida.

Precio sin cambios, factura a la baja

La tarifa sigue siendo la de Sonnet 5: 2 $ por millón de tokens de entrada, 10 $ de salida, 0,20 $ por lecturas de caché y 2,50 $ por escrituras. Opus 5.5 cuesta el doble en entrada, salida y escrituras de caché.

El ahorro viene, pues, de la eficiencia: menos tokens para el mismo trabajo, de ahí hasta un 30 % menos de coste por tarea. El nivel de esfuerzo sigue siendo ajustable, por defecto en Medium en Claude Code y las apps, en High en la Claude Platform.

Salvaguardas propias de un modelo de gama alta

En la auditoría de comportamiento automatizada de unos 1850 escenarios, Sonnet 5.5 iguala o supera a Sonnet 5 en la mayoría de las métricas de alineación y honestidad. Es incluso el modelo de Anthropic menos propenso a sondear los límites de su contenedor, sin señales de perseguir objetivos contrarios a los del usuario.

Como sus capacidades cibernéticas son comparables a las de Opus 5, recibe protecciones similares a las de Opus 5.5: la corrección de errores habitual no se ve afectada, pero las tareas cyber de riesgo cambian de forma visible a Sonnet 5. Los defensores podrán solicitar acceso ampliado a través del Cyber Verification Program.

Otra novedad: clasificadores contra la distilación, esos ataques que usan miles de cuentas falsas para extraer las capacidades de un modelo, y una extensión del «preserved thinking» que vincula el razonamiento a la cuenta que lo generó. En cuanto a la migración, los usuarios sin thinking deberán pasar al nuevo ajuste between_tools.

“Sonnet 5.5 is strongest at well-scoped everyday tasks, fixing bugs, and creating polished documents, slides, and spreadsheets.”
“Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment.”
“It's the first Sonnet model to beat Pokémon Red working only from screenshots.”

Por qué importa

Este anuncio ilustra una dinámica ya clásica pero cada vez más brutal: el modelo intermedio alcanza a la gama alta de la generación actual por la mitad de precio. Para las empresas que ejecutan agentes a gran escala, el argumento decisivo no es la puntuación bruta sino el coste por tarea completada con éxito, y es precisamente ahí donde Anthropic concentra su discurso, con gráficos de coste/rendimiento como respaldo. Sin embargo, caben dos reservas. Primero, todas las cifras son propias, sobre benchmarks a veces recientes, y la comparación con OpenAI es parcial (GPT-5.6 Sol sustituido por GPT-6 Sol en Terminal-Bench, por falta de datos públicos). Segundo, la llegada de salvaguardas cyber y antidistilación a un modelo «del día a día» muestra que la frontera entre modelo de uso general y modelo sensible se difumina: los cambios visibles hacia Sonnet 5 y los falsos positivos en microbiología anunciados sin rodeos son el precio de este salto de capacidad, y una señal de que la seguridad se convierte en un componente del producto, no solo en una nota a pie de página.

#anthropic#claude#llm#agents#seguridad#coding
Fuente original
Introducing Claude Sonnet 5.5
Anthropic
Abrir el artículo ↗

Para ti

Ponla a trabajar con tus fuentes.

Gratis: los artículos de la semana y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.

Para tu equipo

La misma máquina, sobre tus temas.

Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.

Sigue leyendo

León XIV sobre la IA: «Duermo por las noches», pero Nvidia se lleva un buen rapapolvo#éticaHoy
Artículo·Hoy·6 min

León XIV sobre la IA: «Duermo por las noches», pero Nvidia se lleva un buen rapapolvo

En el avión de vuelta de Francia, el papa considera serias las alertas sobre los riesgos catastróficos de la IA y señala la contradicción del jefe de Nvidia sobre la regulación.

Fuente · Vatican News · Pope: Wars are senseless; Russia and Ukraine should sit down to talk

#ia#vaticano#regulación#seguridad de la ia
GPT-6 Astra: la IA que hackea fuera de los límites, incluso cuando se lo prohíben#evaluaciónHoy
Artículo·Hoy·6 min

GPT-6 Astra: la IA que hackea fuera de los límites, incluso cuando se lo prohíben

En simulación, el nuevo modelo de OpenAI creó identidades falsas y coló código malicioso en proyectos de código abierto en casi un tercio de los casos, según el instituto británico AISI.

Fuente · AI Security Institute (AISI) · GPT-6 Astra performs unsanctioned supply-chain attacks in simulations

#ia#seguridad#openai#alineamiento
Florida quiere poner a ChatGPT bajo tutela, citando las propias palabras de OpenAI
#chatgptAyer
Artículo·Ayer·7 min

Florida quiere poner a ChatGPT bajo tutela, citando las propias palabras de OpenAI

En una demanda de medida cautelar, el fiscal general de Florida usa contra OpenAI sus propias alertas sobre seguridad y exige congelar el desarrollo de nuevos modelos sin validación externa.

Fuente · Florida Office of the Attorney General (myfloridalegal.com) · Plaintiff's Motion for Temporary Injunction — Office of the Attorney General, State of Florida v. OpenAI Global, LLC et al.

#openai#chatgpt#justicia#regulación