Fuente primariaIAArtículo··5 min de lectura

GPT-6.1 Sol: casi Astra, por una quinta parte del precio

OpenAI actualiza su modelo intermedio y promete el rendimiento de su gama alta en código, agentes y trabajo profesional, con una factura dividida entre cinco.

GPT-6.1 Sol: casi Astra, por una quinta parte del precio
Fuente : OpenAI · OpenAIVer el original ↗

En breve

OpenAI lanza GPT-6.1 Sol, una actualización de GPT-6 Sol que se acerca a GPT-6 Astra en código agéntico, uso de ordenador y tareas profesionales, a una quinta parte de su precio de API. La caché de entrada baja a 0,10 $ por millón de tokens, una señal clara para los desarrolladores de agentes que reutilizan mucho contexto.

🍺 Versión de barra

OpenAI tiene dos modelos: el carísimo que lo hace todo, y el más barato que casi lo hace todo. Pues resulta que el más barato acaba de alcanzar al carísimo en casi todo, salvo en investigación científica de vanguardia, por cinco veces menos. Es como descubrir que el vino de la casa vale lo mismo que la gran reserva, con una etiqueta escrita por el propio restaurante. Si las cifras aguantan fuera del laboratorio, hacer correr agentes todo el día deja de ser un lujo.

Para recordar

  1. 1

    GPT-6.1 Sol cuesta 2 $ por millón de tokens de entrada, 0,10 $ en entrada cacheada y 10 $ en salida, es decir, una quinta parte de las tarifas estándar de GPT-6 Astra.

  2. 2

    La caché de entrada es un 95 % más barata que la entrada estándar y un 50 % más barata que la de GPT-6 Sol, un argumento hecho a medida para agentes que reutilizan su contexto.

  3. 3

    En DeepSWE v1.1, iguala a GPT-6 Astra por aproximadamente una quinta parte del coste y supera a GPT-6 Sol en 6,4 puntos.

  4. 4

    En Terminal-Bench Science 0.1, cuesta 5,47 $ por tarea de media frente a 23,21 $ de Opus 5.5 y 23,80 $ de Astra, que sigue en cabeza con 68,1 %.

  5. 5

    En OSWorld 2.0, gana 7 puntos sobre GPT-6 Sol y se sitúa a 2,1 puntos de Astra por aproximadamente una séptima parte del coste por tarea.

  6. 6

    La tasa de respuestas con error factual pasa de 11,4 % a 7,7 % con esfuerzo de razonamiento bajo, es decir, un 32 % menos de errores aproximadamente.

  7. 7

    Disponible desde ya en ChatGPT Work y Codex para los planes Plus, Pro, Business, Enterprise y Edu, así como en la API (gpt-6.1-sol), pero todavía no en Chat.

La gama media que apunta a lo alto

GPT-6.1 Sol es una actualización de GPT-6 Sol, el modelo intermedio de OpenAI. Su promesa se resume en una frase: una inteligencia "cercana a Astra" en código agéntico, uso de ordenador y trabajo profesional, por una quinta parte de las tarifas estándar de Astra tanto en entrada como en salida.

OpenAI presenta el modelo como un nuevo equilibrio entre capacidad y coste para el trabajo diario: escribir y depurar código, entender documentos, ejecutar workflows empresariales de varios pasos. La comparación se hace tanto con su hermano mayor Astra como con la competencia, en particular Opus 5.5.

Código y trabajo profesional: las cifras destacadas

En DeepSWE v1.1, que evalúa tareas de ingeniería de software en bases de código reales, GPT-6.1 Sol iguala a Astra por aproximadamente una quinta parte del coste. También supera la mejor puntuación de GPT-6 Sol en 6,4 puntos, con menor esfuerzo de razonamiento y menor coste.

En GDP.pdf, que mide la exactitud de las respuestas a preguntas profesionales sobre PDF complejos (tablas, gráficos, esquemas, letra pequeña) en finanzas, salud, derecho y otros siete ámbitos, supera a Opus 5.5 con fallbacks por menos de la mitad del coste por tarea.

En AutomationBench 1.0.6, que prueba workflows completos con 47 herramientas (ventas, marketing, operaciones, soporte, finanzas, RRHH), adelanta a Opus 5.5 en 2,2 puntos con esfuerzo medio, por aproximadamente un tercio del coste, y gana 4,8 puntos sobre GPT-6 Sol. OpenAI precisa que el coste mostrado para Claude Fable 5.1 está subestimado porque omite los fallbacks, que se dieron en aproximadamente el 40 % de las tareas.

Uso de ordenador y ciencia

En el conjunto offline de OSWorld 2.0, que evalúa workflows largos de uso de aplicaciones, GPT-6.1 Sol gana 7 puntos sobre GPT-6 Sol con esfuerzo máximo, por menos de la mitad del coste. Se sitúa a 2,1 puntos de Astra por aproximadamente una séptima parte del coste por tarea.

En Terminal-Bench Science 0.1 (análisis de datos, simulación, demostración de teoremas), más que duplica la puntuación de GPT-6 Sol. Con esfuerzo máximo, cuesta 5,47 $ por tarea, frente a 23,21 $ de Opus 5.5 y 23,80 $ de Astra, es decir, más de un 75 % de ahorro.

OpenAI marca sin embargo un límite: Astra sigue siendo el mejor modelo probado en este benchmark, con 68,1 %, y debe preferirse para las tareas de investigación científica más difíciles.

Factualidad y alineación

La factualidad se mide sobre conversaciones anonimizadas de ChatGPT donde usuarios habían señalado un error de un modelo anterior. Con esfuerzo bajo, la proporción de respuestas erróneas pasa de 11,4 % a 7,7 %. En todos los ajustes, la diferencia con Astra se mantiene por debajo de 1,9 puntos, por menos de una quinta parte del coste.

OpenAI insiste en que estos prompts, deliberadamente difíciles, no reflejan el uso habitual. En cuanto a alineación, el modelo sería más transparente sobre sus límites (por ejemplo, ante una herramienta de búsqueda averiada), más respetuoso con las restricciones explícitas y menos propenso a producir resultados no autorizados en modo agente. No se observó ningún intento de sortear al revisor de seguridad automatizado, igual que con Astra y GPT-6 Sol. Los detalles figuran en un anexo a la system card.

Precio y disponibilidad

El modelo está disponible desde hoy para los usuarios Plus, Pro, Business, Enterprise y Edu en ChatGPT Work y Codex, pero todavía no en Chat. Los desarrolladores acceden a él vía API bajo el nombre gpt-6.1-sol.

Las tarifas: 2 $ por millón de tokens de entrada, 0,10 $ en entrada cacheada, 10 $ en salida. En los próximos días, OpenAI también ofrecerá GPT-6.1 Sol Ultrafast en Codex, con una generación de tokens hasta 8 veces más rápida que la velocidad estándar.

“Near-Astra intelligence for a fifth of the price”
“GPT‑6 Astra still achieves the highest score among the models tested at 68.1%, and should be used for the most difficult scientific research tasks.”
“We observed no attempts to bypass an automated safety reviewer, matching GPT‑6 Astra and GPT‑6 Sol.”

Por qué importa

El anuncio dice menos "aquí tenéis un modelo más inteligente" que "aquí tenéis la inteligencia de ayer a una fracción del precio". Ese es el verdadero terreno de juego de 2026: los agentes consumen enormes cantidades de tokens, releen sin cesar el mismo contexto, y su viabilidad económica depende más del coste por tarea que de la puntuación bruta. La caché a 0,10 $ el millón y la comunicación sistemática en coste por tarea lo demuestran. Aun así, conviene leer estas cifras con cautela. Todos los resultados los publica OpenAI, a menudo con niveles de esfuerzo de razonamiento elegidos para cada benchmark. Algunas pruebas (GDP.pdf, AutomationBench) son poco conocidas. Y las comparaciones de coste con la competencia dependen de convenciones discutibles, como reconoce la nota sobre los fallbacks de Claude Fable 5.1. Por último, que Astra siga liderando en ciencia y que Sol aún no esté en Chat indica una segmentación deliberada: Sol para el trabajo en volumen, Astra para las tareas más difíciles. Para los equipos que hacen correr agentes en producción, es la buena noticia del trimestre, siempre que se repitan las mediciones con sus propias tareas.

#openai#llm#agentes#api#codex#benchmarks
Fuente original
Introducing GPT-6.1 Sol
OpenAI
Abrir el artículo ↗

Para ti

Ponla a trabajar con tus fuentes.

Gratis: los artículos de la semana y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.

Para tu equipo

La misma máquina, sobre tus temas.

Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.

Sigue leyendo