AI Sources
De primera manoIAArtículo··7 min de lectura

GPT-6 Sol y Luna: OpenAI reduce a la mitad sus precios de API

Tras Astra, OpenAI despliega su nueva generación en dos modelos más baratos y ataca frontalmente a Claude en la relación coste/inteligencia.

GPT-6 Sol y Luna: OpenAI reduce a la mitad sus precios de API
Fuente : OpenAI · OpenAIVer el original

En breve

OpenAI completa la familia GPT-6 con Sol y Luna, dos modelos entrenados con los mismos métodos que Astra pero optimizados para el coste, con precios de API reducidos un 50% respecto a la tarifa promocional de GPT-5.6. El anuncio está repleto de comparaciones numéricas con Claude Opus 5 y Fable 5.1, donde Sol alcanza puntuaciones equivalentes o superiores por un 80 a 90% menos por tarea. Se suma un gran trabajo sobre el prompt caching para los agentes y disponibilidad inmediata en ChatGPT Work, Codex y la API.

🍺 Versión de barra

Ya conoces el guion: el modelo tope de gama sale primero para impresionar, las versiones asequibles llegan tres semanas después para cobrar. Sol y Luna son los GPT-6 que cuestan la mitad y que, según los benchmarks caseros de OpenAI, superan a Claude Opus 5 al 9% de su tarifa — una cifra presentada con la calma de un vendedor que te dice que la oferta termina esta noche. El verdadero tema es este: para los agentes que funcionan en bucle durante horas, la factura pesa tanto como la inteligencia. Cuando un investigador de OpenAI quema 600 dólares en tokens al día de mediana, se entiende por qué el precio se convierte de repente en una característica del producto.

Para recordar

  1. 1

    OpenAI amplía la familia GPT-6 con Sol y Luna, entrenados con métodos similares a los de Astra pero posicionados en la eficiencia de coste.

  2. 2

    Los precios de la API bajan un 50% respecto a la tarifa promocional de GPT-5.6: Sol pasa a 2$ / 10$ por millón de tokens (entrada / salida), Luna a 0,10$ / 0,50$.

  3. 3

    En AutomationBench 1.0.6, Sol con esfuerzo xhigh obtiene 33,2% por 0,27$ por tarea, frente al 26,9% de Claude Opus 5 con esfuerzo max, es decir 11,1 veces más caro.

  4. 4

    En DeepSWE v1.1, Sol en max alcanza 68,8%, a 1,1 puntos de la mejor puntuación de Claude Fable 5 en la evaluación, por aproximadamente un 80% menos por tarea.

  5. 5

    La fiabilidad factual mejora: Sol comete aproximadamente la mitad de errores que su predecesor en la evaluación interna construida a partir de conversaciones reales señaladas por usuarios.

  6. 6

    El prompt caching se reelabora: mejores tasas de acierto por defecto, 90% de descuento sobre los tokens de entrada en caché, panel y herramienta de diagnóstico, y cambios de esfuerzo o de herramientas sin romper la caché.

  7. 7

    Disponibles desde hoy en ChatGPT Work y Codex para Plus, Pro, Business, Enterprise y Edu; Luna llega también para cuentas Free y Go en la app de escritorio, y la API expone gpt-6-sol y gpt-6-luna.

Una familia de tres niveles

Astra sigue siendo, en el discurso de OpenAI, la cima: el modelo más inteligente y mejor alineado, el que se elige cuando no se quiere ningún compromiso. Sol y Luna no pretenden sustituirlo, sino ocupar los dos niveles inferiores, donde se desarrolla la mayor parte del trabajo diario.

El argumento central no es «más inteligente» sino «misma generación, más barato». OpenAI afirma haber entrenado Sol y Luna con métodos similares a los de Astra, transfiriendo sus avances en trabajo profesional, factualidad, código, uso del ordenador y alineación hacia modelos más rápidos.

El vocabulario empleado es revelador: la empresa habla de «hacer avanzar la frontera de la eficiencia de coste». La competencia ya no se juega solo en la puntuación máxima alcanzable, sino en la posición ocupada a lo largo de la curva coste/inteligencia.

La guerra de precios por tarea

La bajada tarifaria es clara: 2$ en entrada y 10$ en salida por millón de tokens para Sol, 0,10$ y 0,50$ para Luna, es decir la mitad de la tarifa promocional de los GPT-5.6 correspondientes. OpenAI atribuye este margen a mejoras de infraestructura en el caching y la inferencia, trasladadas a los clientes.

Pero la métrica destacada en todo el post no es el precio del token: es el coste por tarea. En AutomationBench, una prueba de flujos de trabajo empresariales que moviliza 47 herramientas en ventas, marketing, operaciones, soporte, finanzas y RR.HH., Sol con esfuerzo xhigh puntúa 33,2% por 0,27$ por tarea, mientras Claude Opus 5 en max se queda en 26,9% por 11,1 veces ese coste.

OpenAI llega a señalar que el punto de Claude Fable 5.1 subestima su coste real, ya que omite los recursos de respaldo hacia Opus 5, que ocurrieron en aproximadamente un 40% de las tareas. Estamos ante una comparación competitiva asumida, con el nivel de detalle metodológico correspondiente — y la advertencia habitual de que las puntuaciones de la competencia proceden de informes públicos.

Detalle punzante: Sol en xhigh supera también a Astra con esfuerzo low (33,2% frente a 30,3%), por casi cuatro veces menos coste. La jerarquía de los modelos ya no es lineal, depende del nivel de esfuerzo elegido.

Código, factualidad, uso del ordenador

En el código, OpenAI justifica su lógica con sus propias cifras internas: valorado a precios de la API, el consumo diario de tokens supera los 600$ para el investigador mediano y los 7.000$ en el percentil 90. Cuando los agentes de código trabajan durante mucho tiempo, el coste de uso sostenido se convierte en la principal restricción.

Los resultados siguen esta lógica: en DeepSWE v1.1, Sol en max alcanza 68,8%, a 1,1 puntos de la mejor puntuación de Claude Fable 5 en la evaluación, por aproximadamente un 80% menos por tarea. Luna en max obtiene 66,6%, comparable a Opus 5 y Fable 5 con esfuerzo medium, pero un 93% y un 96% más barato respectivamente.

En cuanto a factualidad, OpenAI evalúa sus modelos sobre conversaciones de ChatGPT desidentificadas en las que usuarios habían señalado un error. Sol comete allí aproximadamente la mitad de errores que su predecesor; Luna con esfuerzo alto iguala a GPT-5.6 Sol por aproximadamente una centésima parte de su coste. La empresa precisa que estas conversaciones, elegidas porque inducen errores, no reflejan el uso típico.

En cuanto al uso del ordenador, Astra sigue presentándose como el mejor modelo del mundo. Sol en xhigh obtiene 60,5% en OSWorld 2.0 offline, empatado con Opus 5 en medium (60,3%), por aproximadamente un 80% menos de coste por tarea.

El caching, arma discreta de los agentes

La parte menos espectacular del post es quizás la más estructurante. OpenAI anuncia mejores tasas de acierto de caché por defecto en GPT-6, con un descuento del 90% en la lectura de tokens de entrada en caché — una palanca decisiva cuando un agente reinyecta el mismo contexto en cada turno.

Tres novedades equipan a los desarrolladores: un Prompt Caching Dashboard para seguir la parte de entrada en caché, una herramienta de diagnóstico que explica las oportunidades perdidas, y breakpoints explícitos para elegir dónde termina el prefijo cacheado. Sobre todo, modificar el esfuerzo de razonamiento o activar/desactivar herramientas ya no rompe la caché.

La prueba social viene de GitHub: en los últimos meses, estas mejoras habrían reducido en más de un 50% la proporción de tokens de prompt que necesitan procesamiento fresco, sobre miles de millones de solicitudes, acelerando las respuestas de Copilot.

Estilo, alineación y disponibilidad

OpenAI también ha trasladado a Sol y Luna el estilo de comunicación de Astra: más claridad, menos jerga, menos giros extraños, menos detalles de bajo valor, y respuestas ligeramente más cortas. La empresa ilustra su punto con un ejemplo de prompt front-end en React, explicando por qué prefiere la respuesta de GPT-6 Sol — más explícita sobre lo que se ha verificado o no, menos charlatana sobre sus propias herramientas.

En cuanto a la alineación, ambos modelos mejoran respecto a sus equivalentes GPT-5.6, en particular en la tasa de afirmaciones engañosas sobre su propio trabajo de código. OpenAI recuerda que estas evaluaciones prueban deliberadamente situaciones difíciles y no miden tasas de fallo en uso normal; la system card contiene los resultados completos.

El despliegue es inmediato pero parcial: ChatGPT Work y Codex para Plus, Pro, Business, Enterprise y Edu, Luna en la app de escritorio para Free y Go. Los modelos aún no están disponibles en Chat, y el despliegue se extiende a lo largo del día para preservar la estabilidad del servicio.

GPT-6 Astra continues to be our best model across the board.
GPT-6 Sol at xhigh effort outperforms Claude Opus 5 at max effort at just 9% of Opus 5's cost per task.
Daily token usage has exceeded $600 for the median researcher and $7,000 for researchers at the 90th percentile.

Por qué importa

Este anuncio dice menos sobre el estado del arte que sobre el estado del mercado. Al desglosar GPT-6 en tres niveles y dividir los precios por dos, OpenAI reconoce que la batalla ya no se gana en la cima de los benchmarks sino en el coste por tarea completada — la única métrica que importa cuando los agentes funcionan de forma continua. La elección de comparar sistemáticamente Sol y Luna con Claude Opus 5 y Fable 5.1, insistiendo en ratios del 9% o del 4% del coste de la competencia, es un ataque directo al terreno donde Anthropic se ha instalado, el de los agentes de código en empresas. Queda la prudencia de uso: estas cifras proceden de evaluaciones realizadas por OpenAI en su propio entorno de investigación, las puntuaciones de la competencia se toman de informes públicos, y los niveles de esfuerzo comparados no siempre son idénticos — un modelo en «xhigh» frente a un competidor en «medium» no es una igualdad neutra. La señal más sólida está en otra parte: en el trabajo sobre el caching y en la confesión de que, incluso internamente, la factura de tokens se ha convertido en un problema de gestión.

#openai#gpt-6#llm#api#agentes#coste
Fuente original
Introducing GPT-6 Sol and Luna
OpenAI
Abrir el artículo

Para equipos

La misma máquina, sobre vuestros temas.

Vuestras fuentes, vuestro equipo, cada mañana, en vuestro idioma. Piloto abierto a tres empresas.

Solicitar acceso piloto

Sigue leyendo