GPT-6: la guía de OpenAI para pasar del prototipo a producción
Tres modelos, cinco niveles de razonamiento, dos velocidades y agentes que trabajan durante horas: OpenAI publica el manual de su nueva familia.

En breve
OpenAI publica una guía práctica para startups que construyen con la familia GPT-6: GPT-6 Astra, GPT-6.1 Sol y GPT-6 Luna. El documento explica cómo elegir el modelo y el nivel de razonamiento adecuados, reescribir prompts y skills, gestionar tareas largas y controlar los costes en producción. De ahí surge una visión clara: el desarrollador se convierte en el jefe de proyecto de agentes autónomos.
🍺 Versión de barra
OpenAI lanza tres modelos de golpe y, consciente de que vas a elegir forzosamente el más caro antes de ponerte a revisar las facturas, publica un manual para explicarte cuál escoger. El mensaje de fondo es simple: habla con la IA como con un becario brillante, dile qué quieres, qué puede hacer por su cuenta y en qué momento el trabajo está terminado. De paso, estos agentes ahora pueden currar horas, incluso días, y hasta clicar botones por ti, lo que los convierte en los únicos compañeros que no piden pausa para el café. Lo que importa es que el verdadero saber hacer ya no consiste en escribir código, sino en redactar un pliego de condiciones que hasta ahora nadie leía.
Para recordar
- 1
La familia GPT-6 se divide en tres modelos: Astra para el razonamiento más difícil, GPT-6.1 Sol para código complejo, investigación y computer use, Luna para tareas repetitivas a gran escala.
- 2
El esfuerzo de razonamiento se ajusta en cinco niveles (Low, Medium, High, Extra high / Max), que hay que tratar como un equilibrio entre inteligencia y precio.
- 3
Dos modos de velocidad de pago: Fast para tiempos de respuesta rápidos y estables, Ultrafast (reservado a Astra) que acelera la generación de tokens independientemente del razonamiento.
- 4
El prompt caching reduce hasta un 95% el coste de los tokens de entrada almacenados en caché, siempre que se coloquen las instrucciones estables antes de los detalles cambiantes.
- 5
OpenAI recomienda sustituir reglas del tipo «preguntar siempre» por fronteras de decisión explícitas y definir con precisión qué significa «terminado».
- 6
Para tareas largas: steering en tiempo de ejecución vía la Responses WebSocket API, llamadas a herramientas asíncronas y workflows multiagente (en beta en GPT-6.1 Sol).
- 7
Los tres modelos saben manejar sitios web y aplicaciones de escritorio mediante computer use, incluso software sin API.
Una gama pensada como un equilibrio
La guía plantea desde el inicio el marco: elegir un modelo GPT-6 es equilibrar capacidad, coste y latencia. GPT-6 Astra está reservado a los problemas de razonamiento más difíciles, allí donde se necesita la máxima inteligencia.
GPT-6.1 Sol apunta al código complejo, la investigación y el computer use. GPT-6 Luna se dirige al trabajo masivo de objetivo claro: extraer campos de facturas, clasificar solicitudes, producir resúmenes estructurados.
El nivel de razonamiento se ajusta por separado. Low para extracción o pequeños cambios, Medium para planificar una funcionalidad, High para depuración difícil. Extra high / Max solo debe mantenerse si la ganancia justifica el tiempo y el coste adicionales.
En cuanto a velocidad, el modo Fast ofrece respuestas más rápidas y regulares a un precio por token más elevado. Ultrafast, disponible solo para Astra en Codex y la API, acelera la generación sea cual sea el esfuerzo de razonamiento.
La producción, ante todo una cuestión de contexto y costes
OpenAI insiste en la eficiencia: recortar el contexto innecesario manteniendo los elementos probatorios, y lanzar en paralelo las tareas independientes para que un paso lento no bloquee el resto.
Se destaca el prompt caching: los tokens de entrada en caché cuestan hasta un 95% menos según el modelo. La receta consiste en colocar instrucciones estables y documentos de referencia antes de los detalles variables, y mantener constantes las definiciones de herramientas.
Para las conversaciones largas, la compactación reduce el tamaño del contexto conservando el estado necesario. Antes de cualquier despliegue, la guía recomienda medir la tasa de éxito, la latencia y el coste por tarea completada con éxito, y prever monitorización y controles de datos.
Prompts, skills y AGENTS.md: escribir un verdadero pliego de condiciones
El consejo central, atribuido a Eric Provencher (Developer Experience en OpenAI), se resume en una frase: dar al modelo una misión clara. El resultado esperado, su destinatario, el contexto, las restricciones y qué cuenta como terminado.
Los skills deben tener descripciones cortas que precisen cuándo activarlos, cargar los detalles solo si es necesario, y cambiar las recetas rígidas por orientaciones adaptadas a los modelos utilizados.
El archivo AGENTS.md debe explicar cuándo tal documento o tal test es pertinente y autorizar explícitamente rutinas seguras, como lanzar tests locales sobre datos desechables sin acceso a producción.
Por último, la guía pide ser prescriptivo sobre la perseverancia: «terminado» incluye implementar, ejecutar, inspeccionar el resultado y corregir los fallos. El modelo puede, por ejemplo, elegir la organización de un resumen, pero debe consultar antes de modificar el alcance del proyecto.
Agentes que trabajan horas, incluso días
OpenAI afirma que con GPT-6 se pueden confiar tareas que se extienden durante horas o días. En la API, el steering durante el turno permite enviar una corrección vía la Responses WebSocket API mientras el modelo trabaja; las actualizaciones se ponen en cola sin cancelar las herramientas en curso ni las acciones ya realizadas.
Las llamadas a herramientas asíncronas dejan que el modelo avance en un trabajo independiente mientras una tarea lenta, como una batería de tests, se ejecuta del lado de la aplicación. GPT-6.1 Sol también soporta workflows multiagente, aún en beta: delega en subagentes y luego fusiona sus conclusiones.
En Codex, Astra puede hacer preguntas de clarificación sobre la marcha. La guía aconseja indicar qué tareas pueden continuar mientras se reflexiona, y redirigir explícitamente el trabajo cuando cambian los requisitos.
El computer use, como último recurso
Los tres modelos pueden interactuar directamente con sitios web y aplicaciones de escritorio, incluidas las que no tienen API. Ejemplo citado: investigar un bug, corregir el código, y luego abrir el producto en un navegador para verificar la corrección.
La regla propuesta es pragmática: pasar por una API o una herramienta conectada cuando sea posible, y reservar el computer use para los casos en que haya que leer una pantalla, hacer clic o rellenar un formulario. Para integrarlo en su propia aplicación, OpenAI cita Playwright para el navegador y PyAutoGUI para el escritorio.
“Give the model a clear assignment.”
“Think of the model choice and reasoning level as an intelligence/ price tradeoff.”
“Cached input tokens cost up to 95% less than uncached input tokens, depending on the model.”
Por qué importa
Esta guía dice más sobre la estrategia de OpenAI que una simple ficha de producto. La multiplicación de los controles (modelo, esfuerzo de razonamiento, Fast, Ultrafast, caché) transforma el uso de un LLM en un ejercicio de optimización económica, y la compañía asume que el coste por tarea completada con éxito es la métrica que importa. El segundo mensaje es cultural: el trabajo del desarrollador se desplaza hacia la delegación, con fronteras de decisión, definiciones de «terminado» y agentes que se reorientan sobre la marcha. Es coherente, pero hay que mantener la mirada crítica. Una guía escrita por el propio proveedor empuja naturalmente hacia sus propias herramientas (Responses API, Codex, modos premium) y no dice nada sobre los límites reales de estos agentes en tareas de varios días. El multiagente sigue en beta, y la promesa de un trabajo autónomo sostenido todavía debe verificarse en casos reales, con la factura correspondiente.
Cuenta gratis
Acabas de leer un artículo de AI Sources
Crea una cuenta gratuita: un mes de archivo completo, tus propias fuentes resumidas como esta, tus notas y subrayados.
Para ti
Ponla a trabajar con tus fuentes.
Gratis: un mes de artículos y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.
Para tu equipo
La misma máquina, sobre tus temas.
Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.
Sigue leyendo
#superinteligenciaAyerHinton, Bengio, OpenAI y Anthropic firman un plan contra la explosión de inteligencia
Veintidós investigadores, incluidos directivos de OpenAI y Anthropic, sostienen que la automatización de la investigación en IA podría comprimir años de progreso en pocos meses, y que los Estados no están preparados para ello.
Fuente · Cambridge Programme on AI Science & Policy (CASP) · What if automating AI R&D triggers an intelligence explosion?
#agentesAyerFLUX 3 Image: Black Forest Labs apuesta por la maquetación al píxel
Con FLUX 3 Image, ya no basta con describir una imagen: se dibuja caja por caja, y luego se retoca sin que el resto se mueva.
Fuente · Black Forest Labs · FLUX 3 Image: Maximum control over every pixel
#open source2 octClef: Cloudflare lanza sus propios modelos de decisión, open source
Con Clef y Clef-flash, Cloudflare entra en el mercado naciente de los «decision models» y añade una plataforma de fine-tuning por reinforcement learning.
Fuente · Cloudflare Blog · Introducing Clef: our open-source decision models, and new RL fine-tuning platform