GPT-6: la guida di OpenAI per passare dal prototipo alla produzione
Tre modelli, cinque livelli di ragionamento, due velocità e agenti che lavorano per ore: OpenAI pubblica il manuale d'uso della sua nuova famiglia.

In breve
OpenAI pubblica una guida pratica destinata alle startup che costruiscono con la famiglia GPT-6: GPT-6 Astra, GPT-6.1 Sol e GPT-6 Luna. Il documento spiega come scegliere il modello giusto e il livello di ragionamento adatto, riscrivere prompt e skill, gestire task lunghi e controllare i costi in produzione. Ne emerge una visione chiara: lo sviluppatore diventa il project manager di agenti autonomi.
🍺 Versione da bancone
OpenAI lancia tre modelli in un colpo solo e, consapevole che sceglierai inevitabilmente il più caro per poi lamentarti delle fatture, pubblica un manuale per spiegarti quale prendere. Il messaggio di fondo è semplice: parla all'IA come a uno stagista brillante, digli cosa vuoi, cosa può fare da solo e quando il lavoro è finito. Nel frattempo, questi agenti possono lavorare per ore, persino giorni, e cliccare bottoni al posto tuo, il che li rende gli unici colleghi che non chiedono una pausa caffè. Quello che conta è che la vera competenza non consiste più nello scrivere codice ma nel redigere un capitolato che finora nessuno leggeva.
Da ricordare
- 1
La famiglia GPT-6 si articola in tre modelli: Astra per il ragionamento più difficile, GPT-6.1 Sol per codice complesso, ricerca e computer use, Luna per task ripetitivi su larga scala.
- 2
Lo sforzo di ragionamento si imposta su cinque livelli (Low, Medium, High, Extra high / Max), da trattare come un compromesso intelligenza/prezzo.
- 3
Due modalità di velocità a pagamento: Fast per tempi di risposta rapidi e stabili, Ultrafast (riservato ad Astra) che accelera la generazione di token indipendentemente dal ragionamento.
- 4
Il prompt caching riduce fino al 95% il costo dei token di input in cache, a condizione di posizionare le istruzioni stabili prima dei dettagli variabili.
- 5
OpenAI consiglia di sostituire regole tipo «chiedi sempre» con confini decisionali espliciti e di definire con precisione cosa significhi «finito».
- 6
Per i task lunghi: steering in corso d'esecuzione via la Responses WebSocket API, chiamate a strumenti asincrone e workflow multi-agente (in beta su GPT-6.1 Sol).
- 7
Tutti e tre i modelli sanno pilotare siti web e applicazioni desktop tramite computer use, anche software privi di API.
Una gamma pensata come un compromesso
La guida pone subito il quadro: scegliere un modello GPT-6 significa bilanciare capacità, costo e latenza. GPT-6 Astra è riservato ai problemi di ragionamento più difficili, quelli in cui serve l'intelligenza massima.
GPT-6.1 Sol punta su codice complesso, ricerca e computer use. GPT-6 Luna è pensato per il lavoro di massa con obiettivo chiaro: estrarre campi da fatture, classificare richieste, produrre riassunti strutturati.
Il livello di ragionamento si imposta separatamente. Low per l'estrazione o piccole modifiche, Medium per pianificare una funzionalità, High per il debug difficile. Extra high / Max va mantenuto solo se il guadagno giustifica il tempo e il costo aggiuntivi.
Sul fronte velocità, la modalità Fast offre risposte più rapide e regolari a fronte di una tariffa per token più alta. Ultrafast, disponibile solo per Astra in Codex e nell'API, accelera la generazione indipendentemente dallo sforzo di ragionamento.
La produzione, prima di tutto una questione di contesto e costi
OpenAI insiste sull'efficienza: tagliare il contesto inutile mantenendo gli elementi probanti, e lanciare in parallelo i task indipendenti perché una fase lenta non blocchi il resto.
Il prompt caching viene messo in evidenza: i token di input in cache costano fino al 95% in meno a seconda del modello. La ricetta consiste nel posizionare istruzioni stabili e documenti di riferimento prima dei dettagli variabili, e mantenere costanti le definizioni degli strumenti.
Per le conversazioni lunghe, la compaction riduce la dimensione del contesto mantenendo lo stato necessario. Prima di ogni deployment, la guida raccomanda di misurare il tasso di successo, la latenza e il costo per task riuscito, e di prevedere monitoraggio e controlli sui dati.
Prompt, skill e AGENTS.md: scrivere un vero capitolato
Il consiglio centrale, attribuito a Eric Provencher (Developer Experience presso OpenAI), si riassume in una frase: dare al modello una missione chiara. Il risultato atteso, il suo destinatario, il contesto, i vincoli e cosa conta come finito.
Le skill devono avere descrizioni brevi che precisano quando attivarle, caricare i dettagli solo se necessario, e scambiare ricette rigide con orientamenti adattati ai modelli utilizzati.
Il file AGENTS.md deve spiegare quando un determinato documento o test è rilevante e autorizzare esplicitamente le routine sicure, come lanciare test locali su dati usa e getta senza accesso alla produzione.
Infine, la guida chiede di essere prescrittivi sulla perseveranza: «finito» include implementare, eseguire, ispezionare il risultato e correggere i fallimenti. Il modello può ad esempio scegliere l'organizzazione di un riassunto, ma deve consultare prima di modificare il perimetro del progetto.
Agenti che lavorano per ore, persino giorni
OpenAI afferma che con GPT-6 si possono affidare task che si estendono per ore o giorni. Nell'API, lo steering durante il turno permette di inviare una correzione via la Responses WebSocket API mentre il modello lavora; gli aggiornamenti vengono accodati senza annullare gli strumenti in corso né le azioni già compiute.
Le chiamate a strumenti asincrone lasciano il modello proseguire su un lavoro indipendente mentre un task lento, come una suite di test, gira lato applicazione. GPT-6.1 Sol supporta anche workflow multi-agente, ancora in beta: delega a sotto-agenti e poi fonde le loro conclusioni.
In Codex, Astra può porre domande di chiarimento in corso d'opera. La guida consiglia di indicare quali task possono continuare mentre si riflette, e di reindirizzare esplicitamente il lavoro quando i requisiti cambiano.
Il computer use, come ultima risorsa
I tre modelli possono interagire direttamente con siti web e applicazioni desktop, incluse quelle prive di API. Esempio citato: indagare su un bug, correggere il codice, poi aprire il prodotto in un browser per verificare la correzione.
La regola proposta è pragmatica: passare da un'API o uno strumento connesso quando possibile, e riservare il computer use ai casi in cui serve leggere uno schermo, cliccare o compilare un modulo. Per integrarlo nella propria applicazione, OpenAI cita Playwright per il browser e PyAutoGUI per il desktop.
“Give the model a clear assignment.”
“Think of the model choice and reasoning level as an intelligence/ price tradeoff.”
“Cached input tokens cost up to 95% less than uncached input tokens, depending on the model.”
Perché conta
Questa guida rivela più sulla strategia di OpenAI di una semplice scheda prodotto. La moltiplicazione dei cursori (modello, sforzo di ragionamento, Fast, Ultrafast, cache) trasforma l'uso di un LLM in un esercizio di ottimizzazione economica, e l'azienda dà per scontato che il costo per task riuscito sia la metrica che conta. Il secondo messaggio è culturale: il lavoro dello sviluppatore scivola verso la delega, con confini decisionali, definizioni di «finito» e agenti che si riorientano in corso d'opera. È coerente, ma occorre mantenere uno sguardo critico. Una guida scritta dal venditore spinge naturalmente verso i propri strumenti (Responses API, Codex, modalità premium) e non dice nulla sui limiti reali di questi agenti su task di più giorni. Il multi-agente è ancora in beta, e la promessa di un lavoro autonomo prolungato resta da verificare su casi reali, con la relativa fattura.
Account gratuito
Hai appena letto un articolo di AI Sources
Crea un account gratuito: un mese di archivio completo, le tue fonti riassunte come questa, le tue note ed evidenziazioni.
Per te
Falla lavorare sulle tue fonti.
Gratis: un mese di articoli e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.
Per il tuo team
La stessa macchina, sui vostri temi.
Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.
Da leggere anche
#ricercaIeriHinton, Bengio, OpenAI e Anthropic firmano un piano contro l'esplosione di intelligenza
Ventidue ricercatori, tra cui dirigenti di OpenAI e Anthropic, ritengono che l'automazione della ricerca in IA potrebbe comprimere anni di progresso in pochi mesi, e che gli Stati non sono preparati.
Fonte · Cambridge Programme on AI Science & Policy (CASP) · What if automating AI R&D triggers an intelligence explosion?
#agentiIeriFLUX 3 Image: Black Forest Labs punta sull'impaginazione al pixel
Con FLUX 3 Image non si descrive più solo un'immagine: la si disegna riquadro per riquadro, poi la si ritocca senza che il resto si muova.
Fonte · Black Forest Labs · FLUX 3 Image: Maximum control over every pixel
#open source2 ottClef: Cloudflare lancia i propri modelli di decisione, open source
Con Clef e Clef-flash, Cloudflare entra nel mercato nascente dei «decision model» e vi aggiunge una piattaforma di fine-tuning tramite reinforcement learning.
Fonte · Cloudflare Blog · Introducing Clef: our open-source decision models, and new RL fine-tuning platform