Vai al contenuto principale
OpenAI

Presentazione di GPT‑6 Sol e Luna

Più modi per portare l’intelligenza di frontiera nel lavoro di ogni giorno.

Caricamento in corso...

All’inizio di questo mese abbiamo presentato GPT‑6 Astra, il modello più intelligente e allineato al mondo. Anche se i progetti più impegnativi e importanti richiedono ancora tutte le capacità di Astra, il lavoro si svolge su scale, con ritmi e budget diversi.

Per questo stiamo ampliando l’universo GPT‑6 con GPT‑6 Sol e GPT‑6 Luna. GPT‑6 Astra ha inaugurato una nuova generazione di intelligenza; questi modelli contribuiscono a distribuirne i vantaggi spostando la frontiera dell’efficienza economica. Abbiamo addestrato GPT‑6 Sol e Luna con metodi simili a quelli usati per GPT‑6 Astra, portando in modelli più veloci e convenienti i progressi alla base delle prestazioni all’avanguardia di Astra nel lavoro professionale, nell’accuratezza fattuale, nella programmazione, nell’uso del computer e nell’allineamento.

I modelli GPT‑6 sono in testa lungo tutta la curva costo-intelligenza, combinando capacità eccezionali a ogni livello con un’infrastruttura in grado di offrirle in modo efficiente e su larga scala. I miglioramenti apportati al caching e all’inferenza ci consentono di offrire questi modelli a un costo inferiore. Trasferiamo direttamente il risparmio a utenti e clienti riducendo del 50% i prezzi API di Sol e Luna rispetto ai prezzi promozionali di GPT‑5.6. Nel complesso, questi miglioramenti rendono l’IA avanzata una soluzione pratica per più attività quotidiane e applicazioni su larga scala.

Prezzi dell’API GPT‑6

Modello

Input

Output

Riduzione del prezzo

GPT‑6 Sol
rispetto a GPT‑5.6 Sol

4 $ → 2 $

20 $ → 10 $

50% in meno

GPT‑6 Luna
rispetto a GPT‑5.6 Luna

0,20 $ → 0,10 $

1,20 $ → 0,50 $

50% in meno

I prezzi si intendono per 1 milione di token.

GPT‑6 Astra resta il nostro modello migliore sotto ogni aspetto. Sceglilo quando vuoi i risultati migliori e un’esperienza senza compromessi.

Un salto di qualità per l’intera famiglia di modelli

GPT‑6 Sol e Luna migliorano l’intelligenza e l’efficienza economica dei modelli che già conosci e utilizzi, potenziando le capacità più utili per portare a termine lavori complessi.

Lavoro professionale

GPT‑6 Sol può affrontare attività lavorative difficili, lasciandoti più margine per le iterazioni grazie a limiti di utilizzo più elevati e costi inferiori. Offre inoltre maggiore intelligenza e risultati migliori rispetto ai modelli concorrenti di prezzo analogo.

In AutomationBench, un test sui flussi di lavoro aziendali tra diverse app, GPT‑6 Sol con livello di ragionamento xhigh supera Claude Opus 5 con livello Max, a un costo per attività pari ad appena il 9% di quello di Opus 5. Con un livello di ragionamento Alto, GPT‑6 Luna migliora di 5,4 punti percentuali rispetto al predecessore, riducendo del 58% il costo per attività.

In AutomationBench 1.0.6⁠(si apre in una nuova finestra), gli agenti di IA vengono testati su flussi di lavoro completi che utilizzano 47 strumenti nei settori vendite, marketing, operazioni, assistenza, finanza e risorse umane. Il dato relativo a Claude Fable 5.1 ne sottostima il costo effettivo, perché non include il costo dei fallback su Opus 5, avvenuti in circa il 40% delle attività.

GPT‑6 Sol supera anche Claude Fable 5.1 a un costo molto inferiore e batte persino GPT‑6 Astra con livello di ragionamento basso.

Modello (e livello di ragionamento)

Punteggio

Costo per attività

GPT‑6 Sol (xhigh)

33,2%

0,27 $

GPT‑6 Astra (basso)

30,3%

3,9 volte GPT‑6 Sol

Claude Opus 5 (Max)

26,9%

11,1 volte GPT‑6 Sol

Claude Fable 5.1 con fallback su Opus 5 (Max)

31,4%

>8,9 volte GPT‑6 Sol

(costo del fallback non comunicato)

In Agents’ Last Exam, che valuta gli agenti su flussi di lavoro professionali complessi, GPT‑6 Sol con livello di ragionamento Max ottiene il 56,4%, superando il punteggio più alto di Claude Opus 5 nella valutazione con un costo per attività inferiore del 60%.

In Agents’ Last Exam V1⁠(si apre in una nuova finestra), gli agenti di IA vengono valutati su attività economicamente rilevanti e di lunga durata in 55 sottosettori, che coprono la maggior parte dei principali ambiti del lavoro professionale svolto al computer.

Accuratezza fattuale

L’utilità di una risposta dipende dalla correttezza dei fatti e continuiamo a migliorare l’affidabilità fattuale. Nella nostra valutazione interna dell’accuratezza fattuale, basata su conversazioni reali anonimizzate in cui gli utenti avevano segnalato errori dei nostri modelli, GPT‑6 Sol commette circa la metà degli errori del suo predecessore, avvicinandosi all’affidabilità di Astra a un costo molto inferiore. Anche GPT‑6 Luna migliora notevolmente: ai livelli di ragionamento più elevati eguaglia GPT‑5.6 Sol a un costo circa cento volte inferiore.

Qui valutiamo l’accuratezza fattuale su conversazioni ChatGPT anonimizzate in cui gli utenti avevano segnalato un errore fattuale di un modello precedente. Queste conversazioni, che tendono a provocare errori, non rappresentano l’uso tipico, nel quale gli errori fattuali sono più rari. I punteggi non sono normalizzati in base alla lunghezza; tuttavia, le nostre analisi su diversi livelli di verbosità hanno mostrato una dipendenza quasi nulla dalla lunghezza della risposta.

Programmazione

Quest’anno gli agenti di programmazione hanno iniziato ad affrontare attività più complesse, ampie e lunghe che mai. In OpenAI, il nostro utilizzo interno è cresciuto in modo esponenziale. Calcolato in base ai prezzi API, l’utilizzo giornaliero di token ha superato i 600 $ per il ricercatore mediano e i 7.000 $ per i ricercatori al 90° percentile (Accelerare la ricerca: uno sguardo all’interno di OpenAI⁠). Man mano che gli agenti di programmazione affrontano attività più lunghe e impegnative, il costo di un utilizzo continuativo acquista maggiore importanza. GPT‑6 Sol e Luna combinano ottime prestazioni di programmazione con prezzi API più bassi, offrendo agli sviluppatori più margine per le iterazioni e ai team la sicurezza necessaria per affidare a Codex attività più ambiziose.

In FrontierCode, che valuta se gli agenti di programmazione producono modifiche pronte per essere integrate in codebase reali, GPT‑6 Sol migliora notevolmente rispetto a GPT‑5.6 Sol e riesce a eguagliare Claude Fable 5.1 xhigh a un costo molto inferiore.

In FrontierCode 1.1 Main⁠(si apre in una nuova finestra), gli agenti di IA scrivono codice valutato non solo per la correttezza, ma anche per la “possibilità di integrazione”: per esempio, qualità dei test, rispetto dell’ambito, stile del codice e conformità agli standard della codebase.

In DeepSWE v1.1, che verifica le prestazioni su attività complesse di ingegneria del software in codebase reali, GPT‑6 Sol con livello di ragionamento Max ottiene il 68,8%, ad appena 1,1 punti percentuali dal punteggio più alto di Claude Fable 5 nella valutazione, pari al 69,9% con livello xhigh, e con un costo per attività inferiore di circa l’80%.

GPT‑6 Luna con livello di ragionamento Max ottiene il 66,6%, un risultato paragonabile a quelli di Claude Opus 5 e Fable 5 con livello Medio. In questi confronti, il costo per attività di Luna è inferiore del 93% rispetto a Opus 5 e del 96% rispetto a Fable 5.

In DeepSWE 1.1⁠(si apre in una nuova finestra), gli agenti di IA risolvono attività originali e di lunga durata nell’ambito dell’ingegneria del software.

Uso del computer

Sebbene GPT‑6 Astra resti il miglior modello al mondo per l’uso del computer, GPT‑6 Sol e Luna offrono prestazioni più convenienti rispetto ai rispettivi predecessori. In OSWorld 2.0 offline, GPT‑6 Sol con livello di ragionamento xhigh ottiene un punteggio simile a Claude Opus 5 con livello Medio, rispettivamente 60,5% e 60,3%, a un costo per attività inferiore di circa l’80%. GPT‑6 Luna (Max) riesce a superare GPT‑5.6 Sol (Medio) a un decimo del costo.

In OSWorld 2.0⁠(si apre in una nuova finestra), gli agenti di IA tentano di completare al computer flussi di lavoro di lunga durata che comprendono attività quotidiane e professionali. Riportiamo la ricompensa parziale sul set offline della versione v2026.08.08.

Stile di collaborazione

Abbiamo portato anche su Sol e Luna lo stile comunicativo migliorato di GPT‑6 Astra, che riteniamo sarà particolarmente evidente nelle conversazioni tecniche e di programmazione. Le risposte saranno in genere un po’ più brevi, senza perdere sostanza, e offriranno maggiore chiarezza, meno gergo, meno formulazioni insolite e meno dettagli di scarso valore.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Anche se lo stile è soggettivo, in questo caso preferiamo la risposta di GPT‑6 Sol. Non trae conclusioni altrettanto affrettate, dedica meno spazio a ribadire dettagli che potrebbero essere ovvi per chi ha posto la domanda (per esempio, che il sito web ha quattro pagine), usa un linguaggio meno vago (per esempio, “stile bento” e “rimodellare… attorno a quel sistema”), indica più chiaramente che cosa ha verificato e che cosa no e non condivide inutilmente dettagli d’implementazione come il prompt del suo strumento per immagini.

Migliorare il caching per gli agenti e le conversazioni lunghe

Oltre a ridurre i prezzi dei token, aiutiamo gli sviluppatori che creano soluzioni basate su GPT‑6 a risparmiare di più sul contesto riutilizzato dalle loro applicazioni. Abbiamo migliorato il caching dei prompt per GPT‑6, aumentando per impostazione predefinita il tasso di riscontri nella cache. In questo modo, gli agenti possono riutilizzare più contesto, rispondere più velocemente e usufruire di uno sconto del 90% sulla lettura dei token di input memorizzati nella cache.

Gli sviluppatori dispongono inoltre di più strumenti per misurare e ottimizzare le prestazioni del caching:

GitHub riferisce che, negli ultimi mesi, questi miglioramenti hanno ridotto di oltre il 50% la quota di token dei prompt che richiede una nuova elaborazione, su miliardi di richieste ai modelli OpenAI, aiutando Copilot a rispondere più velocemente.

Continuare a migliorare l’allineamento

GPT‑6 Sol e Luna si basano sul lavoro di allineamento introdotto con Astra, il nostro modello più allineato di sempre. Nelle nostre valutazioni dell’allineamento, sia Sol sia Luna migliorano rispetto alle rispettive versioni GPT‑5.6, anche grazie a una minore frequenza di affermazioni fuorvianti sul lavoro di programmazione svolto.

Le valutazioni seguenti esaminano deliberatamente situazioni difficili e non misurano i tassi di errore nell’uso tipico. Consulta la scheda di sistema⁠(si apre in una nuova finestra) per i risultati completi.

Disponibilità

Da oggi, GPT‑6 Sol e GPT‑6 Luna sono disponibili in ChatGPT Work e Codex per tutti gli utenti Plus, Pro, Business, Enterprise ed Edu. Gli utenti Free e Go possono accedere a GPT‑6 Luna nell’app desktop. Questi modelli non sono ancora disponibili in Chat. Nell’API OpenAI sono disponibili come gpt-6-sol e gpt-6-luna.

Per mantenere stabile il servizio per tutti, prevediamo di introdurre gradualmente questi modelli in ChatGPT nel corso della giornata. Se non vedi i nuovi modelli in ChatGPT Work o Codex, riprova più tardi.


Le valutazioni di GPT sono state eseguite nel nostro ambiente di ricerca o tramite la nostra API, che potrebbe produrre output leggermente diversi rispetto alla versione di produzione di ChatGPT a causa di differenze nei prompt di sistema, negli strumenti disponibili e così via. Le valutazioni dei modelli concorrenti sono tratte da report pubblici. Quando i punteggi di Claude Fable 5.1 non erano disponibili, sono stati riportati quelli di Claude Fable 5.

Autore

OpenAI