Vai al contenuto principale
OpenAI

GPT-6.1Sol

Near-Astra intelligence for a fifth of the price

Presentiamo GPT‑6.1 Sol, un aggiornamento di GPT‑6 Sol con prestazioni eccezionali nel coding agentico, nell'uso del computer e nel lavoro professionale. Avvicina Sol a GPT‑6 Astra nelle attività impegnative, a un quinto dei prezzi standard di Astra per i token di input e output, offrendo agli sviluppatori più margine per creare ed eseguire agenti capaci a parità di budget.

GPT‑6.1 Sol offre prestazioni vicine ad Astra ai prezzi di Sol, con il miglior rapporto tra costo e prestazioni tra i modelli oggi disponibili. L'input in cache costa solo 0,10 $ per milione di token, con uno sconto del 95% sul prezzo standard dell'input: una soluzione più conveniente per i carichi di lavoro agentici che richiedono di riutilizzare il contesto in richieste ripetute.

GPT‑6 Astra rimane nel complesso il nostro modello di frontiera più capace. GPT‑6.1 Sol offre un nuovo equilibrio tra capacità e costi per le attività importanti che gli utenti vogliono svolgere più spesso e per i clienti API che sviluppano ed eseguono applicazioni su larga scala.

Tre schede dei modelli: GPT-6 Astra, il nostro modello più intelligente per i migliori risultati, 10 $ per l'input, 50 $ per l'output e 1 $ per l'input in cache; GPT-6.1 Sol, un'intelligenza vicina ad Astra a un quinto del prezzo, 2 $ per l'input, 10 $ per l'output e 0,10 $ per l'input in cache; GPT-6 Luna, rapido ed efficiente per il lavoro quotidiano su larga scala, 0,10 $ per l'input, 0,50 $ per l'output e 0,01 $ per l'input in cache.

Un Sol più capace in ogni attività

GPT‑6.1 Sol migliora notevolmente rispetto a GPT‑6 Sol nelle attività professionali complesse, dalla scrittura e dal debug del codice alla comprensione dei documenti e all'esecuzione di flussi di lavoro aziendali in più fasi. In diverse di queste valutazioni si avvicina alle prestazioni di GPT‑6 Astra a un costo nettamente inferiore.

Programmazione

Su DeepSWE v1.1, che valuta attività complesse di ingegneria del software su codebase reali, GPT‑6.1 Sol eguaglia GPT‑6 Astra a circa un quinto del costo e supera il miglior punteggio di GPT‑6 Sol di 6,4 punti percentuali, con uno sforzo di ragionamento e un costo inferiori.

In DeepSWE 1.1⁠⁠(si apre in una nuova finestra), gli agenti di IA svolgono compiti inediti di ingegneria del software che richiedono lunghe sequenze di operazioni.

Lavoro professionale

Su GDP.pdf, che misura l'accuratezza con cui i modelli rispondono a domande professionali usando documenti PDF complessi, con tabelle, grafici, diagrammi e dettagli in caratteri piccoli, GPT‑6.1 Sol supera Opus 5.5 con fallback a meno della metà del costo per attività, nelle impostazioni di ragionamento testate. Si avvicina inoltre alle prestazioni all'avanguardia di GPT‑6 Astra a circa un quinto del costo per attività.

In GDP.pdf⁠(si apre in una nuova finestra), i modelli devono rispondere a prompt reali su PDF complessi tratti da flussi di lavoro professionali in ambito finanziario, sanitario, legale e in altri sette settori.

Su AutomationBench, che misura se gli agenti completano correttamente flussi di lavoro aziendali in più fasi, GPT‑6.1 Sol supera Opus 5.5 di 2,2 punti percentuali con sforzo di ragionamento impostato su Medio, a circa un terzo del costo. Questo punteggio supera anche quello di GPT‑6 Sol di 4,8 punti percentuali con la stessa impostazione.

In AutomationBench 1.0.6⁠⁠(si apre in una nuova finestra), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Uso del computer

GPT‑6.1 Sol compie progressi significativi anche nelle attività che richiedono di interagire con applicazioni sul computer. Sul set offline di OSWorld 2.0, che valuta gli agenti su flussi di lavoro impegnativi che richiedono l'uso del computer, GPT‑6.1 Sol supera GPT‑6 Sol di sette punti percentuali al massimo sforzo di ragionamento, a meno della metà del costo. Arriva a soli 2,1 punti percentuali dal punteggio di Astra al massimo sforzo di ragionamento, a circa un settimo del costo per attività.

In OSWorld 2.0⁠⁠(si apre in una nuova finestra), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Ricerca scientifica

Su Terminal-Bench Science 0.1, che valuta flussi di lavoro scientifici tra cui analisi dei dati, simulazioni e dimostrazione di teoremi, GPT‑6.1 Sol più che raddoppia il punteggio di GPT‑6 Sol al massimo sforzo di ragionamento, a meno della metà del costo per attività. Con lo sforzo di ragionamento al massimo, GPT‑6.1 Sol costa in media 5,47 $ per attività, rispetto ai 23,21 $ di Opus 5.5 e ai 23,80 $ di Astra, offrendo notevoli capacità scientifiche a un costo inferiore di oltre il 75% rispetto a entrambi i modelli.

GPT‑6 Astra ottiene comunque il punteggio più alto tra i modelli testati, pari al 68,1%, ed è il modello da usare per le attività di ricerca scientifica più difficili.

In Terminal-Bench Science 0.1⁠(si apre in una nuova finestra), gli agenti completano flussi di lavoro di ricerca scientifica usando codice e strumenti da terminale, con attività che includono l’analisi dei dati, l’esecuzione di simulazioni e l’adattamento di modelli ai dati.

Accuratezza fattuale

GPT‑6.1 Sol migliora anche l'accuratezza fattuale sui prompt difficili. Con uno sforzo di ragionamento molto alto, il suo tasso di errori fattuali è del 4,1%, in calo rispetto al 4,5% di GPT‑6 Sol e più vicino al 4,0% di Astra con la stessa impostazione, a un costo per attività inferiore di circa l'83% rispetto ad Astra.

Questa valutazione misura la percentuale di risposte contenenti almeno un errore fattuale su conversazioni private dei dati identificativi, in cui gli utenti avevano segnalato un errore di un modello precedente. Questi prompt, volutamente difficili, non sono rappresentativi dell'uso tipico.

Valutiamo l'accuratezza fattuale su conversazioni di ChatGPT private dei dati identificativi, in cui gli utenti avevano segnalato un errore fattuale di un modello precedente. Queste conversazioni che inducono errori non sono rappresentative dell'uso tipico, in cui gli errori fattuali sono più rari.

Rendere disponibile GPT‑6.1 Sol in sicurezza

GPT‑6.1 Sol mostra miglioramenti significativi rispetto a GPT‑6 Sol nelle nostre valutazioni dell'allineamento, avvicinandosi a GPT‑6 Astra.

GPT‑6.1 Sol è più trasparente sui propri limiti e più affidabile nel rispettare l'intento dell'utente e i vincoli di sicurezza. Nelle valutazioni più impegnative mostra tassi di errore inferiori a GPT‑6 Sol nel segnalare malfunzionamenti degli strumenti di ricerca, nel rispettare restrizioni esplicite e nell'evitare esiti non autorizzati durante le attività agentiche. Non abbiamo osservato tentativi di aggirare un sistema automatico di revisione della sicurezza, come per GPT‑6 Astra e GPT‑6 Sol.

Le valutazioni seguenti mettono alla prova situazioni volutamente difficili e non misurano i tassi di errore nell'uso tipico.

Prezzi e disponibilità

GPT‑6.1 Sol è disponibile da oggi per tutti gli utenti Plus, Pro, Business, Enterprise ed Edu in ChatGPT Work e Codex. Questi modelli non sono ancora disponibili in Chat. Gli sviluppatori possono accedervi anche tramite l'API di OpenAI come gpt-6.1-sol. I prezzi standard dell'API sono di 2 $ per milione di token di input, 0,10 $ per milione di token di input in cache e 10 $ per milione di token di output.

In parallelo, lanciamo GPT‑6 Astra Ultrafast, il modello di frontiera più veloce al mondo, fino a 8 volte più rapido di GPT‑6 Astra, insieme a GPT‑6.1 Sol Ultrafast. Sono disponibili nell'API, oltre che in ChatGPT Work e Codex per gli utenti del nostro nuovo livello Pro con i limiti di utilizzo più elevati, a 500 $ al mese. Con GPT‑6.1 Sol Ultrafast, gli sviluppatori possono ottenere un'intelligenza vicina ad Astra a una velocità fino a 8 volte superiore, con una spesa API pressoché pari a quella precedente per GPT‑6 Astra.

Autore

OpenAI

Le valutazioni di GPT sono state eseguite nel nostro ambiente di ricerca o tramite la nostra API, che possono fornire risultati leggermente diversi da ChatGPT in produzione a causa di differenze nei prompt di sistema, negli strumenti disponibili, nei livelli di ragionamento e così via. Le valutazioni dei modelli concorrenti sono tratte da report pubblicamente disponibili.