Sari la conținutul principal
OpenAI

GPT-6.1Sol

Inteligență apropiată de Astra, la o cincime din preț, pentru performanță de vârf susținută

Prezentăm GPT‑6.1 Sol, o versiune îmbunătățită a GPT‑6 Sol, cu performanțe excepționale în codare agentivă, precum și în utilizarea computerului și activități profesionale. Acesta aduce Sol mai aproape de GPT‑6 Astra în sarcini solicitante, la o cincime din prețurile standard Astra pentru tokenuri de intrare și de ieșire, oferind dezvoltatorilor mai multă libertate de a crea și rula agenți capabili cu același buget.

GPT‑6.1 Sol oferă performanțe apropiate de Astra la prețurile Sol, având astfel cel mai bun raport performanță-cost dintre modelele disponibile în prezent. Intrarea din cache costă doar 0,10 $ per milion de tokenuri — o reducere de 95% față de prețul standard de intrare — ceea ce îl face mai accesibil pentru sarcinile agentive care necesită reutilizarea contextului în solicitări repetate.

GPT‑6 Astra rămâne, per ansamblu, cel mai capabil model de vârf al nostru. GPT‑6.1 Sol oferă un nou echilibru între capacități și cost, atât pentru activitățile importante pe care utilizatorii vor să le realizeze mai des, cât și pentru clienții API care dezvoltă și rulează aplicații la scară largă.

Trei fișe de model: GPT-6 Astra, cel mai inteligent model al nostru pentru cele mai bune rezultate, 10 $ pentru intrare, 50 $ pentru ieșire și 1 $ pentru intrarea din cache; GPT-6.1 Sol, inteligență apropiată de Astra la o cincime din preț, 2 $ pentru intrare, 10 $ pentru ieșire și 0,10 $ pentru intrarea din cache; GPT-6 Luna, rapid și eficient pentru activități cotidiene la scară largă, 0,10 $ pentru intrare, 0,50 $ pentru ieșire și 0,01 $ pentru intrarea din cache.

Un Sol mai capabil în diverse sarcini

GPT‑6.1 Sol aduce îmbunătățiri substanțiale față de GPT‑6 Sol în activități profesionale complexe, de la scrierea și depanarea codului la înțelegerea documentelor și executarea fluxurilor de lucru de afaceri în mai mulți pași. În mai multe dintre aceste evaluări, se apropie de performanța GPT‑6 Astra la un cost considerabil mai mic.

Programare

În DeepSWE v1.1, care evaluează sarcini complexe de inginerie software în baze de cod reale, GPT‑6.1 Sol egalează GPT‑6 Astra la aproximativ o cincime din cost și depășește cel mai bun scor al GPT‑6 Sol cu 6,4 puncte procentuale, cu un efort de raţionament și un cost mai mici.

În DeepSWE 1.1⁠⁠(se deschide într-o fereastră nouă), agenții IA rezolvă sarcini originale, de lungă durată, din domeniul ingineriei software.

Activități profesionale

În GDP.pdf, care măsoară cât de corect răspund modelele la întrebări profesionale folosind documente PDF complexe, cu tabele, grafice, diagrame și detalii scrise cu caractere mici, GPT‑6.1 Sol obține scoruri mai mari decât Opus 5.5 cu variante de rezervă, la mai puțin de jumătate din costul pe sarcină, pentru toate setările de raţionament testate. De asemenea, se apropie de performanța de ultimă generație a GPT‑6 Astra la aproximativ o cincime din costul pe sarcină.

În GDP.pdf⁠(se deschide într-o fereastră nouă), modelele trebuie să răspundă unor solicitări din situații reale despre documente PDF complexe, provenite din fluxuri de lucru profesionale din domeniul financiar, medical, juridic și din alte șapte domenii profesionale.

În AutomationBench, care măsoară dacă agenții finalizează corect fluxuri de lucru de afaceri în mai mulți pași, GPT‑6.1 Sol obține un scor cu 2,2 puncte procentuale peste Opus 5.5 la un efort de raţionament mediu, la aproximativ o treime din cost. Acest scor este și cu 4,8 puncte procentuale mai mare decât cel al GPT‑6 Sol la aceeași setare.

In AutomationBench 1.0.6⁠⁠(se deschide într-o fereastră nouă), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Utilizarea computerului

GPT‑6.1 Sol înregistrează progrese substanțiale și în sarcinile care necesită interacțiunea cu aplicații pe computer. Pe setul offline al OSWorld 2.0, care evaluează agenții în fluxuri de lucru solicitante ce implică utilizarea computerului, GPT‑6.1 Sol depășește GPT‑6 Sol cu șapte puncte procentuale la efort maxim de raţionament, la mai puțin de jumătate din cost. Se apropie la 2,1 puncte procentuale de scorul Astra la efort maxim de raţionament, la aproximativ o șeptime din costul pe sarcină.

In OSWorld 2.0⁠⁠(se deschide într-o fereastră nouă), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Cercetare științifică

În Terminal-Bench Science 0.1, care evaluează fluxuri de lucru științifice, inclusiv analiza datelor, simularea și demonstrarea teoremelor, GPT‑6.1 Sol obține un scor de peste două ori mai mare decât GPT‑6 Sol la efort maxim de raţionament, la mai puțin de jumătate din costul pe sarcină. La efort maxim, GPT‑6.1 Sol costă în medie 5,47 $ pe sarcină, comparativ cu 23,21 $ pentru Opus 5.5 și 23,80 $ pentru Astra, oferind capacități științifice substanțiale la un cost cu peste 75% mai mic decât oricare dintre cele două modele.

GPT‑6 Astra obține în continuare cel mai mare scor dintre modelele testate, de 68,1%, și ar trebui folosit pentru cele mai dificile sarcini de cercetare științifică.

În Terminal-Bench Science 0.1⁠(se deschide într-o fereastră nouă), agenții parcurg fluxuri de lucru de cercetare științifică folosind cod și instrumente de terminal, inclusiv pentru analiza datelor, rularea simulărilor și ajustarea modelelor.

Corectitudine factuală

GPT‑6.1 Sol îmbunătățește și corectitudinea factuală a răspunsurilor la prompturi dificile. La un efort de raţionament foarte ridicat, rata sa de erori factuale este de 4,1%, în scădere față de 4,5% pentru GPT‑6 Sol și mai aproape de valoarea de 4,0% a Astra la aceeași setare, în timp ce costul pe sarcină este cu aproximativ 83% mai mic decât cel al Astra.

Această evaluare măsoară ponderea răspunsurilor care conțin cel puțin o eroare factuală, folosind conversații din care au fost eliminate datele de identificare și în care utilizatorii au semnalat o eroare a unui model anterior. Aceste prompturi intenționat dificile nu sunt reprezentative pentru utilizarea obișnuită.

Evaluăm corectitudinea factuală pe baza unor conversații ChatGPT din care au fost eliminate datele de identificare și în care utilizatorii au semnalat o eroare factuală a unui model anterior. Aceste conversații care provoacă erori nu sunt reprezentative pentru utilizarea obișnuită, în care erorile factuale sunt mai rare.

Implementarea în siguranță a GPT‑6.1 Sol

GPT‑6.1 Sol înregistrează îmbunătățiri substanțiale față de GPT‑6 Sol în evaluările noastre de aliniere, apropiindu-se de GPT‑6 Astra.

GPT‑6.1 Sol este mai transparent cu privire la propriile limitări și mai fiabil în respectarea intenției utilizatorului și a constrângerilor de siguranță. În evaluări dificile, prezintă rate de eșec mai mici decât GPT‑6 Sol în ceea ce privește transparența despre instrumentele de căutare nefuncționale, respectarea restricțiilor explicite și evitarea rezultatelor neautorizate în sarcini agentive. Nu am observat nicio încercare de eludare a unui evaluator automat de siguranță, la fel ca în cazul GPT‑6 Astra și GPT‑6 Sol.

Evaluările de mai jos testează în mod deliberat situații dificile și nu măsoară ratele de eșec în utilizarea obișnuită.

Prețuri și disponibilitate

GPT‑6.1 Sol este disponibil de astăzi pentru toți utilizatorii Plus, Pro, Business, Enterprise și Edu în ChatGPT Work și Codex. Aceste modele nu sunt încă disponibile în Chat. Dezvoltatorii îl pot accesa și prin API-ul OpenAI sub numele gpt-6.1-sol. Prețurile sale standard în API sunt de 2 $ per milion de tokenuri de intrare, 0,10 $ per milion de tokenuri de intrare din cache și 10 $ per milion de tokenuri de ieșire.

Totodată, lansăm GPT‑6 Astra Ultrafast, cel mai rapid model de vârf din lume, de până la 8 ori mai rapid decât GPT‑6 Astra, precum și GPT‑6.1 Sol Ultrafast. Acestea sunt disponibile în API, precum și în ChatGPT Work și Codex pentru utilizatorii noului nostru nivel Pro, cu cele mai mari limite de utilizare, la 500 $/lună. Cu GPT‑6.1 Sol Ultrafast, dezvoltatorii pot obține inteligență apropiată de Astra la o viteză de până la 8 ori mai mare, cu aproximativ aceleași cheltuieli API ca înainte pentru GPT‑6 Astra.

Autor

OpenAI

Evaluările GPT au fost efectuate în mediul nostru de cercetare sau prin API-ul nostru, care pot oferi rezultate ușor diferite față de versiunea ChatGPT disponibilă utilizatorilor, din cauza diferențelor dintre prompturile de sistem, instrumentele disponibile, nivelurile de efort etc. Evaluările modelelor concurente au fost preluate din rapoarte publice.