Sari la conținutul principal
OpenAI

Îți prezentăm GPT‑6 Sol și Luna

Mai multe moduri de a integra inteligența de vârf în munca de zi cu zi.

Se încarcă…

La începutul acestei luni, am prezentat GPT‑6 Astra, cel mai inteligent și mai bine aliniat model din lume. Deși cele mai solicitante și importante proiecte necesită în continuare întreaga profunzime a capabilităților Astra, munca se desfășoară la scări, în ritmuri și cu bugete diferite.

De aceea, extindem universul GPT‑6 cu GPT‑6 Sol și GPT‑6 Luna. GPT‑6 Astra a inaugurat o nouă generație de inteligență, iar aceste modele ajută la distribuirea beneficiilor sale, ducând mai departe standardele de vârf privind eficiența costurilor. Am instruit modelele GPT‑6 Sol și Luna prin metode similare celor folosite pentru GPT‑6 Astra, integrând progresele care stau la baza performanțelor de ultimă generație ale Astra în munca profesională, acuratețea factuală, programare, utilizarea computerului și aliniere în modele mai rapide și mai accesibile.

Modelele GPT‑6 sunt lider în întreaga gamă cost–inteligență, combinând capabilități excepționale la fiecare nivel cu o infrastructură care le oferă eficient, la scară largă. Îmbunătățirile aduse memorării în cache și inferenței ne permit să oferim aceste modele la costuri mai mici, iar economiile ajung direct la utilizatori și clienți prin reducerea cu 50% a prețurilor API pentru Sol și Luna, comparativ cu prețurile promoționale ale GPT‑5.6. Împreună, aceste îmbunătățiri fac IA avansată să fie practică pentru mai multe activități și utilizări cotidiene la scară largă.

Prețurile API pentru GPT‑6

Model

Intrare

Ieșire

Reducerea prețului

GPT‑6 Sol
vs GPT‑5.6 Sol

4 $ → 2 $

20 $ → 10 $

cu 50% mai ieftin

GPT‑6 Luna
vs GPT‑5.6 Luna

0,20 $ → 0,10 $

1,20 $ → 0,50 $

cu 50% mai ieftin

Prețurile sunt pentru 1 milion de tokenuri.

GPT‑6 Astra rămâne cel mai bun model al nostru din toate punctele de vedere. Îl poți alege când dorești cele mai bune rezultate și o experiență fără compromisuri.

Un progres în întreaga familie de modele

GPT‑6 Sol și Luna aduc un plus de inteligență și eficiență a costurilor modelelor pe care deja le cunoști și folosești, îmbunătățind capabilitățile cele mai utile pentru realizarea activităților complexe.

Munca profesională

GPT‑6 Sol poate prelua sarcini profesionale dificile, oferindu-ți totodată mai mult spațiu pentru iterații datorită limitelor de utilizare mai mari și costurilor mai mici, precum și mai multă inteligență și rezultate mai bune decât modelele concurente cu prețuri similare.

În AutomationBench, un test al fluxurilor de lucru pentru companii, desfășurate în mai multe aplicații, GPT‑6 Sol cu efort xhigh depășește Claude Opus 5 cu efort Max, la doar 9% din costul per sarcină al Opus 5. Cu efort Ridicată, GPT‑6 Luna își depășește predecesorul cu 5,4 puncte procentuale, la un cost per sarcină cu 58% mai mic.

În AutomationBench 1.0.6⁠(se deschide într-o fereastră nouă), agenții IA sunt testați în fluxuri de lucru complete, utilizând 47 de instrumente din vânzări, marketing, operațiuni, asistență, finanțe și resurse umane. Punctul de date pentru Claude Fable 5.1 îi subestimează costul real, deoarece omite costul trecerilor de rezervă la Opus 5, care au avut loc în aproximativ 40% dintre sarcini.

GPT‑6 Sol depășește și Claude Fable 5.1 la un cost mult mai mic și obține rezultate chiar mai bune decât GPT‑6 Astra cu efort redus.

Model (și efort)

Scor

Cost per sarcină

GPT‑6 Sol (xhigh)

33,2%

0,27 $

GPT‑6 Astra (scăzut)

30,3%

de 3,9 ori GPT‑6 Sol

Claude Opus 5 (max)

26,9%

de 11,1 ori GPT‑6 Sol

Claude Fable 5.1 cu Opus 5 ca model de rezervă (max)

31,4%

de >8,9 ori GPT‑6 Sol

(costul utilizării modelului de rezervă nu este raportat)

În Agents’ Last Exam, care evaluează agenții în fluxuri profesionale complexe, GPT‑6 Sol cu efort Max obține 56,4%, peste cel mai mare scor al Claude Opus 5 din evaluare, la un cost per sarcină cu 60% mai mic.

În Agents’ Last Exam V1⁠(se deschide într-o fereastră nouă), agenții IA sunt evaluați în sarcini cu orizont lung și valoare economică, din 55 de sub-sectoare, acoperind majoritatea domeniilor principale ale muncii profesionale desfășurate pe computere.

Acuratețe factuală

Utilitatea unui răspuns depinde de corectitudinea faptelor, iar noi continuăm să îmbunătățim fiabilitatea factuală. În evaluarea noastră internă a acurateței factuale, bazată pe conversații reale anonimizate în care utilizatorii au semnalat greșeli ale modelelor noastre, GPT‑6 Sol face aproximativ jumătate din numărul de greșeli al predecesorului său, apropiindu-se de fiabilitatea Astra la un cost mult mai mic. Și GPT‑6 Luna se îmbunătățește considerabil: la niveluri mai ridicate de efort, egalează GPT‑5.6 Sol la aproximativ o sutime din cost.

Aici evaluăm acuratețea factuală în conversații ChatGPT anonimizate, în care utilizatorii semnalaseră o eroare factuală a unui model anterior. Aceste conversații care provoacă erori nu sunt reprezentative pentru utilizarea obișnuită, în care erorile factuale sunt mai rare. Scorurile nu sunt ajustate în funcție de lungime, dar testele noastre cu diferite niveluri de detaliere au indicat o dependență aproape inexistentă de lungimea răspunsului.

Programare

Anul acesta, agenții de programare au început să abordeze sarcini mai complexe, mai ample și mai îndelungate ca niciodată. La OpenAI, utilizarea internă a crescut exponențial. Evaluată la prețurile API, utilizarea zilnică de tokenuri a depășit 600 $ pentru cercetătorul median și 7.000 $ pentru cercetătorii din percentila 90 (Accelerarea cercetării: perspectiva din interiorul OpenAI⁠). Pe măsură ce agenții de programare preiau sarcini mai lungi și mai solicitante, costul utilizării susținute devine tot mai important. GPT‑6 Sol și Luna combină performanțele solide de programare cu prețuri API mai mici, oferindu-le dezvoltatorilor mai mult spațiu pentru iterații, iar echipelor, încrederea de a solicita Codex să preia sarcini mai ambițioase.

În FrontierCode, care evaluează dacă agenții de programare produc modificări gata de integrat în baze de cod reale, GPT‑6 Sol se îmbunătățește considerabil față de GPT‑5.6 Sol și poate egala Claude Fable 5.1 xhigh la un cost mult mai mic.

În FrontierCode 1.1 Main⁠(se deschide într-o fereastră nouă), agenții IA scriu cod evaluat nu doar în funcție de corectitudine, ci și de „posibilitatea de îmbinare”: de exemplu, calitatea testelor, respectarea domeniului de aplicare, stilul codului și conformitatea cu standardele bazei de cod.

În DeepSWE v1.1, care testează performanța în sarcini complexe de inginerie software pe baze de cod reale, GPT‑6 Sol cu efort Max obține 68,8%, la 1,1 puncte procentuale de cel mai mare scor al Claude Fable 5 din evaluare (69,9% cu efort xhigh), la un cost per sarcină cu aproximativ 80% mai mic.

GPT‑6 Luna cu efort max obține 66,6%, un rezultat comparabil cu Claude Opus 5 și Fable 5 cu efort mediu. În aceste comparații, Luna costă cu 93% mai puțin per sarcină decât Opus 5 și cu 96% mai puțin decât Fable 5.

În DeepSWE 1.1⁠(se deschide într-o fereastră nouă), agenții IA rezolvă sarcini originale de inginerie software, cu orizont lung.

Utilizarea computerului

Deși GPT‑6 Astra rămâne cel mai bun model din lume pentru utilizarea computerului, GPT‑6 Sol și Luna oferă performanțe mai eficiente din punct de vedere al costurilor decât predecesorii lor. În OSWorld 2.0 offline, GPT‑6 Sol cu efort xhigh obține un scor similar cu Claude Opus 5 cu efort Mediu (60,5% față de 60,3%), la un cost per sarcină cu aproximativ 80% mai mic. GPT‑6 Luna (Max) poate depăși GPT‑5.6 Sol (Mediu) la o zecime din costul acestuia.

În OSWorld 2.0⁠(se deschide într-o fereastră nouă), agenții IA încearcă să realizeze fluxuri îndelungate de utilizare a computerului, care includ sarcini cotidiene și profesionale. Raportăm recompensa parțială pentru setul offline din versiunea v2026.08.08.

Stil de colaborare

Am integrat și în Sol și Luna stilul de comunicare îmbunătățit al GPT‑6 Astra, despre care credem că va fi deosebit de vizibil în conversațiile tehnice și despre programare. Te poți aștepta la mai multă claritate, mai puțin jargon, mai puține formulări neobișnuite și detalii cu valoare redusă, precum și la răspunsuri în general puțin mai scurte, fără pierderi de substanță.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Deși stilul este subiectiv, aici preferăm răspunsul GPT‑6 Sol. Acesta nu trage concluzii la fel de repede, petrece mai puțin timp repetând detalii care i-ar putea fi evidente persoanei care întreabă (de exemplu, faptul că site-ul are patru pagini), folosește mai puține formulări vagi (precum „aspect de bento” sau „remodelarea… în jurul acelui sistem”), explică mai deschis ce a verificat și ce nu și nu oferă inutil detalii de implementare, precum solicitarea transmisă instrumentului său pentru imagini.

Îmbunătățirea memorării în cache pentru agenți și conversații lungi

Pe lângă prețurile mai mici per token, ajutăm dezvoltatorii care folosesc GPT‑6 să economisească mai mult în privința contextului reutilizat de aplicațiile lor. Am îmbunătățit memorarea în cache a solicitărilor pentru GPT‑6, astfel încât să ofere implicit rate mai mari de regăsire în cache, ajutând agenții să reutilizeze mai mult context, să răspundă mai repede și să beneficieze de reduceri de 90% pentru citirea tokenurilor de intrare din cache.

Dezvoltatorii au și mai multe modalități de a măsura și optimiza performanța memorării în cache:

GitHub raportează că, în ultimele câteva luni, aceste îmbunătățiri au redus cu peste 50% proporția tokenurilor din solicitări care necesită procesare nouă, în miliardele de cereri adresate modelelor OpenAI, ajutând Copilot să răspundă mai repede.

Îmbunătățirea continuă a alinierii

Modelele GPT‑6 Sol și Luna se bazează pe eforturile de aliniere realizate cu Astra, cel mai bine aliniat model al nostru de până acum. În evaluările noastre privind alinierea, atât Sol, cât și Luna prezintă îmbunătățiri față de omologii lor din seria GPT‑5.6, inclusiv rate mai scăzute de afirmații înșelătoare cu privire la activitatea lor de programare.

Evaluările de mai jos testează intenționat situații dificile și nu măsoară ratele de eșec din utilizarea obișnuită. Consultă fișa de sistem⁠(se deschide într-o fereastră nouă) pentru rezultatele complete.

Disponibilitate

GPT‑6 Sol și GPT‑6 Luna sunt disponibile începând de astăzi în ChatGPT Work și Codex pentru toți utilizatorii Plus, Pro, Business, Enterprise și Edu. Utilizatorii Free și Go pot accesa GPT‑6 Luna în aplicația pentru desktop. Aceste modele nu sunt disponibile încă în Chat. În API-ul OpenAI, acestea sunt disponibile ca gpt-6-sol și gpt-6-luna.

Pentru a menține serviciul stabil pentru toată lumea, intenționăm să lansăm treptat aceste modele în ChatGPT pe parcursul zilei. Dacă nu vezi noile modele în ChatGPT Work sau Codex, încearcă din nou mai târziu.


Evaluările GPT au fost efectuate în mediul nostru de cercetare sau prin API-ul nostru, care poate furniza rezultate ușor diferite de versiunea ChatGPT din producție, din cauza diferențelor dintre solicitările de sistem, instrumentele disponibile etc. Evaluările modelelor concurente au fost preluate din rapoarte disponibile public. Am raportat scorurile Claude Fable 5 atunci când scorurile Claude Fable 5.1 nu erau disponibile.

Autor

OpenAI