Îți prezentăm GPT‑6 Sol și Luna
Mai multe moduri de a integra inteligența de vârf în munca de zi cu zi.
La începutul acestei luni, am prezentat GPT‑6 Astra, cel mai inteligent și mai bine aliniat model din lume. Deși cele mai solicitante și importante proiecte necesită în continuare întreaga profunzime a capabilităților Astra, munca se desfășoară la scări, în ritmuri și cu bugete diferite.
De aceea, extindem universul GPT‑6 cu GPT‑6 Sol și GPT‑6 Luna. GPT‑6 Astra a inaugurat o nouă generație de inteligență, iar aceste modele ajută la distribuirea beneficiilor sale, ducând mai departe standardele de vârf privind eficiența costurilor. Am instruit modelele GPT‑6 Sol și Luna prin metode similare celor folosite pentru GPT‑6 Astra, integrând progresele care stau la baza performanțelor de ultimă generație ale Astra în munca profesională, acuratețea factuală, programare, utilizarea computerului și aliniere în modele mai rapide și mai accesibile.
Modelele GPT‑6 sunt lider în întreaga gamă cost–inteligență, combinând capabilități excepționale la fiecare nivel cu o infrastructură care le oferă eficient, la scară largă. Îmbunătățirile aduse memorării în cache și inferenței ne permit să oferim aceste modele la costuri mai mici, iar economiile ajung direct la utilizatori și clienți prin reducerea cu 50% a prețurilor API pentru Sol și Luna, comparativ cu prețurile promoționale ale GPT‑5.6. Împreună, aceste îmbunătățiri fac IA avansată să fie practică pentru mai multe activități și utilizări cotidiene la scară largă.
Model | Intrare | Ieșire | Reducerea prețului |
GPT‑6 Sol | 4 $ → 2 $ | 20 $ → 10 $ | cu 50% mai ieftin |
GPT‑6 Luna | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ | cu 50% mai ieftin |
Prețurile sunt pentru 1 milion de tokenuri.
GPT‑6 Astra rămâne cel mai bun model al nostru din toate punctele de vedere. Îl poți alege când dorești cele mai bune rezultate și o experiență fără compromisuri.
GPT‑6 Sol și Luna aduc un plus de inteligență și eficiență a costurilor modelelor pe care deja le cunoști și folosești, îmbunătățind capabilitățile cele mai utile pentru realizarea activităților complexe.
GPT‑6 Sol poate prelua sarcini profesionale dificile, oferindu-ți totodată mai mult spațiu pentru iterații datorită limitelor de utilizare mai mari și costurilor mai mici, precum și mai multă inteligență și rezultate mai bune decât modelele concurente cu prețuri similare.
În AutomationBench, un test al fluxurilor de lucru pentru companii, desfășurate în mai multe aplicații, GPT‑6 Sol cu efort xhigh depășește Claude Opus 5 cu efort Max, la doar 9% din costul per sarcină al Opus 5. Cu efort Ridicată, GPT‑6 Luna își depășește predecesorul cu 5,4 puncte procentuale, la un cost per sarcină cu 58% mai mic.
În AutomationBench 1.0.6(se deschide într-o fereastră nouă), agenții IA sunt testați în fluxuri de lucru complete, utilizând 47 de instrumente din vânzări, marketing, operațiuni, asistență, finanțe și resurse umane. Punctul de date pentru Claude Fable 5.1 îi subestimează costul real, deoarece omite costul trecerilor de rezervă la Opus 5, care au avut loc în aproximativ 40% dintre sarcini.
GPT‑6 Sol depășește și Claude Fable 5.1 la un cost mult mai mic și obține rezultate chiar mai bune decât GPT‑6 Astra cu efort redus.
Model (și efort) | Scor | Cost per sarcină |
|---|---|---|
GPT‑6 Sol (xhigh) | 33,2% | 0,27 $ |
GPT‑6 Astra (scăzut) | 30,3% | de 3,9 ori GPT‑6 Sol |
Claude Opus 5 (max) | 26,9% | de 11,1 ori GPT‑6 Sol |
Claude Fable 5.1 cu Opus 5 ca model de rezervă (max) | 31,4% | de >8,9 ori GPT‑6 Sol (costul utilizării modelului de rezervă nu este raportat) |
În Agents’ Last Exam, care evaluează agenții în fluxuri profesionale complexe, GPT‑6 Sol cu efort Max obține 56,4%, peste cel mai mare scor al Claude Opus 5 din evaluare, la un cost per sarcină cu 60% mai mic.
În Agents’ Last Exam V1(se deschide într-o fereastră nouă), agenții IA sunt evaluați în sarcini cu orizont lung și valoare economică, din 55 de sub-sectoare, acoperind majoritatea domeniilor principale ale muncii profesionale desfășurate pe computere.
Utilitatea unui răspuns depinde de corectitudinea faptelor, iar noi continuăm să îmbunătățim fiabilitatea factuală. În evaluarea noastră internă a acurateței factuale, bazată pe conversații reale anonimizate în care utilizatorii au semnalat greșeli ale modelelor noastre, GPT‑6 Sol face aproximativ jumătate din numărul de greșeli al predecesorului său, apropiindu-se de fiabilitatea Astra la un cost mult mai mic. Și GPT‑6 Luna se îmbunătățește considerabil: la niveluri mai ridicate de efort, egalează GPT‑5.6 Sol la aproximativ o sutime din cost.
Aici evaluăm acuratețea factuală în conversații ChatGPT anonimizate, în care utilizatorii semnalaseră o eroare factuală a unui model anterior. Aceste conversații care provoacă erori nu sunt reprezentative pentru utilizarea obișnuită, în care erorile factuale sunt mai rare. Scorurile nu sunt ajustate în funcție de lungime, dar testele noastre cu diferite niveluri de detaliere au indicat o dependență aproape inexistentă de lungimea răspunsului.
Anul acesta, agenții de programare au început să abordeze sarcini mai complexe, mai ample și mai îndelungate ca niciodată. La OpenAI, utilizarea internă a crescut exponențial. Evaluată la prețurile API, utilizarea zilnică de tokenuri a depășit 600 $ pentru cercetătorul median și 7.000 $ pentru cercetătorii din percentila 90 (Accelerarea cercetării: perspectiva din interiorul OpenAI). Pe măsură ce agenții de programare preiau sarcini mai lungi și mai solicitante, costul utilizării susținute devine tot mai important. GPT‑6 Sol și Luna combină performanțele solide de programare cu prețuri API mai mici, oferindu-le dezvoltatorilor mai mult spațiu pentru iterații, iar echipelor, încrederea de a solicita Codex să preia sarcini mai ambițioase.
În FrontierCode, care evaluează dacă agenții de programare produc modificări gata de integrat în baze de cod reale, GPT‑6 Sol se îmbunătățește considerabil față de GPT‑5.6 Sol și poate egala Claude Fable 5.1 xhigh la un cost mult mai mic.
În FrontierCode 1.1 Main(se deschide într-o fereastră nouă), agenții IA scriu cod evaluat nu doar în funcție de corectitudine, ci și de „posibilitatea de îmbinare”: de exemplu, calitatea testelor, respectarea domeniului de aplicare, stilul codului și conformitatea cu standardele bazei de cod.
În DeepSWE v1.1, care testează performanța în sarcini complexe de inginerie software pe baze de cod reale, GPT‑6 Sol cu efort Max obține 68,8%, la 1,1 puncte procentuale de cel mai mare scor al Claude Fable 5 din evaluare (69,9% cu efort xhigh), la un cost per sarcină cu aproximativ 80% mai mic.
GPT‑6 Luna cu efort max obține 66,6%, un rezultat comparabil cu Claude Opus 5 și Fable 5 cu efort mediu. În aceste comparații, Luna costă cu 93% mai puțin per sarcină decât Opus 5 și cu 96% mai puțin decât Fable 5.
În DeepSWE 1.1(se deschide într-o fereastră nouă), agenții IA rezolvă sarcini originale de inginerie software, cu orizont lung.
Deși GPT‑6 Astra rămâne cel mai bun model din lume pentru utilizarea computerului, GPT‑6 Sol și Luna oferă performanțe mai eficiente din punct de vedere al costurilor decât predecesorii lor. În OSWorld 2.0 offline, GPT‑6 Sol cu efort xhigh obține un scor similar cu Claude Opus 5 cu efort Mediu (60,5% față de 60,3%), la un cost per sarcină cu aproximativ 80% mai mic. GPT‑6 Luna (Max) poate depăși GPT‑5.6 Sol (Mediu) la o zecime din costul acestuia.
În OSWorld 2.0(se deschide într-o fereastră nouă), agenții IA încearcă să realizeze fluxuri îndelungate de utilizare a computerului, care includ sarcini cotidiene și profesionale. Raportăm recompensa parțială pentru setul offline din versiunea v2026.08.08.
Am integrat și în Sol și Luna stilul de comunicare îmbunătățit al GPT‑6 Astra, despre care credem că va fi deosebit de vizibil în conversațiile tehnice și despre programare. Te poți aștepta la mai multă claritate, mai puțin jargon, mai puține formulări neobișnuite și detalii cu valoare redusă, precum și la răspunsuri în general puțin mai scurte, fără pierderi de substanță.
Deși stilul este subiectiv, aici preferăm răspunsul GPT‑6 Sol. Acesta nu trage concluzii la fel de repede, petrece mai puțin timp repetând detalii care i-ar putea fi evidente persoanei care întreabă (de exemplu, faptul că site-ul are patru pagini), folosește mai puține formulări vagi (precum „aspect de bento” sau „remodelarea… în jurul acelui sistem”), explică mai deschis ce a verificat și ce nu și nu oferă inutil detalii de implementare, precum solicitarea transmisă instrumentului său pentru imagini.
Pe lângă prețurile mai mici per token, ajutăm dezvoltatorii care folosesc GPT‑6 să economisească mai mult în privința contextului reutilizat de aplicațiile lor. Am îmbunătățit memorarea în cache a solicitărilor pentru GPT‑6, astfel încât să ofere implicit rate mai mari de regăsire în cache, ajutând agenții să reutilizeze mai mult context, să răspundă mai repede și să beneficieze de reduceri de 90% pentru citirea tokenurilor de intrare din cache.
Dezvoltatorii au și mai multe modalități de a măsura și optimiza performanța memorării în cache:
Monitorizează și diagnostichează. Panoul pentru memorarea în cache a solicitărilor(se deschide într-o fereastră nouă) arată cât din conținutul de intrare este memorat în cache și cum se modifică această valoare în timp. Instrumentul de diagnosticare(se deschide într-o fereastră nouă) ajută la explicarea oportunităților ratate de memorare în cache și a aspectelor care trebuie corectate.
Ajustează efortul de raţionament și disponibilitatea instrumentelor fără a invalida memoria cache. Crește efortul de raționament(se deschide într-o fereastră nouă) pentru sarcini mai dificile sau redu-l pentru continuări mai simple și activează dezactivează instrumentele(se deschide într-o fereastră nouă) pe măsură ce nevoile agentului se schimbă. Ambele comenzi păstrează acum contextul anterior pentru reutilizarea memoriei cache.
Optimizează prefixele memorate în cache. Punctele de întrerupere explicite le permit dezvoltatorilor să aleagă unde se încheie prefixele solicitărilor memorate în cache. Astfel, dezvoltatorii au mai mult control asupra reutilizării memoriei cache și pot îmbunătăți performanța.
GitHub raportează că, în ultimele câteva luni, aceste îmbunătățiri au redus cu peste 50% proporția tokenurilor din solicitări care necesită procesare nouă, în miliardele de cereri adresate modelelor OpenAI, ajutând Copilot să răspundă mai repede.
Modelele GPT‑6 Sol și Luna se bazează pe eforturile de aliniere realizate cu Astra, cel mai bine aliniat model al nostru de până acum. În evaluările noastre privind alinierea, atât Sol, cât și Luna prezintă îmbunătățiri față de omologii lor din seria GPT‑5.6, inclusiv rate mai scăzute de afirmații înșelătoare cu privire la activitatea lor de programare.
Evaluările de mai jos testează intenționat situații dificile și nu măsoară ratele de eșec din utilizarea obișnuită. Consultă fișa de sistem(se deschide într-o fereastră nouă) pentru rezultatele complete.
GPT‑6 Sol și GPT‑6 Luna sunt disponibile începând de astăzi în ChatGPT Work și Codex pentru toți utilizatorii Plus, Pro, Business, Enterprise și Edu. Utilizatorii Free și Go pot accesa GPT‑6 Luna în aplicația pentru desktop. Aceste modele nu sunt disponibile încă în Chat. În API-ul OpenAI, acestea sunt disponibile ca gpt-6-sol și gpt-6-luna.
Pentru a menține serviciul stabil pentru toată lumea, intenționăm să lansăm treptat aceste modele în ChatGPT pe parcursul zilei. Dacă nu vezi noile modele în ChatGPT Work sau Codex, încearcă din nou mai târziu.
Evaluările GPT au fost efectuate în mediul nostru de cercetare sau prin API-ul nostru, care poate furniza rezultate ușor diferite de versiunea ChatGPT din producție, din cauza diferențelor dintre solicitările de sistem, instrumentele disponibile etc. Evaluările modelelor concurente au fost preluate din rapoarte disponibile public. Am raportat scorurile Claude Fable 5 atunci când scorurile Claude Fable 5.1 nu erau disponibile.


