Kalo te përmbajtja kryesore
OpenAI

Prezantimi i GPT‑6 Sol dhe Luna

Më shumë mënyra për të sjellë inteligjencën më të avancuar në punën tënde të përditshme.

Duke ngarkuar…

Në fillim të këtij muaji prezantuam GPT‑6 Astra, modelin më inteligjent dhe më të harmonizuar në botë. Ndërsa projektet më të vështira dhe më të rëndësishme ende kërkojnë shfrytëzimin e plotë të aftësive të Astra, puna e përditshme ndryshon për nga përmasat, ritmi dhe buxheti.

Prandaj po e zgjerojmë familjen e modeleve GPT‑6 me GPT‑6 Sol dhe GPT‑6 Luna. GPT‑6 Astra solli një brez të ri inteligjence. Këto modele ndihmojnë që përfitimet e kësaj inteligjence të bëhen më të arritshme, duke çuar më tej kufijtë e efikasitetit të kostos. GPT‑6 Sol dhe Luna i trajnuam me metoda të ngjashme me ato të përdorura për GPT‑6 Astra, duke sjellë në modele më të shpejta dhe më ekonomike përparimet që qëndrojnë pas performancës së Astra-s në nivelin më të lartë bashkëkohor në punën profesionale, saktësinë faktike, programimin, përdorimin e kompjuterit dhe përputhjen me udhëzimet dhe vlerat e përcaktuara.

Modelet GPT‑6 kryesojnë në raportin mes kostos dhe inteligjencës, duke ndërthurur aftësi të jashtëzakonshme në çdo nivel me një infrastrukturë që i ofron ato me efikasitet në shkallë të gjerë. Përmirësimet në ruajtjen në memorien specifike dhe në inferencë na mundësojnë t'i ofrojmë këto modele me kosto më të ulët. Këto kursime po ua kalojmë drejtpërdrejt përdoruesve dhe klientëve, duke ulur me 50% çmimet e API-së për Sol dhe Luna krahasuar me çmimet e tyre promocionale për GPT‑5.6. Së bashku, këto përmirësime e bëjnë IA-në e avancuar praktike për më shumë detyra të përditshme dhe zbatime në shkallë të gjerë.

Çmimet e API-së për GPT‑6

Modeli

Hyrja

Dalja

Ulja e çmimit

GPT‑6 Sol
krahasuar me GPT‑5.6 Sol

4 dollarë → 2 dollarë

20 dollarë → 10 dollarë

50% më lirë

GPT‑6 Luna
krahasuar me GPT‑5.6 Luna

0,20 dollarë → 0,10 dollarë

1,20 dollarë → 0,50 dollarë

50% më lirë

Çmimet janë për 1 milion tokenë.

GPT‑6 Astra mbetet modeli ynë më i mirë në çdo aspekt. Zgjidhe kur kërkon rezultatet më të mira dhe një përvojë pa kompromise.

Një hap përpara për të gjithë familjen e modeleve

GPT‑6 Sol dhe Luna u sjellin modeleve që tashmë njeh dhe përdor inteligjencë të përmirësuar dhe efikasitet më të lartë të kostos në aftësitë më të dobishme për kryerjen e punëve komplekse.

Punë profesionale

GPT‑6 Sol mund të përballojë detyra të vështira pune, duke të dhënë më shumë hapësirë për përmirësime të njëpasnjëshme falë kufijve më të lartë të përdorimit dhe kostos më të ulët. Ai ofron më shumë inteligjencë dhe rezultate më të mira se modelet konkurrente me çmim të ngjashëm.

Në AutomationBench, një test i proceseve të punës së biznesit në aplikacione të ndryshme, GPT‑6 Sol me nivel përpjekjeje xhigh tejkalon Claude Opus 5 me nivel përpjekjeje max, me vetëm 9% të kostos për detyrë të Opus 5. Me nivel përpjekjeje High, GPT‑6 Luna e tejkalon paraardhësin e vet me 5,4 pikë përqindjeje, me kosto 58% më të ulët për detyrë.

Në AutomationBench 1.0.6⁠(hapet në një dritare të re), agjentët e AI-së testohen në procese të plota pune duke përdorur 47 mjete në fushat e shitjeve, marketingut, operacioneve, mbështetjes, financave dhe burimeve njerëzore. Vlera e paraqitur për Claude Fable 5.1 është më e ulët se kostoja e tij reale, pasi nuk përfshin koston e përdorimit të Opus 5 si model rezervë, gjë që ndodhi në rreth 40% të detyrave.

GPT‑6 Sol tejkalon edhe Claude Fable 5.1 me kosto shumë më të ulët dhe madje ia kalon GPT‑6 Astra me nivel të ulët përpjekjeje.

Modeli (dhe përpjekja)

Rezultati

Kostoja për detyrë

GPT‑6 Sol (xhigh)

33,2%

0,27 dollarë

GPT‑6 Astra (Low)

30,3%

3,9x GPT‑6 Sol

Claude Opus 5 (Max)

26,9%

11.1x GPT‑6 Sol

Claude Fable 5.1 me Opus 5 si model rezervë (Max)

31,4%

>8,9x GPT‑6 Sol

(kostoja e alternativës rezervë nuk është raportuar)

Në Agents’ Last Exam, një test që vlerëson agjentët në procese komplekse pune profesionale, GPT‑6 Sol, me nivelin maksimal të përpjekjes, arrin një rezultat prej 56,4%, duke tejkaluar rezultatin më të lartë të Claude Opus 5 në këtë vlerësim, me një kosto 60% më të ulët për detyrë.

Në Agents’ Last Exam V1⁠(hapet në një dritare të re), agjentët e IA-së vlerësohen në detyra afatgjata me vlerë ekonomike, që përfshijnë 55 nënindustri dhe mbulojnë shumicën e fushave kryesore të punës profesionale të kryer në kompjuter.

Saktësia faktike

Dobia e një përgjigjeje varet nga saktësia e fakteve dhe ne vazhdojmë të përmirësojmë besueshmërinë faktike. Në vlerësimin tonë të brendshëm të saktësisë faktike, i cili bazohet në biseda reale ku janë hequr të dhënat identifikuese dhe ku përdoruesit kanë sinjalizuar gabime të modeleve tona, GPT‑6 Sol bën rreth gjysmën e gabimeve të paraardhësit të vet, duke iu afruar nivelit të besueshmërisë së Astra me kosto shumë më të ulët. Edhe GPT‑6 Luna përmirësohet ndjeshëm; në nivele më të larta përpjekjeje, arrin rezultate të barabarta me GPT‑5.6 Sol, me rreth një të qindtën e kostos së tij.

Këtu vlerësojmë saktësinë faktike në biseda të ChatGPT‑së nga të cilat janë hequr të dhënat identifikuese dhe ku përdoruesit kishin raportuar një gabim faktik në përgjigjen e një modeli të mëparshëm. Këto biseda, që kanë nxitur gabime, nuk janë përfaqësuese të përdorimit të zakonshëm, ku gabimet faktike janë më të rralla. Rezultatet nuk janë kontrolluar për gjatësinë e përgjigjeve. Megjithatë, testet tona me nivele të ndryshme të hollësisë së përgjigjeve treguan se rezultatet pothuajse nuk varen nga gjatësia e tyre.

Programimi

Këtë vit, agjentët e programimit kanë filluar të marrin përsipër detyra më komplekse, më të gjera dhe më afatgjata se kurrë më parë. Në OpenAI, përdorimi i tyre i brendshëm është rritur në mënyrë eksponenciale. Bazuar në çmimet e API-së, vlera e përdorimit ditor të tokenëve ka tejkaluar 600 dollarë për studiuesin në medianë dhe 7000 dollarë për studiuesit në percentilin e 90-të (përshpejtimi i kërkimit: Një vështrim nga brenda OpenAI⁠). Ndërsa agjentët e programimit marrin përsipër detyra më të gjata dhe më kërkuese, kostoja e përdorimit të vazhdueshëm bëhet gjithnjë e më e rëndësishme. GPT‑6 Sol dhe Luna ndërthurin performancën e lartë në programim me çmime më të ulëta të API-së, duke u dhënë zhvilluesve më shumë hapësirë për të eksperimentuar dhe përmirësuar zgjidhjet e tyre, si dhe ekipeve sigurinë për të qenë më ambicioze në detyrat që i ngarkojnë Codex-it.

Në FrontierCode, një test që vlerëson nëse agjentët e programimit prodhojnë ndryshime të gatshme për t'u integruar në baza reale kodi, GPT‑6 Sol shënon një përmirësim të ndjeshëm krahasuar me GPT‑5.6 Sol dhe arrin të njëjtin nivel performance me Claude Fable 5.1 xhigh, me një kosto shumë më të ulët.

Në FrontierCode 1.1 Main⁠(hapet në një dritare të re), agjentët e IA-së shkruajnë kod që vlerësohet jo vetëm për saktësinë, por edhe për “mundësinë e integrimit”: p.sh., cilësinë e testeve, respektimin e fushës së detyrës, stilin e kodit dhe përputhjen me standardet e bazës së kodit.

Në DeepSWE v1.1, një test që vlerëson performancën në detyra komplekse të inxhinierisë së softuerit në baza reale kodi, GPT‑6 Sol, me nivelin maksimal të përpjekjes, arrin një rezultat prej 68,8%, vetëm 1,1 pikë përqindjeje më pak se rezultati më i lartë i Claude Fable 5 në këtë vlerësim (69,9% me nivelin xhigh të përpjekjes), me një kosto afërsisht 80% më të ulët për detyrë.

GPT‑6 Luna, me nivelin maksimal të përpjekjes, arrin një rezultat prej 66,6%, të krahasueshëm me rezultatet e Claude Opus 5 dhe Fable 5 në nivelin mesatar të përpjekjes. Në këto krahasime, kostoja e Luna për detyrë është 93% më e ulët se ajo e Opus 5 dhe 96% më e ulët se ajo e Fable 5.

Në DeepSWE 1.1⁠(hapet në një dritare të re), agjentët e IA-së zgjidhin detyra origjinale dhe afatgjata të inxhinierisë softuerike.

Përdorimi i kompjuterit

Ndërsa GPT‑6 Astra mbetet modeli më i mirë në botë për përdorimin e kompjuterit, GPT‑6 Sol dhe Luna ofrojnë performancë më efikase për sa i përket kostos krahasuar me modelet e tyre paraardhëse. Në OSWorld 2.0 offline, GPT‑6 Sol, me nivelin shumë të lartë të përpjekjes (xhigh), arrin një rezultat të ngjashëm me Claude Opus 5 në nivelin mesatar të përpjekjes: 60,5% kundrejt 60,3%, me një kosto afërsisht 80% më të ulët për detyrë. GPT‑6 Luna (max) arrin të tejkalojë GPT‑5.6 Sol (medium) me një të dhjetën e kostos së tij.

Në OSWorld 2.0⁠(hapet në një dritare të re), agjentët e IA-së provojnë procese afatgjata të përdorimit të kompjuterit që përfshijnë detyra të përditshme dhe profesionale. Raportojmë shpërblimin e pjesshëm në grupin jashtë linje të versionit v2026.08.08.

Stili i bashkëpunimit

Stilin e përmirësuar të komunikimit të GPT‑6 Astra e kemi sjellë edhe te Sol dhe Luna, dhe mendojmë se kjo do të vihet re veçanërisht në bisedat teknike dhe ato rreth programimit. Prit përgjigje më të qarta, me më pak zhargon, më pak shprehje të pazakonta dhe më pak hollësi të panevojshme. Në përgjithësi, përgjigjet do të jenë pak më të shkurtra, pa humbur përmbajtjen thelbësore.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Megjithëse stili është subjektiv, ne preferojmë përgjigjen e GPT‑6 Sol në këtë rast. Modeli nuk nxjerr përfundime të nxituara, nuk shpenzon shumë kohë duke përsëritur hollësi që mund të jenë të qarta për personin që ka bërë kërkesën (p.sh., që faqja e internetit ka katër faqe), përdor më pak shprehje të paqarta (p.sh., "pamje në stilin bento", "ristrukturimi... rreth atij sistemi"), është më transparent për atë që ka kontrolluar dhe atë që nuk ka kontrolluar, si dhe nuk ndan pa nevojë hollësi të zbatimit teknik, si kërkesën që i ka dhënë mjetit të gjenerimit të imazheve.

Përmirësimi i ruajtjes në memorie specifike për agjentët dhe bisedat e gjata

Krahas uljes së çmimeve të tokenëve, po i ndihmojmë zhvilluesit që ndërtojnë aplikacione me GPT‑6 të kursejnë edhe më shumë nga ripërdorimi i kontekstit në aplikacionet e tyre. Kemi përmirësuar ruajtjen në memorien specifike të kërkesave për GPT‑6, duke rritur si parazgjedhje shkallën e përdorimit të të dhënave të ruajtura në këtë memorie. Kjo i ndihmon agjentët të ripërdorin më shumë kontekst, të përgjigjen më shpejt dhe të përfitojnë nga ulje prej 90% të çmimit për leximin e tokenëve hyrës të ruajtur në memorien specifike.

Zhvilluesit kanë gjithashtu më shumë mënyra për të matur dhe optimizuar performancën e ruajtjes në memorien specifike:

GitHub raporton se, gjatë muajve të fundit, këto përmirësime kanë ulur me më shumë se 50% përqindjen e tokenëve të promptit që kërkojnë përpunim nga e para, në miliarda kërkesa drejtuar modeleve të OpenAI, duke ndihmuar Copilot të përgjigjet më shpejt.

Vazhdimi i përmirësimit të harmonizimit

GPT‑6 Sol dhe Luna mbështeten në përparimet në përputhjen e modeleve me udhëzimet dhe vlerat e përcaktuara, të prezantuara me Astra-n, modelin tonë që ka arritur nivelin më të lartë të kësaj përputhjeje deri më sot. Në vlerësimet tona të përputhjes, si Sol ashtu edhe Luna tregojnë përmirësime krahasuar me modelet përkatëse GPT‑5.6, duke përfshirë një shkallë më të ulët të pretendimeve çorientuese për punën e tyre në programim.

Vlerësimet më poshtë testojnë qëllimisht situata sfiduese dhe nuk matin shkallën e dështimeve në përdorimin tipik. Shih kartën e sistemit⁠(hapet në një dritare të re) për rezultatet e plota.

Disponueshmëria

GPT‑6 Sol dhe GPT‑6 Luna janë të disponueshme në ChatGPT Work dhe Codex duke filluar nga sot për të gjithë përdoruesit e planeve Plus, Pro, Business, Enterprise dhe Edu. Përdoruesit e planeve Free dhe Go mund të përdorin GPT‑6 Luna në aplikacionin për kompjuter. Këto modele nuk janë ende të disponueshme në Chat. Në API-në e OpenAI, ato janë të disponueshme me emrat gpt-6-sol dhe gpt-6-luna.

Për të siguruar që shërbimi të funksionojë në mënyrë të qëndrueshme për të gjithë, planifikojmë t’i bëjmë këto modele të disponueshme gradualisht në ChatGPT gjatë gjithë ditës. Nëse nuk i sheh modelet e reja në ChatGPT Work ose Codex, provo përsëri më vonë.


Vlerësimet e GPT‑së u kryen në mjedisin tonë kërkimor ose përmes API-së sonë. Për shkak të ndryshimeve në udhëzimet e sistemit, mjetet e disponueshme etj., rezultatet mund të ndryshojnë pak nga ato të ChatGPT‑së në mjedisin e prodhimit. Vlerësimet e modeleve konkurruese u morën nga raporte të disponueshme publikisht. Kur rezultatet për Claude Fable 5.1 nuk ishin të disponueshme, u përdorën rezultatet e raportuara për Claude Fable 5.

Autori

OpenAI