Prezantimi i GPT‑6 Sol dhe Luna
Më shumë mënyra për të sjellë inteligjencën më të avancuar në punën tënde të përditshme.
Në fillim të këtij muaji prezantuam GPT‑6 Astra, modelin më inteligjent dhe më të harmonizuar në botë. Ndërsa projektet më të vështira dhe më të rëndësishme ende kërkojnë shfrytëzimin e plotë të aftësive të Astra, puna e përditshme ndryshon për nga përmasat, ritmi dhe buxheti.
Prandaj po e zgjerojmë familjen e modeleve GPT‑6 me GPT‑6 Sol dhe GPT‑6 Luna. GPT‑6 Astra solli një brez të ri inteligjence. Këto modele ndihmojnë që përfitimet e kësaj inteligjence të bëhen më të arritshme, duke çuar më tej kufijtë e efikasitetit të kostos. GPT‑6 Sol dhe Luna i trajnuam me metoda të ngjashme me ato të përdorura për GPT‑6 Astra, duke sjellë në modele më të shpejta dhe më ekonomike përparimet që qëndrojnë pas performancës së Astra-s në nivelin më të lartë bashkëkohor në punën profesionale, saktësinë faktike, programimin, përdorimin e kompjuterit dhe përputhjen me udhëzimet dhe vlerat e përcaktuara.
Modelet GPT‑6 kryesojnë në raportin mes kostos dhe inteligjencës, duke ndërthurur aftësi të jashtëzakonshme në çdo nivel me një infrastrukturë që i ofron ato me efikasitet në shkallë të gjerë. Përmirësimet në ruajtjen në memorien specifike dhe në inferencë na mundësojnë t'i ofrojmë këto modele me kosto më të ulët. Këto kursime po ua kalojmë drejtpërdrejt përdoruesve dhe klientëve, duke ulur me 50% çmimet e API-së për Sol dhe Luna krahasuar me çmimet e tyre promocionale për GPT‑5.6. Së bashku, këto përmirësime e bëjnë IA-në e avancuar praktike për më shumë detyra të përditshme dhe zbatime në shkallë të gjerë.
Modeli | Hyrja | Dalja | Ulja e çmimit |
GPT‑6 Sol | 4 dollarë → 2 dollarë | 20 dollarë → 10 dollarë | 50% më lirë |
GPT‑6 Luna | 0,20 dollarë → 0,10 dollarë | 1,20 dollarë → 0,50 dollarë | 50% më lirë |
Çmimet janë për 1 milion tokenë.
GPT‑6 Astra mbetet modeli ynë më i mirë në çdo aspekt. Zgjidhe kur kërkon rezultatet më të mira dhe një përvojë pa kompromise.
GPT‑6 Sol dhe Luna u sjellin modeleve që tashmë njeh dhe përdor inteligjencë të përmirësuar dhe efikasitet më të lartë të kostos në aftësitë më të dobishme për kryerjen e punëve komplekse.
GPT‑6 Sol mund të përballojë detyra të vështira pune, duke të dhënë më shumë hapësirë për përmirësime të njëpasnjëshme falë kufijve më të lartë të përdorimit dhe kostos më të ulët. Ai ofron më shumë inteligjencë dhe rezultate më të mira se modelet konkurrente me çmim të ngjashëm.
Në AutomationBench, një test i proceseve të punës së biznesit në aplikacione të ndryshme, GPT‑6 Sol me nivel përpjekjeje xhigh tejkalon Claude Opus 5 me nivel përpjekjeje max, me vetëm 9% të kostos për detyrë të Opus 5. Me nivel përpjekjeje High, GPT‑6 Luna e tejkalon paraardhësin e vet me 5,4 pikë përqindjeje, me kosto 58% më të ulët për detyrë.
Në AutomationBench 1.0.6(hapet në një dritare të re), agjentët e AI-së testohen në procese të plota pune duke përdorur 47 mjete në fushat e shitjeve, marketingut, operacioneve, mbështetjes, financave dhe burimeve njerëzore. Vlera e paraqitur për Claude Fable 5.1 është më e ulët se kostoja e tij reale, pasi nuk përfshin koston e përdorimit të Opus 5 si model rezervë, gjë që ndodhi në rreth 40% të detyrave.
GPT‑6 Sol tejkalon edhe Claude Fable 5.1 me kosto shumë më të ulët dhe madje ia kalon GPT‑6 Astra me nivel të ulët përpjekjeje.
Modeli (dhe përpjekja) | Rezultati | Kostoja për detyrë |
|---|---|---|
GPT‑6 Sol (xhigh) | 33,2% | 0,27 dollarë |
GPT‑6 Astra (Low) | 30,3% | 3,9x GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9% | 11.1x GPT‑6 Sol |
Claude Fable 5.1 me Opus 5 si model rezervë (Max) | 31,4% | >8,9x GPT‑6 Sol (kostoja e alternativës rezervë nuk është raportuar) |
Në Agents’ Last Exam, një test që vlerëson agjentët në procese komplekse pune profesionale, GPT‑6 Sol, me nivelin maksimal të përpjekjes, arrin një rezultat prej 56,4%, duke tejkaluar rezultatin më të lartë të Claude Opus 5 në këtë vlerësim, me një kosto 60% më të ulët për detyrë.
Në Agents’ Last Exam V1(hapet në një dritare të re), agjentët e IA-së vlerësohen në detyra afatgjata me vlerë ekonomike, që përfshijnë 55 nënindustri dhe mbulojnë shumicën e fushave kryesore të punës profesionale të kryer në kompjuter.
Dobia e një përgjigjeje varet nga saktësia e fakteve dhe ne vazhdojmë të përmirësojmë besueshmërinë faktike. Në vlerësimin tonë të brendshëm të saktësisë faktike, i cili bazohet në biseda reale ku janë hequr të dhënat identifikuese dhe ku përdoruesit kanë sinjalizuar gabime të modeleve tona, GPT‑6 Sol bën rreth gjysmën e gabimeve të paraardhësit të vet, duke iu afruar nivelit të besueshmërisë së Astra me kosto shumë më të ulët. Edhe GPT‑6 Luna përmirësohet ndjeshëm; në nivele më të larta përpjekjeje, arrin rezultate të barabarta me GPT‑5.6 Sol, me rreth një të qindtën e kostos së tij.
Këtu vlerësojmë saktësinë faktike në biseda të ChatGPT‑së nga të cilat janë hequr të dhënat identifikuese dhe ku përdoruesit kishin raportuar një gabim faktik në përgjigjen e një modeli të mëparshëm. Këto biseda, që kanë nxitur gabime, nuk janë përfaqësuese të përdorimit të zakonshëm, ku gabimet faktike janë më të rralla. Rezultatet nuk janë kontrolluar për gjatësinë e përgjigjeve. Megjithatë, testet tona me nivele të ndryshme të hollësisë së përgjigjeve treguan se rezultatet pothuajse nuk varen nga gjatësia e tyre.
Këtë vit, agjentët e programimit kanë filluar të marrin përsipër detyra më komplekse, më të gjera dhe më afatgjata se kurrë më parë. Në OpenAI, përdorimi i tyre i brendshëm është rritur në mënyrë eksponenciale. Bazuar në çmimet e API-së, vlera e përdorimit ditor të tokenëve ka tejkaluar 600 dollarë për studiuesin në medianë dhe 7000 dollarë për studiuesit në percentilin e 90-të (përshpejtimi i kërkimit: Një vështrim nga brenda OpenAI). Ndërsa agjentët e programimit marrin përsipër detyra më të gjata dhe më kërkuese, kostoja e përdorimit të vazhdueshëm bëhet gjithnjë e më e rëndësishme. GPT‑6 Sol dhe Luna ndërthurin performancën e lartë në programim me çmime më të ulëta të API-së, duke u dhënë zhvilluesve më shumë hapësirë për të eksperimentuar dhe përmirësuar zgjidhjet e tyre, si dhe ekipeve sigurinë për të qenë më ambicioze në detyrat që i ngarkojnë Codex-it.
Në FrontierCode, një test që vlerëson nëse agjentët e programimit prodhojnë ndryshime të gatshme për t'u integruar në baza reale kodi, GPT‑6 Sol shënon një përmirësim të ndjeshëm krahasuar me GPT‑5.6 Sol dhe arrin të njëjtin nivel performance me Claude Fable 5.1 xhigh, me një kosto shumë më të ulët.
Në FrontierCode 1.1 Main(hapet në një dritare të re), agjentët e IA-së shkruajnë kod që vlerësohet jo vetëm për saktësinë, por edhe për “mundësinë e integrimit”: p.sh., cilësinë e testeve, respektimin e fushës së detyrës, stilin e kodit dhe përputhjen me standardet e bazës së kodit.
Në DeepSWE v1.1, një test që vlerëson performancën në detyra komplekse të inxhinierisë së softuerit në baza reale kodi, GPT‑6 Sol, me nivelin maksimal të përpjekjes, arrin një rezultat prej 68,8%, vetëm 1,1 pikë përqindjeje më pak se rezultati më i lartë i Claude Fable 5 në këtë vlerësim (69,9% me nivelin xhigh të përpjekjes), me një kosto afërsisht 80% më të ulët për detyrë.
GPT‑6 Luna, me nivelin maksimal të përpjekjes, arrin një rezultat prej 66,6%, të krahasueshëm me rezultatet e Claude Opus 5 dhe Fable 5 në nivelin mesatar të përpjekjes. Në këto krahasime, kostoja e Luna për detyrë është 93% më e ulët se ajo e Opus 5 dhe 96% më e ulët se ajo e Fable 5.
Në DeepSWE 1.1(hapet në një dritare të re), agjentët e IA-së zgjidhin detyra origjinale dhe afatgjata të inxhinierisë softuerike.
Ndërsa GPT‑6 Astra mbetet modeli më i mirë në botë për përdorimin e kompjuterit, GPT‑6 Sol dhe Luna ofrojnë performancë më efikase për sa i përket kostos krahasuar me modelet e tyre paraardhëse. Në OSWorld 2.0 offline, GPT‑6 Sol, me nivelin shumë të lartë të përpjekjes (xhigh), arrin një rezultat të ngjashëm me Claude Opus 5 në nivelin mesatar të përpjekjes: 60,5% kundrejt 60,3%, me një kosto afërsisht 80% më të ulët për detyrë. GPT‑6 Luna (max) arrin të tejkalojë GPT‑5.6 Sol (medium) me një të dhjetën e kostos së tij.
Në OSWorld 2.0(hapet në një dritare të re), agjentët e IA-së provojnë procese afatgjata të përdorimit të kompjuterit që përfshijnë detyra të përditshme dhe profesionale. Raportojmë shpërblimin e pjesshëm në grupin jashtë linje të versionit v2026.08.08.
Stilin e përmirësuar të komunikimit të GPT‑6 Astra e kemi sjellë edhe te Sol dhe Luna, dhe mendojmë se kjo do të vihet re veçanërisht në bisedat teknike dhe ato rreth programimit. Prit përgjigje më të qarta, me më pak zhargon, më pak shprehje të pazakonta dhe më pak hollësi të panevojshme. Në përgjithësi, përgjigjet do të jenë pak më të shkurtra, pa humbur përmbajtjen thelbësore.
Megjithëse stili është subjektiv, ne preferojmë përgjigjen e GPT‑6 Sol në këtë rast. Modeli nuk nxjerr përfundime të nxituara, nuk shpenzon shumë kohë duke përsëritur hollësi që mund të jenë të qarta për personin që ka bërë kërkesën (p.sh., që faqja e internetit ka katër faqe), përdor më pak shprehje të paqarta (p.sh., "pamje në stilin bento", "ristrukturimi... rreth atij sistemi"), është më transparent për atë që ka kontrolluar dhe atë që nuk ka kontrolluar, si dhe nuk ndan pa nevojë hollësi të zbatimit teknik, si kërkesën që i ka dhënë mjetit të gjenerimit të imazheve.
Krahas uljes së çmimeve të tokenëve, po i ndihmojmë zhvilluesit që ndërtojnë aplikacione me GPT‑6 të kursejnë edhe më shumë nga ripërdorimi i kontekstit në aplikacionet e tyre. Kemi përmirësuar ruajtjen në memorien specifike të kërkesave për GPT‑6, duke rritur si parazgjedhje shkallën e përdorimit të të dhënave të ruajtura në këtë memorie. Kjo i ndihmon agjentët të ripërdorin më shumë kontekst, të përgjigjen më shpejt dhe të përfitojnë nga ulje prej 90% të çmimit për leximin e tokenëve hyrës të ruajtur në memorien specifike.
Zhvilluesit kanë gjithashtu më shumë mënyra për të matur dhe optimizuar performancën e ruajtjes në memorien specifike:
Monitoro dhe diagnostiko. Paneli i ruajtjes së kërkesës në memorien specifike(hapet në një dritare të re) tregon sa nga hyrja ruhet dhe si ndryshon kjo me kalimin e kohës. Mjeti diagnostikues(hapet në një dritare të re) ndihmon të shpjegohen mundësitë e humbura për ruajtje në memorie specifike dhe çfarë duhet rregulluar.
Rregullo përpjekjen e arsyetimit dhe disponueshmërinë e mjeteve pa prishur memorien specifike. Rrit përpjekjen e arsyetimit(hapet në një dritare të re) për detyra më të vështira ose ule për pyetje vijuese më të thjeshta, si dhe aktivizo ose çaktivizo mjetet(hapet në një dritare të re) kur ndryshojnë nevojat e agjentit tënd. Tani të dyja kontrollet e ruajnë kontekstin e mëparshëm për ripërdorim nga memoria specifike.
Optimizo se cilat parashtesa ruhen në memorien specifike. Pikat e qarta të ndërprerjes u lejojnë zhvilluesve të zgjedhin se ku përfundojnë parashtesat e kërkesave të ruajtura në memorien specifike. Kjo u jep zhvilluesve më shumë kontroll mbi ripërdorimin e memories specifike dhe mund të përmirësojë performancën.
GitHub raporton se, gjatë muajve të fundit, këto përmirësime kanë ulur me më shumë se 50% përqindjen e tokenëve të promptit që kërkojnë përpunim nga e para, në miliarda kërkesa drejtuar modeleve të OpenAI, duke ndihmuar Copilot të përgjigjet më shpejt.
GPT‑6 Sol dhe Luna mbështeten në përparimet në përputhjen e modeleve me udhëzimet dhe vlerat e përcaktuara, të prezantuara me Astra-n, modelin tonë që ka arritur nivelin më të lartë të kësaj përputhjeje deri më sot. Në vlerësimet tona të përputhjes, si Sol ashtu edhe Luna tregojnë përmirësime krahasuar me modelet përkatëse GPT‑5.6, duke përfshirë një shkallë më të ulët të pretendimeve çorientuese për punën e tyre në programim.
Vlerësimet më poshtë testojnë qëllimisht situata sfiduese dhe nuk matin shkallën e dështimeve në përdorimin tipik. Shih kartën e sistemit(hapet në një dritare të re) për rezultatet e plota.
GPT‑6 Sol dhe GPT‑6 Luna janë të disponueshme në ChatGPT Work dhe Codex duke filluar nga sot për të gjithë përdoruesit e planeve Plus, Pro, Business, Enterprise dhe Edu. Përdoruesit e planeve Free dhe Go mund të përdorin GPT‑6 Luna në aplikacionin për kompjuter. Këto modele nuk janë ende të disponueshme në Chat. Në API-në e OpenAI, ato janë të disponueshme me emrat gpt-6-sol dhe gpt-6-luna.
Për të siguruar që shërbimi të funksionojë në mënyrë të qëndrueshme për të gjithë, planifikojmë t’i bëjmë këto modele të disponueshme gradualisht në ChatGPT gjatë gjithë ditës. Nëse nuk i sheh modelet e reja në ChatGPT Work ose Codex, provo përsëri më vonë.
Vlerësimet e GPT‑së u kryen në mjedisin tonë kërkimor ose përmes API-së sonë. Për shkak të ndryshimeve në udhëzimet e sistemit, mjetet e disponueshme etj., rezultatet mund të ndryshojnë pak nga ato të ChatGPT‑së në mjedisin e prodhimit. Vlerësimet e modeleve konkurruese u morën nga raporte të disponueshme publikisht. Kur rezultatet për Claude Fable 5.1 nuk ishin të disponueshme, u përdorën rezultatet e raportuara për Claude Fable 5.


