Tunakuletea GPT‑6 Sol na Luna
Njia zaidi za kuleta akili ya kiwango cha juu zaidi katika kazi unayofanya kila siku.
Mapema mwezi huu, tuliwaletea GPT‑6 Astra, muundo wenye akili zaidi na uliopatanishwa zaidi duniani. Ingawa miradi migumu na muhimu zaidi bado inahitaji uwezo kamili wa Astra, kazi hufanyika kwa viwango, kasi na bajeti tofauti.
Ndiyo maana tunapanua ulimwengu wa GPT‑6 kwa GPT‑6 Sol na GPT‑6 Luna. GPT‑6 Astra ilianzisha kizazi kipya cha akili—miundo hii inasaidia kusambaza manufaa ya akili hiyo kwa kusogeza mbele mpaka wa ufanisi wa gharama. Tulifunza GPT‑6 Sol na Luna kwa mbinu zinazofanana na za GPT‑6 Astra, tukileta maendeleo yanayowezesha utendaji wa kisasa wa Astra katika kazi za kitaalamu, usahihi wa ukweli, uandishi wa msimbo, matumizi ya kompyuta na upatanishaji kwenye miundo yenye kasi zaidi na nafuu zaidi.
Miundo ya GPT‑6 inaongoza katika uwiano wa gharama na akili, ikiunganisha uwezo wa kipekee katika kila daraja na miundombinu inayoutoa kwa ufanisi kwa kiwango kikubwa. Maboresho katika uhifadhi wa muda na uchakataji wa majibu yanatuwezesha kutoa miundo hii kwa gharama ya chini, na tunawapitishia watumiaji na wateja akiba hiyo moja kwa moja kwa kupunguza bei za API za Sol na Luna kwa 50% ikilinganishwa na bei zao za ofa za GPT‑5.6. Kwa pamoja, maboresho haya yanafanya AI ya hali ya juu iweze kutumika kivitendo katika majukumu na programu zaidi za kila siku kwa kiwango kikubwa.
Muundo | Ingizo | Tokeo | Punguzo la bei |
GPT‑6 Sol | $4 → $2 | $20 → $10 | Nafuu kwa 50% |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | Nafuu kwa 50% |
Bei ni kwa kila tokeni milioni 1.
GPT‑6 Astra inaendelea kuwa muundo wetu bora zaidi kwa ujumla. Ichague unapotaka matokeo bora zaidi na matumizi yasiyo na maridhiano.
GPT‑6 Sol na Luna zinaleta maboresho ya akili na ufanisi wa gharama kwenye miundo unayoijua na kutumia, katika uwezo unaofaa zaidi kukamilisha kazi changamano.
GPT‑6 Sol inaweza kushughulikia majukumu magumu ya kazi huku ikikupa nafasi zaidi ya kuboresha kwa hatua kutokana na vikomo vya juu vya matumizi na gharama ya chini, ikitoa akili zaidi na matokeo bora kuliko miundo ya washindani yenye bei sawa.
Katika AutomationBench, jaribio la mtiririko wa kazi za biashara kwenye programu mbalimbali, GPT‑6 Sol kwa juhudi ya xhigh inaishinda Claude Opus 5 kwa juhudi ya Max huku ikigharimu 9% pekee ya gharama ya Opus 5 kwa kila jukumu. Kwa juhudi ya Juu, GPT‑6 Luna inaboresha matokeo ya mtangulizi wake kwa pointi 5.4 za asilimia huku gharama kwa kila jukumu ikiwa chini kwa 58%.
Katika AutomationBench 1.0.6(fungua katika dirisha jipya), mawakala wa AI hujaribiwa katika mitiririko kamili ya kazi kwa kutumia zana 47 katika mauzo, masoko, shughuli, usaidizi, fedha na rasilimali watu. Data ya Claude Fable 5.1 inaonyesha gharama ndogo kuliko halisi kwa sababu haijumuishi gharama ya kutumia Opus 5 kama akiba, jambo lililotokea katika takribani 40% ya majukumu.
GPT‑6 Sol pia inaizidi Claude Fable 5.1 kwa gharama ya chini sana, na hata inaishinda GPT‑6 Astra ya juhudi ya chini.
Muundo (na juhudi) | Alama | Gharama kwa kila jukumu |
|---|---|---|
GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
GPT‑6 Astra (Chini) | 30.3% | Mara 3.9 ya GPT‑6 Sol |
Claude Opus 5 (Max) | 26.9% | Mara 11.1 ya GPT‑6 Sol |
Claude Fable 5.1 pamoja na Opus 5 ya akiba (Max) | 31.4% | Zaidi ya mara 8.9 ya GPT‑6 Sol (gharama ya kutumia muundo wa akiba haikuripotiwa) |
Katika Agents’ Last Exam, inayotathmini mawakala katika mitiririko changamano ya kazi za kitaalamu, GPT‑6 Sol kwa juhudi ya Max inapata 56.4%, zaidi ya alama ya juu zaidi ya Claude Opus 5 katika tathmini hiyo, huku gharama kwa kila jukumu ikiwa chini kwa 60%.
Katika Agents’ Last Exam V1(fungua katika dirisha jipya), mawakala wa AI hutathminiwa katika majukumu ya muda mrefu yenye thamani ya kiuchumi katika sekta ndogo 55, yanayojumuisha nyanja nyingi kuu za kazi za kitaalamu zinazofanywa kwenye kompyuta.
Umuhimu wa jibu hutegemea usahihi wa ukweli, na tunaendelea kuboresha utegemezi wa taarifa za ukweli. Katika tathmini yetu ya ndani ya usahihi wa ukweli, inayotegemea mazungumzo halisi yaliyofutwa utambulisho ambapo watumiaji waliashiria makosa ya miundo yetu, GPT‑6 Sol hufanya takribani nusu ya makosa ya mtangulizi wake, ikikaribia utegemezi wa kiwango cha Astra kwa gharama ya chini sana. GPT‑6 Luna pia imeimarika sana; katika viwango vya juu vya juhudi, inalingana na GPT‑5.6 Sol kwa takribani moja ya mia ya gharama yake.
Hapa tunatathmini usahihi wa ukweli katika mazungumzo ya ChatGPT yaliyofutwa utambulisho ambapo watumiaji walikuwa wameashiria kosa la ukweli kutoka kwa muundo wa awali. Mazungumzo haya yanayochochea makosa hayawakilishi matumizi ya kawaida, ambako makosa ya ukweli hutokea mara chache zaidi. Alama hazijadhibitiwa kulingana na urefu; hata hivyo, majaribio yetu ya urefu wa majibu yalionyesha karibu kutokuwa na uhusiano na urefu wa jibu.
Mwaka huu, mawakala wa uandishi wa msimbo wameanza kushughulikia majukumu yenye uchangamano, upeo na muda mkubwa zaidi kuliko hapo awali. Katika OpenAI, matumizi yetu ya ndani yameongezeka kwa kasi kubwa sana. Yakikadiriwa kwa bei za API, matumizi ya kila siku ya tokeni yamezidi $600 kwa mtafiti wa kati na $7,000 kwa watafiti walio katika asilimia 10 ya juu (Kuongeza kasi ya utafiti: Mtazamo kutoka ndani ya OpenAI). Kadiri mawakala wa uandishi wa msimbo wanavyoshughulikia majukumu marefu na magumu zaidi, gharama ya matumizi endelevu inazidi kuwa muhimu. GPT‑6 Sol na Luna zinaunganisha utendaji thabiti wa uandishi wa msimbo na bei za chini za API, zikiwapa wasanidi nafasi zaidi ya kuboresha kwa hatua na kuzipa timu ujasiri wa kuwa na malengo makubwa zaidi kuhusu wanachoiomba Codex ishughulikie.
Katika FrontierCode, inayotathmini kama mawakala wa uandishi wa msimbo hutengeneza mabadiliko yaliyo tayari kuunganishwa kwenye hifadhi halisi za msimbo, GPT‑6 Sol imeimarika sana kuliko GPT‑5.6 Sol na inaweza kulingana na Claude Fable 5.1 xhigh kwa gharama ya chini sana.
Katika FrontierCode 1.1 Main(fungua katika dirisha jipya), mawakala wa AI huandika msimbo unaotathminiwa si kwa usahihi tu bali pia kwa “uwezo wa kuunganishwa”: kwa mfano, ubora wa majaribio, nidhamu ya upeo, mtindo wa msimbo na kufuata viwango vya hifadhi ya msimbo.
Katika DeepSWE v1.1, inayopima utendaji katika majukumu changamano ya uhandisi wa programu kwenye hifadhi halisi za msimbo, GPT‑6 Sol kwa juhudi ya Max inapata 68.8%, ikiwa nyuma kwa pointi 1.1 pekee za asilimia ya alama ya juu zaidi ya Claude Fable 5 katika tathmini—69.9% kwa juhudi ya xhigh—huku gharama kwa kila jukumu ikiwa chini kwa takribani 80%.
GPT‑6 Luna kwa juhudi ya Max inapata 66.6%, matokeo yanayolingana na Claude Opus 5 na Fable 5 kwa juhudi ya Wastani. Katika ulinganisho huu, gharama ya Luna kwa kila jukumu ni chini kwa 93% kuliko Opus 5 na chini kwa 96% kuliko Fable 5.
Katika DeepSWE 1.1(fungua katika dirisha jipya), mawakala wa AI hutatua majukumu asili ya muda mrefu ya uhandisi wa programu.
Ingawa GPT‑6 Astra inasalia kuwa muundo bora zaidi duniani kwa matumizi ya kompyuta, GPT‑6 Sol na Luna zinatoa utendaji wenye ufanisi zaidi wa gharama kuliko watangulizi wake. Katika OSWorld 2.0 offline, GPT‑6 Sol kwa juhudi ya xhigh inapata alama inayokaribiana na ya Claude Opus 5 kwa juhudi ya Wastani—60.5% dhidi ya 60.3%—huku gharama kwa kila jukumu ikiwa chini kwa takribani 80%. GPT‑6 Luna (Max) inaweza kuizidi GPT‑5.6 Sol (Wastani) kwa moja ya kumi ya gharama yake.
Katika OSWorld 2.0(fungua katika dirisha jipya), mawakala wa AI hujaribu mitiririko ya muda mrefu ya matumizi ya kompyuta katika majukumu ya kila siku na ya kitaalamu. Tunaripoti zawadi ya sehemu kwenye seti ya nje ya mtandao kutoka toleo la v2026.08.08.
Pia tumeleta mtindo bora wa mawasiliano wa GPT‑6 Astra kwenye Sol na Luna, ambao tunaamini utaonekana zaidi katika mazungumzo ya kiufundi na ya uandishi wa msimbo. Tarajia uwazi zaidi, istilahi chache ngumu, misemo michache isiyo ya kawaida, maelezo machache yasiyo na thamani kubwa na majibu mafupi kidogo kwa ujumla bila kupoteza hoja muhimu.
Ingawa mtindo hutegemea mapendeleo, tunapendelea jibu la GPT‑6 Sol hapa. Halikimbilii hitimisho, halitumii muda mwingi kurudia maelezo ambayo huenda yako wazi kwa muulizaji (kwa mfano, kwamba tovuti ina kurasa nne), linatumia lugha isiyo na utata mwingi (kwa mfano, “mwonekano wa bento”, “kuunda upya… kulingana na mfumo huo”), linaeleza wazi zaidi mambo liliyokagua na ambayo halikukagua, na halishiriki bila sababu maelezo ya utekelezaji kama dokeza la zana yake ya picha.
Pamoja na bei za chini za tokeni, tunawasaidia wasanidi wanaotumia GPT‑6 kuokoa zaidi kwenye muktadha unaotumiwa tena na programu zao. Tumeboresha hifadhi muda ya maelekezo tangulizi ya GPT‑6 ili kutoa viwango vya juu zaidi vya kupata data kwenye hifadhi kwa chaguomsingi, hivyo kusaidia mawakala kutumia tena muktadha zaidi, kujibu haraka na kupata punguzo la 90% kwa usomaji wa tokeni za ingizo zilizohifadhiwa.
Wasanidi pia wana njia zaidi za kupima na kuboresha utendaji wa uhifadhi wao wa muda:
Fuatilia na utambue matatizo. Dashibodi ya Hifadhi Muda ya Maelekezo Tangulizi(fungua katika dirisha jipya) inaonyesha kiasi cha ingizo kilichohifadhiwa na jinsi kinavyobadilika kadiri muda unavyopita. Zana ya uchunguzi(fungua katika dirisha jipya) husaidia kueleza fursa za uhifadhi wa muda zilizokosekana na mambo ya kurekebisha.
Rekebisha juhudi ya uwazaji na upatikanaji wa zana bila kuvuruga hifadhi. Ongeza juhudi ya uwazaji(fungua katika dirisha jipya) kwa majukumu magumu zaidi au ipunguze kwa maombi rahisi ya ufuatiliaji, na uwashe au uzime zana(fungua katika dirisha jipya) kadiri mahitaji ya wakala wako yanavyobadilika. Vidhibiti vyote viwili sasa vinahifadhi muktadha wa awali ili utumiwe tena kutoka kwenye hifadhi.
Boresha viambishi awali vinavyohifadhiwa. Vituo bayana vya ukatizaji vinawawezesha wasanidi kuchagua mahali viambishi awali vya vidokezo vilivyohifadhiwa vinaishia. Hili linawapa wasanidi udhibiti zaidi wa matumizi tena ya hifadhi na linaweza kuboresha utendaji.
GitHub inaripoti kuwa, katika miezi kadhaa iliyopita, maboresho haya yamepunguza kwa zaidi ya 50% sehemu ya tokeni za vidokezo zinazohitaji uchakataji mpya katika mabilioni ya maombi kwa miundo ya OpenAI, hivyo kusaidia Copilot kujibu haraka zaidi.
GPT‑6 Sol na Luna zinaendeleza kazi ya upatanishaji iliyoanzishwa na Astra, muundo wetu uliopatanishwa zaidi hadi sasa. Katika tathmini zetu za upatanishaji, Sol na Luna zote zinaonyesha maboresho dhidi ya miundo wenzao ya GPT‑5.6, ikiwemo viwango vya chini vya madai ya kupotosha kuhusu kazi yao ya uandishi wa msimbo.
Tathmini zilizo hapa chini zinajaribu kimakusudi hali ngumu na hazipimi viwango vya hitilafu katika matumizi ya kawaida. Tazama kasi ya mfumo(fungua katika dirisha jipya) kwa matokeo kamili.
GPT‑6 Sol na GPT‑6 Luna zinapatikana katika ChatGPT Work na Codex kuanzia leo kwa watumiaji wote wa Plus, Pro, Business, Enterprise na Edu. Watumiaji wa Free na Go wanaweza kufikia GPT‑6 Luna katika programu ya kompyuta. Miundo hii bado haipatikani katika Chat. Katika API ya OpenAI, inapatikana kama gpt-6-sol na gpt-6-luna.
Ili kudumisha uthabiti wa huduma kwa kila mtu, tunapanga kutoa miundo hii hatua kwa hatua katika ChatGPT siku nzima. Usipoona miundo mipya katika ChatGPT Work au Codex, tafadhali jaribu tena baadaye.
Tathmini za GPT zilifanywa katika mazingira yetu ya utafiti au kupitia API yetu, ambayo inaweza kutoa matokeo tofauti kidogo na ChatGPT ya uzalishaji kutokana na tofauti katika vidokezo vya mfumo, zana zinazopatikana na kadhalika. Tathmini za miundo ya washindani zilitolewa kwenye ripoti zinazopatikana kwa umma. Alama za Claude Fable 5 ziliripotiwa wakati alama za Claude Fable 5.1 hazikupatikana.


