Ruka hadi kwenye maudhui kuu
OpenAI

Tunakuletea GPT‑6 Sol na Luna

Njia zaidi za kuleta akili ya kiwango cha juu zaidi katika kazi unayofanya kila siku.

Inapakia…

Mapema mwezi huu, tuliwaletea GPT‑6 Astra, muundo wenye akili zaidi na uliopatanishwa zaidi duniani. Ingawa miradi migumu na muhimu zaidi bado inahitaji uwezo kamili wa Astra, kazi hufanyika kwa viwango, kasi na bajeti tofauti.

Ndiyo maana tunapanua ulimwengu wa GPT‑6 kwa GPT‑6 Sol na GPT‑6 Luna. GPT‑6 Astra ilianzisha kizazi kipya cha akili—miundo hii inasaidia kusambaza manufaa ya akili hiyo kwa kusogeza mbele mpaka wa ufanisi wa gharama. Tulifunza GPT‑6 Sol na Luna kwa mbinu zinazofanana na za GPT‑6 Astra, tukileta maendeleo yanayowezesha utendaji wa kisasa wa Astra katika kazi za kitaalamu, usahihi wa ukweli, uandishi wa msimbo, matumizi ya kompyuta na upatanishaji kwenye miundo yenye kasi zaidi na nafuu zaidi.

Miundo ya GPT‑6 inaongoza katika uwiano wa gharama na akili, ikiunganisha uwezo wa kipekee katika kila daraja na miundombinu inayoutoa kwa ufanisi kwa kiwango kikubwa. Maboresho katika uhifadhi wa muda na uchakataji wa majibu yanatuwezesha kutoa miundo hii kwa gharama ya chini, na tunawapitishia watumiaji na wateja akiba hiyo moja kwa moja kwa kupunguza bei za API za Sol na Luna kwa 50% ikilinganishwa na bei zao za ofa za GPT‑5.6. Kwa pamoja, maboresho haya yanafanya AI ya hali ya juu iweze kutumika kivitendo katika majukumu na programu zaidi za kila siku kwa kiwango kikubwa.

Bei za API ya GPT‑6

Muundo

Ingizo

Tokeo

Punguzo la bei

GPT‑6 Sol
dhidi ya GPT‑5.6 Sol

$4 → $2

$20 → $10

Nafuu kwa 50%

GPT‑6 Luna
dhidi ya GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

Nafuu kwa 50%

Bei ni kwa kila tokeni milioni 1.

GPT‑6 Astra inaendelea kuwa muundo wetu bora zaidi kwa ujumla. Ichague unapotaka matokeo bora zaidi na matumizi yasiyo na maridhiano.

Hatua kubwa mbele katika familia nzima ya miundo

GPT‑6 Sol na Luna zinaleta maboresho ya akili na ufanisi wa gharama kwenye miundo unayoijua na kutumia, katika uwezo unaofaa zaidi kukamilisha kazi changamano.

Kazi za kitaalamu

GPT‑6 Sol inaweza kushughulikia majukumu magumu ya kazi huku ikikupa nafasi zaidi ya kuboresha kwa hatua kutokana na vikomo vya juu vya matumizi na gharama ya chini, ikitoa akili zaidi na matokeo bora kuliko miundo ya washindani yenye bei sawa.

Katika AutomationBench, jaribio la mtiririko wa kazi za biashara kwenye programu mbalimbali, GPT‑6 Sol kwa juhudi ya xhigh inaishinda Claude Opus 5 kwa juhudi ya Max huku ikigharimu 9% pekee ya gharama ya Opus 5 kwa kila jukumu. Kwa juhudi ya Juu, GPT‑6 Luna inaboresha matokeo ya mtangulizi wake kwa pointi 5.4 za asilimia huku gharama kwa kila jukumu ikiwa chini kwa 58%.

Katika AutomationBench 1.0.6⁠(fungua katika dirisha jipya), mawakala wa AI hujaribiwa katika mitiririko kamili ya kazi kwa kutumia zana 47 katika mauzo, masoko, shughuli, usaidizi, fedha na rasilimali watu. Data ya Claude Fable 5.1 inaonyesha gharama ndogo kuliko halisi kwa sababu haijumuishi gharama ya kutumia Opus 5 kama akiba, jambo lililotokea katika takribani 40% ya majukumu.

GPT‑6 Sol pia inaizidi Claude Fable 5.1 kwa gharama ya chini sana, na hata inaishinda GPT‑6 Astra ya juhudi ya chini.

Muundo (na juhudi)

Alama

Gharama kwa kila jukumu

GPT‑6 Sol (xhigh)

33.2%

$0.27

GPT‑6 Astra (Chini)

30.3%

Mara 3.9 ya GPT‑6 Sol

Claude Opus 5 (Max)

26.9%

Mara 11.1 ya GPT‑6 Sol

Claude Fable 5.1 pamoja na Opus 5 ya akiba (Max)

31.4%

Zaidi ya mara 8.9 ya GPT‑6 Sol

(gharama ya kutumia muundo wa akiba haikuripotiwa)

Katika Agents’ Last Exam, inayotathmini mawakala katika mitiririko changamano ya kazi za kitaalamu, GPT‑6 Sol kwa juhudi ya Max inapata 56.4%, zaidi ya alama ya juu zaidi ya Claude Opus 5 katika tathmini hiyo, huku gharama kwa kila jukumu ikiwa chini kwa 60%.

Katika Agents’ Last Exam V1⁠(fungua katika dirisha jipya), mawakala wa AI hutathminiwa katika majukumu ya muda mrefu yenye thamani ya kiuchumi katika sekta ndogo 55, yanayojumuisha nyanja nyingi kuu za kazi za kitaalamu zinazofanywa kwenye kompyuta.

Usahihi wa ukweli

Umuhimu wa jibu hutegemea usahihi wa ukweli, na tunaendelea kuboresha utegemezi wa taarifa za ukweli. Katika tathmini yetu ya ndani ya usahihi wa ukweli, inayotegemea mazungumzo halisi yaliyofutwa utambulisho ambapo watumiaji waliashiria makosa ya miundo yetu, GPT‑6 Sol hufanya takribani nusu ya makosa ya mtangulizi wake, ikikaribia utegemezi wa kiwango cha Astra kwa gharama ya chini sana. GPT‑6 Luna pia imeimarika sana; katika viwango vya juu vya juhudi, inalingana na GPT‑5.6 Sol kwa takribani moja ya mia ya gharama yake.

Hapa tunatathmini usahihi wa ukweli katika mazungumzo ya ChatGPT yaliyofutwa utambulisho ambapo watumiaji walikuwa wameashiria kosa la ukweli kutoka kwa muundo wa awali. Mazungumzo haya yanayochochea makosa hayawakilishi matumizi ya kawaida, ambako makosa ya ukweli hutokea mara chache zaidi. Alama hazijadhibitiwa kulingana na urefu; hata hivyo, majaribio yetu ya urefu wa majibu yalionyesha karibu kutokuwa na uhusiano na urefu wa jibu.

Uandishi wa msimbo

Mwaka huu, mawakala wa uandishi wa msimbo wameanza kushughulikia majukumu yenye uchangamano, upeo na muda mkubwa zaidi kuliko hapo awali. Katika OpenAI, matumizi yetu ya ndani yameongezeka kwa kasi kubwa sana. Yakikadiriwa kwa bei za API, matumizi ya kila siku ya tokeni yamezidi $600 kwa mtafiti wa kati na $7,000 kwa watafiti walio katika asilimia 10 ya juu (Kuongeza kasi ya utafiti: Mtazamo kutoka ndani ya OpenAI⁠). Kadiri mawakala wa uandishi wa msimbo wanavyoshughulikia majukumu marefu na magumu zaidi, gharama ya matumizi endelevu inazidi kuwa muhimu. GPT‑6 Sol na Luna zinaunganisha utendaji thabiti wa uandishi wa msimbo na bei za chini za API, zikiwapa wasanidi nafasi zaidi ya kuboresha kwa hatua na kuzipa timu ujasiri wa kuwa na malengo makubwa zaidi kuhusu wanachoiomba Codex ishughulikie.

Katika FrontierCode, inayotathmini kama mawakala wa uandishi wa msimbo hutengeneza mabadiliko yaliyo tayari kuunganishwa kwenye hifadhi halisi za msimbo, GPT‑6 Sol imeimarika sana kuliko GPT‑5.6 Sol na inaweza kulingana na Claude Fable 5.1 xhigh kwa gharama ya chini sana.

Katika FrontierCode 1.1 Main⁠(fungua katika dirisha jipya), mawakala wa AI huandika msimbo unaotathminiwa si kwa usahihi tu bali pia kwa “uwezo wa kuunganishwa”: kwa mfano, ubora wa majaribio, nidhamu ya upeo, mtindo wa msimbo na kufuata viwango vya hifadhi ya msimbo.

Katika DeepSWE v1.1, inayopima utendaji katika majukumu changamano ya uhandisi wa programu kwenye hifadhi halisi za msimbo, GPT‑6 Sol kwa juhudi ya Max inapata 68.8%, ikiwa nyuma kwa pointi 1.1 pekee za asilimia ya alama ya juu zaidi ya Claude Fable 5 katika tathmini—69.9% kwa juhudi ya xhigh—huku gharama kwa kila jukumu ikiwa chini kwa takribani 80%.

GPT‑6 Luna kwa juhudi ya Max inapata 66.6%, matokeo yanayolingana na Claude Opus 5 na Fable 5 kwa juhudi ya Wastani. Katika ulinganisho huu, gharama ya Luna kwa kila jukumu ni chini kwa 93% kuliko Opus 5 na chini kwa 96% kuliko Fable 5.

Katika DeepSWE 1.1⁠(fungua katika dirisha jipya), mawakala wa AI hutatua majukumu asili ya muda mrefu ya uhandisi wa programu.

Matumizi ya kompyuta

Ingawa GPT‑6 Astra inasalia kuwa muundo bora zaidi duniani kwa matumizi ya kompyuta, GPT‑6 Sol na Luna zinatoa utendaji wenye ufanisi zaidi wa gharama kuliko watangulizi wake. Katika OSWorld 2.0 offline, GPT‑6 Sol kwa juhudi ya xhigh inapata alama inayokaribiana na ya Claude Opus 5 kwa juhudi ya Wastani—60.5% dhidi ya 60.3%—huku gharama kwa kila jukumu ikiwa chini kwa takribani 80%. GPT‑6 Luna (Max) inaweza kuizidi GPT‑5.6 Sol (Wastani) kwa moja ya kumi ya gharama yake.

Katika OSWorld 2.0⁠(fungua katika dirisha jipya), mawakala wa AI hujaribu mitiririko ya muda mrefu ya matumizi ya kompyuta katika majukumu ya kila siku na ya kitaalamu. Tunaripoti zawadi ya sehemu kwenye seti ya nje ya mtandao kutoka toleo la v2026.08.08.

Mtindo wa ushirikiano

Pia tumeleta mtindo bora wa mawasiliano wa GPT‑6 Astra kwenye Sol na Luna, ambao tunaamini utaonekana zaidi katika mazungumzo ya kiufundi na ya uandishi wa msimbo. Tarajia uwazi zaidi, istilahi chache ngumu, misemo michache isiyo ya kawaida, maelezo machache yasiyo na thamani kubwa na majibu mafupi kidogo kwa ujumla bila kupoteza hoja muhimu.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Ingawa mtindo hutegemea mapendeleo, tunapendelea jibu la GPT‑6 Sol hapa. Halikimbilii hitimisho, halitumii muda mwingi kurudia maelezo ambayo huenda yako wazi kwa muulizaji (kwa mfano, kwamba tovuti ina kurasa nne), linatumia lugha isiyo na utata mwingi (kwa mfano, “mwonekano wa bento”, “kuunda upya… kulingana na mfumo huo”), linaeleza wazi zaidi mambo liliyokagua na ambayo halikukagua, na halishiriki bila sababu maelezo ya utekelezaji kama dokeza la zana yake ya picha.

Kuboresha uhifadhi wa muda kwa mawakala na mazungumzo marefu

Pamoja na bei za chini za tokeni, tunawasaidia wasanidi wanaotumia GPT‑6 kuokoa zaidi kwenye muktadha unaotumiwa tena na programu zao. Tumeboresha hifadhi muda ya maelekezo tangulizi ya GPT‑6 ili kutoa viwango vya juu zaidi vya kupata data kwenye hifadhi kwa chaguomsingi, hivyo kusaidia mawakala kutumia tena muktadha zaidi, kujibu haraka na kupata punguzo la 90% kwa usomaji wa tokeni za ingizo zilizohifadhiwa.

Wasanidi pia wana njia zaidi za kupima na kuboresha utendaji wa uhifadhi wao wa muda:

GitHub inaripoti kuwa, katika miezi kadhaa iliyopita, maboresho haya yamepunguza kwa zaidi ya 50% sehemu ya tokeni za vidokezo zinazohitaji uchakataji mpya katika mabilioni ya maombi kwa miundo ya OpenAI, hivyo kusaidia Copilot kujibu haraka zaidi.

Kuendelea kuboresha upatanishaji

GPT‑6 Sol na Luna zinaendeleza kazi ya upatanishaji iliyoanzishwa na Astra, muundo wetu uliopatanishwa zaidi hadi sasa. Katika tathmini zetu za upatanishaji, Sol na Luna zote zinaonyesha maboresho dhidi ya miundo wenzao ya GPT‑5.6, ikiwemo viwango vya chini vya madai ya kupotosha kuhusu kazi yao ya uandishi wa msimbo.

Tathmini zilizo hapa chini zinajaribu kimakusudi hali ngumu na hazipimi viwango vya hitilafu katika matumizi ya kawaida. Tazama kasi ya mfumo⁠(fungua katika dirisha jipya) kwa matokeo kamili.

Upatikanaji

GPT‑6 Sol na GPT‑6 Luna zinapatikana katika ChatGPT Work na Codex kuanzia leo kwa watumiaji wote wa Plus, Pro, Business, Enterprise na Edu. Watumiaji wa Free na Go wanaweza kufikia GPT‑6 Luna katika programu ya kompyuta. Miundo hii bado haipatikani katika Chat. Katika API ya OpenAI, inapatikana kama gpt-6-sol na gpt-6-luna.

Ili kudumisha uthabiti wa huduma kwa kila mtu, tunapanga kutoa miundo hii hatua kwa hatua katika ChatGPT siku nzima. Usipoona miundo mipya katika ChatGPT Work au Codex, tafadhali jaribu tena baadaye.


Tathmini za GPT zilifanywa katika mazingira yetu ya utafiti au kupitia API yetu, ambayo inaweza kutoa matokeo tofauti kidogo na ChatGPT ya uzalishaji kutokana na tofauti katika vidokezo vya mfumo, zana zinazopatikana na kadhalika. Tathmini za miundo ya washindani zilitolewa kwenye ripoti zinazopatikana kwa umma. Alama za Claude Fable 5 ziliripotiwa wakati alama za Claude Fable 5.1 hazikupatikana.

Mwandishi

OpenAI