OpenAI

9 Julai 2026

ProductToa

GPT‑5.6: Kiwango cha ufikiri cha mpaka kinachopanuka kulingana na azma yenu

Kiwango cha ufikiri zaidi kutoka kwa kila tokeni, utendaji thabiti zaidi kwa kila dola, na uwezo zaidi unapohitajika kwa kazi zenu ngumu zaidi.

Inapakia…

Sasisho la tarehe 30 Julai 2026: OpenAI ilipunguza bei ya GPT‑5.6 Luna kwa asilimia 80% na GPT‑5.6 Terra kwa asilimia 20%. Pata maelezo zaidi hapa.


Tunazindua familia ya miundo ya GPT‑5.6 kwa upatikanaji wa jumla kufuatia toleo letu la awali lililowekewa mipaka: muundo wetu mpya kinara, Sol, pamoja na Terra, muundo uliosawazishwa kwa kazi za kila siku, na Luna, muundo wetu wenye ufanisi zaidi wa gharama.

GPT‑5.6 Sol inaweka kiwango kipya cha akili na ufanisi, ikipata matokeo ya hali ya juu katika uandishi wa misimbo, kazi za maarifa, usalama wa mtandao, na sayansi huku ikizidi miundo ya awali na ile ya mpaka kwa kutumia tokeni chache na kwa gharama iliyokadiriwa kuwa ya chini zaidi. Matokeo yake ni utendaji bora zaidi kwa kila dola: kazi yenye mafanikio zaidi kwa matumizi yale yale, au matokeo yanayolingana kwa gharama ya jumla iliyopunguzwa. Pia tunazindua njia mpya ya kuharakisha kazi zinazohitaji juhudi kubwa zaidi: ultra ni mpangilio wetu wenye uwezo wa juu zaidi, unaoratibu mawakala wengi katika mitiririko sambamba ya kazi ili kukamilisha majukumu changamano kwa haraka zaidi. Matumizi thabiti zaidi ya kompyuta na uamuzi bora wa usanifu hufanya GPT‑5.6 kuwa bora zaidi Sol, mshirika wetu aliyekamilika zaidi hadi sasa, akiisaidia kukagua, kuboresha, na kuwasilisha matokeo yaliyo tayari kutumika.

Tulifunza GPT‑5.6 kupata kazi yenye manufaa zaidi kutoka kwa kila tokeni. Kwenye Mtihani wa Mwisho wa Wakala(fungua katika dirisha jipya), tathmini ya taratibu za kazi ya kitaalamu inayochukua muda mrefu katika nyanja 55, GPT‑5.6 Sol inaweka kiwango kipya cha juu cha 53.6, ikiizidi Claude Fable 5 (uwazaji unaojibadilisha) kwa pointi 13.1. Hata ikiwa na uwazaji wa wastani, inaishinda Fable 5 kwa pointi 11.4 kwa takriban robo ya gharama iliyokadiriwa. Ufanisi huo unaenea hadi kwenye miundo midogo zaidi, ambayo ni muhimu katika kufanya kiwango cha ufikiri kipatikane kwa wingi zaidi na kwa gharama nafuu: GPT‑5.6 Terra na GPT‑5.6 Luna zinaizidi Fable 5 kwa utendaji kwa takriban sehemu moja ya kumi na sita ya gharama. Kwenye Kielezo cha Kiwango cha ufikiri cha Uchambuzi Unde(fungua katika dirisha jipya), kipimo pana cha akili kinachojumuisha kazi za kiwakala, uandishi wa misimbo, uwazaji wa kisayansi, na uwezo wa jumla, GPT‑5.6 Sol yenye uwazaji wa kiwango cha juu inakaribia Fable 5 kwa tofauti ya pointi moja huku ikikamilisha kazi kwa muda mfupi kwa asilimia 61 kwa takribani nusu ya gharama iliyokadiriwa.

Mtihani wa Mwisho wa Mawakala(fungua katika dirisha jipya): Taratibu za kazi za kiwakala za upeo mrefu katika nyanja za kitaalamu.

GPT‑5.6 inazinduliwa ikiwa na mifumo yetu thabiti zaidi ya ulinzi kufikia sasa, iliyoundwa kustahimili matumizi mabaya ya kimakusudi na yanayobadilika bila kuzuia kwa upana kazi halali. Kabla ya upatikanaji wa jumla, tulipitisha miundo na hatua za ulinzi katika kipindi chetu cha kina zaidi cha tathmini kufikia sasa, tukichanganya jaribio la kubaini udhaifu wa mfumo linalofanywa na binadamu na majaribio ya kiotomatiki kwa kiwango kikubwa. Wakati wa kipindi cha toleo tangulizi, tulifanya kazi kwa karibu na mashirika yenye utaalamu pamoja na washirika wa kuaminika ili kujaribu uimara wa ulinzi chini ya shinikizo na kuimarisha hatua za usalama kabla ya uzinduzi mpana zaidi. Mfumo unaotokana na hilo huweka matabaka ya ulinzi yaliyofunzwa ndani ya muundo pamoja na ukaguzi wa wakati halisi, ufuatiliaji, na ufikiaji uliosawazishwa kulingana na uaminifu na hatari.

Ina ufanisi kwa chaguo-msingi, utendaji wa juu zaidi inapohitajika

GPT‑5.6 Sol ndio muundo wetu bora zaidi wa uandishi wa misimbo hadi sasa. Kwenye Kiashiria cha Wakala wa Uandishi wa Misimbo wa Uchambuzi Unde, GPT‑5.6 Sol yenye uwazaji huweka kiwango kipya bora zaidi kwa alama 80, pointi 2.8 zaidi ya Fable 5, huku ikitumia chini ya nusu ya tokeni za matokeo, ikichukua chini ya nusu ya muda, na kugharimu karibu theluthi moja pungufu. Faida hiyo inaenea katika familia nzima: Terra inafanya vizuri kidogo kuliko Fable 5, huku Luna ikifanya vizuri kuliko Opus 4.8; kila moja hufanya hivyo kwa takriban theluthi moja ya muda, ikiwa na takriban nusu ya idadi ya tokeni za matokeo, na kwa takriban robo ya gharama iliyokadiriwa. Pia imeweka matokeo mapya ya kiwango cha juu zaidi kwenye Terminal‑Bench 2.1 na DeepSWE, ambazo hupima taratibu changamano za kazi za mstari wa amri na uhandisi wa muda mrefu katika misingi halisi ya msimbo.

Faharasa ya Wakala wa Usimbaji wa Uchambuzi wa Bandia: faharasa huru ya utendaji wa wakala wa usimbaji katika utekelezaji, matumizi ya terminali, na misimbo halisi ya msingi.

GPT‑5.6 inaweza kuandika na kuendesha programu nyepesi zinazoratibu zana, kuchakata matokeo ya kati, kufuatilia maendeleo, na kuchagua hatua inayofuata kadri kazi inavyoendelea. Hii huruhusu majukumu yanayotegemea zana nyingi yaendelee kwa tokeni chache, mizunguko michache ya kwenda na kurudi kwa muundo, na mwongozo mdogo. Badala ya kuwahitaji wasanidi programu kuandika msimbo wa kila hatua au kupitisha kila jibu la zana kupitia muundo tena, Uwezo wa Kuingiliana na Zana za Nje kwa Njia ya Kiprogramu(fungua katika dirisha jipya) katika Responses API unaweza kuchuja kiasi kikubwa cha data ya kati, kuhifadhi kile tu kilicho muhimu, na kurekebisha utaratibu wake wa kazi kadri mchakato unavyoendelea.

Kwa matatizo yanayothamini uwekezaji mkubwa zaidi wa muda na rasilimali za ukokotoaji, GPT‑5.6 inaweza kwenda zaidi ya chaguo-msingi hili lenye ufanisi. max huipa GPT‑5.6 muda hata zaidi kuliko xhigh wa kufikiri kwa mantiki na kuchunguza njia mbadala, kufanya ukaguzi, na kurekebisha mbinu yake. ultra inaenda mbali zaidi kwa kuratibu mawakala wanne sambamba kwa chaguo-msingi, ikibadilisha matumizi ya juu zaidi ya tokeni kwa matokeo bora zaidi na muda mfupi zaidi wa kupata matokeo katika kazi zinazohitaji juhudi zaidi. Chati zilizo hapa chini zinalinganisha usanidi chaguomsingi wa ultra wa wakala wanne na msingi wa kulinganisha wa wakala mmoja katika BrowseComp, SEC-Bench Pro, na Terminal-Bench 2.1; BrowseComp na SEC-Bench Pro pia zinaonyesha usanidi wa wakala 16. Katika tathmini zote tatu, kuongeza mawakala sambamba husogeza mpaka wa alama na ucheleweshaji juu na kushoto, na kufikia matokeo imara zaidi kwa muda mfupi zaidi. Katika API, wasanidi programu wanaweza kuunda uzoefu unaofanana na Ultra kwa kutumia beta ya mawakala wengi(fungua katika dirisha jipya) katika Responses API. 4, 5 na 6

1 kati ya 11
GPT‑5.6 ni mojawapo ya miundo yenye uwezo zaidi ambayo tumeijaribu kwenye CursorBench, ikitoa matokeo thabiti katika tathmini za awali. Ni hatua ya kusisimua ya kusonga mbele kwa wasanidi programu katika uhifadhi endelevu, kiwango cha ufikiri na ufanisi wa jumla. Tunatazamia kwa hamu kuwaletea watumiaji wetu wa Cursor muundo huu.
—Oskar Schulz, Rais wa Cursor

Hatua kubwa mbele katika muundo

GPT‑5.6 inaleta mabadiliko makubwa katika uwezo wa kufanya maamuzi ya usanifu. Kwa kutumia tu maelekezo ya kiwango cha juu, GPT‑5.6 huunda violesura vyenye mwonekano wa kupendeza, vinavyofaa matumizi, na vinavyofanya kazi vizuri. Uwezo wake imara zaidi wa kutumia kompyuta huiwezesha kukagua na kuboresha matokeo yaliyoonyeshwa—si tu kuzalisha msimbo au maudhui ya msingi—ili iweze kubaini matatizo ya mwonekano na utendaji, na kufanya marekebisho ya mwisho kabla ya kurejesha kazi.

Dokeza: Je, unaweza kunitekelezea mchezo wa 3D wa kuendesha mashua kwa tanga? Kwa chochote kinachohitaji bitmaps/tekstura/sprites (au ikiwa inasaidia kuwa na rejeleo la mfano kwa muundo wowote wa 3D unayounda), jisikie huru kutumia imagegen.

Uwezo wa mbele wa GPT‑5.6 pia hubadilisha maombi ya lugha asilia kuwa maelezo na vielelezo vilivyosafishwa na vinavyoingiliana ndani ya ChatGPT kazi.

Dokeza: Tafadhali tengeneza spirografu shirikishi ili kueleza jinsi inavyofanya kazi.

Kazi ya maarifa kuanzia mwanzo hadi mwisho

GPT‑5.6 hutoa matokeo bora zaidi kwa kazi za kitaalamu. Huchukua muktadha usiopangika kutoka kwenye hati zako na taratibu zako za kazi za kila siku kama vile Slack, Notion, Microsoft 365, na Google Drive, na kuugeuza kuwa nyenzo za kiwango cha kitaalamu zinazoweza kushirikiwa.

Uwezo wa GPT‑5.6 katika kazi za maarifa unaonekana katika tathmini zinazojumuisha uchanganuzi wa kitaalamu wa upeo wa muda mrefu, kuvinjari, matumizi ya zana na matumizi ya kompyuta. GPT‑5.6 Sol inaweka matokeo mapya ya kiwango cha juu zaidi kwenye BrowseComp kwa asilimia 92.2 % na OSWorld 2.0 kwa asilimia 62.6 %; kwenye OSWorld, inaizidi Opus 4.8 huku ikitumia tokeni chache za matokeo kwa asilimia 85%. Hapa, maboresho ya utendaji kwa kila dola yanaenea katika familia nzima ya GPT‑5.6. Luna inakaribia kulingana na utendaji wa kiwango cha juu cha GPT‑5.5 Gharama iliyo chini ya nusu ya gharama iliyokadiriwa, huku Terra ikiizidi kwa gharama ndogo zaidi.

BrowseComp: GPT‑5.6 Sol imefikia kiwango kipya cha ubora wa hali ya juu kwenye BrowseComp, inayojumuisha kazi za kuvinjari za kiwakala.

GPT‑5.6 Sol huboresha ubora katika mawasilisho, hati na lahajedwali, ikizalisha matokeo yaliyo nadhifu zaidi na sahihi zaidi. Inaweza kuunda mawasilisho yanayoweza kuhaririwa kikamilifu kuanzia mwanzo, ikibadilisha dokezo na nyenzo chanzo kuwa simulizi thabiti la kimuonekano lenye mipangilio bora, ngazi za umuhimu, na usanifu.

Maboresho huonekana kwa dhahiri zaidi unapofuata violezo na staha za marejeleo. GPT‑5.6 inaweza kubaini mfumo wa usanifu wa wasilisho la slaidi—miundo ya mipangilio, taipografia, nafasi, rangi, na ruwaza za maudhui zinazojirudia, ikijumuisha sheria zilizopachikwa kwenye Slide Master—na kutumia kaida hizo kwa uthabiti kwenye nyenzo mpya. Katika mfano huu, wakati mfumo unapoombwa kusasisha nambari kulingana na faili ya rejeleo, matokeo ya GPT‑5.5 yanakosa vipengele muhimu kutoka kwenye slaidi kuu, ilhali GPT‑5.6 inafuata muundo wa rejeleo kwa uaminifu zaidi.

Faili ya marejeleo
Slaidi ya ingizo kwa ajili ya ulinganishaji wa mtindo wa GPT-5.6
Matokeo ya GPT‑5.5
Slaidi ya matokeo ya GPT-5.5 kwa ajili ya kulinganisha mtindo

GPT‑5.5 inakosa vipengele muhimu vya slaidi kuu

Matokeo ya GPT‑5.6
Slaidi ya matokeo ya GPT-5.6 kwa ajili ya ulinganishaji wa mtindo

GPT‑5.6 pia huunda hati na lahajedwali zilizoboreshwa zaidi kimwonekano. Hufuata miundo tata ya marejeleo kwa uaminifu zaidi, jambo ambalo ni muhimu kwa shughuli za kazi ya maarifa zinazoweza kurudiwa. Hushughulikia milinganyo na muundo wa kifedha kwa usahihi zaidi, na hutumia vyema zaidi mtindo wa maandishi, uwekaji nafasi, mpangilio wa safu, na mpangilio wa ukurasa au lahajedwali.

Wateja wa mwanzo waliokuwa wakijaribu GPT‑5.6 waliona maboresho katika matokeo ya kazi zinazohitaji maarifa katika nyanja mbalimbali.

1 kati ya 9
GPT‑5.6 ina ufanisi mkubwa katika taratibu ndefu na changamano za kazi zinazohusika katika kuunda programu zinazofaa kutumiwa kwenye mazingira ya uzalishaji. Kama mojawapo ya miundo inayotumiwa sasa na Lovable, huwaletea watumiaji matokeo kwa takribani hatua chache kwa asilimia 25% na miito ya zana chache kwa asiilimia 35–48% kuliko muundo uliotangulia, huku ikiboresha mafanikio ya miradi na kupunguza michakato ya uendeshaji iliyokwama kwa asilimia 15%. Hiyo ni tofauti muhimu kwa mtu yeyote anayejaribu kwenda kutoka kwenye wazo hadi programu inayofanya kazi.
—Fabian Hedin, Mwanzilishi Mwenza katika Lovable

Kukuza mpaka katika nyanja za mtandao na sayansi

GPT‑5.6 ni muundo wetu wenye nguvu zaidi wa usalama wa mtandao hadi sasa, ukifikia utendaji wa kiwango kinachoongoza kwa kutumia tokeni chache sana. Kwenye ExploitBench2, ambayo hupima maendeleo kuanzia kufikia msimbo wenye udhaifu hadi kutekeleza msimbo kiholela, inapata alama ya asilimia 73.5% dhidi ya alama ya GPT‑5.5 katika bajeti ya tokeni za matokeo inayolinganishwa. Kwenye ExploitGym3, inayowataka mawakala kubadilisha udhaifu wa ulimwengu halisi kuwa mbinu za udukuzi zinazofanya kazi, karibu mara mbili hupata alama ya GPT‑5.5 kutoka asilimia 15.1% hadi asilimia 24.9% chini ya kikomo cha saa mbili; kwa saa sita, kinafikia asilimia 33.7%. Kwenye SEC-Bench Pro, ambayo hupima uundaji wa uthibitisho wa dhana kwenye programu changamano, hupata alama ya asilimia 71.2% ikilinganishwa na asilimia 45.8% ya GPT‑5.5. kwa muda wa kusubiri ulioboreshwa. 1

GPT‑5.6 inaunga mkono majukumu muhimu ya ulinzi kama vile ukaguzi salama wa msimbo, kuweka marekebisho, uundaji wa modeli za vitisho, na timu ya ulinzi (blue teaming). Watu binafsi na mashirika yanayostahiki katika mpango wa OpenAI Daybreak’s Trusted Access for Cyber wanaweza kupata uwezo zaidi wa ulinzi kupitia vidhibiti sahihi zaidi kwa kazi iliyothibitishwa katika mazingira yaliyoidhinishwa, ikijumuisha upangaji wa kipaumbele na uthibitishaji wa udhaifu, uchanganuzi wa programu hasidi, uhandisi wa utambuzi wa ulinzi, na uthibitishaji wa marekebisho.

Watu binafsi wanaweza kuthibitisha utambulisho wao na kuomba ufikiaji unaoaminika(fungua katika dirisha jipya), na mashirika yanaweza kuomba kwa ajili ya timu zao. Wanachama binafsi watahitaji kuwezesha Usalama wa Kina wa Akaunti(fungua katika dirisha jipya) kwa funguo za ufikiaji zinazoungwa mkono na maunzi kufikia Septemba 1 ili kuendelea kuwa na ufikiaji wa miundo yetu inayoongoza yenye uwezo mkubwa zaidi wa mtandao; wale ambao hawatafanya hivyo watarejea kwenye ufikiaji chaguo-msingi. Watumiaji ambao bado hawana funguo za ufikiaji zinazotegemea maunzi wanaweza kupata bei maalum(fungua katika dirisha jipya) kutoka kwa mshirika wetu, Yubico. Pia tunachukua hatua za ziada kudhibiti ufikiaji kwa taasisi zenye hatari ya juu na katika maeneo ya mamlaka yenye hatari ya juu.

ExploitBench: Kuunda hatua kwa hatua matukio ya V8 yenye uwezo zaidi; GPT‑5.6 inaonyesha faida kubwa zaidi ya GPT‑5.5. Chati ya ucheleweshaji haijaonyeshwa kwa kuwa ukadiriaji wa ucheleweshaji si wa kutegemewa kwa benchmark hii.

GPT‑5.6 Sol pia inaonyesha maboresho mapana katika utafiti wa kisayansi. Kwenye tathmini za sayansi za uhai, GPT‑5.6 inaonyesha maboresho ya Pareto ikilinganishwa na GPT‑5.5 katika biolojia ya mazingira halisi, taratibu za kazi za utafiti wa sayansi za uhai, na kemia.

GeneBench Pro: Uchanganuzi wa genomiki wa upeo mrefu na biolojia ya kiasi; GPT‑5.6 hupata matokeo bora zaidi kwa tokeni chache na muda mfupi zaidi. Claude Fable 5 haijajumuishwa kwa kuwa haijibu(fungua katika dirisha jipya) maswali ya kina ya biolojia na hukataa maswali mengi katika tathmini hii.

GPT‑5.6 huongeza kasi ya OpenAI

GPT‑5.6 ni muundo wetu wenye nguvu zaidi hadi sasa wa kuharakisha utafiti wa AI. Ndani ya OpenAI, watafiti huitumia katika mzunguko wote wa uendelezaji: kubaini hitilafu, kuboresha mifumo ya mafunzo, kuendesha majaribio, na kufasiri matokeo. Tayari tuliona kasi hiyo na utumiaji mkubwa zaidi wakati wa kipindi cha majaribio ya ndani ya GPT‑5.6, kwani wastani wa tokeni za matokeo za kila siku kwa kila mtafiti hai ulikuwa zaidi ya mara mbili ya kiwango cha juu kabisa kilichozingatiwa kwa GPT‑5.5.

Njia hii ya kufanya kazi inazidi kuwa ya kawaida haraka. Katika kipindi cha miezi sita iliyopita, sehemu ya ukokotoaji wa utafiti iliyotengwa kwa uundaji wa uandishi wa misimbo wa ndani iliongezeka mara 100, huku matumizi ya tokeni za kiwakala za ndani yakiongezeka kwa takriban mara 22. Vipimo hivi vya matumizi havipimi maendeleo ya utafiti vyenyewe, lakini vinaonyesha jinsi usaidizi wa AI unavyoongezeka kwa kasi kwa ajili ya utafiti na katika timu nyingine kama vile mauzo, masoko, shughuli za watumiaji, fedha, na nyinginezo.

Ili kupima uwezo huu moja kwa moja, tulitengeneza seti ya ndani ya tathmini kulingana na majukumu halisi ya utafiti wa AI, ikijumuisha kutatua hitilafu katika mifumo ya utafiti, kuboresha keneli na taratibu za mafunzo, kuendesha majaribio ya ujifunzaji wa mashine, na kuboresha muundo mwingine.

Uwezo wa jumla wa RSI: Kwenye kifurushi cha tathmini zinazopima maendeleo kuelekea kujiboresha kwa kujirudia, tunaona GPT‑5.6 Sol ikiwa uboreshaji wa pointi 16.2 ikilinganishwa na GPT‑5.5, ikiharakisha utafiti wa ndani katika nyanja zote.

Kukuza usalama na ulinzi sambamba na uwezo 

Kadiri uwezo wa muundo unavyoongezeka, tunaimarisha mfumo wetu wa usalama ili kiwango cha ufikiri cha hali ya juu kiendelee kuwa na manufaa kwa wengi huku tukitumia uchunguzi wa kina zaidi kwa matumizi yenye hatari za kiwango cha juu zaidi. Kwa GPT‑5.6, tuliunda mfumo wetu wa usalama ulio madhubuti zaidi hadi sasa, uliorekebishwa kulingana na uwezo wa kila muundo na unaoendeshwa na rasilimali nyingi zaidi za ukokotoaji kuliko wakati mwingine wowote.

Miundo ya GPT‑5.6 ina uwezo zaidi kuliko miundo yetu ya awali katika biolojia na usalama wa mtandao, lakini haivuki kizingiti cha Muhimu katika kategoria yoyote kati ya hizo mbili. Katika usalama wa mtandao, majaribio yetu yanaonyesha kuwa GPT‑5.6 ni bora zaidi katika kugundua na kurekebisha udhaifu wa kiusalama kuliko kutekeleza kwa kutegemewa mashambulizi ya kujitegemea, ya mwanzo hadi mwisho dhidi ya malengo yaliyoimarishwa kiusalama — hali inayowapa walinzi wa mifumo fursa ya kuimarisha mifumo kabla udhaifu haujatumiwa vibaya. Katika biolojia, majaribio yetu yanaonyesha kuwa GPT‑5.6 inaweza kusaidia utafiti halali lakini haitoi uwezo kamili kuanzia mwanzo hadi mwisho unaohitajika kuunda, kuhandisi, au kusanisi tishio jipya lenye hatari kubwa sana.

Sekta zote mbili kwa asili zina matumizi mawili. Katika usalama wa kimtandao, uwezo uleule unaoweza kumsaidia mshambuliaji kutumia udhaifu unaweza kumsaidia mlinzi kuugundua, kuiga, na kutengeneza suluhisho la kuaminika. Kwa hivyo, kuzuia kupita kiasi huleta hatari yake yenyewe ya usalama. Inaweza kuwazuia watetezi kujaribu mifumo na kusambaza marekebisho huku wahalifu wakiendelea kutumia miundo mingine, ikiwemo miundo ya chanzo huria yenye uwezo unaoongezeka, pamoja na zana zilizojulikana. Hatua madhubuti za ulinzi huzingatia muktadha na athari zinazoweza kutokea za ombi, zikiendelea kuhifadhi kazi halali ya ulinzi huku zikitumia vidhibiti vikali zaidi pale ambapo ushahidi unaonyesha hatari kubwa ya madhara.

Hatua za ulinzi za GPT‑5.6 zimepangwa kwa matabaka ili kuongeza usahihi na urudufu, na zimeundwa kubadilika haraka mashambulizi mapya yanapoibuka. Hatua za ulinzi zilizofunzwa ndani ya muundo hufanya kazi pamoja na ukaguzi wa wakati halisi, ufuatiliaji endelevu, na utekelezaji katika kiwango cha akaunti, ili kusaidia mfumo kubaki salama hata wakati safu fulani haifanyi kazi kama ilivyokusudiwa. Katika mifumo mingi, alama za viainishaji pekee ndizo huamua nini kuzuiwa, zikitegemea miundo yenye kiwango cha ufikiri cha chini ambayo ni vigumu zaidi kuibadilisha ili kuzuia madhara. Mbinu yetu huongeza kichunguzi cha uwazaji kinachokagua mazungumzo ili kubaini kama kuna uwezekano wa madhara. Muundo huu unakusudiwa kuwezesha kazi za ulinzi huku ukizuia matumizi mabaya makubwa, ambapo uwezo nyeti zaidi umetengwa kwa watumiaji waliothibitishwa kupitia Trusted Access. Kwa sababu baadhi ya mbinu za ulinzi hutumia uwazaji wakati wa majaribio, tunaweza kuzisasisha kwa haraka ili kuziba mapengo bila kufunza upya viainishaji kuanzia mwanzo.

Tunachukua mbinu ya tahadhari zaidi tunapoendelea kuimarisha mfumo dhidi ya mashambulizi yanayojibadilisha. Ikilinganishwa na miundo ya awali, GPT‑5.6 Sol cyber yetu huzuia takribani mara kumi zaidi shughuli zinazoweza kusababisha madhara. Kwa kuwa hatua hizi zinaweza kusababisha msuguano kwa matumizi yasiyo na madhara, tunatoa chaguo katika ChatGPT na Codex la kujaribu tena madokezo kwa urahisi kwenye muundo wenye uwezo wa chini, na tutaendelea kupunguza athari za ulinzi wetu kwa matumizi yasiyo na madhara huku tukidumisha kiwango cha juu cha uthabiti. Hili linaakisi mbinu yetu ya usambazaji wa hatua kwa hatua: kuanza kwa tahadhari na kuboresha kulingana na tunachojifunza kutokana na matumizi halisi.

Kabla ya upatikanaji wa jumla, tuliendesha tathmini zetu kali zaidi za usalama kufikia sasa, ikijumuisha jaribio la kubaini udhaifu wa mfumo la kina, majaribio madhubuti ya uwezo na hatua za ulinzi kwa kushirikiana na wataalamu wa nje, na takriban saa 700,000 zinazolingana na GPU ya NVIDIA A100 Tensor Core za jaribio la kubaini udhaifu wa mfumo otomatiki kwa njia ya black-box. Hii ilituwezesha kuchunguza kwa utaratibu maeneo yanayoweza kuwa dhaifu, kuibua uharibifu wa mfumo (jailbreak), na kutusaidia kuimarisha mfumo kabla ya uzinduzi.

Hakuna kitu kama usalama kamili, na kazi yetu ya kuhakikisha usalama wa miundo inayozidi kuwa na uwezo inaendelea. Udhaifu mpya utagunduliwa, pamoja na ubadilishaji upya wa mfumo utakaozuia hatua za ulinzi zilizopo. Kila kizazi kipya cha muundo pia kitafungua njia mpya za mashambulizi na matumizi mabaya. Tunaunda kwa kuzingatia uhalisia huo kupitia ulinzi wa kina, ufuatiliaji endelevu, urekebishaji wa haraka, na ushirikiano katika jumuiya ya ulinzi. Kwa GPT‑5.6, tumeoanisha usalama wetu uliopo(fungua katika dirisha jipya) na Mipango yetu ya Watafiti wa Usalama waa biolojia na mchakato mpya wa kurekebisha kwa haraka pamoja na juhudi zetu imara zaidi za ufuatiliaji kufikia sasa. Matokeo kutoka kwa watafiti, ufuatiliaji, na matumizi mabaya katika hali halisi yatachangia tathmini mpya na hatua thabiti zaidi kila mara.

Upatikanaji na uwekaji bei

GPT‑5.6 inajumuisha viwango vitatu vya miundo: Sol, muundo wetu mkuu; Terra, muundo wa gharama ya chini wenye utendaji unaoshindana na GPT‑5.5; na Luna, muundo wetu wenye kasi zaidi na wa bei nafuu zaidi. Nambari hubainisha kizazi, ilhali Sol, Terra, na Luna ni viwango thabiti vya uwezo vinavyoweza kusonga mbele kwa kasi yake vyenyewe.

GPT‑5.6 inapatikana kuanzia leo kwenye ChatGPT, Codex, na API ya OpenAI. Uzinduzi unaanza duniani kote sasa na utaendelea hatua kwa hatua hadi upatikanaji kamili katika saa 24 zijazo.

  • Chat: Watumiaji wa Plus, Pro, Business, na Enterprise wanaweza kufikia GPT‑5.6 Sol kupitia mipangilio ya juhudi ya wastani na ya juu zaidi. Watumiaji wa Pro na Enterprise pia wanaweza kuchagua GPT‑5.6 Sol Pro kwa matokeo ya ubora wa juu zaidi kwenye majukumu changamano.
  • ChatGPT Work na Codex: Watumiaji wa Free na Go wanaweza kufikia GPT‑5.6 Terra. Watumiaji wa Plus, Pro, Business na Enterprise wanaweza kuchagua kati ya GPT‑5.6 Sol, Terra, na Luna, na kuweka kiwango cha juhudi kwa kila moja. max inapatikana kwa watumiaji wote walio na ufikiaji wa GPT‑5.6 katika ChatGPT Work na Codex, na inaweza kuwashwa kwenye mipangilio. Katika ChatGPT Work, ultra inapatikana kwa watumiaji wa Pro na Enterprise. Katika Codex, inapatikana kwa mipango ya Plus na ya juu zaidi.
  • API: Wasanidi programu wanaweza kufikia Sol, Terra, na Luna kupitia OpenAI API. Katika Responses API, Uwezo wa Kuingiliana na Zana za Nje kwa njia ya Kiprogramu huwezesha GPT‑5.6 kuandika na kuendesha programu kwenye kumbukumbu ambazo huratibu zana na kuchakata matokeo ya kati, na kuifanya iwe na ulinganifu na Hakuna Kuhifadhi Data (ZDR). Multi-agent, inayopatikana awali katika beta, huiruhusu GPT‑5.6 kuendesha mawakala wadogo kwa wakati mmoja na kuunganisha kazi yao katika ombi moja.

GPT‑5.6 ina bei kwa kila tokeni milioni 1 katika saizi tatu za mifano: Sol ni $5 kwa pembejeo / $30 kwa matokeo; Terra ni $2.50 kwa pembejeo / $15 kwa matokeo; na Luna ni $1 kwa pembejeo / $6 kwa matokeo. GPT‑5.6 pia inaleta uhifadhi wa dokeza kwenye kache unaoweza kutabirika zaidi, ikijumuisha usaidizi wa vituo bayana vya kukatiza kache(fungua katika dirisha jipya) na muda wa chini wa kudumu kwa kache wa dakika 30. Kwa GPT‑5.6 na miundo ya baadaye, uandishi kwenye akiba hutozwa kwa mara 1.25 ya kiwango cha ingizo lisilowekwa kwenye akiba cha muundo, huku usomaji kutoka kwenye akiba ukiendelea kupata punguzo la 90% la ingizo lililowekwa kwenye akiba.

7, 8

Mtaalamu

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Toleo Tangulizi la Gemini 3.1 ProGemini 3.5 Flash
Mtihani wa Mwisho wa Mawakala52.7%50.4%50.3%46.9%40.5%45.2%32.1%
GDPval-AA v21,747.8 Elo1,593 Elo1,591.8 Elo1,493.7 Elo1,759.6 Elo1,600.1 Elo962.3 Elo1,348.8 Elo
Majukumu ya Ushauri wa Usimamizi (Ya Ndani)43.2%37.2%35.4%31.3%35.5%31.6%13.2%
Big Finance Bench53%51%36%49%44%
Kielezo cha Kielelezo cha Kiwango cha ufikiri cha Uchambuzi Unde v4.158.9 Alama ya kielezo55 Alama ya kielezo51.2 Alama ya kielezo54.8 Alama ya kielezo59.9 Alama ya kielezo55.7 Alama ya kielezo46.5 Alama ya kielezo50.2 Alama ya kielezo

Uandishi wa msimbo

EvalGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Toleo Tangulizi la Claude MythosClaude Fable 5Claude Opus 4.8Toleo Tangulizi la Gemini 3.1 Pro
Kiolezo cha Wakala wa Uandishi wa Misimbo wa Uchambuzi Unde v1.180 Alama ya kiolezo77.4 Alama ya kiolezo74.6 Alama ya kiolezo76.4 Alama ya kiolezo77.2 Alama ya kiolezo72.5 Alama ya kiolezo42.7 Alama ya kiolezo
SWE-Bench Pro64.6%63.4%62.7%59.4%80.3%77.8%80%69.2%54.2%
DeepSWE v1.172.7%69.6%67.2%67%69.7%59%11.8%
Terminal-Bench 2.188.8%91.9%87.4%84.7%85.6%88%83.1%78.9%70.7%

Usalama

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5GPT‑5.4Claude Opus 4.8Claude Mythos 5Toleo Tangulizi la Claude Mythos
Healthbench Professional60.5%57.7%55.7%51.8%48.1%52.6%66%64.7%

Matumizi ya kompyuta

EvalGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Onyesho Tangulizi la Claude MythosClaude Opus 4.8Onyesho Tangulizi la Gemini 3.1 Pro
OSWorld 2.062.6%50.2%45.6%47.5%54.8%
BrowseComp90.4%92.2%87.5%83.3%84.4%88%87.9%84.3%85.9%
BenchCAD70.6%62.3%63.1%44.4%38.4%35.5%27.3%
BenchCAD (zana ya Python)83.4%78.2%73.9%55.8%65%61%51.8%

Usalama wa Mtandao

EvalGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Toleo Tangulizi la Claude MythosClaude Opus 4.8
Changamoto za Shindano la Capture-the-Flag96.7%91.8%85.2%88.1%
SEC-Bench Pro71.2%74.3%57.7%48.9%45.8%
ExploitBench73.5%52.9%33.2%47.9%78%74.2%40%
ExploitGym33.7%23.2%12.4%15.1%

Kujiboresha

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5
Tathmini ya Utatuzi wa Hitilafu katika Utafiti wa Ndani68.3%67.8%50.8%50%
KernelGen 1P61.1%49.2%22.4%29.3%
NanoGPT9.69%14.5%1.66%2.65%
PostTrainBench Lite50.3%51.5%29.6%38.8%
Kipimo cha RSI57.9%56.3%41.9%41.7%

Multimodal

TathminiGPT‑5.6 SuluhishoGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview
MMMU Pro (bila zana)83%80.7%78.4%81.2%80.5%
MMMU Pro (kwa zana)84.6%82%79.5%83.2%
gdp.pdf30.7%24.7%22.7%26%29.8%22.5%16.7%

Kitaaluma

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Toleo Tangulizi la Claude MythosClaude Fable 5Claude Opus 4.8Toleo Tangulizi la Gemini 3.1 Pro
GPQA Diamond94.6%92.9%92.3%93.6%94.1%94.6%92.6%92%94.3%
FrontierMath Kiwango 1-3 (v2)89%84.9%78.6%85.3%87%80%59.6%
FrontierMath Kiwango 4 (v2)83%68.3%58.5%72.5%87.8%56.1%

Matumizi ya zana

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro PreviewGemini 3.5 Flash
AutomationBench18.1%15.2%14.9%12.9%17.4%15.5%14.5%
Toolathlon58%53.1%53.4%55.6%61.7%61.1%61.7%59.9%48.8%

Muktadha mrefu

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Toleo Tangulizi la Claude MythosClaude Opus 4.8
OpenAI MRCR v2 8-needle 256K-512K91.5%89.6%41.3%81.5%
OpenAI MRCR v2 8-needle 512K-1M73.8%72.5%41.3%74%
GraphWalks BFS 256k f190.7%76.9%81.3%73.7%91.1%85.7%85.9%
GraphWalks BFS 1mil f177.1%71.2%51.2%45.4%79.4%74.3%68.1%

Uwazaji wa dhana

EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Opus 4.8Toleo Tangulizi la Gemini 3.1 Pro
ARC-AGI-3⁷7.78%0.8%0.18%0.43%1.5%0.42%

Mwandishi

OpenAI

Tanbihi

  1. 1

    Uwezo wa kimtandao hutathminiwa huku hatua za ulinzi zikiwa zimepunguzwa. Watumiaji wanaweza kujiunga na mpango wa Trusted Access for Cyber wa OpenAI Daybreak ili kupata ufikiaji zaidi wa uwezo wa ulinzi wa mtandao.

  2. 2

    Miundo yote hutathminiwa kwa kutumia mazingira ya uendeshaji ya API ya ExploitBench yenye mbegu 5 na mwendelezo wa uwazaji.

  3. 3

    Tuliendesha ExploitGym kwenye API yetu ya alpha, ambayo hutoa majibu kwa kasi zaidi kuliko API yetu ya umma, kisha tukarekebisha vipimo ili vilingane na API yetu ya umma. Wakati wa kubadilisha kipimo cha muda wa ucheleweshaji kwa kasi zinazotarajiwa kwa API yetu ya umma, hili husababisha baadhi ya muda wa ucheleweshaji uliokadiriwa kuzidi vikomo vya muda vya saa mbili na sita, licha ya kwamba vilizingatiwa kwa usahihi katika utekelezaji wa tathmini. Ili kupata kasi ya juu zaidi kwa kazi zinazohitaji kushughulikiwa haraka, tunatoa uchakataji wa kipaumbele katika API na hali ya haraka katika Codex.

  4. 4

    Tunakadiria ucheleweshaji na gharama ya API kwa kuchunguza tabia ya uzalishaji ya miundo yetu na kufanya uigaji nje ya mtandao. Makadirio haya yanajumuisha maelezo ya miito ya zana, tokeni zilizochaguliwa kwa sampuli, na tokeni za ingizo. Matokeo ya ulimwengu halisi yanaweza kutofautiana sana, na yanategemea mambo mengi ambayo hayajazingatiwa katika uigaji wetu. Tunaiga muda wa kuchelewa kwa kasi za API za haraka, na gharama kwa bei za kawaida za API.

  5. 5

    Miundo isiyo na tokeni za matokeo, ucheleweshaji au gharama zilizoripotiwa huonyeshwa kama mistari mlalo ya nukta.

  6. 6

    Kwa mawakala wengi, ucheleweshaji unatokana na wakala msingi, ilhali jumla za tokeni za matokeo na gharama za API hujumuisha tokeni zote. Ultra inaendeshwa kwa kutumia mawakala 4.

  7. 7

    Tunakokotoa alama kwa kutumia mbinu rasmi ya utoaji alama iliyoelezwa katika makala ya HealthBench Professional, ambayo haiwezi kulinganishwa na matokeo yaliyoripotiwa katika kasi ya mfumo za Anthropic.

  8. 8

    ARC-AGI-3 kwa Opus 4.8 iliendeshwa kwa juhudi za uwazaji za juu na si za kiwango cha juu kabisa, kwa kuwa hili ndilo tokeo pekee la ARC-AGI-3 lililochapishwa.