Ruka hadi kwenye maudhui kuu
OpenAI

26 Juni 2026

ProductToa

Onyesho la awali la GPT‑5.6 Sol: muundo wa kizazi kijacho

Inapakia…

Tunaanza onyesho la awali lenye mipaka la mfululizo wa GPT‑5.6: Sol, muundo wetu mkuu; Terra, muundo uliosawazika kwa kazi za kila siku; na Luna, muundo wa haraka na nafuu. Terra ina utendaji unaoshindana na GPT‑5.5 huku ikiwa nafuu mara 2, na Luna inaleta uwezo thabiti kwa gharama yetu ya chini kabisa.

GPT‑5.6 Sol inazinduliwa ikiwa na rundo letu thabiti zaidi la usalama hadi sasa. Tuliimarisha ulinzi kwa shughuli zenye hatari kubwa zaidi, maombi nyeti ya mtandao, na matumizi mabaya ya mara kwa mara, na tukatumia wiki kadhaa kutafuta udhaifu, kuujaribu mfumo wetu kwa shinikizo, na kuuimarisha dhidi ya mashambulizi ya ulimwengu halisi.

Tunaamini katika ufikiaji mpana, na tunapanga kufanya GPT‑5.6 Sol, Terra, na Luna zipatikane kwa ujumla katika wiki zijazo. Kama sehemu ya ushirikiano wetu unaoendelea na serikali ya Marekani, tuliwasilisha mapema mipango yetu na uwezo wa miundo kabla ya uzinduzi wa leo. Kwa ombi lao, tunaanza na onyesho la awali lenye mipaka kwa kundi dogo la washirika wanaoaminika ambao ushiriki wao umeshirikiwa na serikali, kabla ya kutoa kwa upana zaidi. Katika kipindi hiki cha onyesho la awali, tutaendelea kupima na kuratibu kwa karibu na washirika tunapofanya kazi kuelekea upatikanaji mpana zaidi. Hatuamini kwamba mchakato wa aina hii wa ufikiaji wa serikali unapaswa kuwa chaguo-msingi la muda mrefu. Huzuia zana bora zaidi kuwafikia watumiaji, wasanidi, mashirika, walinzi wa mtandao, na washirika wa kimataifa wanaozihitaji. Tunachukua hatua hii ya muda mfupi kwa sababu tunaamini ndiyo njia imara zaidi ya kufikia upatikanaji mpana zaidi katika wiki zijazo, huku tukifanya kazi na Utawala kuunda mfumo wa Amri ya Utendaji ya mtandao na mchakato unaoweza kurudiwa kwa matoleo ya miundo ya baadaye.

Uwezo

GPT‑5.6 Sol ndiyo muundo wetu imara zaidi hadi sasa. Ili kutoa muhtasari wa utendaji wa muundo, tunashiriki seti ya tathmini zinazoonyesha uwezo bora wa kiwakala katika usimbaji, biolojia, na usalama wa mtandao, huku tathmini za ziada za usalama na maandalizi zikipatikana katika kasi ya mfumo(fungua katika dirisha jipya) yetu. Tutashiriki mkusanyiko uliopanuliwa wa matokeo ya tathmini tutakapofanya muundo upatikane kwa upana.

Kwa GPT‑5.6, tunaanzisha juhudi mpya ya uwazaji ya `max` ili kuipa Sol muda mwingi zaidi wa kuwaza kwa kina. Aidha, tunaanzisha hali mpya ya `ultra` inayopita uwezo wa wakala mmoja kwa kutumia mawakala wadogo kuharakisha kazi tata.

Kwa mitiririko ya kazi ya usimbaji, GPT‑5.6 Sol inaweka kiwango kipya cha juu kwenye Terminal‑Bench 2.1, inayopima mitiririko ya kazi ya mstari wa amri inayohitaji kupanga, kurudia, na uratibu wa zana.

GPT‑5.6 Sol pia inaonyesha maboresho mapana katika mitiririko ya kazi ya biolojia. Kwenye GeneBench v1, inayotathmini uchanganuzi wa muda mrefu wa jenomiki na biolojia ya kiasi, hupata matokeo imara zaidi kuliko GPT‑5.5 huku ikitumia tokeni chache.

GPT‑5.6 Sol ndiyo muundo wetu wenye uwezo zaidi hadi sasa kwa usalama wa mtandao. Inasogeza mpaka wa utendaji na ufanisi kwa kazi za usalama za muda mrefu, ikiwemo utafiti wa udhaifu na unyonyaji. Kwenye ExploitBench², GPT‑5.6 Sol inashindana na Mythos Preview kwa kutumia tu takriban 1/3 ya tokeni za matokeo. Kwenye ExploitGym(fungua katika dirisha jipya)3, kipimo kilichoundwa na watafiti wa UC Berkeley kwa ushirikiano na OpenAI na maabara nyingine za mipaka, miundo ya GPT‑5.6 Sol, Terra, na Luna yote inaonyesha maboresho makubwa katika uwezo wa mtandao tunapoongeza uwazaji.

Uwezo imara zaidi wa mtandao ukiwa na ulinzi imara zaidi

Tulitengeneza GPT‑5.6 Sol, Terra na Luna zikiwa na ulinzi wetu thabiti zaidi hadi sasa, na usanidi unaolinganishwa na uwezo wa kila muundo. Kadiri muundo unavyokuwa na uwezo zaidi, tunabuni ulinzi unaoweza kustahimili zaidi shinikizo la wapinzani wa ulimwengu halisi huku tukihifadhi ufikiaji wa kazi halali kama ukaguzi wa msimbo, utafiti wa udhaifu, uundaji wa viraka, utatuzi, elimu ya usalama, na majaribio ya kujilinda. Lengo letu ni kufanya shughuli za kushambulia zilizopigwa marufuku ziwe ngumu zaidi, zisizo na uhakika, na zinazotambulika bila kuweka mipaka isiyo ya lazima kwa matumizi hayo yenye manufaa. Kulingana na tathmini yetu ya muundo na ulinzi, tunatarajia manufaa makubwa kwa kazi halali za kujilinda, huku tukizuia kwa kiwango kikubwa matumizi ya kushambulia yaliyopigwa marufuku.

GPT‑5.6 Sol ni bora zaidi katika kuwasaidia watu kupata na kurekebisha udhaifu kuliko kutekeleza mashambulizi ya mwanzo hadi mwisho kwa kutegemewa. Kadiri uwezo huu unavyoendelea kusonga mbele, kipaumbele chetu ni kuhakikisha unawafikia na kuwanufaisha walinzi, wanaoweza kutumia zana hizi kupata udhaifu, kuunda viraka, na kuimarisha mifumo kwa upana zaidi.

GPT‑5.6 Sol haivuki kizingiti cha Cyber Critical chini ya Preparedness Framework yetu. Katika tathmini zilizohusisha Chromium na Firefox, ilitambua hitilafu na vipengele vya msingi vya unyonyaji—vijenzi vya exploit—lakini haikuzalisha kwa uhuru exploit kamili inayofanya kazi kutoka mwanzo hadi mwisho chini ya masharti yaliyopimwa. Hata hivyo, vizingiti vya vipimo haviwezi kunasa kila njia ambayo muundo unaweza kutumiwa au kuunganishwa na zana nyingine. Kutokuwa na uhakika huko, pamoja na ongezeko pana la uwezo wa muundo, ndiko kunakotufanya tuunganishe uwezo ulioongezeka wa muundo na ulinzi imara zaidi na utoaji wa hatua kwa hatua. Tunashiriki maelezo zaidi kuhusu ulinzi wetu katika kasi ya mfumo ya Onyesho la Awali la GPT‑5.6(fungua katika dirisha jipya).

Rundo la ulinzi la tabaka nyingi

Hakuna ulinzi mmoja unaotosha dhidi ya matumizi mabaya ya kudhamiria au yanayobadilika. Katika onyesho la awali la GPT‑5.6, tunatumia ulinzi wa tabaka nyingi, huku usanidi mahususi ukitofautiana kati ya miundo, na tunaujaribu kwa shinikizo dhidi ya mashambulizi ya ulimwengu halisi. Hii inajumuisha ulinzi uliofunzwa ndani ya muundo, ukaguzi wa wakati halisi wakati wa uzalishaji, ishara za kiwango cha akaunti, ufikiaji uliotofautishwa, ufuatiliaji, utekelezaji, na majaribio yanayoendelea.

GPT‑5.6 imefunzwa kukataa usaidizi wa mtandao uliopigwa marufuku, ikiwemo wakati watumiaji wanapojaribu kuficha nia yao au kufanya jailbreak ya muundo. Ulinzi huu wa kiwango cha muundo huweka mpaka wa kwanza kuhusu mambo ambayo muundo unapaswa kusaidia nayo na yale usiyopaswa kusaidia nayo.

Vichujio vya matumizi mabaya ya mtandao na biolojia vya wakati halisi hutoa tabaka jingine kwa kutathmini matokeo yanapozalishwa. Kwa visa vya hatari kubwa zaidi, vikigundua ukiukaji unaowezekana, uzalishaji unaweza kusitishwa kwa muda huku muundo mkubwa wa uwazaji ukipitia mazungumzo na muktadha wake. Ikiwa matokeo yatatathminiwa kuwa hayaruhusiwi, yanazuiwa kabla ya kumfikia mtumiaji.

Shughuli iliyotiwa alama pia inaweza kusababisha ukaguzi wa kiwango cha akaunti katika mazungumzo husika na ishara za hatari, kulingana na masharti na sera zetu kuhusu uhifadhi na ukaguzi wa maudhui. Kuangalia zaidi ya mazungumzo moja husaidia mifumo yetu kutofautisha tabia ovu inayoendelea na kazi halali ya usalama yenye matumizi mawili, ambapo dhana sawa za kiufundi zinaweza kuonekana katika miktadha tofauti sana.

Kwa pamoja, tabaka hizi hufanya mkabala wa jumla uwe thabiti zaidi kuliko ulinzi wowote mmoja peke yake. Tabia ya muundo hupunguza uwezekano wa majibu hatari, mifumo ya wakati halisi inaweza kuingilia wakati wa uzalishaji, ukaguzi wa kiwango cha akaunti unaweza kutambua mifumo mipana, na ufikiaji uliotofautishwa huhifadhi kazi muhimu ya kujilinda bila kufanya uwezo nyeti zaidi upatikane kwa upana kwa chaguo-msingi.

Hasa wakati wa onyesho la awali, watumiaji wanaweza kukumbana na ulinzi unaozuia au kukataa baadhi ya maombi. Maombi mengine yanaweza kuchukua muda mrefu zaidi kwa sababu uzalishaji unasitishwa kwa muda kwa ukaguzi wa ziada. Ulinzi unaweza kuingilia mara kwa mara kazi halali, hasa katika maeneo ya matumizi mawili ambapo shughuli za kujilinda na kushambulia zinaweza kuonekana kufanana mwanzoni.

Hilo ni sehemu ya mambo ambayo onyesho la awali limeundwa kupima. Tunataka kuelewa si tu kama ulinzi unazuia matumizi mabaya, bali pia kama watumiaji halali bado wanaweza kukamilisha kazi za kawaida kwa kutegemewa na kwa ufanisi. Maoni wakati wa onyesho la awali yatatusaidia kupunguza vizuizi na ucheleweshaji usio wa lazima, kuboresha jinsi ulinzi unavyotafsiri muktadha, na kuunda matumizi laini zaidi kabla ya utoaji mpana.

Pia tunafanya kazi na wateja wa mashirika kuhusu mbinu za muda mrefu—ikiwemo ugunduzi unaolinda faragha, vidhibiti vya usalama vinavyoendeshwa na mteja, na ufikiaji uliopimwa kulingana na hatari ya mteja, mtumiaji, au mzigo wa kazi—ili kuendeleza usalama huku tukisaidia mahitaji ya faragha ya mashirika.

Kuboresha uthabiti kwa red-teaming ya kiotomatiki

Ulinzi pia unahitaji kuendelea kuwa na ufanisi washambuliaji wanapobadilisha mbinu zao. Ulinzi unaofanya kazi tu kwenye seti isiyobadilika ya mashambulizi yanayojulikana hautoshi kwa muundo wa mipaka.

Ndiyo sababu tunatumia akili na kompyuta zaidi kuliko hapo awali katika usalama, tukitumia miundo yetu wenyewe kupata udhaifu na kuboresha ulinzi kwa kasi zaidi. Tulitoa zaidi ya saa 700,000 za GPU sawa na A100 kwa red-teaming ya kiotomatiki iliyolenga kupata jailbreak za jumla: mashambulizi yanayoweza kufanya kazi katika dokeza au miktadha mingi, si katika mazingira finyu pekee. Kuzingatia mashambulizi haya magumu zaidi na ya jumla zaidi kulitusaidia kupima ulinzi zaidi ya seti isiyobadilika ya kasoro zinazojulikana. Pia hutuwezesha kuchunguza mifumo mingi zaidi ya mashambulizi kuliko ambavyo majaribio ya binadamu pekee yangeweza kushughulikia, kutambua mifumo ya kufeli mapema, na kufupisha njia kutoka kugundua udhaifu hadi kuushughulikia.

Mbali na red-teaming ya kiotomatiki, tulifanya kazi na wapimaji wa nje kufanya red-teaming pana ya wataalamu binadamu, ambayo itaendelea katika kipindi cha onyesho la awali. Red-teaming ya binadamu hukamilisha kazi ya kiotomatiki kwa kupima ulinzi dhidi ya wataalamu wabunifu wanaojaribu kutumia muundo vibaya kwa njia ambazo mifumo yetu huenda haitarajii.

Hakuna tathmini inayoweza kuwakilisha kila usanidi wa bidhaa, shambulio la hatua nyingi, au mtiririko wa kazi wa ulimwengu halisi. Kwa hiyo tunaendeleza mchakato wa majibu ya haraka ili kurudia, kutathmini, kupanga vipaumbele, na kurekebisha jailbreak mpya zilizogunduliwa, kisha kuziongeza kwenye tathmini zetu zinazoendelea ili tuweze kupima dhidi ya kasoro zinazofanana baadaye.

Upatikanaji na bei

Wakati wa onyesho la awali, miundo ya GPT‑5.6 itapatikana mwanzoni kupitia API na Codex kwa kundi teule la washirika na mashirika yanayoaminika. Tunapanga kuifanya ipatikane kwa watu wengi zaidi wanaotumia ChatGPT, Codex, na API hivi karibuni.

Katika mfumo huu mpya wa majina ulioanzishwa na GPT‑5.6, nambari hutambua kizazi cha muundo, huku Sol, Terra, na Luna zikitambua viwango vya kudumu vya uwezo vinavyoweza kusonga mbele kwa ratiba zao wenyewe. Kwa pamoja, familia hii huwapa watu na wasanidi chaguo zilizo wazi zaidi kuhusu akili, kasi, na gharama.

Bei ya GPT‑5.6 ni kwa kila tokeni milioni 1 katika ukubwa mitatu ya muundo: Sol ni $5 kwa ingizo / $30 kwa matokeo; Terra ni $2.50 kwa ingizo / $15 kwa matokeo; na Luna ni $1 kwa ingizo / $6 kwa matokeo. GPT‑5.6 pia inaleta uhifadhi wa muda wa dokeza unaotabirika zaidi, ikiwemo usaidizi wa sehemu bayana za kukatiza kache na muda wa chini wa kache wa dakika 30. Kwa GPT‑5.6 na miundo ya baadaye, uandishi wa kache hutozwa mara 1.25 ya kiwango cha ingizo lisilokachewa la muundo, huku usomaji wa kache ukiendelea kupata punguzo la 90% la ingizo lililokachewa.

Pia tunazindua GPT‑5.6 Sol kwenye Cerebras kwa hadi tokeni 750 kwa sekunde mwezi Julai, tukiwaletea wateja akili ya mipaka kwa kasi isiyo na kifani. Mwanzoni ufikiaji utakuwa kwa wateja teule pekee tunapopanua uwezo.

Tunafurahi kuendelea kujifunza kutokana na kipindi hiki cha onyesho la awali, na kuleta GPT‑5.6 Sol, Terra na Luna kwa watu wengi zaidi hivi karibuni.


1. Tunakadiria muda wa kusubiri na gharama ya API kwa kuangalia tabia ya uzalishaji ya miundo yetu, na kuiga nje ya mtandao. Makadirio haya huzingatia maelezo ya miito ya zana, tokeni zilizochukuliwa sampuli, na tokeni za ingizo. Matokeo ya ulimwengu halisi yanaweza kutofautiana sana, na hutegemea mambo mengi ambayo hayajajumuishwa katika uigaji wetu. Tunaiga muda wa kusubiri kwa kasi za haraka za API, na gharama kwa bei ya kawaida ya API.

2. Miundo yote hutathminiwa kwa kutumia fremu ya API ya ExploitBench yenye mbegu 5 na mwendelezo wa uwazaji.

3. Tuliendesha ExploitGym kwenye API yetu ya alpha, ambayo hutoa majibu kwa kasi kuliko API yetu ya umma, kisha tukapima upya ili ilingane na API yetu ya umma. Tunapopima upya muda wa kusubiri kwa kasi zinazotarajiwa kwa API yetu ya umma, jambo hili husababisha baadhi ya makadirio ya muda wa kusubiri kuzidi vikomo vya muda vya saa 2 na saa 6, licha ya kufuatwa ipasavyo katika jaribio la tathmini. Ili kupata kasi zaidi kwa kazi zinazohitaji muda, tunatoa uchakataji wa kipaumbele katika API na hali ya haraka katika Codex.

4. Miundo isiyo na tokeni za matokeo, muda wa kusubiri au gharama zilizoripotiwa huonyeshwa kama mistari mlalo ya nukta.

Mwandishi

OpenAI