Անցնել հիմնական բովանդակությանը
OpenAI

26 հունիսի, 2026 թ.

ԱրտադրանքԹողարկում

GPT‑5.6 Sol-ի նախադիտում՝ նոր սերնդի մոդել

Բեռնվում է…

Մենք սկսում ենք GPT‑5.6 շարքի սահմանափակ նախադիտումը՝ Sol՝ մեր ֆլագմանային մոդելը, Terra՝ հավասարակշռված մոդել ամենօրյա աշխատանքի համար, և Luna՝ արագ ու մատչելի մոդել։ Terra-ն ունի GPT‑5.5‑ի հետ մրցունակ արդյունավետություն՝ լինելով 2 անգամ ավելի էժան, իսկ Luna-ն ուժեղ կարողություններ է տալիս մեր ամենացածր արժեքով։

GPT‑5.6 Sol-ը մեկնարկում է մինչ օրս մեր ամենակայուն անվտանգության շերտով։ Մենք ուժեղացրել ենք պաշտպանությունը բարձր ռիսկի գործունեության, զգայուն կիբեր հարցումների և կրկնվող չարաշահման դեմ, ինչպես նաև մի քանի շաբաթ հատկացրել ենք թույլ կողմերի որոնմանը, մեր համակարգի սթրես-թեստավորմանը և իրական հարձակումների դեմ ամրապնդմանը։

Մենք հավատում ենք լայն հասանելիությանը և նախատեսում ենք առաջիկա շաբաթներին GPT‑5.6 Sol-ը, Terra-ն և Luna-ն դարձնել ընդհանուր առմամբ հասանելի։ ԱՄՆ կառավարության հետ մեր շարունակական համագործակցության շրջանակում մենք այսօրվա գործարկումից առաջ ներկայացրել ենք մեր ծրագրերն ու մոդելների կարողությունները։ Նրանց խնդրանքով, ավելի լայն թողարկումից առաջ մենք սկսում ենք սահմանափակ նախադիտում վստահելի գործընկերների փոքր խմբի համար, որոնց մասնակցության մասին տեղեկացվել է կառավարությանը։ Այս նախադիտման ընթացքում մենք կշարունակենք փորձարկումները և սերտ համակարգումը գործընկերների հետ՝ աշխատելով ավելի լայն հասանելիության ուղղությամբ։ Մենք չենք կարծում, որ կառավարության այսպիսի հասանելիության գործընթացը պետք է դառնա երկարաժամկետ լռելյայն մոտեցում։ Այն լավագույն գործիքները հեռու է պահում օգտատերերից, մշակողներից, ձեռնարկություններից, կիբերպաշտպաններից և գլոբալ գործընկերներից, որոնք դրանց կարիքն ունեն։ Մենք անում ենք այս կարճաժամկետ քայլը, քանի որ այն համարում ենք առաջիկա շաբաթներին ավելի լայն հասանելիության ամենաուժեղ ուղին, մինչ աշխատում ենք Վարչակազմի հետ՝ մշակելու կիբեր գործադիր հրամանի շրջանակը և ապագա մոդելների թողարկումների կրկնելի գործընթացը։

Կարողություններ

GPT‑5.6 Sol-ը մինչ օրս մեր ամենաուժեղ մոդելն է։ Մոդելի արդյունավետությունը նախադիտելու համար կիսվում ենք գնահատումների հավաքածուով, որն ընդգծում է բարելավված ագենտային կարողությունները կոդավորման, կենսաբանության և կիբերանվտանգության ոլորտներում, իսկ անվտանգության և պատրաստվածության լրացուցիչ գնահատումները հասանելի են մեր համակարգի քարտում(բացվում է նոր պատուհանում)։ Մենք կկիսվենք գնահատման արդյունքների ընդլայնված փաթեթով, երբ մոդելը լայնորեն հասանելի դարձնենք։

GPT‑5.6‑ով ներկայացնում ենք նոր `max` հիմնավորման ջանք, որպեսզի Sol-ը առավելագույն ժամանակ ունենա խորությամբ հիմնավորելու համար։ Բացի այդ, ներկայացնում ենք նոր `ultra` ռեժիմ, որը ենթաագենտների օգտագործմամբ արագացնում է բարդ աշխատանքը և անցնում մեկ ագենտի կարողություններից այն կողմ։

Կոդավորման աշխատանքային հոսքերի համար GPT‑5.6 Sol-ը նոր առաջատար մակարդակ է սահմանում Terminal‑Bench 2.1-ում, որը ստուգում է հրամանի տողի աշխատանքային հոսքերը՝ պահանջելով պլանավորում, կրկնություն և գործիքների համակարգում։

GPT‑5.6 Sol-ը նաև լայն բարելավումներ է ցույց տալիս կենսաբանության աշխատանքային հոսքերում։ GeneBench v1-ում, որը գնահատում է երկարաժամկետ գենոմիկայի և քանակական կենսաբանության վերլուծությունները, այն հասնում է ավելի ուժեղ արդյունքների, քան GPT‑5.5-ը՝ օգտագործելով ավելի քիչ թոքեններ։

GPT‑5.6 Sol-ը կիբերանվտանգության համար մինչ օրս մեր ամենակարող մոդելն է։ Այն տեղաշարժում է արդյունավետության և արտադրողականության սահմանագիծը երկարաժամկետ անվտանգության առաջադրանքների համար, ներառյալ խոցելիությունների հետազոտությունը և շահագործումը։ ExploitBench²-ում GPT‑5.6 Sol-ը մրցունակ է Mythos Preview-ի հետ՝ օգտագործելով ելքային թոքենների միայն մոտ ~1/3-ը։ ExploitGym(բացվում է նոր պատուհանում)3-ում՝ UC Berkeley-ի հետազոտողների կողմից OpenAI-ի և այլ սահմանային լաբորատորիաների հետ համատեղ ստեղծված բենչմարքում, GPT‑5.6 Sol, Terra և Luna մոդելները բոլորը ցույց են տալիս կիբեր կարողությունների զգալի բարելավումներ, երբ մեծացնում ենք հիմնավորումը։

Ավելի ուժեղ կիբեր կարողություններ՝ ավելի ուժեղ պաշտպանական միջոցներով

Մենք GPT‑5.6 Sol-ը, Terra-ն և Luna-ն մշակել ենք մինչ օրս մեր ամենակայուն պաշտպանական միջոցներով՝ յուրաքանչյուր մոդելի կարողություններին համապատասխանեցված կազմաձևերով։ Քանի որ մոդելը դառնում է ավելի կարող, մենք նախագծում ենք պաշտպանական միջոցներ, որոնք ավելի լավ են դիմակայում իրական աշխարհի հակառակորդային ճնշմանը՝ միաժամանակ պահպանելով օրինական աշխատանքի հասանելիությունը, ինչպիսիք են կոդի վերանայումը, խոցելիությունների հետազոտությունը, պատչերի մշակումը, վրիպազերծումը, անվտանգության կրթությունը և պաշտպանական թեստավորումը։ Մեր նպատակն է արգելված հարձակողական գործունեությունը դարձնել ավելի դժվար, անորոշ և հայտնաբերելի՝ առանց անհարկի սահմանափակելու այդ օգտակար կիրառումները։ Մոդելի և պաշտպանական միջոցների մեր գնահատման հիման վրա ակնկալում ենք էական օգուտ օրինական պաշտպանական աշխատանքի համար՝ միաժամանակ նշանակալիորեն սահմանափակելով արգելված հարձակողական օգտագործումը։

GPT‑5.6 Sol-ը ավելի լավ է օգնում մարդկանց գտնել և շտկել խոցելիությունները, քան հուսալիորեն իրականացնել ամբողջական հարձակումներ։ Քանի որ այս կարողությունները շարունակում են զարգանալ, մեր առաջնահերթությունն է ապահովել, որ դրանք հասնեն և օգուտ տան պաշտպաններին, որոնք կարող են այս գործիքներով գտնել թույլ կողմեր, մշակել պատչեր և ավելի լայնորեն ամրապնդել համակարգերը։

GPT‑5.6 Sol-ը չի անցնում Cyber Critical շեմը մեր Preparedness Framework-ի համաձայն։ Chromium-ի և Firefox-ի հետ կապված գնահատումներում այն հայտնաբերեց վրիպակներ և շահագործման պրիմիտիվներ՝ էքսփլոյթի կառուցատարրերը, բայց թեստավորման պայմաններում ինքնավար կերպով չստեղծեց գործող ամբողջական շղթայով էքսփլոյթ։ Այնուամենայնիվ, բենչմարքի շեմերը չեն կարող ընդգրկել բոլոր եղանակները, որոնցով մոդելը կարող է օգտագործվել կամ համադրվել այլ գործիքների հետ։ Այդ անորոշությունը, ինչպես նաև մոդելի կարողությունների ավելի լայն աստիճանական թռիչքը, պատճառ են, որ մոդելի աճած կարողությունները զուգակցում ենք ավելի ուժեղ պաշտպանական միջոցների և փուլային թողարկման հետ։ Մեր պաշտպանական միջոցների մասին ավելի մանրամասն կիսվում ենք GPT‑5.6 Preview համակարգի քարտում(բացվում է նոր պատուհանում)։

Շերտավոր պաշտպանական փաթեթ

Ոչ մի առանձին պաշտպանական միջոց բավարար չէ վճռական կամ հարմարվող չարաշահման դեմ։ GPT‑5.6-ի նախադիտման ամբողջ ընթացքում մենք օգտագործում ենք շերտավոր պաշտպանական միջոցներ, որոնց ճշգրիտ կազմաձևերը տարբերվում են ըստ մոդելների, և դրանք սթրես-թեստավորում ենք իրական աշխարհի հարձակումների համար։ Դրանք ներառում են մոդելի մեջ ուսուցանված պաշտպանություններ, իրական ժամանակի ստուգումներ գեներացման ընթացքում, հաշվի մակարդակի ազդանշաններ, տարբերակված հասանելիություն, մոնիթորինգ, կիրարկում և շարունակական թեստավորում։

GPT‑5.6-ը ուսուցանված է մերժելու արգելված կիբեր օգնությունը, այդ թվում՝ երբ օգտատերերը փորձում են քողարկել իրենց մտադրությունը կամ jailbreak անել մոդելը։ Մոդելի մակարդակի այս պաշտպանական միջոցները սահմանում են առաջին սահմանը, թե ինչում մոդելը պետք է օգնի և ինչում՝ ոչ։

Իրական ժամանակի կիբեր և կենսաբանական չարաշահման դասակարգիչները տալիս են ևս մեկ շերտ՝ գնահատելով ելքը գեներացման ընթացքում։ Ավելի բարձր ռիսկի դեպքերում, եթե դրանք հայտնաբերեն հնարավոր խախտում, գեներացումը կարող է դադարեցվել, մինչ ավելի մեծ հիմնավորման մոդել վերանայում է խոսակցությունն ու դրա համատեքստը։ Եթե ելքը գնահատվում է որպես չթույլատրված, այն պահվում է մինչև օգտատիրոջը հասնելը։

Նշված գործունեությունը կարող է նաև գործարկել հաշվի մակարդակի վերանայում համապատասխան խոսակցությունների և ռիսկի ազդանշանների շրջանակում՝ բովանդակության պահպանման և վերանայման վերաբերյալ մեր պայմաններին և քաղաքականություններին համապատասխան։ Մեկ խոսակցությունից այն կողմ նայելը մեր համակարգերին օգնում է տարբերել կայուն չարամիտ վարքագիծը օրինական երկակի օգտագործման անվտանգության աշխատանքից, որտեղ նմանատիպ տեխնիկական հասկացությունները կարող են հայտնվել շատ տարբեր համատեքստերում։

Միասին այս շերտերը ամբողջ մոտեցումը դարձնում են ավելի կայուն, քան ցանկացած մեկ պաշտպանական միջոց առանձին վերցրած։ Մոդելի վարքագիծը նվազեցնում է վնասակար պատասխանների հավանականությունը, իրական ժամանակի համակարգերը կարող են միջամտել գեներացման ընթացքում, հաշվի մակարդակի վերանայումը կարող է բացահայտել ավելի լայն օրինաչափություններ, իսկ տարբերակված հասանելիությունը պահպանում է կարևոր պաշտպանական աշխատանքը՝ առանց ամենազգայուն կարողությունները լռելյայն լայնորեն հասանելի դարձնելու։

Հատկապես նախադիտման ընթացքում օգտատերերը կարող են հանդիպել պաշտպանական միջոցների, որոնք արգելափակում կամ մերժում են որոշ հարցումներ։ Այլ հարցումներ կարող են ավելի երկար տևել, քանի որ գեներացումը դադարեցվում է լրացուցիչ վերանայման համար։ Պաշտպանական միջոցները երբեմն կարող են միջամտել օրինական աշխատանքին, հատկապես երկակի օգտագործման ոլորտներում, որտեղ պաշտպանական և հարձակողական գործունեությունը սկզբում կարող է նման թվալ։

Սա այն բանի մի մասն է, ինչի փորձարկման համար նախատեսված է նախադիտումը։ Մենք ուզում ենք հասկանալ ոչ միայն՝ արդյոք պաշտպանական միջոցները սահմանափակում են չարաշահումը, այլև՝ արդյոք օրինական օգտատերերը դեռ կարող են հուսալի և արդյունավետ ավարտել սովորական աշխատանքը։ Նախադիտման ընթացքում ստացվող արձագանքները կօգնեն մեզ նվազեցնել անհարկի արգելափակումներն ու ուշացումները, բարելավել, թե ինչպես են պաշտպանական միջոցները մեկնաբանում համատեքստը, և ստեղծել ավելի հարթ փորձառություն՝ նախքան ավելի լայն թողարկումը։

Մենք նաև աշխատում ենք ձեռնարկատիրական հաճախորդների հետ ավելի երկարաժամկետ մոտեցումների վրա՝ ներառյալ գաղտնիությունը պահպանող հայտնաբերումը, հաճախորդի կողմից կառավարվող անվտանգության վերահսկիչները և հասանելիությունը՝ չափաբերված ըստ հաճախորդի, օգտատիրոջ կամ ծանրաբեռնվածության ռիսկի, որպեսզի առաջ մղենք անվտանգությունը՝ միաժամանակ աջակցելով ձեռնարկությունների գաղտնիության պահանջներին։

Կայունության բարելավում ավտոմատացված red teaming-ով

Պաշտպանական միջոցները պետք է արդյունավետ մնան նաև այն դեպքում, երբ հարձակվողները հարմարեցնում են իրենց մարտավարությունը։ Պաշտպանությունը, որն աշխատում է միայն հայտնի հարձակումների ֆիքսված հավաքածուի վրա, բավականաչափ կայուն չէ սահմանային մոդելի համար։

Այդ պատճառով մենք անվտանգության վրա կիրառում ենք ավելի շատ բանականություն և հաշվողական ռեսուրս, քան երբևէ՝ մեր սեփական մոդելներով ավելի արագ գտնելով թույլ կողմերը և բարելավելով պաշտպանական միջոցները։ Մենք ավելի քան 700,000 A100-համարժեք GPU ժամ ենք հատկացրել ավտոմատացված red teaming-ին՝ ունիվերսալ jailbreak-ներ գտնելու համար. հարձակումներ, որոնք կարող են աշխատել բազմաթիվ հարցումների կամ համատեքստերի մեջ, ոչ միայն մեկ նեղ միջավայրում։ Այս ավելի բարդ և ընդհանուր հարձակումների վրա կենտրոնանալը թույլ տվեց պաշտպանական միջոցները ստուգել հայտնի ձախողումների ֆիքսված հավաքածուից դուրս։ Դա նաև թույլ է տալիս ուսումնասիրել շատ ավելի շատ հարձակման ձևաչափեր, քան կարող էր ընդգրկել միայն մարդկանց թեստավորումը, ավելի վաղ բացահայտել ձախողման օրինաչափությունները և կրճատել ճանապարհը՝ թույլ կետը գտնելուց մինչև այն շտկելը։

Ավտոմատացված red teaming-ից բացի, մենք աշխատեցինք երրորդ կողմի թեստավորողների հետ՝ իրականացնելու լայնածավալ մարդկային փորձագիտական red teaming, որը կշարունակվի նախադիտման ընթացքում։ Մարդկային red teaming-ը լրացնում է ավտոմատացված աշխատանքը՝ պաշտպանական միջոցները փորձարկելով ստեղծագործ փորձագետների դեմ, որոնք փորձում են մոդելը չարաշահել այնպիսի եղանակներով, որոնք մեր համակարգերը կարող են չկանխատեսել։

Ոչ մի գնահատում չի կարող ներկայացնել յուրաքանչյուր արտադրանքի կազմաձև, բազմաքայլ հարձակում կամ իրական աշխարհի աշխատանքային հոսք։ Ուստի մենք պահպանում ենք արագ արձագանքման գործընթաց՝ նոր հայտնաբերված jailbreak-ները վերարտադրելու, գնահատելու, առաջնահերթացնելու և շտկելու համար, ապա ավելացնում ենք դրանք մեր շարունակական գնահատումներին, որպեսզի ապագայում ստուգենք նմանատիպ ձախողումների դեմ։

Հասանելիություն և գներ

Նախադիտման ընթացքում GPT‑5.6 մոդելները սկզբում API-ի և Codex-ի միջոցով հասանելի կլինեն վստահելի գործընկերների և կազմակերպությունների ընտրված խմբի համար։ Շուտով նախատեսում ենք դրանք ավելի լայնորեն հասանելի դարձնել ChatGPT, Codex և API օգտագործողներին։

GPT‑5.6‑ի հետ ներկայացվող անվանակոչման այս նոր համակարգում թիվը ցույց է տալիս մոդելի սերունդը, իսկ Sol-ը, Terra-ն և Luna-ն՝ կայուն կարողությունների մակարդակներ, որոնք կարող են առաջընթաց ունենալ իրենց սեփական տեմպով։ Ընդհանուր առմամբ, այս ընտանիքը մարդկանց և մշակողներին տալիս է ավելի հստակ ընտրություն՝ ըստ բանականության, արագության և արժեքի։

GPT‑5.6‑ի գինը սահմանված է 1 մլն թոքենի համար՝ երեք մոդելի չափերով. Sol՝ $5 մուտքային / $30 ելքային, Terra՝ $2.50 մուտքային / $15 ելքային, իսկ Luna՝ $1 մուտքային / $6 ելքային։ GPT‑5.6-ը նաև ներկայացնում է ավելի կանխատեսելի հարցումների քեշավորում, ներառյալ հստակ քեշի ընդհատման կետերի աջակցություն և քեշի 30 րոպե նվազագույն կյանք։ GPT‑5.6-ի և ավելի ուշ մոդելների համար քեշի գրումները գանձվում են մոդելի չքեշավորված մուտքի սակագնի 1.25x չափով, իսկ քեշի ընթերցումները շարունակում են ստանալ քեշավորված մուտքի 90% զեղչը։

Հուլիսին մենք նաև գործարկում ենք GPT‑5.6 Sol-ը Cerebras-ում՝ մինչև 750 թոքեն վայրկյանում արագությամբ՝ սահմանային բանականությունը հաճախորդներին հասցնելով աննախադեպ արագությամբ։ Սկզբում հասանելիությունը սահմանափակ կլինի ընտրված հաճախորդներով, մինչ մենք ընդլայնում ենք հզորությունը։

Ուրախ ենք շարունակել սովորել այս նախադիտման շրջանից և շուտով GPT‑5.6 Sol-ը, Terra-ն և Luna-ն հասանելի դարձնել ավելի շատ մարդկանց։


1. Մենք գնահատում ենք ուշացումը և API-ի արժեքը՝ դիտարկելով մեր մոդելների արտադրական վարքագիծը և կատարելով օֆլայն մոդելավորում։ Այս գնահատումները հաշվի են առնում գործիքների կանչերի մանրամասները, նմուշառված թոքենները և մուտքային թոքենները։ Իրական արդյունքները կարող են էապես տարբերվել և կախված են բազմաթիվ գործոններից, որոնք մեր մոդելավորումը չի ընդգրկում։ Մենք ուշացումը մոդելավորում ենք API-ի արագ արագություններով, իսկ արժեքը՝ API-ի սովորական գնագոյացմամբ։

2. Բոլոր մոդելները գնահատվում են ExploitBench API harness-ի միջոցով՝ 5 seed-ով և հիմնավորման շարունակականությամբ։

3. Մենք ExploitGym-ը գործարկել ենք մեր ալֆա API-ում, որն արձագանքներն ավելի արագ է թողարկում, քան մեր հանրային API-ն, ապա վերամասշտաբավորել ենք՝ հանրային API-ին համապատասխանեցնելու համար։ Երբ ուշացումները վերամասշտաբավորվում են մեր հանրային API-ի համար ակնկալվող արագություններին, որոշ գնահատված ուշացումներ գերազանցում են 2 ժամ և 6 ժամ ժամանակային սահմանները, թեև գնահատման գործարկման ընթացքում դրանք ճիշտ են պահպանվել։ Ժամանակի նկատմամբ զգայուն աշխատանքի համար ավելի բարձր արագություն ստանալու նպատակով API-ում առաջարկում ենք առաջնահերթ մշակում⁠, իսկ Codex-ում՝ արագ ռեժիմ⁠։

4. Մոդելները, որոնց համար ելքային թոքեններ, ուշացում կամ արժեք չեն նշվել, ցուցադրված են հորիզոնական կետագծերով։

Հեղինակ

OpenAI