Негізгі мазмұнға өту
OpenAI

2026 ж. 26 маусым

ӨнімШығарылым

GPT‑5.6 Sol алдын ала таныстырылымы: жаңа буын моделі

Жүктелуде…

Біз GPT‑5.6 сериясының шектеулі алдын ала қарауын бастаймыз: Sol — негізгі модель; Terra — күнделікті жұмысқа арналған теңгерімді модель; Luna — жылдам әрі қолжетімді модель. Terra өнімділігі GPT‑5.5‑пен бәсекелес бола отырып, 2 есе арзан, ал Luna ең төмен бағамен мықты мүмкіндіктер ұсынады.

GPT‑5.6 Sol бүгінге дейінгі ең орнықты қауіпсіздік стекімізбен іске қосылады. Біз жоғары тәуекелді әрекеттерге, сезімтал киберсұрауларға және қайталанатын теріс пайдалануға қарсы қорғанысты күшейттік, сондай-ақ бірнеше апта бойы әлсіз тұстарды тауып, жүйемізді қысыммен тексеріп, нақты әлем шабуылдарына қарсы нығайттық.

Біз кең қолжетімділікке сенеміз және алдағы апталарда GPT‑5.6 Sol, Terra және Luna-ны жалпыға қолжетімді етуді жоспарлап отырмыз. АҚШ үкіметімен үздіксіз өзара іс-қимылымыз аясында бүгінгі іске қосу алдында жоспарларымыз бен модельдердің мүмкіндіктерін алдын ала көрсеттік. Олардың өтініші бойынша, кеңірек шығарылымға дейін қатысуы үкіметке хабарланған сенімді серіктестердің шағын тобына арналған шектеулі алдын ала қараудан бастаймыз. Осы алдын ала қарау кезінде кеңірек қолжетімділікке ұмтыла отырып, тестілеуді жалғастырып, серіктестермен тығыз үйлестіреміз. Біз мұндай үкіметтік қолжетімділік процесі ұзақ мерзімді әдепкі тәртіпке айналмауы керек деп санаймыз. Ол ең жақсы құралдарды соларға мұқтаж пайдаланушылардан, әзірлеушілерден, кәсіпорындардан, киберқорғаушылардан және жаһандық серіктестерден алшақ ұстайды. Біз бұл қысқа мерзімді қадамға алдағы апталарда кеңірек қолжетімділікке апаратын ең мықты жол деп сенгендіктен барып отырмыз; осы уақытта Әкімшілікпен бірге киберқауіпсіздік жөніндегі атқарушы жарлық шеңберін және болашақ модель шығарылымдарына арналған қайталанатын процесті әзірлейміз.

Мүмкіндіктер

GPT‑5.6 Sol — бүгінге дейінгі ең мықты модельіміз. Модель өнімділігін алдын ала көрсету үшін кодтау, биология және киберқауіпсіздік салаларындағы жақсарған агенттік мүмкіндіктерді айқындайтын бағалаулар жиынын бөлісеміз; қосымша қауіпсіздік және дайындық бағалаулары жүйе картасында(жаңа терезеде ашылады) қолжетімді. Модельді кеңінен қолжетімді еткен кезде бағалау нәтижелерінің кеңейтілген жиынын бөлісеміз.

GPT‑5.6‑пен бірге Sol-ға терең ой қорытуға ең көп уақыт беру үшін жаңа `max` ой қорыту күшін енгіземіз. Сонымен қатар, күрделі жұмысты жеделдету үшін қосалқы агенттерді пайдаланып, бір агенттің мүмкіндіктерінен асып түсетін жаңа `ultra` режимін енгіземіз.

Кодтау жұмыс процестерінде GPT‑5.6 Sol жоспарлау, итерация және құралдарды үйлестіруді қажет ететін командалық жол жұмыс процестерін сынайтын Terminal‑Bench 2.1 бойынша жаңа ең жоғары деңгейді орнатады.

GPT‑5.6 Sol биология жұмыс процестерінде де кең ауқымды жақсартулар көрсетеді. Ұзақ көкжиекті геномика мен сандық биология талдауларын бағалайтын GeneBench v1 бойынша ол GPT‑5.5-тен күштірек нәтижелерге жетіп, азырақ токен пайдаланады.

GPT‑5.6 Sol — киберқауіпсіздікке арналған бүгінге дейінгі ең қабілетті модельіміз. Ол осалдықтарды зерттеу мен пайдалануды қоса алғанда, ұзақ көкжиекті қауіпсіздік тапсырмалары үшін өнімділік-тиімділік шегін ілгерілетеді. ExploitBench² бойынша GPT‑5.6 Sol шығыс токендерінің тек шамамен 1/3 бөлігін пайдаланып, Mythos Preview-пен бәсекелес нәтиже көрсетеді. UC Berkeley зерттеушілері OpenAI және басқа озық зертханалармен бірлесіп жасаған бенчмарк — ExploitGym(жаңа терезеде ашылады)3 бойынша GPT‑5.6 Sol, Terra және Luna модельдерінің бәрі ой қорыту артқан сайын кибермүмкіндіктерде айқын жақсарулар көрсетеді.

Күштірек қорғаныспен бірге күштірек кибермүмкіндіктер

Біз GPT‑5.6 Sol, Terra және Luna-ны бүгінге дейінгі ең орнықты қорғаныс шараларымызбен, әр модельдің мүмкіндіктеріне сәйкестендірілген конфигурациялармен әзірледік. Модель қабілеті артқан сайын, кодты шолу, осалдықтарды зерттеу, патч әзірлеу, қателерді түзету, қауіпсіздікке оқыту және қорғаныстық тестілеу сияқты заңды жұмысқа қолжетімділікті сақтай отырып, нақты әлемдегі қарсылас қысымына көбірек төтеп беретін қорғаныс шараларын жобалаймыз. Мақсатымыз — осы пайдалы қолдануларды орынсыз шектемей, тыйым салынған шабуылдық әрекетті күрделірек, белгісіздеу және анықталатын ету. Модель мен қорғаныс шараларын бағалауымызға сүйене отырып, тыйым салынған шабуылдық қолдануды елеулі түрде шектей отырып, заңды қорғаныстық жұмысқа айтарлықтай пайда күтеміз.

GPT‑5.6 Sol толық тізбекті шабуылдарды сенімді орындаудан гөрі, адамдарға осалдықтарды табуға және түзетуге көмектесуде жақсырақ. Бұл мүмкіндіктер ілгерілей берген сайын, басты басымдығымыз — олардың әлсіз тұстарды табу, патчтар әзірлеу және жүйелерді кеңірек нығайту үшін осы құралдарды пайдалана алатын қорғаушыларға жетіп, пайда әкелуін қамтамасыз ету.

GPT‑5.6 Sol біздің Дайындық шеңбері бойынша Cyber Critical шегінен өтпейді. Chromium және Firefox қатысқан бағалауларда ол қателерді және эксплойт примитивтерін — эксплойттың құрылыс блоктарын — анықтады, бірақ тексерілген жағдайларда функционал толық тізбекті эксплойтты автономды түрде шығармады. Дегенмен бенчмарк шектері модельдің қолданылуы немесе басқа құралдармен біріктірілуі мүмкін барлық тәсілді қамти алмайды. Сол белгісіздік, сондай-ақ модель мүмкіндіктеріндегі кең ауқымды қадамдық өзгеріс — модельдің артқан мүмкіндіктерін күштірек қорғаныс шараларымен және кезең-кезеңімен шығарумен ұштастыруымыздың себебі. Қорғаныс шараларымыз туралы толығырақ мәліметті GPT‑5.6 Preview жүйе картасында(жаңа терезеде ашылады) бөлісеміз.

Қабатты қорғаныс стегі

Бір ғана қорғаныс шарасы табанды немесе бейімделгіш теріс пайдалануға қарсы жеткіліксіз. GPT‑5.6 алдын ала қарауының барлық аясында біз конфигурациялары модельдер арасында әртүрлі болатын қабатты қорғаныс шараларын қолданамыз және оларды нақты әлем шабуылдарына қарсы қысыммен тексереміз. Бұған модельге үйретілген қорғаныс, генерация кезіндегі нақты уақыттағы тексерулер, аккаунт деңгейіндегі сигналдар, сараланған қолжетімділік, мониторинг, талаптарды қолдану және үздіксіз тестілеу кіреді.

GPT‑5.6 пайдаланушылар ниетін жасыруға немесе модельді қорғанысты айналып өту үлгісін жасауға тырысқан жағдайларды қоса алғанда, тыйым салынған киберкөмектен бас тартуға үйретілген. Модель деңгейіндегі бұл қорғаныс шаралары модель немен көмектесуі керек және немен көмектеспеуі керек екені жөніндегі алғашқы шекараны белгілейді.

Нақты уақыттағы кибер және биологияны теріс пайдалану классификаторлары шығыс жасалып жатқанда оны бағалау арқылы тағы бір қабат береді. Тәуекелі жоғары жағдайларда олар ықтимал бұзушылықты анықтаса, үлкенірек ойлайтын модель әңгімені және оның контекстін қарап шыққанша генерация кідіртілуі мүмкін. Егер шығысқа рұқсат етілмейді деп бағаланса, ол пайдаланушыға жетпей ұсталады.

Белгіленген әрекет мазмұнды сақтау және қарау жөніндегі шарттарымыз бен саясаттарымызға сай, тиісті әңгімелер мен тәуекел сигналдары бойынша аккаунт деңгейіндегі тексеруді де іске қосуы мүмкін. Бір әңгімеден тыс қарау жүйелерімізге ұқсас техникалық ұғымдар мүлде басқа контекстерде пайда болуы мүмкін заңды екіұдай қолданылатын қауіпсіздік жұмысын тұрақты зиянды мінез-құлықтан ажыратуға көмектеседі.

Осы қабаттар бірге жалпы тәсілді жеке кез келген қорғаныс шарасынан орнықтырақ етеді. Модель мінез-құлқы зиянды жауаптардың ықтималдығын азайтады, нақты уақыттағы жүйелер генерация кезінде араласа алады, аккаунт деңгейіндегі тексеру кеңірек паттерндерді анықтай алады, ал сараланған қолжетімділік ең сезімтал мүмкіндіктерді әдепкі түрде кеңінен ашпай, маңызды қорғаныстық жұмысты сақтайды.

Әсіресе алдын ала қарау кезінде пайдаланушылар кейбір сұрауларды бұғаттайтын немесе бас тартатын қорғаныс шараларына тап болуы мүмкін. Кейбір басқа сұраулар ұзаққа созылуы мүмкін, себебі генерация қосымша тексеру үшін кідіртіледі. Қорғаныс шаралары кейде заңды жұмысқа да араласуы мүмкін, әсіресе қорғаныстық және шабуылдық әрекет бастапқыда ұқсас көрінетін екіұдай қолданылатын салаларда.

Алдын ала қарау кезеңі дәл осыны да тексеруге арналған. Біз қорғаныс шаралары теріс пайдалануды шектей ме дегенді ғана емес, заңды пайдаланушылар қалыпты жұмысты әлі де сенімді әрі тиімді аяқтай ала ма дегенді де түсінгіміз келеді. Алдын ала қарау кезіндегі пікірлер бізге қажетсіз бұғаттаулар мен кідірістерді азайтуға, қорғаныс шараларының контексті түсіндіруін жақсартуға және кеңірек шығарылымға дейін ыңғайлырақ тәжірибе жасауға көмектеседі.

Сондай-ақ біз кәсіпорын клиенттерімен қауіпсіздікті ілгерілетіп, кәсіпорын құпиялылығы талаптарын қолдау үшін ұзақ мерзімді тәсілдермен жұмыс істеп жатырмыз, соның ішінде құпиялылықты сақтайтын анықтау, клиент басқаратын қауіпсіздік бақылаулары және клиенттің, пайдаланушының немесе жұмыс жүктемесінің тәуекеліне қарай калибрленген қолжетімділік бар.

Автоматтандырылған редтиминг арқылы орнықтылықты жақсарту

Шабуылдаушылар тактикасын өзгерткен кезде де қорғаныс шаралары тиімді болып қалуы керек. Белгілі шабуылдардың бекітілген жиынында ғана жұмыс істейтін қорғаныс озық модель үшін жеткілікті орнықты емес.

Сондықтан біз қауіпсіздікке бұрынғыдан көбірек интеллект пен есептеу ресурсын жұмсап, әлсіз тұстарды табу және қорғанысты тезірек жақсарту үшін өз модельдерімізді қолданамыз. Көптеген көмексөздерде немесе контекстерде, бір ғана тар жағдайда емес, жұмыс істей алатын әмбебап қорғанысты айналып өту үлгісі шабуылдарын табуға бағытталған автоматтандырылған редтимингке A100 баламасындағы 700 000-нан астам GPU сағатын арнадық. Осындай күрделірек әрі жалпылама шабуылдарға назар аудару қорғанысты белгілі сәтсіздіктердің бекітілген жиынынан тыс тексеруге мүмкіндік берді. Бұл адам тестілеуі ғана қамти алатыннан әлдеқайда көп шабуыл үлгілерін зерттеуге, сәтсіздік паттерндерін ертерек анықтауға және әлсіз тұсты табудан оны жоюға дейінгі жолды қысқартуға мүмкіндік береді.

Автоматтандырылған редтимингтен бөлек, біз үшінші тарап тестілеушілерімен бірге ауқымды адам сарапшылары жүргізетін редтиминг жүргіздік; ол алдын ала қарау кезеңінде де жалғасады. Адам редтимингі жүйелеріміз алдын ала болжай алмауы мүмкін тәсілдермен модельді теріс пайдалануға тырысатын креативті сарапшыларға қарсы қорғанысты сынап, автоматтандырылған жұмысты толықтырады.

Ешбір бағалау өнімнің барлық конфигурациясын, көпқадамды шабуылды немесе нақты әлемдегі жұмыс процесін толық көрсете алмайды. Сондықтан біз жаңадан табылған қорғанысты айналып өту үлгісі тәсілдерін қайта жаңғырту, бағалау, басымдық беру және түзету үшін жедел әрекет ету процесін жүргіземіз, кейін оларды болашақта ұқсас сәтсіздіктерге қарсы тексере алу үшін үздіксіз бағалауларымызға қосамыз.

Қолжетімділік және баға

Алдын ала қарау кезеңінде GPT‑5.6 модельдері бастапқыда сенімді серіктестер мен ұйымдардың таңдаулы тобына API және Codex арқылы қолжетімді болады. Жақында оларды ChatGPT, Codex және API пайдаланатын адамдарға кеңірек қолжетімді етуді жоспарлап отырмыз.

GPT‑5.6‑пен бірге енгізілген жаңа атау жүйесінде сан модель буынын білдіреді, ал Sol, Terra және Luna өз қарқынымен дами алатын тұрақты мүмкіндік деңгейлерін көрсетеді. Осы отбасы адамдар мен әзірлеушілерге интеллект, жылдамдық және құн бойынша анығырақ таңдау береді.

GPT‑5.6 үш модель өлшемінде 1 млн токенге қарай бағаланады: Sol — енгізу $5 / шығару $30; Terra — енгізу $2.50 / шығару $15; Luna — енгізу $1 / шығару $6. GPT‑5.6 сондай-ақ анығырақ болжанатын көмексөз кэштеуін енгізеді, оған айқын кэш үзу нүктелерін қолдау және кэштің кемінде 30 минут сақталуы кіреді. GPT‑5.6 және кейінгі модельдерде кэшке жазу модельдің кэштелмеген енгізу тарифінің 1.25x мөлшерінде есептеледі, ал кэштен оқу кэштелген енгізуге берілетін 90% жеңілдікті бұрынғыдай алады.

Сондай-ақ шілдеде Cerebras-та секундына 750 токенге дейінгі жылдамдықпен GPT‑5.6 Sol-ды іске қосамыз, бұл клиенттерге озық интеллектіні бұрын-соңды болмаған жылдамдықпен жеткізеді. Қуатты кеңейткенше, қолжетімділік бастапқыда таңдаулы клиенттермен шектеледі.

Осы алдын ала қарау кезеңінен үйренуді жалғастырып, жақында GPT‑5.6 Sol, Terra және Luna-ны көбірек адамға жеткізуге қуаныштымыз.


1. Біз кідіріс пен API құнын модельдеріміздің өндірістегі әрекетін қарап және офлайн симуляциялау арқылы бағалаймыз. Бұл бағалаулар құрал шақыруларының мәліметтерін, іріктелген токендерді және енгізу токендерін ескереді. Нақты нәтижелер айтарлықтай өзгеруі мүмкін және симуляциямызда қамтылмаған көптеген факторға тәуелді. Кідірісті жылдам API жылдамдықтарында, ал құнды әдеттегі API бағасымен симуляциялаймыз.

2. Барлық модельдер ExploitBench API тапсырма ортасы арқылы 5 seed және ой қорыту үздіксіздігімен бағаланады.

3. Біз ExploitGym-ді ашық API-ымыздан жылдамырақ жауап шығаратын альфа API-ымызда іске қостық, кейін қоғамдық API-ымызға сәйкестендіру үшін қайта масштабтадық. Кідірістерді қоғамдық API үшін күтілетін жылдамдықтарға қайта масштабтау кезінде бұл кейбір бағаланған кідірістердің 2 сағат және 6 сағат уақыт шектерінен асып кетуіне әкеледі, бірақ бағалау іске қосуында олар дұрыс сақталған. Уақытқа сезімтал жұмыс үшін жылдамырақ жылдамдық алу мақсатында API-де басымдықты өңдеуді және Codex-те жылдам режимді ұсынамыз.

4. Шығыс токендері, кідірісі немесе құны көрсетілмеген модельдер көлденең нүктелі сызықтар ретінде салынады.

Автор

OpenAI