Үндсэн агуулга руу алгасах
OpenAI

2026 оны зургаадугаар сарын 26

БүтээгдэхүүнГаргалт

GPT‑5.6 Sol-ыг танилцуулж байна: дараагийн үеийн загвар

Ачаалж байна…

Бид GPT‑5.6 цувралын хязгаарлагдмал урьдчилсан хувилбарыг эхлүүлж байна: манай тэргүүлэх загвар Sol; өдөр тутмын ажилд зориулсан тэнцвэртэй загвар Terra; мөн хурдан, боломжийн үнэтэй загвар Luna. Terra нь GPT‑5.5‑тай өрсөлдөхүйц гүйцэтгэлтэй атлаа 2 дахин хямд, харин Luna нь манай хамгийн бага зардлаар хүчтэй чадамж өгнө.

GPT‑5.6 Sol нь өнөөг хүртэлх манай хамгийн бат бөх аюулгүй байдлын давхаргатайгаар гарч байна. Бид өндөр эрсдэлтэй үйл ажиллагаа, эмзэг кибер хүсэлт, давтан буруу ашиглалтын хамгаалалтыг бэхжүүлж, сул талыг олох, системээ ачаалалтай шалгах, бодит халдлагын эсрэг хатууруулахад хэдэн долоо хоног зарцуулсан.

Бид өргөн хүрээний хандалтад итгэдэг бөгөөд ирэх долоо хоногуудад GPT‑5.6 Sol, Terra, Luna-г нийтэд нээлттэй болгохоор төлөвлөж байна. АНУ-ын засгийн газартай үргэлжилж буй хамтын ажиллагааны хүрээнд бид өнөөдрийн нээлтээс өмнө төлөвлөгөө болон загваруудын чадамжаа урьдчилан танилцуулсан. Тэдний хүсэлтээр бид илүү өргөн хүрээнд гаргахаасаа өмнө оролцоо нь засгийн газарт мэдэгдсэн итгэмжлэгдсэн цөөн түншийн хязгаарлагдмал урьдчилсан хувилбараар эхэлж байна. Энэ урьдчилсан хувилбарын үеэр бид илүү өргөн хүртээмж рүү ажиллахдаа түншүүдтэйгээ ойр хамтран тест, зохицуулалтаа үргэлжлүүлнэ. Ийм төрлийн засгийн газрын хандалтын үйл явц урт хугацааны үндсэн жишиг болох ёсгүй гэж бид үзэж байна. Энэ нь шилдэг хэрэгслүүдийг хэрэгтэй байгаа хэрэглэгчид, хөгжүүлэгчид, аж ахуйн нэгжүүд, кибер хамгаалагчид болон дэлхийн түншүүдээс хол байлгана. Бид Администрацитай хамтран кибер Executive Order-ийн хүрээ болон ирээдүйн загварын хувилбаруудад давтагдах үйл явцыг боловсруулахын зэрэгцээ ирэх долоо хоногуудад илүү өргөн хүртээмжид хүрэх хамгийн хүчтэй зам гэж үзсэн тул энэ богино хугацааны алхмыг хийж байна.

Чадамжууд

GPT‑5.6 Sol бол одоогоор манай хамгийн хүчирхэг загвар юм. Загварын гүйцэтгэлийн урьдчилсан дүр зургийг өгөхийн тулд бид кодчилол, биологи, кибер аюулгүй байдал дахь сайжирсан агентлаг чадамжийг онцолсон үнэлгээний багцыг хуваалцаж байна; нэмэлт аюулгүй байдал болон бэлэн байдлын үнэлгээг манай системийн карт(шинэ цонхонд нээгдэнэ)-аас үзэх боломжтой. Загварыг өргөн хүрээнд нээлттэй болгох үед бид үнэлгээний үр дүнгийн өргөтгөсөн багцыг хуваалцана.

GPT‑5.6‑тай хамт бид Sol-д гүн сэтгэн бодоход хамгийн их хугацаа өгөх шинэ `max` сэтгэн бодох хүчин чармайлтыг нэвтрүүлж байна. Мөн бид дэд агентуудыг ашиглан нарийн төвөгтэй ажлыг хурдасгаж, нэг агентын чадамжаас давсан шинэ `ultra` горимыг нэвтрүүлж байна.

Кодчиллын ажлын урсгалд GPT‑5.6 Sol нь төлөвлөлт, давталт, хэрэгслийн зохицуулалт шаардсан командын мөрийн ажлын урсгалыг шалгадаг Terminal‑Bench 2.1 дээр шинэ шилдэг түвшин тогтоож байна.

GPT‑5.6 Sol нь биологийн ажлын урсгалд мөн өргөн хүрээний сайжруулалт харуулж байна. Урт хугацааны геномик болон тоон биологийн шинжилгээг үнэлдэг GeneBench v1 дээр энэ нь GPT‑5.5-аас илүү хүчтэй үр дүнд хүрэхийн зэрэгцээ цөөн токен ашигладаг.

GPT‑5.6 Sol бол кибер аюулгүй байдлын хувьд одоогоор манай хамгийн чадамжтай загвар юм. Энэ нь эмзэг байдлын судалгаа, exploit хийх зэрэг урт хугацааны аюулгүй байдлын даалгаврын гүйцэтгэл-үр ашгийн хязгаарыг урагшлуулж байна. ExploitBench² дээр GPT‑5.6 Sol нь гаралтын токены ердөө ~1/3-ийг ашиглан Mythos Preview-тэй өрсөлдөхүйц байна. UC Berkeley-ийн судлаачид OpenAI болон бусад хил хязгаарын лабораторитой хамтран бүтээсэн жишиг болох ExploitGym(шинэ цонхонд нээгдэнэ)3 дээр GPT‑5.6 Sol, Terra, Luna загварууд бүгд сэтгэн бодохыг нэмэгдүүлэхэд кибер чадамжид хүчтэй сайжруулалт харуулж байна.

Илүү хүчтэй кибер чадамжийг илүү хүчтэй хамгаалалттай хослуулах нь

Бид GPT‑5.6 Sol, Terra, Luna-г өнөөг хүртэлх манай хамгийн бат бөх хамгаалалтуудтай, загвар бүрийн чадамжид тааруулсан тохиргоотойгоор хөгжүүлсэн. Загвар илүү чадамжтай болохын хэрээр бид кодын хяналт, эмзэг байдлын судалгаа, нөхөөс боловсруулах, алдаа засах, аюулгүй байдлын боловсрол, хамгаалалтын тест зэрэг хууль ёсны ажилд хандах боломжийг хадгалахын зэрэгцээ бодит ертөнцийн эсрэг талын дарамтад улам сайн тэсэх хамгаалалтыг зохион бүтээдэг. Манай зорилго бол эдгээр ашигтай хэрэглээг шаардлагагүйгээр хязгаарлахгүйгээр хориглосон довтолгооны үйл ажиллагааг илүү хэцүү, тодорхойгүй, илрүүлэх боломжтой болгох юм. Загвар болон хамгаалалтын үнэлгээндээ үндэслэн бид хориглосон довтолгооны хэрэглээг мэдэгдэхүйц хязгаарлахын зэрэгцээ хууль ёсны хамгаалалтын ажилд ихээхэн ашиг өгнө гэж үзэж байна.

GPT‑5.6 Sol нь төгсгөлөөс төгсгөл хүртэлх халдлагыг найдвартай гүйцэтгэхээс илүү хүмүүсийг эмзэг байдлыг олох, засахад туслахдаа илүү сайн. Эдгээр чадамж цаашид ахихын хэрээр сул талыг олох, нөхөөс боловсруулах, системүүдийг өргөн хүрээнд бэхжүүлэхэд эдгээр хэрэгслийг ашиглаж чадах хамгаалагчдад хүрч, тэдэнд ашиг тусаа өгөхийг баталгаажуулах нь бидний тэргүүлэх зорилт юм.

GPT‑5.6 Sol нь манай Preparedness Framework-ийн дагуу Cyber Critical босгыг давдаггүй. Chromium болон Firefox-той холбоотой үнэлгээнд энэ нь алдаа болон exploit-ийн суурь бүрэлдэхүүн болох exploitation primitives-ийг илрүүлсэн ч туршсан нөхцөлд ажиллагаатай full-chain exploit-ийг бие даан гаргаагүй. Гэсэн ч жишгийн босгууд нь загварыг ашиглах эсвэл бусад хэрэгсэлтэй хослуулах бүх аргыг бүрэн тусгаж чадахгүй. Энэхүү тодорхойгүй байдал болон загварын чадамж дахь өргөн хүрээний шат ахилт нь бид яагаад загварын нэмэгдсэн чадамжийг илүү хүчтэй хамгаалалт, үе шаттай гаргалттай хослуулж буй шалтгаан юм. Бид хамгаалалтынхаа талаар илүү дэлгэрэнгүйг GPT‑5.6 Preview системийн карт(шинэ цонхонд нээгдэнэ)-д хуваалцсан.

Давхаргат хамгаалалтын стек

Шийдэмгий эсвэл дасан зохицдог буруу ашиглалтын эсрэг ганц хамгаалалт хангалттай биш. GPT‑5.6 урьдчилсан хувилбарын турш бид давхаргат хамгаалалт ашигладаг бөгөөд нарийн тохиргоо нь загваруудаар ялгаатай, мөн тэдгээрийг бодит халдлагын эсрэг ачаалалтай шалгадаг. Үүнд загварт сургаж суулгасан хамгаалалт, үүсгэлтийн үеийн бодит цагийн шалгалт, дансны түвшний дохио, ялгаатай хандалт, хяналт, хэрэгжилт, үргэлжилсэн тест багтана.

GPT‑5.6 нь хэрэглэгчид санаагаа нуух эсвэл загварыг jailbreak хийхийг оролдсон ч хориглосон кибер туслалцаанаас татгалзахаар сургагдсан. Эдгээр загварын түвшний хамгаалалт нь загвар юунд туслах ёстой, юунд туслах ёсгүйг заасан эхний хязгаарыг тогтоодог.

Бодит цагийн кибер болон биологийн буруу ашиглалтын ангилагчид гаралтыг үүсэж байх үед нь үнэлж, өөр нэг давхарга бүрдүүлдэг. Илүү өндөр эрсдэлтэй тохиолдолд боломжит зөрчлийг илрүүлбэл илүү том сэтгэн бодох загвар харилцан яриа болон контекстийг нь хянах зуур үүсгэлтийг түр зогсоож болно. Хэрэв гаралтыг зөвшөөрөгдөөгүй гэж үнэлбэл хэрэглэгчид хүрэхээс өмнө саатуулна.

Тэмдэглэгдсэн үйл ажиллагаа нь контент хадгалалт, хяналтын талаарх манай нөхцөл, бодлоготой нийцүүлэн холбогдох харилцан яриа болон эрсдэлийн дохионы хүрээнд дансны түвшний хяналтыг мөн өдөөж болно. Нэг харилцан ярианаас цааш харах нь ижил төстэй техникийн ойлголтууд маш өөр контекстэд гарч болох хууль ёсны хоёрдмол хэрэглээтэй аюулгүй байдлын ажлаас тогтвортой хорлонтой зан төлөвийг ялгахад манай системүүдэд тусалдаг.

Эдгээр давхарга нийлээд ерөнхий хандлагыг дан ганц хамгаалалтаас илүү бат бөх болгодог. Загварын зан төлөв нь хор хөнөөлтэй хариу гарах магадлалыг бууруулж, бодит цагийн системүүд үүсгэлтийн үеэр хөндлөнгөөс оролцож, дансны түвшний хяналт илүү өргөн хэв маягийг илрүүлж, ялгаатай хандалт нь хамгийн эмзэг чадамжуудыг анхдагчаар өргөн нээлттэй болголгүйгээр чухал хамгаалалтын ажлыг хадгална.

Ялангуяа урьдчилсан хувилбарын үеэр хэрэглэгчид зарим хүсэлтийг хаах эсвэл татгалзах хамгаалалттай тулгарч болзошгүй. Нэмэлт хяналт хийхийн тулд үүсгэлтийг түр зогсоодог тул бусад хүсэлт илүү удаан авч магадгүй. Хамгаалалт заримдаа хууль ёсны ажилд хөндлөнгөөс орж болзошгүй, ялангуяа хамгаалалтын болон довтолгооны үйл ажиллагаа эхэндээ төстэй харагдаж болох хоёрдмол хэрэглээний салбарт.

Энэ бол урьдчилсан хувилбараар шалгахаар зорьсон зүйлийн нэг хэсэг юм. Бид хамгаалалт буруу ашиглалтыг хязгаарлаж байгаа эсэхээс гадна хууль ёсны хэрэглэгчид хэвийн ажлаа найдвартай, үр ашигтайгаар гүйцэтгэж чадаж байгаа эсэхийг ойлгохыг хүсэж байна. Урьдчилсан хувилбарын үеийн санал хүсэлт нь илүү өргөн гаргалтаас өмнө шаардлагагүй хаалт, саатлыг багасгах, хамгаалалт контекстийг хэрхэн тайлбарладгийг сайжруулах, илүү жигд туршлага бий болгоход бидэнд тусална.

Мөн бид аж ахуйн нэгжийн нууцлалын шаардлагыг дэмжихийн зэрэгцээ аюулгүй байдлыг ахиулахын тулд нууцлалыг хадгалсан илрүүлэлт, хэрэглэгчийн удирддаг аюулгүй байдлын хяналт, хэрэглэгч, хэрэглэгчийн данс эсвэл ажлын ачааллын эрсдэлд тохируулсан хандалт зэрэг урт хугацааны хандлагууд дээр аж ахуйн нэгжийн хэрэглэгчидтэй хамтран ажиллаж байна.

Автоматжуулсан улаан багаар бат бөх байдлыг сайжруулах нь

Халдагчид арга тактикаа өөрчилсөн ч хамгаалалтууд үр дүнтэй хэвээр байх ёстой. Зөвхөн мэдэгдэж буй тогтмол халдлагын багцад ажилладаг хамгаалалт нь хил хязгаарын загварт хангалттай бат бөх биш.

Тиймээс бид аюулгүй байдалд урьд өмнөхөөс илүү их оюун чадамж, тооцооллыг зориулж, өөрсдийн загваруудаар сул талыг илрүүлж, хамгаалалтыг илүү хурдан сайжруулж байна. Бид олон өгөгдөл эсвэл контекстэд ажиллаж чаддаг, зөвхөн нэг явцуу орчинд хязгаарлагдахгүй универсал jailbreak халдлагуудыг олоход чиглэсэн автоматжуулсан улаан багт 700,000 гаруй A100-тэй тэнцэх GPU цаг зарцуулсан. Илүү хэцүү, ерөнхий шинжтэй эдгээр халдлагад төвлөрснөөр бид хамгаалалтыг мэдэгдэж буй алдааны тогтмол багцаас давуулан шалгах боломжтой болсон. Мөн зөвхөн хүний тестээр хамрах боломжгүй олон халдлагын хэв маягийг судалж, алдааны хэв шинжийг эрт илрүүлэн, сул талыг олохоос засах хүртэлх замыг богиносгох боломж олгож байна.

Автоматжуулсан улаан багаас гадна бид гуравдагч талын шалгагчидтай хамтран хүний шинжээчдийн өргөн хүрээний улаан багийн тест хийсэн бөгөөд энэ нь урьдчилсан хувилбарын хугацаанд үргэлжилнэ. Хүний улаан баг нь манай системүүд урьдчилан тооцоолоогүй байж болох аргаар загварыг буруугаар ашиглахыг оролдох бүтээлч шинжээчдийн эсрэг хамгаалалтыг шалгаж, автоматжуулсан ажлыг нөхдөг.

Ямар ч үнэлгээ бүтээгдэхүүний бүх тохиргоо, олон алхамт халдлага эсвэл бодит ажлын урсгалыг бүрэн төлөөлж чадахгүй. Тиймээс бид шинээр илэрсэн jailbreak-үүдийг дахин гаргаж, үнэлж, эрэмбэлж, засварлах шуурхай хариу арга хэмжээний үйл явцыг хэрэгжүүлж, дараа нь ирээдүйд төстэй алдааны эсрэг шалгахын тулд тэдгээрийг тасралтгүй үнэлгээндээ нэмдэг.

Хүртээмж ба үнэ

Урьдчилсан хувилбарын үеэр GPT‑5.6 загварууд эхний ээлжид итгэмжлэгдсэн сонгогдсон түнш, байгууллагуудад API болон Codex-оор дамжин उपलब्ध болно. Бид удахгүй тэдгээрийг ChatGPT, Codex болон API ашигладаг хүмүүст илүү өргөн хүрээнд нээлттэй болгохоор төлөвлөж байна.

GPT‑5.6‑тай хамт нэвтрүүлж буй энэ шинэ нэршлийн системд тоо нь загварын үеийг илэрхийлдэг бол Sol, Terra, Luna нь өөр өөрийн хэмнэлээр ахиж болох тогтвортой чадамжийн түвшнүүдийг илтгэнэ. Энэ гэр бүл нь хүмүүс болон хөгжүүлэгчдэд оюун чадамж, хурд, зардлын хүрээнд илүү тодорхой сонголт өгнө.

GPT‑5.6 нь гурван загварын хэмжээнд 1 сая токен тутамд үнэлэгдэнэ: Sol нь оролт $5 / гаралт $30; Terra нь оролт $2.50 / гаралт $15; Luna нь оролт $1 / гаралт $6. GPT‑5.6 нь мөн ил тод кэшийн таслах цэгүүдийн дэмжлэг болон кэшийн 30 минутын доод хугацааг багтаасан, илүү урьдчилан таамаглах боломжтой өгөгдлийн кэшийг нэвтрүүлж байна. GPT‑5.6 болон түүнээс хойших загваруудад кэш бичилт нь загварын кэшлээгүй оролтын үнийн 1.25x-аар тооцогдох бол кэш уншилтад кэшлэгдсэн оролтын 90%-ийн хөнгөлөлт хэвээр үргэлжилнэ.

Бид мөн долдугаар сард Cerebras дээр секундэд 750 хүртэл токен боловсруулах GPT‑5.6 Sol-ыг эхлүүлж, хил хязгаарын оюун чадамжийг хэрэглэгчдэд урьд өмнө байгаагүй хурдаар хүргэнэ. Багтаамжаа нэмэгдүүлэх явцад хандалт эхний ээлжид сонгогдсон хэрэглэгчдээр хязгаарлагдана.

Энэхүү урьдчилсан хувилбарын үеэс үргэлжлүүлэн суралцаж, GPT‑5.6 Sol, Terra, Luna-г удахгүй илүү олон хүнд хүргэхдээ бид баяртай байна.


1. Бид загваруудынхаа үйлдвэрлэлийн орчин дахь зан төлөвийг ажиглаж, офлайнаар загварчлан хоцролт болон API зардлыг тооцоолдог. Эдгээр тооцоонд хэрэгслийн дуудлагын дэлгэрэнгүй, дээжлэсэн токен болон оролтын токенуудыг харгалзсан. Бодит үр дүн ихээхэн ялгаатай байж болох бөгөөд манай загварчлалд тусгагдаагүй олон хүчин зүйлээс хамаарна. Бид хоцролтыг хурдан API хурдтайгаар, зардлыг ердийн API үнээр загварчилдаг.

2. Бүх загварыг ExploitBench API harness-ийг 5 seed болон сэтгэн бодох тасралтгүй байдалтайгаар ашиглан үнэлсэн.

3. Бид ExploitGym-ийг нийтийн API-аас хурдан хариу гаргадаг альфа API дээрээ ажиллуулаад, дараа нь нийтийн API-тайгаа тааруулахын тулд дахин масштабласан. Хоцролтыг нийтийн API-д хүлээгдэх хурдтай тааруулан дахин масштаблахад үнэлгээний ажиллуулалтдаа зөв мөрдөгдсөн байсан ч зарим тооцоолсон хоцролт 2 цаг болон 6 цагийн хугацааны хязгаараас давж харагдсан. Цаг хугацаанд мэдрэмтгий ажилд илүү хурд авахын тулд бид API-д priority processing⁠, Codex-д fast mode⁠ санал болгодог.

4. Гаралтын токен, хоцролт эсвэл зардал нь мэдээлэгдээгүй загваруудыг хэвтээ тасархай шугамаар дүрсэлсэн.

Зохиогч

OpenAI