Оюун ухааны шинэ үе
2026-09-22-ны шинэчлэлт: Бид GPT‑6 Sol болон GPT‑6 Luna-г нэмснээр GPT‑6 бүтээгдэхүүний бүлгээ өргөжүүлж байна. Дэлгэрэнгүй үзэх.
Бид дэлхийн хамгийн ухаалаг бөгөөд нийцтэй загвар болох GPT‑6 Astra-г танилцуулж байна.
GPT‑6 Astra нь урьдчилсан сургалт, бататгах сургалт, нийцүүлэлтийн чиглэлд олон жилийн судалгаа болон томоохон бооцоог нэгтгэдэг. Astra нь компьютер ашиглах, хөтөч ашиглах, програм хангамжийн инженерчлэл, кибер аюулгүй байдал, шинжлэх ухаан болон мэргэжлийн ажлын хувьд орчин үеийн шилдэг түвшинд хүрсэн. Astra нь FrontierMath Tier 4-д 98%-ийн оноогоор дээд түвшинд хүрч, математикийн удаан хугацаанд нээлттэй байсан асуудлуудыг шийдвэрлэхэд аль хэдийн тусалсан. Astra мөн ARC-AGI-3 дээр 99.9%-ийн оноо авч, ExploitBench дээр 100%-ийн оноо авсан. Мөн компьютер болон хөтчийн хэрэглээнд шинэ хил хязгаар тогтоож, хамгийн шаардлага өндөртэй мэргэжлийн ажлыг хосгүй хурд, нарийвчлал, дүгнэлт гаргах чадвараар гүйцэтгэдэг.
GPT‑6 Astra нь өнөөдрөөс эхлэн хязгаарлагдмал тооны байгууллагад нэвтэрч эхлэх бөгөөд ойрын өдрүүдэд ChatGPT Plus, Pro, Business, Enterprise-ийн бүх хэрэглэгчид, мөн OpenAI API, Microsoft Azure болон AWS Bedrock-оор дамжуулан ашиглах боломжтой болно.
Astra бол хэрэглэгчийн зорилго болон загварын зан төлөвийг ойлгох талд мэдэгдэхүйц сайжирсан, хамгийн сайн нийцүүлэлттэй загвар маань юм. Та Astra-гийн дүгнэлтэд илүү итгэлтэйгээр даалгавар өгч болно. Үүнийг шалгах нэг арга болгон бид Hugging Face-ийн ослоос сургамж авсан шинэ үнэлгээ боловсруулсан бөгөөд хэцүү эсвэл боломжгүй даалгавартай тулгарсан загвар нь зориулалтын хүрээнээсээ хэтрэх эсэхийг үнэлдэг. Үйлдвэрлэлийн хамгаалалтын арга хэмжээгүй үед зөвшөөрөгдсөн зорилтот хүрээнээс тохиолдлын 48%-д хэтэрсэн GPT‑5.6 Sol-той харьцуулахад GPT‑6 Astra тохиолдлын 0%-д ингэж үйлдсэн.
Компьютер ашиглах дэлхийн шилдэг загвар
GPT‑6 Astra нь компьютер ашиглах хурд, нарийвчлал, аюулгүй байдлын шинэ хил хязгаарыг нээж байна. Энэ нь онлайн маягт бөглөх, CRM дэх харилцагчийн бүртгэлийг шинэчлэх, таны календарийг зохион байгуулах зэрэг уйтгартай ажлуудыг гүйцэтгэж чадна. Энэ нь онлайн судалгаа хийж, таны имэйл эсвэл баримт бичгийн засагчид хураангуйн ноорог бэлтгэж чадна. Энэ нь шинжлэх ухааны өгөгдөлд дүн шинжилгээ хийж, график үүсгэн, вэбсайт бүтээж, тухайн сайтын бүх функц ажиллаж буйг баталгаажуулахын тулд фронтендийн QA шалгалт хийж чадна. Энэ нь танд программ хангамжийг бие даан суулгаж, турших, мөн дэлгэц дээр харж буй асуудлуудыг оношлон шийдвэрлэхэд тусална. Эдгээр сайжруулалт нь манай хамгийн сүүлийн үеийн үнэлгээний үр дүнд мөн тусгагдаж байна.
Эдгээр сайжруулалт нь бодит мэдлэгт суурилсан ажлын даалгавруудын үр ашгийг мөн мэдэгдэхүйц нэмэгдүүлдэг. OSWorld 2.0 дээрх хариу өгөх хугацааны симуляцид Astra нь GPT‑5.6-аас даалгавар бүрийг ойролцоогоор 47%-иар бага хугацаанд гүйцэтгэж, компьютер ашиглахдаа илүү өндөр гүйцэтгэл үзүүлдэг Sol нь даалгавар тутамд ойролцоогоор 40 минутад 72.6% оноо авсан нь ойролцоогоор 75 минутад 65.7% оноо авсантай харьцуулахад.3
GPT‑6 Astra-гийн компьютер ашиглах чадвар нь тоглоом хөгжүүлэлт, цахилгааны инженерчлэл, өдөр тутмын мэдлэгт суурилсан ажил зэрэг олон салбарын үр дүнгээс харагдана:
Astra-гийн зэрэгцээ, компьютер ашиглах хурдыг мэдэгдэхүйц сайжруулахын тулд бид Codex-ийн тестийн орчныг мөн шинэчилж байна. Энэ нь Astra-гийн үр ашигтай хосолсноор Mind2Web жишиг үнэлгээнд одоогийн GPT‑5.6 Sol-ийн туршлагатай харьцуулахад даалгаврыг 1.9 дахин хурдан гүйцэтгэх боломжийг олгоно. Загварын хурдны сайжруулалт нь таны өмнөөс цаг их шаарддаг өдөр тутмын олон ажлыг таны хийхээс ч хурдан гүйцэтгэх боломжтой гэсэн үг.4
Мэргэжлийн ажил дахь үсрэнгүй ахиц
GPT‑6 Astra нь компьютер ашиглах дэвшлийг мэргэжлийн орчинд чиглэсэн сургалттай хослуулж, нарийн төвөгтэй ажлын даалгавруудыг шийдвэрлэхэд тусалдаг. Энэ нь нарийн төвөгтэй асуудалд шаардлагатай оюун ухааныг олон үе шаттай ажлын урсгалыг хэрэгжүүлэх, боловсронгуй баримт бичиг, хүснэгт, танилцуулга бэлтгэх чадвартай хослуулдаг.
GPT‑6 Astra нь одоо байгаа загваруудыг дагаж мөрдөх, сайн зохион байгуулалттай, бүтэцтэй өгүүлэмжээр гол санааг товч тодорхой дамжуулсан слайд бүтээхэд зориулсан манай хамгийн сайн загвар юм. Энэ нь таны загваруудыг дагаж, бичгийн болон визуал хэв маягт тань нийцсэн ойлгомжтой, сайн бүтэцтэй баримт бичиг, танилцуулга, хүснэгт, шинжилгээ бүтээдэг. Түүнчлэн Astra нь тухайн ажилд шаардлагагүй мэдээллийг давтахаас илүүтэйгээр зөвхөн чухал агуулгыг гаралтдаа тусгайлан оруулахаар сургагдсан. Энэ бүхэн нь таны бизнесийн нөхцөл байдал, стандартад нийцсэн, шууд ашиглахад илүү бэлэн ажлын материал гаргах боломжтой гэсэн үг юм.
GPT‑6 Astra нь бүтээдэг вэбсайт, тоглоом, аппликейшн, дүрслэлүүддээ илүү хүчтэй харааны дүгнэлт гаргах чадварыг авчирдаг. ChatGPT дахь Sites(шинэ цонхонд нээгдэнэ) -ийн тусламжтайгаар Astra нь командаас шууд вэбсайт, вэб апп болон тоглоом үүсгэж, хост хийж, хуваалцах боломжтой.
Заавар нь тайлбарлах боломж үлдээсэн үед GPT‑6 Astra зөв шийдвэр гаргахдаа өмнөх загваруудаас илүү сайн. Энэ нь ердийн дутуу мэдээллийг нөхөхдөө контекстийг ашиглаж, хариулт нь үр дүнг өөрчилж болзошгүй үед чиглэсэн асуулт асууна. Codex-д таны хариултаас хамаарахгүй ажлыг үргэлжлүүлэн хийхийн зэрэгцээ асинхроноор асуулт асууж чадна. Хэрэв та хариу өгөхгүй бол тохиромжтой үед үндэслэлтэй таамаглалаар үргэлжлүүлнэ, харин үр дагавартай шийдвэрүүдийн талаар таны оролтыг хүлээнэ.
Доорх жишээнүүд нь Astra дутуу мэдээлэл хариултад мэдэгдэхүйц нөлөөлж болох өдөр тутмын даалгаврууд дээр хэрхэн хамтран ажилладгийг харуулж байна.
Astra нь даалгавар хувьсан өөрчлөгдөх үед чиг баримжаагаа хадгалахдаа мөн илүү сайн. Өмнөх загварууд заримдаа чиглүүлэх зурвасуудыг шинэ зорилго гэж үзэж, анхны хүсэлт эсвэл өмнөх хязгаарлалтуудыг умартдаг байсан. Astra нь шинэ шаардлагуудыг нэгтгэж, хүсэлт гаргавал чиглэлээ өөрчилж, өргөн хүрээтэй даалгаврыг орхигдуулахгүйгээр хажуугийн асуултуудад хариулдаг.
Код бичих
GPT‑6 Astra нь програм хангамжийн инженерчлэлд зориулсан өнөөг хүртэлх хамгийн шилдэг загвар юм.
"GPT‑6 Astra нь манай дотоод кодчиллын жишиг үнэлгээнүүдэд хамгийн дэвшилтэт гүйцэтгэл үзүүлж, GPT‑5.6 Sol-той харьцуулахад арилжааны зөн совингийн үнэлгээнд тодорхой ахиц харуулж байна. Агент шинжтэй кодчилолд ашиглах үед GPT‑6 Astra нь хөгжүүлэгчдэд дагахад илүү хялбар байдлаар харилцаж, үйлдвэрлэлийн түвшний чанарт хүрэхэд цөөн давталт шаарддаг код гаргадаг.”
"Бид анхны үеийн үнэлгээнүүдийнхээ нэг дээр Astra-г бага, дунд, өндөр хүчин чармайлтаар туршсан бөгөөд энэ нь GPT 5.6 Sol-оос мэдэгдэхүйц илүү үр дүн үзүүлсэн. Өндөр хүчин чармайлт нь шинээр бүтээсэн хувилбар дээр илүү олон давталт хийх, хөтчийн туршилтаар илүү их баталгаажуулалт хийх, apply-patch-г хэрэглэхээс илүү код гүйцэтгэхэд төвлөрөх боломж олгодог. Загвар хүчин чармайлтаа хэрхэн зарцуулдгийг ойлгосноор бид сая сая бүтээгчид санаанаас ажилладаг апп хүртэлх илүү хурдан, найдвартай замыг санал болгодог."
Astra-ийн тусламжтайгаар контекстийн цонх дүүрэх үед Codex контекстийг хадгалж, сэргээх шинэ аргыг танилцуулж байна. Өмнө нь загварууд нарийн төвөгтэй асуудлуудыг дибаг хийх эсвэл томоохон дахин зохион байгуулалт хийх зэрэг урт холболтын үеэр ажлыг хураангуйлахын тулд шахалтыг ашигладаг байсан. Шахалт бүр нь засвар яагаад бүтэлгүйтсэн эсвэл бүрэлдэхүүн хэсэг хэрхэн ажилладгийн талаарх дэлгэрэнгүйг орхигдуулж болзошгүй. Codex-д Astra нь хуримтлагдсан дэлгэрэнгүй мэдээллийг нэг хураангуй болгон дахин дахин шахахгүйгээр контекстийн цонх дамнан тэмдэглэл хадгалж чадна. Өмнөх контекстийн цонхнууд хайлт хийх боломжтой хэвээр байдаг тул Astra өмнөх мессежүүд болон хэрэгслийн гаралтаас шаардлага эсвэл туршилтын үр дүнг, тэр мэдээлэл тэмдэглэлд нь тусгагдаагүй байсан ч, олох боломжтой. Та энэ туршилтын функцийг Codex config.toml файлдаа идэвхжүүлж болно,(шинэ цонхонд нээгдэнэ) мөн энэ нь ирэх долоо хоногуудад Astra-д анхдагч тохиргоо болно.
Шинжлэх ухааны нээлтийг урагшлуулах
Astra нь шинжлэх ухааны нээлтийн цаадах практик ажилд тусалж чадна. Шинжлэх ухааны сэтгэн бодох чадварыг компьютер ашиглахтай хослуулснаар өгөгдлийг шалгаж, үр дүнг судлахын тулд тусгай программ хангамж дээр шууд ажиллаж, судлаачдад нотолгоог үнэлж, дараа нь юуг судлахаа шийдэхэд нь тусалж чадна.
Кибер аюулгүй байдал
Манай аюулгүй байдлын шинэчлэлт-д заасанчлан, Astra нь кибер чадавхын хувьд томоохон үсрэлт бөгөөд манай Чухал босго-ыг хангаж, Бэлэн байдлын хүрээ-ний дагуу кибер аюулгүй байдлыг хангаж байна. Тэг өдрийн эмзэг байдлыг ашиглах аргуудыг илрүүлж, боловсруулах чадвар нь хамгаалагчдад сул талыг илрүүлж, нөхөхөд тусалж болох ч илүү хүчтэй хамгаалалтын арга хэмжээ шаардлагатай болгодог. Эдгээр чадавх хэр өргөн хүрээтэйг ойлгохын тулд бид Astra-г дотоодын болон гуравдагч талын шинжээчдийн үнэлгээнд ашигласан.
Бид эхлээд үйлдвэрлэлийн хамгаалалтгүйгээр уг загварыг ExploitBench болон ExploitGym дээр туршсан бөгөөд эдгээр нь загварууд мэдэгдэж буй програм хангамжийн эмзэг байдлыг ажиллахуйц ашиглах код болгон хувиргаж чадах эсэхийг үнэлдэг. ExploitBench дээр Astra 100%-ийн төгс оноо авсан нь өмнөх хил хязгаарын кибер чадамжтай загвар болох GPT‑5.6 Sol-ийн 78.5%-тай харьцуулахад өндөр үзүүлэлт юм. ExploitGym дээр Astra нь үлэмж цөөн гаралтын токен ашиглан 42.4%-ийн амжилтын түвшинд хүрсэн бол GPT‑5.6 Sol-ийнх 30.3% байсан.13
Түүхэн программ хангамжийн эмзэг байдалд өртсөн нь жишиг шалгалтын үр дүнд нөлөөлсөн байж болзошгүй гэсэн болгоомжлолын үүднээс бид Astra-г мөн хоёр шинэ жишиг шалгалтаар үнэлсэн. Тухайлбал, өмнөх гурван сарын эмзэг байдлыг ашиглан эксплойт боловсруулах чадварыг шалгах зорилгоор "ExploitBench (2026 оны 6–8-р сар)" нэртэй дотоод үнэлгээ боловсруулсан.14 Astra GPT‑5.6‑аас дурын код гүйцэтгэх үзүүлэлтээрээ мэдэгдэхүйц өндөр үр дүнд хүрсэн Энэ өгөгдлийн багцад Sol нь гаралтын токеныг хавьгүй цөөн ашигласан. Үнэлгээний үеэр Astra өмнө нь мэдэгдээгүй хоёр zero-day эмзэг байдлыг бүр илрүүлж, ашигласан. Бид хоёр эмзэг байдлын талаар засвар үйлчилгээ үзүүлэгчдэд нь мэдэгдэж байна.
Мөн бид Astra-г загварууд түүхий эх кодод хандахгүйгээр програм хангамжийн хоёртын файлуудад урвуу инженерчлэл хийж, үндсэн логикийг нь ойлгож чадах эсэхийг хэмждэг SRE-Bench15 жишиг үнэлгээнд туршсан. Astra даалгаврын 88.0%-ийг нэг оролдлогоор, 99.2%-ийг дөрвөн оролдлогын дотор шийдсэн бол GPT‑5.6 Sol харгалзан 55.9% болон 68.7%-ийг шийдсэн.
Жишиг шалгалтаас гадна шинжээчдийн удирдлагаар хийсэн үнэлгээгээр Astra-г үйлдвэрлэлийн хамгаалалтын арга хэмжээгүйгээр ажиллуулах үед өмнө нь мэдэгдээгүй эмзэг байдлуудыг ашиглан бэхжүүлсэн хөтөч дээр дурын код гүйцэтгэж, бэхжүүлсэн үйлдлийн системд эрх ахиулах ашиглалтын код үүсгэж чадахыг тогтоосон.
Бидний "Хамгаалагчийн боломжит хугацаа"-д хэлэлцсэнчлэн, хил хязгаарын кибер чадавх нь хамгаалагчдад сул талуудыг илүү хурдан илрүүлэхэд тусалж болох ч мөн тэдгээр сул талыг ашиглахад илүү хялбар болгож, хамгаалагчид дасан зохицох яаралтай хэрэгцээг нэмэгдүүлдэг. Өнөөдөр нээлтээ хийж буй Astra хувилбарыг хамгаалагчид аюулгүй код хянах, нөхөөс хийх зэрэг ажлуудыг гүйцэтгэхэд ашиглах боломжтой.
Гэвч Astra нь эмзэг байдлын нотлох-концепц ашиглах код үүсгэх зэрэг илүү дэвшилтэт кибер аюулгүй байдлын даалгаврыг биелүүлэхээс татгалзана. OpenAI Daybreak-ээр дамжуулан бид ирэх долоо хоногуудад хандалтыг өргөжүүлж, хязгаарлалт багатай хамгаалалтын арга хэмжээнүүдийг нэвтрүүлэхээр төлөвлөж байна. Энэ нь эмзэг байдал болон концепцийн нотолгооны баталгаажуулалт, хортой програм хангамжийн шинжилгээ, илрүүлэлтийн инженерчлэл зэрэг илүү олон хамгаалалтын ажлын урсгалыг хэрэгжүүлэх боломжийг олгоно.
Мөн GPT‑5.6 Sol-д зориулсан хамгаалалтын цогцод тулгуурлан болзошгүй кибер урвуулан ашиглалтаас хамгаалах арга хэмжээгээ бэхжүүлсэн. Үүнд болзошгүй jailbreak-үүдийг илүү сайн тэсвэрлэх загварын тэсвэртэй байдлыг сайжруулах болон мониторингийн системүүдэд зориулсан илүү их контекст багтана. Мөн манай дотоод улаан багийн халдагчидтай хийсэн автоматжуулсан үнэлгээг багтаасан дотоод болон гадаад нарийн туршилтаа үргэлжлүүлсэн. Манай кибер хамгаалалт, туршилтын талаарх дэлгэрэнгүй мэдээллийг Astra-гийн аюулгүй байдлын тойм болон системийн карт(шинэ цонхонд нээгдэнэ)-аас авах боломжтой..
GPT‑6 Astra-г хариуцлагатайгаар уялдуулж, нэвтрүүлэх
Astra бол манай хамгийн сайн нийцүүлэлттэй загвар юм. Astra нь нямбай ажиллах, даалгаврын хязгаарыг хүндэтгэх, ил тод харилцах тал дээр онцгой сайн. Энэхүү ажил нь эхнээс нь дуустал хүний зорилготой нийцсэн хэвээр байх загваруудыг сургахад чиглэсэн, удаан хугацаанд хэрэгжиж буй манай судалгааны хөтөлбөрийн хамгийн сүүлийн үр дүн юм.
Эмзэг орчинд Astra нь эрсдэлтэй нь дүйцэхүйц болгоомжтой ажилладаг. Зүй бус үйлдэл гаргуулахаар өрсөлдөгчийн байдлаар сонгосон компьютер ашиглах даалгавруудын үнэлгээнд Astra нь санаандгүй үр дагавраас зайлсхийхдээ илүү амжилттай байсан. Анхдагчаар санал болгодог нэмэлт аюулгүй байдлын арга хэмжээнүүдийг ашиглан ажиллуулахад гүйцэтгэл нь бүр ч илүү сайжирсан.
Astra нь туршсан бусад бүх хил хязгаарын загвараас цөөн нийцээгүй үр дагавар үүсгэдэг. Шударга харьцуулахын тулд бид the OpenAI Responses API(шинэ цонхонд нээгдэнэ) болон Anthropic Messages API(шинэ цонхонд нээгдэнэ)-ийн аль алинд нь ашиглах боломжтой эхнээсээ суурилсан компьютер ашиглах хэрэгслүүдэд үндэслэсэн ерөнхий зориулалтын компьютер ашиглах агентын хамгаалалтыг ашигласан бөгөөд Codex болон ChatGPT Ажил хэрэглэгчдэд ердийн үед хэрэгжүүлдэг нэмэлт хамгаалалтыг (автомат шалгалт, баталгаажуулалтын бодлого) ашиглаагүй.
Astra нь мөн хэрэглэгчийн тогтоосон бөгөөд орчноос нь илэрхий болох хязгаарын хүрээнд ажиллах магадлал өндөртэй. Дотоод үнэлгээгээр Astra Codex Автомат шалгалтын татгалзлыг хэзээ ч тойрч гарахыг оролдоогүй. Автомат шалгалтыг зориудаар тойрч болохоор тохируулсан бөгөөд өөрөөр даалгаврыг гүйцэтгэх боломжгүй байсан ч энэ нь хэвээр байв. Орчны хязгаарлалтыг ийнхүү хүндэтгэж буй нь энэ нийтлэлийн оршил хэсэгт хуваалцсан боломжгүй кибер даалгаврын үнэлгээний үр дүн болон манай системийн карт(шинэ цонхонд нээгдэнэ)-д баримтжуулсан бусад дүгнэлттэй нийцэж байна.
Astra нь хэрэглэгчтэй ил тод харилцах чиглэлээр мөн шинэ үзүүлэлт тогтоож байна. Нэг үнэлгээгээр Astra нь GPT‑5.6 Sol-оос өөрийн чадавх болон боломжуудын талаар буруу ойлголт төрүүлэх магадлал гурав дахин бага байна.
Чадавхийн талаарх хий үзэгдлийн үнэлгээнд Astra нь GPT‑5.6 Sol-той харьцуулахад мэдэгдэхүйц сайжирч, өөрийн чадавхийн талаар төөрөгдүүлсэн мэдэгдэл цөөн гаргаж байна.
Манай үнэлгээгээр Astra-гийн бичгээр илэрхийлсэн сэтгэн бодох үйл явцыг GPT‑5.6 Sol-ийнхоос хянахад илүү хэцүү болохыг тогтоосон. Энэ нь Astra-д хяналтаас зайлсхийхийг ил тод хүссэн туршилтад үндэслэсэн. Үүнийг Astra нь энгийн даалгаварт бичгээр илэрхийлсэн сэтгэн бодох үйл явцаа илүү сайн хянах чадвартай, мөн цөөн бичмэл алхмаар асуудал шийдэх чадвартай холбоотой гэж үзэж байна. Astra нарийн төвөгтэй даалгаварт шаардлагатай сэтгэн бодох үйл явцыг нуухад бэрхшээлтэй хэвээр байгаа бололтой ч бид энэ бууралтад нухацтай хандаж байна. Хяналт тавих боломжийг сайжруулах нь судалгааны тэргүүлэх чиглэл хэвээр байгаа бөгөөд дагалдах системийн карт(шинэ цонхонд нээгдэнэ) нь бидний олдворууд болон үргэлжилж буй ажлын талаар дэлгэрэнгүй өгүүлдэг.
Нийцүүлэлтийн сургалт нь байршуулалтад хандах бидний арга барилын гол хэсэг юм. Хамгаалалтын нэмэлт давхарга болгон аюултай зан төлөвийг илрүүлж, хязгаарлахад туслахын тулд Codex Автомат шалгалт(шинэ цонхонд нээгдэнэ) зэрэг системийн хамгаалалт, мөн агентуудын сэтгэн бодох үйл явц болон үйлдлийн мониторингийг боловсруулдаг. Манай аюулгүй байдлын шинэчлэлтэд тайлбарласны дагуу, нийцгүй байдлыг харах боломжтой болж, түүний хамгийн ноцтой тохиолдлуудыг хязгаарлахад туслахын тулд Astra ангиллын загваруудад үйлдвэрлэлийн орчинд нийцгүй байдлын мониторинг мөн нэвтрүүлж байна. Эдгээр хамгаалалт нь дотоод нэвтрүүлэлтийн мониторингтой төстэй бөгөөд загварын сэтгэн бодох үйл явц, үйлдэлд зөвшөөрөлгүй зан төлөв байгаа эсэхийг шалгаж, зөвшөөрөлгүй байж болзошгүй үйл ажиллагааг автоматаар зогсоодог ангилагчдын системээс бүрдэнэ.
Astra-гийн кибер аюулгүй байдлын чадавх мэдэгдэхүйц нэмэгдсэн тул энэхүү нэвтрүүлэлтийг аюулгүй, хамгаалалттай байлгахад онцгой анхаарч байна. Аюулгүй байдлын нэмэлт шалгалтууд хамгаалалтын кибер аюулгүй байдлын ажлыг оролцуулан хууль ёсны ажлыг заримдаа удаашруулж, түр зогсоож эсвэл бүрэн зогсоож болно. ChatGPT эсвэл Codex-д даалгавар түр зогсвол үргэлжлүүлэхийн өмнө тухайн үйлдлийг хянахыг танаас хүсэж магадгүй. API-д даалгавар зогсоно. Эдгээр шалгалт нь заримдаа хууль ёсны ажлыг тасалдуулж болох бөгөөд шаардлагагүй тасалдлыг бууруулахын тулд бид энэ системийг үргэлжлүүлэн сайжруулж байна. Нийцгүй байдлын мониторинг нь нийцүүлэлтийг орлож чадахгүй: эдгээр хамгаалалт оролцох шаардлагагүй байхаар зөвшөөрөгдсөн хүрээндээ найдвартай үлддэг загваруудыг бүтээх нь бидний зорилго юм.
Бэлэн байдал
GPT‑6 Astra нь өнөөдөр хязгаарлагдмал тооны байгууллагад нэвтэрч эхэлж байгаа бөгөөд ирэх өдрүүдэд бүх ChatGPT Plus, Pro, Business болон Enterprise хэрэглэгчдэд, мөн OpenAI API, Microsoft Azure болон AWS Bedrock-оор дамжуулан ашиглах боломжтой болно. Astra-ийн хэрэглээ нь одоогийн захиалгын эрхэд багтсан бөгөөд хэрэглэгчид болон байгууллагууд нэмэлт хэрэглээнд зориулж кредит худалдан авах боломжтой. Pro, Business болон Enterprise багцын хэрэглэгчид GPT‑6 Astra Pro-д мөн хандах эрхтэй болно. Enterprise-ийн администраторууд өөрсдийн ажлын талбарт Astra-г идэвхжүүлж болно; нэвтрүүлэх үед хандалт анхдагчаар идэвхгүй байна.
Astra нь шаардлага хангасан API хэрэглэгчдэд тэг өгөгдөл хадгалалтыг дэмждэг бөгөөд өнгөрсөн сард хуваалцсанчлан, хэрэглэгчийн нууцлалыг хадгалж, аюулгүй байдлын хяналтыг бэхжүүлэхээр Private Safety Processing -ийг туршиж байна.
Хөгжүүлэгчдэд зориулж GPT‑6 Astra нь OpenAI API-д gpt-6-astra нэрээр, мөн Microsoft Azure болон Amazon Bedrock-оор дамжуулан ашиглах боломжтой болно.
OpenAI API-ийн Standard үнэ нь 1 сая оролтын токен тутамд 10 $, 1 сая гаралтын токен тутамд 50 $ байна. Кэш унших болон бичихэд тусдаа үнэ үйлчилнэ. Хурдан горим нь API дахь GPT‑6 Astra-д ашиглах боломжтой бөгөөд Standard боловсруулалтын хурдаас 2 дахин хүртэл хурдан, Standard үнээс 2 дахин үнэтэй.
Мэргэжлийн
Мэргэжлийн | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
Browse comp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore чавхдаст дөрвөл (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Дотоод дизайны даалгавар | 50.0% | 47.4% | - | 35.8% | - | - |
Дотоод өгөгдлийн шинжлэх ухааны даалгавар | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis оюун ухааны индекс v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Код бичих
| Кодчилол | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Өргөтгөсөн (оноо) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Үндсэн (оноо) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Дотоод өгөгдлийн сангийн шилжүүлэлтийн даалгаврууд | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis код бичих агентын индекс v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Академик
Академик | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Шинжлэх ухаан 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Түвшин 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Хүн төрөлхтний сүүлийн шалгалт (хэрэгсэлтэй) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
Шинжлэх ухаан ба эрүүл мэнд
Тохируулга
Тохируулга | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Дотоод компьютер ашиглалтын аюулгүй байдлын жишиг үзүүлэлт (бага байх тусам сайн) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
Автомат шалгалт бүхий дотоод компьютер ашиглалтын аюулгүй байдлын жишиг үзүүлэлт (бага байх тусам сайн) | 1.8% | 4.3% | - | - | - | - |
Дотоод тойрч гарах жишиг үзүүлэлт (бага байх тусам сайн) | 0.00% | 0.29% | - | - | - | - |
ExploitGym өгөөш систем (бага байх тусмаа сайн) | 0.0% | 48.2% | - | - | - | - |
Боломжгүй ExploitGym | 100.0% | - | - | - | - | - |
Дотоод хийсвэрлэлтийн жишиг үзүүлэлт (бага байх тусам сайн) | 4.2% | 12.2% | - | - | - | - |
Урт контекст
Урт контекст | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96.3% | 73.8% | - | - | - | - |
Хийсвэр сэтгэн бодох
| Хийсвэр сэтгэн бодох | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
Үнэлгээний оноо нь ямар ч хүчин чармайлтын түвшинд хамгийн өндөр байна. GPT үнэлгээг манай судалгааны орчинд эсвэл API-аар дамжуулан ажиллуулсан бөгөөд системийн команд, ашиглах боломжтой хэрэгсэл зэрэг ялгаанаас шалтгаалан үйлдвэрлэлийн ChatGPT‑ээс ялимгүй өөр гаралт өгч болзошгүй.
Зүүлт тайлбарууд
- 1
ARC-AGI-3 дээр GPT-6 Astra-г манай responses API туршилтын орчноор ажиллуулсан бөгөөд энэ нь бодит нөхцөл дэх гүйцэтгэлд илүү нийцүүлэхийн тулд хоёр тохиргоог өөрчилдөг. Эдгээр өөрчлөлтүүд нь ARC-AGI-3-ыг тусгайлан чиглээгүй.
- 2
GPT-5.6 Sol нь манай API, ChatGPT Codex болон ChatGPT Ажилд ашиглах боломжтой хувилбарыг хэлнэ. ChatGPT-ийн Чат дахь хувилбар нь ялимгүй өөр.
- 3
OSWorld V2-Offline нь интернетэд холбогдохгүйгээр ажилладаг эх OSWorld V2-ын дэд багц юм. OSWorld-V2 Offline дээрх Claude загварын гүйцэтгэлийг зохиогчид албан ёсны тэргүүлэгчдийн жагсаалтад(шинэ цонхонд нээгдэнэ) дахин гаргасан.OSWorld 2.0 дээр Claude-ийн оноог албан ёсны тохиргоог ашиглан тооцдог бөгөөд Fable 5.1 системийн картын өөрчилсөн даалгавар болон өөрчилсөн үнэлгээг ашигладаггүй.
- 4
- 5
BenchCAD дээр Claude-ийн оноо нь үнэлгээнд хийсэн 3 өөрчлөлтийг тусгасан бөгөөд эдгээрийг Fable 5.1 системийн карт(шинэ цонхонд нээгдэнэ)-д дэлгэрэнгүй тайлбарласан.
- 6
Гуан Ян, Викториа Эберт, Назиф Тамер, Брайан Сиюань Чжэн, Луиза Поццобон, Ной А. Смит "LEGATO: Хэвлэмэл OMR-д зориулсан өргөн хүрээний, төгсгөлөөс төгсгөл хүртэлх ерөнхийшүүлэх боломжтой арга(шинэ цонхонд нээгдэнэ)." arXiv:2506.19065, 2025 он.
- 7
Марк Р. Х. Готам, Морин Редбонд, Бруно Бауэр, Петер Йонас. "OpenScore чавхдаст дөрвөлийн корпус(шинэ цонхонд нээгдэнэ)." Хөгжим судлалын дижитал номын сангийн 10 дахь олон улсын хурлын эмхэтгэл, х. 49–57. ACM, 2023.
- 8
FrontierCode дээр GPT-6 Astra-г Codex дахь хөгжүүлэгчийн мессежийнх нь хэсэгтэй(шинэ цонхонд нээгдэнэ) төстэй хөгжүүлэгчийн мессежээр ажиллуулсан: "Хэт олон тестийн файл үүсгэхээс зайлсхий. Зөвхөн репозиторын дүрэм журмаар шаардсан эсвэл одоо байгаа файл тохирох газар байхгүй үед л шинэ тестийн файл үүсгээрэй. Холбогдолгүй цэвэрлэгээ болон шаардлагагүй төвөгтэй байдлаас зайлсхийхээрэй. Тохиромжтой одоо байгаа хэрэгслүүдийг дахин ашиглаарай. Холбогдох репозиторын зааврыг уншиж, ойролцоох код, тест, баримт бичиг болон CI-г шалга. Тогтсон дүрэм журмыг дага. Зорилго нь цэвэр, нэгтгэхэд бэлэн код юм." Командыг үнэлгээнд зориулан оновчлоогүй байна.
- 9
Эхнийх нь тоон шулуун дагуу хэчнээн хол явсан ч анхны тоонууд хоорондоо хэр ойрхон тохиолдож болох тухай юм. Арав гаруй жилийн турш хамгийн сайн мэдэгдэж байсан үр дүн нь хязгааргүй олон хос анхны тоо хоорондоо 246-аас ихгүй зайтай байдгийг тогтоосон. Жулиа Штадльманн(шинэ цонхонд нээгдэнэ) саяхан уг хязгаарыг 240 болгож сайжруулсан. Astra нь 186 гэсэн илүү хүчтэй хязгаарыг тогтооход тусалсан бөгөөд энэ нь энэхүү бага зайн дотор хязгааргүй олон хос тохиолддогийг харуулж байна. Анхны тоонуудын богино зай: Баталгаа(шинэ цонхонд нээгдэнэ) болон дэмжих судалгаа(шинэ цонхонд нээгдэнэ).
- 10
Хоёр дахь нь анхны тоонуудын хоорондох ер бусын том зай завсрын тухай юм. Astra 80 гаруй жилийн турш өөрчлөгдөөгүй байсан эдгээр зай завсрын хязгаар дахь нэг гишүүнийг сайжруулсан. Бид хоёр үр дүнгийн нотолгоо, товчилсон бодлын хэлхээ болон баталгаажуулалтын материалыг хуваалцаж байна. Анхны тоонуудын том зай завсар: Нотолгоо(шинэ цонхонд нээгдэнэ) болон дэмжих судалгаа(шинэ цонхонд нээгдэнэ).
- 11
- 12
- 13
- 14
ExploitBench (2026 оны 6–8-р сар) нь Chrome-ын тогтвортой 13 хувилбарт хамаарах өндөр ноцтой байдлын V8 эмзэг байдлыг агуулдаг. Энэхүү жишиг шалгалт нь агентууд тодорхойлсон эмзэг байдал тус бүрийг ашиглан V8 болон Linux-д зориулсан Chrome-ын албан ёсны хувилбаруудад дурын код гүйцэтгэж чадах эсэхийг шалгадаг. Үнэлгээний хязгаарлалтын хүрээнд багтсан зарим эмзэг байдал нь дурын код гүйцэтгэх боломж олгохгүй байж болох тул 100%-ийн амжилтын түвшинд хүрэх боломжгүй байж магадгүй. Тэмдэглэл: GPT-5.6 Sol-ын 5.5%-ийн оноо нь жишиг шалгалтын 300 алхмын хязгаарлалтын үр дагавар бөгөөд энэ нь Max ашигладаг бодит хэрэглэгчдэд байдаг хязгаарлалт биш юм. Ижил төстэй тохиргоонд загвар нь цөөн хязгаарт хүрэх үед 11.5%-ийн оноо авсан.
- 15
Jeremy Spence болон бусад. “Агентлаг кибер аюулгүй байдлын дараагийн сорилт: Бодитой, өгөгдлийн бохирдолгүй урвуу инженерчлэлийн жишиг үнэлгээ(шинэ цонхонд нээгдэнэ).” arXiv:2608.11469v1, 2026.
- 16
Бид гуравдагч талын загваруудыг туршихдаа илүү энгийн судалгааны тохиргоог ашигладаг. Codex нь илүү нарийн төвөгтэй үйлдвэрлэлийн тохиргоотой тул түүхий загварын алдааны түвшин өөр байж болно. Үйлчилгээ үзүүлэгч талын хамгаалалтын арга хэмжээ болон компьютерийн хэрэгслийн хэрэгжилт мөн ялгаатай хэвээр байна. Энэ нь дотоод судалгааны тохиргоо учраас хэрэглэгчид Codex дээр баталгаажуулалтгүй хувилбартай тулгардаггүй.
- 17
