GPT‑5.6 ашиглан бүтээгчдэд зориулсан гарын авлага
Үйлдвэрлэлийн орчинд ажиллаж буй стартапуудаас авсан техникийн сургамж
GPT‑5.6 загварын бүл нь хил хязгаарын түвшний агентын гүйцэтгэлийг эрс хямдруулахын зэрэгцээ боломжийн хил хязгаарыг улам тэлж байна.
Энэ гарын авлагад стартапууд загварыг илүү ухаалгаар сонгож, сэтгэн бодох үйл явцын залгамж чанар, олон агентын зохицуулалт, програмчлалын аргаар хэрэгсэл дуудах ажиллагааг дэмждэг API-ийн шинэ удирдлагыг ашиглан зардлын өчүүхэн хэсгээр илүү хурдан, чадварлаг агентуудыг хэрхэн бүтээж байгааг харуулна.
GPT‑5‑аас хойш загварын үе бүр цөөн токеноор илүү урт хугацааны даалгавар гүйцэтгэхийг зорьж ирсэн. GPT‑5.6 энэ чиглэлийг үргэлжлүүлж, үндсэн хамгаалалтад маш бага өөрчлөлт оруулан агентын гүйцэтгэлийг сайжруулж, зардлыг бууруулсан.
Зардлын нийт үр ашгийн өсөлтийг сэтгэн бодох ачаалал багатай үед ч нарийвчлал нэмэгдсэн нь улам ахиулж байна. Жишээлбэл, хамгаалалтыг ижил байлгахад Agents’ Last Exam сорил дээр «бага» сэтгэн бодох ачаалалтай GPT‑5.6 Sol нь «өндөр» ачаалалтай GPT‑5.5‑аас илүү гүйцэтгэл үзүүлсэн. Үйлдвэрлэлийн орчны туршилтуудад ч ижил үр дүн ажиглагдсан. Стартапууд өмнөх өгөгдмөл тохиргооноос сэтгэн бодох ачааллыг бууруулснаар олон төрлийн ажлын урсгалын зардал мэдэгдэхүйц багассаныг мэдээлсэн.
Өмнө нь урт хугацааны хэрэглээнд хамгийн боломжит өндөр сэтгэн бодох түвшинтэй тэргүүлэх загварт шилжих нь хамгийн сайн сонголт байв. Үүний гол шалтгаан нь эдгээр загвар урт контекст боловсруулах, хэрэгсэл дуудахдаа зардалд оновчлогдсон загваруудаас хавьгүй чадварлаг байсанд оршино. 5.6 бүл гарснаар энэ байдал өөрчлөгдсөн: туршилтын үеийн тооцооллыг нэмэгдүүлэхэд Luna болон Terra нь GPT‑5.4, 5.5-тай ойролцоо гүйцэтгэл үзүүлэхийн зэрэгцээ хавьгүй хямд байж чадна.
BrowseComp дахь даалгавруудыг авч үзье. Энэ нь загварын олдоц муутай баримтуудыг хайж олох чадварыг шалгадаг хайлтад суурилсан жишиг сорил юм. Гурван сарын өмнө GPT‑5.5 (Маш өндөр) энэ жишиг сорилд нийт $33.27-ын зардлаар 84.36%-ийн оноо авсан. GPT‑5.6 Luna (Маш өндөр) нээлтийн үеэр $1.33-ын зардлаар 84.04%-ийн оноо авч, үндсэндээ ижил гүйцэтгэл үзүүлсэн. Үүнээс хойш бид үнийг дахин бууруулсан. Хамгийн сүүлийн үнийн бууралтын талаар дэлгэрэнгүй уншина уу.
5.6 бүлийн жижиг загварууд нь их хэмжээний ажлын ачаалал, хоцролтод мэдрэмтгий харилцан үйлдэл болон агентын ажлын урсгал дахь давтагдах алхмуудад нэн тохиромжтой. Жишээлбэл, агентын шинжилгээний өмнө гараар бичсэн тэмдэглэлийг боловсруулдаг хууль зүйн технологийн стартап ажиллуулдаг бол бүх үйл явцад хил хязгаар загвар ашиглахын оронд мэдээлэл задлахдаа Terra эсвэл Luna-г ашиглан зардлаа мэдэгдэхүйц хэмнэх боломжтой.
Бид GPT‑5.6‑г шууд ашиглах үеийн гүйцэтгэлийг сайжруулаад зогсохгүй, нэмэлт үр өгөөж бий болгох шинэ суурь боломжуудыг Responses API-д нэвтрүүлсэн. Агентуудыг илүү үр ашигтай ажиллуулах, харилцан бие биеэ нөхөх архитектурын гурван шийдлээр GPT‑5.6‑г эхнээс нь дуустал сургасан:
- Хийсэн ажлыг дахин ашиглах: загварын ээлжүүдийн хооронд сэтгэн бодох үйл явцыг хадгалах(шинэ цонхонд нээгдэнэ), удаан үргэлжилсэн харилцан яриаг уугуул шахалтаар(шинэ цонхонд нээгдэнэ) багасгах боломж олгосноор загвар төөрөлдөхгүй, өмнөх контекстийг дахин бүтээх шаардлагагүйгээр урт хугацааны даалгаварт ажлын уялдааг хадгална.
- Тохиромжтой үед зэрэгцүүлэн задлах: уугуул олон агентын зохицуулалт(шинэ цонхонд нээгдэнэ) ашигласнаар олон агентыг зэрэгцээ ажлын урсгалуудаар зохицуулж, нарийн төвөгтэй даалгаврыг хурдан дуусгана.
- Тодорхой үр дүнтэй ажлыг кодод шилжүүлэх: програмчлалын аргаар хэрэгсэл дуудах(шинэ цонхонд нээгдэнэ) боломж ашиглан хэрэгслийн гаралтыг загварын контекстийн цонхны гадна шүүж, нэгтгэж, зохицуулна. Ингэснээр загварын токеныг дүгнэлт хийхэд зориулж, зардал, хоцролт, контекстийн доройтлыг бууруулна.
Эдгээрийг хамтад нь ашиглавал ялгаа асар их байж болно. Жишээлбэл, ARC-AGI-3 дээр GPT‑5.6 Sol стандарт хамгаалалттайгаар 13.3%-ийн оноо авсан. Харин хадгалсан сэтгэн бодох үйл явц болон шахалтыг идэвхжүүлсний дараа гаралтын токеныг ойролцоогоор 6 дахин бага ашигласан ч оноо 38.3% болж өссөн. Загварт өөрчлөлт оруулаагүй ч гүйцэтгэл бараг гурав дахин өссөн. Манай ARC-AGI-3 хамгаалалтын судалгааны талаар эндээс дэлгэрэнгүй уншина уу.
Агентын ажлын урсгалд ихэвчлэн хоёр төрлийн ажил ордог:
- Дүгнэлт шаарддаг даалгавар
- Өгөгдлийг голчлон зөөх, шүүх, нэгтгэх ажил
Агент 100 тайлан татаж, огноогоор шүүн, холбогдох гүйлгээг илрүүлэх үед загвар контекстийн цонхон дахь завсрын үр дүн бүрийг сэтгэн бодож боловсруулах ёсгүй. Programmatic Tool Calling нь GPT‑5.6‑д хэрэгслүүдийг зохицуулах JavaScript бичих, бие даасан дуудлагуудыг зэрэгцүүлэн ажиллуулах, гаралтыг нь контекстийн цонхны гадна боловсруулах боломж олгодог. Ингэснээр загвар оюун ухаан шаардсан зүйл буюу дүгнэлт хийхэд төвлөрнө.
Зэрэгцүүлэн гүйцэтгэх боломжтой нарийн төвөгтэй даалгаварт үйлдэл, сэтгэн бодох ажиллагааг агентын олон ажлын урсгалд хуваарилснаар даалгаврыг хурдан дуусгаж, оюун ухааны чадамжийг нэмэгдүүлнэ. Ийм тохиргоонд үндсэн агент дэд агентуудыг зохицуулж, тэдэнд даалгавар хуваарилна. Дэд агентууд зорилгоо зэрэгцүүлэн биелүүлж, эцэст нь гаралтаа нэгтгэн боловсруулах үндсэн агент руу буцаана. Багууд Responses API-д олон агентын горимыг идэвхжүүлснээр(шинэ цонхонд нээгдэнэ) уг боломжийг шууд ашиглаж эхлэх боломжтой. ChatGPT дахь Ultra чадамжийн тохиргоо мөн ийм зарчмаар ажилладаг.
“Qualia нээлттэй хүрээтэй судалгааны асуудлууд дээр агентуудын баг ажиллуулдаг бөгөөд GPT‑5.6 Sol бидний хэрэгцээнд яг тохирсон. Энэ нь GPT‑5.5‑аас мэдэгдэхүйц сайжирч, бидний туршсан бараг бүх загвараас хурдан дуусгасан тул удалгүй бидний үндсэн OpenAI загвар болсон.”
“GPT‑5.6 бол OpenAI-аас гаргасан, бидний үзсэн хамгийн сайн зохицуулагч. Бид түүнд зургаан техникийн тодорхойлолтыг нэгэн зэрэг өгч, бүгдийг нь бичиж, бүтээж, хэлэлцэхийг хүсэхэд чанараа алдалгүй бүхнийг хяналтдаа байлгасан.”
GPT‑5.6 хэдэн дэд агент тохиромжтой болон тэдгээрийг хэзээ үүсгэхийг сайн мэддэг ч олон агентын үйлдлийг нарийн чиглүүлэх боломжтой. Дэд агентуудыг хэзээ дуудахыг загварт зааж өгснөөр нэмэлт токены зардал нь илүү сайн гүйцэтгэл авчрах нөхцөлд л агент үүсгэх магадлалыг нэмэгдүүлнэ.
Загварын бүх бүлд өгөгдлийн кэшийн TTL-ийг доод тал нь 30 минут болгож сунгасан бөгөөд одоо загварын контекстийн цонхонд кэшийн зааг цэгүүдийг тодорхой дүрмээр тохируулах боломжтой. Ингэснээр стартапууд кэшээс амжилттай онох хувиа мэдэгдэхүйц нэмэгдүүлсэн.
Кэшийн зааг цэгүүдийг тохируулахаас гадна тохирох prompt_cache_key(шинэ цонхонд нээгдэнэ)-г үргэлжлүүлэн ашигласнаар хүсэлт өмнө нь ижил угтварыг боловсруулсан тооцооллын хөдөлгүүрт очих магадлал нэмэгдэж, хоцролт буурна.
Эдгээр жишээнээс агент бүтээх эдийн засгийн нөхцөл хэр их өөрчлөгдсөн нь онцгой харагдана.
Өмнө нь алхам бүрд хил хязгаар загвар шаарддаг байсан хэрэглээнүүд одоо жижиг загвар ашиглах, сэтгэн бодох ачааллыг тохируулах, архитектурын үр ашигтай сонголт хийх замаар зардлын өчүүхэн хэсгээр ижил түвшний эсвэл илүү сайн үр дүнд хүрэх боломжтой.
Та бүхний юу бүтээхийг харахыг тэсэн ядан хүлээж байна!
- 2026
- API платформ
Зохиогчдын тухай
Энэхүү гарын авлагыг GPT‑5.6 дээр бүтээж буй стартапуудтай анхны туршилтаас үйлдвэрлэлийн орчин хүртэл нягт хамтран ажилласан туршлагадаа үндэслэн Самарт Маддуру(шинэ цонхонд нээгдэнэ), Прашант Митал(шинэ цонхонд нээгдэнэ), Дэйв Лео(шинэ цонхонд нээгдэнэ), Жюльен Райман(шинэ цонхонд нээгдэнэ) нар боловсруулав.


