Үндсэн агуулга руу алгасах
OpenAI

2026 оны наймдугаар сарын 13

Хэрэглээний AI

GPT‑5.6 ашиглан бүтээгчдэд зориулсан гарын авлага

Үйлдвэрлэлийн орчинд ажиллаж буй стартапуудаас авсан техникийн сургамж

Ачаалж байна…

GPT‑5.6 үнэ, гүйцэтгэлийн шинэ жишиг тогтоолоо

GPT‑5.6 загварын бүл нь хил хязгаарын түвшний агентын гүйцэтгэлийг эрс хямдруулахын зэрэгцээ боломжийн хил хязгаарыг улам тэлж байна.

Энэ гарын авлагад стартапууд загварыг илүү ухаалгаар сонгож, сэтгэн бодох үйл явцын залгамж чанар, олон агентын зохицуулалт, програмчлалын аргаар хэрэгсэл дуудах ажиллагааг дэмждэг API-ийн шинэ удирдлагыг ашиглан зардлын өчүүхэн хэсгээр илүү хурдан, чадварлаг агентуудыг хэрхэн бүтээж байгааг харуулна.

Шууд ашиглахад илүү сайн туршлага

GPT‑5‑аас хойш загварын үе бүр цөөн токеноор илүү урт хугацааны даалгавар гүйцэтгэхийг зорьж ирсэн. GPT‑5.6 энэ чиглэлийг үргэлжлүүлж, үндсэн хамгаалалтад маш бага өөрчлөлт оруулан агентын гүйцэтгэлийг сайжруулж, зардлыг бууруулсан.

Зардлын нийт үр ашгийн өсөлтийг сэтгэн бодох ачаалал багатай үед ч нарийвчлал нэмэгдсэн нь улам ахиулж байна. Жишээлбэл, хамгаалалтыг ижил байлгахад Agents’ Last Exam сорил дээр «бага» сэтгэн бодох ачаалалтай GPT‑5.6 Sol нь «өндөр» ачаалалтай GPT‑5.5‑аас илүү гүйцэтгэл үзүүлсэн. Үйлдвэрлэлийн орчны туршилтуудад ч ижил үр дүн ажиглагдсан. Стартапууд өмнөх өгөгдмөл тохиргооноос сэтгэн бодох ачааллыг бууруулснаар олон төрлийн ажлын урсгалын зардал мэдэгдэхүйц багассаныг мэдээлсэн.

Бид GPT‑5.6-г хамгаалалтдаа шууд оруулахад бага сэтгэн бодох ачаалал хамгийн сайн үр дүн өгсөн. Энэ нь өгөгдөл байхгүйг таньж, буруу мөрөөр хөөгөөгүй бөгөөд цөөн токеноор зөв хариунд хүрсэн.
— Иззи Миллер, Hex(шинэ цонхонд нээгдэнэ)-ийн хиймэл оюуны судалгааны ахлагч

Загварын сонголт

Өмнө нь урт хугацааны хэрэглээнд хамгийн боломжит өндөр сэтгэн бодох түвшинтэй тэргүүлэх загварт шилжих нь хамгийн сайн сонголт байв. Үүний гол шалтгаан нь эдгээр загвар урт контекст боловсруулах, хэрэгсэл дуудахдаа зардалд оновчлогдсон загваруудаас хавьгүй чадварлаг байсанд оршино. 5.6 бүл гарснаар энэ байдал өөрчлөгдсөн: туршилтын үеийн тооцооллыг нэмэгдүүлэхэд Luna болон Terra нь GPT‑5.4, 5.5-тай ойролцоо гүйцэтгэл үзүүлэхийн зэрэгцээ хавьгүй хямд байж чадна.

1 -н 3
Luna нь GPT‑5.5‑ын мэдээлэл задлах нарийвчлалын 98%-ийг зардлын арван наймны нэгээр хадгалдаг. Ингэснээр манай агентууд олон ажлын урсгалд практикт ашиглахуйц үнээр баримт бичгийг өндөр чанартай ойлгох боломжтой болдог.
— Серхий Шчохолиев, Hypha(шинэ цонхонд нээгдэнэ)-ийн агентын инженерчлэлийн ахлагч

BrowseComp дахь даалгавруудыг авч үзье. Энэ нь загварын олдоц муутай баримтуудыг хайж олох чадварыг шалгадаг хайлтад суурилсан жишиг сорил юм. Гурван сарын өмнө GPT‑5.5 (Маш өндөр) энэ жишиг сорилд нийт $33.27-ын зардлаар 84.36%-ийн оноо авсан. GPT‑5.6 Luna (Маш өндөр) нээлтийн үеэр $1.33-ын зардлаар 84.04%-ийн оноо авч, үндсэндээ ижил гүйцэтгэл үзүүлсэн. Үүнээс хойш бид үнийг дахин бууруулсан. Хамгийн сүүлийн үнийн бууралтын талаар дэлгэрэнгүй уншина уу.

5.6 бүлийн жижиг загварууд нь их хэмжээний ажлын ачаалал, хоцролтод мэдрэмтгий харилцан үйлдэл болон агентын ажлын урсгал дахь давтагдах алхмуудад нэн тохиромжтой. Жишээлбэл, агентын шинжилгээний өмнө гараар бичсэн тэмдэглэлийг боловсруулдаг хууль зүйн технологийн стартап ажиллуулдаг бол бүх үйл явцад хил хязгаар загвар ашиглахын оронд мэдээлэл задлахдаа Terra эсвэл Luna-г ашиглан зардлаа мэдэгдэхүйц хэмнэх боломжтой.

Илүү үр ашигтай агентуудын архитектурыг бүтээхэд Responses API-г хөгжүүлэх нь

Бид GPT‑5.6‑г шууд ашиглах үеийн гүйцэтгэлийг сайжруулаад зогсохгүй, нэмэлт үр өгөөж бий болгох шинэ суурь боломжуудыг Responses API-д нэвтрүүлсэн. Агентуудыг илүү үр ашигтай ажиллуулах, харилцан бие биеэ нөхөх архитектурын гурван шийдлээр GPT‑5.6‑г эхнээс нь дуустал сургасан:

  1. Хийсэн ажлыг дахин ашиглах: загварын ээлжүүдийн хооронд сэтгэн бодох үйл явцыг хадгалах(шинэ цонхонд нээгдэнэ), удаан үргэлжилсэн харилцан яриаг уугуул шахалтаар(шинэ цонхонд нээгдэнэ) багасгах боломж олгосноор загвар төөрөлдөхгүй, өмнөх контекстийг дахин бүтээх шаардлагагүйгээр урт хугацааны даалгаварт ажлын уялдааг хадгална.
  2. Тохиромжтой үед зэрэгцүүлэн задлах: уугуул олон агентын зохицуулалт(шинэ цонхонд нээгдэнэ) ашигласнаар олон агентыг зэрэгцээ ажлын урсгалуудаар зохицуулж, нарийн төвөгтэй даалгаврыг хурдан дуусгана.
  3. Тодорхой үр дүнтэй ажлыг кодод шилжүүлэх: програмчлалын аргаар хэрэгсэл дуудах(шинэ цонхонд нээгдэнэ) боломж ашиглан хэрэгслийн гаралтыг загварын контекстийн цонхны гадна шүүж, нэгтгэж, зохицуулна. Ингэснээр загварын токеныг дүгнэлт хийхэд зориулж, зардал, хоцролт, контекстийн доройтлыг бууруулна.

Эдгээрийг хамтад нь ашиглавал ялгаа асар их байж болно. Жишээлбэл, ARC-AGI-3 дээр GPT‑5.6 Sol стандарт хамгаалалттайгаар 13.3%-ийн оноо авсан. Харин хадгалсан сэтгэн бодох үйл явц болон шахалтыг идэвхжүүлсний дараа гаралтын токеныг ойролцоогоор 6 дахин бага ашигласан ч оноо 38.3% болж өссөн. Загварт өөрчлөлт оруулаагүй ч гүйцэтгэл бараг гурав дахин өссөн. Манай ARC-AGI-3 хамгаалалтын судалгааны талаар эндээс дэлгэрэнгүй уншина уу.

Програмчлалын аргаар хэрэгсэл дуудах

Агентын ажлын урсгалд ихэвчлэн хоёр төрлийн ажил ордог:

  1. Дүгнэлт шаарддаг даалгавар
  2. Өгөгдлийг голчлон зөөх, шүүх, нэгтгэх ажил

Агент 100 тайлан татаж, огноогоор шүүн, холбогдох гүйлгээг илрүүлэх үед загвар контекстийн цонхон дахь завсрын үр дүн бүрийг сэтгэн бодож боловсруулах ёсгүй. Programmatic Tool Calling нь GPT‑5.6‑д хэрэгслүүдийг зохицуулах JavaScript бичих, бие даасан дуудлагуудыг зэрэгцүүлэн ажиллуулах, гаралтыг нь контекстийн цонхны гадна боловсруулах боломж олгодог. Ингэснээр загвар оюун ухаан шаардсан зүйл буюу дүгнэлт хийхэд төвлөрнө.

Санхүүгийн судалгаанд тайлан мэдээг найдвартай татах, хэрэгслүүдийг зохицуулах, тоон мэдээллийг нягтлан боловсруулах нь хамгийн хэцүү. Бидний үнэлгээгээр Programmatic Tool Calling ашигласан GPT‑5.6 нь үнэлгээний шалгуурын дагуух чанарыг хадгалахын зэрэгцээ оролтын токеныг 21%-иар бага ашигласан. Энэ нь санхүүгийн судалгааг зөвхөн хэлэлцэж чаддаг агент болон бодитоор гүйцэтгэж чаддаг агентын ялгаа юм.
— Алекс Ван, Rogo(шинэ цонхонд нээгдэнэ)-ийн хэрэглээний хиймэл оюуны мэргэжилтэн

Олон агент

Зэрэгцүүлэн гүйцэтгэх боломжтой нарийн төвөгтэй даалгаварт үйлдэл, сэтгэн бодох ажиллагааг агентын олон ажлын урсгалд хуваарилснаар даалгаврыг хурдан дуусгаж, оюун ухааны чадамжийг нэмэгдүүлнэ. Ийм тохиргоонд үндсэн агент дэд агентуудыг зохицуулж, тэдэнд даалгавар хуваарилна. Дэд агентууд зорилгоо зэрэгцүүлэн биелүүлж, эцэст нь гаралтаа нэгтгэн боловсруулах үндсэн агент руу буцаана. Багууд Responses API-д олон агентын горимыг идэвхжүүлснээр(шинэ цонхонд нээгдэнэ) уг боломжийг шууд ашиглаж эхлэх боломжтой. ChatGPT дахь Ultra чадамжийн тохиргоо мөн ийм зарчмаар ажилладаг.

1 -н 2
Qualia нээлттэй хүрээтэй судалгааны асуудлууд дээр агентуудын баг ажиллуулдаг бөгөөд GPT‑5.6 Sol бидний хэрэгцээнд яг тохирсон. Энэ нь GPT‑5.5‑аас мэдэгдэхүйц сайжирч, бидний туршсан бараг бүх загвараас хурдан дуусгасан тул удалгүй бидний үндсэн OpenAI загвар болсон.
— Э Чи, Quadrillion(шинэ цонхонд нээгдэнэ)-ийн үүсгэн байгуулагч

GPT‑5.6 хэдэн дэд агент тохиромжтой болон тэдгээрийг хэзээ үүсгэхийг сайн мэддэг ч олон агентын үйлдлийг нарийн чиглүүлэх боломжтой. Дэд агентуудыг хэзээ дуудахыг загварт зааж өгснөөр нэмэлт токены зардал нь илүү сайн гүйцэтгэл авчрах нөхцөлд л агент үүсгэх магадлалыг нэмэгдүүлнэ.

Промптын кэшлэлт

Загварын бүх бүлд өгөгдлийн кэшийн TTL-ийг доод тал нь 30 минут болгож сунгасан бөгөөд одоо загварын контекстийн цонхонд кэшийн зааг цэгүүдийг тодорхой дүрмээр тохируулах боломжтой. Ингэснээр стартапууд кэшээс амжилттай онох хувиа мэдэгдэхүйц нэмэгдүүлсэн.

Бид 29,000 токентой дундын өгөгдөлд кэшийн зааг цэгүүд болон ажлын талбар бүрийн түлхүүрүүдийг нэмснээр кэшлэгдээгүй оролтыг 28%-иар бууруулсан. 30 минутын кэшийн хугацаа ч том дэвшил болсон: манай агентууд ажиллагаа бүрийг шинээр эхлэхийн оронд ижил контекстийг дахин ашиглах боломжтой болсон.
— Лоренцо Жентиле, Ploy(шинэ цонхонд нээгдэнэ)-ийн хиймэл оюуны инженер

Кэшийн зааг цэгүүдийг тохируулахаас гадна тохирох prompt_cache_key(шинэ цонхонд нээгдэнэ)-г үргэлжлүүлэн ашигласнаар хүсэлт өмнө нь ижил угтварыг боловсруулсан тооцооллын хөдөлгүүрт очих магадлал нэмэгдэж, хоцролт буурна.

Дүгнэлт

Эдгээр жишээнээс агент бүтээх эдийн засгийн нөхцөл хэр их өөрчлөгдсөн нь онцгой харагдана.

Өмнө нь алхам бүрд хил хязгаар загвар шаарддаг байсан хэрэглээнүүд одоо жижиг загвар ашиглах, сэтгэн бодох ачааллыг тохируулах, архитектурын үр ашигтай сонголт хийх замаар зардлын өчүүхэн хэсгээр ижил түвшний эсвэл илүү сайн үр дүнд хүрэх боломжтой.

Та бүхний юу бүтээхийг харахыг тэсэн ядан хүлээж байна!

  • 2026
  • API платформ

Зохиогчдын тухай

Энэхүү гарын авлагыг GPT‑5.6 дээр бүтээж буй стартапуудтай анхны туршилтаас үйлдвэрлэлийн орчин хүртэл нягт хамтран ажилласан туршлагадаа үндэслэн Самарт Маддуру(шинэ цонхонд нээгдэнэ), Прашант Митал(шинэ цонхонд нээгдэнэ), Дэйв Лео(шинэ цонхонд нээгдэнэ), Жюльен Райман(шинэ цонхонд нээгдэнэ) нар боловсруулав.