Хэрхэн GPT‑5.6 хил хязгаарын оюун ухаан ба үр ашгийг нэгтгэх вэ
Хүмүүсийн манай загваруудыг ашигладаг бүхий л төрлийн үүрэг даалгаварт чадвар ба зардлыг тэнцвэржүүлэхээр бид GPT‑5.6 загварын бүлийг бүтээсэн. Манай тэргүүлэх загвар GPT‑5.6 Sol нь сэтгэн бодох дээд тохиргоотой үед Хиймэл шинжилгээний кодлох агентын индекс дээр Claude Fable 5-аас хоёр дахин бага зардлаар илүү сайн гүйцэтгэл үзүүлдэг. Terra нь оюуны чадамжийн жишиг туршилтуудад GPT‑5.5-тай ижил түвшний гүйцэтгэлийг тал үнээр үзүүлдэг. Luna бол Sol-ын зардлаас 80%-иар хямд үнэтэй, манай хамгийн хурдан бөгөөд боломжийн загвар юм. Энэ үр ашигт хүрэхийн тулд манай судалгаа, техникийн багууд технологийн үндсэн давхарга бүрд томоохон оновчлол хийсэн. Эдгээр сайжруулалт нь манай загварууд, гаргалгаа (гаралт үүсгэхийн тулд загваруудыг хэрхэн ажиллуулдаг арга), мөн Codex болон ChatGPT Ажил хоёул ашигладаг агентын хамгаалалтыг хамарна.
Сүүлийн дөрвөн жилд загваруудаа нэг тэрбум идэвхтэй хэрэглэгч, хоёр сая гаруй бизнест хүргэн өргөжүүлэхдээ оюуны чадамжийн үр өгөөжийг хүн бүрд түгээхэд үр ашгийг гол зарчим болгосон. Ерөнхий хиймэл оюун ухааны үр өгөөжийг нийт хүн төрөлхтөнд хүртээх нь бидний эрхэм зорилго юм. Эдгээр жилүүдэд бид зардал-оюуны чадамжийн муруйн цэг бүрд хамгийн өндөр гүйцэтгэлтэй загваруудыг санал болгохын тулд технологийн бүх давхаргын оновчлолыг тасралтгүй ахиулсан. Бид токен бүрээр илүү их ажил гүйцэтгэхээр сургагдсан GPT‑5.6‑аар токен тутмын оюуны чадамжийн үр ашгийг урьд өмнөхөөс хамгийн өндөр түвшинд хүргэсэн. Сургалтын явцад бид үүрэг даалгаврын амжилт болон үр ашгийг хамтад нь оновчилж, загварыг үүрэг даалгаврыг илүү шууд замаар гүйцэтгэхэд чиглүүлдэг.
Энэ нийтлэлд загваруудаас гадна технологийн өөр хоёр үндсэн хэсгийг ахиулан үр ашигтай болгосон арга барилаа танилцуулна. Үүнд 1) ачаалал тэнцвэржүүлэлт, таамагт тайлалт, кэшлэлт, програмын оновчлол зэрэг процессыг сайжруулж, ижил техник хангамжаас илүү их гаралт авах гаргалгаа, 2) контекстийн хэт тэлэлт, хэрэгслийн хэрэглээ, давтагдах ажлыг илүү сайн удирдах манай агентын хамгаалалт багтана. Мөн эдгээр үр ашгийн хэд хэдийг бие даан хэрэгжүүлэхэд GPT‑5.6 Sol ямар үүрэг гүйцэтгэснийг ил болгоно. Тус бүрийн сайжруулалт дангаараа бага мэт харагдаж болох ч нийлбэр үр дүн нь оюуны чадамж болон үр ашгийн аль алиных нь хил хязгаарт хүрэх боломж олгодог.
Загварын эрэлт хүчин чадлаас хурдан өсөж, тооцоолох нөөц хязгаарлагдсан өнөөгийн нөхцөлд үр ашиг нь систем бүрийн дизайны гол үндэс юм. Энэ нь сургагдсан загваруудаар хариу үүсгэдэг манай гаргалгааны технологийн давхаргад бүр ч чухал. Хэрэглэгчдийн хүлээдэг оюуны чадамж, хариу өгөх хурд, хүртээмж, найдвартай байдлыг хадгалангаа ижил техник хангамжаар илүү олон токен боловсруулахад бидний үндсэн зорилго оршино.
Үүнд хүрэхийн тулд системийг бүхэлд нь оновчлох шаардлагатай. Загвар дангаараа өндөр үр ашигтай байсан ч хүсэлтүүдийг муу хуваарилах, техник хангамж сул зогсох, эсвэл өгөгдлийн хөдөлгөөн тооцооллыг удаашруулах үед ажиллуулах зардал өндөр хэвээр байж болно. Давхарга бүрийн сайжруулалт хуримтлагдан үр өгөөжийг нэмэгдүүлдэг. Үүнд чиглүүлэлт (хүсэлтийг хааш нь илгээх), хуваарилалт (хэзээ илгээх), програм (GPU дээр ажиллах програм), кэшлэлт (ажлыг хадгалж дахин ашиглах), загварын хэрэгжүүлэлт (GPU кодын гүйцэтгэх дараалал)-ийн оновчлол багтана. Codex дахь GPT‑5.6 Sol эдгээр бүх оновчлолд чухал үүрэг гүйцэтгэсэн.
Эхний чухал жишээ нь ачаалал тэнцвэржүүлэлт юм. Дэлхийн хэмжээнд бид газарзүйн байршил, боломжит хүчин чадал, хурдасгуурын төрөл (загварыг ажиллуулдаг GPU эсвэл тусгай чипийн төрөл) зэрэг хүчин зүйлд үндэслэн хүсэлтүүдийг чиглүүлдэг. Кластер дотор бид ачаалал, контекстийн урт, кэшийн бэлэн байдал болон хүсэлтийн бусад шинжид үндэслэн ажлыг загварын хувилбаруудад хуваарилдаг. Дараа нь хувилбар бүрийн доторх ажлыг хурдасгуур, загварын дэд сүлжээ болон тооцоолох цөмүүдэд үр ашигтай хуваах шаардлагатай. Codex дахь GPT‑5.6 Sol нь боловсруулалтын урсгалыг шинжлэх, өмнө нь анзаарагдаагүй тэнцвэргүй байдлын эх үүсвэрийг илрүүлэх, шинэ чиглүүлэлтийн стратегийг турших, эдгээр эвристикийг байнга тохируулахад тусалдаг. Зөвхөн ачаалал тэнцвэржүүлэлтийн эдгээр сайжруулалт л загваруудаар үйлчилгээ үзүүлэх зардлыг эрс бууруулсан.
Мөн GPT‑5.6 Sol-ыг ашиглан оролтыг дараагийн токены таамаглал болгон хувиргадаг тооцоолол буюу загварын цааш дамжуулалтыг оновчилсон. Үйлдэл бүр хурдан байсан ч санах ойн илүүдэл хөдөлгөөн, синхрончлол, өгөгдлийн үр ашиггүй зохион байгуулалт нь GPU-уудыг сул зогсоож болно. Үүнээс сэргийлэхийн тулд GPT‑5.6 Sol урьдчилан тооцоолох, алгасах эсвэл зэрэгцүүлэн гүйцэтгэх боломжтой ажлуудыг илрүүлсэн. GPT‑5.6 Sol нь Codex-ийн тусламжтайгаар загварыг бүрдүүлэгч математик үйлдлүүдийг гүйцэтгэдэг үндсэн код болох боловсруулалтын програмуудыг бие даан дахин бичиж, оновчилсон. OpenAI-ийн хөгжүүлдэг нээлттэй эхийн GPU програмчлалын хоёр хэл болох Triton(шинэ цонхонд нээгдэнэ) болон Gluon(шинэ цонхонд нээгдэнэ) дээр програм бичих, сайжруулах чадвартай байхаар GPT‑5.6‑г сургасан нь үүнд тодорхой хэмжээгээр нөлөөлсөн. Эдгээр ажил болон GPT‑5.6 Sol-ын програмын бусад өргөн хүрээний сайжруулалт нийлээд үйлчилгээний нийт зардлыг 20%-иар бууруулсан. GPT‑5.6 Sol-ын бичсэн програмуудын зөв ажиллагааг баталгаажуулахын тулд нээлттэй эхийн FpSan(шинэ цонхонд нээгдэнэ) (Хөвөгч цэгийн ариутгагч) зэрэг шалгалтын хэрэгслүүдэд бид ихээхэн хөрөнгө оруулсан.
Таамагласан тайлалт нь хурд, үр ашгийг нэмэгдүүлэх өөр нэг арга юм. Энэ аргад жижиг ноорог (эсвэл “таамаглагч”) загварыг үндсэн загвартай зэрэгцүүлэн ажиллуулж, үндсэн загвар зэрэг шалгах хэд хэдэн токеныг санал болгодог. Санал болгосон токенуудыг зөвшөөрвөл систем үндсэн загварын нэг дамжуулалтаар олон гаралтын токен үүсгэж, өндөр зардалтай дараалсан тооцооллын хэмжээг бууруулна. GPT‑5.6 Sol өөрийн архитектур дээр олон зуун туршилт зохион байгуулж, ажиллуулахын зэрэгцээ хэмжээ, бүтэц, боломжуудын өөрчлөлтийг шалган өөрийн ноорог загварыг сайжруулсан. Түүнчлэн GPT‑5.6 Sol таамаглагчийг сургах процессыг эхлүүлж, хянасан бөгөөд техник хангамжийн гэмтэл, сургалтын тогтворгүй байдал зэрэг асуудал гарахад бие даан оролцсон. Үүний үр дүнд токен үүсгэх үр ашиг 15%-иас дээш нэмэгдсэн.
Кэшлээгүй оролтын токеныг боловсруулахдаа загвар түлхүүр-утгын (KV) кэшийг тооцоолол их шаарддаг нэг дамжуулалтаар үүсгэнэ. Гаралт үүсгэхдээ уг кэшийг давтан уншиж, өргөтгөнө. Багцлалт, хэсэгчлэн хуваарилалт, KV удирдлага зэрэг үйлчилгээний оновчтой тохиргоо нь ажлын ачааллаас ихээхэн хамаарна. Үүнд өгөгдөл ба гаралтын урт, багцын хэмжээ, кэш таарах хувь, асуулгын шинж зэрэг орно. Гэвч өмнө нь тохиргооны боломжит орон зай системтэйгээр тааруулахад хэт том байсан тул инженерүүд ерөнхий эвристикт найдах шаардлагатай байв. Codex дахь GPT‑5.6 Sol-ын тусламжтайгаар бид боловсруулалтын ажлын ачааллыг шинжилж, боломжит тохиргоонуудыг үүсгэн үнэлж, нөхцөл бүрд хөдөлгүүр болон загварыг хэрхэн тохируулахыг маш нарийн оновчилж чадсан. Ингэснээр ажлын ачаалал тус бүрд зориулсан шинэ түвшний оновчлолыг бодитоор хэрэгжүүлж, ижил техник хангамжаас илүү их ашигтай гаргалгаа гаргах боломжтой болсон.
Гаргалгааны оновчлол бол тасралтгүй эргэх санал хүсэлтийн мөчлөг юм. Бид боловсруулалтын орчин дахь ажиллагааг хэмжиж, хамгийн том зөрүүг илрүүлэн, өөрчлөлт хэрэгжүүлж, тусгаарлагдсан жишиг туршилтыг бус системийг бүхэлд нь сайжруулж буй эсэхийг баталгаажуулдаг. GPT‑5.6 Sol болон Codex уг мөчлөгийн бүх хэсгийг хурдасгадаг. Ингэснээр манай баг илүү олон санааг туршиж, өөрчлөгдөж буй ажлын ачаалалд хурдан хариу үйлдэл үзүүлэн, хэрэглэгчдэд зориулсан хариу өгөх хугацаа богино, хүчин чадал их, зардал бага гаргалгааны технологийн давхаргыг бий болгож чадна.
ChatGPT Ажил болон Codex нь загварын хүсэлт, хэрэгслийн дуудлагыг цувруулан ашиглаж нарийн төвөгтэй үүрэг даалгаврыг гүйцэтгэдэг. Хэрэглэгчийн хүсэлтээс эцсийн хариу хүртэлх нэг эргэлтэд Codex эх кодыг шалгах, байршуулалтын түүхээс хайх, ослын тайлан унших, файл засах, туршилт ажиллуулах боломжтой. Алхам бүрд тусдаа хүсэлт шаардагдаж болно.
Контекст бэлтгэх, өгөгдөл дамжуулах, гаргалгаа ажиллуулах, хэрэгсэл дуудах, процесс эхлүүлэх бүрд хугацаа болон тооцоолох нөөц зарцуулна. Үүрэг даалгаварт загварын 30 хүсэлт шаардлагатай бол хүсэлт бүрд нэмэгдэх нэг секунд нийлээд их хугацаа болно. Нийт гүйцэтгэлийг сайжруулахын тулд зөвхөн загварыг хурдасгах бус, систем даяарх давтагдах ажлыг багасгах шаардлагатай.
Нэг хэрэглэгчийн эргэлт олон загвар болон хэрэгслийн давталт агуулж болно. Давтагдсан хэсгийн доторх ямар ч зардлыг олон удаа төлөх боломжтой.
Эдгээр үржигдэх нөлөөг харгалзан бид загварууд, хэрэгслүүд болон хэрэглэгчийн орчныг холбодог Rust зохицуулалтын давхарга болох агентын хамгаалалтаа бүтээсэн. Одоо контекстийн хэт тэлэлтээс зайлсхийх, хэрэгсэл ачаалах, өмнөх ажлыг дахин ашиглах замаар хүсэлт бүрийг хэрхэн илүү үр ашигтай болгодог талаар авч үзье.
Агентуудад илүү олон хэрэгсэл, ур чадвар, нэмэлт өргөтгөл болон харилцан ярианы түүх ашиглах эрх өгөхийн хэрээр контекстийн цонх амархан тэлдэг. Ингэснээр зардал нэмэгдэж, загварын анхаарал сарнин, шаардлагагүй сэтгэн бодох үйл явц үүсдэг. Хамгаалалт нь хойшлуулсан илрүүлэлтийг ашиглан энэ нэмэлт ачааллыг бууруулж чадна. Ингэснээр интеграц, тусгай MCP хэрэгсэл, ур чадвар, нэмэлт өргөтгөлүүд зөвхөн шаардлагатай үед харагдана. Мөн хамгаалалт нь тусдаа хэрэгсэл болон MCP интеграц контекстийн цонхыг санаандгүйгээр дүүргэхээс сэргийлдэг. Загвар өөр хязгаар хүсээгүй бол хэрэгслийн гаралтыг анхдагчаар 10,000 токеноор хязгаарлана.
Өмнө дурдсанчлан, агентын давталт нэг эргэлтийн дотор ижил заавар, харилцан ярианы түүх, хэрэгслийн тодорхойлолт болон өмнөх үр дүнг GPU-ууд руу олон удаа илгээж болно. Эдгээр давтагдсан оролтыг боловсруулахад их зардал гардаг тул өгөгдлийн кэшлэлт нь өмнө боловсруулсан өгөгдлийн угтварт хамаарах тооцооллыг дахин ашигладаг. Уг угтварыг хадгалахын тулд хамгаалалт нь загварт харагдах бүх түүхийг зөвхөн төгсгөлд нь нэмэх зарчмаар зохицуулдаг: шинэ зурвас, хэрэгслийн үр дүн, орчны шинэчлэлийг өмнөх контекстэд оруулахын оронд төгсгөлд нь нэмнэ. Мөн хэрэгслүүдийг тогтсон дарааллаар танилцуулдаг бөгөөд зөвшөөрлийн бодлого зэрэг ажиллах үеийн тохиргоог хэрэгслийн тодорхойлолтод оруулахын оронд гүйцэтгэлийн үед хэрэгжүүлдэг. Энэхүү шийдэл нь Codex болон ChatGPT Ажлын горимын өгөгдлийн кэш амжилттай ашиглагдах нийт хувь өндөр байхад нөлөөлдөг.
Өгөгдлийг хэсэгчлэн дамжуулах нь сүлжээгээр юу дамжихыг, харин өгөгдлийн кэшлэлт нь загвар юуг дахин тооцоолохгүй байж болохыг өөрчилнө. Өргөн нь ойлголтыг дүрсэлсэн бөгөөд нэмэлт шахалтын давхаргыг харуулаагүй.
GPT‑5.6‑аар бий болгосон үр ашгийн өсөлт нь судалгаа, гаргалгаа болон агентын хамгаалалтыг хамарсан бүх технологийн давхаргад олон жилийн турш хуримтлагдсан сайжруулалтын үр дүн юм. Эдгээр сайжруулалтуудаас олныг хэрэгжүүлэхэд GPT‑5.6 чухал үүрэг гүйцэтгэсэн нь оновчлолын хурд цаашид нэмэгдэнэ гэсэн итгэл төрүүлж байна. Бид технологийн үндсэн давхаргуудаа сууриар нь сайжруулахын зэрэгцээ програмын оновчлол зэрэг чиглэлд илүү өргөн оновчлол хийсээр байх болно. Дотоод ажиллагаанд тасралтгүй хийгдэж буй эдгээр сайжруулалтыг илүү өргөн хүртээмжтэй, зардал багатай оюуны чадамж болгон хэрэглэгч, харилцагчдадаа хүргэхийг бид зорьж байна.
Энэ нийтлэлд хувь нэмрээ оруулсан Техникийн багийн гишүүд болох Мэттью Феррари, Филипп Тилле, Ахмед Ибрахим, Жо Гершенсон, Стив Коффи нарт онцгой талархал илэрхийлье.


