Прескокни до главната содржина
OpenAI

Како GPT‑5.6 ги спојува граничната интелигенција и граничната ефикасност

Се вчитува...

Го дизајниравме семејството модели GPT‑5.6 за да ги балансира способностите и трошоците низ целиот спектар задачи за кои луѓето ги користат нашите модели. Нашиот водечки модел, GPT‑5.6 Sol, со Max расудување го надминува Claude Fable 5 на Artificial Analysis Coding Agent Index за помалку од половина од трошокот. Terra постигнува резултати еднакви на GPT‑5.5 на тестовите за интелигенција за половина од цената, а Luna е нашиот најбрз и најдостапен модел, со цена 80% пониска од Sol. За да ја постигнат оваа ефикасност, нашите истражувачки и технички тимови направија значителни оптимизации во секој главен слој од нашиот стек. Овие подобрувања ги опфаќаат нашите модели, инференцијата (начинот на кој ги извршуваме моделите за да создадеме излез) и нашата агентска рамка, која ја користат и Codex и ChatGPT Работа.

Додека во изминатите четири години ги проширувавме нашите модели до 1 милијарда активни корисници и повеќе од 2 милиони компании, ефикасноста беше клучна за придобивките од интелигенцијата да им станат достапни на сите. Нашата мисија е да обезбедиме општата вештачка интелигенција да му користи на целото човештво. Во текот на овие години постојано работевме на поголеми оптимизации низ нашиот стек за да ги понудиме моделите со најдобри перформанси во секоја точка од кривата трошок-интелигенција. Со GPT‑5.6 ја постигнавме досега најголемата ефикасност во односот интелигенција по токен, бидејќи е обучен да извршува повеќе работа по токен. При обуката оптимизираме и за успешно извршување на задачите и за ефикасност, насочувајќи го моделот да оди по подиректен пат низ задачата.

Оваа објава гледа подалеку од нашите модели и објаснува како ја вградивме ефикасноста преку напредок во два други главни дела на стекот: 1) инференцијата, со оптимизирање процеси како балансирање на оптоварувањето, спекулативно декодирање, кеширање и оптимизација на кернелите за да добиеме повеќе излез од истиот хардвер; и 2) нашата агентска рамка, вклучувајќи подобро управување со прекумерниот контекст, употребата на алатки и повторливата работа. Ќе објасниме и каква улога имаше GPT‑5.6 Sol во самостојното постигнување на неколку од овие придобивки. Иако секое поединечно подобрување може да изгледа ограничено, овие придобивки се надополнуваат и ни овозможуваат да ги поместуваме границите и на интелигенцијата и на ефикасноста.

Дијаграм што ја прикажува ефикасноста на GPT-5.6 во агентската рамка, API-оркестрацијата и инференцијата на моделот, со помалку мрежни податоци, помалку работа за процесорот и повеќе излез од графичкиот процесор.

Забрзување на инференцијата со GPT‑5.6 Sol

Во свет со ограничени пресметковни ресурси, каде што побарувачката за модели расте побрзо од капацитетот, ефикасноста е во сржта на дизајнот на секој систем. Тоа особено важи за нашиот стек за инференција, кој извршува обучени модели за да создава одговори. Нашата главна цел е со истиот хардвер да опслужуваме повеќе токени, задржувајќи ги интелигенцијата, латентноста, достапноста и сигурноста што ги очекуваат корисниците.

За да се постигне тоа, мора да се оптимизира целиот систем. Еден модел може сам по себе да биде многу ефикасен, но сепак скап за опслужување ако барањата се распределуваат лошо, хардверот е неактивен или преносот на податоци ги забавува пресметките. Подобрувањата на секој слој се надополнуваат, а придобивките доаѓаат од оптимизација на насочувањето (каде се испраќаат барањата), распоредувањето (кога се испраќаат), кернелите (софтверот што работи на графичките процесори), кеширањето (зачувана и повторно искористена работа) и имплементацијата на моделот (редоследот на кодот за графичките процесори). GPT‑5.6 Sol во Codex одигра клучна улога во сите овие оптимизации.

Првиот важен пример е балансирањето на оптоварувањето. На глобално ниво, ги насочуваме барањата според фактори како географската локација, достапниот капацитет и видот на забрзувачот (видот на графички процесор или специјализиран чип што го извршува моделот). Во рамките на еден кластер, ја распределуваме работата меѓу инстанците на моделот според оптоварувањето, должината на контекстот, достапноста на кешот и другите својства на барањето. Во секоја инстанца, работата потоа мора ефикасно да се распредели меѓу забрзувачите, потмрежите на моделот и пресметковните јадра. GPT‑5.6 Sol во Codex ни помага да го анализираме продукцискиот сообраќај, да откриваме претходно занемарени извори на нерамнотежа, да тестираме нови стратегии за насочување и постојано да ги приспособуваме овие хеуристики. Само овие подобрувања во балансирањето на оптоварувањето драстично ги намалија трошоците за опслужување на нашите модели.

Го користевме GPT‑5.6 Sol и за оптимизација на директното поминување низ моделот: пресметката што ги претвора влезните податоци во предвидувања за следниот токен. Дури и кога поединечните операции се брзи, прекумерното преместување на меморијата, синхронизацијата и неефикасниот распоред на податоците може да ги остават графичките процесори неактивни. За да го избегне тоа, GPT‑5.6 Sol откри задачи што може однапред да се пресметаат, да се избегнат или да се извршат паралелно. Со Codex, GPT‑5.6 Sol самостојно ги преработи и оптимизира нашите продукциски кернели — основниот код што ги извршува математичките операции од кои е составен моделот. Ова делумно беше можно бидејќи го обучивме GPT‑5.6 ефикасно да пишува и подобрува кернели во Triton(се отвора во нов прозорец) и Gluon(се отвора во нов прозорец), два јазика со отворен код за програмирање графички процесори што ги одржува OpenAI. Овие напори, заедно со пошироките унапредувања на кернелите од GPT‑5.6 Sol, ги намалија вкупните трошоци за опслужување за 20%. Исто така, значително вложивме во алатки за проверка, како алатката со отворен код FpSan(се отвора во нов прозорец) (санитизатор за подвижна запирка), за полесно да ја потврдиме точноста на кернелите напишани од GPT‑5.6 Sol.

Спекулативното декодирање е уште еден начин за подобрување на брзината и ефикасноста. Техниката вклучува извршување помал нацрт-модел (или „спекулатор“) паралелно со главниот модел, кој предлага неколку токени што главниот модел ги проверува истовремено. Кога овие предлози ќе бидат прифатени, системот може да создаде повеќе излезни токени со едно поминување низ главниот модел, намалувајќи го обемот на скапите последователни пресметки. GPT‑5.6 Sol го подобри сопствениот нацрт-модел така што осмисли и спроведе стотици експерименти со неговата архитектура, тестирајќи промени во големината, структурата и функциите. Дополнително, GPT‑5.6 Sol го започна и го следеше процесот на обука на спекулаторот, самостојно интервенирајќи при појава на проблеми, вклучително и хардверски дефекти и нестабилност во обуката. Овие подобрувања ја зголемија ефикасноста на создавањето токени за повеќе од 15%.

При обработка на некеширани влезни токени, моделот го создава кешот клуч-вредност (KV) во едно пресметковно интензивно поминување; при создавање излез, постојано чита од тој кеш и го проширува. Оптималната конфигурација за опслужување, како групирањето, поделбата и управувањето со KV, во голема мера зависи од оптоварувањето — должината на промптот и излезот, големината на групата, стапката на погодоци во кешот, својствата на барањата и друго. Меѓутоа, просторот на конфигурации претходно беше преголем за систематско приспособување, па инженерите мораа да се потпираат на општи хеуристики. Со GPT‑5.6 Sol во Codex можевме да ги анализираме продукциските оптоварувања, да создаваме и оценуваме можни конфигурации и максимално да го оптимизираме конфигурирањето на механизмот и моделот за секое сценарио. Ова овозможува ново ниво на практична оптимизација според оптоварувањето, со што се добива повеќе корисна инференција од истиот хардвер.

Оптимизацијата на инференцијата е континуиран циклус на повратни информации. Го мериме однесувањето во продукција, ги откриваме најголемите недостатоци, воведуваме промени и проверуваме дали тие го подобруваат целиот систем, а не само изолиран репер. GPT‑5.6 Sol и Codex го забрзуваат секој дел од тој циклус. Тоа значи дека нашиот тим може да истражува повеќе идеи, побрзо да реагира на променливите оптоварувања и да создава стек за инференција со помала латентност, поголем капацитет и пониски трошоци за корисниците.

Како нашата агентска рамка ја поедноставува повторливата работа

ChatGPT Работа и Codex извршуваат сложени задачи преку низа барања до моделот и повици до алатки. Во еден чекор — од барањето на корисникот до конечниот одговор — Codex може да го прегледа изворниот код, да ја пребара историјата на распоредувања, да прочита извештаи за инциденти, да уреди датотека и да изврши тестови. За секој чекор може да биде потребно посебно барање.

Подготовката на контекстот, преносот на податоци, извршувањето инференција, повикувањето алатки и започнувањето процеси бараат време и пресметковни ресурси. Ако една задача бара 30 барања до моделот, дополнителната секунда за секое барање се натрупува. Подобрувањето на вкупните перформанси значи намалување на повторливата работа низ целиот систем, а не само забрзување на моделот.

Корисничка задача влегува во моделот, кој може да повика алатка, да добие резултат и повторно да донесе одлука, повеќепати, пред да ја заврши задачата.

Еден кориснички чекор може да содржи многу повторувања на моделот и алатките. Секој трошок во повторуваниот дел може да се плати повеќепати.

Овие мултипликативни ефекти влијаеја врз дизајнот на нашата агентска рамка — слој за оркестрација во Rust што ги поврзува нашите модели, алатките и околината на корисникот. Во продолжение ќе објасниме како избегнувањето на прекумерен контекст, вчитувањето алатки и повторната употреба на сработеното го прават секое барање поефикасно.

Избегнувајте прекумерен контекст

Како што агентите добиваат пристап до повеќе алатки, вештини, приклучоци и историја на разговори, прозорците за контекст лесно може да се прошират. Тоа ги зголемува трошоците, му го одвлекува вниманието на моделот и предизвикува непотребно расудување. Рамката може да го намали ова оптоварување преку одложено откривање, со што интеграциите, приспособените MCP-алатки, вештините и приклучоците се прикажуваат само кога се потребни. Рамката исто така спречува поединечни алатки и MCP-интеграции неочекувано да го пополнат прозорецот за контекст. Излезот од алатките стандардно е ограничен на 10.000 токени, освен ако моделот не побара друга граница.

Зачувајте ги точните префикси за кеширање на промптот

Како што претходно споменавме, циклусот на агентот може повеќепати во еден чекор да ги испрати до графичките процесори истите инструкции, историјата на разговорот, дефинициите на алатките и претходните резултати. Обработката на овие повторени влезни податоци е скапа, па кеширањето на промптот повторно ја користи пресметката поврзана со претходно обработен префикс на промпт. За да го зачува тој префикс, рамката ја третира целата историја видлива за моделот како таква што дозволува само додавање: новите пораки, резултатите од алатките и ажурирањата на околината се додаваат на крајот наместо да се вметнуваат во претходниот контекст. Алатките се прикажуваат и по детерминистички редослед, додека поставките за време на извршување, како што се политиките за одобрување, се применуваат при извршувањето наместо да се вградуваат во дефинициите на алатките. Оваа проектантска одлука придонесува за високите вкупни стапки на погодоци во кешот на промпти кај Codex и ChatGPT Работа.

Три барања ги споредуваат бајтите испратени преку постојана врска со растечкиот контекст што го гледа моделот и префиксот што може повторно да се користи од кешот.

Инкременталниот пренос го менува она што минува низ мрежата; кеширањето на промптот го менува она што моделот можеби нема да мора повторно да го пресметува. Широчините се концептуални, а дополнителниот слој за компресија не е прикажан.

Ефикасност низ кривата на интелигенцијата

Подобрувањата на ефикасноста што ги постигнавме со GPT‑5.6 се резултат на повеќегодишни надградби низ целиот стек, од истражувањето и инференцијата до нашата агентска рамка. Улогата на GPT‑5.6 во реализацијата на многу од овие подобрувања ни дава оптимизам дека темпото на оптимизација ќе се забрза. Ќе продолжиме со уште поголеми оптимизации во области како оптимизацијата на кернелите, заедно со темелни подобрувања на нашиот стек. Со нетрпение очекуваме овие тековни подобрувања во заднината да им ги пренесеме на нашите корисници и клиенти во облик на подостапна и поекономична интелигенција.

Посебна благодарност до Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson и Steve Coffey, членови на техничкиот персонал, за нивниот придонес кон оваа објава.

Автор

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson и Steve Coffey