Перейти до основного вмісту
OpenAI

Як GPT‑5.6 поєднує передовий інтелект із передовою ефективністю

Завантаження…

Ми розробили сімейство моделей GPT‑5.6 так, щоб збалансувати можливості й вартість у всьому спектрі завдань, для яких люди використовують наші моделі. Наша флагманська модель GPT‑5.6 Sol із максимальним рівнем міркувань перевершує Claude Fable 5 в індексі Artificial Analysis Coding Agent Index, коштуючи менш ніж удвічі дешевше. Terra демонструє результати на рівні GPT‑5.5 у тестах інтелекту за вдвічі нижчою ціною, а Luna — наша найшвидша й найдоступніша модель, що коштує на 80% менше за Sol. Щоб досягти такої ефективності, наші дослідницькі й технічні команди суттєво оптимізували кожен основний рівень нашого стека. Ці вдосконалення охоплюють наші моделі, інференс — те, як ми запускаємо моделі для генерування результатів, — і нашу агентну систему harness, яку використовують Codex і режим Робота в ChatGPT.

Протягом останніх чотирьох років, коли ми масштабували наші моделі до 1 мільярда активних користувачів і понад 2 мільйонів компаній, ефективність була ключем до поширення переваг інтелекту для всіх. Наша місія — забезпечити, щоб штучний загальний інтелект приносив користь усьому людству. Упродовж цих років ми постійно знаходили нові можливості для оптимізації всього стека, щоб пропонувати найпродуктивніші моделі в кожній точці співвідношення вартості й інтелекту. Завдяки GPT‑5.6, навченій виконувати більше роботи на токен, ми досягли найвищої досі ефективності інтелекту на токен. Під час навчання ми оптимізуємо і успішність виконання завдань, і ефективність, навчаючи модель пряміше рухатися до результату.

У цій публікації ми виходимо за межі самих моделей і розповідаємо, як підвищили ефективність завдяки поступу у двох інших основних частинах стека: 1) інференсі — оптимізувавши балансування навантаження, спекулятивне декодування, кешування та ядра, щоб отримувати більше результатів на тому самому обладнанні; 2) нашій агентній системі harness — поліпшивши керування розростанням контексту, використанням інструментів і повторюваною роботою. Ми також розповімо, як GPT‑5.6 Sol допомогла автономно досягти кількох із цих результатів. Хоча кожне окреме вдосконалення може здаватися незначним, разом вони дають змогу досягати передового рівня і в інтелекті, і в ефективності.

Схема ефективності GPT-5.6 в агентній системі harness, оркестрації API та інференсі моделі: менше мережевих даних і роботи CPU, більше результатів від GPU.

Прискорення інференсу за допомогою GPT‑5.6 Sol

У світі обмежених обчислювальних ресурсів, де попит на моделі зростає швидше за доступні потужності, ефективність лежить в основі проєктування кожної системи. Особливо це стосується нашого стека інференсу, який запускає навчені моделі для генерування відповідей. Наша головна мета — обробляти більше токенів на тому самому обладнанні, зберігаючи очікувані користувачами рівні інтелекту, затримки, доступності та надійності.

Для цього потрібно оптимізувати всю систему. Окремо взята модель може бути дуже ефективною, але її обслуговування все одно коштуватиме дорого, якщо запити розподіляються невдало, обладнання простоює або переміщення даних сповільнює обчислення. Удосконалення на кожному рівні дають сукупний ефект: переваги забезпечують оптимізація маршрутизації (куди надсилаються запити), планування (коли вони надсилаються), ядер (програм, що працюють на GPU), кешування (збереження й повторного використання роботи) та реалізації моделі (порядку виконання коду на GPU). GPT‑5.6 Sol у Codex відіграла ключову роль у всіх цих оптимізаціях.

Перший важливий приклад — балансування навантаження. На глобальному рівні ми маршрутизуємо запити з огляду на такі чинники, як географічне розташування, доступна потужність і тип прискорювача — GPU або спеціалізованого чипа, на якому працює модель. У межах кластера ми розподіляємо роботу між екземплярами моделі з урахуванням навантаження, довжини контексту, доступності кешу та інших властивостей запитів. Потім у межах кожного екземпляра роботу потрібно ефективно розподілити між прискорювачами, підмережами моделі та обчислювальними ядрами. GPT‑5.6 Sol у Codex допомагає нам аналізувати робочий трафік, виявляти раніше непомічені джерела дисбалансу, перевіряти нові стратегії маршрутизації та постійно налаштовувати ці евристики. Лише ці вдосконалення балансування навантаження суттєво знизили вартість обслуговування наших моделей.

Ми також застосували GPT‑5.6 Sol для оптимізації прямого проходу моделі — обчислення, яке перетворює вхідні дані на прогнози наступного токена. Навіть якщо окремі операції виконуються швидко, надмірне переміщення пам’яті, синхронізація та неефективне компонування даних можуть спричиняти простої GPU. Щоб уникнути цього, GPT‑5.6 Sol знайшла обчислення, які можна було виконати заздалегідь, оминути або розпаралелити. За допомогою Codex GPT‑5.6 Sol автономно переписала й оптимізувала наші робочі ядра — основний код, що виконує математичні операції, з яких складається модель. Це стало можливим, зокрема, тому, що ми навчили GPT‑5.6 ефективно писати й удосконалювати ядра мовами Triton(відкривається у новому вікні) і Gluon(відкривається у новому вікні), двома мовами програмування GPU з відкритим кодом, які підтримує OpenAI. У сукупності ці зусилля та ширші вдосконалення ядер за допомогою GPT‑5.6 Sol знизили наскрізну вартість обслуговування на 20%. Ми також значно інвестували в інструменти перевірки, як-от засіб із відкритим кодом FpSan(відкривається у новому вікні) (санітайзер чисел із рухомою комою), що допомагає перевіряти правильність ядер, написаних GPT‑5.6 Sol.

Спекулятивне декодування — ще один спосіб підвищити швидкість і ефективність. Цей метод передбачає запуск меншої чернеткової моделі (або «спекулятора») разом з основною: вона пропонує кілька токенів, які основна модель перевіряє паралельно. Коли ці пропозиції приймаються, система може створити кілька вихідних токенів за один прохід основної моделі, скорочуючи обсяг дорогих послідовних обчислень. GPT‑5.6 Sol удосконалила власну чернеткову модель, спроєктувавши й провівши сотні експериментів з її архітектурою та перевіривши зміни розміру, структури й функцій. Крім того, GPT‑5.6 Sol запустила й контролювала навчання спекулятора, автономно втручаючись у разі проблем, зокрема відмов обладнання та нестабільності навчання. Завдяки цим удосконаленням ефективність генерування токенів зросла більш ніж на 15%.

Під час обробки некешованих вхідних токенів модель створює кеш ключів і значень (KV) за один ресурсомісткий прохід, а під час генерування виводу багаторазово читає та розширює цей кеш. Оптимальна конфігурація обслуговування — зокрема пакетування, шардінг і керування KV — значною мірою залежить від робочого навантаження: довжини запиту й виводу, розміру пакета, частки влучань у кеш, характеристик запитів тощо. Однак раніше простір конфігурацій був надто великим для систематичного налаштування, тому інженерам доводилося покладатися на загальні евристики. За допомогою GPT‑5.6 Sol у Codex ми змогли аналізувати робочі навантаження, створювати й оцінювати конфігурації-кандидати та надточно оптимізувати налаштування рушія й моделі для кожного сценарію. Це робить практичним новий рівень оптимізації під конкретні навантаження й дає змогу отримувати більше корисних результатів інференсу на тому самому обладнанні.

Оптимізація інференсу — це безперервний цикл зворотного зв’язку. Ми вимірюємо робочі показники, виявляємо найбільші прогалини, упроваджуємо зміни й перевіряємо, чи покращують вони всю систему, а не лише окремий тест. GPT‑5.6 Sol і Codex прискорюють кожен етап цього циклу. Завдяки цьому наша команда може досліджувати більше ідей, швидше реагувати на зміни навантаження та створювати стек інференсу з меншою затримкою, більшою пропускною здатністю й нижчою вартістю для користувачів.

Як наша агентна система harness оптимізує повторювану роботу

Режим Робота в ChatGPT і Codex виконують складні завдання за допомогою низки запитів до моделі та викликів інструментів. Протягом одного ходу — від запиту користувача до остаточної відповіді — Codex може перевірити вихідний код, знайти історію розгортань, прочитати звіти про інциденти, відредагувати файл і запустити тести. Кожен крок може потребувати окремого запиту.

Підготовка контексту, передавання даних, виконання інференсу, виклики інструментів і запуск процесів потребують часу та обчислювальних ресурсів. Якщо завдання потребує 30 запитів до моделі, навіть одна зайва секунда на кожен із них накопичується у відчутну затримку. Щоб підвищити загальну продуктивність, потрібно скоротити повторювану роботу в усій системі, а не лише прискорити модель.

Завдання користувача надходить до моделі, яка може викликати інструмент, отримати результат і знову ухвалити рішення; цикл повторюється до завершення завдання.

Один хід користувача може охоплювати багато ітерацій моделі та інструментів. Будь-які витрати в повторюваній частині можуть виникати багаторазово.

Ці множники визначили архітектуру нашої агентної системи harness — рівня оркестрації на Rust, який з’єднує наші моделі, інструменти й середовище користувача. Далі розглянемо, як запобігання розростанню контексту, завантаження інструментів і повторне використання результатів підвищують ефективність кожного запиту.

Запобігайте розростанню контексту

Коли агенти отримують доступ до більшої кількості інструментів, навичок, плагінів та історії розмов, ліміт контексту може швидко вичерпуватися. Це збільшує витрати, відволікає модель і спонукає до зайвих міркувань. Система harness може зменшити ці накладні витрати завдяки відкладеному виявленню, за якого інтеграції, власні інструменти MCP, навички та плагіни стають доступними лише за потреби. Система harness також запобігає непередбаченому вичерпанню ліміту контексту окремими інструментами та інтеграціями MCP. За замовчуванням вивід інструментів обмежено 10 000 токенів, якщо модель не запитає інший ліміт.

Зберігайте точні префікси для кешування запитів

Як уже зазначалося, цикл агента може протягом одного ходу кілька разів надсилати на GPU ті самі інструкції, історію розмови, визначення інструментів і попередні результати. Обробка цих повторюваних вхідних даних дорога, тому кешування запитів повторно використовує обчислення, пов’язані з раніше обробленим префіксом запиту. Щоб зберегти цей префікс, система harness розглядає всю видиму моделі історію як доступну лише для доповнення: нові повідомлення, результати інструментів і оновлення середовища додаються в кінці, а не вставляються в попередній контекст. Інструменти також подаються в детермінованому порядку, а параметри середовища виконання, як-от політики схвалення, застосовуються під час виконання, а не вбудовуються у визначення інструментів. Завдяки цьому рішенню Codex і режим Робота в ChatGPT мають високі загальні показники влучань у кеш запитів.

Три запити порівнюють обсяг байтів, переданих через постійне з’єднання, зі зростанням контексту, який бачить модель, і префіксом, придатним для повторного використання з кешу.

Інкрементальна передача змінює те, що проходить мережею, а кешування запитів — те, що модель може не обчислювати повторно. Ширина елементів умовна; додатковий рівень стиснення не показано.

Ефективність у всьому діапазоні рівнів інтелекту

Підвищення ефективності, якого ми досягли з GPT‑5.6, стало результатом багаторічних сукупних удосконалень усього технологічного стека — від досліджень та інференсу до нашої агентної системи harness. Роль GPT‑5.6 у реалізації багатьох із цих удосконалень вселяє в нас оптимізм щодо подальшого прискорення темпів оптимізації. Ми й надалі посилюватимемо оптимізацію в таких сферах, як оптимізація ядер, паралельно з фундаментальними вдосконаленнями нашого стека. Ми прагнемо й надалі передавати ці непомітні користувачам внутрішні вдосконалення у формі доступнішого й економічно ефективнішого інтелекту.

Окрема подяка технічним фахівцям Метью Феррарі, Філіппу Тілле, Ахмеду Ібрагіму, Джо Гершенсону та Стіву Коффі за внесок у цю публікацію.

Автор

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson, Steve Coffey