Як два налаштування утричі підвищили наш результат у тесті ARC-AGI-3
Прискорене відео, на якому GPT‑5.6 Sol намагається розв’язувати головоломки тесту ARC-AGI-3 з офіційною системою harness (ліворуч) і нашою системою harness на основі API Responses (праворуч), яка зберігає міркування й забезпечує ущільнення. У таблиці лідерів цієї гри(відкривається у новому вікні) жодна передова модель не проходить далі першого рівня. З нашою системою harness GPT‑5.6 Sol проходить усі шість.
Коли ми вперше побачили низькі результати GPT‑5.6 Sol у тесті ARC-AGI-3(відкривається у новому вікні), то були спантеличені.
GPT‑5.6 Sol розв’язала давні відкриті математичні задачі, як-от гіпотеза про подвійне покриття циклами(відкривається у новому вікні), і пройшла такі ігри, як Pokémon FireRed. Але в ARC-AGI-3, тесті на основі двовимірних головоломок, GPT‑5.6 Sol набрала лише 7,8%, а GPT‑5.5 майже не могла в них грати й отримала мізерні 0,4%.
Невже двовимірні головоломки виявилися надзвичайно складними для наших моделей? Чи причина була в чомусь іншому?
Тести рідко оцінюють моделі ШІ ізольовано. Вони також оцінюють менш помітні рішення щодо налаштувань API, будови системи harness і промптингу. У випадку ARC-AGI-3 ми з’ясували, що ввімкнення двох налаштувань API, які ми використовуємо в ChatGPT і Codex, — збереження міркувань та ущільнення — утричі підвищило результати й у шість разів скоротило кількість вихідних токенів на загальнодоступному наборі завдань.
З офіційною системою harness GPT‑5.6 Sol набрала 13,3% на загальнодоступному наборі ARC-AGI-3. Зі збереженням міркувань і ущільненням результат становив 38,3%. Оцінки вимірюють відносну ефективність дій людини (RHAE(відкривається у новому вікні)) — показник, що порівнює продуктивність моделі з базовим рівнем людини. На основі офіційних журналів гри(відкривається у новому вікні) ми оцінюємо середній результат тестувальника-людини у 48%. Моделям не повідомляють, як їх оцінюватимуть, і протягом гри вони не бачать свого результату — у відповідь на дії надходить лише текстове представлення кожного кадру та номер поточного рівня.
ARC-AGI-3 — це тест, призначений для оцінювання здатності агентів ШІ навчатися й міркувати. Агенти досліджують незнайомі двовимірні ігри й без прямих інструкцій з’ясовують, як вони працюють. Ви можете зіграти у 25 демонстраційних ігор на arcprize.org/tasks(відкривається у новому вікні).
ARC-AGI-3 навмисно використовує універсальну систему harness без інструментів чи спеціальних можливостей. На думку ARC, проста система harness виразніше показує недоліки моделі й забезпечує справедливіше порівняння моделей. Натомість комерційні розробники оптимізують системи harness під можливості й особливості кожної моделі.
Серед ігрових досягнень GPT‑5.6 Sol — проходження Pokémon FireRed із системою harness, що використовує лише зір (трансляція GPT_Plays_Pokemon(відкривається у новому вікні)), Slay the Spire за допомогою керування комп’ютером у Codex (трансляція EpochAI(відкривається у новому вікні)) і перших етапів Baba Is You (за матеріалами Пйотра Мігдаля та Пйотра Грабовського(відкривається у новому вікні)). Чим же так відрізнявся ARC-AGI-3?

Ітан Моллік показує(відкривається у новому вікні), як GPT‑5.6 Sol у Codex долає випадкове щоденне випробування в Slay the Spire 2 — грі, випущеній після завершення періоду знань GPT‑5.6 Sol.
Натхненні аналізом недоліків GPT‑5.5 від ARC(відкривається у новому вікні), ми розглянули кілька спроб GPT‑5.6 Sol. Як і ARC, ми побачили, що модель поводилася не надто кмітливо. Вона довго обмірковувала кожну дію й майже не просувалася вперед.
Однак під час детальнішого аналізу ми виявили, що значна частина плутанини була спричинена не самою моделлю, а налаштуваннями системи harness.
По-перше, ми помітили, що після кожної ігрової дії всі приватні міркування видалялися. Тож після кожної дії GPT‑5.6 Sol мусила заново розбиратися в грі, не пам’ятаючи попередніх міркувань. Модель і далі бачила записи попередніх ходів і короткі супровідні нотатки, але не плани, висновки чи думки, які до них привели.
По-друге, ми побачили, що система harness використовувала рухоме вікно обрізання, через яке давніші дії зникали зі зростанням історії. Отже, GPT‑5.6 Sol не лише не пам’ятала своїх попередніх міркувань, а й поступово втрачала пам’ять про минулі дії.
Разом ці дві особливості системи harness — видалення міркувань і рухоме обрізання — пояснювали, чому GPT‑5.6 Sol було складно навчатися з часом.
Наші моделі навчені спершу формувати приватні повідомлення з міркуваннями, а вже потім видавати відповіді чи викликати інструменти. Ці приватні повідомлення з думками зберігаються в історії розмови. Якщо розмова стає надто довгою, ми стисло підсумовуємо її та продовжуємо.
Саме так навчаються наші моделі, і так само вони працюють у ChatGPT та Codex. Щоб точніше відтворити наше робоче середовище, ми реалізували систему harness ARC-AGI-3 за допомогою нашого API Responses(відкривається у новому вікні). Наш API спрощує керування контекстом: для GPT‑5.6 передавання ідентифікатора попередньої відповіді автоматично зберігає міркування між викликами інструментів і репліками.
Після збереження міркувань ми помітили дві значні зміни. По-перше, GPT‑5.6 Sol витрачала менше часу на обдумування кожної дії, адже їй більше не доводилося щоходу заново розбиратися в грі. По-друге, завдяки пам’яті про попередні думки GPT‑5.6 Sol значно краще навчалася з часом і застосовувала послідовні стратегії.
Наступним удосконаленням стала заміна рухомого обрізання на ущільнення(відкривається у новому вікні), ще одне налаштування API Responses.
Система harness ARC-AGI-3 долає обмеження контексту за допомогою рухомого обрізання. Коли контекст розмови перевищує 175 000 символів, найстаріші повідомлення видаляються.
Рухоме обрізання має два недоліки. По-перше, модель втрачає попередні спостереження та дії. По-друге, значну частину завдань вона виконує з майже заповненим лімітом контексту, що може дещо погіршувати продуктивність.
Коли ми ввімкнули ущільнення в ARC-AGI-3, GPT‑5.6 Sol змогла краще зберігати вивчене про кожну гру протягом триваліших запусків і досягла вищого результату з меншою кількістю вихідних токенів.
Щоб показати ефект збереження міркувань і ввімкнення ущільнення, наведемо анімацію 175-тисячного ліміту контексту GPT‑5.6 Sol під час розв’язання серії головоломок ARC-AGI-3 з кожною системою harness.
Дві центральні колонки показують, як кожна система harness по-різному використовує ліміт контексту моделі. Краще пам’ятаючи минуле, GPT‑5.6 Sol менше обдумує кожну дію й рухається значно швидше. Примітка: у нашій реалізації встановлено обмеження у 175 000 токенів, а не символів, але на практиці результати майже однакові, оскільки переважну частину тексту становлять сітки дій, які наш токенізатор розбиває на токени у співвідношенні 1:1.
Разом збереження міркувань і ущільнення дають GPT‑5.6 Sol (Max) змогу отримати приблизно втричі вищий результат із ушестеро меншою кількістю вихідних токенів.
Сподіваємося, ці експерименти нагадають, що тести рідко оцінюють моделі ізольовано: вони також оцінюють сукупність менш помітних рішень щодо налаштувань API, будови системи harness і промптингу. Це не перший випадок, коли нас дивували низькі результати в загальнодоступному тесті, а потім з’ясовувалося, що система запуску оцінювання використовувала універсальну систему harness, яка видаляла повідомлення з міркуваннями.
Якщо ви розробляєте з API й прагнете максимальної продуктивності, рекомендуємо використовувати ті самі налаштування, що й у наших продуктах:
- Використовуйте наш API Responses, а не застарілий API завершення чатів
- Зберігайте міркування
- Використовуйте ущільнення
А якщо ви порівнюєте моделі, радимо покладатися на тести з наведеними вище налаштуваннями, які найточніше відповідають реальному використанню в ChatGPT і Codex.
Ми вдячні ARC за багаторічну творчу роботу над оцінюванням AGI та за аналіз, який спонукав нас уважніше розглянути це питання.
Якщо хочете випробувати власні сили проти передових моделей, зіграйте в загальнодоступні ігри на arcprize.org/tasks(відкривається у новому вікні).


