Переход к основному контенту
OpenAI

Как две настройки утроили наш результат в бенчмарке ARC-AGI-3

Загрузка…

Ускоренная видеозапись попыток GPT‑5.6 Sol решить головоломки бенчмарка ARC-AGI-3: слева — официальная обвязка, справа — наша обвязка на основе Responses API, которая сохраняет рассуждения и включает сжатие контекста. В таблице лидеров этой игры(открывается в новом окне) ни одна передовая модель не проходит уровни дальше первого. С нашей обвязкой GPT‑5.6 Sol проходит все шесть.

Когда мы впервые увидели низкие результаты GPT‑5.6 Sol в бенчмарке ARC-AGI-3(открывается в новом окне), мы были озадачены.

GPT‑5.6 Sol решила такие давно не поддававшиеся решению открытые математические задачи, как гипотеза о двойном покрытии циклами(открывается в новом окне), и прошла такие игры, как Pokémon FireRed. Но в ARC-AGI-3, бенчмарке на основе двумерных игр-головоломок, GPT‑5.6 Sol набрала всего 7,8%, а GPT‑5.5 почти не могла играть и получила лишь 0,4%.

Неужели двумерные игры-головоломки оказались необычайно сложными для наших моделей? Или дело было в чем-то другом?

Бенчмарки редко оценивают модели ИИ изолированно. Они также оценивают менее заметные решения по настройке API, проектированию обвязки и составлению промптов. В случае ARC-AGI-3 мы обнаружили, что включение двух настроек API, которые мы используем в ChatGPT и Codex, — сохранения рассуждений и сжатия контекста — утроило результат на общедоступном наборе заданий и в шесть раз сократило число выходных токенов.

С официальной обвязкой GPT‑5.6 Sol набрала 13,3% на общедоступном наборе ARC-AGI-3. При сохранении рассуждений и сжатии контекста результат составил 38,3%. Баллы отражают относительную эффективность действий по сравнению с человеком (RHAE(открывается в новом окне))метрику, сопоставляющую результат модели с базовым человеческим уровнем. По официальным журналам игр(открывается в новом окне) мы оцениваем средний результат участников-людей в 48%. Моделям не сообщают, как будет оцениваться их результат, и они не видят свои баллы в процессепосле каждого действия им возвращается лишь текстовое представление кадра и номер текущего уровня.

ARC-AGI-3

ARC-AGI-3 — это бенчмарк для оценки способности ИИ-агентов учиться и рассуждать. Агенты исследуют незнакомые двумерные игры и без явных инструкций выясняют, как они устроены. Сыграть в 25 демонстрационных игр можно на сайте arcprize.org/tasks(открывается в новом окне).

В ARC-AGI-3 намеренно используется универсальная обвязка без инструментов и специальных функций. По мнению ARC, простая обвязка лучше выявляет недостатки моделей и делает их сравнение более объективным. Разработчики коммерческих продуктов, напротив, оптимизируют обвязку под особенности и нюансы каждой модели.

В играх GPT‑5.6 Sol прошла Pokémon FireRed с обвязкой, использующей только зрение (трансляция GPT_Plays_Pokemon(открывается в новом окне)), Slay the Spire — управляя компьютером через Codex (трансляция EpochAI(открывается в новом окне)), а также первые уровни Baba Is You (результатами поделились Пётр Мигдал и Пётр Грабовский(открывается в новом окне)). Чем же так отличался ARC-AGI-3?

GPT-5.6 Sol в Codex проходит случайное ежедневное испытание в Slay the Spire 2.

Итан Моллик показывает(открывается в новом окне), как GPT‑5.6 Sol в Codex проходит случайное ежедневное испытание в Slay the Spire 2 — игре, выпущенной после даты окончания обучающих данных GPT‑5.6 Sol.

Вдохновившись анализом недостатков GPT‑5.5 от ARC(открывается в новом окне), мы изучили несколько попыток GPT‑5.6 Sol. Как и ARC, мы увидели, что модель выглядела не слишком сообразительной. Она подолгу обдумывала каждое действие и с трудом продвигалась вперед.

Но при более глубоком изучении выяснилось, что значительная часть затруднений была вызвана не самой моделью, а настройками обвязки.

Во-первых, мы заметили, что после каждого действия в игре все внутренние рассуждения удалялись. Поэтому после каждого действия GPT‑5.6 Sol приходилось заново разбираться в игре, не помня собственных предыдущих рассуждений. Модель по-прежнему видела историю ходов и краткие сопроводительные заметки, но не планы, выводы и мысли, которые к ним привели.

Во-вторых, обвязка использовала скользящее усечение контекста, из-за чего по мере роста истории старые действия становились невидимыми. Таким образом, GPT‑5.6 Sol не только не помнила прежние рассуждения, но и постепенно забывала свои предыдущие действия.

Эти две особенности обвязки — удаление рассуждений и скользящее усечение — помогли понять, почему GPT‑5.6 Sol было так трудно учиться со временем.

Агенты показывают лучшие результаты, когда помнят свои действия

Наши модели обучены размышлять во внутренних сообщениях с рассуждениями, прежде чем выдавать ответы или вызывать инструменты. Эти внутренние сообщения сохраняются в истории диалога. Если диалог становится слишком длинным, мы создаем его сводку и продолжаем работу.

Схема взаимодействия рассуждений модели, вызовов инструментов, истории диалога и сжатия контекста при выполнении длительной задачи.

Так обучаются наши модели и так же они работают в ChatGPT и Codex. Чтобы точнее воспроизвести нашу рабочую конфигурацию, мы реализовали обвязку ARC-AGI-3 с помощью Responses API(открывается в новом окне). Наш API упрощает управление контекстом: для GPT‑5.6 достаточно передать идентификатор предыдущего ответа, чтобы автоматически сохранять рассуждения между вызовами инструментов и репликами.

После сохранения рассуждений мы заметили два существенных изменения. Во-первых, GPT‑5.6 Sol стала тратить меньше времени на размышления перед каждым действием, поскольку ей больше не приходилось на каждом ходу заново разбираться в игре. Во-вторых, получив возможность помнить прежние мысли, GPT‑5.6 Sol стала гораздо лучше учиться с течением времени и применять последовательные стратегии.

Следующим улучшением стала замена скользящего усечения на сжатие контекста(открывается в новом окне) — еще одну настройку Responses API.

Обвязка ARC-AGI-3 справляется с ограничениями контекста с помощью скользящего усечения. Когда контекст диалога превышает 175 000 символов, самые старые сообщения удаляются.

У скользящего усечения есть два недостатка. Во-первых, модель теряет ранние наблюдения и действия. Во-вторых, значительную часть задания она выполняет с почти полностью заполненным контекстным окном, что может немного снизить качество работы.

Когда мы включили сжатие контекста в ARC-AGI-3, GPT‑5.6 Sol смогла лучше сохранять полученные знания о каждой игре на протяжении длительных запусков и набрала больше баллов при меньшем числе выходных токенов.

Чтобы наглядно показать эффект сохранения рассуждений и сжатия контекста, мы подготовили анимацию 175-тысячного контекстного окна GPT‑5.6 Sol при решении серии головоломок ARC-AGI-3 с каждой из обвязок.

Две центральные колонки показывают, как каждая обвязка использует контекстное окно модели. Лучше помня предыдущие события, GPT‑5.6 Sol меньше размышляет над каждым действием и продвигается намного быстрее. Примечание: в нашей реализации установлен лимит в 175 000 токенов, а не символов, но итог почти не отличается, поскольку подавляющую часть текста составляют сетки действий, которые наш токенизатор преобразует в токены в соотношении 1:1.

Вместе сохранение рассуждений и сжатие контекста позволяют GPT‑5.6 Sol (Max) набрать примерно втрое больше баллов при шестикратном сокращении числа выходных токенов.

Выводы и рекомендации

Надеемся, эти эксперименты напомнят, что тесты редко оценивают модели изолированно: они также учитывают набор менее заметных решений по настройке API, проектированию обвязки и составлению промптов. Мы уже не впервые удивляемся низким результатам в общедоступном бенчмарке, а затем обнаруживаем, что система запуска тестов использует универсальную обвязку, удаляющую сообщения с рассуждениями.

Если вы разрабатываете решения на основе API и хотите добиться максимальной производительности, рекомендуем использовать те же настройки, что и в наших продуктах:

  • Используйте Responses API вместо устаревшего API завершения чата
  • Сохраняйте рассуждения
  • Используйте сжатие контекста

А при сравнении моделей рекомендуем опираться на тесты с перечисленными выше настройками: именно они лучше всего соответствуют реальному использованию в ChatGPT и Codex.

Мы благодарны ARC за многолетнюю творческую работу над оценкой AGI и за анализ, который побудил нас внимательнее изучить этот вопрос.

Если хотите испытать себя в сравнении с передовыми моделями, попробуйте пройти общедоступные игры на сайте arcprize.org/tasks(открывается в новом окне).

Автор

Ilan Bigio, Ted Sanders