Przejdź do treści głównej
OpenAI

29 lipca 2026

BadaniaPublikacja

Jak dwa ustawienia potroiły nasze wyniki w benchmarku ARC-AGI-3

Ładowanie…

Przyspieszone nagranie, na którym GPT‑5.6 Sol próbuje rozwiązywać łamigłówki benchmarku ARC-AGI-3 w oficjalnym otoczeniu operacyjnym (po lewej) oraz w naszym otoczeniu opartym na Responses API (po prawej), które zachowuje rozumowanie i włącza kompaktowanie. W rankingu tej gry⁠(otwiera nowe okno) żaden pionierski model nie rozwiązuje poziomu wyższego niż pierwszy. W naszym otoczeniu GPT‑5.6 Sol rozwiązuje wszystkie sześć.

Gdy po raz pierwszy zobaczyliśmy niskie wyniki GPT‑5.6 Sol w benchmarku ARC-AGI-3⁠(otwiera nowe okno), byliśmy zaskoczeni.

GPT‑5.6 Sol rozwiązał nierozstrzygnięte od dawna problemy matematyczne, takie jak hipoteza o podwójnym pokryciu cyklami⁠(otwiera nowe okno), i pokonał gry takie jak Pokémon FireRed. Jednak w ARC-AGI-3, benchmarku złożonym z dwuwymiarowych gier logicznych, GPT‑5.6 Sol uzyskał zaledwie 7,8%, a GPT‑5.5 ledwo potrafił w nie grać i osiągnął marne 0,4%.

Czy dwuwymiarowe gry logiczne były wyjątkowo trudne dla naszych modeli? A może chodziło o coś innego?

Benchmarki rzadko mierzą modele AI w oderwaniu od innych czynników. Mierzą też mniej widoczne decyzje dotyczące ustawień API, projektu otoczenia operacyjnego i formułowania promptów. W przypadku ARC-AGI-3 odkryliśmy, że włączenie dwóch ustawień API używanych przez nas w ChatGPT i Codex—zachowywania rozumowania oraz kompaktowania—potroiło wyniki i sześciokrotnie zmniejszyło liczbę tokenów wyjściowych w publicznym zestawie zadań.

W oficjalnym otoczeniu operacyjnym GPT‑5.6 Sol uzyskał 13,3% w publicznym zestawie ARC-AGI-3. Po zachowaniu rozumowania i włączeniu kompaktowania uzyskał 38,3%. Wyniki mierzą względną efektywność działań człowieka (RHAE⁠(otwiera nowe okno))—wskaźnik porównujący wydajność modelu z poziomem bazowym człowieka. Na podstawie oficjalnych dzienników rozgrywki⁠(otwiera nowe okno) szacujemy, że testerzy uzyskiwali średnio 48%. Modele nie wiedzą, jak będą oceniane, i w trakcie gry nie widzą swojego wyniku—działania zwracają jedynie tekstową reprezentację każdej klatki oraz informację o bieżącym poziomie.

ARC-AGI-3

ARC-AGI-3 to benchmark służący do pomiaru zdolności agentów AI do uczenia się i rozumowania. Agenci eksplorują nieznane gry 2D i bez wyraźnych instrukcji ustalają zasady ich działania. W 25 gier demonstracyjnych można zagrać na stronie arcprize.org/tasks⁠(otwiera nowe okno).

ARC-AGI-3 celowo korzysta z ogólnego otoczenia operacyjnego, bez narzędzi ani funkcji specjalnych. ARC kierowało się założeniem, że proste otoczenie operacyjne wyraźniej ukazuje niedoskonałości modeli i pozwala porównywać je w bardziej sprawiedliwy sposób. Twórcy rozwiązań komercyjnych optymalizują natomiast otoczenia operacyjne pod kątem funkcji i specyfiki poszczególnych modeli.

W grach GPT‑5.6 Sol pokonał Pokémon FireRed, korzystając z otoczenia operacyjnego opartego wyłącznie na obrazie (transmisja: GPT_Plays_Pokemon⁠(otwiera nowe okno)), Slay the Spire, sterując komputerem za pomocą Codex (transmisja: EpochAI⁠(otwiera nowe okno)), oraz pierwsze etapy Baba Is You (materiał udostępnili Piotr Migdał & Piotr Grabowski⁠(otwiera nowe okno)). Co tak bardzo odróżniało ARC-AGI-3?

GPT-5.6 Sol w Codex kończy losowe wyzwanie dnia w Slay the Spire 2.

Ethan Mollick pokazuje⁠(otwiera nowe okno), jak GPT‑5.6 Sol w Codex pokonuje losowe wyzwanie dnia w Slay the Spire 2—grze wydanej po dacie granicznej wiedzy GPT‑5.6 Sol.

Zainspirowani analizą niedoskonałości GPT‑5.5 przeprowadzoną przez ARC⁠(otwiera nowe okno), przyjrzeliśmy się niektórym próbom GPT‑5.6 Sol. Podobnie jak ARC zauważyliśmy, że model nie sprawiał wrażenia zbyt bystrego. Długo zastanawiał się nad każdym działaniem i z trudem robił postępy.

Głębsza analiza wykazała jednak, że znaczna część dezorientacji modelu nie wynikała z jego natury, lecz z ustawień otoczenia operacyjnego.

Po pierwsze zauważyliśmy, że po każdym działaniu w grze całe prywatne rozumowanie było odrzucane. Oznaczało to, że przy każdym działaniu GPT‑5.6 Sol musiał na nowo rozgryzać grę, nie pamiętając swoich wcześniejszych przemyśleń. Model nadal widział zapis poprzednich ruchów i krótkie notatki, ale nie miał dostępu do planów, spostrzeżeń ani przemyśleń, które do nich doprowadziły.

Po drugie zauważyliśmy, że otoczenie operacyjne używało przesuwnego okna obcinania, przez co wraz z rozrastaniem się historii starsze działania przestawały być widoczne. GPT‑5.6 Sol nie tylko nie pamiętał więc wcześniejszych przemyśleń, lecz także tracił pamięć o poprzednich działaniach.

Te dwie cechy otoczenia operacyjnego—odrzucanie rozumowania i przesuwne obcinanie—pomogły wyjaśnić, dlaczego GPT‑5.6 Sol miał trudności z uczeniem się w miarę upływu czasu.

Agenci osiągają najlepsze wyniki, gdy pamiętają swoje działania

Nasze modele są trenowane tak, aby przed wygenerowaniem odpowiedzi lub wywołaniem narzędzia przeprowadzały rozumowanie w prywatnych komunikatach. Te prywatne komunikaty z przemyśleniami są zachowywane w historii rozmowy. Jeśli rozmowa staje się zbyt długa, podsumowujemy ją i kontynuujemy.

Schemat pokazujący, jak rozumowanie modelu, wywołania narzędzi, historia rozmowy i kompaktowanie kontekstu współdziałają podczas długotrwałego zadania.

W ten sposób trenujemy nasze modele i tak też wdrażamy je w ChatGPT oraz Codex. Aby lepiej odwzorować nasze środowisko produkcyjne, wdrożyliśmy otoczenie operacyjne ARC-AGI-3 przy użyciu naszego Responses API⁠(otwiera nowe okno). Nasze API ułatwia zarządzanie kontekstem: w przypadku GPT‑5.6 przekazanie identyfikatora poprzedniej odpowiedzi automatycznie zachowuje rozumowanie między wywołaniami narzędzi i turami rozmowy.

Po włączeniu zachowywania rozumowania zauważyliśmy dwie istotne zmiany. Po pierwsze GPT‑5.6 Sol krócej zastanawiał się przed każdym działaniem, ponieważ nie musiał już w każdej turze interpretować gry od początku. Po drugie możliwość zapamiętywania wcześniejszych przemyśleń sprawiła, że GPT‑5.6 Sol znacznie lepiej uczył się z czasem i stosował spójne strategie.

Kolejną poprawę przyniosło zastąpienie przesuwnego obcinania kompaktowaniem⁠(otwiera nowe okno)—innym ustawieniem Responses API.

Otoczenie operacyjne ARC-AGI-3 radzi sobie z limitami kontekstu za pomocą przesuwnego obcinania. Gdy kontekst rozmowy przekracza 175 000 znaków, najstarsze komunikaty są odrzucane.

Przesuwne obcinanie ma dwie wady. Po pierwsze model traci wcześniejsze obserwacje i działania. Po drugie przez znaczną część zadań działa z bardziej zapełnionym oknem kontekstu, co może nieco obniżać wydajność.

Po włączeniu kompaktowania w ARC-AGI-3 GPT‑5.6 Sol lepiej zachowywał podczas dłuższych sesji wiedzę zdobytą o każdej grze i osiągnął wyższy wynik przy mniejszej liczbie tokenów wyjściowych.

Aby zilustrować wpływ zachowywania rozumowania i kompaktowania, przedstawiamy animację pokazującą, jak GPT‑5.6 Sol wykorzystuje okno kontekstu o pojemności 175 tys. podczas rozwiązywania serii łamigłówek ARC-AGI-3 w każdym z otoczeń operacyjnych.

Dwie środkowe kolumny pokazują, jak każde z otoczeń operacyjnych inaczej wykorzystuje okno kontekstu modelu. Dzięki lepszej pamięci wcześniejszych działań GPT‑5.6 Sol poświęca mniej czasu na rozumowanie przed każdym ruchem i działa znacznie szybciej. Uwaga: nasza implementacja stosuje limit 175 000 tokenów zamiast znaków, ale wartości te są dość zbliżone, ponieważ zdecydowana większość tekstu to siatki działań, które nasz tokenizer przetwarza w stosunku 1:1.

Łącznie zachowywanie rozumowania i kompaktowanie pozwalają GPT‑5.6 Sol (Maks) osiągnąć około trzykrotnie wyższy wynik przy sześciokrotnie mniejszej liczbie tokenów wyjściowych.

Wnioski i zalecenia

Mamy nadzieję, że te eksperymenty przypomną, iż ewaluacje rzadko mierzą modele w oderwaniu od innych czynników—uwzględniają też zestaw mniej widocznych decyzji dotyczących ustawień API, projektu otoczenia operacyjnego i formułowania promptów. To nie pierwszy raz, gdy zaskoczyły nas niskie wyniki w publicznym benchmarku, po czym odkryliśmy, że mechanizm ewaluacyjny korzystał z ogólnego otoczenia operacyjnego, które pomijało komunikaty z rozumowaniem.

Deweloperom API, którzy chcą maksymalizować wydajność, zalecamy korzystanie z tych samych ustawień, które wdrażamy w naszych produktach:

  • Korzystaj z naszego Responses API zamiast starszego API zakończenia czatu

  • Zachowuj rozumowanie

  • Korzystaj z kompaktowania

Jeśli zaś porównujesz modele, zalecamy opieranie się na ewaluacjach wykorzystujących powyższe ustawienia, ponieważ najlepiej odzwierciedlają one rzeczywiste zastosowania w ChatGPT i Codex.

Dziękujemy ARC za lata twórczej pracy nad ewaluacją AGI oraz za analizę, która zainspirowała nas do bliższego przyjrzenia się temu zagadnieniu.

Jeśli chcesz zmierzyć się z pionierskimi modelami, samodzielnie wypróbuj publiczne gry na stronie arcprize.org/tasks⁠(otwiera nowe okno).

Autorzy

Ilan Bigio i Ted Sanders