GPT-6.1Sol
Inteligencja zbliżona do Astry za jedną piątą ceny — stała wydajność na poziomie pionierskich modeli
Przedstawiamy GPT‑6.1 Sol, ulepszoną wersję GPT‑6 Sol, która osiąga wyjątkowo dobre wyniki w kodowaniu agentowym, obsłudze komputera i pracy zawodowej. Zbliża ona Sol do GPT‑6 Astra w wymagających zadaniach, przy cenach tokenów wejściowych i wyjściowych wynoszących jedną piątą standardowych cen Astry. Daje to programistom więcej możliwości tworzenia i uruchamiania skutecznych agentów w ramach tego samego budżetu.
GPT‑6.1 Sol zapewnia wydajność zbliżoną do Astry w cenie Sol, co czyni go modelem o najlepszym obecnie stosunku wydajności do kosztów. Dane wejściowe z pamięci podręcznej kosztują zaledwie 0,10 USD za milion tokenów — o 95% mniej niż standardowe dane wejściowe. Obniża to koszty zadań agentowych wymagających ponownego użycia kontekstu w kolejnych żądaniach.
GPT‑6 Astra pozostaje naszym pionierskim modelem o największych ogólnych możliwościach. GPT‑6.1 Sol oferuje nową równowagę między możliwościami a kosztami — zarówno w ważnych zadaniach, które użytkownicy chcą wykonywać częściej, jak i dla klientów API tworzących i uruchamiających aplikacje na dużą skalę.

GPT‑6.1 Sol znacznie przewyższa GPT‑6 Sol w złożonych zadaniach zawodowych — od pisania kodu i usuwania z niego błędów po rozumienie dokumentów i realizację wieloetapowych procesów biznesowych. W kilku z tych testów zbliża się do wyników GPT‑6 Astra przy znacznie niższych kosztach.
W DeepSWE v1.1, który ocenia złożone zadania z zakresu inżynierii oprogramowania w rzeczywistych bazach kodu, GPT‑6.1 Sol dorównuje GPT‑6 Astra za około jedną piątą kosztu. Jednocześnie przewyższa najlepszy wynik GPT‑6 Sol o 6,4 punktu procentowego przy mniejszym wysiłku rozumowania i niższym koszcie.
W benchmarku DeepSWE 1.1(otwiera nowe okno) agenci AI wykonują autorskie zadania z zakresu inżynierii oprogramowania wymagające wielu etapów pracy.
Test GDP.pdf mierzy, jak trafnie modele odpowiadają na pytania zawodowe na podstawie złożonych dokumentów PDF zawierających tabele, wykresy, diagramy i szczegóły zapisane drobnym drukiem. GPT‑6.1 Sol uzyskuje w nim lepsze wyniki niż Opus 5.5 z modelami rezerwowymi przy koszcie zadania niższym o ponad połowę we wszystkich testowanych ustawieniach rozumowania. Zbliża się też do najlepszych w branży wyników GPT‑6 Astra przy około pięciokrotnie niższym koszcie zadania.
W benchmarku GDP.pdf(otwiera nowe okno) modele muszą odpowiadać na polecenia z praktyki zawodowej dotyczące złożonych plików PDF wykorzystywanych w finansach, ochronie zdrowia, prawie i siedmiu innych dziedzinach.
W AutomationBench, który sprawdza, czy agenci poprawnie realizują wieloetapowe procesy biznesowe, GPT‑6.1 Sol przy średnim wysiłku rozumowania uzyskuje wynik o 2,2 punktu procentowego wyższy niż Opus 5.5 za około jedną trzecią kosztu. To również wynik o 4,8 punktu procentowego lepszy niż GPT‑6 Sol przy tym samym ustawieniu.
In AutomationBench 1.0.6(otwiera nowe okno), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol robi też znaczne postępy w zadaniach wymagających interakcji z aplikacjami komputerowymi. Na zestawie offline testu OSWorld 2.0, który ocenia agentów w wymagających procesach obsługi komputera, GPT‑6.1 Sol przewyższa GPT‑6 Sol o siedem punktów procentowych przy maksymalnym wysiłku rozumowania i koszcie niższym o ponad połowę. Przy maksymalnym wysiłku rozumowania ustępuje Astrze zaledwie o 2,1 punktu procentowego, a koszt zadania wynosi około jedną siódmą kosztu Astry.
In OSWorld 2.0(otwiera nowe okno), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
W Terminal-Bench Science 0.1, który ocenia procesy naukowe obejmujące analizę danych, symulacje i dowodzenie twierdzeń, GPT‑6.1 Sol ponad dwukrotnie poprawia wynik GPT‑6 Sol przy maksymalnym wysiłku rozumowania i koszcie zadania niższym o ponad połowę. Przy maksymalnym wysiłku średni koszt zadania dla GPT‑6.1 Sol wynosi 5,47 USD, w porównaniu z 23,21 USD dla Opus 5.5 i 23,80 USD dla Astry. Zapewnia to duże możliwości w badaniach naukowych przy koszcie o ponad 75% niższym niż w przypadku każdego z tych modeli.
GPT‑6 Astra nadal osiąga najwyższy wynik wśród testowanych modeli — 68,1% — i to jego należy używać do najtrudniejszych zadań badawczych.
W benchmarku Terminal-Bench Science 0.1(otwiera nowe okno) agenci realizują procesy badań naukowych za pomocą kodu i narzędzi terminalowych, m.in. analizują dane, przeprowadzają symulacje i dopasowują modele.
GPT‑6.1 Sol poprawia też poprawność merytoryczną odpowiedzi na trudne prompty. Przy bardzo wysokim wysiłku rozumowania odsetek błędów merytorycznych wynosi 4,1%, wobec 4,5% dla GPT‑6 Sol. Zbliża się tym samym do wyniku Astry — 4,0% przy tym samym ustawieniu — przy koszcie zadania niższym od Astry o około 83%.
Test mierzy odsetek odpowiedzi zawierających co najmniej jeden błąd merytoryczny w rozmowach, z których usunięto dane identyfikujące, a w których użytkownicy zgłosili błąd wcześniejszego modelu. Te celowo trudne prompty nie odzwierciedlają typowego użytkowania.
Oceniamy poprawność merytoryczną na podstawie rozmów w ChatGPT, z których usunięto dane identyfikujące, a w których użytkownicy zgłosili błąd merytoryczny wcześniejszego modelu. Te rozmowy prowokujące błędy nie odzwierciedlają typowego użytkowania, podczas którego błędy merytoryczne zdarzają się rzadziej.
W naszych testach zgodności działania z ludzkimi intencjami GPT‑6.1 Sol wypada znacznie lepiej niż GPT‑6 Sol, zbliżając się do GPT‑6 Astra.
GPT‑6.1 Sol bardziej otwarcie informuje o swoich ograniczeniach i skuteczniej respektuje intencje użytkownika oraz ograniczenia bezpieczeństwa. W wymagających testach popełnia mniej błędów niż GPT‑6 Sol w zakresie informowania o awarii narzędzi wyszukiwania, przestrzegania wyraźnych ograniczeń i unikania nieautoryzowanych skutków podczas zadań agentowych. Nie zaobserwowaliśmy żadnych prób obejścia automatycznego systemu kontroli bezpieczeństwa, podobnie jak w przypadku GPT‑6 Astra i GPT‑6 Sol.
Poniższe testy celowo sprawdzają trudne sytuacje i nie mierzą częstości błędów podczas typowego użytkowania.
GPT‑6.1 Sol jest od dziś dostępny w ChatGPT Work i Codex dla wszystkich użytkowników planów Plus, Pro, Business, Enterprise i Edu. Te modele nie są jeszcze dostępne w trybie Chat. Programiści mogą też korzystać z niego przez API OpenAI pod nazwą gpt-6.1-sol. Standardowe ceny w API wynoszą 2 USD za milion tokenów wejściowych, 0,10 USD za milion tokenów wejściowych z pamięci podręcznej i 10 USD za milion tokenów wyjściowych.
Równocześnie wprowadzamy GPT‑6 Astra Ultrafast, najszybszy pionierski model na świecie, działający nawet 8 razy szybciej niż GPT‑6 Astra, a także GPT‑6.1 Sol Ultrafast. Są one dostępne w API, a także w ChatGPT Work i Codex dla użytkowników naszego nowego wariantu planu Pro z najwyższymi limitami użytkowania, za 500 USD miesięcznie. GPT‑6.1 Sol Ultrafast daje programistom inteligencję zbliżoną do Astry przy nawet 8-krotnie większej szybkości, za mniej więcej tyle, ile wcześniej płacili za GPT‑6 Astra w API.
Autorzy
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

