Przejdź do treści głównej
OpenAI

Przedstawiamy modele GPT‑6 Sol i Luna

Więcej sposobów na wykorzystanie pionierskiej inteligencji w codziennej pracy.

Ładowanie…

Na początku tego miesiąca przedstawiliśmy GPT‑6 Astra, najbardziej inteligentny i najlepiej dostosowany model na świecie. Najbardziej wymagające i najważniejsze projekty nadal potrzebują pełni możliwości Astry, ale praca ma różną skalę, tempo i budżet.

Dlatego rozszerzamy rodzinę GPT‑6 o modele GPT‑6 Sol i GPT‑6 Luna. GPT‑6 Astra zapoczątkował nową generację inteligencji, a te modele pozwalają szerzej korzystać z jej zalet, wyznaczając nowe granice efektywności kosztowej. GPT‑6 Sol i Luna wytrenowaliśmy metodami podobnymi do użytych w przypadku GPT‑6 Astra. Dzięki temu szybsze i tańsze modele korzystają z rozwiązań, które zapewniły Astrze najnowocześniejsze możliwości w zakresie pracy zawodowej, zgodności z faktami, programowania, obsługi komputera i dostosowania.

Modele GPT‑6 oferują czołową wydajność w całym spektrum kosztów i poziomów inteligencji, łącząc wyjątkowe możliwości na każdym poziomie z infrastrukturą, która efektywnie udostępnia je na dużą skalę. Ulepszenia buforowania i wnioskowania pozwalają nam udostępniać te modele taniej. Oszczędności przekazujemy bezpośrednio użytkownikom i klientom, obniżając ceny Sol i Luny w API o 50% względem promocyjnych cen GPT‑5.6. Dzięki tym ulepszeniom zaawansowana AI staje się praktycznym rozwiązaniem dla większej liczby codziennych zadań i zastosowań na dużą skalę.

Cennik GPT‑6 API

Model

Wejście

Wyjście

Obniżka ceny

GPT‑6 Sol
w porównaniu z GPT‑5.6 Sol

4 USD → 2 USD

20 USD → 10 USD

o 50% taniej

GPT‑6 Luna
w porównaniu z GPT‑5.6 Luna

0,20 USD → 0,10 USD

1,20 USD → 0,50 USD

o 50% taniej

Ceny dotyczą 1 miliona tokenów.

GPT‑6 Astra pozostaje naszym najlepszym modelem pod każdym względem. Wybierz go, jeśli zależy Ci na najlepszych wynikach i bezkompromisowym działaniu.

Postęp w całej rodzinie modeli

GPT‑6 Sol i Luna zapewniają większą inteligencję i efektywność kosztową w modelach, które już znasz i wykorzystujesz do wykonywania złożonych zadań.

Praca zawodowa

GPT‑6 Sol radzi sobie z trudnymi zadaniami zawodowymi, a wyższe limity użycia i niższe koszty zapewniają więcej możliwości iteracji. Oferuje przy tym większą inteligencję i lepsze wyniki niż podobnie wycenione modele konkurencji.

W teście AutomationBench, który obejmuje procesy biznesowe realizowane w różnych aplikacjach, GPT‑6 Sol przy bardzo wysokim poziomie wysiłku przewyższa Claude Opus 5 przy poziomie maksymalnym, a koszt pojedynczego zadania wynosi zaledwie 9% kosztu Opus 5. Przy wysokim poziomie wysiłku GPT‑6 Luna osiąga wynik o 5,4 punktu procentowego lepszy od poprzednika, a koszt zadania jest o 58% niższy.

W teście AutomationBench 1.0.6⁠(otwiera nowe okno) agenty AI realizują kompleksowe procesy z użyciem 47 narzędzi z obszarów sprzedaży, marketingu, operacji, obsługi klienta, finansów i HR. Punkt danych dla Claude Fable 5.1 zaniża jego rzeczywisty koszt, ponieważ nie uwzględnia kosztu użycia modelu zapasowego Opus 5, który był wykorzystywany w około 40% zadań.

GPT‑6 Sol przewyższa też Claude Fable 5.1 przy znacznie niższym koszcie, a nawet pokonuje GPT‑6 Astra działający przy niskim poziomie wysiłku.

Model (i poziom wysiłku)

Wynik

Koszt zadania

GPT‑6 Sol (xhigh)

33,2%

0,27 USD

GPT‑6 Astra (Niski)

30,3%

3,9× GPT‑6 Sol

Claude Opus 5 (Maks)

26,9%

11,1× GPT‑6 Sol

Claude Fable 5.1 z modelem zapasowym Opus 5 (Maks)

31,4%

>8,9× GPT‑6 Sol

(nie podano kosztu modelu zapasowego)

W teście Agents’ Last Exam, który ocenia agentów realizujących złożone procesy zawodowe, GPT‑6 Sol przy maksymalnym poziomie wysiłku uzyskuje 56,4% — więcej niż najwyższy wynik Claude Opus 5 w tej ocenie — przy koszcie zadania niższym o 60%.

W teście Agents’ Last Exam V1⁠(otwiera nowe okno) agenty AI są oceniane pod kątem wykonywania długotrwałych, wartościowych ekonomicznie zadań z 55 podbranż, obejmujących większość głównych dziedzin pracy zawodowej wykonywanej na komputerze.

Zgodność z faktami

Użyteczność odpowiedzi zależy od poprawności faktów, dlatego nadal pracujemy nad poprawą wiarygodności faktograficznej. W naszej wewnętrznej ocenie zgodności z faktami, opartej na zanonimizowanych rzeczywistych rozmowach, w których użytkownicy zgłosili błędy naszych modeli, GPT‑6 Sol popełnia mniej więcej o połowę mniej błędów niż poprzednik. Zbliża się tym samym do niezawodności Astry przy znacznie niższym koszcie. GPT‑6 Luna również osiąga znaczną poprawę — przy wyższych poziomach wysiłku dorównuje GPT‑5.6 Sol, kosztując około sto razy mniej.

W tym teście oceniamy zgodność z faktami na podstawie zanonimizowanych rozmów w ChatGPT, w których użytkownicy zgłosili błąd rzeczowy popełniony przez wcześniejszy model. Rozmowy dobrane tak, by wywoływać błędy, nie odzwierciedlają typowego użycia, w którym błędy rzeczowe występują rzadziej. Wyniki nie są korygowane ze względu na długość, jednak nasze testy różnych poziomów szczegółowości wykazały, że długość odpowiedzi niemal nie wpływa na rezultat.

Programowanie

W tym roku agenty programistyczne zaczęły wykonywać zadania bardziej złożone, rozległe i długotrwałe niż kiedykolwiek wcześniej. W OpenAI nasze wewnętrzne użycie rośnie wykładniczo. Przy wycenie według stawek API wartość dziennego wykorzystania tokenów przekroczyła 600 USD dla badacza o medianowym wykorzystaniu oraz 7000 USD dla badaczy z 90. percentyla (Research acceleration: The view inside OpenAI⁠). W miarę jak agenty programistyczne podejmują się coraz dłuższych i bardziej wymagających zadań, rośnie znaczenie kosztu ich ciągłego używania. GPT‑6 Sol i Luna łączą wysoką skuteczność programowania z niższymi cenami API. Daje to deweloperom więcej możliwości iteracji, a zespołom — pewność, że mogą powierzać agentowi Codex ambitniejsze zadania.

W teście FrontierCode, który ocenia, czy agenty programistyczne tworzą zmiany gotowe do scalenia z rzeczywistymi bazami kodu, GPT‑6 Sol znacznie przewyższa GPT‑5.6 Sol i dorównuje Claude Fable 5.1 przy bardzo wysokim poziomie wysiłku, kosztując znacznie mniej.

W teście FrontierCode 1.1 Main⁠(otwiera nowe okno) agenty AI piszą kod oceniany nie tylko pod względem poprawności, ale także „gotowości do scalenia”, m.in. jakości testów, trzymania się zakresu, stylu kodu i zgodności ze standardami bazy kodu.

W teście DeepSWE v1.1, który sprawdza skuteczność w złożonych zadaniach inżynierii oprogramowania wykonywanych w rzeczywistych bazach kodu, GPT‑6 Sol przy maksymalnym poziomie wysiłku uzyskuje 68,8%. To o 1,1 punktu procentowego mniej od najwyższego wyniku Claude Fable 5 w tej ocenie — 69,9% przy bardzo wysokim poziomie wysiłku — przy koszcie zadania niższym o około 80%.

GPT‑6 Luna przy maksymalnym poziomie wysiłku uzyskuje 66,6%, czyli wynik porównywalny z Claude Opus 5 i Fable 5 przy średnim poziomie wysiłku. W tych porównaniach koszt zadania dla Luny jest o 93% niższy niż dla Opus 5 i o 96% niższy niż dla Fable 5.

W teście DeepSWE 1.1⁠(otwiera nowe okno) agenty AI rozwiązują oryginalne, długotrwałe zadania z zakresu inżynierii oprogramowania.

Obsługa komputera

GPT‑6 Astra pozostaje najlepszym na świecie modelem do obsługi komputera, ale GPT‑6 Sol i Luna zapewniają większą efektywność kosztową niż ich poprzednicy. W teście OSWorld 2.0 offline GPT‑6 Sol przy bardzo wysokim poziomie wysiłku osiąga wynik zbliżony do Claude Opus 5 przy średnim poziomie — 60,5% wobec 60,3% — przy koszcie zadania niższym o około 80%. GPT‑6 Luna (Maks) przewyższa GPT‑5.6 Sol (Średni), kosztując dziesięć razy mniej.

W teście OSWorld 2.0⁠(otwiera nowe okno) agenty AI próbują realizować długotrwałe procesy obsługi komputera obejmujące zadania codzienne i zawodowe. Podajemy częściową nagrodę dla zestawu offline z wydania v2026.08.08.

Styl współpracy

Udoskonalony styl komunikacji GPT‑6 Astra zastosowaliśmy również w modelach Sol i Luna. Sądzimy, że będzie to szczególnie widoczne w rozmowach technicznych i dotyczących programowania. Odpowiedzi będą jaśniejsze, mniej żargonowe i nieco krótsze, z mniejszą liczbą niezręcznych sformułowań oraz mało przydatnych szczegółów, ale bez utraty istotnej treści.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Choć styl jest kwestią subiektywną, w tym przypadku wolimy odpowiedź GPT‑6 Sol. Model nie wyciąga tak szybko pochopnych wniosków, poświęca mniej czasu na powtarzanie szczegółów, które mogą być oczywiste dla pytającego (np. że witryna ma cztery strony), używa mniej niejasnych sformułowań (np. „charakter bento”, „przekształcanie… wokół tego systemu”), otwarciej mówi, co sprawdził, a czego nie, i nie podaje niepotrzebnie szczegółów implementacji, takich jak polecenie przekazane narzędziu do obrazów.

Lepsze buforowanie dla agentów i długich rozmów

Oprócz obniżenia cen tokenów pomagamy deweloperom korzystającym z GPT‑6 dodatkowo oszczędzać na kontekście wielokrotnie używanym przez ich aplikacje. Ulepszyliśmy buforowanie poleceń w GPT‑6, aby domyślnie zwiększyć współczynnik trafień w pamięci podręcznej. Dzięki temu agenty mogą ponownie wykorzystywać więcej kontekstu, szybciej odpowiadać i korzystać z 90-procentowej zniżki na odczyt buforowanych tokenów wejściowych.

Deweloperzy mają też więcej sposobów mierzenia i optymalizowania wydajności buforowania:

  • Monitorowanie i diagnostyka. Panel buforowania poleceń⁠(otwiera nowe okno) pokazuje, jaka część danych wejściowych jest buforowana i jak zmienia się to z czasem. Narzędzie diagnostyczne⁠(otwiera nowe okno) pomaga wyjaśnić niewykorzystane możliwości buforowania i wskazuje, co należy poprawić.

  • Zmiana nakładu na rozumowanie i dostępności narzędzi bez naruszania pamięci podręcznej. Możesz zwiększyć nakład na rozumowanie⁠(otwiera nowe okno) przy trudniejszych zadaniach lub zmniejszyć go przy prostszych pytaniach uzupełniających, a także włączać i wyłączać narzędzia⁠(otwiera nowe okno) w zależności od potrzeb agenta. Oba ustawienia zachowują teraz wcześniejszy kontekst do ponownego wykorzystania z pamięci podręcznej.

  • Optymalizacja wyboru buforowanych prefiksów. Jawne punkty podziału pamięci podręcznej pozwalają deweloperom określić, gdzie kończą się buforowane prefiksy polecenia. Daje to deweloperom większą kontrolę nad ponownym wykorzystaniem pamięci podręcznej i może poprawić wydajność.

GitHub informuje, że w ciągu ostatnich kilku miesięcy ulepszenia te zmniejszyły o ponad 50% udział tokenów poleceń wymagających ponownego przetwarzania w miliardach żądań kierowanych do modeli OpenAI, dzięki czemu Copilot odpowiada szybciej.

Dalsze doskonalenie dostosowania

GPT‑6 Sol i Luna rozwijają rozwiązania z zakresu dostosowania wprowadzone wraz z Astrą — naszym najlepiej dotąd dostosowanym modelem. W naszych ocenach dostosowania zarówno Sol, jak i Luna wypadają lepiej niż ich odpowiedniki GPT‑5.6, m.in. rzadziej przedstawiając mylące twierdzenia na temat wykonanej pracy programistycznej.

Poniższe oceny celowo sprawdzają trudne sytuacje i nie mierzą częstotliwości błędów podczas typowego użycia. Pełne wyniki znajdziesz w karcie systemu⁠(otwiera nowe okno).

Dostępność

Od dziś GPT‑6 Sol i GPT‑6 Luna są dostępne w ChatGPT Work i Codex dla wszystkich użytkowników planów Plus, Pro, Business, Enterprise i Edu. Użytkownicy planów Free i Go mogą korzystać z GPT‑6 Luna w aplikacji komputerowej. Modele te nie są jeszcze dostępne w trybie Chat. W OpenAI API są dostępne jako gpt-6-sol i gpt-6-luna.

Aby zapewnić wszystkim stabilne działanie usługi, planujemy stopniowo udostępniać te modele w ChatGPT w ciągu dnia. Jeśli nie widzisz nowych modeli w ChatGPT Work lub Codex, spróbuj ponownie później.


Oceny GPT przeprowadzono w naszym środowisku badawczym lub za pośrednictwem API, dlatego ze względu na różnice w poleceniach systemowych, dostępnych narzędziach itp. wyniki mogą nieznacznie różnić się od rezultatów produkcyjnej wersji ChatGPT. Oceny modeli konkurencji zaczerpnięto z publicznie dostępnych raportów. Gdy wyniki Claude Fable 5.1 nie były dostępne, podawaliśmy wyniki Claude Fable 5.

Autorzy

OpenAI