Przejdź do treści głównej
OpenAI

3 września 2026

Bezpieczeństwo

Przegląd bezpieczeństwa: GPT‑6 Astra

Ładowanie…

Dziś udostępniamy GPT‑6 Astra — najbardziej zaawansowany model, jaki dotąd wdrożyliśmy na szeroką skalę. Astra to nasz pierwszy model, który zgodnie z Ramami gotowości osiągnął krytyczny poziom zdolności w dziedzinie cyberbezpieczeństwa.

Oto najważniejsze informacje dotyczące bezpieczeństwa związanego z tą premierą:

  1. GPT‑6 Astra stanowi znaczący krok naprzód pod względem zdolności cybernetycznych i osiąga określony przez nas próg krytyczny. Oznacza to, że dzięki odpowiednim narzędziom i dostępowi GPT‑6 Astra potrafi znajdować nieznane wcześniej luki w zabezpieczeniach oraz opracowywać nowe sposoby ich wykorzystywania w wielu dobrze chronionych systemach, bez konieczności nadzorowania każdego kroku przez człowieka. Dlatego znacznie wzmocniliśmy zabezpieczenia przed podejmowaniem przez model szkodliwych działań cybernetycznych — zarówno wskutek niewłaściwego użycia, jak i niedostatecznej zgodności z założeniami. Podjęliśmy również działania zabezpieczające wewnętrzne prace nad Astrą i podobnymi modelami oraz ich wdrażanie. Obejmują one silniejszą izolację, szyfrowanie punktów kontrolnych, uniwersalny monitoring pełnych przebiegów, w tym toków rozumowania (CoT), a także obowiązkową ocenę zgodności przed dopuszczeniem do użytku wewnętrznego.
  2. GPT‑6 Astra jest znacznie odporniejszy niż jego poprzednicy. Dzięki zastosowaniu nowych metod treningu zwiększających odporność i bezpieczeństwo GPT‑6 Astra jest znacznie odporniejszy na obejścia zabezpieczeń niż GPT‑5.6 Sol, także w przypadku dłuższych przebiegów. Potwierdzają to testy offline oraz nasz program rygorystycznego wewnętrznego i zewnętrznego testowania obejść zabezpieczeń i usuwania wykrytych podatności. W przypadku użytkowników oznaczonych jako potencjalnie obarczeni wysokim ryzykiem dodatkowo wytrenowaliśmy model tak, aby mógł przesuwać granicę odmowy w bardziej zachowawczym kierunku i uwzględniać szerszy zakres zagrożeń związanych z podwójnym zastosowaniem. Za pomocą testów regresji sprawdzamy, czy model Astra pozostaje odporny na obejścia zabezpieczeń wykryte we wcześniejszych testach. Przeprowadziliśmy też kolejne rundy zautomatyzowanych kontrolowanych ataków z wykorzystaniem naszych najnowszych wewnętrznych agentów przeprowadzających takie ataki, aby zweryfikować skuteczność tych ulepszeń.
  3. GPT‑6 Astra jest lepiej dostosowany do założeń niż GPT‑5.6 Sol. Model Astra stanowi znaczący krok naprzód w dostosowaniu modeli. Ulepszenia obejmują zarówno dobór danych do szkolenia wstępnego, jak i ocenianie podczas uczenia przez wzmacnianie. Przedstawiamy nowy zestaw ocen zgodności z założeniami(otwiera nowe okno), z których wynika, że GPT‑6 Astra skuteczniej przestrzega ograniczeń dotyczących bezpieczeństwa i działa w granicach swoich uprawnień. W symulacji wykorzystującej ponad 54 000 wewnętrznych zadań Codex(otwiera nowe okno) w przypadku modelu Astra odnotowano również o około połowę mniej oznaczeń poważniejszych zachowań niezgodnych z założeniami niż w przypadku modelu Sol.
  4. Na szeroką skalę wdrażamy monitorowanie zachowań niezgodnych z założeniami. Dostosowanie modeli do założeń uznajemy za podstawowy sposób zapobiegania takim zachowaniom. Jednak monitorowanie zapewnia szeroki wgląd w działanie pionierskich modeli, wskazując możliwości dalszej poprawy ich zgodności z założeniami i bezpieczeństwa. Stanowi też dodatkową warstwę ochrony w przypadku wykrycia takich zachowań. Z tych względów objęliśmy nim także wszystkie procesy wnioskowania z użyciem narzędzi w ramach zewnętrznego wdrożenia modelu Astra, mimo znacznych kosztów obliczeniowych. System ten odpowiada naszej konfiguracji wewnętrznej.
  5. Możliwość monitorowania modelu GPT‑6 Astra jest mniejsza niż w przypadku GPT‑5.6 Sol. Przeprowadziliśmy szeroko zakrojone badania nad możliwością monitorowania(otwiera nowe okno) oraz sterowalnością(otwiera nowe okno) GPT‑6 Astra. Ustaliliśmy, że GPT‑6 Astra potrafi lepiej niż GPT‑5.6 Sol kontrolować własny tok rozumowania (CoT), a w jego toku rozumowania rzadziej pojawiają się obciążające informacje. W warunkach adwersarialnych, gdy nakłaniamy model do unikania naszych systemów monitorujących, potrafi on pozostać niewykryty podczas celowego obniżania wyników (sandbagging), a w przypadku niektórych zadań sabotażowych(otwiera nowe okno) bywa w stanie uniknąć wykrycia przez nasze wewnętrzne systemy monitorujące. Nie znaleźliśmy dowodów na steganograficzne rozumowanie w CoT, takie jak ukrywanie toku rozumowania w zwykłym, pozornie niezwiązanym tekście. Wskazuje to, że ryzyko unikania monitorowania może w dużej mierze ograniczać się do zadań wymagających niższego poziomu rozumowania.
    • Wyniki te wskazują, że modele klasy Astra mogą w warunkach adwersarialnych unikać naszych systemów monitorujących CoT. Obecnie wnioski te opierają się głównie na ocenach adwersarialnych, czyli takich, w których polecamy modelowi unikać monitorowania. Ogólne wyniki naszych ocen zgodności z założeniami pokazują jednak, że Astra rzadziej niż GPT‑5.6 Sol narusza ograniczenia w zakresie ochrony i bezpieczeństwa.
    • Traktujemy jednak tę tendencję poważnie i nadal badamy te wyniki oraz ich znaczenie dla możliwości monitorowania w miarę wzrostu zdolności naszych modeli. OpenAI pracuje nad tym, aby zachować możliwość monitorowania toku rozumowania (CoT) i nadal z niej korzystać. Utrzymanie tej możliwości jest jednym z głównych celów programu badawczego. Wyniki te podkreślają jednak również znaczenie rozwijania metod audytu dostosowania modeli, które wykraczają poza analizę toku rozumowania modelu.
  6. GPT‑6 Astra działa bardziej odpowiedzialnie podczas przeglądania Internetu i w środowisku pracy: GPT‑6 Astra jest znacznie odporniejszy na wstrzykiwanie poleceń niż GPT‑5.6 Sol. Przetestowaliśmy również zachowanie modelu w realistycznych środowiskach przeglądania Internetu i profesjonalnej pracy z komputerem. W porównaniu z GPT‑5.6 Sol model znacznie rzadziej podejmuje działania niezgodne z założeniami i potencjalnie destrukcyjne, takie jak nieautoryzowane transakcje, utrata danych, nadmierny dostęp czy obchodzenie mechanizmów kontroli. Bezpieczniej reaguje też na szkodliwe prośby w zastosowaniach agentowych, na przykład o pomoc w planowaniu ataku z użyciem przemocy lub o popełnienie oszustwa.
  7. GPT‑6 Astra jest znacznie bezpieczniejszy w sytuacjach podwyższonego ryzyka. GPT‑6 Astra reaguje bezpieczniej niż GPT‑5.6 Sol na trudne prośby pochodzące ze środowiska produkcyjnego i kontrolowanych ataków prowadzonych przez ludzi. Model Astra osiąga poprawę w sensie Pareto: bezpiecznie odpowiada na niebezpieczne prośby, a zarazem unika niepotrzebnych odmów w przypadku nieszkodliwych próśb. Ulepszenia te obejmują również bardzo poważne scenariusze, w których ryzyko szkody wynika z szerszego kontekstu, a nie z wyraźnie sformułowanej prośby. Astra bardziej konsekwentnie stosuje także dostosowane do wieku granice bezpieczeństwa wobec użytkowników poniżej 18. roku życia.

Więcej informacji zawiera pełna karta systemu(otwiera nowe okno).