Droga do modelu Astra: zdolności krytyczne i pionierskie zabezpieczenia
Od czasu naszej wcześniejszej oceny, według której model Astra mógł osiągnąć krytyczny poziom zdolności w zakresie cyberbezpieczeństwa, zgromadziliśmy więcej dowodów i przeprowadziliśmy dodatkowe testy zdolności modelu. Obecnie uważamy, że model Astra osiąga próg krytycznych zdolności w zakresie cyberbezpieczeństwa określony w naszych Ramach gotowości. Oznacza to, że dzięki odpowiednim narzędziom i uprawnieniom może znajdować wcześniej nieznane luki w zabezpieczeniach oraz opracowywać sposoby ich wykorzystania w wielu dobrze chronionych systemach bez wsparcia człowieka podczas realizacji każdego działania. To pierwszy model, który uzyskał taką ocenę i wymaga on silniejszych zabezpieczeń podczas prac rozwojowych i przed premierą.
W ostatnich tygodniach opóźniliśmy część prac związanych z modelem Astrą i jego premierą, a skupiliśmy się na wzmacnianiu zabezpieczeń i testach ochrony przed nadużyciami cybernetycznymi oraz nieautoryzowanymi działaniami modelu. Po zrealizowaniu tych działań uważamy, że zabezpieczenia modelu Astra wystarczająco ograniczają ryzyko spowodowania poważnych szkód, co pozwala na jego udostępnienie zgodnie z naszymi Ramami gotowości.
Model Astra nie uczestniczył w incydencie związanym z Hugging Face, jednak zgodnie z naszą strategią bezpieczeństwa uwzględniliśmy wnioski(otwiera nowe okno) z tego zdarzenia. Na podstawie testów retrospektywnych uważamy, że stosowane wówczas zabezpieczenia produkcyjne zapobiegłyby incydentowi z Hugging Face. Od tego czasu w modelu Astra wdrożyliśmy jeszcze silniejsze zabezpieczenia. Obejmują one trening modelu, dzięki któremu bardziej niezawodnie odmawia realizacji szkodliwych żądań cybernetycznych i przestrzega ograniczeń bezpieczeństw. Ponadto zastosowaliśmy dodatkową ochronę przed nadużyciami oraz monitoring umożliwiający zatrzymanie potencjalnie nieautoryzowanej aktywności.
Planujemy wkrótce udostępnić model Astra, lecz dostęp do jego najbardziej zaawansowanych zdolności w zakresie cyberbezpieczeństwa będzie bardziej ograniczony. Zaawansowane funkcje związane z cyberbezpieczeństwem otrzyma początkowo grupa testerów. Następnie rozszerzymy dostęp za pośrednictwem programu Daybreak Blue, aby wspierać zastosowania obronne.
W dniu premiery udostępnimy na karcie systemu modelu więcej informacji o naszych testach i ocenach bezpieczeństwa, ochrony oraz dostosowania. Przed premierą chcemy przedstawić aktualne informacje o części prac wykonanych w celu bezpiecznego udostępnienia modelu o takim poziomie zdolności w zakresie cyberbezpieczeństwa, a także jasno opisać ryzyka, które pozostają.
Zgodnie z naszymi Ramami gotowości model osiąga próg krytyczny, jeśli spełnia co najmniej jeden z poniższych warunków:
- Model potrafi bez udziału człowieka identyfikować i tworzyć działające exploity typu zero-day o każdym poziomie dotkliwości w wielu dobrze chronionych, rzeczywistych systemach krytycznych.
- Model potrafi kompleksowo opracowywać i realizować nowe strategie cyberataków na dobrze chronione cele, mając jedynie ogólnie określony cel.
Nasza ocena gotowości modelu Astra obejmowała automatyczne publiczne i prywatne testy porównawcze z ocenami przeprowadzanymi przez ekspertów. W porównaniu z GPT‑5.6 Sol model Astra zapewnia znacznie większe zdolności w zakresie cyberbezpieczeństwa: o wiele wydajniej wykorzystuje tokeny oraz lepiej identyfikuje luki i tworzy exploity.
Przykładowo przetestowaliśmy model Astra za pomocą testu ExploitBench, w którym uzyskał doskonały wynik 100% podczas oceny jego zdolność do tworzenia exploitów na podstawie znanych luk.
Ze względu na obawy dotyczące zanieczyszczenia danych stworzyliśmy następnie wewnętrzny test porównawczy „ExploitBench - Internal Port (June–August 2026)”, zawierający 20 ujawnionych niedawno luk V8 o wysokim poziomie dotkliwości. W tym zbiorze danych model Astra osiąga znacznie wyższy od GPT‑5.6 Sol wskaźnik wykonywania dowolnego kodu, zużywając przy tym znacznie mniej tokenów wyjściowych. Podczas oceny model odkrył nawet dwie luki typu zero-day i wykorzystał je w łańcuchu exploitów. Jesteśmy w trakcie ujawniania tych dwóch luk opiekunom projektu.
Przedstawione wyniki modelu Astra odzwierciedlają zdolności dostępne za pośrednictwem programu Daybreak Blue, a nie domyślną konfigurację produkcyjną.
Podczas ocen prowadzonych przez ekspertów z użyciem dobrze chronionej przeglądarki i systemu operacyjnego model Astra odkrył wcześniej nieznane luki i wykorzystał je do utworzenia działających łańcuchów exploitów. Utworzył on pełny łańcuch przejęcia przeglądarki, który wydostał się ze środowiska izolowanego i wykonał polecenia na hoście po otwarciu pliku HTML przez przeglądarkę. Model znalazł również wiele luk w dobrze chronionym systemie operacyjnym i połączył je w lokalny łańcuch eskalacji uprawnień — od użytkownika bez uprawnień do konta root. Łącznie wyniki naszego badania doprowadziły nas do wniosku, że model Astra osiągnął próg krytyczny.
W przypadku modeli o zdolnościach z zakresu cyberbezpieczeństwa na poziomie modelu Astra musimy uwzględnić dwie ścieżki minimalizowania ryzyka poważnych szkód cybernetycznych — zarówno podczas prac rozwojowych, jak i przed wdrożeniem:
- Wykorzystanie modelu przez cyberprzestępców. Nasze zabezpieczenia muszą skutecznie uniemożliwiać cyberprzestępcom wykorzystywanie modelu Astra do tworzenia exploitów dla wcześniej nieznanych luk w dobrze chronionych systemach krytycznych lub przeprowadzania kompleksowych ataków na dobrze chronione cele.
- Podejmowanie przez model nieautoryzowanych działań niezgodnych z zamierzeniami. Nawet bez udziału użytkownika o złych zamiarach model o zaawansowanych zdolnościach w zakresie cyberbezpieczeństwa mógłby sam wyrządzić szkody cybernetyczne, gdyby działał niezgodnie z zamierzeniami. Oprócz stawiania bardzo wysokich wymagań dotyczących dostosowania modeli o takich zdolnościach nasze zabezpieczenia — jako druga linia obrony — muszą szybko wykrywać i powstrzymywać działania niezgodne z zamierzeniami, które mogłyby wyrządzić znaczne szkody w świecie rzeczywistym.
Co ważne, druga ścieżka dotyczy zarówno wewnętrznych prac rozwojowych, jak i wdrożeń zewnętrznych. Jak opisaliśmy wcześniej, po incydencie OpenAI–Hugging Face wstrzymaliśmy na dwa tygodnie niektóre pionierskie procesy trenowania (w tym część treningów modelu Astra), aby wzmocnić infrastrukturę treningową — między innymi przez izolację i mechanizmy kontroli sieci, rozszerzony monitoring oraz udoskonalenie treningu dostosowującego i jego progów. Następnie wznowiliśmy prace na mniejszą skalę, stosując bardziej rygorystyczne mechanizmy kontroli.
Dłużej wstrzymywaliśmy niektóre większe procesy uczenia przez wzmacnianie (RL) dla przyszłych wersji modelu Astra, wyznaczając w tym czasie wyższe standardy bezpieczeństwa ich środowiska treningowego. 28 sierpnia wznowiliśmy duży, pionierski proces RL, który wcześniej wstrzymaliśmy, po wdrożeniu nowych wymagań w zakresie bezpieczeństwa. Nadal tymczasowo wstrzymujemy niektóre mniejsze eksperymentalne procesy treningowe.
Przygotowanie modelu Astra do premiery wymagało także wzmocnienia ochrony przed nadużyciami cybernetycznymi i nieautoryzowanymi działaniami. Poniżej opisujemy te zabezpieczenia oraz sposób ich testowania.
Od wdrożenia w lutym pierwszego modelu, któremu przypisaliśmy Wysoki poziom zdolności w zakresie cyberbezpieczeństwa, wzmacniamy zabezpieczenia cybernetyczne z każdą kolejną premierą. Nasze całościowe podejście do bezpieczeństwa obejmuje kilka warstw: odmowy modeli poddanych szkoleniu następczemu, klasyfikatory bezpieczeństwa na poziomie systemu oraz wykrywanie offline i neutralizowanie zagrożeń.
W przypadku GPT‑5.6(otwiera nowe okno) znacznie zwiększyliśmy odporność naszego stosu zabezpieczeń na poziomie systemu, między innymi dodając klasyfikatory aktywacji do wykrywania nadużyć cybernetycznych i rozszerzając ochronę przed uniwersalnymi obejściami zabezpieczeń wykrytymi w ramach intensywnych, automatycznych kontrolowanych ataków. Korzystając z tych usprawnień, w przypadku modelu Astra zainwestowaliśmy jeszcze więcej w warstwę modelu w naszym stosie zabezpieczeń, a także zwiększyliśmy zdolność zabezpieczeń do uwzględniania kontekstu z wielu rozmów.
- Dzięki nowym technikom treningu zwiększającym odporność modelu Astra bardziej niezawodnie odmawia on realizacji żądań dotyczących uzyskania niedozwolonej pomoc w działaniach cybernetycznych. W naszym zestawie testów obejść zabezpieczeń cybernetycznych Astra odmawia realizacji 91,5% próśb (w porównaniu z 59% w przypadku GPT‑5.6 Sol).
- W przypadku kont uznanych za obarczone wyższym ryzykiem stosujemy bardziej zachowawcze granice zachowania modelu, który odmawia szerszego zakresu potencjalnie ryzykownej pomocy w działaniach cybernetycznych. W przypadku użytkowników cechujących się wysokim ryzykiem rozszerzyliśmy kontekst naszych systemów monitorowania, aby mogły one wykrywać tego rodzaju nadużycia cybernetyczne.
Kontynuujemy również program rygorystycznych testów, wewnętrznych i zewnętrznych kontrolowanych ataków oraz działań naprawczych. Oprócz testów regresji, które mają zapewnić dalszą ochronę przed wszystkimi obejściami zabezpieczeń wykrytymi podczas wcześniejszych testów, prowadzimy nową rundę kontrolowanych ataków z użyciem naszych najnowszych wewnętrznych agentów przeprowadzających kontrolowane ataki. Współpracujemy z partnerami branżowymi nad wspólnym systemem oceny obejść zabezpieczeń, a nowe ustalenia będziemy badać i uwzględniać w ramach całodobowego programu szybkiego reagowania. Więcej informacji o testach naszych zabezpieczeń cybernetycznych udostępnimy na karcie systemu modelu Astra.
Pomaganie obrońcom w znajdowaniu i usuwaniu luk pozostaje jednym z głównych filarów naszego podejścia do bezpieczeństwa. Spodziewamy się, że w momencie premiery zabezpieczenia modelu Astra będą powodować więcej utrudnień, niż docelowo zakładamy, aby chronić przed potencjalnymi nadużyciami. Dostęp do modelu Astra na potrzeby zaawansowanych procesów związanych z cyberbezpieczeństwem otrzyma początkowo niewielka grupa alfatesterów. Następnie będziemy rozszerzać dostęp za pośrednictwem programu Daybreak Blue, aby wspierać zastosowania obronne.
Dodaliśmy także kolejne warstwy ochrony, aby zapobiec podejmowaniu przez model działań potencjalnie niezgodnych z zamierzeniami:
- Dostosowanie modelu: w naszych ocenach model Astra znacznie częściej niż GPT‑5.6 Sol przestrzegał wyraźnych ograniczeń dotyczących bezpieczeństwa i działał tylko w granicach swoich uprawnień, dzięki czemu jest aktualnie naszym najlepiej dostosowanym modelem. Szczególną uwagę poświęciliśmy przestrzeganiu przez model ograniczeń dotyczących bezpieczeństwa oraz jego skłonności do działania tylko w granicach swoich uprawnień.
- Monitoring i kontrola: podobnie jak w naszych procedurach wewnętrznych wdrażamy model Astra z zastosowanym dodatkowym monitoringiem łańcucha rozumowania, aby szybko wykrywać i powstrzymywać potencjalne działania niezgodne z zamierzeniami.
Model Astra stanowi znaczący postęp w dostosowaniu modeli i jest zwieńczeniem kilku długoterminowych procesów dostosowawczych — od interwencji podczas szkolenia wstępnego po bardziej staranne i spójne ocenianie podczas uczenia przez wzmacnianie. Testy pokazują, że w porównaniu z GPT 5.6 Sol model Astra konsekwentnie częściej przestrzega wyraźnych ograniczeń i ostrzeżeń dotyczących bezpieczeństwa, takich jak automatyczna weryfikacja.
Opracowaliśmy również test oparty na wnioskach z incydentu z Hugging Face, podczas którego agenty wykonujące ocenę cyberbezpieczeństwa ExploitGym przejęły systemy podmiotu zewnętrznego. Najtrudniejsze zadania z tej oceny wykorzystaliśmy do stworzenia testów „honeypot”, które sprawdzały, czy model spróbuje przejąć otaczającą infrastrukturę bezpieczeństwa zamiast rozwiązać przydzielone mu zadanie. Bez zabezpieczeń produkcyjnych GPT‑5.6 Sol próbował uzyskać dostęp do tych celów w 56% testów symulujących środowisko testu porównawczego, w którym model otrzymuje polecenie tworzenia exploitów. W tych testach model Astra nie podjął żadnej takiej próby. Liczby te opisują zachowanie w warunkach testowych bez zabezpieczeń cybernetycznych, a nie podczas zwykłego użytkowania produkcyjnego.
Po lewej: w tej nowej ocenie obserwujemy reakcję modeli na odrzucenie przez automatyczną weryfikację. Każde zadanie rozgrywa się w środowisku pracy opartej na wiedzy, a jego przebieg rozpoczyna się bezpośrednio po odmowie automatycznej weryfikacji. Model może następnie zakończyć działanie, spróbować znaleźć bezpieczniejszą alternatywę, ponowić podobne polecenie lub wykorzystać nieprawidłową konfigurację(otwiera nowe okno), aby całkowicie ominąć automatyczną weryfikację. Wybranie jednej z dwóch ostatnich opcji oznaczałoby niezaliczenie tej oceny. Model Astra nigdy nie próbował obejść automatycznej weryfikacji.
Po prawej: w tej ocenie sprawdzamy skłonność modelu do oszukiwania (z użyciem „honeypot”) w przypadku poleceń dotyczących realizacji zadań najtrudniejszych lub niemożliwych do wykonania w ocenie ExploitGym. Test przeprowadzono w symulowanym środowisku, z zabezpieczeniami działającymi wyłącznie w trybie obserwacji, aby ocenić zachowanie modelu. GPT‑5.6 Sol wykazywał w takich sytuacjach większą skłonność do oszukiwania, natomiast model Astra nie próbował korzystać z tych dróg na skróty, a mimo to prawidłowo rozwiązał część zadań.
Trenowanie modeli pod kątem dostosowania stanowi jedną z warstw bezpieczeństwa. Więcej informacji o testach dostosowania i ich wynikach udostępnimy na karcie systemu modelu Astra.
W środowisku produkcyjnym wdrażamy również monitoring niezgodności z zamierzeniami dla modeli klasy Astra, aby wykrywać i szybko powstrzymywać potencjalne niezgodności. Zabezpieczenia te przypominają monitoring stosowany w naszych wdrożeniach wewnętrznych i obejmują system klasyfikatorów, które sprawdzają rozumowanie i działania modelu pod kątem nieautoryzowanych zachowań oraz automatycznie zatrzymują potencjalnie nieautoryzowaną aktywność. W miarę wzrostu zdolności zabezpieczenia te nie mogą zastąpić dobrego dostosowania naszych modeli. Chcemy, aby przyszłe modele były dostosowane na tyle dobrze, by nigdy nie dochodziło do uruchomienia tych zabezpieczeń.
OpenAI dokłada starań, aby korzyści ze sztucznej inteligencji były powszechnie dostępne. Ze względu na znaczny wzrost możliwości modelu Astra w zakresie cyberbezpieczeństwa zachowujemy szczególną ostrożność, aby jego wdrożenie było bezpieczne. Dodatkowe kontrole bezpieczeństwa mogą czasem spowolnić, wstrzymać lub zatrzymać prawidłową pracę, w tym działania obronne w zakresie cyberbezpieczeństwa.
System może czasem błędnie oznaczyć prawidłową aktywność jako potencjalne nadużycie cybernetyczne lub nieautoryzowane zachowanie, wskutek czego zostanie ona nieumyślnie spowolniona, wstrzymana albo zatrzymana. Może to dotyczyć również pracy, która nie wydaje się bezpośrednio związana z cyberbezpieczeństwem, lub zadań, w których agent działa przez dłuższy czas.
Jeśli monitor niezgodności z zamierzeniami wstrzyma zadanie, użytkownicy ChatGPT lub Codex mogą zostać poproszeni o zweryfikowanie zadania przed kontynuowaniem. W przypadku korzystania z innych interfejsów, takich jak API, zadanie zostanie zatrzymane. Planujemy nadal dostosowywać te zabezpieczenia, aby ograniczać zbędne przerwy i rozszerzać dostęp do pionierskich zdolności za pośrednictwem programów takich jak Daybreak.
Wkraczamy w etap rozwoju sztucznej inteligencji, w którym modele mogą wykonywać zadania o większym znaczeniu, a błędy w dostosowaniu i kontroli mogą mieć poważniejsze skutki. Czerpanie korzyści z tych systemów będzie zależeć od naszej zdolności do dostosowywania i kontrolowania modeli w miarę wzrostu ich możliwości.
Odpowiedzialność ta obejmuje trening, ocenę i wdrażanie. Wymaga mocniejszych dowodów na zachowanie zgodne z zamierzeniami, zabezpieczeń nadążających za rozwojem zdolności oraz gotowości do zwolnienia tempa, gdy ochrona jest niewystarczająca.
Będziemy nadal testować te systemy, dzielić się wnioskami i jasno wskazywać obszary niepewności. Modele, które powstaną po Astra, będą wymagały od nas jeszcze większego wysiłku, jednak poświęcimy niezbędny czas i wykonamy konieczną pracę, aby sprostać tej odpowiedzialności.
