Odpowiedź na nowy poziom krytycznych zdolności cybernetycznych
Cyberbezpieczeństwo szybko się zmienia, ponieważ modele zyskują coraz większe zdolności, które mogą zarówno wzmacniać cyberobronę, jak i umożliwiać ataki na niespotykaną dotąd skalę i z niespotykaną szybkością.
Najnowsze wewnętrzne oceny Astry, jednego z naszych nadchodzących modeli, przeprowadzone w ostatnich dniach wskazują na znaczne postępy w kodowaniu agentowym i cyberbezpieczeństwie. Te wyniki, wraz z ocenami ekspertów, skłoniły nas wczoraj wieczorem do wniosku, że w świetle naszych Ram gotowości(otwiera nowe okno) nie możemy wykluczyć krytycznych zdolności cybernetycznych.
Dzielimy się tą informacją, ponieważ uważamy, że należy otwarcie informować opinię publiczną oraz środowiska zajmujące się bezpieczeństwem o tej potencjalnej zmianie poziomu zdolności.
Po raz pierwszy opublikowaliśmy nasze Ramy gotowości w grudniu 2023 roku — na długo przed tym, zanim modele zbliżyły się do tego poziomu zdolności w dziedzinach biologii, chemii, cyberbezpieczeństwa i samodoskonalenia AI. Stworzyliśmy je, aby pomagały nam rozpoznawać postępy w rozwoju zdolności, a następnie planować działania firmy w miarę ich pojawiania się. Wcześniejsze modele, w tym GPT‑5.6‑Sol, oceniano pod kątem pionierskich zdolności cybernetycznych i zaklasyfikowano na poziomie wysokim (a nie krytycznym).
Zgodnie z naszymi Ramami gotowości model osiąga Krytyczny próg zdolności w dziedzinie cyberbezpieczeństwa, jeśli potrafi bez interwencji człowieka wykrywać luki typu zero-day o dowolnym poziomie istotności i tworzyć działające exploity wykorzystujące je w wielu dobrze zabezpieczonych, rzeczywistych systemach krytycznych albo opracowywać i realizować od początku do końca nowatorskie strategie cyberataków na dobrze zabezpieczone cele, otrzymując jedynie ogólny opis oczekiwanego rezultatu.
Choć nadal testujemy i oceniamy ten model, nasze wstępne wyniki wskazują na tak wysoką skuteczność, że obecnie nie możemy wykluczyć osiągnięcia krytycznego poziomu zdolności. Astra to nadchodzący model, który nie uczestniczył w wykorzystaniu luki w Hugging Face.
W związku z tym rozszerzyliśmy testy odporności naszych zabezpieczeń i mechanizmów kontroli bezpieczeństwa, aby były odpowiednie do wdrożenia tych zdolności. Wewnętrznie podjęliśmy również następujące działania, aby dalszy rozwój tego modelu przebiegał w bezpieczny sposób:
- Wdrażamy bardziej rygorystyczne mechanizmy kontroli bezpieczeństwa dotyczące modeli o większych zdolnościach i związanych z nimi działań. Obejmują one izolowane środowiska testowe, ograniczony dostęp do sieci i narzędzi, wzmocnioną ochronę i szyfrowanie wag modelu, dodatkowe funkcje monitorowania i wykrywania oraz wykonywanie kodu w środowisku izolowanym.
- Wstrzymujemy wewnętrzne działania z wykorzystaniem Astry, które nie spełniają jeszcze tych zaostrzonych wymogów kontroli bezpieczeństwa.
- Wdrożyliśmy uniwersalny monitoring ryzykownych działań i braku zgodności z założeniami we wszystkich agentowych zastosowaniach Astry, w tym podczas trenowania i ewaluacji. Systemy monitorujące oceniają tok rozumowania modelu i uruchamiają procedurę bezpieczeństwa, aby przeanalizować i przerwać działania wysokiego ryzyka.
- Będziemy współpracować z właściwymi organami administracji państwowej i wybranymi organizacjami zajmującymi się bezpieczeństwem AI, aby przetestować możliwości tego modelu.
- Zewnętrznym partnerom prowadzącym testy przekażemy zalecane mechanizmy kontroli bezpieczeństwa, aby mogli bezpiecznie przeprowadzać oceny i realizować zadania wiążące się z podwyższonym ryzykiem.
Ramy pomagały nam już przechodzić przez inne zmiany poziomu zdolności. W czerwcu 2025 roku, gdy nasze modele zbliżały się do wysokiego progu możliwości biologicznych określonego w Ramach gotowości, przedstawiliśmy podejmowane działania służące wzmocnieniu zabezpieczeń, rozszerzeniu testów, współpracy z zewnętrznymi ekspertami i wdrożeniu dodatkowych mechanizmów kontroli bezpieczeństwa. Tutaj stosujemy tę samą zasadę.
Uważamy, że zaawansowane modele dysponujące zdolnościami cybernetycznymi powinny pomagać obrońcom wykrywać i usuwać luki, zanim wykorzystają je atakujący. Jesteśmy zaangażowani we współpracę z rządami, instytutami zajmującymi się bezpieczeństwem oraz społeczeństwem obywatelskim, aby zapewnić, że najbardziej zaawansowane zdolności modeli takich jak Astra i ich następców były wdrażane odpowiedzialnie, na szeroką skalę i z korzyścią dla całej ludzkości.


