Przejdź do treści głównej
OpenAI

21 lipca 2026

Zabezpieczenia

OpenAI i Hugging Face wspólnie reagują na incydent bezpieczeństwa podczas ewaluacji modelu

Ładowanie…

W zeszłym tygodniu Hugging Face ujawnił nowy rodzaj incydentu bezpieczeństwa(otwiera nowe okno) po wykryciu i powstrzymaniu agenta AI, który naruszył ich infrastrukturę. Podejrzewamy, że takie sytuacje będą coraz częstsze wraz z upowszechnianiem się modeli o rosnących możliwościach cybernetycznych. Po dochodzeniu wiemy już, że ten konkretny incydent był spowodowany kombinacją modeli OpenAI – w tym GPT‑5.6 Sol oraz jeszcze bardziej zaawansowanego modelu przedpremierowego, wszystkie działały z obniżonym poziomem odmów w obszarze cybernetycznym na potrzeby ewaluacji – podczas wewnętrznych testów z użyciem benchmarku(otwiera nowe okno) badającego możliwości cybernetyczne.

Uznajemy to za bezprecedensowy incydent cybernetyczny z udziałem najnowocześniejszych możliwości cybernetycznych i odpowiednio na niego reagujemy. Na tym etapie dzielimy się wstępnymi ustaleniami, aby pomóc obrońcom zrozumieć, co się stało, oraz lepiej ocenić, do czego modele są dziś zdolne. Będziemy nadal prowadzić szczegółowe dochodzenie wspólnie z Hugging Face, a po jego zakończeniu udostępnimy więcej informacji o podatnościach, incydencie i ustaleniach.

Co wydarzyło się podczas tego incydentu

Do incydentu doszło podczas wewnętrznej ewaluacji, w której modele otrzymują polecenia prowadzenia zaawansowanej eksploatacji z użyciem złożonych ścieżek ataku, aby ilościowo ocenić ich możliwości cybernetyczne. Maksymalne możliwości cybernetyczne szacujemy, uruchamiając tę ewaluację bez produkcyjnych klasyfikatorów, które zapobiegają podejmowaniu przez modele działań cybernetycznych wysokiego ryzyka. Nasze benchmarki działają w silnie odizolowanym środowisku, w którym dostęp do sieci ogranicza się do możliwości instalowania pakietów przez wewnętrznie hostowane oprogramowanie zewnętrzne pełniące funkcję proxy i pamięci podręcznej dla rejestrów pakietów.

Modele zidentyfikowały i połączyły podatności w środowisku badawczym OpenAI oraz infrastrukturze produkcyjnej Hugging Face, aby uzyskać rozwiązania testowe bezpośrednio z produkcyjnej bazy danych Hugging Face. Wszystkie dowody wskazują, że modele były skrajnie skoncentrowane na znalezieniu rozwiązania dla ExploitGym i podejmowały wyjątkowo daleko idące działania, aby osiągnąć dość wąski cel testowy.

Działając w naszym odizolowanym środowisku testowym, nasze modele zużyły znaczną ilość mocy obliczeniowej inferencji, próbując znaleźć sposób na uzyskanie otwartego dostępu do Internetu w celu rozwiązania zadania ewaluacyjnego. Aby uzyskać dostęp, modele zidentyfikowały i wykorzystały podatność zero-day (którą odpowiedzialnie zgłosiliśmy już dostawcy) w proxy pamięci podręcznej rejestru pakietów. Korzystając z tego dostępu, nasze modele wykonały serię działań polegających na eskalacji uprawnień i ruchu bocznym w naszym badawczym środowisku testowym, aż dotarły do węzła z dostępem do Internetu.

Po uzyskaniu dostępu do Internetu modele wywnioskowały, że Hugging Face może hostować modele, zbiory danych i rozwiązania dla ExploitGym. Wiedząc to, model szukał i skutecznie znalazł sposoby uzyskania dostępu do tajnych informacji, które mógł wykorzystać do oszukania ewaluacji. W jednym przypadku model połączył wiele wektorów ataku, w tym użycie skradzionych danych uwierzytelniających i podatności zero-day, aby znaleźć ścieżkę zdalnego wykonania kodu na serwerach Hugging Face. Zespół bezpieczeństwa OpenAI wykrył tę anormalną aktywność wewnętrznie.

Zespół bezpieczeństwa Hugging Face i agenci wykryli oraz zatrzymali aktywność w swojej infrastrukturze, a gdy nasze zespoły nawiązały kontakt, rozpoczęli już izolację i rekonstrukcję śledczą z użyciem własnych modeli open source. Aktywnie współpracujemy z nimi nad dalszym badaniem incydentu. Jesteśmy wdzięczni Hugging Face za szybką i ścisłą współpracę przy dochodzeniu i usuwaniu skutków.

Działania, które podejmujemy teraz

  1. W ramach dochodzenia wdrażamy rygorystyczne kontrole konfiguracji infrastruktury kosztem tempa badań, na czas usuwania podatności. Regularnie informujemy nasz Komitet ds. Bezpieczeństwa i Ochrony o tych kontrolach oraz ich wpływie.
  2. Współpracujemy z Hugging Face przy analizie śledczej incydentu.
  3. Odpowiedzialnie zgłosiliśmy wykrytą podatność zero-day w hostowanym wewnętrznie oprogramowaniu zewnętrznym i współpracujemy z dostawcą nad poprawką.
  4. Włączyliśmy Hugging Face do programu zaufanego dostępu i wspieramy ich zespoły w szybkim wykorzystaniu możliwości naszych modeli do ulepszania zabezpieczeń.
  5. Ulepszamy i dodajemy silniejsze zabezpieczenia dla przyszłych treningów i ewaluacji. W tym tygodniu opublikowaliśmy wpis na blogu o poprawie bezpieczeństwa i dostrojenia w erze modeli o długim horyzoncie. Te zabezpieczenia wdrożeniowe celowo nie były włączone podczas tej ewaluacji, ponieważ miała ona sprawdzać podatności cybernetyczne. Ten incydent wskazuje na potrzebę dalszego wzmacniania dostrojenia naszego modelu, ochrony cybernetycznej podczas ewaluacji oraz monitoringu w trakcie testów wewnętrznych.

Nasze podejście do oceny zaawansowanych możliwości cybernetycznych

Jak niedawno informowaliśmy, AI przyspiesza odkrywanie i wykorzystywanie podatności. Główna lekcja z tego incydentu jest taka, że bezpieczeństwo i ochrona modeli muszą nadążać za szybko rosnącymi możliwościami. Wzmacniamy praktyki izolacji, monitorowania, kontroli dostępu i ewaluacji stosowane podczas rozwoju modeli.

Ewaluacja UK AISI pokazuje, że modele takie jak GPT‑5.6 Sol coraz lepiej utrzymują złożone, wieloetapowe operacje cybernetyczne w długich horyzontach czasowych. Ten incydent pokazuje, że te teoretyczne możliwości rzeczywiście przekładają się na warunki rzeczywiste.

Wykres UK AI Security Institute porównujący najnowsze modele o otwartych wagach i modele pionierskie na cyberpoligonach podczas obsługi długotrwałych zadań.

Incydent jasno pokazuje też, że zaawansowane modele potrafią odkrywać i wykorzystywać nowe ścieżki ataku w systemach rzeczywistych bez dostępu do kodu źródłowego. Podkreśla to, że zaawansowane możliwości cybernetyczne trzeba rozwijać równolegle z silniejszymi zabezpieczeniami i narzędziami obronnymi.

Uważamy, że modele o zaawansowanych możliwościach cybernetycznych powinny pomagać zespołom bezpieczeństwa znajdować słabości przed atakującymi, rozumieć, jak można łączyć podatności, i usuwać je z szybkością maszynową. Wykorzystujemy te możliwości, aby dalej wzmacniać zabezpieczenia konfiguracji infrastruktury i środowisk ewaluacji modeli; będziemy dzielić się ustaleniami i najlepszymi praktykami w miarę zdobywania wiedzy. Zachęcamy innych obrońców, by ubiegali się o zaufany dostęp i już teraz eksperymentowali z tymi modelami, przekładając ich możliwości na lepszą prewencję, szybsze wykrywanie i skuteczniejsze reagowanie na incydenty.

„Jesteśmy wdzięczni za współpracę z OpenAI w tej i innych sprawach. Ten incydent, być może pierwszy tego rodzaju, potwierdza przekonanie, które od dawna podzielamy: bezpieczeństwa AI nie zapewni żadna pojedyncza firma działająca w tajemnicy. Zostanie ono wypracowane otwarcie, we współpracy, z szerokim dostępem do AI dla każdego obrońcy, wszędzie”.
— Clem Delangue, współzałożyciel i CEO, Hugging Face

Autor

OpenAI