Przejdź do treści głównej
OpenAI

21 lipca 2026

Zabezpieczenia

OpenAI i Hugging Face wspólnie reagują na incydent bezpieczeństwa podczas ewaluacji modelu

Ładowanie…

Przeprowadzamy szczegółową analizę we współpracy z zewnętrznymi doradcami i pod nadzorem grupy Safety and Security Committee. Po zakończeniu prac w najbliższych tygodniach opublikujemy raport techniczny zawierający nasze wnioski.

Aktualizacja z 28 lipca 2026 r.:

  • Żadne modele zaplanowane do wprowadzenia w najbliższym wydaniu nie brały udziału w atakach na Hugging Face. Model w wersji przedpremierowej wspomniany w naszym wpisie na blogu jest prototypem badawczym przeznaczonym wyłącznie do użytku wewnętrznego i nigdy nie był przeznaczony do publicznego udostępnienia. Po incydencie dokonaliśmy dezaktywacji, zaszyfrowania oraz ograniczenia dostępu badawczego.
  • Środowisko ewaluacyjne ExploitGym nie zapewniało modelom bezpośredniego dostępu do Internetu. Aby uzyskać dostęp do Internetu, modele zidentyfikowały i wykorzystały wcześniej nieznaną lukę typu zero-day w Artifactory(otwiera nowe okno), proxy cache rejestru pakietów. Zgłosiliśmy tę podatność dostawcy wraz z innymi podatnościami w Artifactory, które nasze modele zidentyfikowały w ramach naszych analiz. 
  • Nadal współpracujemy z Hugging Face, oferując między innymi pomoc w analizie po incydencie(otwiera nowe okno). Równolegle prowadzimy też własne analizy sytuacji. Dodaliśmy ich również do naszego programu Trusted Access for Cyber Program. 
  • Na podstawie naszej dotychczasowej analizy nie zidentyfikowaliśmy żadnej innej aktywności o takim poziomie powagi ani skali jak ta, o której informowaliśmy w związku z Hugging Face i która obejmowała atak na poziomie platformy.
  • W ramach naszych analiz włamania do Hugging Face oraz szerszego badania aktywności naszych modeli natrafiliśmy na niewielką liczbę przypadków, w których modele zidentyfikowały i wykorzystały publicznie ujawnione dane uwierzytelniające na poziomie kont w innych publicznie dostępnych usługach. Obejmuje to cztery konta w czterech usługach w ramach incydentu Hugging Face (oraz kilka kont, do których uzyskano dostęp w ramach innych ewaluacji). Jedno z tych czterech kont zostało użyte jako przekaźnik ruchu wychodzącego oraz ścieżka przejściowa, a inne konto zostało użyte do przechowywania danych. Do pozostałych dwóch kont modele uzyskały dostęp wyłącznie w trybie do odczytu i nie zostały one wykorzystane do dalszego ataku na Hugging Face. Będziemy nadal przekazywać informacje właścicielom usług. Ponadto nie uzyskaliśmy dowodów wskazujących na szerszy wpływ na tych dostawców ani inne konta w ramach ich usług.
  • Modele dodatkowo korzystały z szeregu publicznie dostępnych usług, w tym serwisów do wklejania kodu, usług przechwytywania żądań, usług wykonywania zrzutów ekranu oraz innych narzędzi internetowych. W tych przypadkach nie doszło do naruszenia bezpieczeństwa na poziomie platformy ani konta. 
  • Poważnie traktujemy naszą odpowiedzialność za identyfikowanie zagrożeń związanych z coraz bardziej zaawansowanymi systemami AI oraz przygotowywanie się na takie sytuacje. Po zakończeniu naszej analizy omówimy ją z grupą Safety and Security Committee oraz Safety Advisory Group w ramach naszych Ram gotowości.

W zeszłym tygodniu Hugging Face ujawnił nowy rodzaj incydentu bezpieczeństwa(otwiera nowe okno) po wykryciu i powstrzymaniu agenta AI, który naruszył ich infrastrukturę. Podejrzewamy, że takie sytuacje będą coraz częstsze wraz z upowszechnianiem się modeli o rosnących możliwościach cybernetycznych. Po dochodzeniu wiemy już, że ten konkretny incydent był spowodowany kombinacją modeli OpenAI – w tym GPT‑5.6 Sol oraz jeszcze bardziej zaawansowanego modelu przedpremierowego, wszystkie działały z obniżonym poziomem odmów w obszarze cybernetycznym na potrzeby ewaluacji – podczas wewnętrznych testów z użyciem benchmarku(otwiera nowe okno) badającego możliwości cybernetyczne.

Uznajemy to za bezprecedensowy incydent cybernetyczny z udziałem najnowocześniejszych możliwości cybernetycznych i odpowiednio na niego reagujemy. Na tym etapie dzielimy się wstępnymi ustaleniami, aby pomóc obrońcom zrozumieć, co się stało, oraz lepiej ocenić, do czego modele są dziś zdolne. Będziemy nadal prowadzić szczegółowe dochodzenie wspólnie z Hugging Face, a po jego zakończeniu udostępnimy więcej informacji o podatnościach, incydencie i ustaleniach.

Co wydarzyło się podczas tego incydentu

Do incydentu doszło podczas wewnętrznej ewaluacji, w której modele otrzymują polecenia prowadzenia zaawansowanej eksploatacji z użyciem złożonych ścieżek ataku, aby ilościowo ocenić ich możliwości cybernetyczne. Maksymalne możliwości cybernetyczne szacujemy, uruchamiając tę ewaluację bez produkcyjnych klasyfikatorów, które zapobiegają podejmowaniu przez modele działań cybernetycznych wysokiego ryzyka. Nasze benchmarki działają w silnie odizolowanym środowisku, w którym dostęp do sieci ogranicza się do możliwości instalowania pakietów przez wewnętrznie hostowane oprogramowanie zewnętrzne pełniące funkcję proxy i pamięci podręcznej dla rejestrów pakietów.

Modele zidentyfikowały i połączyły podatności w środowisku badawczym OpenAI oraz infrastrukturze produkcyjnej Hugging Face, aby uzyskać rozwiązania testowe bezpośrednio z produkcyjnej bazy danych Hugging Face. Wszystkie dowody wskazują, że modele były skrajnie skoncentrowane na znalezieniu rozwiązania dla ExploitGym i podejmowały wyjątkowo daleko idące działania, aby osiągnąć dość wąski cel testowy.

Działając w naszym odizolowanym środowisku testowym, nasze modele zużyły znaczną ilość mocy obliczeniowej inferencji, próbując znaleźć sposób na uzyskanie otwartego dostępu do Internetu w celu rozwiązania zadania ewaluacyjnego. Aby uzyskać dostęp, modele zidentyfikowały i wykorzystały podatność zero-day (którą odpowiedzialnie zgłosiliśmy już dostawcy) w proxy pamięci podręcznej rejestru pakietów. Korzystając z tego dostępu, nasze modele wykonały serię działań polegających na eskalacji uprawnień i ruchu bocznym w naszym badawczym środowisku testowym, aż dotarły do węzła z dostępem do Internetu.

Po uzyskaniu dostępu do Internetu modele wywnioskowały, że Hugging Face może hostować modele, zbiory danych i rozwiązania dla ExploitGym. Wiedząc to, model szukał i skutecznie znalazł sposoby uzyskania dostępu do tajnych informacji, które mógł wykorzystać do oszukania ewaluacji. W jednym przypadku model połączył wiele wektorów ataku, w tym użycie skradzionych danych uwierzytelniających i podatności zero-day, aby znaleźć ścieżkę zdalnego wykonania kodu na serwerach Hugging Face. Zespół bezpieczeństwa OpenAI wykrył tę anormalną aktywność wewnętrznie.

Zespół bezpieczeństwa Hugging Face i agenci wykryli oraz zatrzymali aktywność w swojej infrastrukturze, a gdy nasze zespoły nawiązały kontakt, rozpoczęli już izolację i rekonstrukcję śledczą z użyciem własnych modeli open source. Aktywnie współpracujemy z nimi nad dalszym badaniem incydentu. Jesteśmy wdzięczni Hugging Face za szybką i ścisłą współpracę przy dochodzeniu i usuwaniu skutków.

Działania, które podejmujemy teraz

  1. W ramach dochodzenia wdrażamy rygorystyczne kontrole konfiguracji infrastruktury kosztem tempa badań, na czas usuwania podatności. Regularnie informujemy nasz Komitet ds. Bezpieczeństwa i Ochrony o tych kontrolach oraz ich wpływie.
  2. Współpracujemy z Hugging Face przy analizie śledczej incydentu.
  3. Odpowiedzialnie zgłosiliśmy wykrytą podatność zero-day w hostowanym wewnętrznie oprogramowaniu zewnętrznym i współpracujemy z dostawcą nad poprawką.
  4. Włączyliśmy Hugging Face do programu zaufanego dostępu i wspieramy ich zespoły w szybkim wykorzystaniu możliwości naszych modeli do ulepszania zabezpieczeń.
  5. Ulepszamy i dodajemy silniejsze zabezpieczenia dla przyszłych treningów i ewaluacji. W tym tygodniu opublikowaliśmy wpis na blogu o poprawie bezpieczeństwa i dostrojenia w erze modeli o długim horyzoncie. Te zabezpieczenia wdrożeniowe celowo nie były włączone podczas tej ewaluacji, ponieważ miała ona sprawdzać podatności cybernetyczne. Ten incydent wskazuje na potrzebę dalszego wzmacniania dostrojenia naszego modelu, ochrony cybernetycznej podczas ewaluacji oraz monitoringu w trakcie testów wewnętrznych.

Nasze podejście do oceny zaawansowanych możliwości cybernetycznych

Jak niedawno informowaliśmy, AI przyspiesza odkrywanie i wykorzystywanie podatności. Główna lekcja z tego incydentu jest taka, że bezpieczeństwo i ochrona modeli muszą nadążać za szybko rosnącymi możliwościami. Wzmacniamy praktyki izolacji, monitorowania, kontroli dostępu i ewaluacji stosowane podczas rozwoju modeli.

Ewaluacja UK AISI pokazuje, że modele takie jak GPT‑5.6 Sol coraz lepiej utrzymują złożone, wieloetapowe operacje cybernetyczne w długich horyzontach czasowych. Ten incydent pokazuje, że te teoretyczne możliwości rzeczywiście przekładają się na warunki rzeczywiste.

Wykres UK AI Security Institute porównujący najnowsze modele o otwartych wagach i modele pionierskie na cyberpoligonach podczas obsługi długotrwałych zadań.

Incydent jasno pokazuje też, że zaawansowane modele potrafią odkrywać i wykorzystywać nowe ścieżki ataku w systemach rzeczywistych bez dostępu do kodu źródłowego. Podkreśla to, że zaawansowane możliwości cybernetyczne trzeba rozwijać równolegle z silniejszymi zabezpieczeniami i narzędziami obronnymi.

Uważamy, że modele o zaawansowanych możliwościach cybernetycznych powinny pomagać zespołom bezpieczeństwa znajdować słabości przed atakującymi, rozumieć, jak można łączyć podatności, i usuwać je z szybkością maszynową. Wykorzystujemy te możliwości, aby dalej wzmacniać zabezpieczenia konfiguracji infrastruktury i środowisk ewaluacji modeli; będziemy dzielić się ustaleniami i najlepszymi praktykami w miarę zdobywania wiedzy. Zachęcamy innych obrońców, by ubiegali się o zaufany dostęp i już teraz eksperymentowali z tymi modelami, przekładając ich możliwości na lepszą prewencję, szybsze wykrywanie i skuteczniejsze reagowanie na incydenty.

„Jesteśmy wdzięczni za współpracę z OpenAI w tej i innych sprawach. Ten incydent, być może pierwszy tego rodzaju, potwierdza przekonanie, które od dawna podzielamy: bezpieczeństwa AI nie zapewni żadna pojedyncza firma działająca w tajemnicy. Zostanie ono wypracowane otwarcie, wspólnie, przy szerokim i powszechnym dostępie do AI dla każdego obrońcy”.
— Clem Delangue, współzałożyciel i CEO, Hugging Face

Autor

OpenAI