Przejdź do treści głównej
OpenAI

29 października 2025

ProduktWersja

Przedstawiamy gpt-oss-safeguard

Nowe otwarte modele rozumujące w zakresie bezpieczeństwa (120b i 20b) obsługujące niestandardowe zasady bezpieczeństwa.

Ładowanie…

Dziś udostępniamy wersję zapoznawczą gpt-oss-safeguard – naszych modeli rozumujących z otwartymi wagami do zadań z zakresu klasyfikacji bezpieczeństwa, które są dostępne w dwóch rozmiarach: gpt-oss-safeguard-120b i gpt-oss-safeguard-20b. Modele te stanowią dostrojone wersje naszych modeli otwartych gpt-oss i są dostępne na tej samej liberalnej licencji Apache 2.0, co pozwala każdemu swobodnie ich używać, modyfikować je i wdrażać. Oba modele można pobrać już dziś z Hugging Face(otwiera nowe okno).

Modele gpt-oss-safeguard korzystają z rozumowania, aby bezpośrednio interpretować zasady dostarczane przez programistę w czasie wnioskowania, klasyfikując wiadomości użytkownika, odpowiedzi oraz pełne czaty zgodnie z wymogami programisty. Programista zawsze decyduje, których zasad użyć, dlatego odpowiedzi są bardziej odpowiednie i dopasowane do danego zastosowania. Model wykorzystuje łańcuch rozumowania, który programista może sprawdzić, aby zrozumieć sposób podejmowania decyzji przez model. Dodatkowo zasady są dostarczane podczas wnioskowania, a nie wprowadzane do modelu podczas trenowania, dlatego programiści mogą z łatwością iteracyjnie weryfikować zasady, aby zwiększyć wydajność. Takie podejście, które początkowo opracowano pod kątem użytku wewnętrznego, jest zdecydowanie bardziej uniwersalne niż tradycyjna metoda trenowania klasyfikatora w celu pośredniego wyznaczania granicy decyzyjnej z dużej liczby oznaczonych przykładów.

Model gpt-oss-safeguard umożliwia programistom wyznaczenie linii zasad, które najlepiej pasują do ich zastosowań. Przykładowo: forum dyskusyjne na temat gier wideo może potrzebować zasad klasyfikacji postów omawiających oszustwa w grze, a strona z recenzjami produktów może wymagać własnych zasad do sprawdzania recenzji, które wydają się być fałszywe.

Model pobiera jednocześnie dwa rodzaje danych wejściowych – zasady i treść do klasyfikacji pod kątem tych zasad – a następnie podaje konkluzję na temat kategorii, do której należy treść, a także przedstawia swoje rozumowanie. Programiści mogą zdecydować, w jaki sposób, jeśli w ogóle, chcą wykorzystać te konkluzje we własnych zabezpieczeniach. Zauważyliśmy, że to podejście oparte na rozumowaniu sprawdza się szczególnie dobrze w następujących sytuacjach:

  • Pojawia się lub zmienia potencjalne zagrożenie, a zasady należy szybko dostosować.
  • Obszar jest bardzo zniuansowany i trudny do obsłużenia dla mniejszych klasyfikatorów.
  • Programiści nie mają wystarczającej liczby próbek, aby wytrenować wysokiej jakości klasyfikator dla każdego ryzyka na swojej platformie.
  • Opóźnienia są mniej ważne niż tworzenie wysokiej jakości przejrzystych etykiet.

Udostępniamy tę wersję zapoznawczą gpt-oss-safeguard, aby uzyskać opinie od społeczności zajmującej się badaniami i bezpieczeństwem oraz dalej poprawiać wydajność modelu. Przez wiele miesięcy pracowaliśmy nad tym modelem z otwartymi wagami z ROOST(otwiera nowe okno), aby zidentyfikować krytyczne potrzeby programistów, przetestować model oraz stworzyć dokumentację dla programistów. W ramach tego uruchomienia ROOST utworzy społeczność modelu(otwiera nowe okno), również uruchamianą już dziś, aby badać otwarte modele AI w celu ochrony przestrzeni online. Równocześnie z tą wersją publikujemy krótki raport techniczny, który zawiera szczegóły dotyczące wydajności w zakresie bezpieczeństwa tej wersji zapoznawczej modelu.

Bezpieczeństwo na poziomie systemu: rola klasyfikatorów bezpieczeństwa

W kwestiach bezpieczeństwa wierzymy w obronę wielowarstwową. Trenujemy nasze modele pod kątem bezpiecznego odpowiadania oraz wdrażamy dodatkowe warstwy ochrony, które wykrywają i reagują na potencjalnie niebezpieczne dane wejściowe i wyjściowe w ramach naszych zasad. Klasyfikatory bezpieczeństwa, które odróżniają treści bezpieczne od niebezpiecznych w konkretnym obszarze zagrożenia, od dawna stanowią podstawową warstwę ochrony naszych i innych dużych modeli językowych.

Tradycyjne klasyfikatory bezpieczeństwa, takie jak te dostępne za pośrednictwem naszego Moderation API(otwiera nowe okno), są tworzone poprzez ręczne opracowywanie tysięcy przykładów bezpiecznych i niebezpiecznych treści zgodnie z wcześniej zdefiniowanymi zasadami bezpieczeństwa. Na podstawie tych danych treningowych klasyfikator uczy się rozróżniać bezpieczne i niebezpieczne wyniki. W tym tradycyjnym podejściu klasyfikator nigdy nie widzi zasad bezpieczeństwa. Zamiast tego próbuje wywnioskować podstawowe zasady, które zostały użyte do oznaczenia przykładów, poprzez wyszukiwanie podobieństw w treściach oznaczonych jako niebezpieczne, oraz różnic pomiędzy bezpieczną i niebezpieczną treścią.

Tradycyjne klasyfikatory mogą charakteryzować się wysoką wydajnością przy niskich opóźnieniach i kosztach operacyjnych. Jednak gromadzenie odpowiedniej liczby przykładów szkoleniowych może być czasochłonne i kosztowne, a aktualizowanie lub zmiana zasad wymaga ponownego wytrenowania klasyfikatora.

Model gpt-oss-safeguard wyróżnia się możliwościami rozumowania, które pozwalają programistom zastosować dowolne zasady, np. samodzielnie opracowane lub pobrane z innych źródeł, a rozumowanie pomaga modelom uogólniać nowe zasady. Poza zasadami bezpieczeństwa modelu gpt-oss-safeguard można używać do oznaczania treści na inne sposoby dopasowane do określonych produktów i platform.

Schemat przepływu zatytułowany „Rozumowanie oparte na zasadach – gpt-oss-safeguard.” Zasady zapewniane przez programistę oraz treści od użytkownika trafiają do GPT-OSS-Safeguard. Model generuje łańcuch rozumowania, a następnie podejmuje decyzję dotyczącą zasad, a pętla oznaczona jako „iteracja zasad” pozwala cofnąć się w celu udoskonalenia zasad. Legenda wskazuje dane wejściowe programisty, dane wejściowe użytkownika oraz dane wyjściowe modelu.

Wewnętrzne wykorzystanie rozumowania w zakresie bezpieczeństwa

Nasze podstawowe modele rozumujące uczą się teraz bezpośrednio naszych zasad bezpieczeństwa i wykorzystują swoje zdolności rozumowania do wnioskowania w kwestiach określania aspektów bezpiecznych i niebezpiecznych. Takie podejście nazywane dostosowaniem opartym na rozumowaniu znacząco poprawia wcześniejsze metody szkolenia w zakresie bezpieczeństwa i sprawia, że nasze modele rozumujące są bezpieczniejsze pod wieloma względami niż ich nierozumujący poprzednicy, nawet gdy ich możliwości rosną. Jednak rozumowanie jest przydatne nie tylko do trenowania samych modeli. Tworzy ono również nowe możliwości obrony wielowarstwowej. Podejścia oparte na rozumowaniu są bardziej uniwersalne i mniej ograniczone przez szczegóły wcześniejszego szkolenia, co czasami z nawiązką uzasadnia dodatkowy koszt obliczeniowy i opóźnienia, jakie mogą się z tym wiązać.

Model gpt-oss-safeguard to otwartowagowa implementacja podejścia, które opracowaliśmy wewnętrznie w narzędziu Safety Reasoner. Zaczęliśmy od dostosowania ze wzmocnieniem w zadaniach związanych z oznaczaniem zasad, nagradzając model za odwzorowywanie poprawnych ocen ekspertów. Dzięki temu model nauczył się rozumować, jak zasada prowadzi do oceny. Obecnie Safety Reasoner pozwala nam dynamicznie aktualizować nasze zasady bezpieczeństwa w środowisku produkcyjnym w czasie krótszym niż zajęłoby ponowne wytrenowanie klasyfikatora. Dzięki temu Safety Reasoner staje się kluczowym narzędziem do iteracyjnego wdrażania: gdy wdrażamy nowe modele w środowisku produkcyjnym, często zaczynamy od bardziej surowych zasad i używamy względnie dużej ilości mocy obliczeniowej, gdzie jest to potrzebne do umożliwienia narzędziu Safety Reasoner dokładnego stosowania tych zasad. Następnie dostosowujemy zasady w miarę poprawy zrozumienia zagrożeń w środowisku produkcyjnym. W przypadku niektórych naszych ostatnich wdrożeń udział całkowitej mocy obliczeniowej poświęconej na rozumowanie w zakresie bezpieczeństwa osiągnął nawet 16%.

Safety Reasoner stał się kluczowym komponentem naszej struktury bezpieczeństwa. W przypadku generowania obrazów i korzystania za aplikacji Sora 2 przeprowadza on dynamiczne, etapowe oceny danych wyjściowych, aby identyfikować i blokować niebezpieczne operacje generowania w czasie rzeczywistym. W takich obszarach jak biologia i samookaleczenie uruchamiamy modele podobne do używanych w Moderation API jako małe, szybkie i bardzo czułe klasyfikatory, w celu określania treści znajdujących się w obszarze zainteresowania, a następnie używamy narzędzia Safety Reasoner do sprawdzania takich treści. Safety Reasoner klasyfikuje dane wyjściowe modelu w odniesieniu do szczegółowej taksonomii, aby określić najlepszy sposób odpowiedzi, tworząc w ten sposób część naszych wielowarstwowych zabezpieczeń w różnych systemach, takich jak GPT‑5 i agent ChatGPT. Obecnie dzięki modelom gpt-oss-safeguard takie podejście jest dostępne dla każdego.

Wyniki gpt-oss-safeguard

Modele gpt-oss-safeguard oceniliśmy w wewnętrznych i zewnętrznych zestawach ewaluacyjnych.

W ramach oceny wewnętrznej jednocześnie udostępniliśmy modelowi gpt-oss-safeguard wiele zasad w trakcie wnioskowania. W przypadku wszystkich testowych danych wejściowych oceniamy, czy gpt-oss-safeguard prawidłowo klasyfikuje tekst w ramach dołączonych zasad. To wymagające zadanie, a model jest uznawany za dokładny tylko wtedy, gdy dokładnie odpowiada wzorcowym etykietom dla wszystkich objętych zasad.

Nasze modele gpt-oss-safeguard oraz wewnętrzne narzędzie Safety Reasoner przewyższają modele gpt-5-thinking oraz open modele gpt-oss pod względem dokładności w wielu zasadach. Lepsze wyniki modeli gpt-oss-safeguard w stosunku do gpt-5-thinking są zaskakujące ze względu na niewielki rozmiar tych modeli.

Przeprowadziliśmy dalszą ocenę tych modeli z użyciem zestawu danych moderacyjnych(otwiera nowe okno) przedstawionego w naszym artykule badawczym z 2022 roku(otwiera nowe okno) oraz ToxicChat(otwiera nowe okno), publicznego zestawu testowego opartego na zapytaniach użytkowników skierowanych do chatbota open-source.

W przypadku zestawu moderacyjnego w 2022 r. przeprowadziliśmy ocenę z użyciem naszych wewnętrznych zasad bezpieczeństwa (dostosowując jedną z zasad, aby uwzględnić późniejsze zmiany). Model gpt-oss-safeguard spisał się nieco lepiej od wszystkich innych testowanych modeli, włączając w to nasze wewnętrzne narzędzie Safety Reasoner oraz gpt-5-thinking, chociaż różnica pomiędzy narzędziem Safety Reasoner a gpt-oss-safeguard nie była istotna statystycznie.

W przypadku ToxicChat ocenę przeprowadziliśmy z użyciem krótkiego, ręcznie napisanego polecenia opracowanego na bazie wybranych zasad wewnętrznych. Nasze wewnętrzne narzędzie Safety Reasoner ponownie spisało się lepiej niż gpt-5-thinking, podczas gdy gpt-5-thinking oraz Safety Reasoner nieznacznie przewyższyły modele gpt-oss-safeguard-120b i gpt-oss-safeguard-20b. Oczekujemy, że względnie mały rozmiar gpt-oss-safeguard nadal sprawia, że jest to preferowane rozwiązanie przy tego typu zadaniach.

Ograniczenia

Występują dwa konkretne ograniczenia modelu gpt-oss-safeguard. Po pierwsze: zaobserwowaliśmy, że klasyfikatory wytrenowane na podstawie dziesiątek tysięcy oznaczonych próbek wysokiej jakości mogą nadal spisywać się lepiej przy klasyfikowaniu treści niż model gpt-oss-safeguard przy bezpośrednim rozumowaniu na podstawie zasad. Poświęcenie czasu na wytrenowanie dedykowanego klasyfikatora może być lepszym rozwiązaniem zapewniającym wyższą wydajność w przypadku bardziej złożonych zagrożeń.

Po drugie: gpt-oss-safeguard może wymagać dużo czasu i mocy obliczeniowej, co utrudnia skalowanie go na wszystkie treści platformy. Wewnętrznie rozwiązujemy tę kwestię na kilka sposobów za pomocą narzędzia Safety Reasoner: (1) używamy mniejszych i szybszych klasyfikatorów w celu określenia, jakie treści oceniać, a także (2) w niektórych sytuacjach używamy narzędzia Safety Reasoner asynchronicznie, aby zapewniać użytkownikom niewielkie opóźnienia, jednocześnie utrzymując możliwość podejmowania interwencji, jeśli wykryjemy niebezpieczne treści.

Dalsze działania: kontynuacja współpracy ze społecznością

gpt-oss-safeguard stanowi pierwszy zestaw otwartych modeli bezpieczeństwa OpenAI, stworzony we współpracy ze społecznością. Nad udoskonalaniem gpt-oss-safeguard pracowaliśmy ze specjalistami ds. zaufania i bezpieczeństwa z SafetyKit, ROOST, Tomoro, a także platformy Discord w ramach wczesnych testów. Vinay Rao, CTO z ROOST, powiedział: „gpt-oss-safeguard to pierwszy model rozumujący typu open source pozwalający korzystać z własnych zasad i definicji szkód. Organizacje powinny mieć możliwość swobodnego badania, modyfikowania i wykorzystywania technologii z zakresu bezpieczeństwa o znaczeniu krytycznym oraz wprowadzania innowacji. Podczas naszych testów model wykazał się umiejętnością zrozumienia różnych zasad, wyjaśnienia rozumowania oraz przedstawienia niuansów w stosowaniu zasad, co naszym zdaniem przyniesie korzyści programistom i zespołom zajmującym się bezpieczeństwem”.

Będziemy dalej współpracować ze społecznością, aby udoskonalać narzędzia bezpieczeństwa open source, w tym poprzez ROOST Model Community (RMC). RMC skupia praktyków z dziedziny bezpieczeństwa oraz naukowców i pozwala dzielić się najlepszymi rozwiązaniami w zakresie wdrażania modeli AI open source w procesach bezpieczeństwa, w tym wynikami oceny oraz informacjami zwrotnymi o modelu. Odwiedź repozytorium RMC na GitHub(otwiera nowe okno), aby dowiedzieć się więcej na temat tego partnerstwa i możliwości udziału w nim.

Aby rozpocząć tworzenie z wykorzystaniem tych modeli, pobierz je z Hugging Face(otwiera nowe okno).

Autor

OpenAI