Priorytety i zasady skutecznych ocen zewnętrznych
Laboratoria zajmujące się pionierską AI ponoszą ogromną odpowiedzialność za bezpieczne trenowanie, ewaluację i wdrażanie modeli. Oceny zewnętrzne mają kluczowe znaczenie dla właściwego rozłożenia tej odpowiedzialności, poszerzają możliwości wyrażania opinii na temat bezpieczeństwa AI, dostarczają światu informacji oraz pomagają rozliczać laboratoria z jasnych, niezależnie potwierdzonych tez dotyczących bezpieczeństwa.
W ramach naszych działań na rzecz regulowania tempa rozwoju pionierskiej AI OpenAI zobowiązuje się wspierać niezależne oceny, zapewniając szeroki dostęp do procesów trenowania, ewaluacji i wdrażania. Dostęp ten powinien umożliwiać oceniającym kwestionowanie naszych założeń, identyfikowanie przeoczonych przez nas zagrożeń i wyciąganie własnych wniosków na temat skuteczności naszych zabezpieczeń.
Od dawna współpracujemy z zewnętrznymi podmiotami oceniającymi na różnych etapach opracowywania i wdrażania modeli. Oceny zewnętrzne uwzględniliśmy również w naszych praktykach związanych z Ramami gotowości, a ponadto wspieraliśmy organizacje i przepisy promujące bardziej rygorystyczny i rozliczalny proces. W ramach tej współpracy zapewnialiśmy szeroki dostęp, w tym do informacji o naszych zabezpieczeniach technicznych, widocznego łańcucha rozumowania oraz — w bezprecedensowym zakresie — do poufnych danych i wewnętrznych wdrożeń na potrzeby reagowania na incydenty i kontrolowanych ataków na systemy monitorowania. Przedstawione tutaj priorytety i zasady dotyczą naszej współpracy z niezależnymi organizacjami oceniającymi z sektora prywatnego i non profit w zakresie technicznych ocen bezpieczeństwa. Uzupełniają one naszą współpracę z administracją publiczną w zakresie testów i ewaluacji, gdzie odmienne role i obowiązki mogą wymagać innego podejścia.
Skuteczność takich ocen wymaga solidnych mechanizmów niezależności, naukowego rygoru, niezawodnych praktyk bezpieczeństwa i jasnego podziału odpowiedzialności. Laboratoria odpowiadają za umożliwienie rzetelnej kontroli przy jednoczesnej ochronie informacji wrażliwych. Laboratoria i niezależni oceniający wspólnie odpowiadają za prawidłową realizację tego procesu i powinni działać zgodnie ze wspólnymi międzynarodowymi standardami praktyk w zakresie bezpieczeństwa i ochrony. Poniżej proponujemy cztery priorytetowe obszary pogłębionej oceny wraz z zasadami prowadzenia rygorystycznych, bezpiecznych i niezależnych prac.
Oceny zewnętrzne są najbardziej użyteczne, gdy odpowiadają na konkretne, istotne pytania: Czy argumentacja laboratorium na rzecz bezpieczeństwa oraz jego tezy dotyczące bezpieczeństwa są poparte dowodami? Czy ewaluacje odpowiednio sprawdzają zagrożenia, do których pomiaru zostały przeznaczone? Czy zabezpieczenia działają w realistycznych warunkach?
Opisane tutaj oceny mogą przybierać różne formy, zależnie od badanego zagadnienia bezpieczeństwa. Spodziewamy się wspierać wiele ocen prowadzonych równolegle i w różnych okresach — niektóre potrwają kilka tygodni, a inne kilka miesięcy. Oceny zewnętrzne mogą być również elementem prac poprzedzających wdrożenie i wpływać na decyzje o wdrożeniu, jednak opisane tutaj działania mają zasadniczo charakter długoterminowy i są niezależne od terminu premiery — koncentrują się na dogłębnym, prowadzonym w czasie badaniu konkretnych tez dotyczących bezpieczeństwa.
W opisach naszych priorytetowych obszarów i zasad posługujemy się terminami „tezy dotyczące bezpieczeństwa” oraz „argumentacja na rzecz bezpieczeństwa”. Rozumiemy je następująco:
Teza dotycząca bezpieczeństwa: Konkretne stwierdzenie dotyczące możliwości, zachowania lub zabezpieczeń modelu bądź systemu, które ma znaczenie dla jego bezpieczeństwa i może zostać ocenione na podstawie dowodów. Teza powinna wskazywać zagrożenia i warunki, których dotyczy, a także istotne założenia i ograniczenia.
Argumentacja na rzecz bezpieczeństwa: Uporządkowane uzasadnienie poparte dowodami, wyjaśniające, dlaczego ryzykiem związanym z modelem lub systemem odpowiednio się zarządza w ramach określonego działania, takiego jak trenowanie, ewaluacja lub wdrożenie. Argumentacja na rzecz bezpieczeństwa łączy poszczególne tezy dotyczące bezpieczeństwa z potwierdzającymi je dowodami oraz wyraźnie wskazuje założenia, niepewności i pozostałe zagrożenia, które mogą wpływać na wnioski.
Proponujemy cztery priorytetowe obszary pogłębionej oceny wraz z zasadami prowadzenia rygorystycznych, bezpiecznych i niezależnych prac.
Niezależna ocena argumentacji na rzecz bezpieczeństwa obejmująca trenowanie, ewaluację oraz wdrożenia wewnętrzne i zewnętrzne.
Ocena argumentacji na rzecz bezpieczeństwa wymaga wiedzy specjalistycznej w zakresie dostosowania, metod kontroli takich jak monitorowanie, cyberbezpieczeństwa, nadużyć biologicznych i chemicznych oraz kontrolowanego ataku. Na argumentację na rzecz bezpieczeństwa składają się tezy dotyczące między innymi trenowania, ewaluacji możliwości i zabezpieczeń. Można ją oceniać w całości lub częściowo (zob. priorytety 2 i 3 poniżej). Poszczególne części argumentacji będzie prawdopodobnie musiało zbadać wielu oceniających, stosownie do ich specjalizacji. Łącznie ich oceny powinny odpowiadać na pytania takie jak:
Czy dowody przedstawione w argumentacji na rzecz bezpieczeństwa dotyczącej trenowania, ewaluacji i wdrożeń są należycie potwierdzone? Czy podczas trenowania, ewaluacji i wdrożenia przestrzegano warunków określonych w argumentacji na rzecz bezpieczeństwa?
Czy nasza argumentacja na rzecz bezpieczeństwa obejmuje najpilniejsze zagrożenia zidentyfikowane w toku oceny? Czy tezy dotyczące bezpieczeństwa stanowią oparcie dla całościowej argumentacji na rzecz bezpieczeństwa? Czy występują jakiekolwiek luki lub obszary wymagające poprawy?
Czy stosuje się skuteczne metody identyfikowania i ograniczania bodźców występujących podczas trenowania, które mogłyby premiować oszustwo, obchodzenie systemu nagród, działania destrukcyjne lub omijanie ograniczeń?
Ocena krytycznych zabezpieczeń we wdrożeniach wewnętrznych i zewnętrznych
Nasz zestaw zabezpieczeń stale ewoluuje, aby odpowiadać na zmieniające się możliwości i uwarunkowania. Nasze zabezpieczenia obejmują trenowanie oraz wdrożenia wewnętrzne i zewnętrzne. Obecnie obejmują one zabezpieczenia na poziomie modelu, mechanizmy egzekwowania zasad i środki bezpieczeństwa, a także systemy monitorowania niedostosowania — dotyczące wielu różnych zagrożeń, takich jak utrata kontroli oraz nadużycia stwarzające zagrożenia cybernetyczne, biologiczne i chemiczne. Partnerstwa techniczne mogą już teraz identyfikować słabości zabezpieczeń, a zarazem doskonalić metody oceny i przyspieszać rozwój standardów. Zapewni to solidniejszą podstawę techniczną przyszłych polityk publicznych pozwalających regulować tempo rozwoju pionierskiej AI — zwłaszcza w przypadku wdrożeń wewnętrznych, dla których standardy bezpieczeństwa i ochrony dopiero powstają.
Niezależne oceny powinny sprawdzać skuteczność tych zabezpieczeń i wskazywać ich potencjalne braki, odpowiadając na pytania takie jak:
Czy przy dostępie typu „grey box” zabezpieczenia są odporne na testy kontradyktoryjne (próby obejścia zabezpieczeń) i wystarczająco chronią przed zwiększaniem możliwości w obszarach wysokiego ryzyka, takich jak cyberbezpieczeństwo i biologia? Czy nasze testy kontradyktoryjne i kontrolowane ataki obejmują najważniejsze zagrożenia?
Jak podczas autoryzowanych testów w realistycznych warunkach operacyjnych agenty wchodzą w interakcje z zabezpieczeniami cybernetycznymi, takimi jak kontrola dostępu, piaskownice oraz systemy wykrywania i reagowania? Które zabezpieczenia zapobiegają szkodliwym działaniom, wykrywają je lub ograniczają ich skutki, a w jakich sytuacjach zawodzą?
Czy nasze systemy monitorowania niedostosowania mają krytyczne luki, które mogłyby doprowadzić do utraty kontroli lub poważnego niedostosowania zarówno we wdrożeniach wewnętrznych, jak i zewnętrznych? Na ile wiarygodnym źródłem dowodów dotyczących bezpieczeństwa lub dostosowania jest monitorowanie łańcucha rozumowania w miarę wzrostu możliwości modeli?
Czy we wszystkich istotnych procesach trenowania, ewaluacji i wdrażania stosuje się odpowiednie monitorowanie, którego nie da się łatwo wyłączyć?
Czy wdrożone zabezpieczenia są współmierne do możliwości?
Ocena ewaluacji możliwości obejmujących kategorie zagrożeń z Ram gotowości (zagrożenia chemiczne i biologiczne, cyberbezpieczeństwo, samodoskonalenie AI) oraz ewaluacji dostosowania pod kątem zagrożeń wynikających z niedostosowania
Nasze Ramy gotowości wymagają przeprowadzania ewaluacji kluczowych obszarów zagrożeń ze strony modeli pionierskich. W miarę przekraczania progów i osiągania przez modele maksymalnych wyników w istniejących ewaluacjach ważne jest ich systematyczne odświeżanie oraz zapewnianie odpowiedniego zakresu i jakości zarówno ewaluacji możliwości w obszarach zagrożeń z Ram gotowości, jak i ewaluacji dostosowania służących ocenie ryzyka poważnego niedostosowania.
Do istotnych pytań należą:
Czy ewaluacje zagrożeń z Ram gotowości odpowiednio uwzględniają definicję progu zagrożenia określoną w tych Ramach? Czy progi tych ewaluacji są prawidłowo ustalone?
Czy ewaluacje są aktualizowane, gdy modele regularnie osiągają najwyższe wyniki, i czy nowe testy rzeczywiście mierzą bardziej zaawansowane możliwości?
Czy nasze ewaluacje dostosowania odpowiednio obejmują zagrożenia związane z poważnym niedostosowaniem i jakie istotne zachowania lub warunki mogą pomijać?
Niezależne dochodzenie w sprawie krytycznych incydentów związanych z niedostosowaniem
Niezależne dochodzenie może być wartościowe w przypadku wielu krytycznych incydentów związanych z bezpieczeństwem AI. Koncentrujemy się tutaj na niedostosowaniu modeli, w tym na przypadkach działania bez upoważnienia lub unikania nadzoru, które mogą ujawniać słabości metod dostosowania i zabezpieczeń nawet bez celowego nadużycia.
W wybranych okolicznościach, tak jak w przypadku incydentu OpenAI związanego z Hugging Face, korzystne może być zaangażowanie niezależnego podmiotu zewnętrznego do przeprowadzenia niezależnego dochodzenia w sprawie incydentu związanego z niedostosowaniem. Kluczowe jest, aby podmioty zewnętrzne uczestniczące w badaniu incydentu dysponowały niezbędnymi kompetencjami, w tym, w stosownych przypadkach, wiedzą z zakresu informatyki śledczej i dostosowania, umiejętnością analizy łańcuchów rozumowania na dużą skalę oraz personelem i zasobami pozwalającymi terminowo przeprowadzić dochodzenie. Reagowanie na incydent może wymagać dostępu do wrażliwych danych wewnętrznych i danych podmiotów zewnętrznych, dlatego publikowanie lub udostępnianie niektórych szczegółów może być niewskazane. Ustalenia niezależnych dochodzeń mogą również zostać uwzględnione w argumentacji na rzecz bezpieczeństwa modelu jako dowody służące ocenie tez dotyczących jego dostosowania oraz skuteczności działań podjętych w celu usunięcia wcześniej zaobserwowanego niedostosowania.
W kontekście incydentów związanych z niedostosowaniem priorytetowo traktujemy niezależne oceny następujących kwestii:
Jakie zachowania modelu lub problemy z niedostosowaniem wystąpiły podczas incydentu i jakie były główne czynniki, które się do niego przyczyniły?
Czy zabezpieczenia i działania naprawcze skutecznie ograniczyłyby podobne incydenty w przyszłości?
Jasno określony zakres i wspólnie uzgodnione tezy podlegające ocenie: Ocenę należy rozpocząć od wspólnego uzgodnienia jej zakresu, a następnie jasno zdefiniować i wstępnie zarejestrować tezy dotyczące bezpieczeństwa — jeszcze przed rozpoczęciem działań oceniających. Podmioty zewnętrzne i laboratoria powinny wyjaśnić, czy chodzi o tezy, które oceniana firma chce poddać ocenie, czy o tezy, które zewnętrzny podmiot zamierza ocenić niezależnie i względem których laboratorium zgadza się poddać ocenie. Niektóre tezy mogą wykraczać poza zakres oceny z wielu powodów, w tym z powodu braku możliwości uzyskania przez podmioty zewnętrzne dostępu do danych, niewystarczających kompetencji oceniającego lub uzasadnionych ograniczeń czasowych, gdy ocena jest pilna. Laboratoria i oceniający powinni ustanowić procedurę uwzględniania istotnych zagrożeń wykrytych poza pierwotnym zakresem, w tym ustalania, czy wymagają one dalszego zbadania. Wnioski powinny jasno wskazywać, co zostało, a co nie zostało ocenione w odniesieniu do wspólnie uzgodnionego zakresu.
Proporcjonalny dostęp: W miarę możliwości oceniający powinni otrzymać dostęp proporcjonalny do potrzeb związanych z oceną uzgodnionych tez, z uwzględnieniem ograniczeń prawnych, wymogów bezpieczeństwa i ochrony własności intelektualnej. Gdy bezpośredni dostęp jest niepraktyczny lub niemożliwy, oceniający mogą współpracować z wyznaczonym przedstawicielem firmy albo korzystać z pośrednich mechanizmów dostępu lub rozwiązań chroniących prywatność, aby zabezpieczyć informacje źródłowe.
Transparentna metodologia i standardy: Oceniający powinni wyjaśnić swoje metody, kryteria oceny i niepewności, opierając się tam, gdzie to możliwe, na ustanowionych standardach. Jeśli standardy jeszcze nie istnieją, powinni jasno uzasadnić stosowane kryteria. Raporty powinny odróżniać bezpośrednie ustalenia od ich interpretacji, wyjaśniać niepewności i jasno wskazywać, które wnioski znajdują potwierdzenie w dowodach.
Wiedza specjalistyczna i niezależność: Oceniający powinni wykazać się odpowiednią wiedzą techniczną, a także identyfikować, ujawniać i rozwiązywać organizacyjne oraz indywidualne konflikty interesów, w tym wynikające z uwarunkowań finansowych, relacji z twórcami i wcześniejszego udziału w ocenianych pracach. Należy wdrożyć zabezpieczenia gwarantujące, że presja komercyjna i warunki wynagrodzenia nie wpływają na ustalenia. Mogą one obejmować wyłączenie danej osoby z prac lub odpowiednie okresy karencji.
Bezpieczeństwo i poufność: Oceniający powinni wykazać stosowanie praktyk z zakresu bezpieczeństwa informacji oraz egzekwowalnych mechanizmów ochrony poufności obejmujących ich personel i proporcjonalnych do wrażliwości udostępnionych systemów oraz informacji. Ochrona ta powinna obejmować własność intelektualną, informacje wrażliwe i dokumentację dot. oceny. Jeśli oceniający nie mogą spełnić wymogów bezpieczeństwa we własnym środowisku lub udostępniane dane są szczególnie wrażliwe, właściwe może być zapewnienie dostępu na urządzeniach zarządzanych przez firmę lub w jej siedzibie.
Ustalenia umożliwiające podjęcie działań i czas na naprawę: Oceny powinny wskazywać konkretne luki i zawierać wystarczająco szczegółowe informacje, aby laboratoria mogły je usunąć. W stosownych przypadkach laboratoria powinny otrzymać rozsądny czas na usunięcie problemów przed publikacją. W stosownych przypadkach raporty powinny również przedstawiać wnioski dla twórców i podmiotów wdrażających agentów oraz dla specjalistów ds. ochrony, wraz z praktycznymi zaleceniami dotyczącymi ich wdrożenia.
Odpowiedzialne praktyki publikacyjne: Raporty z ocen powinny opierać się na dowodach i być udostępniane w możliwie otwarty sposób, przy jednoczesnej ochronie informacji wrażliwych i poufnych. Gdy pełne publiczne ujawnienie informacji nie jest możliwe, poufne raportowanie odpowiednim organom nadzoru, takim jak organy zarządzające lub rady spółek, może sprzyjać rozliczalności. Aby zachować równowagę między niezależnością a poufnością, należy ustanowić oparte na jasno określonych zasadach mechanizmy ochronne i polityki dotyczące usuwania informacji wrażliwych, a także jasno określić oczekiwania dotyczące informacji zwrotnych i korygowania nieścisłości. Oceniający powinni zachować niezależność redakcyjną, dbając jednocześnie o poufność i ochronę własności intelektualnej. Oceniający powinni przyjąć jasne zasady usuwania informacji wrażliwych, które pozwolą laboratoriom wnioskować o usunięcie informacji wrażliwych, a oceniającym — wskazywać, gdzie dokonano istotnych usunięć, oraz ich wpływ na raport z oceny.
Zobowiązujemy się wspierać niezależnych oceniających i ustanawiać jaśniejsze, wspólne standardy międzynarodowe skutecznych ocen zewnętrznych — zarówno w przyszłych przepisach, jak i za pośrednictwem prywatnych instytucji zarządzających. Ekosystem niezależnych ocen wciąż się rozwija. Będziemy wspierać ten rozwój poprzez pomoc zróżnicowanej społeczności niezależnych oceniających, którzy dysponują rozległą wiedzą specjalistyczną dotyczącą kwestii bezpieczeństwa pionierskiej AI, oraz współpracę z nimi. Żaden pojedynczy podmiot zewnętrzny nie jest w stanie ani nie powinien kompleksowo zajmować się pilnymi kwestiami bezpieczeństwa pionierskiej AI. Będziemy w przemyślany i celowy sposób rozwijać nasze możliwości oraz wspierać rosnący ekosystem podmiotów zewnętrznych w uzgadnianiu najlepszych praktyk i zasad. Prowadzimy rozmowy z wieloma podmiotami zewnętrznymi na temat propozycji zgodnych z powyższymi obszarami priorytetowymi.


