Cesta ke zdůvodnění bezpečnosti trénování průkopnické AI
Domníváme se, že vstupujeme do nové éry, v níž by pokračování každého trénovacího běhu průkopnických modelů využívajícího učení posilováním mělo být podmíněno strukturovanou bezpečnostní dokumentací. V ideálním případě by taková dokumentace měla dosáhnout úrovně „zdůvodnění bezpečnosti“ – ucelené, strukturované argumentace o rizicích podložené důkazy, jaká se používá v jiných odvětvích s kritickými nároky na bezpečnost. Zdůvodnění bezpečnosti chápeme jako ambiciózní cíl, k němuž směřujeme. Zároveň si uvědomujeme, jak obtížné je dosáhnout u modelů AI stejné míry rigoróznosti jako v letectví či jaderné energetice, protože každá nová úroveň schopností AI přináší novou, emergentní složitost. Pracujeme na rámci, který tyto postupy formálně zakotví.
Níže uvádíme úvodní zásady, které by podle nás měly být součástí takových zdůvodnění bezpečnosti při trénování průkopnické AI. Tyto osvědčené postupy odrážejí naše současné poznatky. Očekáváme, že se budou vyvíjet spolu s tím, jak budeme dále zdokonalovat interní procesy pro obezřetný vývoj. Sdílíme je už nyní, abychom otevřeně představili své současné uvažování a získali zpětnou vazbu od komunity. Upozorňujeme, že tento dokument se zaměřuje na trénování průkopnických modelů učením posilováním. Interní i externí nasazení vyžaduje zohlednit mnohem širší soubor vlastností souvisejících se souladem se záměry.
Zdůvodnění bezpečnosti by měla pokrývat tři oblasti technického řešení: trénování k souladu se záměry, izolaci a monitorování. Tato ochranná opatření pomáhají zajistit, aby se model nepokoušel jednat v rozporu se záměry. I kdyby se o to pokusil, mělo by pro něj být obtížné uniknout z izolace a monitorování by mělo takové chování zachytit dříve, než vznikne újma.
Soulad modelu se záměry: První obrannou linií by mělo být trénování modelů k souladu se záměry, tedy k tomu, aby spolehlivě jednaly tak, jak zamýšlíme. To by mohlo zahrnovat:
Trénovací prostředí a hodnocení: Snižovat riziko vzniku chování v rozporu se záměry tím, že se při trénování zabrání pozitivnímu posilování zneužívání systému odměn. To by mohlo zahrnovat:
Automatizované kontroly datových sad: Využívat agenty k vyhledávání a opravám chybných prostředí pro učení posilováním, v nichž by posloupnosti kroků v rozporu se záměry mohly získávat vysoké odměny zneužíváním slabin namísto zamýšleného chování. Tím se omezí příležitosti k posilování nežádoucího chování při trénování.
Ruční kontroly datových sad: Doplňovat automatizovaný red-teaming ručním posuzováním a kontrolami kvality datových sad, aby se odhalily chybné úlohy, které by mohly neúmyslně posilovat chování v rozporu se záměry.
Ladění hodnoticích systémů: Ladit hodnoticí systémy tak, aby penalizovaly pokusy modelu zneužít slabiny prostředí pro učení posilováním nebo je během trénování napadnout.
Analýza předchozích běhů: Používat klasifikátory na záznamy průběhu předchozích experimentů a ověřovat tak, že hodnoticí systémy fungují podle záměru.
Měření souladu se záměry: Provádět vyhodnocení, která sledují sklony modelu jednat v rozporu se záměry, a měřit tak účinnost trénování k souladu. To by mohlo zahrnovat:
Offline vyhodnocování souladu: Během trénovacích běhů průkopnických modelů provádět vyhodnocení souladu se záměry, posuzovat, zda trénování funguje podle očekávání, a prošetřovat každé podstatné zhoršení.
Zpětné testování: Ověřovat vyhodnocení souladu na předchozích incidentech, aby se potvrdilo, že odhalují modely, které dříve jednaly v rozporu se záměry, a nejsou přeučená na konkrétní incidenty.
Sledování obcházení vyhodnocení: Sledovat uvědomování si posuzování nebo metagaming (kdy modely rozpoznají, že jsou testovány), které by mohly vyvolat změnu chování. Například při vyhodnocování souladu zapnout monitorování uvědomování si posuzování a metagamingu a stanovit konkrétní prahy, při jejichž překročení se běh zablokuje.
Zátěžové testy nejhorších scénářů: Vyvolávat nejhorší možné nežádoucí chování a ověřovat, že by je zachytilo alespoň jedno vyhodnocení.
Zamezení trénování na myšlenkovém řetězci: Nezpřístupňovat automatizovaným hodnoticím systémům při učení posilováním myšlenkový řetězec, aby se modely nenaučily vyhýbat jeho monitorování.
Izolace: Zajistit dostatečně silnou izolaci v sandboxu a zabezpečení, aby se zabránilo škodlivému jednání v případě, že model přestane být v souladu se záměry. To by mohlo zahrnovat:
Více vrstev zabezpečení infrastruktury: Výrazně investovat do posílení zabezpečení sandboxu, v němž model běží, i výzkumné infrastruktury, která sandbox hostuje. Zajistíme tak další ochrannou vrstvu pro případ úniku ze sandboxu.
Red-teaming izolace: Zlepšovat zabezpečení sandboxu, výzkumné infrastruktury a perimetru opakovaným red-teamingem těchto systémů pomocí průběžně uložených verzí modelů z trénovacích běhů průkopnické AI. Toto testování musí podléhat bezpečnostní analýze a sloužit k odhalení a odstranění případných mezer. Stejnému testování podrobit také všechny služby, s nimiž by model mohl během trénování přijít do styku (např. internetovou mezipaměť).
Komunikace mezi vzorky: Omezit vysokokapacitní komunikaci mezi vzorky na schválené cesty, například nástroje pro více agentů, a uzavřít postranní kanály v infrastruktuře, které mají vysokou kapacitu a agenti je mohou snadno objevit.
Neměnné přepisy: Uchovávat přepisy interakcí agentů po přiměřenou dobu v neměnné podobě (např. v účtech úložiště s jednorázovým zápisem), a to pro veškeré trénování učením posilováním, vyhodnocování i interní nasazení. Umožní to spolehlivé vyšetřování incidentů a zabrání neúmyslným úpravám.
Monitorování: Pro případ, že modely začnou jednat v rozporu se záměry, mít k dispozici monitorovací systém v reálném čase, který zachytí případný nesoulad a umožní rychle řešit prioritní problémy dříve, než dojde k závažnému incidentu. To by mohlo zahrnovat:
Zajištění monitorovatelnosti: Zajistit, aby modely zůstaly monitorovatelné, a ověřovat to vyhodnoceními monitorovatelnosti a vyhýbání se monitorování s jasnými prahy. To umožní včas zachytit znepokojivé chování.
Vysoká záchytnost známých problémů: Zajistit, aby monitorovací systém zachytil vysoký podíl minulých incidentů při vyhodnocení na datech vyhrazených pro testování.
Aktuálnost vyhodnocení monitorovacích systémů: Vytvářet testovací případy reprezentující zcela nová rizika u nových běhů, aby měření záchytnosti a přesnosti monitorovacích systémů nezastarávala.
Rychlá reakce: Zavést prioritní upozornění, která povedou k zásahu ve lhůtě stanovené SLA, a to buď přivoláním pracovníka pohotovostní služby, nebo automatickým pozastavením dotčeného běhu dříve, než model způsobí újmu (např. při incidentech ve dne přivolat bezpečnostní pohotovost a osobu odpovědnou za běh, v noci pak automaticky pozastavit běhy, pokud nikdo nepotvrdí přijetí upozornění).
Vedle doporučení k technickým ochranným opatřením pracujeme také na osvědčených provozních postupech pro zdůvodnění bezpečnosti jednotlivých běhů trénování průkopnické AI. Mohly by zahrnovat:
Oponentní stanoviska (předběžné analýzy selhání): Po vypracování zdůvodnění bezpečnosti by měl člen jiného týmu sepsat oponentní stanovisko, které odhalí případné mezery a nabídne přiměřený odhad rizika. Trénovací tým by se s ním měl následně vypořádat, aby se zdůvodnění bezpečnosti posílilo.
Schvalování: Zdůvodnění bezpečnosti by měli posoudit členové vrcholového vedení, přičemž každý z nich by měl mít možnost daný běh vetovat. Tím se zajistí několik interních úrovní kontroly (např. vedoucí výzkumné organizace či viceprezident pro výzkum, vedoucí bezpečnosti a hlavní vědecký pracovník).
Odpovědnost: Člen vrcholového vedení odpovědný za trénovací běh (např. vedoucí výzkumné organizace či viceprezident pro výzkum) by měl nést odpovědnost za zdůvodnění bezpečnosti i případnou reakci na incidenty, a to i v rámci hodnocení pracovního výkonu. Trénovací týmy tak budou rovněž motivovány prosazovat bezpečnost a soulad se záměry.
Pozastavení: Pro případ zjištění problémů, které by zneplatnily zdůvodnění bezpečnosti (např. nového bezpečnostního problému), musí existovat provozní postupy, technické mechanismy a dohody o úrovni služeb (SLA) pro pozastavení všech běhů, na něž se zdůvodnění vztahuje.
Interní transparentnost: Zdůvodnění bezpečnosti by měla být přístupná interním dohledovým orgánům (např. Výboru pro bezpečnost a ochranu).
Audity: Auditoři by měli mít dostatečný přístup k ověření platnosti a podloženosti tvrzení ve zdůvodnění bezpečnosti a k upozornění na případné zjištěné mezery.
Eskalace: Měl by existovat jasný postup pro eskalaci případů nesouladu se záměry, tabulka definovaných stupňů závažnosti a pohotovostní služba pro tyto případy, která může přivolat vrcholové vedení (např. generálního ředitele), když běh dosáhne určitého stupně závažnosti.
Technické kontrolní mechanismy: Pro lidi i agenty by mělo být obtížné spouštět běhy, které nesplňují pravidla. Bezpečnostní funkce, jako je monitorování a automatické pozastavení, by měly při selhání přejít do stavu, který zabrání dalšímu provozu (např. by nemělo být možné spouštět běhy bez zapnutého odpovídajícího monitorování ani vypnout monitorovací systém zevnitř trénování učením posilováním, vyhodnocování nebo interního nasazení).
Možnost vrácení změn: Mělo by být snadné dohledat všechna navazující využití modelu, který není v souladu se záměry, v procesu trénování (např. generování dat nebo hodnocení), aby bylo možné v případě potřeby zvrátit dopady jeho nežádoucích výstupů.
Úplnost přehledu zbytkových rizik: Zdůvodnění bezpečnosti by měla obsahovat co nejúplnější seznam zbytkových rizik, která nejsou pokryta zavedenými opatřeními ke zmírnění rizik, aby bylo možné informovaně rozhodovat o jejich přijetí.
Jde o naše současná doporučení, která nyní v OpenAI zavádíme. Očekáváme, že se naše postupy budou v nadcházejících týdnech dále vyvíjet.
Vyvíjíme také osvědčené postupy pro vyšetřování závažných incidentů, při nichž AI jedná v rozporu se záměry. Laboratoře by se měly snažit z jednotlivých incidentů co nejvíce poučit, aby jim dokázaly v budoucnu předcházet, podobně jako je tomu u vyšetřovacích postupů(otevře se v novém okně) v jiných odvětvích, kde může mít selhání vážné následky. Takové kroky by mohly zahrnovat například:
Interní transparentnost: Protože dokončení vyšetřování může trvat dlouho, měly by se o jeho průběhu pravidelně sdílet interní zprávy (např. každodenní aktualizace u probíhajících vyšetřování). Zaměstnanci by měli mít jasně stanovené postupy, jak získat širší přístup, včetně nezpracovaných přepisů a možnosti vzorkovat výstupy modelů, které nejsou v souladu se záměry, pokud je to bezpečné a relevantní pro jejich práci.
Prvotní příčina nesouladu: Výzkumníci by měli zjišťovat prvotní příčiny v dynamice trénování (např. cílenými ablačními experimenty nebo experimenty s opakovaným vzorkováním), aby pochopili, jak nežádoucí chování vzniklo. Tím prohloubí vědecké porozumění nesouladu se záměry a zlepší jeho prevenci.
Následná analýza: Měla by proběhnout následná analýza provozních postupů a organizační kultury, která objasní všechny příčiny přispívající k incidentu, například proč problémy vznikly a proč nebyly před incidentem odhaleny nebo eskalovány.
Detekce: Měli bychom vyvíjet metody testování souladu se záměry, které dokážou odhalit sklon způsobit daný incident, aniž bychom je přímo optimalizovali podle informací získaných z incidentu (např. přepisů nebo shrnutí incidentu). Vyhodnocení odvozená z incidentů by měla sloužit jako „regresní testy“, které zajistí, že budoucí modely nebudou vykazovat sklon k nesouladu se záměry ve velmi podobných situacích.
Zveřejňování informací: Výsledky vyšetřování, následné analýzy a změny provozních postupů by měly být po ukončení vyšetřování sdíleny s veřejností. Dotčené třetí strany by měly být informovány co nejdříve.


