Tempo vývoja modelov v ére kritických kybernetických schopností
V uplynulých týždňoch poukázali na rastúce riziká spojené s čoraz schopnejšími systémami AI dve udalosti: incident OpenAI – Hugging Face a samostatne aj predbežné dôkazy, že jeden z našich pripravovaných modelov Astra môže podľa nášho Rámca pripravenosti dosahovať prahovú úroveň kritických schopností v oblasti kybernetickej bezpečnosti. Tieto udalosti spolu s rýchlym pokrokom nášho interného výskumu zvýšili naliehavosť našej práce na posilňovaní ochranných opatrení v oblasti monitorovania, zosúladenia a izolácie vo všetkých fázach tréningového procesu.
S rastúcimi schopnosťami modelov sa zvyšujú aj riziká spojené s ich interným vývojom a testovaním. Naše normy monitorovania, zosúladenia a bezpečnosti musia tieto riziká neustále predstihovať. Chceli sme si vyhradiť čas potrebný na splnenie týchto noriem, preto sme dočasne spomalili rozširovanie kapacít. Súčasťou bola dvojtýždňová prestávka v tréningu pomocou učenia posilňovaním (RL) pri našich najnovších modeloch určených na nasadenie. Počas nej sme ďalej posilňovali a red-teamovo testovali naše výskumné prostredia a rozširovali pokrytie monitorovacích systémov. Náš najväčší plánovaný prelomový tréning RL zostáva pozastavený. Zatiaľ vykonávame tréningy a hodnotenia menšieho rozsahu, aby sme posúdili správanie modelu, overili ochranné opatrenia a pred pokračovaním získali ďalšie dôkazy o zosúladení.
Zosúladenie – teda úsilie zabezpečiť, aby sa systémy AI správali zamýšľaným spôsobom a reagovali na ľudský dohľad – je už dlho jadrom nášho výskumného programu. Počas celého tréningu teraz vyžadujeme presvedčivejšie dôkazy o zosúladenom správaní, pričom nadväzujeme na prebiehajúci výskum a hodnotenia. Udržať čoraz schopnejšie systémy zosúladené je výzvou, ktorú bude musieť riešiť celé odvetvie. Signály, ktoré pozorujeme pri pokroku pripravovaných modelov, jasne ukazujú, že potrebujeme širší prístup – taký, ktorý vychádza zo súčasného Rámca pripravenosti a zároveň ho rozširuje.
Považujeme za dôležité transparentne informovať o tom, ako sa náš prístup mení. Nižšie opisujeme zmeny, ktoré sme už zaviedli do našich výskumných procesov a infraštruktúry, ako aj prácu, ktorá stále prebieha.
Náš prístup k vývoju schopnejších modelov stojí na troch vzájomne sa podporujúcich ochranných opatreniach:
- Monitorovanie, ktoré odhaľuje znepokojujúce správanie a umožňuje nám naň reagovať.
- Zosúladenie, ktoré znižuje pravdepodobnosť škodlivých alebo neoprávnených krokov.
- Bezpečnostné opatrenia, ktoré obmedzujú, k čomu môžu mať systémy AI prístup a čo môžu ovplyvniť.
Očakávame, že modely budú čoskoro vykonávať väčšinu bezpečnostných činností vrátane obrany proti iným modelom. Všetky tri ochranné opatrenia sa tak budú môcť rozširovať spolu so schopnosťami modelov, čo považujeme za kľúčové.
Tieto ochranné opatrenia uplatňujeme vo výskume aj pri nasadení a prispôsobujeme ich schopnostiam, prevádzkovému prostrediu a úrovni rizika každého modelu.
Keďže prelomové modely získavajú pokročilejšie schopnosti v oblasti kybernetickej bezpečnosti, sprísňujeme bezpečnostné normy prostredí, v ktorých ich trénujeme a hodnotíme. Splnenie týchto noriem si vyžiadalo značné technické úsilie a prinieslo vysoké náklady aj oneskorenia prelomového výskumu. Bezprostredne po incidente OpenAI – Hugging Face* sme vo výskumných klastroch pozastavili inferenciu prelomových modelov pri úlohách, ktoré mohli spúšťať kód alebo používať nástroje s prístupom na internet. Pomerne rýchlo sme obnovili obmedzenejší a bezpečnejší spôsob spúšťania kódu a potom sme jednotlivo preskúmali každú pracovnú záťaž, aby sme určili, či ju možno bezpečne obnoviť. Niektoré výskumné pracovné záťaže sme obnovili s týmito novými kontrolnými mechanizmami, iné si vyžadovali ďalšie zmeny.
V nasledujúcich týždňoch sme stanovili prísnejšie bezpečnostné požiadavky na pracovné záťaže prelomového výskumu a začali sme ich zavádzať. Napríklad:
- Izolácia pracovných záťaží: Pri pracovných záťažiach, ktoré spúšťajú kód generovaný modelom alebo iný nedôveryhodný kód, teraz vyžadujeme dôkladnejšiu izoláciu („sandboxy“). Platí to aj pre softvér, ktorý by mohol byť napadnutý pri spracovaní výstupov modelu.
- Izolácia siete: Zaviedli sme ďalšie kontrolné mechanizmy na izolovanie rizikovejších a nedôveryhodných pracovných záťaží od internetu. Tieto kontrolné mechanizmy sme navrhli tak, aby jediné narušenie pracovnej záťaže alebo podpornej služby samo osebe neumožnilo neoprávnený prístup na internet ani do iných interných sietí.
- Priebežné testovanie bezpečnosti: Prekonfigurovali sme naše prostredie, aby sme odstránili potenciálne zraniteľné zdieľané služby, obmedzili trvalé oprávnenia a zlepšili hranice bezpečnosti a dôvery. Zlepšujeme aj našu schopnosť zhromažďovať a monitorovať bezpečnostné záznamy. Napokon investujeme do automatizácie, pri ktorej naše modely nepretržite testujú tieto hranice pomocou simulovaných útokov.
Tieto kontrolné mechanizmy spoločne vytvárajú viacvrstvovú ochranu a pomáhajú chrániť naše výskumné prostredie pred útokmi. V súčasnosti vyžadujeme najprísnejšiu úroveň bezpečnostných opatrení pri pracovných záťažiach zahŕňajúcich model Astra alebo kybernetické modely, pretože sme dospeli k záveru, že modely Astra môžu mať kritickú úroveň kybernetických schopností. Tieto ochranné opatrenia sa vzťahujú aj na všetky ostatné pracovné záťaže súvisiace s kybernetikou.
Hoci niektoré tréningy a hodnotenia modelu Astra tieto požiadavky spĺňajú, značný počet pracovných záťaží zostáva pozastavený, kým nebudú úplne migrované a posilnené tak, aby spĺňali novú bezpečnostnú úroveň. Pri migrácii do týchto nových prostredí dávame prednosť pracovným záťažiam zameraným na bezpečnosť a zosúladenie.
Monitorovanie je už dlho dôležitou súčasťou nášho procesu vývoja modelov vrátane monitorovania interných programovacích agentov a dlhotrvajúcich relácií. Naše monitorovanie sa sústreďovalo najmä na interné nasadenia prelomových modelov a prelomové tréningy RL. Považovali sme ich za najrizikovejšie pracovné záťaže, pretože môžu spájať pokročilé schopnosti modelov s prístupom k nástrojom, citlivým systémom a interným či externým sieťam. Neuplatňovali sme ho na všetky inferencie a tréningy využívajúce nástroje. S novým nastavením monitorovania sme náš prístup prepracovali a rozšírili.
Nové monitorovanie prebieha vo viacerých fázach. Začína sa klasifikátormi aktivácií (detektormi kontrolujúcimi internú aktivitu modelu), ktoré pracujú pri každom vzorkovanom tokene a prípadné problémy postupujú čoraz sofistikovanejším automatizovaným vyšetrovacím systémom s vyššími výpočtovými nárokmi. Tieto systémy skúmajú úkony nástrojov, dostupné uvažovanie a celú postupnosť činností, aby odhalili neoprávnený prístup, krádež údajov, deštruktívne správanie a pokusy o prekonanie ochranných opatrení. Naším cieľom je vydať upozornenie do 30 minút od odhalenia znepokojujúcej aktivity monitorovacím systémom. Ak monitorovací systém odhalí pravdepodobné narušenie kritickej bezpečnostnej hranice, vygeneruje upozornenie s najvyššou prioritou. V našej súčasnej implementácii dostanú pohotovostné hlásenie tímy pre bezpečnosť, ochranu a výskum. Ak tieto tímy nedokážu do 30 minút jednoznačne určiť, že hlásenie je falošne pozitívne, musia danú aktivitu pozastaviť.
Toto monitorovanie sa vyžaduje pri všetkých tréningoch RL a hodnoteniach s nástrojmi pre modely so schopnosťami na úrovni Sol alebo vyššej. Keď sme 7. augusta dospeli k záveru, že Astra môže mať kritické kybernetické schopnosti, zaviedli sme dodatočnú požiadavku monitorovať každú inferenciu modelu Astra s nástrojmi (nielen tréningy RL a hodnotenia).
Tieto ochranné opatrenia si vyžadujú značný výpočtový výkon. Podľa našich súčasných odhadov predstavuje réžia monitorovania približne 20 % výpočtového výkonu monitorovanej inferencie, hoci náklady sa medzi tréningovými a hodnotiacimi pracovnými záťažami výrazne líšia. Viac podrobností o tomto systéme zverejníme v pripravovanom blogovom príspevku.
Výskum zosúladenia je ústrednou súčasťou nášho poslania. Naším poslaním je zabezpečiť, aby všeobecná umelá inteligencia prinášala úžitok celému ľudstvu. Keď modely získajú pokročilé schopnosti, napríklad schopnosť vykonávať kybernetické útoky, a budú fungovať v zložitejších prostrediach, nezosúladené správanie, ako je obchádzanie systému odmeňovania (hľadanie spôsobov, ako počas tréningu získať vysoké odmeny bez skutočného dosiahnutia zamýšľaného výsledku), klamanie či neoprávnený prístup, bude predstavovať čoraz vážnejšie riziko.
Pri tréningoch RL najvýkonnejších modelov teraz uplatňujeme naše hlavné techniky zosúladenia vo viacerých fázach tréningového procesu. Patrí sem zdokonaľovanie modelov odmeňovania, aby lepšie odhaľovali a potláčali nebezpečné správanie naprieč úlohami a prostrediami; tréning modelov, aby pravdivejšie informovali o svojich krokoch, schopnostiach a obmedzeniach; a obmedzovanie správania, ktoré zneužíva slabiny odmien, hodnotiteľov, nástrojov alebo dohľadu. Rozširujeme aj tréningové pokrytie správania, ktoré by mohlo spôsobiť škodu pri interakcii modelov s externými systémami alebo zdrojmi.
Naďalej intenzívne investujeme do výskumu zosúladenia, rozširujeme pokrytie hodnotení a získané poznatky využívame pri tréningu a navrhovaní ochranných opatrení. V blízkej budúcnosti plánujeme zverejniť podstatne viac informácií o našom výskume zosúladenia vrátane poznatkov o správaní modelov a všetkých nových výzvach, ktoré odhalíme.
Náš Rámec pripravenosti budeme ďalej rozvíjať, aby tieto ochranné opatrenia spájal naprieč tréningom a nasadením a lepšie zohľadňoval schopnosti budúcich modelov aj prostredia, v ktorých fungujú. Vývoj metód, ktoré sa dokážu rozširovať spolu s týmito schopnosťami, si vyžiada trvalé investície do bezpečnosti podporovanej modelmi, účinnejšieho monitorovania a ďalšieho pokroku vo výskume zosúladenia. Máme v úmysle zapojiť externé organizácie a s ďalším rozvojom nášho prístupu zverejňovať viac získaných poznatkov.
Schopnosti prelomových modelov sa rýchlo zvyšujú. Naša schopnosť porozumieť im, zosúladiť ich a zabezpečiť ich musí zostať v predstihu.
*V najbližších týždňoch zverejníme technickú správu o získaných poznatkoch.

