Úton az élvonalbeli MI-modellek tanítását megalapozó biztonsági érvelések felé
Úgy véljük, új korszakba lépünk, amelyben minden élvonalbeli, megerősítéses tanulást alkalmazó tanítási futás folytatása előtt strukturált biztonsági dokumentációt kellene megkövetelni. Ideális esetben ez a dokumentáció elérné a „biztonsági érvelés” szintjét: olyan átfogó, strukturált, bizonyítékokon alapuló érvelést tartalmazna a kockázatokról, amilyet más, biztonságkritikus iparágakban is alkalmaznak. A biztonsági érveléseket olyan irányadó célnak tekintjük, amely felé törekszünk. Ugyanakkor elismerjük, hogy az MI-képességek minden új szintjén megjelenő összetettség miatt kihívást jelent az MI-modelleknél ugyanolyan szigorúan megalapozni őket, mint a repülésben vagy az atomenergetikában. E gyakorlatok egységes rögzítéséhez keretrendszert dolgozunk ki.
Az alábbiakban néhány kezdeti irányelvet ismertetünk, amelyeknek véleményünk szerint részét kell képezniük az élvonalbeli MI-modellek tanítására vonatkozó biztonsági érveléseknek. E bevált gyakorlatok a jelenlegi tapasztalatainkat tükrözik. Várakozásaink szerint tovább fejlődnek majd, ahogy folyamatosan finomítjuk a körültekintő fejlesztést szolgáló belső folyamatainkat. Azért osztjuk meg őket most, hogy átláthatóvá tegyük jelenlegi megközelítésünket, és visszajelzést kérjünk a közösségtől. Fontos, hogy ez a dokumentum az élvonalbeli modellek megerősítéses tanulására összpontosít; a belső és külső használat a szándékainkhoz való igazodás jóval több szempontjának mérlegelését igényli.
A biztonsági érveléseknek a technikai rendszer három területére kell kiterjedniük: a szándékainkhoz való igazodást célzó tanításra, az elszigetelésre és a megfigyelésre. E védelmi intézkedések segítenek biztosítani, hogy a modell ne próbáljon a szándékainktól eltérően cselekedni; ha mégis megtenné, nehezen tudjon kitörni az elszigetelt környezetből, és a megfigyelés még a károkozás előtt észlelje ezt.
A modellek igazodása a szándékainkhoz: Az első védelmi vonal az legyen, hogy a modelleket a szándékainkhoz való igazodásra tanítjuk, vagyis arra, hogy megbízhatóan az általunk kívánt módon cselekedjenek. Ez a következőket foglalhatja magában:
Tanítási környezetek és pontozás: Csökkentsük annak kockázatát, hogy a modellekben a szándékainktól eltérő viselkedés alakuljon ki: akadályozzuk meg, hogy a jutalmazási rendszer kijátszása pozitív megerősítést kapjon a tanítás során. Ez a következőket foglalhatja magában:
Az adatkészletek automatizált felülvizsgálata: Ügynökökkel keressük meg és javítsuk ki azokat a hibás megerősítéses tanulási környezeteket, amelyekben a szándékainktól eltérő cselekvéssorok a kívánt viselkedés helyett hibák kihasználásával is magas jutalmat kaphatnak. Így kevesebb lehetőség lesz az eltérő viselkedés megerősítésére a tanítás során.
Az adatkészletek kézi felülvizsgálata: Egészítsük ki az automatizált támadásszimulációt az adatkészletek kézi felülvizsgálatával és minőségellenőrzésével, hogy azonosíthassuk azokat a hibás feladatokat, amelyek akaratlanul is megerősíthetik a szándékainktól eltérő viselkedést.
A pontozók hangolása: Hangoljuk úgy a pontozókat, hogy büntessék a modell azon kísérleteit, amelyekkel a tanítás során a megerősítéses tanulási környezetek hibáit próbálja kihasználni, vagy magukat a környezeteket próbálja kijátszani.
Korábbi futások elemzése: Futtassunk osztályozókat a korábbi kísérletek végrehajtási naplóin, hogy ellenőrizzük, a pontozók a tervezett módon működnek-e.
A szándékainkhoz való igazodás mérése: Végezzünk olyan értékeléseket, amelyek nyomon követik a modell hajlamát a szándékainktól eltérő működésre, és így mérik az igazodást célzó tanítás hatékonyságát. Ez a következőket foglalhatja magában:
Offline igazodási értékelések: Az élvonalbeli modellek tanítási futásai során értékeljük a szándékainkhoz való igazodást, hogy megállapíthassuk, a tanítás a tervek szerint működik-e, és vizsgáljunk ki minden jelentős visszaesést.
Visszamenőleges tesztelés: Teszteljük az igazodási értékeléseket korábbi incidenseken, hogy megerősítsük: felismerik a korábban a szándékainktól eltérően működő modelleket, és nincsenek túlzottan konkrét incidensekre illesztve.
Az értékelések kijátszásának követése: Kövessük nyomon a viselkedés megváltozását előidéző értékeléstudatosságot és a teszthelyzetre építő stratégiákat (amikor a modellek felismerik, hogy tesztelik őket), konkrét leállítási küszöbértékekkel. Például kapcsoljuk be ezek megfigyelését az igazodási értékelések során.
A legrosszabb esetre irányuló stressztesztek: Váltsuk ki a lehető legsúlyosabb helytelen viselkedést, és ellenőrizzük, hogy legalább egy értékelés képes lenne észlelni azt.
A gondolatmenet alapján történő tanítás megakadályozása: A megerősítéses tanulás során ne engedjük, hogy az automatizált pontozók lássák a gondolatmenetet, nehogy a modellek megtanulják kijátszani a gondolatmenetet figyelő rendszereket.
Elszigetelés: Legyen elég erős a védett futtatókörnyezet és a biztonsági védelem ahhoz, hogy megakadályozza a káros cselekvéseket, ha a modell a szándékainktól eltérően kezd működni. Ez a következőket foglalhatja magában:
Többrétegű infrastruktúra-védelem: Fordítsunk jelentős erőforrásokat mind a modell védett futtatókörnyezetének, mind az azt befogadó kutatási infrastruktúrának a megerősítésére, hogy a modell kitörése esetén is legyen egy további védelmi rétegünk.
Az elszigetelés támadásszimulációja: Javítsuk a védett futtatókörnyezet, a kutatási infrastruktúra és a rendszerhatárok biztonságát ismételt támadásszimulációval. Ehhez – biztonsági elemzés alapján – használjuk az élvonalbeli tanítási futások köztes modellállapotait a hiányosságok feltárására és megszüntetésére. Végezzünk támadásszimulációt minden olyan szolgáltatáson is, amellyel a modell a tanítás során kapcsolatba kerülhet (például az internetes gyorsítótáron).
Minták közötti kommunikáció: A nagy sávszélességű, minták közötti kommunikációt korlátozzuk a jóváhagyott csatornákra, például a többügynökös eszközökre. Zárjuk le az infrastruktúra nagy sávszélességű, az ügynökök számára könnyen felfedezhető mellékcsatornáit.
Módosíthatatlan átiratok: Minden megerősítéses tanulás, értékelés és belső használat esetében mentsük az ügynökök átiratait észszerű időtartamra módosíthatatlan formában (például egyszer írható tárhelyfiókokba). Ez megbízható incidensvizsgálatot tesz lehetővé, és megelőzi a véletlen módosításokat.
Megfigyelés: Ha a modellek a szándékainktól eltérően kezdenek cselekedni, legyen élő megfigyelőrendszer, amely észleli a lehetséges eltéréseket, és lehetővé teszi a kiemelt problémák gyors kezelését, még egy súlyos incidens bekövetkezése előtt. Ez a következőket foglalhatja magában:
A megfigyelhetőség biztosítása: Biztosítsuk, hogy a modellek továbbra is megfigyelhetők maradjanak. Ezt egyértelmű küszöbértékekkel mérjük a megfigyelhetőséget és a megfigyelés kijátszását vizsgáló értékeléseken, hogy az aggasztó viselkedést korán észlelhessük.
Az ismert problémák magas felismerési aránya: Biztosítsuk, hogy a megfigyelőrendszer egy elkülönített értékelési adatkészleten magas arányban felismerje a korábbi incidenseket.
A megfigyelőrendszerek értékeléseinek naprakészen tartása: Az új futásokhoz készítsünk a teljesen új kockázatokat tükröző értékelési adatpontokat, hogy a megfigyelőrendszer felismerési arányának és pontosságának mérőszámai ne avuljanak el.
Gyors reagálás: Vezessünk be olyan kiemelt riasztásokat, amelyek egy meghatározott SLA-n belül intézkedést váltanak ki, még mielőtt a modell kárt okozna: akár egy ügyeletes riasztásával, akár az érintett futás automatikus felfüggesztésével. Például nappal értesítsük a biztonsági ügyeletest és a futás felelősét az incidensekről, éjjel pedig automatikusan függesszük fel a futásokat, ha a riasztásokat nem nyugtázzák.
A műszaki védelmi intézkedésekre vonatkozó ajánlások mellett az élvonalbeli MI-modellek tanítási futásainak biztonsági érveléséhez is dolgozunk ki bevált működési gyakorlatokat. Ezek közé tartozhatnak:
Ellenvélemények (előzetes hibaelemzések): A biztonsági érvelés tervezetének elkészülte után egy másik csapat tagja írjon ellenvéleményt, amely feltárja az érvelés esetleges hiányosságait, és reális kockázatértékelést ad. A tanítást végző csapat ezután reagáljon a felvetésekre, hogy megalapozottabbá váljon a biztonsági érvelés.
Jóváhagyások: A biztonsági érvelést a felső vezetés tagjai vizsgálják felül, és mindegyiküknek legyen vétójoga a futással szemben. Így a futás többszörös belső ellenőrzésen megy át (például a kutatási szervezet vezetője vagy a kutatási alelnök, a biztonsági vezető és a tudományos főmunkatárs részéről).
Elszámoltathatóság: A tanítási futásért felelős felső vezető (például a kutatási szervezet vezetője vagy a kutatási alelnök) legyen elszámoltatható a biztonsági érvelésért és az esetleges incidensek kezeléséért, többek között a teljesítményértékelések során is. Ez a tanítást végző csapatokat is arra ösztönzi, hogy előmozdítsák a biztonságot és a szándékainkhoz való igazodást.
Felfüggesztés: Ha a biztonsági érvelést érvénytelenítő problémákra derül fény (például új biztonsági hibára), álljanak rendelkezésre eljárásrendek, műszaki kontrollok és szolgáltatásiszint-megállapodások (SLA-k) az érintett futások felfüggesztésére.
Belső átláthatóság: A biztonsági érveléseket hozzáférhetővé kell tenni a belső felügyeleti csoportok (például a Biztonsági és Védelmi Bizottság) számára.
Auditok: Az auditorok kapjanak elegendő hozzáférést ahhoz, hogy ellenőrizhessék a biztonsági érvelés állításainak érvényességét és megalapozottságát, és jelezhessék az esetleges hiányosságokat.
Eszkaláció: Legyen egyértelmű eljárás a szándékainktól eltérő működés magasabb szintre történő jelzésére, a súlyossági szinteket meghatározó táblázattal és kijelölt ügyelettel. Az ügyelet riaszthassa a vezetőket (például a vezérigazgatót), ha egy futás során a probléma elér egy adott súlyossági szintet.
Műszaki kontrollok: Az emberek és az ügynökök számára egyaránt legyen nehéz a követelményeknek nem megfelelő futásokat indítani. A biztonsági funkciók, például a megfigyelés és az automatikus felfüggesztés, hiba esetén tiltsák le a működést. Például ne lehessen futásokat indítani megfelelő megfigyelés nélkül, sem a megfigyelést kikapcsolni a megerősítéses tanulás, az értékelés vagy a belső használat során, magából a környezetből.
Visszaállíthatóság: Legyen könnyű azonosítani a szándékainktól eltérően működő modell minden további felhasználását a tanítási folyamatban (például adatgenerálás vagy pontozás), hogy szükség esetén vissza lehessen vonni az ilyen kimenetek hatását.
A fennmaradó kockázatok teljes körű feltárása: A biztonsági érvelések a lehető legteljesebben sorolják fel azokat a fennmaradó kockázatokat, amelyekre a már bevezetett kockázatcsökkentő intézkedések nem terjednek ki. Ez teszi lehetővé a kockázatok elfogadásáról szóló megalapozott döntéseket.
Ezek a jelenlegi ajánlásaink, amelyek bevezetése folyamatban van az OpenAI-nál. Arra számítunk, hogy gyakorlataink a következő hetekben tovább fejlődnek.
Bevált gyakorlatokat dolgozunk ki az MI szándékainktól eltérő működéséből eredő súlyos incidensek kivizsgálására is. A kutatólaborok törekedjenek arra, hogy minél többet tanuljanak az egyes incidensekből, és így megelőzhessék az újabb hasonló eseteket – ahogyan más, nagy kockázatú iparágak vizsgálati gyakorlatai(új ablakban nyílik meg) is ezt szolgálják. Ilyen intézkedések lehetnek például:
Belső átláthatóság: Mivel a vizsgálatok lezárása jelentős időt vehet igénybe, az incidensvizsgálatok állásáról rendszeresen be kell számolni a szervezeten belül (például a folyamatban lévő vizsgálatokról naponta). A munkatársaknak legyen meghatározott eljárásuk a bővebb hozzáférés igénylésére, beleértve a nyers átiratokat és a szándékainktól eltérően működő modellekből való mintavételezést, amennyiben ez biztonságos és a munkájukhoz releváns.
A szándékainktól eltérő működés kiváltó oka: A kutatók tárják fel a tanítás dinamikájában rejlő kiváltó okokat (például célzott ablációs vagy újramintavételezési kísérletekkel), hogy megértsék, hogyan alakultak ki az eltérő viselkedésformák. Ez segít a jelenség tudományos megértésében és jövőbeli megelőzésében.
Utólagos elemzés: Működési és szervezeti kulturális szempontból is elemezni kell az incidenst, hogy minden hozzájáruló okot megértsünk – például azt, miért alakultak ki a problémák, és miért nem észlelték vagy jelezték őket magasabb szinten az incidens előtt.
Észlelés: Olyan módszereket kell kidolgoznunk a szándékainkhoz való igazodás tesztelésére, amelyek képesek feltárni az incidens előidézésére való hajlamot anélkül, hogy közvetlenül az incidensből származó információk (például átiratok vagy incidens-összefoglalók) alapján optimalizálnánk őket. Az incidensekből származtatott értékeléseket „regressziós tesztként” kell létrehozni, hogy a jövőbeli modellek nagyon hasonló helyzetekben ne mutassanak hajlamot a szándékainktól eltérő működésre.
Nyilvános tájékoztatás: A vizsgálat lezárását követően a vizsgálati eredményeket, az utólagos elemzéseket és a működési változtatásokat nyilvánosságra kell hozni. Az érintett harmadik feleket a lehető leghamarabb értesíteni kell.


