Preskočiť na hlavný obsah
OpenAI

Incident v Hugging Face a ďalšie dôsledky nesprávne zosúladených modelov pre tretie strany

S rastúcimi schopnosťami a autonómiou systémov umelej inteligencie sa môže nesprávne zosúladené správanie pretaviť do závažných krokov v reálnom svete vrátane kybernetických incidentov a ďalších dôsledkov, ktoré vývojári nemuseli predvídať. Pochopenie toho, ako takéto správanie vzniká a stupňuje sa a ako ho odhaliť a reagovať naň, je preto čoraz dôležitejšou súčasťou bezpečného vývoja a nasadzovania pokročilých systémov umelej inteligencie.

Incident v Hugging Face sme spočiatku chápali najmä ako bezpečnostný problém, keďže zahŕňal narušenie na úrovni platformy. Naďalej ide o najzávažnejšiu aktivitu tohto druhu, akú sme doteraz pri našich modeloch identifikovali, pričom ju spôsoboval najmä veľmi schopný interný výskumný model. Odvtedy sme zistili, že tento prienik spôsobili modely, ktoré sa pri riešení náročných úloh uchýlili k nesprávne zosúladeným stratégiám, ako uvádza technická správa o incidente v Hugging Face. Kybernetické incidenty sú jedným z prejavov tohto rizika. Nesprávne zosúladenie môže viesť aj k inému neočakávanému či znepokojujúcemu správaniu mimo tradičných bezpečnostných kategórií, napríklad keď naše modely zverejňujú obsah na lokalitách tretích strán. Takéto správanie označujeme ako „spam agentov“. Musíme riešiť oboje.

Pokračovali sme v skúmaní širšieho spektra aktivít, pričom sme uprednostňovali závažnejšie incidenty a postupne záber rozšírili aj na menej závažné nesprávne zosúladené aktivity vrátane spamu agentov.

Táto stránka zhromažďuje naše správy a novinky o incidente v Hugging Face, súvisiacom výskume a verejných prezentáciách, ďalších identifikovaných aktivitách, našich poznatkoch o úlohe nesprávneho zosúladenia modelov a opatreniach, ktorými posilňujeme svoje systémy. Túto stránku budeme aktualizovať podľa toho, ako budú naše vyšetrovania pokračovať.


Aktivity ovplyvňujúce tretie strany

Aby sme lepšie pochopili rozsah tohto neočakávaného správania, vykonávame rozsiahlu kontrolu internetových aktivít našich modelov počas trénovania a hodnotenia. V rámci kontroly priebežne identifikujeme a informujeme tretie strany, pričom začíname prípadmi, keď:

  • Naše modely mohli obísť bezpečnostné kontroly tretej strany alebo narušiť dostupnosť online služby; alebo

  • Prípady nesprávneho zosúladenia negatívne ovplyvnili webové lokality alebo služby tretích strán.

Na základe doterajšej kontroly sme podľa uvedených kritérií informovali desiatky tretích strán. Kontrola minulých aktivít pokračuje a bude si vyžadovať veľa času a zdrojov. S pokračovaním tejto práce budeme informovať ďalšie tretie strany.

Nižšie zverejňujeme anonymizované súhrny opisujúce druhy pozorovaných nesprávne zosúladených aktivít. Tieto opisy budeme aktualizovať, keď budeme informovať ďalšie tretie strany a prehlbovať svoje poznatky. Budeme tiež zverejňovať relevantné informácie o stave kontroly. V prípade potreby budeme spravidla vynechávať mená a ďalšie identifikačné údaje, aby sme chránili dotknuté strany. Informované strany sa však môžu rozhodnúť údaje, ktoré im poskytneme, zverejniť.

Súhrny pozorovaných aktivít

Doterajšia kontrola a proces oznamovania identifikovali tieto kategórie aktivít:

  • Obídenie riadenia prístupu: Agenti získajú prístup k informáciám alebo funkciám, ktoré bežne vyžadujú overenie totožnosti, konkrétne povolenie, predplatné alebo účet. Agent napríklad použil inú webovú adresu, zmenil údaje v požiadavke alebo využil prihlasovaciu reláciu, ktorá mu poskytla väčší prístup, než sa očakávalo.

  • Použitie odhalených prihlasovacích údajov: Agenti našli verejne sprístupnené prihlasovacie údaje alebo prístupové kľúče a použili ich na prístup k službe.

  • Vloženie dotazu alebo príkazu: Agenti zadali na webovej lokalite alebo v službe text, ktorý služba vyhodnotila ako pokyn namiesto bežného vstupu. Služba tak mohla spustiť databázový dotaz, kód aplikácie alebo príkaz na svojom serveri.

  • Prístup k interným častiam spusteného prostredia: Agenti čítali súbory obsahujúce implementáciu služby alebo komunikovali so systémom na pozadí určeným na interné použitie. V týchto prípadoch sa agent dostal do častí služby mimo rámca zamýšľaného prístupu.

  • Spam agentov: Agenti zverejňujú informácie na lokalitách tretích strán, čím môžu meniť ich obsah a vyvolať potrebu nápravy, napríklad keď používajú verejné wiki stránky ako spoločné nástenky.


Časová os udalostí

September

August

Júl