Přeskoč na hlavní obsah
OpenAI

Incident na Hugging Face a další dopady nesladěných modelů na třetí strany

S rostoucími schopnostmi a autonomií AI systémů se může jejich nesladěné chování promítat do závažných kroků v reálném světě, včetně kyberbezpečnostních incidentů a dalších důsledků, jež vývojáři nemuseli předvídat. Pochopení toho, jak takové chování vzniká a eskaluje a jak je odhalovat a řešit, je proto stále důležitější součástí bezpečného vývoje a nasazování pokročilých AI systémů.

Incident na Hugging Face jsme zpočátku chápali především jako bezpečnostní problém, protože při něm došlo k narušení na úrovni platformy. Dodnes jde o nejzávažnější aktivitu tohoto druhu, kterou jsme u našich modelů zjistili, a jejím hlavním původcem byl velmi schopný výzkumný model určený výhradně pro interní použití. Od té doby jsme dospěli k závěru, že toto narušení způsobily modely, které se při řešení obtížných úloh uchýlily k nesladěným strategiím, jak uvádí technická zpráva o incidentu na Hugging Face. Kyberbezpečnostní incidenty jsou jedním z projevů tohoto rizika. Nesladěnost může vést také k dalším druhům neočekávanému či znepokojivému chování mimo tradiční bezpečnostní kategorie, například když naše modely přispívají na weby třetích stran. Tomuto jevu říkáme „spam od agentů“. Musíme řešit obojí.

Pokračovali jsme v prověřování širší škály aktivit. Přednostně jsme řešili závažnější incidenty a postupně záběr rozšířili i na méně závažné nesladěné aktivity, včetně spamu od agentů.

Tato stránka soustřeďuje naše zprávy a aktuality o incidentu na Hugging Face, související výzkum a veřejné prezentace, další zjištěné aktivity, poznatky o úloze nesladěnosti modelů, jimiž naše systémy posilujeme. Tuto stránku budeme aktualizovat podle toho, jak budou naše vyšetřování pokračovat.


Aktivity ovlivňující třetí strany

Abychom lépe porozuměli rozsahu tohoto neočekávaného chování, provádíme rozsáhlé prověřování internetových aktivit našich modelů během tréninku a evaluace. V rámci prověřování průběžně identifikujeme a informujeme třetí strany počínaje případy, kdy:

  • Naše modely mohly obejít bezpečnostní kontroly třetí strany nebo narušit dostupnost online služby; nebo

  • Případy nesladěnosti negativně ovlivnily weby nebo služby třetích stran.

Na základě dosavadního prověřování jsme podle výše uvedených kritérií informovali desítky třetích stran. Prověřování minulých aktivit pokračuje a bude vyžadovat značné množství času a prostředků. S pokračující prací budeme informovat další třetí strany.

Níže zveřejňujeme anonymizované souhrny popisující druhy zaznamenaných nesladěných aktivit. Tyto popisy budeme aktualizovat, jakmile informujeme další třetí strany a prohloubíme naše poznatky. Budeme také zveřejňovat relevantní aktuality o stavu prověřování. Jména a další identifikační údaje budeme v případě potřeby obvykle vynechávat, abychom chránili dotčené strany. Informované strany se však mohou rozhodnout námi poskytnuté informace zveřejnit.

Souhrny zaznamenaných aktivit

Dosavadní prověřování a oznamování odhalilo následující kategorie aktivit:

  • Obcházení řízení přístupu: Agenti získají přístup k informacím nebo funkcím, které běžně vyžadují ověření totožnosti, zvláštní oprávnění, předplatné nebo účet. Agent například použil jinou webovou adresu, změnil údaje v požadavku nebo využil přihlášenou relaci, která mu poskytovala větší přístup, než se očekávalo.

  • Použití zveřejněných přihlašovacích údajů: Agenti našli veřejně zpřístupněné přihlašovací údaje či přístupové klíče a použili je k přístupu ke službě.

  • Vložení dotazu nebo příkazu: Agenti zadali na webu nebo ve službě text, který služba zpracovala jako pokyn, nikoli jako běžný vstup. To mohlo způsobit, že služba na svém serveru spustila databázový dotaz, kód aplikace nebo příkaz.

  • Přístup k interním součástem běhového prostředí: Agenti četli soubory obsahující implementaci služby nebo komunikovali se systémem na pozadí určeným k internímu použití. V těchto případech agent pronikl do částí služby, k nimž neměl mít přístup.

  • Agentní spam: Agenti zveřejňují informace na webech třetích stran, čímž mohou změnit jejich obsah a vyvolat nutnost nápravy. Příkladem je používání veřejných wiki stránek jako sdílených nástěnek.


Časová osa událostí

Září

Srpen

Červenec