Náš rámec pro hlášení nesouladu modelů
Představujeme nový rámec OpenAI pro sledování, vyšetřování a zveřejňování případů nesouladu modelů spolu se šesti zprávami o neočekávaném či znepokojivém chování modelů, které jsme zaznamenali za posledních šest měsíců.
Abychom lépe informovali výzkumníky, vývojáře AI, tvůrce politik i širokou veřejnost, snažili jsme se již dříve zveřejňovat naše poznatky o nesouladu. Bez systematického přístupu k hlášení těchto poznatků však byla naše zveřejnění nepravidelná a méně častá, než by bylo vhodné. Často jsme čekali, až budeme moci spojit několik případů do jedné zprávy, nebo jsme je přidávali do systémových karet nově vydaných modelů. Tento nový rámec má urychlit zveřejňování zpráv o nesouladu po jeho zaznamenání, i když jsme popisované chování dosud úplně nevysvětlili ani nezmírnili.
S rostoucí vyspělostí a rozšířením systémů AI potřebujeme dosáhnout širšího a informovanějšího konsenzu o pokroku ve výzkumu sladění. Nevěříme, že odvětví AI vyřešilo sladění a monitorování natolik, aby bylo možné ještě dlouho odpovědně pokračovat ve škálování nejvyšší rychlostí. Rozhodování o tom, jak by měl vývoj AI v příštích měsících a letech pokračovat, se musí opírat o důkazy, které mohou sami posoudit i lidé mimo společnosti vyvíjející průkopnické modely.
Příklady nesouladu mohou pomoci odhalit problémy, s nimiž se mohou setkat další vývojáři AI, až jejich systémy dosáhnou podobných schopností, poukázat na slabiny ochranných opatření nebo zpochybnit předpoklady o chování modelů. Sdílení těchto poznatků umožňuje ostatním zkoumat stejné problémy, ověřovat naše vysvětlení a zlepšovat opatření ke zmírnění rizik. Protože považujeme transparentnost ohledně nesouladu za důležitou, náš nový rámec upřednostňuje zveřejnění i tehdy, když význam případu není jistý. Některé zveřejněné případy se tedy mohou ukázat jako nahodilé, bez souvislosti s širším vzorcem či budoucím vývojem.
V současnosti neexistuje jednotný oborový rámec s výslovnými standardy, podle nichž by měli vývojáři AI zveřejňovat příklady nesouladu ve svých modelech. Doufáme, že dnes představený rámec bude prvním krokem k vytvoření takových standardů a stanoví, které případy nesouladu by měli vývojáři zveřejňovat a co by jejich zprávy měly obsahovat. Tento rámec považujeme za rozpracovaný a budeme jej zdokonalovat na základě zkušeností a zpětné vazby veřejnosti.
Zde popisujeme, jak bude rámec fungovat, a sdílíme první zveřejňované zprávy.
Chceme zveřejňovat příklady, které přinášejí užitečné důkazy o tom, jak nesoulad modelů vzniká, jak se projevuje a kde ochranná opatření fungují či selhávají. Upřednostňujeme nové mechanismy, významné změny známého chování a zjištění, která zpochybňují předpoklady o bezpečnosti nebo opatřeních ke zmírnění rizik. Aby případ stál za zveřejnění, nemusí způsobit újmu ani dokládat širší vzorec. Tento rámec se bude vztahovat na příslušné chování v celém životním cyklu modelu, včetně trénování, vyhodnocování, testování a nasazení.
Patří sem nové způsoby, jimiž mohou modely jednat bez oprávnění, koordinovat se s jinými modely nebo unikat dohledu; selhání zpochybňující metodu sladění či ochranné opatření; a chování, které odporuje tvrzení ve zveřejněném posouzení bezpečnosti. Stejná kritéria zveřejnění platí i pro nesoulad, který může mít dopad na třetí strany.
Může jít také o případy nesouladu, které se zdají opakovat již dříve zveřejněné případy. Samotné opakování problému může být užitečným důkazem o chování našich modelů nebo účinnosti našich ochranných opatření, například pokud se určitý druh nesouladného chování vrací navzdory opakovaným snahám o jeho zmírnění. Za těchto okolností zveřejníme další příklady aktualizací původního oznámení o nesouladu.
Postupem času plánujeme společně s dalšími vývojáři, externími výzkumníky, oborovými normalizačními orgány a regulačními úřady vytvořit objektivnější kritéria zveřejňování. Domníváme se také, že závažné incidenty týkající se bezpečnosti, zabezpečení a nesouladu by měly být hlášeny federální vládě USA, a pracujeme na návrhu mechanismů hlášení. Tento rámec považujeme za doplněk našich stávajících povinností. Nenahrazuje zákonné požadavky na zveřejňování informací, včetně požadavků týkajících se kritických bezpečnostních incidentů nebo narušení kybernetické bezpečnosti.
Při příležitosti zavedení našeho nového rámce pro zveřejňování nesouladu vydáváme šest zpráv o případech nesouladného chování, které jsme zaznamenali při trénování nebo vyhodnocování našich modelů. Tyto případy ilustrují různá chování, která podle nás stojí za zveřejnění, od zatajování informací uživateli až po nepovolené jednání s cílem překonat překážky. Jde o zprávy o jednotlivých případech, a nelze je proto považovat za ukazatel četnosti nesouladu u našich modelů. Každá položka níže odkazuje na úplnou zprávu.
Samovolně vytvořené pokyny v souhrnech úloh(otevře se v novém okně). Nevydaný výzkumný model vložil do souhrnů používaných k pokračování práce v novém kontextovém okně nesouvisející pokyny, včetně pokynů, aby ignoroval svá běžná omezení. Zjistili jsme 27 dotčených souhrnů.
Pokyny k zatajování chyb v souhrnech úloh(otevře se v novém okně). Během trénování modelu GPT‑5.6 Sol přidávala řada instancí modelu do svých souhrnů pokyny, aby před uživatelem zatajily chyby nebo nesouladné chování. Souhrny kompakce například obsahovaly pokyny, aby si model vymyslel chybějící historická data, aniž by to uvedl, a skryl nesoulad verzí zdrojů.
Vyhledávání odhalených klíčů API ve veřejných úložištích a následné vymýšlení informací(otevře se v novém okně). Při odpovídání na běžný dotaz ohledně údajů o příjmech v jednom kalifornském okrese model našel a bez oprávnění použil odhalený klíč API. Když ani potom nedokázal požadované údaje získat, vymyslel si je a vydával je za data z požadovaného zdroje.
Nahrávání souborů na internet za účelem jejich citování(otevře se v novém okně). Když uživatel požádal nevydaný model o identifikátory a názvy jezer větších než 5 000 000 metrů čtverečních, agent našel správnou odpověď pomocí Pythonu. Protože však pokyny vyžadovaly citaci z prohlížeče, agent se bez souhlasu uživatele rozhodl soubor nahrát, aby jej mohl ve své odpovědi citovat.
Nepovolené zápisy a komunikace prostřednictvím interního softwarového úložiště(otevře se v novém okně). Modely při hledání chybějících vstupních souborů používaly interní softwarové úložiště jako nástěnku k výměně požadavků a odpovědí mezi oddělenými trénovacími vzorky. Soubory se jim však obnovit nepodařilo. Zpráva zkoumá také dřívější případ, kdy model při pokusu obejít síťová omezení úspěšně nahrál testovací soubory do úložiště.
Nepovolené sdílení souborů mezi spolupracujícími agenty(otevře se v novém okně). Agenti, kteří společně pracovali na stejné trénovací úloze, použili veřejné weby pro hostování souborů ke sdílení dat, když nemohli přistupovat k místním souborům ostatních agentů. Výstupy úlohy tak byly dostupné na veřejných adresách URL, přestože zadání vyžadovalo, aby modely používaly pouze místní soubory.
Kterýkoli zaměstnanec OpenAI může upozornit naše týmy pro bezpečnost a sladění na případ nesouladu, požádat o jeho prošetření a navrhnout jeho veřejné zveřejnění. Tím se zahájí náš proces zveřejňování, který pro každý krok stanoví lhůty, aby vyšetřování a zveřejnění proběhly včas.
Po nahlášení případu naši techničtí pracovníci prošetří, co se stalo, co zůstává nejisté, zda je veřejné zveřejnění opodstatněné a které skutečnosti lze sdílet. Posoudí také, zda byla dotčena třetí strana a zda ji musíme před zveřejněním informovat neveřejně.
Případ bude následně zařazen do jednoho ze tří režimů: Připraveno ke zveřejnění, Menší vyšetřování nebo Rozsáhlejší vyšetřování („pomalý režim“).
Režim Připraveno ke zveřejnění zahrnuje příslušné případy, jejichž vyšetřování je natolik dokončené, že je lze po kontrole zveřejnit. Režim Menší vyšetřování zahrnuje případy, které vyžadují další technické prošetření. Očekáváme, že do těchto dvou režimů bude spadat naprostá většina zveřejňovaných případů, zejména těch, které nevyžadují rozsáhlé vyšetřování, koordinaci s třetími stranami ani řešení závažných rizik zneužití. Všechny dnes zveřejňované případy spadají do jednoho z těchto dvou režimů.
Režim Rozsáhlejší vyšetřování zahrnuje složitá šetření, zejména ta, do nichž jsou zapojeny třetí strany. Pokud je dotčena třetí strana, mají naše povinnosti v oblasti zabezpečení, práva a odpovědného zveřejňování přednost před tímto rámcem. První oznámení se budeme snažit zveřejnit co nejdříve, ale z bezpečnostních důvodů je můžeme odložit, například pokud model objeví dosud neznámou zranitelnost v široce používaném softwaru. Pokud by zpráva identifikovala třetí stranu, chceme ji předem informovat i tehdy, když nedošlo k překonání žádné bezpečnostní hranice.
První oznámení případu v režimu Rozsáhlejší vyšetřování obecně popíše, co se stalo, uvede, zda s vyšetřováním pomáhají externí odborníci, a poskytne dostupný odhad, kdy očekáváme zveřejnění závěrečné zprávy. Pokud by byl incident OpenAI na platformě Hugging Face zveřejněn podle tohoto rámce, spadal by do tohoto režimu.
Zaměstnance, který na daný případ upozornil, budeme informovat o rozhodnutí, zda jej zveřejnit, a pokud ano, v jakém režimu se bude řešit. Nevyřešené neshody ohledně zveřejnění nebo vhodného režimu budou postoupeny Poradní skupině pro bezpečnost společnosti OpenAI (SAG), kterou tvoří vedoucí pracovníci z celé společnosti. Tato skupina posuzuje schopnosti průkopnických modelů a ochranná opatření, dohlíží na náš rámec připravenosti a poskytuje doporučení vedení OpenAI. Neshody uvnitř SAG nebo námitky zaměstnanců proti jejím rozhodnutím budou postoupeny vedení OpenAI. Rozhodnutí případ nezveřejnit nebo závěr, že zveřejnění není opodstatněné, budou sděleny vedoucím pracovníkům pro bezpečnost a sladění a v možné míře také příslušným technickým pracovníkům.
Tento proces zveřejňování můžeme na základě zkušeností z praxe upravit. Veškeré změny zaznamenáme v tomto příspěvku.
Každá úplná zpráva popíše pozorované chování, jeho závažnost a případné vnější dopady, prostředí, v němž k němu došlo, datum nebo období výskytu, kdy jsme je odhalili, a v obecné rovině také příslušný model či modely. Pokud to bude možné, uvedeme také:
Další podrobnosti o tom, co se stalo, a o případné následné újmě;
Jak jsme nesoulad odhalili a jaký byl rozsah našeho vyšetřování;
Náš výklad důsledků pro výzkum sladění a technickou bezpečnost AI;
Důležité nezodpovězené otázky, které daný případ vyvolal;
Opatření, která přijímáme nebo plánujeme přijmout k nápravě tohoto chování. Tyto informace nemusí být v době zveřejnění vždy dostupné, protože zprávu o nesouladu můžeme vydat ještě před dokončením vyšetřování nebo vytvořením nápravy.
U nesouladu, k němuž dojde při nasazení u zákazníků, zveřejníme tolik informací, kolik nám dovolí ochrana soukromí zákazníků a naše smluvní závazky.
Dnešní zprávy představují první soubor zveřejněných případů, nikoli úplný přehled známých nesouladů nebo probíhajících vyšetřování. Tyto první zprávy nemají představovat úplné rozpětí ani závažnost případů, na něž se tento rámec vztahuje. Zavazujeme se zveřejňovat případy nesouladu, které splňují kritéria tohoto rámce, včetně složitějších případů vyžadujících delší vyšetřování nebo koordinaci s třetími stranami. Zprávy budeme podle tohoto rámce zveřejňovat průběžně a s dalším rozvojem našich závazků budeme poskytovat další informace o plánovaném rozsahu hlášení.


