Přeskoč na hlavní obsah
OpenAI

22. září 2026

Bezpečnost

Priority a zásady účinného externího posuzování

Načítání…

Průkopnické laboratoře AI nesou obrovskou odpovědnost za bezpečné trénování, hodnocení a nasazování modelů. Externí posuzování je nezbytnou součástí vyvažování této odpovědnosti: rozšiřuje možnosti vyjádřit se k bezpečnosti AI, informuje světovou veřejnost a zajišťuje, aby se laboratoře zodpovídaly z jasných a nezávisle podložených bezpečnostních tvrzení.

V rámci naší snahy držet krok s průkopnickým vývojem se OpenAI zavazuje podporovat nezávislá posouzení rozsáhlým přístupem k trénování, hodnocení a nasazení. Tento přístup by měl hodnotitelům umožnit zpochybňovat naše předpoklady, odhalovat rizika, která jsme mohli přehlédnout, a dospět k vlastním závěrům o účinnosti našich ochranných opatření.

Dlouhodobě spolupracujeme s externími hodnotiteli v různých fázích vývoje a nasazování modelů. Externí posuzování jsme rovněž začlenili do postupů našeho rámce připravenosti a podpořili organizace a právní předpisy, které prosazují důslednější proces s jasnou odpovědností. V rámci této spolupráce jsme poskytli rozsáhlý přístup, mimo jiné k informacím o našich technických ochranných opatřeních, k viditelnému myšlenkovému řetězci a k bezprecedentnímu množství důvěrných dat i interním nasazením za účelem reakce na incidenty a red-teamingu monitorů. Zde uvedené priority a zásady se zaměřují na naši spolupráci s nezávislými hodnotícími organizacemi ze soukromého a neziskového sektoru při technickém posuzování bezpečnosti. Doplňují naši spolupráci s vládami na testování a hodnocení, kde mohou odlišné role a povinnosti vyžadovat jiné přístupy.

Účinné posuzování vyžaduje silné nezávislé mechanismy, vědeckou důslednost, robustní bezpečnostní postupy a jasně stanovenou odpovědnost. Laboratoře mají povinnost umožnit důkladnou kontrolu a současně chránit citlivé informace. Laboratoře a nezávislí hodnotitelé nesou společnou odpovědnost za správný postup a měli by se řídit společnými mezinárodními standardy bezpečnostních postupů. Níže navrhujeme čtyři prioritní oblasti pro hlubší posuzování a zásady důsledné, bezpečné a nezávislé práce.

Prioritní oblasti posuzování

Externí posuzování je nejužitečnější, když řeší konkrétní a závažné otázky: Podporují důkazy bezpečnostní dokumentace a bezpečnostní tvrzení laboratoře? Prověřují hodnocení dostatečně rizika, která mají měřit? Fungují ochranná opatření v realistických podmínkách?

Zde popsaná posouzení mají mít různé podoby podle zkoumaných bezpečnostních otázek. Předpokládáme, že budeme souběžně a v různých obdobích podporovat několik posouzení, z nichž některá potrvají týdny a jiná několik měsíců. Externí posuzování může být také součástí přípravy před nasazením a podkladem pro rozhodování o nasazení. Zde popsaná práce je však obecně dlouhodobější a nezávislá na konkrétním uvedení produktu; zaměřuje se na průběžné a důkladné zkoumání konkrétních bezpečnostních tvrzení.

V našich prioritních oblastech a zásadách používáme pojmy bezpečnostní tvrzení a bezpečnostní argumentace. Těmito pojmy rozumíme následující:

Bezpečnostní tvrzení: Konkrétní tvrzení o schopnostech, chování či ochranných opatřeních modelu nebo systému, které má význam pro jeho bezpečnost a lze je posoudit na základě důkazů. Tvrzení by mělo určit rizika a podmínky, jimiž se zabývá, a také příslušné předpoklady a omezení.

Bezpečnostní dokumentace: Strukturovaná a důkazy podložená dokumentace, která vysvětluje, proč jsou rizika modelu nebo systému při konkrétní činnosti, například trénování, hodnocení či nasazení, dostatečně řízena. Bezpečnostní dokumentace propojuje jednotlivá bezpečnostní tvrzení s důkazy, které je podporují, a výslovně uvádí předpoklady, nejistoty a zbývající rizika, jež by mohla ovlivnit její závěry.

Navrhujeme čtyři prioritní oblasti pro hlubší posuzování a zásady důsledné, bezpečné a nezávislé práce.

  1. Nezávislé posuzování bezpečnostní dokumentace zahrnující trénování, hodnocení a interní i externí nasazení.

    Posuzování bezpečnostní dokumentace vyžaduje odborné znalosti v oblasti slaďování, metod kontroly, jako je monitorování, kybernetické bezpečnosti, biologického a chemického zneužití a red-teamingu. Bezpečnostní dokumentace se skládá z tvrzení týkajících se mimo jiné trénování, hodnocení schopností a ochranných opatření. Lze ji posuzovat jako celek nebo po částech (viz priority 2 a 3 níže). Různé části dokumentace bude pravděpodobně muset zkoumat více hodnotitelů, z nichž každý využije svou odbornost. Jejich posouzení by společně měla zodpovědět například tyto otázky:

    1. Existují důkazy pro bezpečnostní dokumentaci týkající se trénování, hodnocení a nasazení řádně podloženy? Byly při trénování, hodnocení a nasazení dodrženy podmínky bezpečnostní dokumentace?

    2. Pokrývá naše bezpečnostní dokumentace nejnaléhavější rizika zjištěná během posuzování? Podporují bezpečnostní tvrzení celkovou bezpečnostní dokumentaci? Existují nějaké nedostatky nebo možnosti zlepšení?

    3. Používají se účinné metody k odhalování a omezování pobídek při trénování, které by mohly odměňovat klamání, hackování odměn, destruktivní jednání nebo obcházení omezení?

  2. Posuzování kritických ochranných opatření v interních i externích nasazeních

    Náš soubor ochranných opatření se neustále vyvíjí, aby odpovídal měnícím se schopnostem a prostředí. Naše ochranná opatření zahrnují trénování a interní i externí nasazení. V současnosti mezi ně patří ochranná opatření na úrovni modelu, opatření k prosazování pravidel a bezpečnostní opatření i monitory nesouladu. Pokrývají širokou škálu rizik, například ztrátu kontroly a zneužití v kybernetické, biologické a chemické oblasti. Technická partnerství mohou již nyní odhalovat slabiny ochranných opatření a zároveň zdokonalovat metody posuzování a urychlovat tvorbu standardů. Poskytnou tak pevnější technický základ budoucím veřejným politikám, které mají držet krok s průkopnickým vývojem, zejména u interních nasazení, kde jsou bezpečnostní standardy stále v počátcích.

    Nezávislá posouzení by měla zkoumat, nakolik tato ochranná opatření fungují a kde mohou selhávat, například:

    1. Jsou při přístupu typu „grey box“ ochranná opatření odolná vůči adversariálnímu testování (jailbreakům) a chrání dostatečně před navýšením schopností ve vysoce rizikových oblastech (např. kybernetické či biologické)? Pokrývá naše adversariální testování a red-teaming nejdůležitější rizika?

    2. Jak při autorizovaném testování v realistických provozních podmínkách agenti interagují s kybernetickou obranou, jako jsou řízení přístupu, sandboxing a systémy detekce a reakce? Které obranné mechanismy škodlivým činnostem zabraňují, odhalují je nebo je omezují a kde selhávají?

    3. Mají naše monitory nesouladu kritické nedostatky, které by u interních či externích nasazení mohly vést ke ztrátě kontroly nebo závažnému nesouladu? Nakolik je monitorování myšlenkového řetězce spolehlivým zdrojem důkazů o bezpečnosti či sladění s tím, jak se schopnosti modelů zlepšují?

    4. Je ve všech relevantních procesech trénování, hodnocení a nasazení zavedeno odpovídající monitorování způsobem, který nelze snadno deaktivovat?

    5. Jsou ochranná opatření zavedena úměrně schopnostem?

  3. Posuzování hodnocení schopností, která pokrývají kategorie rizik rámce připravenosti (chemická a biologická rizika, kybernetická bezpečnost, sebezdokonalování AI), a hodnocení sladění zaměřených na rizika nesouladu

    Náš rámec připravenosti vyžaduje hodnocení klíčových oblastí rizik nejvyspělejších technologií. S překračováním prahových hodnot a saturací hodnocení je důležité hodnocení schopností v rizikových oblastech rámce připravenosti průběžně aktualizovat a zajišťovat jejich rozsah a kvalitu. Totéž platí pro hodnocení sladění, která mají posuzovat rizika závažného nesouladu.

    Mezi relevantní otázky patří:

    1. Pokrývají hodnocení rizik rámce připravenosti dostatečně definici prahových hodnot těchto rizik? Jsou prahové hodnoty těchto hodnocení nastaveny správně?

    2. Aktualizují se hodnocení, když modely soustavně dosahují nejvyššího skóre, a měří nové testy smysluplně pokročilejší schopnosti?

    3. Pokrývají naše hodnocení sladění dostatečně rizika závažného nesouladu a která důležitá chování nebo podmínky mohou opomíjet?

  4. Nezávislé vyšetřování kritických incidentů nesouladu

    Nezávislé vyšetřování může být přínosné u celé řady kritických incidentů týkajících se bezpečnosti AI. Zde se zaměřujeme na nesoulad modelů, včetně situací, kdy modely jednají bez oprávnění nebo se vyhýbají dohledu. Ty mohou odhalit slabiny metod sladění a ochranných opatření i bez úmyslného zneužití.

    Za určitých okolností, jako v případě incidentu OpenAI na platformě Hugging Face, může být přínosné zapojit nezávislý externí subjekt do nezávislého vyšetřování incidentu nesouladu. Je zásadní, aby externí subjekty zapojené do vyšetřování incidentu disponovaly potřebnou odborností, případně včetně znalostí kybernetické forenzní analýzy a sladění, schopností rozsáhlé analýzy myšlenkových řetězců a dostatku pracovníků i zdrojů k včasnému provedení vyšetřování. Reakce na incident může vyžadovat přístup k citlivým interním datům i externím datům, takže zveřejnění či zpřístupnění některých podrobností může být citlivé. Zjištění nezávislého vyšetřování mohou rovněž přispět k bezpečnostní argumentaci modelu tím, že poskytnou důkazy pro posouzení tvrzení o jeho sladění a účinnosti opatření přijatých k nápravě dříve zjištěného nesouladu.

    V souvislosti s incidenty nesouladu upřednostňujeme nezávislá posouzení zaměřená na tyto otázky:

    1. K jakému chování modelu nebo problémům s nesouladem během incidentu došlo a které faktory k nim přispěly nejvíce?

    2. Dokázala by ochranná a nápravná opatření v budoucnu účinně zmírnit podobné incidenty?

Zásady účinného posuzování

  • Jasně vymezená a vzájemně odsouhlasená tvrzení k posouzení: Posuzování by mělo začít vzájemnou dohodou o rozsahu. Následně by měla být jasně stanovena bezpečnostní tvrzení, která se před zahájením posuzování předem zaregistrují. Externí subjekty a laboratoře by si měly vyjasnit, zda jde o tvrzení, která chce posuzovaná společnost předložit k posouzení, nebo o tvrzení, jež chce nezávisle posoudit externí hodnotitel a vůči nimž laboratoř souhlasí s posouzením. Některá tvrzení mohou být mimo rozsah posouzení z mnoha důvodů, včetně nemožnosti externích subjektů získat přístup k datům, nedostatečné odbornosti hodnotitele nebo přiměřených časových omezení v případě naléhavého posouzení. Laboratoře a hodnotitelé by měli zavést postup pro posuzování závažných rizik zjištěných mimo původní rozsah, včetně rozhodnutí, zda je namístě další šetření. Závěry by měly jasně uvádět, co v rámci vzájemně dohodnutého rozsahu posouzeno bylo a co nikoli.

  • Přiměřený přístup: Hodnotitelé by měli mít v mezích právních, bezpečnostních a duševněprávních omezení pokud možno přiměřený přístup potřebný k posouzení dohodnutých tvrzení. Pokud je přímý přístup nepraktický nebo nemožný, mohou hodnotitelé spolupracovat s určeným zástupcem společnosti nebo využít nepřímé mechanismy přístupu či mechanismy chránící soukromí, aby byly podkladové informace chráněny.

  • Transparentní metodika a standardy: Hodnotitelé by měli vysvětlit své metody, kritéria posuzování a nejistoty a tam, kde jsou k dispozici, vycházet ze zavedených standardů. Pokud standardy dosud neexistují, měli by jasně zdůvodnit použitá kritéria. Zprávy by měly rozlišovat přímá zjištění od jejich interpretace, vysvětlovat nejistotu a jasně uvádět, které závěry důkazy podporují.

  • Odbornost a nezávislost: Hodnotitelé by měli prokázat příslušnou technickou odbornost a identifikovat, zveřejnit a řešit střety zájmů organizací i jednotlivců, včetně finančních pobídek, vztahů s vývojáři a předchozího zapojení do posuzované práce. Ochranná opatření by měla zajistit, aby obchodní tlaky ani způsob odměňování neovlivňovaly zjištění. Mohou zahrnovat vyloučení dotčených osob nebo odpovídající ochranné lhůty.

  • Bezpečnost a důvěrnost: Hodnotitelé by měli prokázat zavedené postupy v oblasti informační bezpečnosti a vymahatelná opatření na ochranu důvěrnosti vztahující se na jejich pracovníky, a to v míře odpovídající citlivosti systémů a informací, k nimž získávají přístup. Tato opatření by měla zahrnovat ochranu duševního vlastnictví, citlivých informací a záznamů z hodnocení. Pokud hodnotitelé nejsou schopni splnit bezpečnostní požadavky ve vlastním prostředí nebo pokud jsou zpřístupňovaná data obzvlášť citlivá, může být vhodné umožnit přístup pouze prostřednictvím zařízení spravovaných společností nebo přímo v jejích prostorách.

  • Využitelná zjištění a čas na nápravu: Posouzení by měla určit konkrétní nedostatky a poskytnout laboratořím dostatek podrobností k jejich odstranění. Laboratoře by tam, kde je to vhodné, měly před zveřejněním dostat přiměřenou lhůtu k nápravě problémů. Zprávy by tam, kde je to relevantní, měly také uvádět poučení pro vývojáře agentů, jejich provozovatele a obránce spolu s praktickými doporučeními k zavedení.

  • Odpovědné postupy zveřejňování: Zprávy z posouzení by měly vycházet z důkazů a být sdíleny co nejotevřeněji a současně by měla být zachována ochrana citlivých a důvěrných informací. Pokud nelze informace zveřejnit v plném rozsahu, může být odpovědnost podpořena důvěrným poskytováním zpráv příslušným dohledovým orgánům, například orgánům správy či správním radám společností. K zachování rovnováhy mezi nezávislostí a důvěrností by měla být zavedena zásadová ochrana a pravidla pro redakční odstranění informací i jasná očekávání ohledně zpětné vazby a oprav nepřesností. Hodnotitelé by si měli zachovat redakční nezávislost a současně zajistit ochranu důvěrnosti a duševního vlastnictví. Hodnotitelé by měli přijmout jasná pravidla pro redakční odstraňování informací, která laboratořím umožní požádat o odstranění citlivých údajů. Hodnotitelé zároveň mohou uvést, kde došlo k podstatným zásahům a jaký dopad měly na zprávu z posouzení.

Další postup

Jsme odhodláni podporovat nezávislé hodnotitele a vytvářet jasnější společné mezinárodní standardy pro účinné externí posuzování, a to prostřednictvím budoucích právních předpisů i soukromých institucí správy a řízení. Ekosystém nezávislého hodnocení se stále rozvíjí. Jeho růst podpoříme spoluprací s různorodou komunitou nezávislých hodnotitelů, kteří mají hluboké odborné znalosti v otázkách bezpečnosti průkopnických technologií. Žádný externí subjekt nemůže ani by neměl komplexně pokrývat naléhavé otázky bezpečnosti průkopnických technologií. Budeme postupovat uvážlivě a cíleně, abychom rozšířili své kapacity a umožnili rostoucímu externímu ekosystému sjednotit se na osvědčených postupech a zásadách. S několika externími subjekty jednáme o návrzích, které odpovídají výše uvedeným prioritním oblastem.