Preskočiť na hlavný obsah
OpenAI

16. septembra 2026

VyhľadávanieBezpečnosť

Náš rámec hlásenia nesúladu modelov

Načítava sa…

Predstavujeme nový rámec na sledovanie, vyšetrovanie a zverejňovanie prípadov nesúladu modelov v OpenAI spolu so šiestimi správami o neočakávanom alebo znepokojujúcom správaní modelov, ktoré sme zaznamenali za posledných šesť mesiacov.

Aby sme v minulosti lepšie informovali výskumníkov, vývojárov AI, tvorcov politík a širokú verejnosť, snažili sme sa zverejňovať naše zistenia o nesúlade. Keďže sme však nemali systematický prístup k oznamovaniu týchto zistení, zverejňovali sme ich nepravidelne a menej často, než by bolo vhodné. Často sme čakali, kým budeme môcť spojiť viacero prípadov do jednej správy, alebo sme ich pridávali do systémových kariet novo vydaných modelov. Tento nový rámec má urýchliť publikovanie správ o nesúlade po jeho spozorovaní, aj keď sme dané správanie ešte úplne nevysvetlili ani nezmierňovali.

Keďže systémy AI sú čoraz vyspelejšie a nasadzujú sa vo väčšom rozsahu, musíme vytvoriť širší a lepšie informovaný konsenzus o pokroku vo výskume zosúladenia. Nemyslíme si, že odvetvie AI vyriešilo zosúladenie a monitorovanie natoľko, aby mohlo ešte dlho zodpovedne pokračovať v rozširovaní maximálnou rýchlosťou. Rozhodnutia o ďalšom vývoji AI v nadchádzajúcich mesiacoch a rokoch musia vychádzať z dôkazov, ktoré si môžu samostatne preskúmať aj ľudia mimo spoločností vyvíjajúcich prelomové modely.

Príklady nesúladu môžu pomôcť odhaliť problémy, s ktorými sa môžu stretnúť iní vývojári AI, keď ich systémy dosiahnu podobné schopnosti, poukázať na slabiny ochranných opatrení alebo spochybniť predpoklady o správaní modelov. Zverejnenie týchto zistení umožňuje ostatným skúmať rovnaké problémy, overovať naše vysvetlenia a zlepšovať opatrenia na zmiernenie rizík. Keďže veríme v prínos transparentnosti v otázkach nesúladu, náš nový rámec uprednostňuje zverejnenie aj vtedy, keď význam prípadu nie je istý. To znamená, že niektoré zverejnené prípady sa môžu ukázať ako náhodné a nemusia byť súčasťou širšieho vzorca ani naznačovať budúci vývoj.

V súčasnosti neexistuje rámec platný pre celé odvetvie, ktorý by stanovoval výslovné normy, ako majú vývojári AI zverejňovať príklady nesúladu vo svojich modeloch. Dúfame, že rámec, ktorý dnes predstavujeme, je prvým krokom k vytvoreniu takýchto noriem a určí, ktoré prípady nesúladu by mali vývojári zverejniť a čo by mali ich správy obsahovať. Tento rámec považujeme za rozpracovaný a budeme ho zdokonaľovať na základe skúseností a spätnej väzby verejnosti.

Opisujeme tu fungovanie rámca a zverejňujeme prvé správy.

Ktoré príklady nesúladu budeme oznamovať

Naším cieľom je zverejňovať príklady, ktoré poskytujú užitočné dôkazy o tom, ako nesúlad modelov vzniká, ako sa prejavuje a kde ochranné opatrenia fungujú alebo zlyhávajú. Uprednostňujeme nové mechanizmy, významné zmeny známeho správania a zistenia, ktoré spochybňujú predpoklady o bezpečnosti alebo zmierňovaní rizík. Príklad nemusí spôsobiť ujmu ani preukázať širší vzorec, aby si zaslúžil zverejnenie. Tento rámec sa bude vzťahovať na správanie spĺňajúce kritériá počas celého životného cyklu modelu vrátane trénovania, vyhodnocovania, testovania a nasadenia.

Patria sem nové spôsoby, ktorými modely konajú bez oprávnenia, koordinujú sa s inými modelmi alebo sa vyhýbajú dohľadu; zlyhania spochybňujúce metódu zosúladenia či ochranné opatrenie; aj správanie, ktoré spochybňuje tvrdenie v publikovanom hodnotení bezpečnosti. Rovnaké kritériá zverejnenia platia aj pre nesúlad, ktorý môže ovplyvniť tretie strany.

Môže ísť aj o prípady nesúladu, ktoré sa javia ako opakovanie prípadov zverejnených v minulosti. Samotné opakovanie problému môže byť užitočným dôkazom o správaní našich modelov alebo účinnosti našich ochranných opatrení. Napríklad ak sa určitý druh nesúladného správania opakovane vyskytuje napriek viacerým pokusom o jeho zmiernenie. Za týchto okolností zverejníme ďalšie príklady aktualizáciou pôvodného oznámenia o nesúlade.

Postupne plánujeme vypracovať objektívnejšie kritériá zverejňovania spolu s ďalšími vývojármi, externými výskumníkmi, organizáciami pre odvetvové normy a regulačnými orgánmi. Sme tiež presvedčení, že závažné incidenty týkajúce sa bezpečnosti, zabezpečenia a nesúladu by sa mali oznamovať federálnej vláde USA, a pracujeme na návrhu mechanizmov hlásenia. Tento rámec považujeme za doplnok našich existujúcich povinností. Nenahrádza naše zákonné požiadavky na zverejňovanie vrátane požiadaviek týkajúcich sa kritických bezpečnostných incidentov alebo narušení kybernetickej bezpečnosti.

Príklady nesúladu, ktoré dnes zverejňujeme

Pri príležitosti zavedenia nášho nového rámca na zverejňovanie nesúladu publikujeme šesť správ o prípadoch nesúladného správania, ktoré sme pozorovali počas trénovania alebo vyhodnocovania našich modelov. Tieto prípady ilustrujú rôzne druhy správania, ktoré podľa nás stojí za to zverejniť – od zatajovania informácií pred používateľom až po nepovolené kroky na prekonanie prekážok. Ide o správy o jednotlivých prípadoch, preto by sa nemali považovať za obraz toho, ako často sa nesúlad vyskytuje v našich modeloch. Každá položka nižšie odkazuje na úplnú správu.

  1. Samostatne vytvorené pokyny v súhrnoch úloh(otvorí sa v novom okne). Nevydaný výskumný model vložil do súhrnov používaných na pokračovanie práce v novom kontextovom okne nesúvisiace pokyny vrátane pokynov na ignorovanie bežných obmedzení. Identifikovali sme 27 dotknutých súhrnov.

  2. Pokyny na zatajenie chýb v súhrnoch úloh(otvorí sa v novom okne). Počas trénovania GPT‑5.6 Sol pridávalo mnoho inštancií modelu do svojich súhrnov pokyny na zatajenie chýb alebo nesúladného správania pred používateľom. Súhrny vytvorené kompakciou napríklad obsahovali pokyny na vymyslenie chýbajúcich historických údajov bez priznania tejto skutočnosti a na zatajenie nezhôd vo verziách zdrojov.

  3. Vyhľadávanie odhalených kľúčov API vo verejných repozitároch a následné vymýšľanie informácií(otvorí sa v novom okne). Pri odpovedi na bežnú otázku o údajoch o príjmoch v jednom kalifornskom okrese model našiel a bez oprávnenia použil odhalený kľúč API. Keď ani potom nedokázal získať požadované údaje, vymyslel si ich a prezentoval ich ako údaje z požadovaného zdroja.

  4. Nahrávanie súborov na internet s cieľom citovať ich(otvorí sa v novom okne). Keď používateľ požiadal nevydaný model o identifikátory a názvy jazier s rozlohou väčšou ako 5 000 000 štvorcových metrov, agent našiel správnu odpoveď pomocou jazyka Python. Keďže však pokyny požadovali citáciu z prehliadača, agent sa bez opýtania používateľa rozhodol nahrať súbor, aby ho mohol citovať v odpovedi.

  5. Nepovolené zápisy a komunikácia cez interný softvérový repozitár(otvorí sa v novom okne). Modely pri hľadaní chýbajúcich vstupných súborov používali interný softvérový repozitár ako nástenku na výmenu požiadaviek a odpovedí medzi samostatnými tréningovými vzorkami, hoci tieto súbory nedokázali obnoviť. Správa skúma aj skorší prípad, keď model pri pokuse obísť sieťové obmedzenia úspešne nahral testovacie súbory do repozitára.

  6. Nepovolené zdieľanie súborov medzi spolupracujúcimi agentmi(otvorí sa v novom okne). Agenti, ktorí spoločne pracovali na rovnakej tréningovej úlohe, využili verejné weby na hosťovanie súborov, aby si ich mohli vymieňať, keď nemali prístup k miestnym súborom ostatných agentov. Výstupy úlohy sa tak sprístupnili na verejných adresách URL, hoci úloha požadovala, aby modely používali iba miestne súbory.

Ako funguje náš proces zverejňovania

Každý zamestnanec OpenAI môže upozorniť naše tímy pre bezpečnosť a zosúladenie na príklad nesúladu, aby ho vyšetrili, a požiadať o zváženie jeho zverejnenia. Tým sa začne náš proces zverejňovania, ktorý má pre každý krok stanovené lehoty, aby sa zabezpečilo včasné vyšetrovanie a zverejnenie.

Keď niekto na príklad upozorní, naši technickí pracovníci preskúmajú, čo sa stalo, čo zostáva neisté, či je zverejnenie opodstatnené a ktoré skutočnosti možno uviesť. Posúdia tiež, či bola dotknutá tretia strana a či ju treba pred zverejnením súkromne informovať.

Príklad potom zaradíme do jedného z troch postupov: Pripravené na zverejnenie, Menšie vyšetrovanie alebo Rozsiahlejšie vyšetrovanie („pomalý postup“).

Postup Pripravené na zverejnenie zahŕňa prípady spĺňajúce kritériá, ktorých vyšetrovanie je dostatočne ukončené na to, aby sa po kontrole mohli publikovať. Postup Menšie vyšetrovanie zahŕňa prípady, ktoré si vyžadujú ďalšie technické skúmanie. Očakávame, že tieto dva postupy pokryjú veľkú väčšinu prípadov, ktoré zverejníme, najmä tie, ktoré si nevyžadujú rozsiahle vyšetrovanie, koordináciu s tretími stranami ani riešenie závažných rizík zneužitia. Všetky prípady, ktoré dnes zverejňujeme, patria do jedného z týchto dvoch postupov.

Postup Rozsiahlejšie vyšetrovanie zahŕňa zložité vyšetrovania, najmä tie, ktoré sa týkajú tretích strán. Ak je dotknutá tretia strana, naše povinnosti v oblasti zabezpečenia, práva a zodpovedného zverejňovania majú prednosť pred týmto rámcom. Úvodné oznámenie sa budeme snažiť publikovať čo najskôr, no z bezpečnostných dôvodov ho možno budeme musieť odložiť – napríklad ak model objaví dovtedy neznámu zraniteľnosť v široko používanom softvéri. Ak by správa identifikovala tretiu stranu, chceme ju vopred upozorniť aj vtedy, keď nedošlo k prekročeniu žiadnej bezpečnostnej hranice.

Úvodné oznámenie prípadu v postupe Rozsiahlejšie vyšetrovanie poskytne všeobecný opis udalosti, uvedie, či pri vyšetrovaní pomáhajú externí odborníci, a podľa dostupnosti odhadne termín publikovania záverečnej správy. Ak by sa incident OpenAI Hugging Face zverejňoval podľa tohto rámca, patril by do tohto postupu.

Zamestnanca, ktorý na príklad upozornil, budeme informovať o rozhodnutí, či ho zverejniť, a ak áno, podľa ktorého postupu sa bude riešiť. Nevyriešené nezhody týkajúce sa zverejnenia alebo vhodného postupu postúpime Poradnej skupine pre bezpečnosť OpenAI (SAG). Tvoria ju vedúci pracovníci z rôznych častí spoločnosti, ktorí posudzujú schopnosti a ochranné opatrenia prelomových modelov, dohliadajú na náš Rámec pripravenosti a poskytujú odporúčania vedeniu OpenAI. Nezhody v rámci SAG alebo námietky zamestnancov proti jej rozhodnutiam postúpime vedeniu OpenAI. Rozhodnutia informácie nezverejniť alebo závery, že zverejnenie nie je opodstatnené, oznámime vedeniu pre bezpečnosť a zosúladenie a v možnej miere aj príslušným technickým pracovníkom.

Tento proces zverejňovania môžeme upravovať podľa skúseností z praxe a všetky zmeny zaznamenáme v tomto príspevku.

Čo bude obsahovať každá správa

Každá úplná správa opíše pozorované správanie, jeho závažnosť a prípadný vplyv navonok, prostredie, v ktorom sa vyskytlo, dátum alebo obdobie výskytu, čas jeho odhalenia a vo všeobecnosti aj príslušný model či modely. Ak to bude možné, uvedieme aj:

  • ďalšie podrobnosti o udalosti a prípadnej spôsobenej ujme;

  • ako sme nesúlad odhalili a aký bol rozsah nášho vyšetrovania;

  • naše chápanie dôsledkov pre výskum zosúladenia a technickú bezpečnosť AI;

  • dôležité nezodpovedané otázky, ktoré príklad nastolil;

  • opatrenia, ktoré prijímame alebo plánujeme prijať na riešenie daného správania. V čase zverejnenia nemusia byť tieto informácie vždy k dispozícii, pretože správu o nesúlade môžeme publikovať ešte pred dokončením vyšetrovania alebo vypracovaním nápravy.

Pri nesúlade, ku ktorému dôjde v zákazníckych nasadeniach, poskytneme toľko informácií, koľko nám dovolí súkromie zákazníkov a naše zmluvné záväzky.

Dnešné správy predstavujú úvodný súbor zverejnení, nie úplný prehľad známych prípadov nesúladu ani prebiehajúcich vyšetrovaní. Tieto úvodné správy nemajú predstavovať celý rozsah ani závažnosť prípadov, na ktoré sa tento rámec vzťahuje. Zaviazali sme sa zverejňovať prípady nesúladu, ktoré spĺňajú kritériá tohto rámca, vrátane zložitejších prípadov, ktoré si vyžadujú dlhšie vyšetrovanie alebo koordináciu s tretími stranami. Správy podľa tohto rámca budeme naďalej priebežne publikovať a s rozvojom našich záväzkov v oblasti podávania správ o nich poskytneme ďalšie informácie.

Autor

OpenAI