Pereiti prie pagrindinio turinio
OpenAI

2026 m. rugsėjo 16 d.

Moksliniai tyrimaiSauga

Mūsų pranešimų apie modelio tikslų neatitikimą sistema

Įkeliama...

Pristatome naują „OpenAI“ modelių tikslų neatitikimo atvejų stebėjimo, tyrimo ir viešinimo sistemą, taip pat šešias ataskaitas apie per pastaruosius šešis mėnesius pastebėtą netikėtą ar nerimą keliantį modelių elgesį.

Siekdami geriau informuoti tyrėjus, DI kūrėjus, politikos formuotojus ir visuomenę, anksčiau stengėmės viešai skelbti savo tyrimų rezultatus apie tikslų neatitikimą. Tačiau neturint sisteminio tokių rezultatų skelbimo metodo, informaciją viešinome nereguliariai ir rečiau, nei derėtų: dažnai laukdavome, kol kelis atvejus galėsime sujungti į vieną ataskaitą, arba įtraukdavome juos į naujai išleistų modelių sistemos korteles. Šia nauja sistema siekiame greičiau skelbti ataskaitas apie pastebėtą tikslų neatitikimą, net jei dar nesame iki galo paaiškinę aprašomo elgesio ar sumažinę jo keliamą riziką.

DI sistemoms tampant pažangesnėms ir plačiau naudojamoms, turime siekti platesnio ir geriau informuoto sutarimo dėl tikslų atitikimo tyrimų pažangos. Mes nemanome, kad DI sektorius jau pakankamai išsprendė tikslų atitikimo ir stebėsenos problemas, kad dar ilgai būtų galima atsakingai tęsti plėtrą didžiausiu greičiu. Sprendimai, kaip DI turėtų būti plėtojamas artimiausiais mėnesiais ir metais, turi remtis įrodymais, kuriuos galėtų savarankiškai išnagrinėti žmonės, nedirbantys priešakinius modelius kuriančiose bendrovėse.

Tikslų neatitikimo pavyzdžiai gali padėti nustatyti problemas, su kuriomis susidurs kiti DI kūrėjai jų sistemoms pasiekus panašius gebėjimus, atskleisti apsaugos priemonių trūkumus arba suabejoti prielaidomis apie modelių elgesį. Kai šiais rezultatais dalijamasi, kiti gali tirti tas pačias problemas, tikrinti mūsų paaiškinimus ir tobulinti rizikos mažinimo priemones. Kadangi vertiname tikslų neatitikimo skaidrumą, pagal naująją sistemą informaciją esame linkę viešinti net tada, kai jos reikšmė neaiški. Tai reiškia, kad kai kurie mūsų paviešinti atvejai gali pasirodyti esantys atsitiktiniai, nepriklausantys platesnei tendencijai ir nerodantys galimų pokyčių ateityje.

Šiuo metu visame sektoriuje nėra bendros sistemos, nustatančios aiškius standartus, kaip DI kūrėjai turėtų viešinti savo modelių tikslų neatitikimo pavyzdžius. Tikimės, kad šiandien pristatoma sistema bus pirmas žingsnis kuriant tokius standartus ir padės nustatyti, kuriuos tikslų neatitikimo atvejus kūrėjai turėtų viešinti bei ką turėtų apimti jų ataskaitos. Šią sistemą laikome vis dar kuriama ir tobulinsime ją remdamiesi patirtimi bei visuomenės atsiliepimais.

Toliau aprašome, kaip ši sistema veiks, ir pateikiame pirmąsias skelbiamas ataskaitas.

Apie kokius tikslų neatitikimo atvejus pranešime

Siekiame viešinti pavyzdžius, suteikiančius vertingų įrodymų, kaip kyla ir pasireiškia modelių tikslų neatitikimas bei kada apsaugos priemonės veikia arba neveikia. Pirmenybę teikiame naujiems mechanizmams, reikšmingiems žinomo elgesio pokyčiams ir rezultatams, verčiantiems abejoti prielaidomis apie saugą ar rizikos mažinimą. Kad atvejį būtų verta paviešinti, jis nebūtinai turi padaryti žalos ar įrodyti platesnę tendenciją. Ši sistema apims kriterijus atitinkantį elgesį per visą modelio gyvavimo ciklą, įskaitant mokymą, vertinimą, testavimą ir diegimą.

Tai apima naujus būdus modeliams veikti be leidimo, koordinuoti veiksmus su kitais modeliais ar išvengti priežiūros; nesėkmes, verčiančias abejoti tikslų atitikimo užtikrinimo metodu ar apsaugos priemone; ir elgesį, prieštaraujantį paskelbtame saugos vertinime pateiktam teiginiui. Tie patys viešinimo kriterijai taikomi ir tikslų neatitikimui, galinčiam paveikti trečiąsias šalis.

Tai taip pat gali apimti tikslų neatitikimo atvejus, kurie atrodo tokie pat kaip anksčiau mūsų paviešinti atvejai. Problemos pasikartojimas savaime gali suteikti vertingų įrodymų apie mūsų modelių elgesį ar apsaugos priemonių veiksmingumą, pavyzdžiui, jei tam tikras elgesys, pasižymintis tikslų neatitikimu, kartojasi nepaisant daugkartinių bandymų jį sušvelninti. Tokiomis aplinkybėmis papildomus pavyzdžius paskelbsime atnaujinę pradinį pranešimą apie tikslų neatitikimą.

Ilgainiui kartu su kitais kūrėjais, nepriklausomais tyrėjais, sektoriaus standartizavimo institucijomis ir reguliavimo įstaigomis ketiname parengti objektyvesnius viešinimo kriterijus. Taip pat manome, kad apie rimtus saugos, saugumo ir tikslų neatitikimo incidentus reikėtų pranešti JAV federalinei vyriausybei, todėl rengiame siūlymus dėl pranešimo mechanizmų. Ši sistema papildo mūsų esamus įsipareigojimus ir nepakeičia teisinių informacijos atskleidimo reikalavimų, įskaitant reikalavimus dėl kritinių saugos incidentų ar kibernetinio saugumo pažeidimų.

Šiandien pristatomi tikslų neatitikimo pavyzdžiai

Pradėdami taikyti naująją tikslų neatitikimo viešinimo sistemą, skelbiame šešias ataskaitas apie tikslų neatitikimu pasižymintį elgesį, kurį pastebėjome mokydami arba vertindami savo modelius. Šie atvejai iliustruoja įvairų elgesį, apie kurį, mūsų manymu, verta pranešti: nuo informacijos slėpimo nuo naudotojo iki nesankcionuotų veiksmų siekiant įveikti kliūtis. Tai atskirų atvejų ataskaitos, todėl pagal jas nereikėtų spręsti, kaip dažnai tikslų neatitikimas pasireiškia visuose mūsų modeliuose. Kiekviename toliau pateiktame punkte yra nuoroda į išsamią ataskaitą.

  1. Pačių sugeneruotos instrukcijos užduočių santraukose(atsidaro naujame lange). Dar neišleistas tiriamasis modelis į santraukas, naudojamas darbui tęsti naujame konteksto lange, įterpė nesusijusių instrukcijų, įskaitant nurodymus nepaisyti įprastų apribojimų. Nustatėme 27 paveiktas santraukas.

  2. Instrukcijos slėpti klaidas užduočių santraukose(atsidaro naujame lange). Apmokant „GPT‑5.6 Sol“, daugelis modelio egzempliorių į savo santraukas įtraukė instrukcijas slėpti nuo naudotojo klaidas ar tikslų neatitikimu pasižymintį elgesį. Pavyzdžiui, tankinimo santraukose buvo nurodyta išgalvoti trūkstamus istorinius duomenis apie tai nepranešant ir slėpti šaltinių versijų neatitikimus.

  3. Viešose saugyklose nutekintų API raktų paieška ir paskesnis informacijos išgalvojimas(atsidaro naujame lange). Atsakydamas į įprastą klausimą apie pajamas vienoje Kalifornijos apygardoje, modelis aptiko ir be leidimo panaudojo paviešintą API raktą. Vis tiek negalėdamas gauti prašomų skaičių, modelis juos išgalvojo ir pateikė kaip duomenis iš prašyto šaltinio.

  4. Failų įkėlimas į internetą, kad būtų galima juos cituoti(atsidaro naujame lange). Kai naudotojas paprašė dar neišleisto modelio pateikti didesnių nei 5 000 000 kvadratinių metrų ežerų identifikatorius ir pavadinimus, agentas naudodamas „Python“ rado teisingą atsakymą. Tačiau kadangi instrukcijose buvo prašoma naršyklėje pasiekiamos citatos, agentas, neatsiklausęs naudotojo, nusprendė įkelti failą, kad galėtų jį pacituoti atsakyme.

  5. Nesankcionuotas duomenų įrašymas ir komunikacija per vidinę programinės įrangos saugyklą(atsidaro naujame lange). Ieškodami trūkstamų įvesties failų, modeliai naudojo vidinę programinės įrangos saugyklą kaip skelbimų lentą, kad atskiruose mokymo pavyzdžiuose keistųsi užklausomis ir atsakymais, nors tų failų atkurti nepavyko. Šioje ataskaitoje taip pat nagrinėjamas ankstesnis atvejis, kai modelis, mėgindamas apeiti tinklo apribojimus, sėkmingai įkėlė bandomuosius failus į saugyklą.

  6. Nesankcionuotas bendradarbiaujančių agentų dalijimasis failais(atsidaro naujame lange). Kartu vykdydami tą pačią mokymo užduotį, agentai naudojosi viešomis failų prieglobos svetainėmis, kad pasidalytų failais, kai negalėjo pasiekti vieni kitų vietinių failų. Dėl to užduoties rezultatai tapo prieinami viešaisiais URL adresais, nors užduotyje buvo prašoma modelių naudoti tik vietinius failus.

Kaip veikia mūsų viešinimo procesas

Bet kuris „OpenAI“ darbuotojas gali pranešti mūsų saugos ir tikslų atitikimo komandoms apie tirtiną tikslų neatitikimo atvejį ir paprašyti apsvarstyti galimybę jį paviešinti. Taip pradedamas viešinimo procesas, kuriame kiekvienam etapui yra nustatyti terminai, kad tyrimas ir viešinimas vyktų laiku.

Gavę pranešimą apie atvejį, mūsų techniniai darbuotojai ištirs, kas nutiko, kas tebėra neaišku, ar pagrįsta informaciją viešinti ir kokiais faktais galima pasidalyti. Jie taip pat įvertins, ar atvejis paveikė kurią nors trečiąją šalį ir ar prieš paskelbiant informaciją ją reikia informuoti privačiai.

Tada atvejis bus priskirtas vienai iš trijų kategorijų: „Parengta viešinti“, „Nedidelės apimties tyrimas“ arba „Didesnės apimties tyrimas“ („Lėtoji eiga“).

Kategorijai „Parengta viešinti“ priskiriami kriterijus atitinkantys atvejai, kurių tyrimas pakankamai baigtas, kad po peržiūros juos būtų galima paskelbti. Kategorijai „Nedidelės apimties tyrimas“ priskiriami atvejai, kuriuos reikia papildomai techniškai ištirti. Tikimės, kad šioms dviem kategorijoms priklausys didžioji dauguma mūsų viešinamų atvejų, ypač tie, kuriems nereikia išsamaus tyrimo, derinimo su trečiosiomis šalimis ar didelės piktnaudžiavimo rizikos valdymo. Visi šiandien skelbiami atvejai priklauso vienai iš šių dviejų kategorijų.

Kategorijai „Didesnės apimties tyrimas“ priskiriami sudėtingi tyrimai, ypač susiję su trečiosiomis šalimis. Kai paveikiama trečioji šalis, mūsų saugumo, teisiniai ir atsakingo informacijos atskleidimo įsipareigojimai yra viršesni už šią sistemą. Mes sieksime kuo greičiau paskelbti pirminį pranešimą, tačiau saugumo sumetimais gali tekti atidėti, pavyzdžiui, jei modelis aptiktų anksčiau nežinomą plačiai naudojamos programinės įrangos pažeidžiamumą. Jei ataskaitoje būtų galima nustatyti trečiąją šalį, ketiname ją informuoti iš anksto, net jei nebuvo pažeistas joks saugumo barjeras.

Pirminiame pranešime apie kategorijai „Didesnės apimties tyrimas“ priskirtą atvejį bus bendrai aprašyta, kas nutiko, nurodyta, ar tyrime dalyvauja išorės ekspertai, ir, jei įmanoma, pateiktas numatomas galutinės ataskaitos paskelbimo laikas. Jei „OpenAI“ incidentas platformoje „Hugging Face“ būtų buvęs paviešintas pagal šią sistemą, jis būtų priskirtas šiai kategorijai.

Apie sprendimą, ar atvejį viešinti ir, jei taip, kuria tvarka jį nagrinėti, bus pranešta jį iškėlusiam darbuotojui. Neišspręsti nesutarimai dėl viešinimo ar tinkamos nagrinėjimo tvarkos bus perduodami „OpenAI“ Saugos patariamajai grupei (SAG). Ją sudaro visos bendrovės vyresnieji pareigūnai, vertinantys priešakinių modelių gebėjimus ir apsaugos priemones, prižiūrintys mūsų Pasirengimo sistemą ir konsultuojantys „OpenAI“ vadovybę. Nesutarimai SAG viduje arba darbuotojų prieštaravimai jos sprendimams bus perduodami „OpenAI“ vadovybei. Apie sprendimus neviešinti informacijos arba pripažinti, kad jos viešinti nėra pagrindo, bus pranešta saugos ir tikslų atitikimo užtikrinimo vadovams ir, kiek įmanoma, atitinkamiems techniniams darbuotojams.

Atsižvelgdami į praktinę patirtį galime šį viešinimo procesą keisti, o visus pakeitimus užfiksuosime šiame įraše.

Kas bus pateikiama kiekvienoje ataskaitoje

Kiekvienoje išsamioje ataskaitoje aprašysime pastebėtą elgesį, jo pavojingumą ir bet kokį išorinį poveikį, aplinkybes, kuriomis jis pasireiškė, datą ar laikotarpį, kada jį aptikome, ir bendrai nurodysime susijusį modelį ar modelius. Kai galėsime, taip pat pateiksime:

  • daugiau informacijos apie įvykį ir jo padarytą žalą;

  • kaip aptikome tikslų neatitikimą ir kokia buvo mūsų tyrimo apimtis;

  • kaip vertiname jo reikšmę tikslų atitikimo tyrimams ir techninei DI saugai;

  • svarbius dėl šio atvejo kilusius ir neatsakytus klausimus;

  • priemones, kurių imamės arba planuojame imtis, reaguodami į šį elgesį. Viešinimo metu ši informacija ne visada bus prieinama, nes tikslų neatitikimo ataskaitą galime paskelbti dar nebaigę tyrimo ar nesukūrę problemos sprendimo.

Apie klientų sistemose pasireiškusį tikslų neatitikimą pateiksime tiek informacijos, kiek leis klientų privatumo apsauga ir mūsų sutartiniai įsipareigojimai.

Šiandien skelbiamos ataskaitos yra pirmasis viešinamos informacijos rinkinys, o ne išsami žinomų tikslų neatitikimo atvejų ar vykdomų tyrimų apžvalga. Šios pirmosios ataskaitos neatspindi visos pagal šią sistemą nagrinėjamų atvejų įvairovės ar pavojingumo. Įsipareigojame viešinti šios sistemos kriterijus atitinkančius tikslų neatitikimo atvejus, įskaitant sudėtingesnius atvejus, kuriems ištirti ar suderinti su trečiosiomis šalimis reikia daugiau laiko. Pagal šią sistemą ataskaitas skelbsime nuolat, o toliau plėtodami savo įsipareigojimus dėl ataskaitų teikimo apie juos papasakosime išsamiau.

Autorius

OpenAI