Pereiti prie pagrindinio turinio
OpenAI

2026 m. rugpjūčio 18 d.

BendrovėPublikacija

Modelių kūrimo tempas kritinių kibernetinių pajėgumų eroje

Įkeliama...

Per pastarąsias kelias savaites du įvykiai išryškino didėjančią riziką, susijusią su vis pajėgesnėmis DI sistemomis: OpenAI ir „Hugging Face“ incidentas ir atskirai gauti preliminarūs duomenys, kad vienas iš būsimų mūsų modelių „Astra“ pagal mūsų Pasirengimo sistemą gali pasiekti kritinių kibernetinio saugumo pajėgumų ribą. Šie įvykiai ir sparti mūsų vidinių tyrimų pažanga paskatino mus skubiau stiprinti stebėsenos, suderinimo ir izoliavimo apsaugos priemones visuose mokymo proceso etapuose.

Modeliams tampant pajėgesniems, didėja ir rizika, susijusi su jų kūrimu bei bandymu organizacijos viduje. Mūsų stebėsenos, suderinimo ir saugumo standartai turi lenkti šias rizikas. Norėjome skirti tiek laiko, kiek reikia šiems standartams įgyvendinti, todėl laikinai sulėtinome plėtros tempą. Be kita ko, dviem savaitėms pristabdėme diegti skirtų naujausių modelių mokymą pasitelkiant skatinamąjį mokymąsi (RL), kol toliau stiprinome ir imituotomis atakomis tikrinome savo tyrimų aplinkas bei plėtėme stebėsenos sistemų aprėptį. Didžiausias planuotas priešakinio modelio RL mokymo procesas tebėra sustabdytas, kol mažesniu mastu mokome ir vertiname modelį, kad ištirtume jo elgseną, patikrintume apsaugos priemones ir prieš tęsdami surinktume daugiau suderinimo įrodymų.

Suderinimas – darbas siekiant, kad DI sistemos elgtųsi taip, kaip numatyta, ir tinkamai reaguotų į žmonių priežiūrą, – jau seniai yra mūsų tyrimų programos pagrindas. Dabar visuose mokymo etapuose reikalaujame tvirtesnių suderintos elgsenos įrodymų, remdamiesi jau vykdomais tyrimais ir vertinimais. Užtikrinti, kad vis pajėgesnės sistemos išliktų suderintos, turės visa ši sritis. Būsimų modelių pažangos ženklai aiškiai rodo, kad mums reikia platesnio požiūrio, kuris remtųsi dabartine Pasirengimo sistema ir ją pranoktų.

Manome, kad svarbu skaidriai informuoti, kaip keičiasi mūsų požiūris. Toliau aprašome jau įgyvendintus tyrimų procesų bei infrastruktūros pakeitimus ir dar vykdomus darbus.

Pajėgesnių modelių apsaugos priemonių stiprinimas

Kurdami pajėgesnius modelius remiamės trimis viena kitą stiprinančiomis apsaugos priemonėmis:

  1. Stebėsena padeda aptikti susirūpinimą keliančią elgseną ir į ją reaguoti.
  2. Suderinimas mažina žalingų ar neleistinų veiksmų tikimybę.
  3. Saugumo priemonės riboja, ką DI sistemos gali pasiekti ar paveikti.

Tikimės, kad netrukus modeliai atliks didžiąją dalį saugumo darbų, įskaitant apsaugą nuo kitų modelių. Tai leis visoms trims apsaugos priemonėms plėstis kartu su modelių pajėgumais, o tai laikome itin svarbiu dalyku.

Šias apsaugos priemones taikome tiek tyrimams, tiek diegimui ir pritaikome pagal kiekvieno modelio pajėgumus, veikimo aplinką bei rizikos lygį.

Mūsų tyrimų aplinkų apsauga

Priešakiniams modeliams įgyjant didesnių kibernetinio saugumo pajėgumų, griežtiname aplinkų, kuriose juos mokome ir vertiname, saugumo standartus. Šiems standartams įgyvendinti prireikė daug inžinerinio darbo, o priešakiniai tyrimai patyrė didelių išlaidų ir vėlavimų. Iškart po OpenAI ir „Hugging Face“ incidento* tyrimų klasteriuose pristabdėme priešakinių modelių išvedimą, kai procesai galėjo vykdyti kodą arba naudoti prie interneto prieigą turinčius įrankius. Gana greitai atkūrėme labiau ribotą ir saugesnį kodo vykdymo būdą, o tada atskirai įvertinome kiekvieną darbo krūvį, kad nustatytume, ar jį galima saugiai atnaujinti. Dalis tyrimų darbo krūvių buvo atnaujinti taikant šias naujas kontrolės priemones, o kitiems reikėjo papildomų pakeitimų.

Per kitas savaites apibrėžėme griežtesnius priešakinių tyrimų darbo krūvių saugumo reikalavimus ir pradėjome juos įgyvendinti. Pavyzdžiui:

  • Darbo krūvių izoliavimas. Dabar reikalaujame griežčiau izoliuoti („smėlio dėžėse“) darbo krūvius, kurie vykdo modelio sugeneruotą ar kitą nepatikimą kodą. Tai taip pat taikoma programinei įrangai, kuri gali būti pažeista apdorojant modelio išvedinius.
  • Tinklo izoliavimas. Įdiegėme daugiau kontrolės priemonių, skirtų didesnės rizikos ir nepatikimiems darbo krūviams nuo interneto izoliuoti. Šias kontrolės priemones sukūrėme taip, kad vien pažeidus vieną darbo krūvį ar pagalbinę paslaugą nebūtų galima be leidimo pasiekti interneto ar kitų vidinių tinklų.
  • Nuolatinis saugumo testavimas. Pertvarkėme aplinką, kad pašalintume galimai pažeidžiamas bendrinamas paslaugas, sumažintume nuolat suteiktas teises ir sustiprintume saugumo bei pasitikėjimo ribas. Taip pat geriname savo galimybes rinkti ir stebėti saugumo žurnalus. Galiausiai investuojame į automatizavimą ir pasitelkiame savo modelius, kad imituotomis atakomis nuolat tikrintume šias ribas.

Kartu šios kontrolės priemonės užtikrina daugiapakopę apsaugą ir padeda apsaugoti mūsų tyrimų aplinką nuo atakų. Šiuo metu darbo krūviams, susijusiems su „Astra“ ar kibernetiniais modeliais, taikome griežčiausio lygio saugumo priemones, nes nustatėme, kad „Astra“ modeliai gali turėti kritinio lygio kibernetinių pajėgumų. Šios apsaugos priemonės taip pat taikomos visiems kitiems su kibernetine sritimi susijusiems darbo krūviams.

Nors dalis „Astra“ mokymo ir vertinimo procesų atitinka šiuos reikalavimus, daug darbo krūvių tebėra sustabdyti, kol bus visiškai perkelti, patobulinti ir atitiks naują saugumo kartelę. Pirmiausia į šias naujas aplinkas perkeliame saugos ir suderinimo darbo krūvius.

Minčių grandinės stebėsenos plėtra

Stebėsena jau seniai yra svarbi mūsų modelių kūrimo proceso dalis, įskaitant vidinių programavimo agentų stebėseną ir ilgai trunkančias sesijas. Stebėseną ypač sutelkėme į organizacijos viduje diegiamus priešakinius modelius ir jų RL mokymo procesus. Juos laikėme rizikingiausiais darbo krūviais, nes jie gali derinti pažangius modelio pajėgumus su prieiga prie įrankių, jautrių sistemų ir vidinių ar išorinių tinklų. Ji nebuvo taikoma visiems išvedimo ir mokymo procesams, kuriuose naudojami įrankiai. Sukūrę naują stebėsenos sistemą, peržiūrėjome ir išplėtėme savo požiūrį.

Ši nauja stebėsenos sistema yra daugiapakopė. Pirmiausia aktyvacijos klasifikatoriai – modelio vidinę veiklą tikrinantys detektoriai – analizuoja kiekvieną atrinktą žetoną, o galimas problemas perduoda vis pažangesniems, daugiau skaičiavimo išteklių naudojantiems automatiniams tyrėjams. Šios sistemos tikrina įrankių veiksmus, prieinamą protavimą ir visą veiklos seką, ieškodamos neleistinos prieigos, duomenų vagystės, destruktyvios elgsenos bei bandymų apeiti apsaugos priemones. Siekiame pateikti įspėjimą per 30 minučių nuo tada, kai stebėsenos sistema aptinka susirūpinimą keliančią veiklą. Jei stebėsenos sistema nustato tikėtiną kritinės saugumo ribos pažeidimą, ji sugeneruoja aukščiausio prioriteto įspėjimą. Dabartinėje sistemoje apie tai iškvietimo pranešimu informuojamos saugos, saugumo ir tyrimų komandos. Jei per 30 minučių jos negali įtikinamai nustatyti, kad signalas klaidingas, šios komandos turi pristabdyti veiklą.

Ši stebėsena privaloma visiems Sol ar pajėgesnių modelių RL mokymo ir vertinimo procesams, kuriuose naudojami įrankiai. Rugpjūčio 7 d. nustatę, kad „Astra“ gali turėti kritinių kibernetinių pajėgumų, papildomą stebėsenos reikalavimą pradėjome taikyti visiems „Astra“ išvedimo procesams, kuriuose naudojami įrankiai, o ne tik RL mokymui ir vertinimui.

Šioms apsaugos priemonėms reikia nemažai skaičiavimo išteklių. Dabartiniais mūsų vertinimais, stebėsenos pridėtinės sąnaudos sudaro maždaug 20 % stebimam išvedimui naudojamų skaičiavimo išteklių, nors skirtingų mokymo ir vertinimo darbo krūvių sąnaudos labai skiriasi. Daugiau informacijos apie šią sistemą pateiksime būsimame tinklaraščio įraše.

Suderinimo tyrimų pažanga

Suderinimo tyrimai yra mūsų misijos pagrindas. Mūsų misija – užtikrinti, kad bendrasis dirbtinis intelektas būtų naudingas visai žmonijai. Modeliams įgyjant pažangių pajėgumų, pavyzdžiui, gebėjimą vykdyti kibernetines atakas, ir veikiant sudėtingesnėse aplinkose, vis didesnę riziką kels nesuderinta elgsena: atlygio išnaudojimas (būdų gauti didelį atlygį per mokymą radimas iš tiesų nepasiekus numatyto rezultato), apgaulė ar neleistina prieiga.

Pajėgiausių modelių RL mokymo procesuose pagrindinius suderinimo metodus dabar taikome daugiau mokymo proceso etapų. Be kita ko, tobuliname atlygio modelius, kad jie įvairiose užduotyse ir aplinkose geriau aptiktų nesaugią elgseną ir nuo jos atgrasytų; mokome modelius sąžiningiau informuoti apie savo veiksmus, pajėgumus bei ribotumus; mažiname elgseną, kuria išnaudojamos atlygio, vertintojų, įrankių ar priežiūros spragos. Taip pat plečiame modelių mokymą atpažinti elgseną, kuri sąveikaujant su išorinėmis sistemomis ar ištekliais galėtų pakenkti.

Toliau aktyviai investuojame į suderinimo tyrimus, plečiame vertinimų aprėptį ir įgytas žinias panaudojame mokymui bei apsaugos priemonėms tobulinti. Artimiausiu metu ketiname pateikti gerokai daugiau informacijos apie suderinimo tyrimus, įskaitant tai, ką sužinome apie modelių elgseną ir kokius naujus iššūkius aptinkame.

Kas toliau

Tobulinsime Pasirengimo sistemą, kad sujungtume šias apsaugos priemones visuose mokymo ir diegimo etapuose ir geriau atsižvelgtume į būsimų modelių pajėgumus bei jų veikimo aplinkas. Norint kurti kartu su šiais pajėgumais išplečiamus metodus, reikės nuolat investuoti į modelių palaikomą saugumą, veiksmingesnę stebėseną ir tolesnę suderinimo tyrimų pažangą. Plėtodami savo požiūrį ketiname įtraukti išorės organizacijas ir plačiau dalytis įgytomis žiniomis.

Priešakinių modelių pajėgumai sparčiai didėja. Mūsų gebėjimas juos suprasti, suderinti ir apsaugoti turi lenkti šią pažangą.


*Per artimiausias savaites paskelbsime techninę ataskaitą apie įgytas žinias.

Autorius

OpenAI