Preskočite na glavni sadržaj
OpenAI

18. august 2026.

KompanijaPublikacija

Tempo razvoja modela u eri kritičnih kibernetičkih sposobnosti

Učitavanje…

Tokom proteklih nekoliko sedmica, dva događaja naglasila su sve veće rizike povezane sa sve sposobnijim AI sistemima: incident OpenAI-Hugging Face i, zasebno, preliminarni dokazi da bi jedan od naših predstojećih modela, Astra, mogao dostići prag kritične kibernetičke sposobnosti prema našem Okviru pripravnosti. Ovi događaji, zajedno s brzim napretkom naših internih istraživanja, dodatno su pojačali hitnost rada na jačanju zaštitnih mjera za praćenje, usklađivanje i ograničavanje u svim fazama procesa treniranja.

Kako modeli postaju sposobniji, rastu i rizici povezani s njihovim internim razvojem i testiranjem. Naši standardi praćenja, usklađivanja i sigurnosti moraju ostati korak ispred tih rizika. Željeli smo izdvojiti vrijeme potrebno za ispunjavanje tih standarda, pa smo privremeno usporili povećavanje obima. To je uključivalo dvosedmičnu pauzu u treniranju učenjem s potkrepljivanjem (RL) naših najnovijih modela namijenjenih primjeni, dok smo dodatno ojačavali i provodili simulirane napade na naša istraživačka okruženja te širili obuhvat sistema za praćenje. Naše najveće planirano granično RL treniranje i dalje je na čekanju dok provodimo treniranja i evaluacije manjeg obima kako bismo procijenili ponašanje modela, potvrdili zaštitne mjere i prikupili više dokaza o usklađenosti prije nastavka.

Usklađivanje — rad kojim se osigurava da se AI sistemi ponašaju kako je predviđeno i reaguju na ljudski nadzor — već je dugo u središtu našeg istraživačkog programa. Sada tokom cijelog procesa treniranja zahtijevamo snažnije dokaze usklađenog ponašanja, nadograđujući istraživanja i evaluacije koji su već u toku. Održavanje usklađenosti sve sposobnijih sistema izazov je kojim će se morati pozabaviti cijelo područje. Signali koje uočavamo u napretku predstojećih modela jasno pokazuju da nam je potreban širi pristup, koji se oslanja na postojeći Okvir pripravnosti i nadilazi ga.

Smatramo da je važno otvoreno govoriti o tome kako se naš pristup mijenja. U nastavku opisujemo promjene koje smo već uveli u istraživačke procese i infrastrukturu, kao i rad koji je još u toku.

Jačanje zaštitnih mjera za sposobnije modele

Naš pristup razvoju sposobnijih modela zasniva se na tri zaštitne mjere koje se međusobno nadopunjuju:

  1. Praćenje, kojim otkrivamo zabrinjavajuće ponašanje i možemo reagovati na njega.
  2. Usklađivanje, kojim se smanjuje vjerovatnoća štetnih ili neovlaštenih radnji.
  3. Sigurnosne mjere, kojima se ograničava čemu AI sistemi mogu pristupiti ili na šta mogu utjecati.

Očekujemo da će modeli uskoro obavljati većinu sigurnosnih poslova, uključujući odbranu od drugih modela. To će omogućiti da se sve tri zaštitne mjere razvijaju u skladu sa sposobnostima modela, što smatramo ključnim.

Ove zaštitne mjere primjenjujemo u istraživanju i implementaciji, prilagođavajući ih sposobnostima, radnom okruženju i nivou rizika svakog modela.

Zaštita naših istraživačkih okruženja

Kako granični modeli stječu naprednije kibernetičke sposobnosti, podižemo sigurnosne standarde za okruženja u kojima ih treniramo i evaluiramo. Ispunjavanje ovih standarda zahtijevalo je opsežan inženjerski rad te prouzrokovalo velike troškove i kašnjenja u graničnim istraživanjima. Odmah nakon incidenta OpenAI-Hugging Face*, pauzirali smo izvođenje graničnih modela u istraživačkim klasterima za procese koji su mogli izvršavati kod ili koristiti alate s pristupom internetu. Relativno brzo smo obnovili ograničeniji i sigurniji način izvršavanja koda, a zatim pojedinačno pregledali svako radno opterećenje kako bismo utvrdili može li se sigurno nastaviti. Neka istraživačka radna opterećenja nastavljena su uz nove kontrole, dok su druga zahtijevala dodatne izmjene.

Tokom narednih sedmica definirali smo i počeli primjenjivati strožije sigurnosne zahtjeve za granična istraživačka radna opterećenja. Naprimjer:

  • Izolacija radnog opterećenja: Sada zahtijevamo snažniju izolaciju („sigurna testna okruženja”) za radna opterećenja koja izvršavaju kod generiran modelom ili drugi nepouzdani kod. To se odnosi i na softver koji bi mogao biti ugrožen tokom obrade izlaznih rezultata modela.
  • Mrežna izolacija: Uveli smo dodatne kontrole za izolaciju nepouzdanih i visokorizičnih radnih opterećenja od interneta. Ove kontrole osmislili smo tako da ugrožavanje jednog radnog opterećenja ili prateće usluge samo po sebi ne omogući neovlašten pristup internetu ili drugim internim mrežama.
  • Kontinuirano sigurnosno testiranje: Ponovo smo konfigurirali okruženje kako bismo uklonili potencijalno ranjive zajedničke usluge, smanjili trajne privilegije te poboljšali sigurnosne granice i granice povjerenja. Poboljšavamo i svoju sposobnost prikupljanja i praćenja sigurnosnih evidencija. Konačno, ulažemo u automatizaciju koja koristi naše modele za kontinuirano testiranje ovih granica simuliranim napadima.

Ove kontrole zajedno pružaju višeslojnu zaštitu i pomažu u odbrani našeg istraživačkog okruženja od napada. Danas zahtijevamo najstrožiji nivo sigurnosnih mjera za radna opterećenja koja uključuju Astru ili kibernetičke modele jer smo utvrdili da modeli Astra možda imaju kritičan nivo kibernetičkih sposobnosti. Ove zaštitne mjere primjenjuju se i na sva druga radna opterećenja povezana s kibernetičkom sigurnošću.

Iako neka treniranja i evaluacije modela Astra ispunjavaju te zahtjeve, znatan broj radnih opterećenja ostaje pauziran dok se u potpunosti ne premjeste i unaprijede kako bi zadovoljila novi sigurnosni standard. Prednost pri prelasku u ova nova okruženja dajemo radnim opterećenjima za sigurnost i usklađivanje.

Proširenje praćenja lanca razmišljanja

Praćenje je već dugo važan dio našeg procesa razvoja modela, uključujući praćenje internih agenata za kodiranje i dugotrajnih sesija. Praćenje smo naročito usmjerili na interne implementacije graničnih modela i granična RL treniranja, koja smo smatrali najrizičnijim radnim opterećenjima jer mogu objediniti napredne sposobnosti modela s pristupom alatima, osjetljivim sistemima te internim ili vanjskim mrežama. Nismo ga primjenjivali na sva izvođenja i treniranja koja koriste alate. Revidirali smo i proširili svoj pristup novim sistemom za praćenje.

Novi sistem praćenja ima više faza. Počinje klasifikatorima aktivacija, detektorima koji pregledaju internu aktivnost modela, a koji se pokreću pri svakom uzorkovanom tokenu i potencijalne probleme prosljeđuju sve naprednijim automatiziranim istražiteljima koji zahtijevaju mnogo računarskih resursa. Ti sistemi pregledaju radnje alata, dostupno rezonovanje i cijeli slijed aktivnosti radi otkrivanja neovlaštenog pristupa, krađe podataka, destruktivnog ponašanja i pokušaja zaobilaženja zaštitnih mjera. Cilj nam je izdati upozorenje u roku od 30 minuta nakon što naš sistem praćenja otkrije zabrinjavajuću aktivnost. Ako sistem praćenja utvrdi vjerovatno kršenje kritične sigurnosne granice, generira upozorenje najvišeg prioriteta. U trenutnoj implementaciji obavještavaju se timovi za sigurnost, zaštitu i istraživanje. Ako u roku od 30 minuta ne mogu nedvosmisleno utvrditi da je oznaka lažno pozitivna, od tih timova očekuje se da pauziraju aktivnost.

Ovo praćenje obavezno je za sva RL treniranja i evaluacije koje uključuju alate za modele sposobnosti Sol ili više. Nakon što smo 7. augusta utvrdili da Astra možda ima kritične kibernetičke sposobnosti, uveli smo dodatni zahtjev praćenja za sva izvođenja Astre s alatima, a ne samo za RL treniranja i evaluacije.

Ove zaštitne mjere zahtijevaju znatne računarske resurse. Prema našim trenutnim procjenama, dodatno računarsko opterećenje praćenja iznosi približno 20% računarskih resursa za izvođenje koje se prati, iako se trošak znatno razlikuje među radnim opterećenjima za treniranje i evaluaciju. Više pojedinosti o ovom sistemu objavit ćemo u predstojećem blogu.

Unapređivanje istraživanja usklađivanja

Istraživanje usklađivanja ključno je za našu misiju. Naša je misija osigurati da opća umjetna inteligencija koristi cijelom čovječanstvu. Kako modeli stječu napredne sposobnosti, poput izvođenja kibernetičkih napada, i djeluju u složenijim okruženjima, neusklađena ponašanja kao što su manipulisanje nagradom (pronalaženje načina za dobivanje visokih nagrada tokom treniranja bez stvarnog postizanja željenog ishoda), obmana ili neovlašten pristup stvarat će sve ozbiljnije rizike.

Za RL treniranja najsposobnijih modela sada primjenjujemo osnovne tehnike usklađivanja u više faza procesa treniranja. To obuhvata poboljšavanje modela nagrađivanja kako bi bolje otkrivali i suzbijali nesigurno ponašanje u različitim zadacima i okruženjima; treniranje modela da iskrenije izvještavaju o svojim radnjama, sposobnostima i ograničenjima; te smanjivanje ponašanja kojima se iskorištavaju slabosti nagrada, ocjenjivača, alata ili nadzora. Također povećavamo obuhvat treniranja za ponašanja koja bi mogla prouzrokovati štetu kada modeli stupaju u interakciju s vanjskim sistemima ili resursima.

Nastavljamo intenzivno ulagati u istraživanje usklađivanja, povećavati obuhvat evaluacija te koristiti stečena saznanja za usmjeravanje treniranja i zaštitnih mjera. Uskoro planiramo objaviti mnogo više informacija o istraživanju usklađivanja, uključujući ono što učimo o ponašanju modela i sve nove izazove koje otkrijemo.

Šta slijedi

Unaprijedit ćemo Okvir pripravnosti kako bismo objedinili ove zaštitne mjere u treniranju i implementaciji te bolje odrazili sposobnosti budućih modela i okruženja u kojima djeluju. Razvoj metoda koje se mogu prilagođavati tim sposobnostima zahtijevat će kontinuirana ulaganja u sigurnost potpomognutu modelima, djelotvornije praćenje i daljnji napredak istraživanja usklađivanja. Namjeravamo uključiti vanjske organizacije i dijeliti više saznanja kako se naš pristup bude razvijao.

Sposobnosti graničnih modela ubrzano napreduju. Naša sposobnost da ih razumijemo, uskladimo i zaštitimo mora ostati korak ispred.


*U narednim sedmicama objavit ćemo tehnički izvještaj o stečenim saznanjima.

Autor

OpenAI