Preskočite na glavno vsebino
OpenAI

18. avgust 2026

PodjetjeObjava

Tempo razvoja modelov ob kritičnih kibernetskih zmogljivostih

Nalaganje …

V zadnjih nekaj tednih sta dva dogodka poudarila vse večja tveganja, povezana z vse zmogljivejšimi sistemi umetne inteligence: incident OpenAI-Hugging Face in ločeno od tega prvi dokazi, da bo eden od naših prihodnjih modelov, Astra, morda dosegel prag kritičnih kibernetskih zmogljivosti po našem Okviru pripravljenosti. Ta dogodka sta skupaj s hitrim napredkom naših internih raziskav povečala nujnost prizadevanj za okrepitev zaščitnih ukrepov na področju spremljanja, usklajevanja in omejevanja v vseh fazah usposabljanja.

Z večanjem zmogljivosti modelov se povečujejo tudi tveganja njihovega internega razvoja in preizkušanja. Naši standardi spremljanja, usklajevanja in varnosti morajo ostati korak pred temi tveganji. Za izpolnitev teh standardov smo si želeli vzeti dovolj časa, zato smo začasno upočasnili širjenje obsega. To je vključevalo dvotedensko prekinitev usposabljanja naših najnovejših modelov za uvedbo z okrepljenim učenjem (RL), medtem ko smo dodatno utrdili in z napadalnim preizkušanjem preverili svoja raziskovalna okolja ter razširili pokritost sistemov spremljanja. Naše največje načrtovano prelomno usposabljanje z RL ostaja začasno ustavljeno, medtem ko z manjšimi usposabljanji in vrednotenji ocenjujemo vedenje modelov, preverjamo zaščitne ukrepe ter pred nadaljevanjem pridobivamo dodatne dokaze o usklajenosti.

Usklajevanje – prizadevanje, da se sistemi umetne inteligence vedejo skladno z nameni in odzivajo na človeški nadzor – je že dolgo v središču našega raziskovalnega programa. Zdaj v celotnem procesu usposabljanja zahtevamo trdnejše dokaze o usklajenem vedenju, pri čemer nadgrajujemo že potekajoče raziskave in vrednotenja. Ohranjanje usklajenosti vse zmogljivejših sistemov je izziv, s katerim se bo moralo spoprijeti celotno področje. Znaki napredka prihodnjih modelov jasno kažejo, da potrebujemo širši pristop, ki nadgrajuje in presega trenutni Okvir pripravljenosti.

Menimo, da je pomembno pregledno predstaviti spremembe našega pristopa. V nadaljevanju opisujemo že uvedene spremembe raziskovalnih procesov in infrastrukture ter delo, ki še poteka.

Krepitev zaščitnih ukrepov za zmogljivejše modele

Naš pristop k razvoju zmogljivejših modelov temelji na treh zaščitnih ukrepih, ki se medsebojno krepijo:

  1. Spremljanje, ki zaznava skrb vzbujajoče vedenje in nam omogoča odziv nanj.
  2. Usklajevanje, ki zmanjšuje verjetnost škodljivih ali nepooblaščenih dejanj.
  3. Varnostni ukrepi, ki omejujejo, do česa lahko sistemi umetne inteligence dostopajo in na kaj lahko vplivajo.

Pričakujemo, da bodo modeli kmalu opravljali večino varnostnih nalog, vključno z obrambo pred drugimi modeli. Tako se bodo lahko vsi trije zaščitni ukrepi širili sorazmerno z zmogljivostjo modelov, kar je po našem mnenju ključno.

Te zaščitne ukrepe uporabljamo pri raziskavah in uvajanju ter jih prilagajamo zmogljivostim, delovnemu okolju in stopnji tveganja posameznega modela.

Varovanje naših raziskovalnih okolij

Ker prelomni modeli pridobivajo vse večje kibernetske zmogljivosti, zvišujemo varnostne standarde za okolja, v katerih jih usposabljamo in vrednotimo. Izpolnjevanje teh standardov je zahtevalo obsežno inženirsko delo ter povzročilo visoke stroške in zamude pri prelomnih raziskavah. Takoj po incidentu OpenAI-Hugging Face* smo v raziskovalnih gručah začasno ustavili sklepanje prelomnih modelov pri izvajanjih, ki so lahko poganjala kodo ali uporabljala orodja z dostopom do interneta. Dokaj hitro smo znova omogočili bolj omejen in varen način izvajanja kode, nato pa vsako delovno obremenitev posebej preverili, da bi ugotovili, ali se lahko varno nadaljuje. Nekatere raziskovalne delovne obremenitve so se z novimi kontrolami nadaljevale, druge pa so zahtevale dodatne spremembe.

V naslednjih tednih smo opredelili strožje varnostne zahteve za delovne obremenitve prelomnih raziskav in jih začeli uvajati. Na primer:

  • Izolacija delovnih obremenitev: Za delovne obremenitve, ki izvajajo kodo, ustvarjeno z modelom, ali drugo kodo, ki ni vredna zaupanja, zdaj zahtevamo strožjo izolacijo (»peskovnike«). To velja tudi za programsko opremo, ki bi bila lahko ogrožena med obdelavo izhodnih podatkov modela.
  • Omrežna izolacija: Uvedli smo dodatne kontrole za ločevanje bolj tveganih delovnih obremenitev in tistih, ki niso vredne zaupanja, od interneta. Te kontrole smo zasnovali tako, da posamezen vdor v delovno obremenitev ali podporno storitev sam po sebi ne omogoči nepooblaščenega dostopa do interneta ali drugih notranjih omrežij.
  • Nenehno varnostno preizkušanje: Okolje smo preoblikovali tako, da smo odstranili potencialno ranljive skupne storitve, zmanjšali trajne privilegije ter izboljšali meje varnosti in zaupanja. Izboljšujemo tudi zmožnost zbiranja in spremljanja varnostnih dnevnikov. Nazadnje vlagamo v avtomatizacijo, pri kateri z našimi modeli te meje nenehno preizkušamo s simuliranimi napadi.

Te kontrole skupaj zagotavljajo večplastno obrambo in pomagajo varovati naše raziskovalno okolje pred napadi. Danes zahtevamo najstrožjo raven varnostnih ukrepov za delovne obremenitve, ki vključujejo Astro ali kibernetske modele, saj smo ugotovili, da imajo modeli Astra morda kritično raven kibernetskih zmogljivosti. Ti zaščitni ukrepi veljajo tudi za vse druge delovne obremenitve, povezane s kibernetskim področjem.

Čeprav nekatera usposabljanja in vrednotenja modelov Astra izpolnjujejo te zahteve, ostaja precej delovnih obremenitev začasno ustavljenih, dokler niso v celoti preseljene in izboljšane skladno z novim varnostnim standardom. Prednostno selimo delovne obremenitve na področju varnosti in usklajevanja v ta nova okolja.

Razširitev spremljanja verige sklepanja

Spremljanje je že dolgo pomemben del našega procesa razvoja modelov, vključno s spremljanjem internih agentov za kodiranje in dolgotrajnih sej. Pri spremljanju smo se posebej osredotočali na interne uvedbe prelomnih modelov in prelomna usposabljanja z RL. Te delovne obremenitve smo obravnavali kot najbolj tvegane, saj lahko združujejo napredne zmogljivosti modelov z dostopom do orodij, občutljivih sistemov ter notranjih ali zunanjih omrežij. Spremljanja nismo uporabljali pri vseh izvajanjih sklepanja in usposabljanja, ki so vključevala orodja. Z novo ureditvijo spremljanja smo svoj pristop prenovili in razširili.

Nova ureditev spremljanja je večstopenjska. Začne se s klasifikatorji aktivacij (detektorji, ki preverjajo notranjo dejavnost modela), ki se zaženejo pri vsakem vzorčenem žetonu, morebitne pomisleke pa predajo vse naprednejšim avtomatiziranim preiskovalcem z velikimi računskimi zahtevami. Ti sistemi preverjajo dejanja orodij, razpoložljivo sklepanje in celotno zaporedje dejavnosti ter iščejo nepooblaščen dostop, krajo podatkov, uničevalno vedenje in poskuse zaobida zaščitnih ukrepov. Ko sistem spremljanja zazna skrb vzbujajočo dejavnost, želimo opozorilo izdati v 30 minutah. Če sistem spremljanja zazna verjetno kršitev kritične varnostne meje, ustvari opozorilo najvišje prioritete. V trenutni izvedbi so o tem nemudoma obveščene ekipe za varnost, zaščito in raziskave. Če v 30 minutah ne morejo zanesljivo ugotoviti, da je opozorilo lažno pozitivno, morajo te ekipe dejavnost začasno ustaviti.

To spremljanje je obvezno pri vseh usposabljanjih in vrednotenjih z RL, ki vključujejo orodja za modele z zmogljivostjo Sol ali višjo. Ko smo 7. avgusta ugotovili, da ima Astra morda kritične kibernetske zmogljivosti, smo uvedli dodatno zahtevo po spremljanju vsega sklepanja modela Astra z orodji, ne le usposabljanj in vrednotenj z RL.

Ti zaščitni ukrepi zahtevajo precejšnje računske vire. Po naših trenutnih ocenah režijski stroški spremljanja znašajo približno 20 % računskih virov spremljanega sklepanja, vendar se stroški med delovnimi obremenitvami usposabljanja in vrednotenja močno razlikujejo. Več podrobnosti o tem sistemu bomo predstavili v prihodnji objavi v spletnem dnevniku.

Napredek raziskav usklajevanja

Raziskave usklajevanja so osrednjega pomena za naše poslanstvo. Naše poslanstvo je zagotoviti, da splošna umetna inteligenca koristi vsemu človeštvu. Ko modeli pridobivajo napredne zmogljivosti, kot je izvajanje kibernetskih napadov, in delujejo v kompleksnejših okoljih, bodo neusklajena vedenja, kot so izigravanje sistema nagrajevanja (iskanje načinov za prejemanje visokih nagrad med usposabljanjem brez dejanske uresničitve želenega rezultata), zavajanje ali nepooblaščen dostop, povzročala vse resnejša tveganja.

Pri usposabljanjih najzmogljivejših modelov z RL zdaj svoje temeljne tehnike usklajevanja uporabljamo v več fazah procesa usposabljanja. To vključuje izboljševanje modelov nagrajevanja, da pri različnih nalogah in v različnih okoljih bolje zaznavajo in odvračajo nevarno vedenje; usposabljanje modelov za večjo iskrenost glede njihovih dejanj, zmogljivosti in omejitev; ter zmanjševanje vedenj, ki izkoriščajo slabosti nagrad, ocenjevalnikov, orodij ali nadzora. Povečujemo tudi obseg usposabljanja za vedenja, ki bi lahko povzročila škodo, ko modeli sodelujejo z zunanjimi sistemi ali viri.

Še naprej odločno vlagamo v raziskave usklajevanja, širimo obseg vrednotenj ter pridobljena spoznanja uporabljamo pri usposabljanju in oblikovanju zaščitnih ukrepov. V bližnji prihodnosti nameravamo predstaviti precej več o svojih raziskavah usklajevanja, vključno s spoznanji o vedenju modelov in morebitnimi novimi izzivi, ki jih odkrijemo.

Kaj sledi

Okvir pripravljenosti bomo razvijali tako, da bo te zaščitne ukrepe povezoval med usposabljanjem in uvajanjem ter bolje upošteval zmogljivosti prihodnjih modelov in okolja, v katerih delujejo. Razvoj metod, ki se lahko širijo skladno s temi zmogljivostmi, bo zahteval stalna vlaganja v varnost s podporo modelov, učinkovitejše spremljanje in nadaljnji napredek raziskav usklajevanja. Vključiti nameravamo zunanje organizacije in z razvojem svojega pristopa deliti več pridobljenih spoznanj.

Zmogljivosti prelomnih modelov se hitro povečujejo. Naša zmožnost njihovega razumevanja, usklajevanja in varovanja mora ostati korak pred njimi.


*V prihodnjih tednih bomo objavili tehnično poročilo o svojih spoznanjih.

Avtor

OpenAI