Preskočite na glavni sadržaj
OpenAI

3. septembar 2026.

Sigurnost

Pregled sigurnosti: GPT‑6 Astra

Učitavanje…

Danas objavljujemo GPT‑6 Astra, najsposobniji model koji smo ikada stavili u široku upotrebu. Astra je naš prvi model koji je prema Okviru pripravnosti dostigao kritični nivo sposobnosti u području kibernetičke sigurnosti.

Najvažnije informacije o sigurnosti ovog izdanja su sljedeće:

  1. GPT‑6 Astra predstavlja značajan napredak u kibernetičkim sposobnostima i dostiže naš kritični prag. To znači da GPT‑6 Astra, uz odgovarajuće alate i pristup, može pronaći dosad nepoznate sigurnosne propuste i razviti nove načine njihovog iskorištavanja u mnogim dobro zaštićenim sistemima, a da je osoba ne usmjerava u svakom koraku. Stoga smo znatno ojačali zaštitu od štetnih kibernetičkih radnji modela, bez obzira na to jesu li posljedica zloupotrebe ili neusklađenosti. Poduzeli smo i mjere za zaštitu internog razvoja i implementacije Astre i sličnih modela, uključujući strožu izolaciju, šifriranje kontrolnih tačaka, sveobuhvatan nadzor cjelovitih tokova, uključujući lance misli (CoT), te obaveznu evaluaciju usklađenosti prije interne upotrebe.
  2. GPT‑6 Astra je znatno robusniji od svojih prethodnika. Zahvaljujući novim tehnikama sigurnosne obuke za povećanje robusnosti, GPT‑6 Astra je znatno otporniji na jailbreak napade od modela GPT‑5.6 Sol, uključujući i duže tokove. To znamo na osnovu testova van mreže i našeg programa rigoroznog internog i eksternog testiranja jailbreak napada i otklanjanja otkrivenih slabosti. Za korisnike označene kao potencijalno visokorizične dodatno smo obučili model da svoju granicu odbijanja može postaviti konzervativnije i obuhvatiti širi raspon rizika dvojne namjene. Regresijskim testiranjem provjeravamo otpornost Astre na jailbreak napade pronađene tokom prethodnih razdoblja testiranja, a proveli smo i nove krugove automatiziranog red teaminga s najnovijim internim napadačkim modelima za red teaming kako bismo potvrdili poboljšanja.
  3. GPT‑6 Astra je bolje usklađen od modela GPT‑5.6 Sol. Astra predstavlja značajan napredak u usklađivanju modela, s poboljšanjima koja obuhvataju sve od sastava podataka za predobuku do ocjenjivanja tokom učenja s potkrepljivanjem. Predstavljamo novi skup evaluacija usklađenosti(otvara se u novom prozoru) i utvrdili smo da GPT‑6 Astra bolje poštuje sigurnosne granice i ostaje unutar odobrenog opsega djelovanja. U simulaciji s više od 54.000 internih Codex zadataka(otvara se u novom prozoru), Astra je također dobila približno upola manje oznaka za ozbiljnije neusklađeno ponašanje nego Sol.
  4. Široko uvodimo nadzor neusklađenosti. Usklađivanje modela smatramo glavnim načinom sprečavanja potencijalnog neusklađenog ponašanja naših modela. Međutim, nadzor pruža širok uvid u ponašanje graničnih modela i otkriva mogućnosti za daljnje unapređenje usklađenosti i sigurnosti. Osim toga, nadzor služi kao dodatni sloj zaštite od otkrivenog neusklađenog ponašanja. Zbog toga smo, uz značajne računske troškove, nadzor neusklađenosti dodali svim procesima zaključivanja koji koriste alate u okviru eksterne implementacije Astre. Ovaj sistem odgovara našem internom okruženju.
  5. Mogućnost nadzora modela GPT‑6 Astra smanjena je u odnosu na GPT‑5.6 Sol. Proveli smo opsežna istraživanja mogućnosti nadzora(otvara se u novom prozoru) i mogućnosti kontrole(otvara se u novom prozoru) modela GPT‑6 Astra. Utvrdili smo da GPT‑6 Astra može bolje kontrolirati vlastiti CoT nego GPT‑5.6 Sol te da je manje vjerovatno da će u svoj CoT uključiti informacije koje ga mogu kompromitirati. U suparničkim okruženjima, u kojima model potičemo da izbjegne naše sisteme nadzora, utvrdili smo da može ostati neotkriven kada tokom evaluacija namjerno prikriva performanse (sandbagging) te da ponekad može izbjeći naše interne sisteme nadzora kada se od njega zatraži izvršavanje određenih zadataka sabotaže(otvara se u novom prozoru). Nismo pronašli dokaze steganografskog CoT rezonovanja, poput skrivanja rezonovanja unutar običnog i naizgled nepovezanog teksta, što ukazuje na to da bi rizik od izbjegavanja nadzora uglavnom mogao biti ograničen na zadatke koji zahtijevaju manje rezonovanja.
    • Ovi nalazi ukazuju na to da bi modeli klase Astra u suparničkim uslovima mogli izbjeći naše CoT sisteme nadzora. Ovi se nalazi zasad uglavnom zasnivaju na suparničkim evaluacijama, odnosno situacijama u kojima modelu nalažemo da izbjegne nadzor, dok naše ukupne evaluacije usklađenosti pokazuju da je za Astru općenito manja vjerovatnoća da će prekršiti sigurnosna ograničenja nego za GPT‑5.6 Sol.
    • Međutim, ovaj trend shvatamo ozbiljno i nastavljamo istraživati nalaze i njihove posljedice po mogućnost nadzora dok naši modeli postaju sposobniji. OpenAI je radio na očuvanju i korištenju nadzora lanca misli, a očuvanje mogućnosti nadzora CoT-a jedan je od glavnih ciljeva ovog istraživačkog programa. Međutim, ovi rezultati također naglašavaju važnost razvoja tehnika za reviziju usklađenosti koje nadilaze ispitivanje lanca misli modela.
  6. GPT‑6 Astra odgovornije djeluje tokom pregledavanja interneta i u poslovnim okruženjima: GPT‑6 Astra je znatno otporniji na ubrizgavanje upita od modela GPT‑5.6 Sol. Dodatno smo testirali ponašanje modela u realističnim okruženjima za pregledavanje interneta i profesionalni rad na računaru te utvrdili da je, u poređenju s modelom GPT‑5.6 Sol, znatno manje vjerovatno da će izvršiti neusklađene i potencijalno destruktivne radnje, poput neovlaštenih transakcija, gubitka podataka, prekomjernog pristupa ili zaobilaženja kontrola. Također postupa sigurnije s opasnim zahtjevima u agentskim okruženjima, poput zahtjeva za pomoć pri planiranju nasilnog napada ili izvršenju prevare.
  7. GPT‑6 Astra je znatno sigurniji u scenarijima većeg rizika. GPT‑6 Astra sigurnije od modela GPT‑5.6 Sol odgovara na zahtjevne upite iz produkcijskog okruženja i suparničkog red teaminga koji provode ljudi. Astra ostvaruje Paretovo poboljšanje u sigurnom postupanju po nesigurnim zahtjevima i izbjegavanju nepotrebnog odbijanja bezopasnih zahtjeva. Ova poboljšanja obuhvataju i izuzetno ozbiljne scenarije u kojima rizik od štete proizlazi iz šireg konteksta, a ne iz izričitog zahtjeva. Astra također dosljednije primjenjuje sigurnosne granice primjerene dobi za korisnike mlađe od 18 godina.