Načítava sa…
Dnes uvádzame GPT‑6 Astra, najvýkonnejší model, aký sme kedy široko nasadili. Astra je náš prvý model, ktorý podľa Rámca pripravenosti dosiahol kritickú úroveň schopností v oblasti kybernetickej bezpečnosti.
Najdôležitejšie informácie o bezpečnosti tohto uvedenia sú tieto:
- GPT‑6 Astra predstavuje výrazný pokrok v kybernetických schopnostiach a spĺňa našu kritickú hranicu. To znamená, že so správnymi nástrojmi a prístupom dokáže GPT‑6 Astra nájsť dovtedy neznáme bezpečnostné chyby a vyvinúť nové spôsoby ich zneužitia v mnohých dobre chránených systémoch bez toho, aby človek usmerňoval každý krok. Preto sme výrazne posilnili ochranné opatrenia proti škodlivým kybernetickým aktivitám modelu, či už by boli dôsledkom zneužitia, alebo nesprávneho nastavenia. Prijali sme aj opatrenia na zabezpečenie interného vývoja a nasadzovania modelu Astra a podobných modelov vrátane prísnejšej izolácie, šifrovania kontrolných bodov, plošného monitorovania celých trajektórií vrátane reťazcov myšlienok (CoT) a procesu hodnotenia zosúladenia, ktorý môže pred interným použitím nasadenie zablokovať.
- GPT‑6 Astra je výrazne odolnejší než jeho predchodcovia. Vďaka novým technikám bezpečnostného trénovania zameraným na odolnosť je GPT‑6 Astra výrazne odolnejší voči jailbreakom než GPT‑5.6 Sol, a to aj pri dlhších trajektóriách. Vieme to z offline testov a nášho programu dôkladného interného aj externého testovania jailbreakov a odstraňovania zistených nedostatkov. Pre používateľov označených za potenciálne vysokorizikových sme model navyše vytrénovali tak, aby dokázal konzervatívnejšie nastaviť hranicu odmietania a pokryť širšiu škálu rizík dvojakého použitia. Pomocou regresného testovania overujeme, či je Astra odolný voči jailbreakom zisteným v predchádzajúcich obdobiach testovania. Zároveň sme uskutočnili nové kolá automatizovaného red teamingu s našimi najnovšími internými útočnými nástrojmi pre red teaming, aby sme overili dosiahnuté zlepšenia.
- GPT‑6 Astra je lepšie zosúladený než GPT‑5.6 Sol. Astra predstavuje výrazný pokrok v zosúladení modelov a zahŕňa zlepšenia od skladby dát na predbežné trénovanie až po hodnotenie počas učenia posilňovaním. Predstavujeme nový súbor hodnotení zosúladenia(otvorí sa v novom okne), podľa ktorého GPT‑6 Astra lepšie rešpektuje hranice bezpečnosti a ochrany a spoľahlivejšie zostáva v rámci svojich oprávnení. V simulácii s viac než 54 000 internými úlohami Codex(otvorí sa v novom okne) dostala Astra približne o polovicu menej označení za závažnejšie prejavy nedostatočne zosúladeného správania než Sol.
- Monitorovanie nesprávneho nastavenia nasadzujeme vo veľkom rozsahu. Zosúladenie modelov považujeme za hlavný nástroj prevencie ich potenciálne nedostatočne zosúladeného správania. Monitorovanie však poskytuje široký prehľad o správaní prelomových modelov a odhaľuje možnosti ďalšieho zlepšovania zosúladenia a bezpečnosti. Monitorovanie navyše slúži ako ďalšia vrstva ochrany pred odhaleným nedostatočne zosúladeným správaním. Z týchto dôvodov sme pri externom nasadení modelu Astra zaviedli monitorovanie nesprávneho nastavenia pri všetkých inferenčných operáciách využívajúcich nástroje, a to aj napriek značným výpočtovým nákladom. Tento systém zodpovedá nášmu internému riešeniu.
- Monitorovateľnosť GPT‑6 Astra sa v porovnaní s GPT‑5.6 Sol znížila. Dôkladne sme preskúmali monitorovateľnosť(otvorí sa v novom okne) a ovládateľnosť(otvorí sa v novom okne) GPT‑6 Astra. Zistili sme, že GPT‑6 Astra dokáže lepšie ovládať vlastný reťazec myšlienok než GPT‑5.6 Sol a menej často v ňom uvádza usvedčujúce informácie. V nepriaznivých podmienkach, keď model nútime vyhýbať sa našim monitorom, dokáže zostať neodhalený pri strategickom znižovaní výkonu počas hodnotení (zahmlievaní potenciálu) a pri pokyne vykonať určité sabotážne úlohy(otvorí sa v novom okne) sa niekedy dokáže vyhnúť našim interným monitorom. Nezistili sme dôkazy o steganografickom uvažovaní v reťazci myšlienok, napríklad o skrývaní uvažovania v bežnom, zdanlivo nesúvisiacom texte. To naznačuje, že riziko vyhýbania sa monitorovaniu sa môže prevažne obmedzovať na úlohy vyžadujúce menej uvažovania.
- Tieto zistenia naznačujú, že modely triedy Astra by sa v nepriaznivých podmienkach mohli vyhnúť našim monitorom reťazca myšlienok. Tieto zistenia zatiaľ vychádzajú najmä z adversariálnych hodnotení, teda zo situácií, keď modelu prikážeme vyhýbať sa monitorovaniu. Naše hodnotenia zosúladenia však celkovo ukazujú, že Astra porušuje bezpečnostné obmedzenia s menšou pravdepodobnosťou než GPT‑5.6 Sol.
- Tento trend však berieme vážne a naďalej skúmame uvedené zistenia aj ich dôsledky pre monitorovateľnosť v čase, keď sú naše modely čoraz výkonnejšie. OpenAI pracuje na zachovaní a využívaní monitorovania reťazca myšlienok, pričom zachovanie monitorovateľnosti CoT je jedným z hlavných cieľov výskumného programu. Tieto výsledky však zároveň zdôrazňujú potrebu vyvíjať techniky auditu zosúladenia, ktoré sa neobmedzujú iba na skúmanie reťazca myšlienok modelu.
- GPT‑6 Astra postupuje pri prehliadaní webu a v pracovnom prostredí zodpovednejšie: GPT‑6 Astra je výrazne odolnejší voči vkladaniu falošných príkazov než GPT‑5.6 Sol. Správanie modelu sme testovali aj v realistických prostrediach na prehliadanie webu a v profesionálnych počítačových prostrediach. Zistili sme, že v porovnaní s GPT‑5.6 Sol vykonáva nedostatočne zosúladené a potenciálne deštruktívne kroky, ako sú neoprávnené transakcie, strata dát, nadmerný prístup či obchádzanie kontrolných mechanizmov, s výrazne menšou pravdepodobnosťou. Bezpečnejšie postupuje aj pri spracovaní škodlivých požiadaviek v agentických prostrediach, napríklad žiadostí o pomoc s plánovaním násilného útoku alebo spáchaním podvodu.
- GPT‑6 Astra je vo vysokorizikových situáciách výrazne bezpečnejší. GPT‑6 Astra reaguje na náročné požiadavky z produkčného prostredia a nepriateľského red teamingu vykonávaného ľuďmi bezpečnejšie než GPT‑5.6 Sol. Astra dosahuje Paretovo zlepšenie pri bezpečnom spracovaní nebezpečných požiadaviek a zároveň sa vyhýba zbytočnému odmietaniu neškodných požiadaviek. Tieto zlepšenia sa týkajú aj veľmi závažných situácií, v ktorých riziko ujmy vyplýva zo širšieho kontextu, nie z explicitnej požiadavky. Astra tiež dôslednejšie uplatňuje bezpečnostné hranice primerané veku používateľov mladších ako 18 rokov.
Ďalšie informácie nájdete v úplnej systémovej karte(otvorí sa v novom okne).
Autor
OpenAI


