Přehled bezpečnosti: GPT‑6 Astra
Načítání…
Dnes vydáváme GPT‑6 Astra, dosud nejschopnější model, který jsme široce nasadili. Astra je náš první model, který podle našeho rámce připravenosti dosáhl kritické úrovně schopností v oblasti kybernetické bezpečnosti.
Nejdůležitější informace o bezpečnosti tohoto vydání jsou následující:
- GPT‑6 Astra představuje významný pokrok v kybernetických schopnostech a dosahuje naší kritické hranice. To znamená, že se správnými nástroji a přístupem dokáže GPT‑6 Astra vyhledávat dosud neznámé bezpečnostní chyby a vyvíjet nové způsoby jejich zneužití v celé řadě dobře chráněných systémů, aniž by člověk musel řídit každý krok. Proto jsme výrazně posílili ochranná opatření proti škodlivým kybernetickým akcím modelu, ať už v důsledku zneužití, nebo nesouladu. Přijali jsme také opatření k zabezpečení interního vývoje a nasazování Astry a podobných modelů, včetně přísnější izolace, šifrování kontrolních bodů, plošného monitorování úplných trajektorií včetně řetězců úvah (CoT) a procesu hodnocení souladu před interním použitím, který může nasazení zablokovat.
- GPT‑6 Astra je výrazně robustnější než její předchůdci. Díky začlenění nových technik bezpečnostního tréninku zaměřených na robustnost je GPT‑6 Astra výrazně robustnější vůči jailbreakům než GPT‑5.6 Sol, a to i v delších trajektoriích. Víme to z offline testů a z našeho programu důkladného interního i externího testování jailbreaků a odstraňování zjištěných nedostatků. Pro uživatele, kteří budou označeni za potenciálně vysoce rizikové, jsme model navíc vytrénovali tak, aby dokázal upravit hranici odmítnutí konzervativnějším směrem a pokrýt širší škálu rizik dvojího užití. Pomocí regresního testování ověřujeme, že je Astra robustní vůči jailbreakům odhaleným v předchozích obdobích testování. Provedli jsme také nová kola automatizovaného red-teamingu s našimi nejnovějšími interními útočnými systémy pro red-teaming, abychom dosažená zlepšení ověřili.
- GPT‑6 Astra je lépe sladěná než GPT‑5.6 Sol. Astra představuje významný pokrok ve sladění modelu a zahrnuje zlepšení od skladby dat pro předtrénování až po hodnocení během učení posilováním. Zveřejňujeme novou sadu hodnocení sladění(otevře se v novém okně), podle níž GPT‑6 Astra lépe dodržuje bezpečnostní hranice a nepřekračuje rozsah svých oprávnění. V simulaci využívající více než 54 000 interních úloh Codexu(otevře se v novém okně) dostala Astra ve srovnání se Sol také přibližně o polovinu méně varování za závažnější projevy nesouladu.
- Monitorování nesouladu nasazujeme v širokém rozsahu. Sladění modelů považujeme za hlavní nástroj k předcházení potenciálním projevům nesouladu našich modelů. Monitorování však poskytuje široký přehled o chování průkopnických modelů a odhaluje příležitosti k dalšímu zlepšování sladění a bezpečnosti. Monitorování navíc slouží jako další vrstva ochrany proti odhaleným projevům nesouladu. Z těchto důvodů jsme také zavedli monitorování nesouladu pro veškeré inference využívající nástroje v rámci externího nasazení Astry, a to za cenu značných výpočetních nákladů. Tento systém odpovídá našemu internímu uspořádání.
- Monitorovatelnost GPT‑6 Astra se oproti GPT‑5.6 Sol snížila. Provedli jsme rozsáhlý výzkum monitorovatelnosti(otevře se v novém okně) a ovladatelnosti(otevře se v novém okně) GPT‑6 Astra. Zjistili jsme, že GPT‑6 Astra dokáže vlastní CoT ovládat lépe než GPT‑5.6 Sol a s menší pravděpodobností do něj zahrnuje inkriminující informace. V adversariálních podmínkách, kdy model nutíme vyhýbat se našim monitorům, dokáže model při strategicky horším výkonu v hodnoceních (skrývání schopností) zůstat neodhalen a při zadání některých sabotážních úloh(otevře se v novém okně) někdy dokáže obejít naše interní monitory. Nezaznamenali jsme důkazy steganografického uvažování v CoT, například ukrývání skrytých úvah v běžném a zdánlivě nesouvisejícím textu. To naznačuje, že riziko obcházení může být do značné míry omezeno na úlohy vyžadující nižší míru uvažování.
- Tato zjištění naznačují, že by modely třídy Astra v adversariálních podmínkách mohly naše monitory CoT obejít. V současnosti tato zjištění z velké části vycházejí z adversariálních hodnocení, tedy situací, kdy modelu nařídíme, aby monitorování obešel. Naše celková hodnocení sladění přitom ukazují, že Astra obecně porušuje bezpečnostní omezení s menší pravděpodobností než GPT‑5.6 Sol.
- Tento trend však bereme vážně a nadále zkoumáme uvedená zjištění i jejich důsledky pro monitorovatelnost s tím, jak se schopnosti našich modelů zvyšují. OpenAI usiluje o zachování a využívání monitorování řetězce úvah a zachování monitorovatelnosti CoT je jedním z hlavních cílů výzkumného programu. Tyto výsledky však zároveň zdůrazňují význam vývoje technik auditu sladění, které se neomezují pouze na zkoumání řetězce úvah modelu.
- GPT‑6 Astra se při procházení webu a práci v profesním prostředí chová zodpovědněji: GPT‑6 Astra je výrazně robustnější vůči útokům typu prompt injection než GPT‑5.6 Sol. Chování modelu jsme navíc testovali v realistických prostředích pro procházení webu a profesionální práci na počítači. Zjistili jsme, že ve srovnání s GPT‑5.6 Sol provádí výrazně méně často akce, které jsou v nesouladu a mohou způsobit škodu, například neautorizované transakce, ztrátu dat, nadměrný přístup nebo obcházení kontrolních mechanismů. Bezpečněji si počíná také při vyřizování škodlivých požadavků v agentních prostředích, například žádostí o pomoc s plánováním násilného útoku nebo spácháním podvodu.
- GPT‑6 Astra je ve scénářích s vyšším rizikem výrazně bezpečnější. GPT‑6 Astra reaguje bezpečněji než GPT‑5.6 Sol na náročné požadavky z reálného provozu i adversariálního lidského red-teamingu. Astra dosahuje Paretova zlepšení: bezpečněji vyřizuje nebezpečné požadavky a zároveň se vyhýbá zbytečnému odmítání neškodných požadavků. Tato zlepšení se týkají i vysoce závažných scénářů, v nichž riziko újmy vyplývá z širšího kontextu, nikoli z výslovného požadavku. Astra také u uživatelů mladších 18 let důsledněji uplatňuje bezpečnostní hranice odpovídající jejich věku.
Další informace najdete v kompletní kartě systému(otevře se v novém okně).
Autor
OpenAI


