Přeskoč na hlavní obsah
OpenAI
Načítání…

Dnes vydáváme GPT‑6 Astra, dosud nejschopnější model, který jsme široce nasadili. Astra je náš první model, který podle našeho rámce připravenosti dosáhl kritické úrovně schopností v oblasti kybernetické bezpečnosti.

Nejdůležitější informace o bezpečnosti tohoto vydání jsou následující:

  1. GPT‑6 Astra představuje významný pokrok v kybernetických schopnostech a dosahuje naší kritické hranice. To znamená, že se správnými nástroji a přístupem dokáže GPT‑6 Astra vyhledávat dosud neznámé bezpečnostní chyby a vyvíjet nové způsoby jejich zneužití v celé řadě dobře chráněných systémů, aniž by člověk musel řídit každý krok. Proto jsme výrazně posílili ochranná opatření proti škodlivým kybernetickým akcím modelu, ať už v důsledku zneužití, nebo nesouladu. Přijali jsme také opatření k zabezpečení interního vývoje a nasazování Astry a podobných modelů, včetně přísnější izolace, šifrování kontrolních bodů, plošného monitorování úplných trajektorií včetně řetězců úvah (CoT) a procesu hodnocení souladu před interním použitím, který může nasazení zablokovat.
  2. GPT‑6 Astra je výrazně robustnější než její předchůdci. Díky začlenění nových technik bezpečnostního tréninku zaměřených na robustnost je GPT‑6 Astra výrazně robustnější vůči jailbreakům než GPT‑5.6 Sol, a to i v delších trajektoriích. Víme to z offline testů a z našeho programu důkladného interního i externího testování jailbreaků a odstraňování zjištěných nedostatků. Pro uživatele, kteří budou označeni za potenciálně vysoce rizikové, jsme model navíc vytrénovali tak, aby dokázal upravit hranici odmítnutí konzervativnějším směrem a pokrýt širší škálu rizik dvojího užití. Pomocí regresního testování ověřujeme, že je Astra robustní vůči jailbreakům odhaleným v předchozích obdobích testování. Provedli jsme také nová kola automatizovaného red-teamingu s našimi nejnovějšími interními útočnými systémy pro red-teaming, abychom dosažená zlepšení ověřili.
  3. GPT‑6 Astra je lépe sladěná než GPT‑5.6 Sol. Astra představuje významný pokrok ve sladění modelu a zahrnuje zlepšení od skladby dat pro předtrénování až po hodnocení během učení posilováním. Zveřejňujeme novou sadu hodnocení sladění(otevře se v novém okně), podle níž GPT‑6 Astra lépe dodržuje bezpečnostní hranice a nepřekračuje rozsah svých oprávnění. V simulaci využívající více než 54 000 interních úloh Codexu(otevře se v novém okně) dostala Astra ve srovnání se Sol také přibližně o polovinu méně varování za závažnější projevy nesouladu.
  4. Monitorování nesouladu nasazujeme v širokém rozsahu. Sladění modelů považujeme za hlavní nástroj k předcházení potenciálním projevům nesouladu našich modelů. Monitorování však poskytuje široký přehled o chování průkopnických modelů a odhaluje příležitosti k dalšímu zlepšování sladění a bezpečnosti. Monitorování navíc slouží jako další vrstva ochrany proti odhaleným projevům nesouladu. Z těchto důvodů jsme také zavedli monitorování nesouladu pro veškeré inference využívající nástroje v rámci externího nasazení Astry, a to za cenu značných výpočetních nákladů. Tento systém odpovídá našemu internímu uspořádání.
  5. Monitorovatelnost GPT‑6 Astra se oproti GPT‑5.6 Sol snížila. Provedli jsme rozsáhlý výzkum monitorovatelnosti(otevře se v novém okně) a ovladatelnosti(otevře se v novém okně) GPT‑6 Astra. Zjistili jsme, že GPT‑6 Astra dokáže vlastní CoT ovládat lépe než GPT‑5.6 Sol a s menší pravděpodobností do něj zahrnuje inkriminující informace. V adversariálních podmínkách, kdy model nutíme vyhýbat se našim monitorům, dokáže model při strategicky horším výkonu v hodnoceních (skrývání schopností) zůstat neodhalen a při zadání některých sabotážních úloh(otevře se v novém okně) někdy dokáže obejít naše interní monitory. Nezaznamenali jsme důkazy steganografického uvažování v CoT, například ukrývání skrytých úvah v běžném a zdánlivě nesouvisejícím textu. To naznačuje, že riziko obcházení může být do značné míry omezeno na úlohy vyžadující nižší míru uvažování.
    • Tato zjištění naznačují, že by modely třídy Astra v adversariálních podmínkách mohly naše monitory CoT obejít. V současnosti tato zjištění z velké části vycházejí z adversariálních hodnocení, tedy situací, kdy modelu nařídíme, aby monitorování obešel. Naše celková hodnocení sladění přitom ukazují, že Astra obecně porušuje bezpečnostní omezení s menší pravděpodobností než GPT‑5.6 Sol.
    • Tento trend však bereme vážně a nadále zkoumáme uvedená zjištění i jejich důsledky pro monitorovatelnost s tím, jak se schopnosti našich modelů zvyšují. OpenAI usiluje o zachování a využívání monitorování řetězce úvah a zachování monitorovatelnosti CoT je jedním z hlavních cílů výzkumného programu. Tyto výsledky však zároveň zdůrazňují význam vývoje technik auditu sladění, které se neomezují pouze na zkoumání řetězce úvah modelu.
  6. GPT‑6 Astra se při procházení webu a práci v profesním prostředí chová zodpovědněji: GPT‑6 Astra je výrazně robustnější vůči útokům typu prompt injection než GPT‑5.6 Sol. Chování modelu jsme navíc testovali v realistických prostředích pro procházení webu a profesionální práci na počítači. Zjistili jsme, že ve srovnání s GPT‑5.6 Sol provádí výrazně méně často akce, které jsou v nesouladu a mohou způsobit škodu, například neautorizované transakce, ztrátu dat, nadměrný přístup nebo obcházení kontrolních mechanismů. Bezpečněji si počíná také při vyřizování škodlivých požadavků v agentních prostředích, například žádostí o pomoc s plánováním násilného útoku nebo spácháním podvodu.
  7. GPT‑6 Astra je ve scénářích s vyšším rizikem výrazně bezpečnější. GPT‑6 Astra reaguje bezpečněji než GPT‑5.6 Sol na náročné požadavky z reálného provozu i adversariálního lidského red-teamingu. Astra dosahuje Paretova zlepšení: bezpečněji vyřizuje nebezpečné požadavky a zároveň se vyhýbá zbytečnému odmítání neškodných požadavků. Tato zlepšení se týkají i vysoce závažných scénářů, v nichž riziko újmy vyplývá z širšího kontextu, nikoli z výslovného požadavku. Astra také u uživatelů mladších 18 let důsledněji uplatňuje bezpečnostní hranice odpovídající jejich věku.