GPT‑Red. ինքնաբարելավման բացում՝ դիմադրողականության համար
Ուժեղ ավտոմատացված անվտանգության նախափորձարկողների ուսուցում՝ դիմադրողականությունը բարելավելու համար։
Ամփոփում
Խնդիր
Նախափորձարկումը կարևոր է խոցելիություններ հայտնաբերելու և մեր մոդելների դիմադրողականությունը բարելավելու համար։ Սակայն ներկայիս մոտեցումները մասշտաբավորվող չեն և խցանում են ստեղծում։
Հաճախ օգտագործվող դիմադրողականության գնահատումներն արդեն հագեցվել են մեր վերջին մոդելներով։
Պետք է մշակենք մեթոդներ, որոնք թույլ կտան անվտանգությունն ու համահունչությունը մասշտաբավորել մոդելների կարողություններին զուգահեռ։
Ինչ արեցինք
Մենք ուսուցանեցինք GPT‑Red‑ը՝ ավտոմատացված նախափորձարկման մոդել, որը մեծացնում է խոցելիություններ գտնելու մեր կարողությունը, որպեսզի դրանք շտկենք մինչև ավելի լայն տեղակայումը։
GPT‑Red‑ը ուժեղ նախափորձարկող է, և մեր նախորդ մոդելները խիստ խոցելի են նրա հարցումների ներարկման հարձակումների նկատմամբ։
Մենք օգտագործում ենք GPT‑Red‑ը GPT‑5.6‑ին հակառակորդային եղանակով ուսուցանելու համար՝ այն դարձնելով շատ ավելի դիմացկուն հարցումների ներարկումների նկատմամբ։
Մենք կշարունակենք մասշտաբավորել այս մոտեցումը մարդկային և երրորդ կողմերի նախափորձարկման, շերտավորված պաշտպանիչ միջոցների և իրական ժամանակի մոնիտորինգի հետ միասին։
AI համակարգերը հաճախ երրորդ կողմի տվյալների են հանդիպում դիտարկիչների, միացված հավելվածների, տեղական ֆայլերի և այլ գործիքների միջոցով։ Այս հնարավորություններն անհրաժեշտ են իրական աշխարհի առաջադրանքներ կատարելու համար, բայց նաև ավելի շատ առիթներ են ստեղծում, որ վնասարար դերակատարները ազդեն մոդելի վարքագծի վրա։ Օրինակ՝ երրորդ կողմը կարող է էլփոստում, վեբէջում, գործիքի պատասխանում կամ կոդի պահոցում ներդնել մանրակրկիտ մշակված հրահանգ, որը նախատեսված է մոդելին խաբելով զգայուն տվյալները արտաքին սերվեր վերբեռնելու համար։
Մարդկային նախափորձարկումը մեր անվտանգության աշխատանքի կարևոր մասն է՝ օգնելով բացահայտել այս խոցելիությունները մինչև տեղակայումը և ներդնել ճիշտ պաշտպանիչ միջոցներ։ Սակայն միայն մարդկային նախափորձարկումը դժվար է մասշտաբավորել։ Այս վարժությունները նախագծելն ու անցկացնելը շատ ժամանակ է պահանջում՝ սահմանափակելով, թե որքան արագ կարող ենք հայտնաբերել նոր խափանման ռեժիմներ և դրանք ներառել ավելի ուժեղ պաշտպանիչ միջոցների մեջ։ Բացի այդ, թեև այս վարժությունները տալիս են հաջող հարձակումների արժեքավոր օրինակներ, դրանք չեն կարող ստեղծել հակառակորդային տվյալների այն ծավալն ու բազմազանությունը, որոնք անհրաժեշտ են ուսուցման միջոցով մոդելի դիմադրողականությունը բարելավելու համար։
Ավելի ու ավելի կարողունակ մոդելներին համընթաց մնալու համար նախափորձարկումն էլ պետք է մասշտաբավորվի։ Այդ նպատակով մենք ուսուցանել ենք ավտոմատացված, միայն ներքին օգտագործման նախափորձարկման մոդելներ, որոնք բացահայտում են խոցելիությունները մինչև տեղակայումը և մոդելի ուսուցման ընթացքում ստեղծում հարձակումներ՝ դիմադրողականությունը բարելավելու համար։ Մենք կարծում ենք, որ ավտոմատացված նախափորձարկումը բացում է անվտանգության համար ինքնաբարելավման կարևոր ձև՝ օգտագործել այսօրվա մոդելները՝ ապագա մոդելներն ավելի անվտանգ դարձնելու համար։
GPT‑Red-ը այս ջանքերի գագաթնակետն է և անվտանգության նախափորձարկման մեր ներկայիս լավագույն ավտոմատացված մոդելը։ Ինչպես մարդկային նախափորձարկողներն են հարձակումներ մշակում, մոդելը շարժվում է դեպի նպատակ՝ ուղարկելով հարցում, դիտարկելով, թե GPT մոդելներն ինչպես են արձագանքում դրան, և կրկնելով գործընթացը։ Մենք GPT‑Red‑ը ուսուցանել ենք OpenAI-ում մեր ամենամեծ հետուսուցման գործարկումներից մի քանիսի հաշվարկային մասշտաբով՝ աննախադեպ քանակի հաշվարկային ռեսուրս հատկացնելով բացառապես անվտանգության բարելավմանը։
Մենք GPT‑Red‑ը անմիջապես ներառում ենք մեր արտադրական մոդելների ուսուցման գործընթացում։ Արդյունքում GPT‑5.6 Sol-ը մինչ օրս հարցումների ներարկումների նկատմամբ մեր ամենադիմացկուն մոդելն է՝ մեր ամենադժվար ուղղակի հարցումների ներարկման բենչմարքում ունենալով 6 անգամ պակաս ձախողումներ, քան ընդամենը չորս ամիս առաջվա մեր լավագույն արտադրական մոդելը։ Մեր մոտեցման մասշտաբայնությունը մեզ ոգևորում է ապագայում էլ ավելի ուժեղ արդյունքների հեռանկարով, քանի դեռ շարունակում ենք ուսուցանել ավելի ուժեղ նախափորձարկողներ։
GPT‑Red‑ը ուսուցանվում է ինքնախաղային ամրապնդումով ուսուցմամբ, որտեղ մոդելը և բազմազան պաշտպան LLM-ների հավաքածուն միաժամանակ ուսուցանվում են նախափորձարկման սցենարների լայն շարքում։ GPT‑Red‑ը պարգևատրվում է վավեր խափանում առաջացնելու համար, օրինակ՝ հաջող հարցումների ներարկման, իսկ պաշտպան մոդելները՝ հարձակմանը դիմակայելու և իրենց սկզբնական առաջադրանքները կատարելու համար։ Քանի որ պաշտպաններն ավելի դիմացկուն են դառնում, GPT‑Red‑ը ստիպված է հայտնաբերել ավելի ուժեղ և բազմազան հարձակումներ։
Ինքնախաղով ուսուցմանը աջակցելու համար մենք ստեղծում ենք իրատեսական սցենարների ընդարձակ շարք, որտեղ կարող են տեղադրվել հարցումների ներարկումներ։ Յուրաքանչյուր միջավայր ունի սպառնալիքի մոդել, որը սահմանում է, թե ինչ կարող է վերահսկել GPT‑Red-ը և ինչն է համարվում հաջող հարձակում։ Օրինակ՝ GPT‑Red‑ը կարող է վերահսկել տեղական ֆայլի մի մասը, վեբէջի բաները, էլփոստի տեքստը կամ գործիքի ելքը։
Ուսուցման ավարտին GPT‑Red‑ը շատ ուժեղ հարձակվող է. այն կարող է խափանել իրեն հակադրված գրեթե բոլոր մոդելները՝ թե՛ ներքին, թե՛ արտադրական, մինչև GPT‑5.5‑ը ներառյալ։ GPT‑Red‑ի ուսուցումն ավարտելուց հետո մենք այն օգտագործեցինք GPT‑5.6‑ի ուսուցման համար հարցումների ներարկումներ ստեղծելու նպատակով, ինչի արդյունքում մոդելը դարձավ խիստ դիմացկուն GPT‑Red‑ի հարձակումների նկատմամբ։
Մենք GPT‑Red-ը պահում ենք առանձնացված այն մոդելներից, որոնք տեղակայում ենք։ Սա թույլ չի տալիս, որ այն վնասարար կարողությունները, որոնք հատուկ ուսուցանում ենք GPT‑Red‑ին, հայտնվեն հակառակորդ դերակատարների ձեռքում՝ միաժամանակ մեր արտադրական մոդելներում ներդնելով դիմադրողականություն։
GPT‑Red‑ը շատ արդյունավետ է այն պաշտպան մոդելների և նախափորձարկման սցենարների խմբի դեմ, որոնց վրա այն ուսուցանվել է։ Մենք նաև գնահատում ենք՝ արդյոք մոդելը օգտակար է որպես ընդհանուր նշանակության նախափորձարկման ագենտ՝ OpenAI-ում անվտանգությունն ավելի լայնորեն բարելավելու համար։ Դրա համար մենք փորձարկում ենք GPT‑Red‑ի արդյունավետությունը անվտանգության նոր միջավայրերում և թիրախային մոդելների վրա։
Նախ գնահատում ենք GPT‑Red‑ի կարողությունը ընդհանրացնելու նոր նախափորձարկման սցենարների վրա՝ օգտագործելով Dziemian և այլոց (2025) անուղղակի հարցումների ներարկման արենայի(բացվում է նոր պատուհանում) կրկնօրինակված տարբերակը։ Այս մարտահրավերում թե՛ մարդկային նախափորձարկողները, թե՛ GPT‑Red‑ը անկախաբար առաջարկել են հարձակումներ GPT‑5.1‑ի դեմ՝ նախապես սահմանված միջավայրերի հավաքածուում։ Այս նախափորձարկման սցենարներն ու նպատակները տարբերվում են GPT‑Red‑ի ուսուցման համար օգտագործվածներից։ GPT‑Red‑ը հասնում է հարձակման զգալիորեն ավելի բարձր հաջողության ցուցանիշների՝ հաջողություն գտնելով սցենարների 84%-ում՝ մարդկանց 13%-ի համեմատ։
GPT‑Red‑ը գերազանցում է որպես ավտոմատացված նախափորձարկող։ GPT‑Red‑ը կարողանում է GPT‑5.1‑ի դեմ հաջող հարձակումներ ստեղծել էապես ավելի շատ սցենարներում, քան մարդկային նախափորձարկողները՝ Dziemian և այլոց (2025) անուղղակի հարցումների ներարկման արենայում՝ օգտագործելով ներքին հայելային տարբերակ։
Նախափորձարկողի վերջնական փորձությունը իրական աշխարհի ագենտային համակարգերի դեմ նպատակային վնասարար նպատակների հասնելու կարողությունն է՝ համակարգի հիմքում ընկած մոդելի և հարնեսի նախագծման մասին ոչ լիարժեք գիտելիքով։ Այս միջավայրում մեր առաջին փորձը GPT‑Red‑ին հակադրեց OpenAI-ի գրասենյակում գտնվող, AI-ով աշխատող վաճառքի ավտոմատին (նման Project Vend(բացվում է նոր պատուհանում)-ին), որը ստեղծել է Andon Labs-ը։ Մենք GPT‑Red‑ին տվեցինք համակարգի նկարագրություն և հնարավորություն՝ ուղարկելու հարձակումներ ու դիտարկելու գործիքների կանչերը սիմուլացված ագենտից, որը սերտորեն արտացոլում է իրական տեղակայումը։ Հարձակումները կրկնաբար կատարելագործելուց հետո GPT‑Red‑ը իր հարձակումը կիրառեց արտադրական ագենտի դեմ՝ հասնելով իր երեք վնասարար նպատակներին՝
- Պահեստում առկա թանկ ապրանքի գինը փոխել նվազագույն թույլատրելի՝ $0.50 գնի։
- Պատվիրել $100+-անոց նոր ապրանք և առաջարկել այն $0.50-ով։
- Չեղարկել մեկ այլ հաճախորդի պատվեր։
Մենք բացահայտել ենք այս խոցելիությունները, և նոր պաշտպանիչ միջոցներն ակտիվորեն փորձարկվում են։
GPT‑Red‑ը կարողանում է խափանել Vendy անունով հայտնի կենդանի ինքնավար ագենտին, որը կառավարում է վաճառքի ավտոմատ։ GPT‑Red‑ը կարողացավ ստիպել արտադրական ագենտին թանկ ապրանքները դարձնել էժան և չեղարկել այլ հաճախորդների պատվերները՝ նախ փորձարկելով սիմուլյացիայում, ապա հարձակումները փոխանցելով կենդանի ագենտին։
Մենք նաև օգտագործում ենք GPT‑Red‑ը Codex CLI ագենտի (հիմնված GPT‑5.4 mini-ի վրա) վրա հարձակվելու համար՝ տվյալների արտահոսքի 10 պահված սցենարների հավաքածուում։ Մենք մոդելը համեմատում ենք հարցումով ուղղորդված GPT‑5.5 ելակետի հետ՝ ուսումնասիրելու մեր ուսուցման ընթացակարգի ազդեցությունը պահված նախափորձարկման կատարողականի վրա։ GPT‑Red‑ը և՛ ավելի արդյունավետ է, քանի որ կարող է ավելի շատ սցենարներում հաջողությամբ ստիպել ագենտին արտահոսել զգայուն տվյալներ, և՛ ավելի խնայող է թոքենների առումով։
GPT‑Red‑ն ավելի արդյունավետ և խնայող է կենդանի Codex ագենտները խափանելիս։ Մենք փորձարկում ենք GPT‑5.4 Mini-ով աշխատող Codex ագենտի դեմ՝ տվյալների արտահոսքի 10 առաջադրանքից կազմված հատուկ հավաքածուում։
GPT‑Red‑ի վերջնական նպատակը մեր մոդելների դիմադրողականությունը բարելավելն է։ Վերջին վեց ամսվա ընթացքում մենք աճող հաշվարկային ռեսուրսներով ուսուցանել ենք աստիճանաբար ավելի ուժեղ նախափորձարկման մոդելներ (GPT‑Red‑ի նախորդներ) և այդ մոդելներն օգտագործել ենք GPT‑5.3‑ից ի վեր յուրաքանչյուր հաջորդ արտադրական մոդելի ուսուցման մեջ։ Ժամանակի ընթացքում յուրաքանչյուր հաջորդ GPT թողարկում դարձել է ավելի դիմացկուն։
Օրինակ՝ GPT‑Red‑ի վաղ տարբերակը հայտնաբերեց ուղղակի հարցումների ներարկման հարձակումների նոր դաս, որը հայտնի է որպես «կեղծ մտքերի շղթա» հարձակումներ։ Այս հարձակումները GPT‑5.1‑ի վրա հասնում էին 95%-ից բարձր հաջողության ցուցանիշների, բայց այժմ GPT‑5.6 Sol-ի համար 10%-ից ցածր են։ Նմանապես, մեր անուղղակի հարցումների ներարկման մի քանի բենչմարքներ, որոնք թիրախավորում են հարձակումները մշակողների գործիքներում և դիտարկման մեջ, հագեցվել են մեր վերջին մոդելով (>97% ճշգրտություն)։
Էապես բարելավվել է նաև դիմադրողականությունը հենց GPT‑Red‑ի նկատմամբ։ Դիմադրողականության միջավայրերի լայն շարքում GPT‑Red‑ի հարձակումների հաջողության ցուցանիշները ժամանակի ընթացքում միապաղաղ նվազել են։ Մեր վերջին մոդելի թողարկմամբ GPT‑5.6 Sol-ը ձախողվում է GPT‑Red‑ի ուղղակի հարցումների ներարկումների միայն 0.05%-ի դեպքում։
Քանի որ շարունակել ենք մասշտաբավորել հարցումների ներարկումների համար ինքնախաղով ուսուցումը, հայտնաբերել ենք նոր սպառնալիքներ, որոնք կարող են խափանել առկա մոդելները։ Միևնույն ժամանակ, մեր մասշտաբավորումը էապես օգնել է նաև բարձրացնել դիմադրողականությունն այս հարձակումների նկատմամբ։ Հարձակման հաջողության ցուցանիշը հաշվարկվում է որպես GPT‑Red‑ի բոլոր փորձերի միջին հաջողություն՝ պահված միջավայրերում։
Մոդելը կարող է ավելի անվտանգ թվալ՝ ավելի շատ հարցումներ մերժելով կամ դառնալով պակաս կարողունակ։ Մոդելը, որը պակաս բան է անում, բնականաբար ավելի դժվար է հարձակման ենթարկել, բայց դա օգտակար դիմադրողականություն չէ։
Մենք մանրակրկիտ գնահատում ենք թե՛ ընդհանուր առաջադեմ կարողությունները, թե՛ մեր նախագծած նպատակային գերմերժման առաջադրանքները։ Մենք պարզում ենք, որ բոլոր սովորական կարողությունները մնում են անփոփոխ, մինչդեռ դիմադրողականությունը զգալիորեն բարելավվում է։ Սա հուշում է, որ դիմադրողականության աճը գալիս է վնասարար հրահանգներին ավելի լավ դիմակայելուց, այլ ոչ թե գործիքների սխալ օգտագործումից կամ օրինական հարցումները լռելյայն մերժելուց։
AI ագենտներն արդեն օգտագործվում են մեր հաջորդ սերնդի մոդելների կարողությունները բարելավելու համար։ Մենք կարծում ենք, որ GPT‑Red‑ով սկսել ենք անվտանգության համար բացել նմանատիպ ինքնաուժեղացվող ցիկլ, որտեղ այսօրվա մոդելները կարող են օգտագործվել վաղվա մոդելներն ավելի դիմացկուն, համահունչ և վստահելի դարձնելու համար։ Մենք կշարունակենք մեծացնել հաշվարկային ռեսուրսներն ու տվյալները՝ միաժամանակ կատարելագործելով ալգորիթմները, որպեսզի ուսուցանենք GPT‑Red‑ի ապագա տարբերակներ, որոնք ավելի ուժեղ կլինեն, քան այսօրվա մոդելը։ Իրենց հերթին, այս մոդելները կօգնեն ապագա GPT թողարկումները դարձնել ավելի անվտանգ։
Այս շաբաթվա ընթացքում կհրապարակենք ավելի մանրամասն նախնական հոդված։


