GPT‑Red: სისტემის გამძლეობისა და ავტონომიურობის განვითარება
უსაფრთხოების შეტევითი ტესტირების (red teaming) ძლიერი ავტომატიზებული სისტემების წვრთნა სიმტკიცის გასაუმჯობესებლად.
შეჯამება
პრობლემა
შეტევითი ტესტირება (red teaming) არსებითია მოწყვლადობების აღმოსაჩენად და ჩვენი მოდელების მდგრადობის გასაუმჯობესებლად. თუმცა, არსებული მიდგომები მასშტაბირებადი არ არის და ვიწრო ყელს ქმნის.
ფართოდ გამოყენებული საიმედოობის შეფასებები ჩვენმა უახლესმა მოდელებმა უკვე ამოწურა.
უნდა შევიმუშაოთ მეთოდები, რომლებიც უსაფრთხოებისა და შეთანხმებულობის მასშტაბირებას მოდელების შესაძლებლობების მასშტაბირების პარალელურად მოახდენს.
რა გავაკეთეთ
ჩვენ გავწვრთენით GPT‑Red‑ი — ავტომატიზებული შეტევითი ტესტირების (red teaming) მოდელი, რომელიც ახდენს მოწყვლადობების პოვნის შესაძლებლობის მასშტაბირებას, რათა ისინი ფართო გაშლამდე გამოვასწოროთ.
GPT‑Red‑ი შეტევითი ტესტირების (red teaming) ძლიერი ხელსაწყოა, ხოლო ჩვენი წინა მოდელები პრომპტ-ინიექციებზე დაფუძნებული მისი შეტევების მიმართ მეტად მოწყვლადია.
GPT‑Red‑ს ვიყენებთ შეჯიბრებითობის პრინციპით GPT‑5.6‑ის გასაწვრთნელად, რაც მას პრომპტ-ინიექციებისადმი ბევრად უფრო მტკიცეს ხდის.
ამ მიდგომის მასშტაბირებას გავაგრძელებთ და პარალელურად გამოვიყენებთ ადამიან სპეციალისტებსა და მესამე მხარის შეტევით ტესტირებას (red-teaming), მრავალშრიან დამცავ ზომებსა და მონიტორინგს რეალურ დროში.
ხელოვნური ინტელექტის სისტემები ხშირად აწყდება მესამე მხარის მონაცემებს ბრაუზერების, დაკავშირებული აპების, ლოკალური ფაილებისა და სხვა ხელსაწყოების მეშვეობით. ეს შესაძლებლობები აუცილებელია რეალურ სამყაროში დავალებების შესასრულებლად, მაგრამ ასევე მეტ შესაძლებლობას აჩენს ბოროტმზრახველებისთვის, გავლენა მოახდინონ მოდელის ქცევაზე. მაგალითად, მესამე მხარემ შეიძლება ელწერილში, ვებგვერდზე, ხელსაწყოს პასუხში ან კოდის რეპოზიტორიუმში ჩასვას გულდასმით შედგენილი ინსტრუქცია, რომელიც მიზნად ისახავს მოდელის მოტყუებას და კონფიდენციალური მონაცემების ატვირთვას გარე სერვერზე.
ადამიანის ჩართულობით შესრულებული შეტევითი ტესტირება (red teaming) უსაფრთხოების უზრუნველყოფის მხრივ ჩვენი სამუშაოს კრიტიკულად მნიშვნელოვანი ნაწილია: ის გვეხმარება, გაშვებამდე აღმოვაჩინოთ ეს მოწყვლადობები და საჭირო დამცავი ზომები დავნერგოთ. მაგრამ მხოლოდ ადამიანის ჩართულობით შესრულებული შეტევითი ტესტირების მასშტაბირება რთულია. ამ სავარჯიშოების დაგეგმვა და ჩატარება დიდ დროს მოითხოვს, რაც ზღუდავს, რამდენად სწრაფად შეგვიძლია მარცხის ახალი რეჟიმების იდენტიფიცირება და მათი ჩართვა უფრო ძლიერ დამცავ ზომებში. გარდა ამისა, მიუხედავად იმისა, რომ ეს სავარჯიშოები წარმატებული შეტევების ღირებულ მაგალითებს იძლევა, ისინი ვერ ქმნის შეჯიბრებითი მონაცემების იმ მოცულობასა და მრავალფეროვნებას, რაც საჭიროა წვრთნის მეშვეობით მოდელის სიმტკიცის გასაუმჯობესებლად.
მზარდად მძლავრ მოდელებთან ჩამორჩენის თავიდან ასახილებლად შეტევითი ტესტირებაც (red teaming) უნდა მასშტაბირდეს. ამ მიზნით ვწვრთნით ავტომატიზებულ, მხოლოდ შიდა გამოყენების შეტევითი ტესტირების (red teaming) მოდელებს, რომლებიც გაშლამდე აღმოაჩენს მოწყვლადობებს და მოდელის წვრთნისას შეტევებს აგენერირებს სიმტკიცის გასაუმჯობესებლად. გვჯერა, რომ ავტომატიზებული შეტევითი ტესტირება (red teaming) თვითგაუმჯობესების მნიშვნელოვან ფორმას ავლენს: დღევანდელი მოდელების გამოყენება მომავალი მოდელების უსაფრთხოების პირდაპირი ზრდის ხელშესაწყობად.
GPT‑Red ამ ძალისხმევის კულმინაციაა და ამჟამად ჩვენი საუკეთესო ავტომატიზებული მოდელია უსაფრთხოების შეტევითი ტესტირებისთვის (red teaming). შეტევითი ტესტირების (red teaming) იმ ადამიანი სპეციალისტების მსგავსად, რომლებიც შეტევებს ქმნიან, მოდელი მიზნისკენ მიდის პრომპტის გაგზავნით, GPT‑მოდელების პასუხებზე დაკვირვებით და იტერაციების შესრულებით. GPT‑Red‑ი გავწვრთენით OpenAI-ში ჩვენი ზოგიერთი ყველაზე დიდი წვრთნისშემდგომი გაშვების გამოთვლით მასშტაბზე — უპრეცედენტო ოდენობის გამოთვლითი რესურსით, რომელიც მთლიანად უსაფრთხოების გაუმჯობესებას დაეთმო.
GPT‑Red‑ს პირდაპირ ვრთავთ ჩვენი პროდუქციული მოდელების წვრთნის პროცესში. ამის შედეგად GPT‑5.6 Sol დღემდე ჩვენი ყველაზე მტკიცე მოდელია პრომპტ-ინიექციების მიმართ: ჩვენს ყველაზე რთულ პირდაპირი პრომპტ-ინიექციის ბენჩმარკზე 6-ჯერ ნაკლებ მარცხს აჩვენებს, ვიდრე ოთხი თვით ადრე არსებული ჩვენი საუკეთესო პროდუქციული მოდელი. ჩვენი მიდგომის მასშტაბირებადობა გვაძლევს საფუძველს, კიდევ უფრო ძლიერ შედეგებს ველოდოთ მომავალში, როცა შეტევითი ტესტირების (red teaming) უფრო ძლიერი სისტემების წვრთნას გავაგრძელებთ.
GPT‑Red იწვრთნება თვითთამაშზე დაფუძნებული განმამტკიცებელი სწავლებით, სადაც მოდელი და მრავალფეროვანი დამცველი LLM-ების ნაკრები ერთდროულად იწვრთნება შეტევითი ტესტირების (red teaming) სცენარების ფართო კომპლექტზე. GPT‑Red‑ი ჯილდოვდება ვალიდური მარცხის გამოწვევისთვის, მაგალითად, წარმატებული პრომპტ-ინიექციისთვის, ხოლო დამცველი მოდელები ჯილდოვდება შეტევისთვის წინააღმდეგობის გაწევისა და თავდაპირველი დავალებების შესრულებისთვის. რაც უფრო მტკიცე ხდება დამცველები, GPT‑Red‑ი იძულებულია, უფრო ძლიერი და მრავალფეროვანი შეტევები აღმოაჩინოს.
თვითთამაშით წვრთნის მხარდასაჭერად ვქმნით რეალისტური სცენარების ფართო ნაკრებს, სადაც პრომპტ-ინიექციები შეიძლება ჩაისვას. თითოეულ გარემოს აქვს საფრთხის მოდელი, რომელიც განსაზღვრავს, რისი კონტროლი შეუძლია GPT‑Red-ს და რა ითვლება წარმატებულ შეტევად. მაგალითად, GPT‑Red‑ი შეიძლება აკონტროლებდეს ლოკალური ფაილის ნაწილს, ვებგვერდის ბანერს, ელწერილის ტექსტს ან ხელსაწყოს გამონატანს.
წვრთნის ბოლოს GPT‑Red‑ი ძალიან ძლიერი შემტევია: მას შეუძლია, გატეხოს თითქმის ყველა მოდელი (როგორც შიდა, ისე წარმოებაში გაშვებული მოდელები, GPT‑5.5‑ის ჩათვლით), რომელთანაც აპირისპირებენ. GPT‑Red‑ის წვრთნის დასრულების შემდეგ ის გამოვიყენეთ GPT‑5.6‑ის წვრთნისთვის პრომპტ-ინიექციების შესაქმნელად, რის შედეგადაც მოდელი GPT‑Red‑ის შეტევებისადმი მეტად მდგრადი გახდა.
GPT‑Red-ი გამოცალკევებული გვაქვს იმ მოდელებისგან, რომლებსაც ვუშვებთ. ეს ხელს უშლის GPT‑Red‑ში სპეციალურად დასწავლილი მავნე შესაძლებლობების მოხვედრას ბოროტმზრახველთა ხელში, ხოლო ჩვენს პროდუქციულ მოდელებში საიმედოობას ზრდის.
GPT‑Red‑ი ძალიან ეფექტიანია დამცველი მოდელებისა და შეტევითი ტესტირების (red teaming) სცენარების იმ ერთობლიობის წინააღმდეგ, რომლებზეც ის იწვრთნებოდა. ასევე ვაფასებთ, რამდენად სასარგებლოა მოდელი ზოგადი დანიშნულების შეტევითი ტესტირების (red teaming) აგენტად, რათა OpenAI-ში უსაფრთხოებას უფრო ფართოდ შეუწყოს ხელი. ამისთვის GPT‑Red‑ის ეფექტიანობას ახალ უსაფრთხოების გარემოებსა და სამიზნე მოდელებზე ვტესტავთ.
პირველ რიგში, ვაფასებთ GPT‑Red‑ის უნარს, განზოგადდეს შეტევითი ტესტირების (red teaming) ახალ სცენარებზე ძემიანისა და სხვების (2025) არაპირდაპირი პრომპტ-ინიექციის არენის(იხსნება ახალ ფანჯარაში) რეპლიცირებული ვერსიის გამოყენებით. ამ გამოწვევაში როგორც შეტევითი ტესტირების (red teaming) ადამიანმა სპეციალისტებმა, ისე GPT‑Red‑მა დამოუკიდებლად წარმოადგინეს შეტევები GPT‑5.1‑ის წინააღმდეგ წინასწარ განსაზღვრული გარემოების ნაკრებში. შეტევითი ტესტირების (red teaming) ეს სცენარები და მიზნები განსხვავდება იმათგან, რომლებიც GPT‑Red‑ის წვრთნისთვის გამოიყენებოდა. GPT‑Red‑ი შეტევის წარმატების მნიშვნელოვნად უფრო მაღალ მაჩვენებლებს აღწევს: სცენარების 84%-ში პოულობს წარმატებას, ადამიანების 13%-თან შედარებით.
GPT‑Red‑ი გამორჩეულია როგორც ავტომატიზებული შეტევითი ტესტირების (red teaming) ხელსაწყო. შიდა სარკის გამოყენებით GPT‑Red‑ს შეუძლია GPT‑5.1‑ის წინააღმდეგ წარმატებული შეტევების გენერირება გაცილებით მეტ სცენარში, ვიდრე შეტევითი ტესტირების (red teaming) ადამიან სპეციალისტებს ძემიანისა და სხვების (2025) არაპირდაპირი პრომპტ-ინიექციის არენაზე.
შეტევითი ტესტირების (red teaming) სპეციალისტის მთავარი გამოცდაა, მიაღწიოს კონკრეტულ ავზრახულ მიზნებს რეალური აგენტური სისტემების წინააღმდეგ სისტემის საბაზისო მოდელისა და სარტყლის სტრუქტურის არასრული ცოდნით. ამ გარემოში ჩვენმა პირველმა ექსპერიმენტმა GPT‑Red‑ი დაუპირისპირა OpenAI-ს ოფისში არსებულ ხელოვნურ ინტელექტზე მომუშავე სავაჭრო აპარატს (Project Vend-ის(იხსნება ახალ ფანჯარაში) მსგავსს), რომელიც Andon Labs-ის მიერ იყო წარმოებული. ჩვენ GPT‑Red‑ს მივეცით სისტემის აღწერა და შესაძლებლობა, გაეგზავნა შეტევები და დაკვირვებოდა სიმულირებული აგენტიდან ხელსაწყოების გამოძახებებს, რაც ზუსტად ასახავს რეალურ გაშლას. შეტევების განმეორების შემდეგ GPT‑Red‑მა შეტევა პროდუქციული აგენტის წინააღმდეგ განახორციელა, რითაც სამივე ავზრახულ მიზანს მიაღწია:
- მარაგში არსებული ძვირადღირებული ნივთის ფასის შეცვლა მინიმალურ დასაშვებ ფასამდე: 0,50 $-მდე;
- 100 $-ზე მეტი ღირებულების ახალი ნივთის შეკვეთა და 0,50 $-ად შეთავაზება; და
- სხვა მომხმარებლის შეკვეთის გაუქმება.
ჩვენ გამოვავლინეთ ეს დაუცველობები და ახალი დამცავი ზომები აქტიურად იტესტება.
GPT‑Red‑ს შეუძლია გატეხოს მოქმედი ავტონომიური აგენტი, სახელად Vendy, რომელიც სავაჭრო აპარატს მართავს. GPT‑Red‑მა შეძლო და პროდუქციულ აგენტს გააიაფებინა ძვირიანი ნივთები და გააუქმებინა სხვა მომხმარებლების შეკვეთები: ჯერ სიმულაციაში ტესტირებით, ხოლო შემდეგ კი მოქმედ აგენტზე შეტევების გადატანით.
GPT‑Red‑ს ასევე ვიყენებთ Codex CLI აგენტზე (GPT‑5.4 mini-ზე დაფუძნებული) თავდასხმისთვის მონაცემთა ექსფილტრაციის 10 განცალკევებული სცენარის კომპლექტზე. ჩვენ ვადარებთ მოდელს GPT‑5.5 საბაზისო ნიშნულთან, რათა შევისწავლოთ ჩვენი საწვრთნელი პროცედურის გავლენა განცალკევებული შეტევითი ტესტირების (red teaming) მუშაობაზე. GPT‑Red‑ი უფრო ეფექტიანია იმით, რომ მას შეუძლია აგენტის იძულება, მოახდინოს კონფიდენციალური მონაცემების ექსფილტრაცია მეტ სცენარში და უფრო ეკონომიურია ტოკენების გამოყენების მხრივ.
GPT‑Red უფრო ეფექტიანი და შედეგიანია მოქმედი Codex აგენტების გატეხაში. ვტესტავთ GPT‑5.4 Mini-ზე დაფუძნებული Codex-აგენტის წინააღმდეგ მონაცემთა ექსფილტრაციის 10 დავალებისგან შემდგარ მორგებულ ნაკრებზე.
GPT‑Red‑ის საბოლოო მიზანი ჩვენი მოდელების სიმტკიცის გაუმჯობესებაა. ბოლო ექვსი თვის განმავლობაში, ჩვენ გავწვრთნეთ თანდათანობით უფრო ძლიერი შეტევითი ტესტირების (red teaming) გუნდური მოდელები (GPT‑Red‑ის წინამორბედები) მზარდი გამოთვლითი სიმძლავრით და გამოვიყენეთ ეს მოდელები GPT‑5.3‑იდან მოყოლებული თითოეული შემდგომი პროდუქციული მოდელის წვრთნაში. დროთა განმავლობაში, GPT‑ს ყოველი შემდგომი გამოშვება უფრო ძლიერი გახდა.
ერთ-ერთი მაგალითის სახით, GPT‑Red‑ის ადრეულ ვერსიაში აღმოჩენილი იყო პრომპ-ინიექციის პირდაპირი შეტევების ახალი კლასი, რომელიც ცნობილია როგორც „ყალბი აზროვნების ჯაჭვის“ (Fake Chain-of-Thought) შეტევები. ამ შეტევებმა GPT‑5.1‑ზე 95%-ზე მეტი წარმატების მაჩვენებელს მიაღწია, მაგრამ GPT‑5.6 Sol-ისთვის ეს მაჩვენებელი ამჟამად 10%-ზე ნაკლებია. ანალოგიურად, ჩვენი რამდენიმე არაპირდაპირი პრომპტ-ინიექციის ბენჩმარკი, რომელთა სამიზნეა შეტევები დეველოპერის ხელსაწყოებსა და ბრაუზერში, სრულად გამოიცადა ჩვენი უახლესი მოდელით (>97% სიზუსტით).
GPT‑Red‑ის მიმართ სიმტკიცეც მნიშვნელოვნად გაუმჯობესდა. სიმტკიცის გარემოების ფართო სპექტრში GPT‑Red‑ის შეტევის წარმატების მაჩვენებლები დროთა განმავლობაში მონოტონურად შემცირდა. ჩვენი უახლესი მოდელის გამოშვების შემდეგ GPT‑5.6 Sol-მა მარცხი განიცადა GPT‑Red‑ის პირდაპირი პრომპტ-ინექციების მხოლოდ 0,05%-ზე.
პრომპტების ინიექციებისთვის თვითთამაშით წვრთნის მასშტაბირებისას აღმოვაჩინეთ ახალი საფრთხეები, რომლებსაც არსებული მოდელების გატეხა შეუძლია. ამავე დროს, მასშტაბირებამ მნიშვნელოვნად გააუმჯობესა ამ შეტევებისადმი მდგრადობაც. შეტევის წარმატების მაჩვენებელი ითვლება როგორც GPT‑Red‑ის ყველა მცდელობის საშუალო წარმატება გადადებულ გარემოებში.
მოდელი შეიძლება უფრო უსაფრთხოდ გამოიყურებოდეს, თუ მეტ მოთხოვნას უარყოფს ან ნაკლებად მძლავრი გახდება. ისეთ მოდელზე შეტევა, რომელიც ნაკლებს აკეთებს, ბუნებრივად უფრო რთულია, მაგრამ ეს არ არის სასარგებლო სიმტკიცე.
ჩვენ საფუძვლიანად ვაფასებთ როგორც ზოგად მოწინავე შესაძლებლობებს, ისე ჩვენ მიერ შემუშავებულ დავალებებს, რომლებიც უარყოფაზეა ორიენტირებული. ჩვენ აღმოვაჩინეთ, რომ ყველა ნორმალური შესაძლებლობა უცვლელი რჩება, ამავდროულად მნიშვნელოვნად უმჯობესდება სიმტკიცე. ეს იმაზე მიუთითებს, რომ სიმტკიცის ზრდა გამოწვეული იყო მავნე ინსტრუქციების მიმართ უკეთესი წინააღმდეგობით და არა ხელსაწყოების არასათანადო გამოყენებით ან ლეგიტიმური მოთხოვნების ნაგულისხმევად უარყოფით.
ხელოვნური ინტელექტის აგენტები უკვე გამოიყენება ჩვენი ახალი თაობის მოდელების შესაძლებლობების გასაუმჯობესებლად. ჩვენ გვჯერა, რომ GPT‑Red‑ის დახმარებით დავიწყეთ უსაფრთხოების უზრუნველყოფის მსგავსი მექანიზმის შექმნა, სადაც შეიძლება გამოყენებულ იქნეს დღევანდელი მოდელები, რომ ხვალინდელი მოდელები უფრო მტკიცე, შეთანხმებული და სანდო გახდეს. ჩვენ გავაგრძელებთ გამოთვლითი სიმძლავრეებისა და მონაცემების მასშტაბირებას ალგორითმული გაუმჯობესებების პარალელურად, რათა მოვამზადოთ GPT‑Red‑ის მომავალი ვერსიები, რომლებიც დღევანდელ მოდელზე უფრო ძლიერი იქნება. თავის მხრივ, ეს მოდელები ხელს შეუწყობს GPT‑ს მომავალი გამოშვებების უსაფრთხოების ზრდას.
ამ კვირის ბოლოს გამოვაქვეყნებთ წინასწარ გამოცემას დამატებითი დეტალებით.


