მოდელების შემუშავების ტემპის მართვა კრიტიკული დონის კიბერშესაძლებლობების ეპოქაში
ბოლო რამდენიმე კვირის განმავლობაში ორმა მოვლენამ გამოკვეთა სულ უფრო მძლავრ AI-სისტემებთან დაკავშირებული მზარდი რისკები: OpenAI-სა და Hugging Face-ს შორის მომხდარმა ინციდენტმა და, ცალკე, წინასწარმა მონაცემებმა, რომელთა მიხედვითაც ჩვენი ერთ-ერთი მომავალი მოდელი, Astra, შესაძლოა აკმაყოფილებდეს კიბერუსაფრთხოების კრიტიკული დონის შესაძლებლობის ზღვარს ჩვენი მზაობის ჩარჩოს მიხედვით. ამ მოვლენებმა, ჩვენს შიდა კვლევებში სწრაფ წინსვლასთან ერთად, კიდევ უფრო გადაუდებელი გახადა მუშაობა მონიტორინგის, თანხვედრისა და შეკავების დამცავი ზომების გასაძლიერებლად წვრთნის პროცესის ყველა ეტაპზე.
მოდელების შესაძლებლობების ზრდასთან ერთად მატულობს მათ შიდა შემუშავებასა და გამოცდასთან დაკავშირებული რისკებიც. მონიტორინგის, თანხვედრისა და უსაფრთხოების ჩვენი სტანდარტები ამ რისკებს უნდა უსწრებდეს. ამ სტანდარტების დასაკმაყოფილებლად საჭირო დროის გამოყოფა გვინდოდა, ამიტომ მასშტაბირების ტემპი დროებით შევანელეთ. ამ ფარგლებში ორი კვირით შევაჩერეთ გაშლისთვის განკუთვნილი ჩვენი უახლესი მოდელების განმტკიცებითი დასწავლა (RL), რათა კვლევითი გარემოები კიდევ უფრო დაგვეცვა და მათზე შეტევითი ტესტირება ჩაგვეტარებინა, ასევე გაგვეფართოებინა მონიტორინგის სისტემების დაფარვა. ჩვენი დაგეგმილი, უდიდესი მასშტაბის მოწინავე RL-ის გაშვება კვლავ შეჩერებულია. გაგრძელებამდე მცირე მასშტაბის სწავლებასა და შეფასებებს ვატარებთ, რათა შევაფასოთ მოდელის ქცევა, დავადასტუროთ დამცავი ზომების ეფექტიანობა და თანხვედრის შესახებ მეტი მტკიცებულება მოვიპოვოთ.
თანხვედრაში მოყვანა — მუშაობა იმის უზრუნველსაყოფად, რომ AI-სისტემები სათანადოდ იქცეოდეს და ადამიანის ზედამხედველობას ემორჩილებოდეს — დიდი ხანია ჩვენი კვლევითი პროგრამის საფუძველია. უკვე მიმდინარე კვლევებსა და შეფასებებზე დაყრდნობით, ახლა სწავლების ყველა ეტაპზე თანხვედრაში მოყვანილი ქცევის უფრო მყარ მტკიცებულებას ვითხოვთ. სულ უფრო მძლავრი სისტემების თანხვედრის შენარჩუნება გამოწვევაა, რომლის გადაჭრაც მთელ დარგს მოუწევს. მომავალი მოდელების პროგრესის ნიშნები ცხადყოფს, რომ უფრო ფართო მიდგომა გვჭირდება — მიდგომა, რომელიც არსებულ მზაობის ჩარჩოს დაეფუძნება და მის ფარგლებს გასცდება.
მიგვაჩნია, რომ მნიშვნელოვანია, ჩვენი მიდგომის ცვლილებები გამჭვირვალედ წარმოვაჩინოთ. ქვემოთ აღწერილია ცვლილებები, რომლებიც უკვე შევიტანეთ კვლევის პროცესებსა და ინფრასტრუქტურაში, აგრეთვე ჯერ კიდევ მიმდინარე სამუშაოები.
უფრო მძლავრი მოდელების შემუშავებისადმი ჩვენი მიდგომა სამ ურთიერთგამაძლიერებელ დამცავ ზომას ეფუძნება:
- მონიტორინგი, რომელიც შემაშფოთებელ ქცევას ავლენს და მასზე რეაგირების საშუალებას გვაძლევს.
- თანხვედრაში მოყვანა, რომელიც საზიანო თუ არასანქცირებული მოქმედებების ალბათობას ამცირებს.
- უსაფრთხოების ზომები, რომლებიც ზღუდავს, რაზე შეიძლება ჰქონდეს AI-სისტემებს წვდომა თუ გავლენა.
ვვარაუდობთ, რომ მალე უსაფრთხოების სამუშაოების უმეტესობას მოდელები შეასრულებს, მათ შორის სხვა მოდელებისგან დაცვასაც. ეს სამივე დამცავ ზომას მოდელის შესაძლებლობების შესაბამისად მასშტაბირების საშუალებას მისცემს, რაც გადამწყვეტად მიგვაჩნია.
ამ დამცავ ზომებს კვლევისა და გაშლის ყველა ეტაპზე ვიყენებთ და ვარგებთ თითოეული მოდელის შესაძლებლობებს, საოპერაციო გარემოსა და რისკის დონეს.
მოწინავე მოდელების კიბერუსაფრთხოების შესაძლებლობების ზრდასთან ერთად ვამკაცრებთ იმ გარემოების უსაფრთხოების სტანდარტებს, სადაც მათ ვასწავლით და ვაფასებთ. ამ სტანდარტების დაკმაყოფილებამ მნიშვნელოვანი საინჟინრო სამუშაო მოითხოვა და მოწინავე კვლევებში დიდი ხარჯები და შეფერხებები გამოიწვია. OpenAI-სა და Hugging Face-ს შორის მომხდარი ინციდენტის* შემდეგ დაუყოვნებლივ შევაჩერეთ მოწინავე მოდელების ინფერენსი კვლევით კლასტერებში იმ გაშვებებისთვის, რომლებსაც კოდის შესრულება ან ინტერნეტთან წვდომის მქონე ხელსაწყოების გამოყენება შეეძლო. საკმაოდ სწრაფად აღვადგინეთ კოდის შესრულების უფრო შეზღუდული და უსაფრთხო გზა, შემდეგ კი თითოეული სამუშაო დატვირთვა ცალ-ცალკე შევაფასეთ, რათა დაგვედგინა, შეიძლებოდა თუ არა მისი უსაფრთხოდ განახლება. ზოგიერთი კვლევითი სამუშაო დატვირთვა ამ ახალი კონტროლების პირობებში განახლდა, სხვებს კი დამატებითი ცვლილებები დასჭირდა.
მომდევნო კვირების განმავლობაში განვსაზღვრეთ და დავიწყეთ მოწინავე კვლევითი სამუშაო დატვირთვებისთვის უსაფრთხოების უფრო მკაცრი მოთხოვნების დანერგვა. მაგალითად:
- სამუშაო დატვირთვის იზოლაცია: სამუშაო დატვირთვებისთვის, რომლებიც მოდელის მიერ გენერირებულ ან სხვა არასანდო კოდს ასრულებს, ახლა უფრო მკაცრ იზოლაციას („სენდბოქსებს“) ვითხოვთ. ეს ასევე ეხება პროგრამულ უზრუნველყოფას, რომელიც მოდელის გამონატანების დამუშავებისას შეიძლება კომპრომეტირდეს.
- ქსელის იზოლაცია: მაღალი რისკის შემცველი და არასანდო სამუშაო დატვირთვების ინტერნეტისგან იზოლირებისთვის დამატებითი კონტროლები დავნერგეთ. ეს კონტროლები ისე შევიმუშავეთ, რომ ერთი სამუშაო დატვირთვის ან დამხმარე სერვისის კომპრომეტირებამ თავისთავად არ დაუშვას არასანქცირებული წვდომა ინტერნეტსა თუ სხვა შიდა ქსელებზე.
- უსაფრთხოების უწყვეტი ტესტირება: გარემო ხელახლა დავაკონფიგურირეთ, რათა ამოგვეღო პოტენციურად მოწყვლადი საერთო სერვისები, შეგვემცირებინა მუდმივი პრივილეგიები და გაგვეუმჯობესებინა უსაფრთხოებისა და ნდობის საზღვრები. ასევე ვაუმჯობესებთ ჩვენს შესაძლებლობას უსაფრთხოების ჟურნალების შეგროვებისა და მონიტორინგის მხრივ. ამასთანავე, ინვესტიციას ვდებთ ავტომატიზაციაში და ჩვენს მოდელებს ვიყენებთ, რომ ეს საზღვრები სიმულირებული შეტევებით უწყვეტად შევამოწმოთ.
ერთობლივად ეს კონტროლი უზრუნველყოფს მრავალშრიან დაცვას და ხელს უწყობს ჩვენი კვლევითი გარემოს დაცვას თავდასხმებისგან. ამჟამად უსაფრთხოების უმკაცრეს დამცავ ზომებს ვითხოვთ Astra-სთან ან კიბერმოდელებთან დაკავშირებული სამუშაო დატვირთვებისთვის, რადგან დავადგინეთ, რომ Astra-ს მოდელებს შეიძლება კრიტიკული დონის კიბერშესაძლებლობა ჰქონდეს. ეს დამცავი ზომები კიბერსფეროსთან დაკავშირებულ ყველა სხვა სამუშაო დატვირთვაზეც ვრცელდება.
Astra-ს წვრთნისა და შეფასებების ნაწილი ამ მოთხოვნებს აკმაყოფილებს, თუმცა სამუშაო დატვირთვების მნიშვნელოვანი ნაწილი შეჩერებული დარჩება, სანამ მათ სრულად არ გადავიტანთ და უსაფრთხოების ახალი სტანდარტის დასაკმაყოფილებლად არ გავაძლიერებთ. ამ ახალ გარემოებში პირველ რიგში უსაფრთხოებასა და თანხვედრასთან დაკავშირებული სამუშაო დატვირთვების გადატანას ვანიჭებთ უპირატესობას.
მონიტორინგი დიდი ხანია ჩვენი მოდელების შემუშავების პროცესის მნიშვნელოვანი ნაწილია, მათ შორის შიდა პროგრამირების აგენტების მონიტორინგი და ხანგრძლივი სესიების მონიტორინგი. მონიტორინგში განსაკუთრებულ ყურადღებას ვუთმობდით მოწინავე მოდელების შიდა დანერგვასა და მოწინავე სისტემების RL-წვრთნის გაშვებებს. მათ უმაღლესი რისკის შემცველ სამუშაო დატვირთვებად მივიჩნევდით, რადგან მძლავრი მოდელის შესაძლებლობები შეიძლება შეუთავსოს წვდომას ხელსაწყოებზე, სენსიტიურ სისტემებსა და შიდა თუ გარე ქსელებზე. ისინი ხელსაწყოების გამოყენებით ჩატარებულ ინფერენსისა და სწავლების ყველა გაშვებაზე არ ვრცელდებოდა. მონიტორინგის ახალი კონფიგურაციით ჩვენს მიდგომას გადავხედეთ და გავაფართოვეთ.
მონიტორინგის ახალი სისტემა მრავალეტაპიანია: ის იწყება აქტივაციის კლასიფიკატორებით — დეტექტორებით, რომლებიც მოდელის შიდა აქტივობას ამოწმებს. ისინი თითოეულ შერჩეულ ტოკენზე მუშაობს და პოტენციურ პრობლემებს თანდათან უფრო დახვეწილ, დიდი გამოთვლითი რესურსის მქონე ავტომატიზებულ გამომძიებლებს გადასცემს. ეს სისტემები ხელსაწყოებით შესრულებულ მოქმედებებს, ხელმისაწვდომ მსჯელობასა და აქტივობის სრულ თანმიმდევრობას ამოწმებს, რომ გამოავლინოს არასანქცირებული წვდომა, მონაცემების ქურდობა, დესტრუქციული ქცევა და დამცავი ზომების გვერდის ავლის მცდელობები. ჩვენი მიზანია, მონიტორინგის სისტემის მიერ შემაშფოთებელი აქტივობის გამოვლენიდან 30 წუთში გავცეთ გაფრთხილება. თუ მონიტორინგის სისტემა უსაფრთხოების კრიტიკული საზღვრის სავარაუდო დარღვევას გამოავლენს, ის უმაღლესი პრიორიტეტის გაფრთხილებას ქმნის. ჩვენს ამჟამინდელ რეალიზაციაში შეტყობინება უსაფრთხოების, დაცულობისა და კვლევის გუნდებს ეგზავნება. თუ ისინი 30 წუთის განმავლობაში საბოლოოდ ვერ დაადგენენ, რომ მონიშვნა ცრუ დადებითი შედეგია, ამ გუნდებმა აქტივობა უნდა შეაჩერონ.
ეს მონიტორინგი სავალდებულოა RL-ზე დაფუძნებული ყველა წვრთნისა და შეფასებისთვის, რომლებიც მოიცავს ხელსაწყოებს Sol-ის შესაძლებლობის ან უფრო მაღალი დონის მოდელებისთვის. მას შემდეგ, რაც 7 აგვისტოს დავადგინეთ, რომ Astra-ს შეიძლება კრიტიკული დონის კიბერშესაძლებლობები ჰქონდეს, მონიტორინგის დამატებითი მოთხოვნა დავაწესეთ Astra-ს ყველა ინფერენსზე, რომლებიც ხელსაწყოებს იყენებს (და არა მხოლოდ RL-წვრთნასა და შეფასებებს).
ამ დამცავ ზომებს მნიშვნელოვანი გამოთვლითი რესურსი სჭირდება. ჩვენი ამჟამინდელი შეფასებით, მონიტორინგის დამატებითი დანახარჯი მონიტორინგის ქვეშ მყოფი ინფერენსის გამოთვლითი რესურსის დაახლოებით 20%-ია, თუმცა ღირებულება მნიშვნელოვნად განსხვავდება წვრთნისა და შეფასების სამუშაო დატვირთვების მიხედვით. ამ სისტემის შესახებ დამატებით დეტალებს მომავალ ბლოგპოსტში გაგიზიარებთ.
თანხვედრის კვლევას ჩვენს მისიაში ცენტრალური ადგილი უკავია. ჩვენი მისიაა, ხელოვნური ზოგადი ინტელექტი მთელი კაცობრიობის სასარგებლოდ მოქმედებდეს. როდესაც მოდელები იძენს ისეთ მოწინავე შესაძლებლობებს, როგორიცაა კიბერშეტევის განხორციელება, და უფრო რთულ გარემოებში მოქმედებს, არათანმხვედრი ქცევები — მაგალითად, ჯილდოების სისტემის გატეხა (სწავლებისას მაღალი ჯილდოს მიღების გზების პოვნა დასახული შედეგის რეალურად მიღწევის გარეშე), მოტყუება ან არასანქცირებული წვდომა — სულ უფრო სერიოზულ რისკს შექმნის.
ყველაზე მძლავრ მოდელებში RL-გაშვებებისთვის თანხვედრის ძირითად მეთოდებს ახლა წვრთნის პროცესის მეტ ეტაპზე ვიყენებთ. ეს მოიცავს ჯილდოს მოდელების გაუმჯობესებას სხვადასხვა ამოცანასა და გარემოში სახიფათო ქცევის უკეთ გამოსავლენად და შესაკავებლად; მოდელების წვრთნას, რათა უფრო გულწრფელად აღწეროს თავიანთი მოქმედებები, შესაძლებლობები და შეზღუდვები; ასევე იმ ქცევების შემცირებას, რომლებიც ჯილდოების, შემფასებლების, ხელსაწყოების ან ზედამხედველობის სისუსტეებს იყენებს. ასევე, წვრთნას ვაფართოებთ, რომ მოიცვას ქცევები, რომლებმაც გარე სისტემებთან ან რესურსებთან მოდელების ურთიერთქმედებისას შეიძლება ზიანი გამოიწვიოს.
ვაგრძელებთ თანხვედრის კვლევაში აქტიურ ინვესტირებას, შეფასებების არეალის გაფართოებასა და მიღებული ცოდნის გამოყენებას წვრთნისა და დამცავი ზომების განსასაზღვრად. უახლოეს მომავალში თანხვედრის კვლევის შესახებ გაცილებით მეტის გაზიარებას ვგეგმავთ, მათ შორის იმას, რასაც მოდელის ქცევაზე ვიგებთ, და ჩვენს მიერ აღმოჩენილ ნებისმიერ ახალ გამოწვევას.
მზაობის ჩარჩოს განვაახლებთ, რათა ეს დამცავი ზომები წვრთნისა და გაშლის პროცესებში გავაერთიანოთ და უკეთ ავსახოთ მომავალი მოდელების შესაძლებლობები და გარემო, რომელშიც ისინი მოქმედებს. ამ შესაძლებლობებთან ერთად მასშტაბირებადი მეთოდების შემუშავება მოითხოვს მუდმივ ინვესტიციას მოდელების დახმარებით უზრუნველყოფილ უსაფრთხოებაში, უფრო ეფექტიან მონიტორინგსა და თანხვედრის კვლევის შემდგომ განვითარებაში. ვაპირებთ გარე ორგანიზაციების ჩართვას და მეტი მიღებული ცოდნის გაზიარებას ჩვენი მიდგომის განვითარებასთან ერთად.
მოწინავე მოდელების შესაძლებლობები სწრაფად იზრდება. ამ ზრდას წინ უნდა უსწრებდეს ჩვენი უნარი, გავიგოთ, თანხვედრაში მოვიყვანოთ და დავიცვათ ისინი.
*ჩვენი მიგნებების შესახებ ტექნიკურ ანგარიშს გამოვაქვეყნებთ მომდევნო კვირებში.


