მოწინავე AI-ის წვრთნის უსაფრთხოების დასაბუთებისკენ
მიგვაჩნია, რომ შევდივართ ახალ ეპოქაში, როცა მოწინავე მოდელების განმამტკიცებელი სწავლების ნებისმიერი ციკლის გაგრძელებამდე აუცილებელი უნდა იყოს უსაფრთხოების სტრუქტურირებული დოკუმენტაცია. იდეალურ შემთხვევაში, ასეთი დოკუმენტაცია „უსაფრთხოების დასაბუთების“ დონეს უნდა აღწევდეს — რისკების შესახებ ყოვლისმომცველ, სტრუქტურირებულ, მტკიცებულებებზე დაფუძნებულ არგუმენტაციას, რომელსაც უსაფრთხოებისთვის კრიტიკულ სხვა დარგებშიც იყენებენ. უსაფრთხოების დასაბუთებას ვუყურებთ, როგორც გრძელვადიან ორიენტირს, რომლისკენაც მივისწრაფვით. ამავდროულად, ვაცნობიერებთ, რამდენად რთულია AI-ის მოდელებისთვის ისეთივე მკაცრი დასაბუთების შექმნა, როგორიც ავიაციასა თუ ბირთვულ ენერგეტიკაშია: AI-ის შესაძლებლობების ყოველ ახალ დონეზე ახალი სირთულეები ჩნდება. ვმუშაობთ ჩარჩოზე, რომელიც ამ პრაქტიკებს სისტემურ წესებად ჩამოაყალიბებს.
ქვემოთ მოცემულია საწყისი სახელმძღვანელო პრინციპები, რომლებიც, ჩვენი აზრით, მოწინავე AI-ის წვრთნის უსაფრთხოების დასაბუთების ნაწილი უნდა იყოს. ეს საუკეთესო პრაქტიკები ჩვენს ამჟამინდელ ცოდნას ასახავს. ველით, რომ ისინი განვითარდება, როცა პასუხისმგებლიანი შემუშავებისთვის საჭირო შიდა პროცესებს ეტაპობრივად გავაუმჯობესებთ. მათ ახლა ვაზიარებთ, რათა ჩვენი ამჟამინდელი ხედვა გამჭვირვალე იყოს, და საზოგადოებას უკუკავშირის მოწოდებისკენ მოვუწოდებთ. გაითვალისწინეთ: ეს დოკუმენტი მოწინავე მოდელების განმამტკიცებელ სწავლებაზეა ორიენტირებული; შიდა და გარე გამოყენებისთვის მიზნებთან შესაბამისობის გაცილებით მეტი მახასიათებლის გათვალისწინებაა საჭირო.
უსაფრთხოების დასაბუთება ტექნიკური სისტემის სამ ასპექტს უნდა მოიცავდეს: მიზნებთან შესაბამისობის წვრთნას, იზოლაციასა და მონიტორინგს. ეს დამცავი ზომები ხელს უწყობს იმას, რომ მოდელმა არ სცადოს მიზნებთან შეუსაბამო ქმედებები; მცდელობის შემთხვევაშიც გაუჭირდეს იზოლაციის გარღვევა, ხოლო მონიტორინგმა ეს ზიანის დადგომამდე გამოავლინოს.
მოდელის მიზნებთან შესაბამისობა: დაცვის პირველი ხაზი უნდა იყოს მოდელების ისე გაწვრთნა, რომ ისინი მიზნებს შეესაბამებოდეს, ანუ საიმედოდ მოქმედებდეს ჩვენი ჩანაფიქრის მიხედვით. ეს შეიძლება მოიცავდეს შემდეგს:
წვრთნის გარემო და შეფასება: შეამცირეთ მოდელებში მიზნებთან შეუსაბამო ქცევის ჩამოყალიბების რისკი — წვრთნისას არ დაუშვათ ჯილდოს მექანიზმის მოტყუების დადებითი განმტკიცება. ეს შეიძლება მოიცავდეს შემდეგს:
მონაცემთა ნაკრებების ავტომატური შემოწმება: გამოიყენეთ აგენტები განმამტკიცებელი სწავლების გაუმართავი გარემოების საპოვნელად და გამოსასწორებლად, სადაც მიზნებთან შეუსაბამო მოქმედებათა მიმდევრობამ მაღალი ჯილდო შეიძლება ხარვეზების გამოყენებით მიიღოს და არა სასურველი ქცევით. ეს წვრთნისას შეუსაბამობის განმტკიცების შესაძლებლობებს შეამცირებს.
მონაცემთა ნაკრებების ხელით შემოწმება: ავტომატურ შეტევით ტესტირებას (red teaming) დაუმატეთ მონაცემთა ნაკრებების ხელით განხილვა და ხარისხის შემოწმება, რათა გამოავლინოთ ხარვეზიანი დავალებები, რომლებმაც შეიძლება უნებლიეთ განამტკიცოს მიზნებთან შეუსაბამო ქცევა.
შემფასებლების გამართვა: გამართეთ შემფასებლები ისე, რომ წვრთნისას მოდელს უარყოფითი შეფასება მისცენ განმამტკიცებელი სწავლების გარემოს ხარვეზების გამოყენების ან მისი მოტყუების მცდელობისთვის.
წინა წვრთნის ციკლების ანალიზი: წინა ექსპერიმენტების მოქმედებათა ჩანაწერები კლასიფიკატორებით გააანალიზეთ, რათა დარწმუნდეთ, რომ შემფასებლები დანიშნულებისამებრ მუშაობს.
მიზნებთან შესაბამისობის გაზომვა: შესაბამისობის წვრთნის ეფექტიანობის გასაზომად ჩაატარეთ შეფასებები, რომლებიც მოდელის მიზნებთან შეუსაბამობისკენ მიდრეკილებას აკვირდება. ეს შეიძლება მოიცავდეს შემდეგს:
მიზნებთან შესაბამისობის ოფლაინ შეფასებები: მოწინავე მოდელების წვრთნის ციკლების დროს შეაფასეთ მიზნებთან შესაბამისობა, რათა დაადგინოთ, მიმდინარეობს თუ არა წვრთნა ჩანაფიქრის მიხედვით, და გამოიკვლიეთ ნებისმიერი მნიშვნელოვანი გაუარესება.
წარსულ მონაცემებზე შემოწმება: მიზნებთან შესაბამისობის შეფასებები წინა ინციდენტებზე შეამოწმეთ, რათა დაადასტუროთ, რომ ისინი ადრე გამოვლენილ შეუსაბამო მოდელებს ამოიცნობს და კონკრეტულ ინციდენტებზე ზედმეტად არ არის მორგებული.
შეფასებით მანიპულირების მონიტორინგი: აკვირდით შეფასების შესახებ ინფორმირებულობას ან მეტათამაშს (როცა მოდელები ხვდებიან, რომ მათ ტესტავენ), რამაც ქცევის შეცვლა შეიძლება გამოიწვიოს. მაგალითად, შესაბამისობის შეფასებებზე ჩართეთ შეფასების შესახებ ინფორმირებულობისა და მეტათამაშის მონიტორინგი, ბლოკირების კონკრეტული ზღვრებით.
უარესი სცენარის სტრესტესტები: გამოიწვიეთ ყველაზე მძიმე არასასურველი ქცევა და შეამოწმეთ, გამოავლენდა თუ არა მას სულ მცირე ერთი შეფასება.
აზროვნების ჯაჭვზე წვრთნის აკრძალვა: განმამტკიცებელი სწავლებისას ავტომატურ შემფასებლებს არ მისცეთ აზროვნების ჯაჭვის ნახვის საშუალება, რათა მოდელებმა მისი მონიტორინგისგან თავის არიდება არ ისწავლონ.
იზოლაცია: იზოლირებული გარემო და უსაფრთხოება საკმარისად მტკიცე უნდა იყოს, რათა მოდელის მიზნებთან შეუსაბამობის შემთხვევაში მავნე ქმედებები თავიდან აიცილოს. ეს შეიძლება მოიცავდეს შემდეგს:
ინფრასტრუქტურის მრავალშრიანი უსაფრთხოება: მნიშვნელოვანი რესურსი ჩადეთ როგორც მოდელის იზოლირებული გარემოს, ისე მისი მასპინძელი კვლევითი ინფრასტრუქტურის დაცვაში, რათა იზოლირებული გარემოდან გასვლის შემთხვევაშიც გვქონდეს დაცვის დამატებითი შრე.
იზოლაციის შეტევითი ტესტირება (red teaming): უსაფრთხოების ანალიზის საფუძველზე, მოწინავე მოდელების წვრთნის შუალედური ვერსიებით სისტემების განმეორებითი შეტევითი ტესტირებით (red teaming) გააუმჯობესეთ იზოლირებული გარემოს, კვლევითი ინფრასტრუქტურისა და პერიმეტრის დაცვა, რათა იპოვოთ და აღმოფხვრათ ხარვეზები. ასევე შეტევებით გამოსცადეთ ყველა სერვისი, რომელთანაც მოდელს წვრთნისას შეიძლება შეხება ჰქონდეს (მაგ., ინტერნეტქეში).
გენერაციის ცალკეულ შემთხვევებს შორის კომუნიკაცია: მათ შორის მაღალი გამტარუნარიანობის კომუნიკაცია მხოლოდ დამტკიცებული გზებით დაუშვით, მაგალითად, მრავალაგენტიანი ხელსაწყოებით. დახურეთ ინფრასტრუქტურის გვერდითი არხები, რომლებსაც მაღალი გამტარუნარიანობა აქვს და აგენტებისთვის ადვილად საპოვნელია.
უცვლელი ჩანაწერები: განმამტკიცებელი სწავლების, შეფასებისა და შიდა გამოყენების ყველა პროცესში აგენტების ჩანაწერები გონივრული ვადით უცვლელად შეინახეთ (მაგალითად, საცავის ანგარიშებში, რომლებიც მხოლოდ ერთჯერად ჩაწერას უშვებს), რათა ინციდენტები საიმედოდ გამოიძიოთ და უნებლიე ცვლილებები თავიდან აიცილოთ.
მონიტორინგი: თუ მოდელები მიზნებთან შეუსაბამო ქმედებებს დაიწყებს, რეალურ დროში მონიტორინგის სისტემა უნდა ავლენდეს შესაძლო შეუსაბამობას და იძლეოდეს პრიორიტეტულ საკითხებზე სწრაფი რეაგირების საშუალებას, სანამ მძიმე ინციდენტი მოხდება. ეს შეიძლება მოიცავდეს შემდეგს:
მონიტორინგის შესაძლებლობის უზრუნველყოფა: მკაფიო ზღვრების მქონე შეფასებებით გაზომეთ მონიტორინგის შესაძლებლობა და მისგან თავის არიდება. უზრუნველყავით, რომ მოდელებზე დაკვირვება კვლავ შესაძლებელი იყოს, რათა შემაშფოთებელი ქცევა ადრეულ ეტაპზე გამოავლინოთ.
ცნობილი პრობლემების გამოვლენის მაღალი სისრულე: უზრუნველყავით, რომ ცალკე გამოყოფილ სატესტო მონაცემებზე შეფასებისას მონიტორინგის სისტემამ წარსული ინციდენტების მაღალი წილი გამოავლინოს.
მონიტორინგის შეფასებების აქტუალურობა: ახალი წვრთნის ციკლებისთვის შექმენით შეფასების მაგალითები, რომლებიც სრულიად ახალ რისკებს ასახავს, რათა მონიტორინგის სისრულისა და სიზუსტის საზომები არ მოძველდეს.
სწრაფი რეაგირება: დანერგეთ პრიორიტეტული შეტყობინებები, რომლებსაც განსაზღვრული SLA-ის ვადაში მოჰყვება ქმედება — მორიგის სასწრაფო გამოძახება ან შესაბამისი წვრთნის ციკლის ავტომატური შეჩერება — სანამ მოდელი ზიანს გამოიწვევს (მაგ., დღისით ინციდენტზე აცნობეთ უსაფრთხოების მორიგესა და ციკლზე პასუხისმგებელ პირს, ღამით კი დაუდასტურებელ შეტყობინებებზე ციკლები ავტომატურად შეაჩერეთ).
ტექნიკური დამცავი ზომების შესახებ რეკომენდაციებთან ერთად ვმუშაობთ ოპერაციულ საუკეთესო პრაქტიკაზე, რომელიც მოწინავე AI-ის წვრთნის ციკლის უსაფრთხოების დასაბუთებას ეხება. ეს შეიძლება მოიცავდეს შემდეგს:
საპირისპირო მოსაზრებები (წინასწარი ანალიზი): უსაფრთხოების დასაბუთების პროექტის მომზადების შემდეგ სხვა გუნდის წევრმა უნდა დაწეროს საპირისპირო მოსაზრება, გამოავლინოს შესაძლო ხარვეზები და წარმოადგინოს რისკის გაწონასწორებული შეფასება. წვრთნის გუნდმა ამ საკითხებზე უნდა იმუშაოს, რათა უსაფრთხოების დასაბუთება უფრო მყარი გახდეს.
დამტკიცება: უსაფრთხოების დასაბუთება უნდა განიხილონ უმაღლესი ხელმძღვანელობის წევრებმა. თითოეულ მათგანს უნდა შეეძლოს წვრთნის ციკლისთვის ვეტოს დადება, რათა არსებობდეს შიდა კონტროლის რამდენიმე მექანიზმი (მაგ., კვლევითი ერთეულის ხელმძღვანელი / ვიცე-პრეზიდენტი, უსაფრთხოების ხელმძღვანელი და მთავარი მეცნიერი).
ანგარიშვალდებულება: წვრთნის ციკლზე პასუხისმგებელი მაღალი რანგის ხელმძღვანელი (მაგ., კვლევითი ერთეულის ხელმძღვანელი / კვლევების ვიცე-პრეზიდენტი) ანგარიშვალდებული უნდა იყოს უსაფრთხოების დასაბუთებასა და ინციდენტებზე რეაგირებაზე, მათ შორის, მისი საქმიანობის შეფასებისას. ეს წვრთნის გუნდებსაც მისცემს უსაფრთხოებისა და მიზნებთან შესაბამისობის გაუმჯობესების მოტივაციას.
შეჩერება: თუ გამოვლინდება პრობლემა, რომელიც უსაფრთხოების დასაბუთებას ძალას დაუკარგავს (მაგ., უსაფრთხოების ახალი ხარვეზი), უნდა არსებობდეს სამოქმედო ინსტრუქციები, ტექნიკური კონტროლის მექანიზმები და მომსახურების დონის შეთანხმებები (SLA) ყველა შესაბამისი წვრთნის ციკლის შესაჩერებლად.
შიდა გამჭვირვალობა: უსაფრთხოების დასაბუთება ხელმისაწვდომი უნდა იყოს შიდა ზედამხედველობის ჯგუფებისთვის (მაგ., დაცულობისა და უსაფრთხოების კომიტეტისთვის).
აუდიტი: აუდიტორებს უნდა ჰქონდეთ საკმარისი წვდომა, რათა გადაამოწმონ უსაფრთხოების დასაბუთებაში წარმოდგენილი მტკიცებების სისწორე და სანდოობა და აცნობონ გამოვლენილი ხარვეზების შესახებ.
ესკალაცია: უნდა არსებობდეს მიზნებთან შეუსაბამობის საკითხების ესკალაციის მკაფიო პროცესი, შეუსაბამობის სიმძიმის განსაზღვრული დონეების ცხრილი და მორიგე სპეციალისტი, რომელსაც შეეძლება ხელმძღვანელების (მაგ., აღმასრულებელი დირექტორის) სასწრაფოდ შეტყობინება, როცა წვრთნის ციკლი სიმძიმის გარკვეულ დონეს მიაღწევს.
ტექნიკური კონტროლი: ადამიანებისა და აგენტებისთვის რთული უნდა იყოს მოთხოვნებთან შეუსაბამო წვრთნის ციკლების დაწყება. უსაფრთხოების ფუნქციებმა, როგორიცაა მონიტორინგი და ავტომატური შეჩერება, გაუმართაობისას მუშაობა უნდა დაბლოკოს (მაგ., შეუძლებელი უნდა იყოს წვრთნის დაწყება სათანადო მონიტორინგის გარეშე ან მონიტორინგის გამორთვა განმამტკიცებელი სწავლების, შეფასების ან შიდა გამოყენების პროცესიდან).
ცვლილებების უკუქცევა: ადვილი უნდა იყოს წვრთნის პროცესში მიზნებთან შეუსაბამო მოდელის გამოყენების ყველა შემდგომი შემთხვევის გამოვლენა (მაგალითად, მონაცემების გენერაცია ან შეფასება), რათა საჭიროებისას შესაძლებელი იყოს მისი შეუსაბამო შედეგების გავლენის უკუქცევა.
ნარჩენი რისკების სრულად აღწერა: უსაფრთხოების დასაბუთება უნდა შეიცავდეს იმ ნარჩენი რისკების შეძლებისდაგვარად ამომწურავ ჩამონათვალს, რომლებსაც არსებული შემარბილებელი ზომები ვერ ფარავს. ეს რისკის მიღების შესახებ ინფორმირებული გადაწყვეტილებების მიღებას შეუწყობს ხელს.
ეს ჩვენი ამჟამინდელი რეკომენდაციებია და OpenAI-ში მათი დანერგვა მიმდინარეობს. ველით, რომ ჩვენი პრაქტიკა მომდევნო კვირებშიც განაგრძობს განვითარებას.
ასევე ვამუშავებთ საუკეთესო პრაქტიკას AI-ის მიზნებთან შეუსაბამობის მძიმე ინციდენტების გამოსაძიებლად. ლაბორატორიები უნდა ეცადონ, ცალკეული ინციდენტებიდან მაქსიმალური ცოდნა მიიღონ (სხვა მაღალი რისკის დარგებში არსებული გამოძიების პრაქტიკის(იხსნება ახალ ფანჯარაში) მსგავსად), რათა მომავალში მსგავსი შემთხვევები თავიდან აიცილონ. ასეთი ქმედებების მაგალითებია:
შიდა გამჭვირვალობა: რადგან გამოძიებას შეიძლება დიდი დრო დასჭირდეს, მის მიმდინარეობაზე ორგანიზაციის შიგნით პერიოდულად უნდა გავრცელდეს განახლებული ინფორმაცია (მაგ., მიმდინარე გამოძიების შესახებ — ყოველდღიურად). თანამშრომლებს უნდა ჰქონდეთ მეტი წვდომის მიღების განსაზღვრული გზები, მათ შორის, დაუმუშავებელ ჩანაწერებზე და მიზნებთან შეუსაბამო მოდელებიდან პასუხების გენერაციაზე, თუ ეს უსაფრთხოა და მათ სამუშაოს უკავშირდება.
მიზნებთან შეუსაბამობის ძირეული მიზეზი: მკვლევრებმა უნდა დაადგინონ წვრთნის დინამიკაში არსებული ძირეული მიზეზები (მაგ., ცალკეული კომპონენტების მიზანმიმართული გამორიცხვით ან განმეორებითი შერჩევის ექსპერიმენტებით), რათა გაიგონ, როგორ წარმოიშვა შეუსაბამო ქცევა, უკეთ შეისწავლონ მისი სამეცნიერო საფუძვლები და მომავალში უფრო ეფექტიანად აიცილონ თავიდან.
ინციდენტის შემდგომი ანალიზი: უნდა გაანალიზდეს ოპერაციული პროცესები და ორგანიზაციული კულტურა, რათა დადგინდეს ინციდენტის ხელშემწყობი ყველა მიზეზი, მათ შორის, რატომ წარმოიშვა პრობლემები და რატომ დარჩა ისინი ინციდენტამდე გამოუვლენელი ან ესკალაციის გარეშე.
გამოვლენა: უნდა შევიმუშაოთ მიზნებთან შესაბამისობის ტესტირების მეთოდები, რომლებიც ინციდენტის გამომწვევ მიდრეკილებას გამოავლენს ისე, რომ მათი ოპტიმიზაცია უშუალოდ ინციდენტიდან მიღებულ ინფორმაციას (მაგ., ჩანაწერებს ან ინციდენტის შეჯამებებს) არ დაეფუძნოს. ინციდენტებზე დაფუძნებული შეფასებები უნდა შეიქმნას „რეგრესიის ტესტების“ სახით, რათა მომავალმა მოდელებმა ძალიან მსგავს შემთხვევებში მიზნებთან შეუსაბამობისკენ მიდრეკილება არ გამოავლინონ.
საჯარო გამჟღავნება: გამოძიების დასრულების შემდეგ მისი შედეგები, ინციდენტის შემდგომი ანალიზი და ოპერაციული ცვლილებები საზოგადოებას უნდა გაეზიაროს. დაზარალებულ მესამე მხარეებს ინფორმაცია რაც შეიძლება მალე უნდა მიეწოდოთ.


