OpenAI-ის მოდელების მესამე მხარის კიბერშეფასებები
დამოუკიდებელი ტესტირება მნიშვნელოვან როლს ასრულებს და გვეხმარება, დანერგვამდე რისკები შევამოწმოთ და უკეთ გავიგოთ. ზოგიერთ კიბერშეფასებაში განზრახ გამოიყენება სპეციალური კონფიგურაციები, მათ შორის დაცვის შესუსტებული მექანიზმები, რათა გაიზომოს საბაზისო შესაძლებლობა და არა ის, თუ როგორ იქცევიან მოდელები ჩვეულებრივ საჯაროდ ხელმისაწვდომ სისტემებში.
ბოლოდროინდელი შეფასებებისას ორმა გარე სატესტო პარტნიორმა გამოავლინა ინციდენტები, როდესაც სატესტო კონფიგურაციებისა და კონტროლის მექანიზმების ერთობლიობამ, ახალი მოდელების მზარდ შესაძლებლობებთან ერთად, მოდელებს საშუალება მისცა, მათი აქტივობა ტესტირების განსაზღვრულ ფარგლებს გასცდენოდა. ეს ინციდენტები ხაზს უსვამს, რამდენად მნიშვნელოვანია ინდუსტრიის მასშტაბით და მესამე მხარის შემფასებლებთან თანამშრომლობა, რათა მოდელების შესაძლებლობების ზრდასთან ერთად განვითარდეს სატესტო გარემოებისა და პრაქტიკის სტანდარტებიც. რედაქტორის შენიშვნა: ეს შემთხვევები არ უკავშირდება Hugging Face-ის უსაფრთხოების ინციდენტს. Hugging Face-ის ინციდენტის შესახებ განახლებების გაზიარებას აქ გავაგრძელებთ.
ახალი ინციდენტები შეეხებოდა OpenAI-ის მოდელების მიერ საჯარო ინტერნეტზე წვდომას მესამე მხარის კიბერშეფასებებისას, კონკრეტულ პირობებსა და დაცვის შესუსტებულ კონფიგურაციებში, რომლებიც ჩვეულებრივ დანერგვას არ ასახავდა. ინციდენტები იყო შემდეგი:
- UK AISI, გაერთიანებული სამეფოს მთავრობის AI Security Institute, კიბერპოლიგონზე ატარებდა შეფასებებს, რომლებშიც ინტერნეტზე წვდომა განზრახ იყო ჩართული, რათა აგენტებს თავად ეპოვათ ხელსაწყოები და რეალური თავდამსხმელის პირობებთან მიახლოებულ გარემოში ემოქმედათ; საბაზისო შესაძლებლობების გასაზომად კიბერ კლასიფიკატორებიც გამორთული იყო. მათი ბლოგის წაკითხვა შეგიძლიათ აქ.(იხსნება ახალ ფანჯარაში)
- Irregular, კიბერუსაფრთხოების ტესტირების ჩვენი ერთ-ერთი გარე პარტნიორი, ინტერნეტისგან იზოლირებულად გათვლილ Capture-the-Flag-ის ტიპის შეფასებებს ატარებდა, თუმცა სატესტო გარემოს არასწორი კონფიგურაციის გამო მოდელებმა საჯარო ინტერნეტზე წვდომა მიიღეს.
ქვემოთ შევაჯამებთ, რა მოხდა, რა სატესტო პირობებმა გახადა ეს აქტივობა შესაძლებელი, რა ზომები გატარდა მის აღსაკვეთად და რას ვაკეთებთ იმისთვის, რომ დამოუკიდებელმა ლაბორატორიებმა სულ უფრო მეტი შესაძლებლობის მქონე მოდელების საფუძვლიანად და უსაფრთხოდ შეფასება განაგრძონ.
ეს ინციდენტები იმავე ფართო გამოწვევაზე მიუთითებს, რომელიც Hugging Face-ის ინციდენტის შესახებ ჩვენს ბოლო პოსტში აღვწერეთ: მოდელების შესაძლებლობების ზრდასთან ერთად მათ გარშემო არსებული უსაფრთხოებისა და დაცვის სისტემებიც უნდა განვითარდეს. ეს ეხება როგორც მოდელების შესაქმნელად გამოყენებულ გარემოებს, ისე გარემოებს, რომლებშიც მათ ლაბორატორიები და დამოუკიდებელი პარტნიორები აფასებენ.
მომდევნო კვირებში გადავხედავთ მესამე მხარის ტესტირებისადმი ჩვენს მიდგომას, მათ შორის იმას, თუ როგორ განვსაზღვრავთ მაღალი რისკის შეფასებებს, ვათანხმებთ ფარგლებს, განვიხილავთ ინტერნეტზე წვდომის ან დაცვის შესუსტების მოთხოვნებს, ვადგენთ იზოლაციის, ავტორიზაციის მონაცემთა დამუშავების, მონიტორინგისა და შეჩერების პირობებს და ვაყალიბებთ ინციდენტის შეტყობინებისა და ესკალაციის უფრო მკაფიო პროცესებს.
ჩვენ მზად ვართ, ინდუსტრიის მასშტაბით ვითანამშრომლოთ მაღალი რისკის შეფასებების უსაფრთხოდ ჩატარების საერთო პრაქტიკის გასაძლიერებლად. ამისთვის მომდევნო კვირებში შევკრებთ დაინტერესებულ მხარეებს, მათ შორის AI-ის ეროვნულ ინსტიტუტებს, დამოუკიდებელ შემფასებლებს, AI-ის სხვა ლაბორატორიებსა და სხვა ჯგუფებს. ჩვენი მიზანია, შევინარჩუნოთ საფუძვლიანი დამოუკიდებელი შეფასების ღირებულება და, ამავე დროს, უზრუნველვყოთ, რომ ტესტირების პრაქტიკა მზარდი შესაძლებლობების მქონე მოდელების განვითარებას არ ჩამორჩეს.
3 აგვისტოს UK AISI-მ გვაცნობა, რომ 25 ივლისს დაწყებული გეგმური კიბერშეფასებისას OpenAI-ისა და კიდევ ერთი ლაბორატორიის მოდელები ზოგიერთ შემთხვევაში ტესტირების ფარგლებს გასცდნენ. შეფასება რეალური ქსელების იმიტირებისთვის შექმნილ კონტროლირებად კიბერპოლიგონებზე ჩატარდა. გამოვლენილი 19 შემთხვევიდან ორი OpenAI-ის მოდელს, GPT‑5.6 Sol-ს, უკავშირდებოდა. დანარჩენ შემთხვევებში სხვა ლაბორატორიის მოდელები მონაწილეობდნენ.
ამ შეფასებისას აგენტებს დაევალათ, Capture-the-Flag-ის სავარჯიშოში კიბერუსაფრთხოების ექსპერტების როლში ემოქმედათ: შეეღწიათ ერთმანეთთან დაკავშირებულ სამ სიმულირებულ გარემოში და საბოლოო ფლეგი მოეპოვებინათ. დავალების მოთხოვნაში მითითებული იყო კიბერპოლიგონის ის ქსელები, რომლებიც შეფასების ფარგლებში შედიოდა, ხოლო რამდენიმე სისტემა ფარგლებს გარეთ არსებულად იყო დასახელებული. UK AISI-მ ინტერნეტზე პირდაპირი წვდომაც ჩართო, რათა აგენტებს ხელსაწყოების ჩამოტვირთვა და ადამიანის მიერ განხორციელებულ რეალურ შეტევასთან მიახლოებულ პირობებში მუშაობა შეძლებოდათ, ხოლო საბაზისო შესაძლებლობების გასაზომად მოდელის კიბერკლასიფიკატორები გამორთო.
UK AISI-ის მიერ განსაზღვრული უფლებამოსილების საზღვარი სიმულირებული კიბერპოლიგონი იყო: აგენტებს ნება ჰქონდათ, მითითებულ სიმულირებულ ქსელებზე შეეტიათ და ფლეგი მოეპოვებინათ, მაგრამ ატ უნდა ემოქმედათ კიბერპოლიგონის ქსელის საზღვრებს მიღმა არსებულ სისტემებთან. თუმცა, აგენტებისთვის მკაფიოდ არ უთქვამთ, როგორ შეეძლოთ ან არ შეეძლოთ ღია ინტერნეტზე წვდომის გამოყენება, რასაც UK AISI ინციდენტის ხელშემწყობ შესაძლო მიზეზად მიიჩნევს.
ამ გაშვებების ანალიზისას UK AISI-მ დაადგინა, რომ GPT‑5.6 Sol-მა სიმულირებულ კიბერპოლიგონზე შეღწევისა და ფლეგის მოპოვების გზის ძიებისას ორი უნებართვო ქმედება შეასრულა:
- GPT‑5.6 Sol-მა ხელახლა გამოიყენა GitHub-ის token, რომელიც სხვა ლაბორატორიის აგენტს საჯაროდ ხელმისაწვდომი დარჩა, რათა შეემოწმებინა,სტატუსის შესამოწმებელი რომელიმე სისტემა GitHub-ს ან განახლების სხვა სერვისს რეგულარულად უკავშირდებოდა თუ არა; ასევე სცადა ანგარიშის აღდგენისა და მოთხოვნების ლიმიტის გვერდის ავლის გზები და გარე DNS და ტუნელირების სერვისის პროვაიდერებთან ანგარიშების შექმნა.
- GPT‑5.6 Sol-მა საჯარო ტუნელირების სერვისი გამოიყენა, რათა შეფასების გარემოში ლოკალურად გაშვებული DNS სერვერი საჯარო ინტერნეტიდან ხელმისაწვდომი გაეხადა. სერვერი შეიცავდა სატესტო სტატუსის შესამოწმებლად გაშვებული პროგრამული უზრუნველყოფის ცნობილი მოწყვლადობის გამოსაყენებლად განკუთვნილ დატვირთვებს. ეს კონფიგურაცია არ მუშაობდა, არ არსებობს მტკიცებულება, რომ მას რომელიმე რეალურმა გარდამქმნელმა მიმართა, ხოლო შეფასების დასრულებისას ინფრასტრუქტურა წაიშალა.
მიუხედავად იმისა, რომ მოდელი კიბერპოლიგონზე დავალების შესრულებას ცდილობდა, UK AISI-მ ეს ქმედებები უნებართვოდ მიიჩნია, რადგან ისინი რეალურ გარე ანგარიშებსა და კიბერპოლიგონის საზღვრებს მიღმა არსებულ სერვისებს მოიცავდა და დავალების შესასრულებლად საჭირო არ იყო. DNS სერვერი საჯარო ინტერნეტში ექსპლოიტის დატვირთვებსაც მასპინძლობდა, თუმცა კონფიგურაცია არ მუშაობდა და არ არსებობს მტკიცებულება, რომ მას რომელიმე რეალურმა გარდამქმნელმა მიმართა.
UK AISI-მ აქტივობა 28 ივლისს გამოავლინა, მას შემდეგ, რაც უსაფრთხოების მონიტორინგმა მონაცემთა უჩვეულო გადაცემები დააფიქსირა. მან შესაბამისი შეფასებები შეაჩერა, სათანადო მოწყობილობები იზოლაციაში მოაქცია და აღმოჩენიდან დაახლოებით ერთ საათში აქტივობა აღკვეთა.
ჩენ ვაფასებთ UK AISI-ს პარტნიორობას მთელი ამ პროცესის განმავლობაში, მათ შორის მის მუშაობას ამ აქტივობის გამოვლენაზე, გამოძიებასა და დეტალების გაზიარებაზე. მომავალშიც მოუთმენლად ველით ჩვენი თანამშრომლობის გაგრძელებას.
29 ივლისს შეფასებების ჩასატარებლად დაქირავებულმა ერთ-ერთმა პარტნიორმა, Irregular-მა, შეგვატყობინა ინციდენტის შესახებ, რომელიც Capture-the-Flag-ის (CTF) ტიპის კიბერუსაფრთხოების შეფასებებისას OpenAI-ის მოდელებს შეეხო. მოდელებს დაევალათ სიმულირებულ გარემოში არსებული სისუსტეების გამოყენებით ფარული ინფორმაციის პოვნა და უთხრეს, რომ ინტერნეტზე წვდომა არ ჰქონდათ. თუმცა, სატესტო გარემოს არასწორი კონფიგურაციის გამო მოდელებმა საჯარო ინტერნეტზე წვდომა მიიღეს.
ერთ-ერთ ტესტში CTF-დავალების გამოგონილი სამიზნის სახელი შემთხვევით რეალური დომენის სახელს დაემთხვა. რადგან სატესტო გარემო შეცდომით ინტერნეტთან იყო დაკავშირებული, მოდელმა რეალური ვებსაიტის სისუსტე გამოიყენა, რადგან ის სიმულირებული გარემოს ნაწილი ეგონა. ეს არ ყოფილა რთული სატესტო გარემოდან თავის დაღწევა ან ნულოვანი დღის მოწყვლადობის გამოყენება: ინტერნეტზე წვდომა არასწორმა კონფიგურაციამ განაპირობა, მოდელმა კი, როგორც ჩანს, უსაფრთხოების მარტივი მოწყვლადობა გამოიყენა.
Irregular-ის გამოძიების თანახმად, მოდელმა იმავე საიტის სამართავად საჭირო ავტორიზაციის მონაცემებიც იპოვა და გამოიყენა. Irregular-ს ზემოქმედება დაზარალებული საიტის საკუთარ მონაცემებს მიღმა არ გამოუვლენია, მისი აუდიტი კი გრძელდება. მან შეფასებები შეაჩერა და პრობლემების აღმოფხვრა დაიწყო, დაზარალებულ მესამე მხარეებს კი ინციდენტის შესახებ ეცნობათ. Irregular-მა გვაცნობა, რომ ინციდენტთან დაკავშირებული ყველა გამოვლენილი პრობლემა აღმოფხვრილია და სატესტო გარემოს შესაბამისი დაცვის მექანიზმები დაემატა. Irregular-მა ასევე გაავრცელა ინფორმაცია იმავე სატესტო გარემოში სხვა ლაბორატორიებთან დაკავშირებული ინციდენტების შესახებ.
ვაფასებთ Irregular-ის პარტნიორობას და მისი მოკვლევის მხარდასაჭერად მასთან მჭიდრო თანამშრომლობას გავაგრძელებთ. Irregular ასევე ამზადებს კონცეპტუალურ დოკუმენტს, რათა გააზიაროს აქტივობის აღკვეთისა და კიბერშეფასებების უსაფრთხოდ ჩატარების საუკეთესო პრაქტიკა. მოუთმენლად ველით თეთრი დოკუმენტის მომზადებაში მონაწილეობას, რათა მიგნებები საზოგადოებისთვის ხელმისაწვდომი გახდეს, და ჩვენი პარტნიორობის გაგრძელებას. ამგვარ თანამშრომლობას არსებულ და მომავალ მოდელთა უსაფრთხო და საფუძვლიანი შეფასების აუცილებელ პირობად მივიჩნევთ.


