მოდელის დისტილაციის კოორდინირებული კამპანიის აღკვეთა
ახლახან გამოვავლინეთ და აღვკვეთეთ კოორდინირებული კამპანია, რომლის მიზანიც ჩვენი მოდელებიდან დაცული მსჯელობის ამოღება იყო. პირველი ასეთი აქტივობა ივლისის პირველ კვირაში დავაფიქსირეთ. ეს აქტივობა შეესაბამება ბოროტგანზრახულ დისტილაციას: ერთი მოდელის პასუხების ან მსჯელობის სისტემატურ და უნებართვო გამოყენებას სხვა მოდელის გასაწვრთნელად, შესაქმნელად ან გასაუმჯობესებლად. დაცული მსჯელობა მოდელის შიდა ჩანაწერია, რომელიც ამოცანაზე მუშაობას ასახავს. მისმა ამოღებამ შეიძლება გამოამჟღავნოს საბოლოო პასუხში არშეტანილი ინფორმაცია და სხვებს მოდელის შესაძლებლობების გამეორებაში დაეხმაროს.
კამპანიის მონაწილეებს ჩვენი დაშიფვრა არ გაუტეხავთ, მონაცემთა ბაზაში არ შეუღწევიათ და მომხმარებლების შენახულ საუბრებზე პირდაპირი წვდომა არ მოუპოვებიათ. ამის ნაცვლად, ისინი მოდელთან ურთიერთქმედებით მანიპულირებდნენ, რათა დაცული მსჯელობა მოთხოვნის გამგზავნისთვის ხილული ფორმით მიეღოთ. ამას კოორდინირებულად, ფართო მასშტაბით და ჩვენი მომსახურების პირობების დარღვევით აკეთებდნენ. ამ მანიპულაციის საფუძვლად არსებული მოწყვლადობა მხოლოდ OpenAI-ის მოდელებისთვის არ არის დამახასიათებელი. მის შესახებ ინფორმაცია Frontier Model Forum-ის მეშვეობით დარგის პარტნიორებს გავუზიარეთ, რათა ბოროტგანზრახული დისტილაციისგან ერთობლივი დაცვა გაგვეძლიერებინა.
გამოქვეყნებამდე შევისწავლეთ კამპანიის მასშტაბი და შესაძლო გავლენა, დავნერგეთ რისკის შემცირების საკუთარი ზომები, ინფორმაცია გავუზიარეთ მკვლევრებსა და დარგის პარტნიორებს და მათი გამოხმაურებაც მივიღეთ, რათა ამ ტიპის შეტევებისგან დაცვა უზრუნველგვეყო. რისკის შემცირებისა და გამოძიების მიმართულებით მუშაობა გრძელდება. მიგვაჩნია, რომ მიღებული ცოდნის ახლა გაზიარება მთელ ეკოსისტემას დაცვის გაძლიერებაში დაეხმარება.
დავაფიქსირეთ დაცული მსჯელობის ახალი გზებით ამოღების მცდელობები. მაგალითად, მონაწილეები ერთი საუბრიდან დაშიფრულ მსჯელობას აკოპირებდნენ და სხვა საუბარში მოდელს სთხოვდნენ, გაეშიფრა და ტექსტად გადმოეტანა ფარული მსჯელობის შიგთავსი.
უსაფრთხოების დამოუკიდებელმა მკვლევრებმაც(იხსნება ახალ ფანჯარაში) პასუხისმგებლიანი გამჟღავნების წესით მოგვაწოდეს ინფორმაცია ამასთან დაკავშირებული მოწყვლადობების შესახებ, რომლებიც სხვადასხვა მოდელს შორის ურთიერთქმედებასა და საუბრის შეკუმშვას ეხებოდა. მათი მიგნებები შევისწავლეთ და დავადასტურეთ, რომ მათ მიერ გამოვლენილი შეტევის გზები რეალური იყო. მათი ნაშრომი დაგვეხმარა, უკეთ გაგვეგო ამ კატეგორიის შეტევები და დაგვეჩქარებინა დამცავი ზომების დანერგვა.
აქტივობა 1 ივლისს დაიწყო და თავდაპირველად მცირე მოცულობის იყო. 24 და 25 ივლისს კი მკვეთრი ზრდა დავაფიქსირეთ: 4 000-ზე მეტმა მომხმარებელმა მსჯელობის ამოღების შესაბამისი შაბლონით 16 000 მოთხოვნა1 გაგზავნა. შემდგომმა გამოძიებამ 15 000-ზე მეტი მომხმარებლის ჯგუფში მოთხოვნების მსგავსი შაბლონებით აქტივობა გამოავლინა, რომელიც 28 ივლისისთვის სრულად აღვკვეთეთ.
დროთა განმავლობაში აქტივობა იცვლებოდა. ეს კიდევ ერთხელ ადასტურებს, რომ ბოროტგანზრახული დისტილაცია უსაფრთხოების უფრო ფართო გამოწვევაა, რომელიც მრავალშრიან, ადაპტირებად დაცვას მოითხოვს.
გაურკვეველია, უკავშირდებოდა თუ არა ერთსა და იმავე მხარეს ყველა მონაწილე, რომელიც შესაბამის პერიოდში დავაფიქსირეთ. თუმცა აქტივობის ძირითად ჯგუფს ვუკავშირებთ Kimi-ს შემქმნელ კომპანიასთან, Moonshot AI-სთან, დაკავშირებულ პირებს.
ბოროტგანზრახული დისტილაცია საფრთხეს უქმნის როგორც ზოგად, ისე ეროვნულ უსაფრთხოებას. ამოღებული მსჯელობა შეიძლება სხვა მოდელის გასაწვრთნელად გამოიყენონ ისე, რომ არ შეინარჩუნონ ის დამცავი მექანიზმები, რომლებიც საწყისი მოდელის მომხმარებლისთვის ხილულ პასუხებზე ვრცელდება. მასშტაბურმა დისტილაციამ ასევე შეიძლება დააჩქაროს მოწინავე შესაძლებლობების გადაცემა ისე, რომ უსაფრთხოებაში იმავე მოცულობის ინვესტიცია არ გახდეს საჭირო. ეს რისკები იზრდება, როცა მოდელები ორმაგი დანიშნულების სფეროებში ახალ შესაძლებლობებს იძენენ.
ეს რისკი მხოლოდ OpenAI-ს არ ეხება. როგორც ზემოთ აღვნიშნეთ, მსგავსმა მეთოდებმა სხვა მოწინავე ხელოვნური ინტელექტის სისტემებზეც შეიძლება იმოქმედოს. ამიტომ ეს უსაფრთხოების საერთო გამოწვევაა, რომელიც მთელ დარგში კოორდინაციას მოითხოვს.
დისტილაციის ამ ბოლო კამპანიის შესაკავებლად ანგარიშების მიმართ სანქციები, ტექნიკური კონტროლის ზომები და პარტნიორებთან კოორდინაცია ერთობლივად გამოვიყენეთ. დავბლოკეთ ან შევზღუდეთ თაღლითური ანგარიშები, გავამკაცრეთ რეგისტრაციისა და ინფრასტრუქტურის კონტროლი და გავაფართოეთ დაკავშირებული ქსელების მონიტორინგი.
ასევე გავაძლიერეთ ფარული მსჯელობის დაცვა მომხმარებლებს, სამუშაო სივრცეებს, ორგანიზაციებსა და მოდელების ოჯახებს შორის. დავხურეთ გზა, რომლითაც სხვისი დაშიფრული მსჯელობის მფლობელს მისი ხელახლა გაგზავნა და შიგთავსის აღდგენა შეეძლო. ასევე დავამატეთ შემოწმებები ნაკადურად გადაცემული ისეთი პასუხების გამოსავლენად და შესაჩერებლად, რომლებსაც მსჯელობის გამჟღავნება შეეძლო. როცა მსგავსი აქტივობა მესამე მხარის სერვისებზე გადავიდა, ამ პროვაიდერებთან ვითანამშრომლეთ ჩართული ანგარიშების გამოსავლენად და მათი საქმიანობის შესაჩერებლად.
ბოლოს, შესაბამისი მიგნებები გავაზიარეთ Frontier Model Forum-ისა და ინფორმაციის გაცვლის სათანადო სამთავრობო არხების მეშვეობით, რათა მოწინავე მოდელების სხვა შემქმნელებსა და საჯარო სექტორის პარტნიორებს მსგავსი აქტივობის მოძიება და საკუთარი დაცვის გაძლიერება შეძლებოდათ. მსგავსი რისკები შეიძლება შეეხოს სისტემებსაც, რომლებიც მსჯელობის ჩანაწერების გადატანას ან ხელახლა გამოყენებას უჭერს მხარს.
მოველით, რომ მოწინავე მოდელების გაუმჯობესებასთან ერთად ბოროტგანზრახული დისტილაციის მცდელობები უფრო დახვეწილი გახდება, რადგან დაინტერესებული მხარეები მათი შესაძლებლობების მიბაძვის იაფ გზებს ეძებენ. ამ აქტივობისგან დაცვა მრავალშრიან კონტროლსა და მუდმივ ადაპტაციას მოითხოვს.
ეს სამუშაო ჯერ არ დასრულებულა. პარტნიორების ინფრასტრუქტურაზე გაშვებულ სისტემებს ისეთივე დაცვა სჭირდება, როგორიც უშუალოდ ჩვენს სერვისებს. ხელსაწყოების პასუხებით განხორციელებული შეტევებისგან დასაცავად კი მხოლოდ ჩვეულებრივი ხილული ტექსტის შემოწმება საკმარისი არ არის. ვაგრძელებთ ხელსაწყოების დაცვის გაუმჯობესებას, კლასიფიკატორების დაფარვის გაფართოებასა და მოდელის მიერ არასათანადო მოთხოვნებზე უარის თქმის დახვეწას. ასევე ვნერგავთ შესაბამის კონტროლს ღრუბლოვანი სერვისების პარტნიორებთან.
ჩვენი რეაგირება კვლავ სამ მიმართულებაზე იქნება ორიენტირებული: მსჯელობის ამოღებისგან ტექნიკური დაცვის გაძლიერება, კოორდინირებული კამპანიების უკეთ გამოვლენა და მათ წინააღმდეგ ზომების გატარება, ასევე საფრთხეების შესახებ ინფორმაციის უფრო ინტენსიური გაცვლა დარგსა და სახელმწიფო უწყებებს შორის.

