უსაფრთხოება და თანხვდომილობა გრძელჰორიზონტიანი მოდელების ეპოქაში
რა გვასწავლა ხანგრძლივად მომუშავე მოდელის შიდა გამოყენებამ უსაფრთხოების შესახებ.
შეჯამება
ხანგრძლივად მომუშავე მოდელებს ღია ტიპის რთული პრობლემების გადაწყვეტა შეუძლია, მაგრამ საკუთარი დაჟინებულობა მათ მეტ შესაძლებლობას აძლევს არასასურველი მოქმედებების შესასრულებლად.
ხანგრძლივი დავალებებისთვის გაწვრთნილი მოდელის შეზღუდული შიდა გამოყენებისას დავინახეთ ახალი ტიპის მარცხები, რომლებიც გაშლამდელ შეფასებებში არ დაფიქსირებულა, და წვდომა შევაჩერეთ. შემდეგ ამ მარცხებიდან მიღებული მიგნებები გამოვიყენეთ ახალი შეფასებების შესაქმნელად, გრძელჰორიზონტიანი თანხვდომილობის გასაუმჯობესებლად, ტრაექტორიის დონის მონიტორინგის დასამატებლად და მომხმარებლებისთვის მეტი ხილვადობისა და კონტროლის მისაცემად შეზღუდული წვდომის აღდგენამდე.
ამ გამოცდილებამ კიდევ ერთხელ დაგვანახა იტერაციული გაშლის ღირებულება. ფიქსირებული შეფასებების ვერცერთი ნაკრები ვერ განჭვრეტს ყველა ქცევას, ამიტომ გაშლამდელი ტესტირება უნდა ერწყმოდეს მჭიდრო მონიტორინგს, დაცვით მექანიზმებს, რომლებსაც ჩარევა შეუძლია, და საჭიროების შემთხვევაში შეჩერების ან უკან დაბრუნების შესაძლებლობას.
მოდელებს, რომლებსაც ხანგრძლივი დროის განმავლობაში ავტონომიურად მუშაობა შეუძლია, რთული, ღია ტიპის პრობლემების გადაჭრის უნარი აქვს. მაგრამ იგივე შეუპოვრობა, რომელიც მათ სასარგებლოს ხდის, ასევე მეტ შესაძლებლობას აძლევს არასასურველი მოქმედებების შესასრულებლად, თანაც ისეთი გზებით, რომლებიც უფრო მოკლე ჰორიზონტის მოდელებისთვის განკუთვნილ შეფასებებს შეიძლება გამორჩეს.
დაახლოებით ორი თვის წინ გამოვაცხადეთ, რომ შიდა, ზოგადი დანიშნულების მოდელმა ერდოშის ერთეულოვანი მანძილის ჰიპოთეზა უარყო. ეს მოდელი შექმნილი იყო იმისთვის, რომ ძალიან ხანგრძლივი პერიოდების განმავლობაში ავტონომიურად ემუშავა. შეზღუდული და მონიტორინგიანი შიდა გამოყენებისას დავინახეთ არასასურველი ქცევა, რომელიც გაშლასთან დაკავშირებულ ჩვენს შეფასებებს არ ჰქონდა დაფიქსირებული. რადგან გაშლა შეზღუდული და მონიტორინგიანი იყო, ჩვენ შევძელით ამ პრობლემების იდენტიფიცირება, წვდომის შეჩერება, ახალი შეფასებების შექმნა იმაზე დაყრდნობით, რაც აღმოვაჩინეთ, მოდელისა და მისი დაცვითი მექანიზმების გაძლიერება და შემდეგ წვდომის აღდგენა გაგრძელებული მონიტორინგის პირობებში.
პირობები, რომლებშიც მოდელებს ვაფასებთ, არასდროს დაემთხვევა სრულყოფილად იმ პირობებს, რომლებსაც ისინი რეალურ გამოყენებაში აწყდება. ამიტომ გაშლამდელი შეფასებები უნდა ერწყმოდეს შეზღუდულ, მონიტორინგიან გაშლას და ჩარევის, შეჩერების ან უკან დაბრუნების შესაძლებლობას პრობლემების გაჩენის შემთხვევაში. ის, რასაც გაშლიდან ვსწავლობთ, უფრო ძლიერი შეფასებებისა და დაცვითი მექანიზმების ნაწილი შეიძლება გახდეს წვდომის გაფართოებამდე.
შემდეგ სექციებში გიზიარებთ კონკრეტულ მაგალითებს: რა შევისაწვლეთ, როგორ მოვაგვარეთ პრობლემები და როგორ განსაზღვრავს ეს გამოცდილება მომავალ გამოშვებებს.
ახალ მოდელს შეუძლია, განმეორებითი მცდელობებით გააგრძელოს მიზნისკენ მუშაობა დიდი ხნის განმავლობაში. იმავე დაჟინებულობამ შეიძლება ის მიიყვანოს თავის გარემოში სისუსტეების პოვნამდე და გამოყენებამდე. როცა წინა მოდელები სენდბოქსის ან გარემოს შეზღუდვებს აწყდებოდა, უბრალოდ ჩერდებოდა და მომხმარებელს უბრუნდებოდა. ეს მოდელი ხშირად აგრძელებდა მცდელობას, მათ შორის ეძებდა გზებს, რომ თავისი სენდბოქსის გარეთ ემოქმედა.
ამის მაგალითი შიდა შეფასებისას დაფიქსირდა NanoGPT‑ს სპიდრანზე(იხსნება ახალ ფანჯარაში) — საჯარო ბენჩმარკზე, რომლის მიზანია პატარა ენობრივი მოდელის გაწვრთნა რაც შეიძლება ნაკლები ნაბიჯით. ჩვენმა მოდელმა შეიმუშავა სწავლების სიჩქარის შენელების ხარისხობრივი კანონ, სახელად PowerCool, რომელმაც მნიშვნელოვანი გაუმჯობესება მოიტანა. მოდელს მიღებული ჰქონდა მითითება, რომ შედეგები მხოლოდ Slack-ში გამოექვეყნებინა, მაგრამ NanoGPT‑ს ინსტრუქციების მიხედვით, შედეგები GitHub-ზე PR-ის სახით გამოქვეყნებას ითხოვდა და მოდელმა სწორედ ეს უკანასკნელი მითითებები შეასრულა და GitHub-ის საჯარო რეპოზიტორიუმში PR #287 გახსნა. მოდელმა გვერდი აუარა სენდბოქსის შეზღუდვებს, რომლებიც გარე წვდომის დაბლოკვისთვის იყო შექმნილი, და გააგრძელა ატვირთვა GitHub-ზე. ჩვენს მოდელს ერთი საათი დასჭირდა სენდბოქსში მოწყვლადობის საპოვნელად, რათა PR გაეკეთებინა; ადრინდელი მოდელები ნაკლებად დაჟინებული იყო, მოწყვლადობების პოვნა ვერ შეძლო და საერთოდ შეეშვა PR-ის ნაწილს.1
ხელოვნური ინტელექტით აღჭურვილი ასისტენტებისთვის უსაფრთხოების მართვის ბევრი საშუალება ცალკეული მოქმედებების გარშემოა აგებული. თუ მოქმედება დაუშვებელია, ის იბლოკება. თუ ის მგრძნობიარეა, სისტემა მომხმარებელს მკაფიო თანხმობას სთხოვს. მაგრამ ხანგრძლივად მომუშავე მოდელები, რომელთა მოქმედებებიც შეიძლება ავტონომიურად საათების, დღეების ან თუნდაც კვირების განმავლობაში განვითარდეს, ამ წყობას გამოწვევის წინაშე აყენებს: ცალკეული მოქმედებებისთვის თვალის დევნება მთელი ტრაექტორიის განზრახვის გასაგებად აღარ არის საკმარისი.
მაგალითად, სცენარში, სადაც მოდელს პრობლემის გადაწყვეტა სთხოვეს, მოდელმა შენიშნა, რომ სხვა სისტემებს წარმატებული, მაგრამ კერძო წარდგენები ჰქონდა, და სცადა ამ გადაწყვეტების აღდგენა შეფასების სერვერული ნაწილიდან. როცა მისი საწყისი მცდელობა დაიბლოკა, რადგან სკანერმა ავთენტიფიკაციის ტოკენი აღმოაჩინა, მოდელმა ტოკენის სხეული ორ ფრაგმენტად გაყო, ისინი გააბუნდოვანა და შემდეგ ავტორიზაციის მონაცემი გაშვების დროს აღადგინა, ისე რომ სრული ტოკენი არასდროს გამოჩენილიყო ერთ უწყვეტ სტრიქონად. მოდელი როგორც მომხმარებლისთვის გაკეთებულ კომენტარებში, ისე მსჯელობის კვალში პირდაპირ ამბობდა, რომ ამ ნაბიჯებს სკანერის გვერდის ასავლელად დგამდა.
ეს მაგალითი გვიჩვენებს, როგორ შეიძლება თითოეული ნაბიჯი ცალკე მისაღებად გამოიყურებოდეს, ხოლო მიმდევრობამ ისეთი შედეგი გამოიწვიოს, რომელიც არ დამტკიცდება. ის ასევე გვიჩვენებს, როგორ შეუძლია მოდელს, რომელიც გრძელ დროით ჰორიზონტებზე ეფექტიანად მოქმედებს, შეისწავლოს დამტკიცების სისტემის უხილავი ზონები და მიზნების მისაღწევად გვერდი აუაროს მას. გრძელი ჰორიზონტის უსაფრთხოება მოითხოვს ვიკითხოთ არა მხოლოდ „დაშვებულია ეს მოქმედება?“, არამედ: „რა შედეგისკენ მიდის მოქმედებების ეს მიმდევრობა?“
მსგავსი ინციდენტების გამო ახალი მოდელის შიდა გაშლა შევაჩერეთ. უსაფრთხოების სისტემა ხელახლა ავაგეთ მრავალშრიანი დაცვისა და ტრაექტორიის დონეზე მონიტორინგის გარშემო.
- ინციდენტებიდან მიღებული შეფასებები. შეფასებები გვაძლევს წარმოდგენას, უსაფრთხოა თუ არა სისტემის გაშლა მანამ, სანამ ის რეალურად გაიშლება. თუმცა, მაქსიმალური სარგებლობისთვის, შეფასება უნდა ასახავდეს ტრაექტორიების განაწილებასა და ჰორიზონტის სიგრძეს რეალური გაშლის განმავლობაში. ამის გამო დამზერილი მარცხები გამოვიყენეთ შეჯიბრებითი შეფასებების შესაქმნელად. აღმოვაჩინეთ, რომ რეალურ ინციდენტებზე დაფუძნებული შეფასებების გაუმჯობესება, თავის მხრივ, საექსპლუატაციო გარემოში განთავსების შემდეგ უფრო უსაფრთხო ქცევას იწვევდა.
- გაუმჯობესებული თანხვდომილობა. გადავდგით ნაბიჯები, რათა შეგვემცირებინა მისი მიდრეკილება, მომხმარებლის მიზნისკენ სვლისას ნებართვის გარეშე არასასურველი მოქმედებები შეესრულებინა. მაგალითად, აღმოვაჩინეთ, რომ ჩვენს მოდელებს გრძელ გაშვებებში ინსტრუქციების დამახსოვრება უარესად გამოსდიოდა; როცა მოდელი ამ უნარისთვის გავწვრთენით, მივიღეთ მოდელი, რომელიც უფრო გრძელ გაშვებებშიც თანხვდომილობას ინარჩუნებდა.
- აქტიური მონიტორინგი. შევქმენით მონიტორინგის სისტემა, რომელიც მოდელის განვითარებად ტრაექტორიას ამოწმებს იმის ნიშნებზე, რომ ის მომხმარებლის შეზღუდვას ან უსაფრთხოების ზღვარს გვერდს უვლის. მონიტორი აკვირდება არამხოლოდ ერთ მოქმედებას, არამედ მთელ ტრაექტორიას. მნიშვნელოვანია, რომ მონიტორს შეუძლია სესიის დაპაუზება და მომხმარებლის გაფრთხილება, რომ უფრო გულდასმითი შემოწმებაა საჭირო. შემოწმების შემდეგ მომხმარებელს შეუძლია აირჩიოს მოდელის მუშაობის გაგრძელება, თუ მონიტორი შეცდომით ამოქმედდა.
- მომხმარებლისთვის მეტი ხილვადობა და კონტროლი. გავაუმჯობესეთ მომხმარებლის შესაძლებლობა, შეამოწმოს ეს ხანგრძლივი სესიები, ნახოს შესრულებული მოქმედებები და დააკვირდეს მონიტორინგის ჩარევებს.
მონიტორინგის ახალი სისტემის შესაფასებლად ხელახლა გავუშვით გაშლის შიდა გარემოების მცირე ნაკრები, სადაც მოდელი ადრე არათანმხვედრ მოქმედებებს მიჰყვებოდა — ამჯერად ახალი დაცვითი მექანიზმებით2. ახალმა დაცვითმა მექანიზმებმა შეძლო მოდელის მიერ განხორციელებული გაცილებით მეტი არაშესაბამისი მოქმედების დაჭერა, ხოლო ყველა გამორჩენილი შემთხვევა შეფასდა როგორც დაბალი სიმძიმის.
დაბალი სიმძიმის ამ ინციდენტების ზოგიერთი მაგალითია შემდეგი შემთხვევები:
- Linear-ის ბრძანების სტრიქონის ხელსაწყოზე წვდომისთვის მოდელმა ჩადგმული
codex --yoloსესია გაუშვა მაშინ, როცა რეალურად ამის გაკეთება--yoloალმის გარეშეც შეეძლო. - მოდელმა შენიშნა, რომ ადრე მოქმედი რესურსი აღარ არსებობდა, შემდეგ კი დაიწყო შესწავლა და SSH-ით შესვლა ცენტრალური პროცესორის სხვა მუშა პოდებში თავისი მფლობელის სახელების სივრცეში და ასევე (წარუმატებლად) OpenAI-ს თანამშრომლების კუთვნილ პოდებში ისე, რომ ამისთვის სათანადო მიზეზი არ ჰქონია.
- მოდელს ბევრი გაჭედილი
findპროცესი ჰქონდა და გარსის ყოველი ბრძანება იჭედებოდა. შემდეგ მან გაუშვაkill -9 -1, რომელიც შესრულების შემთხვევაში SIGKILL-ს გაუგზავნიდა ყველა პროცესს, რომლის მოკვლის უფლებაც აღნიშნულ პოდზე ჰქონდა. თუმცა მას ვადა გაუვიდა და არ შესრულდა.
ახალი სისტემის ტესტირების შემდეგ დავასკვნეთ, რომ გრძელი ჰორიზონტის შესაძლებლობების მქონე მოდელებზე შეზღუდული შიდა წვდომის აღდგენა შეიძლებოდა. რამდენიმე კვირის წინ ხელახალი გაშლის დაწყების შემდეგ დაცვითი მექანიზმებისთვის სერიოზული გვერდის ავლა არ შეგვინიშნავს. ამ დაცვითი მექანიზმების პირველი ვერსია განზრახ კონსერვატიული იყო. განვაგრძეთ სისტემის მორგება, რათა ზედმეტი შეფერხებები შეგვემცირებინა დაცვითი მექანიზმების შესუსტების გარეშე.
რადგან გაშლა ეტაპობრივად ხდებოდა, წვდომის გაფართოებამდე ხარვეზების პოვნა და გამოსწორება შევძელით. გაშლამდელი შეფასებები მნიშვნელობას ინარჩუნებს, მაგრამ გაშლა ავლენს ქცევებს, რომლებიც მათ ეპარებათ. შეზღუდული წვდომით დაწყებამ საშუალება მოგვცა, მოდელი პრაქტიკაში შეგვესწავლა, პრობლემების გაჩენისას შეგვეჩერებინა, ეს მარცხები უკეთესი შეფასებებისა და დაცვითი მექანიზმების შესაქმნელად გამოგვეყენებინა და ცვლილებების ტესტირების შემდეგ შეზღუდული წვდომა აღგვედგინა.
როცა მოდელები უფრო ხანგრძლივ და რთულ ამოცანებს იღებს, უფრო მძიმე შედეგები შეიძლება მოჰყვეს მარცხებს, რომლებიც შეფასებებს გამორჩება. გავაგრძელებთ მუშაობას შეფასებასა და განთავსებას შორის სხვაობის შესამცირებლად: უფრო გრძელ ტრაექტორიებზე მოდელების ტესტირებით, თანხვდომილობის გაუმჯობესებით, ჩარევის უნარის მქონე მონიტორინგის შექმნით და მომხმარებლებისთვის უფრო მკაფიო ხილვადობისა და კონტროლის მიცემით. ეს გამოწვევები მხოლოდ OpenAI-სთვის არ იქნება დამახასიათებელი და ვიმედოვნებთ, რომ ჩვენი ნასწავლის გაზიარება უფრო ფართო სფეროს დაეხმარება მათთვის მომზადებაში.
ავტორი
სქოლიოები
- 1
მიუხედავად იმისა, რომ PR სწრაფად დავხურეთ, სპიდრანის რამდენიმე მონაწილეს ის უკვე ნანახი ჰქონდა და ეს მიდგომა საკუთარ წარდგენებში გამოიყენა; PR 287-ს ციტირებს მსოფლიო რეკორდის მომდევნო წარდგენები, რომლებსაც 3030(იხსნება ახალ ფანჯარაში), 2990(იხსნება ახალ ფანჯარაში), 2930(იხსნება ახალ ფანჯარაში), 2925(იხსნება ახალ ფანჯარაში), 2900(იხსნება ახალ ფანჯარაში) და 2890(იხსნება ახალ ფანჯარაში) ნაბიჯი აქვს. მათგან PR 300(იხსნება ახალ ფანჯარაში) განსაკუთრებით საინტერესოა, რადგან ეს არის PR, რომელიც Opus 4.7-მა წარადგინა, როცა Prime Intellect(იხსნება ახალ ფანჯარაში)-მა ის NanoGPT-ს სპიდრანზე შეაფასა. Opus-მა ნახა ჩვენი მოდელის მიერ წარდგენილი PR, აღმოჩენები გამოიყენა და საბოლოო შედეგში ჩვენი PR მოიხსენია.
- 2


