დღეს ვაქვეყნებთ gpt-oss-safeguard-ის საკვლევ წინასწარ ვერსიას — ჩვენი ღია წონების მსჯელობის მოდელები უსაფრთხოების კლასიფიკაციის დავალებებისთვის, რომლებიც ხელმისაწვდომია ორ ზომაში: gpt-oss-safeguard-120b და gpt-oss-safeguard-20b. ეს მოდელები ჩვენი gpt-oss open model-ების დახვეწილი ვერსიებია და ხელმისაწვდომია იმავე მოქნილი Apache 2.0 ლიცენზიით, რომელიც ნებისმიერ ადამიანს საშუალებას აძლევს, თავისუფლად გამოიყენოს, შეცვალოს და დანერგოს ისინი. ორივე მოდელის ჩამოტვირთვა დღეს შეგიძლიათ Hugging Face(იხსნება ახალ ფანჯარაში)-იდან.
gpt-oss-safeguard მოდელები იყენებს მსჯელობას, რომ ინფერენციის დროს პირდაპირ განმარტოს დეველოპერის მიერ მიწოდებული პოლიტიკა — დეველოპერის საჭიროებების მიხედვით, მომხმარებლის შეტყობინებების, დასრულებების და სრული ჩატების კლასიფიცირებით. დეველოპერი ყოველთვის თავად წყვეტს, რომელი პოლიტიკა გამოიყენოს, ამიტომ პასუხები უფრო რელევანტურია და დეველოპერის გამოყენების სცენარზეა მორგებული. მოდელი იყენებს აზროვნების ჯაჭვს, რომლის გადახედვაც დეველოპერს შეუძლია იმის გასაგებად, თუ როგორ იღებს მოდელი გადაწყვეტილებებს. გარდა ამისა, პოლიტიკა მიეწოდება ინფერენციის დროს, მოდელში გაწვრთნის ნაცვლად, ამიტომ დეველოპერებისთვის მარტივია პოლიტიკების ეტაპობრივად გადახედვა წარმადობის გასაუმჯობესებლად. ეს მიდგომა, რომელიც თავდაპირველად შიდა გამოყენებისთვის შევიმუშავეთ, მნიშვნელოვნად უფრო მოქნილია, ვიდრე ტრადიციული მეთოდი, რომლის დროსაც კლასიფიკატორს წვრთნიან, რათა მან მონიშნული მაგალითების დიდი რაოდენობიდან არაპირდაპირ განსაზღვროს გადაწყვეტილების საზღვარი.
gpt-oss-safeguard საშუალებას აძლევს დეველოპერებს, განსაზღვრონ პოლიტიკის საზღვრები, რომლებიც საუკეთესოდ შეესაბამება მათ გამოყენების სცენარს. მაგალითად, ვიდეოთამაშების განხილვის ფორუმს შეუძლია პოლიტიკის შემუშავება იმ პოსტების კლასიფიკაციისთვის, რომლებიც თამაშში თაღლითობას ეხება, ან პროდუქტის მიმოხილვების საიტს შეუძლია საკუთარი პოლიტიკის გამოყენება ისეთი მიმოხილვების გასაცხრილად, რომლებიც, სავარაუდოდ, ყალბია.
მოდელი ერთდროულად იღებს ორ შეტანილ მასალას — პოლიტიკასა და შიგთავსს, რომელიც ამ პოლიტიკის მიხედვით უნდა კლასიფიცირდეს — და გამოაქვს დასკვნა, თუ რომელ კატეგორიას მიეკუთვნება ეს შიგთავსი, თავის მსჯელობასთან ერთად. დეველოპერები თავად წყვეტენ, როგორ და საერთოდ, გამოიყენონ თუ არა ეს დასკვნები საკუთარ უსაფრთხოების კონვეიერებში. ჩვენ ვნახეთ, რომ მსჯელობაზე დაფუძნებული ეს მიდგომა განსაკუთრებით კარგად მუშაობს ისეთ სიტუაციებში, სადაც:
პოტენციური ზიანი ჩნდება ან ვითარდება, შესაბამისად, პოლიტიკები სწრაფად უნდა ადაპტირდეს.
სფერო უაღრესად ნიუანსურია და უფრო მცირე კლასიფიკატორებისთვის რთულად დასამუშავებელია.
დეველოპერებს არ აქვთ საკმარისი ნიმუშები, რომ თავიანთ პლატფორმაზე თითოეული რისკისთვის მაღალი ხარისხის კლასიფიკატორი გაამზადონ.
დაყოვნება ნაკლებად მნიშვნელოვანია, ვიდრე მაღალი ხარისხის, ახსნადი იარლიყების შექმნა.
კვლევისა და უსაფრთხოების საზოგადოებისგან გამოხმაურების მისაღებად და მოდელის წარმადობის გასაუმჯობესებლად დამატებითი იტერაციისთვის ვუშვებთ gpt-oss-safeguard-ის ამ წინასწარ ვერსიას. რამდენიმე თვის განმავლობაში ROOST(იხსნება ახალ ფანჯარაში) -თან ერთად ვმუშაობდით ამ ღია წონის გამოშვებაზე, რომ დაგვედგინა დეველოპერთა კრიტიკული საჭიროებები, გამოგვეცადა მოდელი და შეგვექმნა დეველოპერის დოკუმენტაცია. ამ გაშვების ფარგლებში ROOST დააარსებს მოდელის საზოგადოებას(იხსნება ახალ ფანჯარაში), რომელიც, ასევე, დღეს იწყებს მუშაობას, რათა ონლაინ სივრცეების დასაცავად ღია AI-მოდელები შეისწავლოს. ამ გამოშვებასთან ერთად ვაქვეყნებთ მოკლე ტექნიკურ ანგარიშს, რომელიც ამ წინასწარი მოდელის უსაფრთხოების შედეგებს აღწერს.
როდესაც საქმე უსაფრთხოებას ეხება, ჩვენ გვჯერა სიღრმისეული დაცვის. ჩვენ საკუთარ მოდელებს ვწვრთნით უსაფრთხო პასუხების გაცემაში და ვნერგავთ დაცვის დამატებით შრეებს, რომ ჩვენი პოლიტიკის ფარგლებში გამოვავლინოთ და მოვაგვაროთ პოტენციურად არაუსაფრთხო შეტანილი და გამოტანილი შიგთავსი. უსაფრთხოების კლასიფიკატორები, რომლებიც კონკრეტული რისკის სფეროში უსაფრთხო და არაუსაფრთხო შიგთავსს არჩევს, დიდი ხანია, დაცვის ძირითადი ფენაა როგორც ჩვენი, ისე სხვა დიდი ენობრივი მოდელებისთვის.
უსაფრთხოების ტრადიციული კლასიფიკატორები, მაგალითად, რომლებიც ხელმისაწვდომია ჩვენ Moderation API(იხსნება ახალ ფანჯარაში)-ში, იქმნება უსაფრთხო და არაუსაფრთხო შიგთავსის ათასობით მაგალითის ხელით შერჩევით, წინასწარ განსაზღვრული უსაფრთხოების პოლიტიკების ფარგლებში. ამ სასწავლო მონაცემებზე დაყრდნობით, კლასიფიკატორი სწავლობს უსაფრთხო და არაუსაფრთხო შედეგების გარჩევას. ამ ტრადიციულ მიდგომაში კლასიფიკატორი უსაფრთხოების პოლიტიკას სინამდვილეში არასდროს ხედავს. ამის ნაცვლად, ის ცდილობს, იგულისხმოს ძირითადი პოლიტიკა, რომელიც გამოყენებულია მაგალითების მონიშვნისთვის, არაუსაფრთხო შიგთავსში მსგავსებებისა და უსაფრთხო და არაუსაფრთხო შიგთავსს შორის განსხვავებების აღმოჩენით.
ტრადიციულ კლასიფიკატორებს შეიძლება ჰქონდეს მაღალი ეფექტურობა, დაბალი დაყოვნება და ოპერაციული ხარჯი. მაგრამ საკმარისი რაოდენობის სასწავლო მაგალითების შეგროვება შეიძლება შრომატევადი და ძვირადღირებული იყოს, ხოლო პოლიტიკის განახლება ან შეცვლა კლასიფიკატორის ხელახლა გაწვრთნას მოითხოვს.
gpt-oss-safeguard განსხვავდება იმით, რომ მისი მსჯელობის შესაძლებლობები დეველოპერებს საშუალებას აძლევს, გამოიყენონ ნებისმიერი პოლიტიკა, მათ შორის ისინიც, რომლებსაც თავად წერენ ან სხვა წყაროებიდან იღებენ, ხოლო მსჯელობა მოდელებს ეხმარება ახლად დაწერილ პოლიტიკებზე განზოგადებაში. უსაფრთხოების პოლიტიკების ფარგლებს მიღმა, gpt-oss-safeguard შეიძლება გამოყენებულ იქნეს შიგთავსის სხვა გზებით მოსანიშნად, რომლებიც მნიშვნელოვანია კონკრეტული პროდუქტებისა და პლატფორმებისთვის.
მსჯელობის ჩვენი ძირითადი მოდელები ახლა უშუალოდ სწავლობს ჩვენს უსაფრთხოების წესებს და თავიანთ მსჯელობის შესაძლებლობებს იყენებს იმის გასააზრებლად, თუ რა არის უსაფრთხო. ეს მიდგომა, რომელსაც ჩვენ გააზრებულ შესაბამისობას ვუწოდებთ, მნიშვნელოვნად აუმჯობესებს უსაფრთხოების სწავლების უფრო ადრეულ მეთოდებს და ჩვენს მსჯელობის მოდელებს რამდენიმე მიმართულებით უფრო უსაფრთხოს ხდის, ვიდრე მათი არამსჯელობითი წინამორბედები მაშინაც კი, როცა მათი შესაძლებლობები იზრდება. მაგრამ მსჯელობა მხოლოდ თავად მოდელების გაწვრთნისთვის არ არის სასარგებლო. ის ასევე ქმნის ახალ შესაძლებლობებს მრავალშრიანი დაცვისთვის. მსჯელობაზე დაფუძნებული მიდგომები უფრო მოქნილია და ნაკლებად არის შეზღუდული მათი წინა სწავლების დეტალებით — ესენი ის უპირატესობებია, რომლებიც ზოგჯერ თავისუფლად ამართლებს დამატებით გამოთვლით ხარჯსა და დაყოვნებას, რასაც ისინი მოიცავს.
gpt-oss-safeguard არის ჩვენ მიერ შიდა გამოყენებისთვის შემუშავებული მიდგომის ღია წონების მქონე იმპლემენტაცია ხელსაწყოში, რომელსაც ვუწოდებთ უსაფრთხოების განმხილველს (Safety Reasoner). ჩვენ დავიწყეთ პოლიტიკის ეტიკეტირების დავალებებზე განმტკიცებითი დახვეწა და მოდელს ვაჯილდოებდით სწორ მსჯელობათა ასახვისთვის, რომლებიც ადამიანმა ექსპერტებმა გააკეთეს. ამან მოდელს ასწავლა მსჯელობა იმაზე, თუ როგორ მიჰყავს პოლიტიკას ის შეფასებამდე. დღეს Safety Reasoner გვაძლევს შესაძლებლობას, დინამიკურად განვაახლოთ ჩვენი უსაფრთხოების პოლიტიკები პროდუქტიულ გარემოში უფრო მოკლე დროში, ვიდრე კლასიფიკატორის ხელახლა გაწვრთნას დასჭირდებოდა. ეს Safety Reasoner-ს აქცევს საკვანძო ხელსაწყოდ იტერაციული დანერგვისთვის: როდესაც ახალ მოდელებს წარმოებაში ვნერგავთ, ხშირად უფრო მკაცრი პოლიტიკებით ვიწყებთ და საჭიროებისამებრ გამოთვლითი რესურსების შედარებით დიდ მოცულობას ვიყენებთ, რათა Safety Reasoner-მა ეს პოლიტიკები ყურადღებით გამოიყენოს. ამის შემდეგ, როდესაც პროდუქტიულ გარემოში რისკების გაგება უმჯობესდება, ვაკორექტირებთ ჩვენს პოლიტიკებს. ჩვენს ზოგიერთ ბოლო გაშვებაში უსაფრთხოების მსჯელობაზე გამოყოფილი მთლიანი გამოთვლითი რესურსის წილი 16%-საც აღწევდა.
Safety Reasoner ჩვენი უსაფრთხოების სტეკის ძირითად კომპონენტად იქცა. სურათის გენერირებისა და Sora 2-ისთვის ის ახორციელებს შედეგების დინამიკურ, ეტაპობრივ შეფასებას, რათა გამოავლინოს და დაბლოკოს სახიფათო გენერაციები რეალურ დროში. ისეთ სფეროებში, როგორიცაა ბიოლოგია და თვითდაზიანება, ჩვენ ვიყენებთ ისეთ მოდელებს, როგორიც Moderation API-ში გამოიყენება, როგორც მცირე, სწრაფი და მაღალი რიკოლის მქონე კლასიფიკატორებს, რათა განვსაზღვროთ, რომელი შიგთავსი შედის ინტერესის სფეროში, შემდეგ კი ამ შიგთავსის გადასახედად ვიყენებთ Safety Reasoner-ს. Safety Reasoner მოდელის შედეგებს დეტალური ტაქსონომიის მიხედვით ახარისხებს, რათა განსაზღვროს, როგორია საუკეთესო რეაგირება, და ის ჩვენი მრავალშრიანი დამცავი მექანიზმების ნაწილია GPT‑5‑ისა და ChatGPT Agent-ის მსგავს სისტემებში. ახლა კი gpt-oss-safeguard მოდელები ამავე მიდგომას ყველასთვის ხელმისაწვდომს ხდის.
ჩვენ შევაფასეთ gpt-oss-safeguard მოდელები როგორც შიდა, ისე გარე შეფასების ნაკრებებზე.
შიდა შეფასებისას ინფერენციის დროს gpt-oss-safeguard-ს ერთდროულად მივაწოდეთ რამდენიმე პოლიტიკა. თითოეული სატესტო შენატანისთვის ვაფასებთ, სწორად აკლასიფიცირებს თუ არა gpt-oss-safeguard ტექსტს ყველა ჩართული პოლიტიკის მიხედვით. ეს რთული ამოცანაა – მოდელი ზუსტად მიიჩნევა მხოლოდ იმ შემთხვევაში, თუ ის ზუსტად ემთხვევა ოქროს ნაკრების იარლიყებს ყველა ჩართული პოლიტიკისთვის.
ჩვენი gpt-oss-safeguard მოდელები და შიდა Safety Reasoner მრავალპოლიტიკური სიზუსტის მხრივ აღემატება gpt-5-thinking-სა და gpt-oss open model-ებს. gpt-oss-safeguard მოდელები შესრულებით gpt-5-thinking-ს აღემატება, რაც განსაკუთრებით გასაკვირია მათი მცირე ზომის გათვალისწინებით.
ეს მოდელები დამატებით შევაფასეთ მოდერაციის მონაცემთა ნაკრებზე(იხსნება ახალ ფანჯარაში), რომელიც ჩვენს 2022 წლის კვლევით ნაშრომთან(იხსნება ახალ ფანჯარაში) ერთად გამოვაქვეყნეთ, და ToxicChat(იხსნება ახალ ფანჯარაში)-ზეც, საჯარო ბენჩმარკზე, რომელიც ღია კოდის ჩატბოტისთვის მომხმარებელთა მოთხოვნებს ეფუძნება.
2022 წლის მოდერაციის შეფასების ნაკრებზე შეფასება ჩავატარეთ ჩვენი შიდა უსაფრთხოების პოლიტიკების გამოყენებით (ერთი პოლიტიკა მოვარგეთ შემდგომი ცვლილებების გასათვალისწინებლად). gpt-oss-safeguard-მა მცირედით აჯობა ყველა სხვა დატესტილ მოდელს, მათ შორის, ჩვენს შიდა Safety Reasoner-სა და gpt-5-thinking-ს, თუმცა ეს განსხვავება Safety Reasoner-სა და gpt-oss-safeguard-ს შორის სტატისტიკურად მნიშვნელოვანი არ არის.
ToxicChat-ისთვის შევაფასეთ მოკლე, ხელით დაწერილი მოთხოვნა, რომელიც ადაპტირებულია ჩვენი ზოგიერთი შიდა პოლიტიკიდან. ჩვენმა შიდა Safety Reasoner-მა კვლავ აჯობა gpt-5-thinking-ს, ხოლო gpt-5-thinking და Safety Reasoner ორივე მცირედით უსწრებს gpt-oss-safeguard-120b-სა და gpt-oss-safeguard-20b-ს. ვვარაუდობთ, რომ gpt-oss-safeguard-ის შედარებით მცირე ზომა მას მაინც უპირატეს არჩევანად ამ ტიპის დავალებისთვის.
gpt-oss-safeguard-ს აქვს ორი კონკრეტული შეზღუდვა. პირველ რიგში, შევნიშნეთ, რომ ათიათასობით მაღალი ხარისხის მარკირებული ნიმუშით გაწვრთნილ კლასიფიკატორებს მაინც შეუძლია შიგთავსის უკეთესი კლასიფიკაცია, ვიდრე gpt-oss-safeguard-ს პირდაპირ პოლიტიკიდან მსჯელობისას. უფრო რთული რისკების შემთხვევაში, მაღალი შედეგისთვის, შესაძლოა, უპირატესობა მიენიჭოს სპეციალიზებული კლასიფიკატორის გაწვრთნას.
მეორეც, gpt-oss-safeguard-ს შეიძლება ბევრი დრო და გამოთვლითი რესურსი დასჭირდეს, რაც ართულებს მის მასშტაბირებას პლატფორმის მთელ შიგთავსზე. შიდა პროცესებში ამას Safety Reasoner-ის მეშვეობით რამდენიმე გზით ვმართავთ: (1) ვიყენებთ უფრო მცირე და სწრაფ კლასიფიკატორებს იმის დასადგენად, რომელი შიგთავსი უნდა შეფასდეს და (2) ზოგიერთ შემთხვევაში Safety Reasoner-ს ასინქრონულად ვიყენებთ დაბალი დაყოვნების მქონე მომხმარებლის გამოცდილების უზრუნველსაყოფად, ამავდროულად კი ვინარჩუნებთ ჩარევის შესაძლებლობას, თუ სახიფათო შიგთავსს აღმოვაჩენთ.
gpt-oss-safeguard არის OpenAI-ს ღია უსაფრთხოების მოდელების პირველი ნაკრები, რომელიც საზოგადოებასთან ერთად შეიქმნა. ადრეული ტესტირების ფარგლებში SafetyKit-ის, ROOST-ის, Tomoro-სა და Discord-ის ნდობისა და უსაფრთხოების სპეციალისტებთან ერთად, gpt-oss-safeguard არაერთი იტერაციით დავხვეწეთ. ROOST-ის CTO ვინაი რაო ამბობს: „gpt-oss-safeguard არის ღია კოდის მსჯელობის პირველი მოდელი დიზაინით „წარმოადგინეთ თქვენი საკუთარი პოლიტიკები და ზიანის განსაზღვრებები“. ორგანიზაციებს უნდა ჰქონდეთ შესაძლებლობა, თავისუფლად შეისწავლონ, შეცვალონ და გამოიყენონ კრიტიკული უსაფრთხოების ტექნოლოგიები და შეძლონ ინოვაციების შექმნა. ჩვენს ტესტირებაში მან გამოავლინა დახელოვნება სხვადასხვა წესის გაგებაში, თავისი მსჯელობის ახსნასა და წესების გამოყენებისას ნიუანსების წარმოჩენაში, რაც, ჩვენი აზრით, სასარგებლო იქნება შემქმნელებისა და უსაფრთხოების გუნდებისთვის.
ჩვენ გავაგრძელებთ საზოგადოებასთან ერთად მუშაობას, რათა გავაუმჯობესოთ ღია უსაფრთხოების ინსტრუმენტები, მათ შორის ROOST Model Community-ს (RMC) მეშვეობით. RMC აერთიანებს უსაფრთხოების პრაქტიკოსებსა და მკვლევრებს, რომლებიც აზიარებენ საუკეთესო პრაქტიკას ღია წყაროს AI მოდელების უსაფრთხოების სამუშაო პროცესებში დანერგვისთვის, მათ შორის, შეფასებების შედეგებსა და გამოხმაურებას მოდელებთან დაკავშირებით. ეწვიეთ RMC-ის GitHub რეპოზიტორიას(იხსნება ახალ ფანჯარაში), რომ შეიტყოთ მეტი ამ პარტნიორობის შესახებ და თუ როგორ შეგიძლიათ, ჩაერთოთ.
ამ მოდელებით შექმნის დასაწყებად ჩამოტვირთეთ ისინი Hugging Face(იხსნება ახალ ფანჯარაში)-იდან.

