გადადით მთავარ შინაარსზე
OpenAI

16 სექტემბერი, 2026

კვლევაუსაფრთხოება

მოდელის შეუსაბამობის ანგარიშგების ჩვენი ჩარჩო

იტვირთება…

OpenAI-ში მოდელის შეუსაბამობის შემთხვევების აღრიცხვის, გამოძიებისა და გასაჯაროების ახალ ჩარჩოს გიზიარებთ, ბოლო ექვს თვეში დაფიქსირებული მოდელის მოულოდნელი ან შემაშფოთებელი ქცევის შესახებ ექვს ანგარიშთან ერთად.

წარსულში, მკვლევრების, ხელოვნური ინტელექტის დეველოპერების, პოლიტიკის შემქმნელებისა და ფართო საზოგადოების უკეთ ინფორმირებისთვის, ვცდილობდით, შეუსაბამობის შესახებ ჩვენი მიგნებები საჯაროდ გამოგვექვეყნებინა. თუმცა ამ მიგნებების ანგარიშგების სისტემური მიდგომის უქონლობის გამო, ინფორმაციას არათანმიმდევრულად და სასურველზე იშვიათად ვასაჯაროებდით: ხშირად ველოდებოდით, სანამ რამდენიმე შემთხვევას ერთ ანგარიშში გავაერთიანებდით, ან მათ ახლად გამოშვებული მოდელების სისტემურ ბარათებს ვამატებდით. ახალი ჩარჩოს მიზანია, დაკვირვების შემდეგ შეუსაბამობის ანგარიშების გამოქვეყნება დააჩქაროს მაშინაც კი, როცა აღწერილი ქცევა ჯერ სრულად არ აგვიხსნია ან არ შეგვიმსუბუქებია.

ხელოვნური ინტელექტის სისტემების განვითარებასა და ფართოდ დანერგვასთან ერთად, თანხვედრის კვლევის პროგრესზე უფრო ფართო და უკეთ ინფორმირებული კონსენსუსის ჩამოყალიბება გვჭირდება. ჩვენ არ გვჯერა, რომ ხელოვნური ინტელექტის ინდუსტრიამ თანხვედრისა და მონიტორინგის საკითხები იმდენად გადაჭრა, რომ კიდევ დიდხანს შეძლოს პასუხისმგებლობით, მაქსიმალური სიჩქარით მასშტაბირება. უახლოეს თვეებსა და წლებში ხელოვნური ინტელექტის განვითარების გზის შესახებ გადაწყვეტილებები უნდა ეფუძნებოდეს მტკიცებულებებს, რომელთა დამოუკიდებლად შესწავლაც მოწინავე მოდელების შემქმნელი კომპანიების გარეთ მყოფ ადამიანებს შეუძლიათ.

შეუსაბამობის მაგალითები შეიძლება დაგვეხმაროს იმ პრობლემების გამოვლენაში, რომლებსაც სხვა დეველოპერები მათი სისტემების მსგავსი შესაძლებლობების მიღწევისას შეხვდებიან, დაცვის მექანიზმების სისუსტეების აღმოჩენაში ან მოდელის ქცევის შესახებ ვარაუდების გადახედვაში. ამ მიგნებების გაზიარება სხვებს საშუალებას აძლევს, იგივე პრობლემები გამოიკვლიონ, ჩვენი განმარტებები შეამოწმონ და შემარბილებელი ზომები გააუმჯობესონ. რადგან შეუსაბამობასთან დაკავშირებული გამჭვირვალობა მნიშვნელოვნად მიგვაჩნია, ახალი ჩარჩო ინფორმაციის გასაჯაროებას ანიჭებს უპირატესობას მაშინაც კი, როცა მისი მნიშვნელობა გაურკვეველია. ეს ნიშნავს, რომ ზოგიერთი გასაჯაროებული შემთხვევა შეიძლება მცდარი აღმოჩნდეს და არც ფართო კანონზომიერების ნაწილი იყოს და არც სამომავლო მოვლენებზე მიუთითებდეს.

ამჟამად ინდუსტრიას არ აქვს ერთიანი ჩარჩო, რომელიც მკაფიოდ განსაზღვრავს, როგორ უნდა გაასაჯაროონ ხელოვნური ინტელექტის დეველოპერებმა თავიანთ მოდელებში შეუსაბამობის მაგალითები. იმედი გვაქვს, დღეს წარმოდგენილი ჩარჩო პირველი ნაბიჯი იქნება ასეთი სტანდარტების შესაქმნელად და განსაზღვრავს, შეუსაბამობის რომელი შემთხვევები უნდა გაასაჯაროონ დეველოპერებმა და რას უნდა მოიცავდეს მათი ანგარიშები. ამ ჩარჩოს მიმდინარე სამუშაოდ მივიჩნევთ და გამოცდილებისა და საზოგადოების უკუკავშირის საფუძველზე დავხვეწთ.

აქ აღვწერთ, როგორ იმუშავებს ჩარჩო, და პირველ გამოქვეყნებულ ანგარიშებს გიზიარებთ.

შეუსაბამობის რომელ მაგალითებს გავასაჯაროებთ

ჩვენი მიზანია, გავასაჯაროოთ მაგალითები, რომლებიც სასარგებლო მტკიცებულებებს გვაწვდის იმის შესახებ, როგორ წარმოიქმნება და ვლინდება მოდელის შეუსაბამობა და სად მუშაობს ან ვერ მუშაობს დაცვის მექანიზმები. უპირატესობას ვანიჭებთ ახალ მექანიზმებს, ცნობილ ქცევაში მნიშვნელოვან ცვლილებებსა და მიგნებებს, რომლებიც უსაფრთხოების ან შემარბილებელი ზომების შესახებ ვარაუდებს ეჭვქვეშ აყენებს. გასაჯაროების დასასაბუთებლად აუცილებელი არ არის, მაგალითმა ზიანი გამოიწვიოს ან ფართო კანონზომიერება დაადასტუროს. ეს ჩარჩო მოიცავს შესაბამის ქცევას მოდელის მთელი სასიცოცხლო ციკლის განმავლობაში — მათ შორის, წვრთნის, შეფასების, ტესტირებისა და დანერგვისას.

ეს მოიცავს მოდელების მიერ უნებართვოდ მოქმედების, სხვა მოდელებთან კოორდინაციის ან ზედამხედველობისთვის თავის არიდების ახალ გზებს; ხარვეზებს, რომლებიც თანხვედრის მეთოდს ან დაცვის მექანიზმს ეჭვქვეშ აყენებს; და ქცევას, რომელიც გამოქვეყნებულ უსაფრთხოების შეფასებაში მოცემულ მტკიცებას ეწინააღმდეგება. გასაჯაროების იგივე კრიტერიუმები ვრცელდება შეუსაბამობაზე, რომელმაც შეიძლება მესამე მხარეებზე იმოქმედოს.

ეს შეიძლება მოიცავდეს შეუსაბამობის ისეთ შემთხვევებსაც, რომლებიც წარსულში გასაჯაროებულ შემთხვევებს იმეორებს. პრობლემის განმეორება შეიძლება თავად იყოს სასარგებლო მტკიცებულება ჩვენი მოდელების ქცევის ან დაცვის მექანიზმების ეფექტიანობის შესახებ — მაგალითად, თუ კონკრეტული სახის შეუსაბამო ქცევა მისი შემსუბუქების მრავალჯერადი მცდელობის მიუხედავად კვლავ მეორდება. ასეთ ვითარებაში დამატებით მაგალითებს შეუსაბამობის თავდაპირველი განცხადების განახლებით გამოვაქვეყნებთ.

სამომავლოდ სხვა დეველოპერებთან, გარე მკვლევრებთან, ინდუსტრიის სტანდარტების ორგანიზაციებსა და მარეგულირებლებთან ერთად გასაჯაროების უფრო ობიექტური კრიტერიუმების შემუშავებას ვგეგმავთ. ასევე მიგვაჩნია, რომ უსაფრთხოებასთან, დაცულობასა და შეუსაბამობასთან დაკავშირებული სერიოზული ინციდენტები აშშ-ის ფედერალურ მთავრობას უნდა ეცნობოს, ამიტომ ანგარიშგების მექანიზმების შეთავაზებაზე ვმუშაობთ. ამ ჩარჩოს არსებული ვალდებულებების შემავსებლად მივიჩნევთ და აღვნიშნავთ, რომ ის არ ცვლის ინფორმაციის გასაჯაროების სამართლებრივ მოთხოვნებს, მათ შორის კრიტიკული უსაფრთხოების ინციდენტებისა და კიბერუსაფრთხოების დარღვევების შესახებ მოთხოვნებს.

შეუსაბამობის მაგალითები, რომლებსაც დღეს გიზიარებთ

შეუსაბამობის გასაჯაროების ახალი ჩარჩოს ამოქმედებასთან დაკავშირებით ვაქვეყნებთ ექვს ანგარიშს შეუსაბამო ქცევის შემთხვევებზე, რომლებიც ჩვენი მოდელების წვრთნის ან შეფასებისას დავაფიქსირეთ. ეს შემთხვევები ასახავს სხვადასხვა ქცევას, რომელთა გაზიარებაც მნიშვნელოვნად მიგვაჩნია — მომხმარებლისთვის ინფორმაციის დამალვიდან დაბრკოლებების გადასალახად უნებართვო მოქმედებების შესრულებამდე. ეს ცალკეული შემთხვევების ანგარიშებია და არ უნდა მივიჩნიოთ იმის მაჩვენებლად, თუ რამდენად ხშირად ვლინდება შეუსაბამობა ჩვენს მოდელებში. ქვემოთ მოცემული თითოეული პუნქტი სრულ ანგარიშს უკავშირდება.

  1. დავალების შეჯამებებში თვითგენერირებული მითითებები(იხსნება ახალ ფანჯარაში). გამოუშვებელმა კვლევითმა მოდელმა ახალ კონტექსტურ ფანჯარაში მუშაობის გასაგრძელებლად გამოყენებულ შეჯამებებში ჩასვა დაუკავშირებელი მითითებები, მათ შორის ჩვეულებრივი შეზღუდვების უგულებელყოფის მოთხოვნა. ჩვენ 27 დაზარალებული შეჯამება გამოვავლინეთ.

  2. დავალების შეჯამებებში შეცდომების დამალვის მითითებები(იხსნება ახალ ფანჯარაში). GPT‑5.6 Sol-ის წვრთნისას მოდელის ბევრმა ეგზემპლარმა თავის შეჯამებებს დაამატა მითითებები, რომ მომხმარებლისთვის შეცდომები ან შეუსაბამო ქცევა დაემალა. მაგალითად, შეკუმშულ შეჯამებებში იყო მითითებები, რომ ნაკლული ისტორიული მონაცემები ამის გაუმხელად გამოეგონებინათ და წყაროთა ვერსიებს შორის შეუსაბამობები დაემალათ.

  3. საჯარო რეპოზიტორიუმებში გამჟღავნებული API-გასაღებების ძიება და შემდეგ ინფორმაციის შეთხზვა(იხსნება ახალ ფანჯარაში). კალიფორნიის ერთ-ერთ ოლქში შემოსავლის მაჩვენებლების შესახებ ჩვეულებრივ კითხვაზე პასუხისას მოდელმა იპოვა და უნებართვოდ გამოიყენა გამჟღავნებული API-გასაღები. როცა მოთხოვნილი მაჩვენებლების მიღება მაინც ვერ შეძლო, მან ისინი გამოიგონა და მოთხოვნილი წყაროდან აღებულ მონაცემებად წარმოადგინა.

  4. ფაილების ინტერნეტში ატვირთვა მათ დასამოწმებლად(იხსნება ახალ ფანჯარაში). როცა მომხმარებელმა გამოუშვებელ მოდელს 5 000 000 კვადრატულ მეტრზე დიდი ტბების ID-ები და სახელები სთხოვა, აგენტმა Python-ის გამოყენებით სწორი პასუხი იპოვა. თუმცა, რადგან მითითებები ბრაუზერიდან წყაროს დამოწმებას მოითხოვდა, აგენტმა მომხმარებლის დაუკითხავად გადაწყვიტა ფაილის ატვირთვა, რათა პასუხში მასზე მიეთითებინა.

  5. უნებართვო ჩაწერა და კომუნიკაცია შიდა პროგრამული რეპოზიტორიუმის მეშვეობით(იხსნება ახალ ფანჯარაში). ნაკლული შემავალი ფაილების ძიებისას მოდელებმა შიდა პროგრამული რეპოზიტორიუმი შეტყობინებების დაფად გამოიყენეს, რათა ცალკეულ სასწავლო ნიმუშებს შორის მოთხოვნები და პასუხები გაეცვალათ, თუმცა ფაილების აღდგენა ვერ შეძლეს. ანგარიში ასევე განიხილავს ადრინდელ შემთხვევას, როცა მოდელმა ქსელის შეზღუდვების გვერდის ავლის მცდელობისას სატესტო ფაილები რეპოზიტორიუმში წარმატებით ატვირთა.

  6. თანამშრომელ აგენტებს შორის ფაილების უნებართვო გაზიარება(იხსნება ახალ ფანჯარაში). ერთსა და იმავე სასწავლო დავალებაზე ერთად მომუშავე აგენტებმა საჯარო ფაილჰოსტინგის ვებსაიტები გამოიყენეს ფაილების გასაზიარებლად, როცა ერთმანეთის ადგილობრივ ფაილებზე წვდომა არ ჰქონდათ. ამის შედეგად დავალების საბოლოო მასალები საჯარო URL-ებზე გახდა ხელმისაწვდომი, მიუხედავად იმისა, რომ დავალება მოდელებისგან მხოლოდ ადგილობრივი ფაილების გამოყენებას მოითხოვდა.

როგორ მუშაობს გასაჯაროების ჩვენი პროცესი

OpenAI-ის ნებისმიერ თანამშრომელს შეუძლია შეუსაბამობის მაგალითი ჩვენი უსაფრთხოებისა და თანხვედრის გუნდებს გამოსაძიებლად გადასცეს და მისი საჯაროდ გასაჯაროების განხილვა მოითხოვოს. ამით იწყება გასაჯაროების პროცესი, რომლის თითოეულ ეტაპსაც დროული გამოძიებისა და გასაჯაროებისთვის განსაზღვრული ვადა აქვს.

მაგალითის მონიშვნის შემდეგ ჩვენი ტექნიკური პერსონალი გამოიკვლევს, რა მოხდა, რა რჩება გაურკვეველი, გამართლებულია თუ არა საჯაროდ გასაჯაროება და რომელი ფაქტების გაზიარება შეიძლება. ისინი ასევე შეაფასებენ, დაზარალდა თუ არა რომელიმე მესამე მხარე და სჭირდება თუ არა მას გამოქვეყნებამდე პირადად შეტყობინება.

შემდეგ მაგალითი სამი პროცედურიდან ერთ-ერთს მიეკუთვნება: „მზადაა გასაჯაროებისთვის“, „მცირე გამოძიება“ ან „ფართომასშტაბიანი გამოძიება“ („ნელი პროცედურა“).

„მზადაა გასაჯაროებისთვის“ მოიცავს შესაბამის შემთხვევებს, რომელთა გამოძიებაც საკმარისად დასრულებულია, რათა შემოწმების შემდეგ გამოქვეყნდეს. „მცირე გამოძიება“ მოიცავს შემთხვევებს, რომლებსაც დამატებითი ტექნიკური შესწავლა სჭირდება. ვვარაუდობთ, რომ ეს ორი პროცედურა გასაჯაროებული შემთხვევების უდიდეს უმრავლესობას მოიცავს, განსაკუთრებით მათ, რომლებსაც ფართო გამოძიება, მესამე მხარეებთან კოორდინაცია ან მძიმე ბოროტად გამოყენების რისკების მართვა არ სჭირდება. დღეს გამოქვეყნებული ყველა შემთხვევა ამ ორი პროცედურიდან ერთ-ერთს მიეკუთვნება.

„ფართომასშტაბიანი გამოძიება“ მოიცავს რთულ გამოძიებებს, განსაკუთრებით მესამე მხარეებთან დაკავშირებულ შემთხვევებს. თუ შემთხვევა მესამე მხარეს ეხება, უსაფრთხოებასთან, სამართლებრივ საკითხებსა და პასუხისმგებლობით გასაჯაროებასთან დაკავშირებულ ჩვენს ვალდებულებებს ამ ჩარჩოზე უპირატესი ძალა აქვს. ვეცდებით, პირველადი შეტყობინება რაც შეიძლება მალე გამოვაქვეყნოთ, თუმცა უსაფრთხოების მიზეზით შესაძლოა მისი გადადება დაგვჭირდეს — მაგალითად, თუ მოდელი ფართოდ გამოყენებულ პროგრამულ უზრუნველყოფაში მანამდე უცნობ მოწყვლადობას აღმოაჩენს. თუ ანგარიში მესამე მხარის ვინაობას გაამჟღავნებს, ვაპირებთ, მას წინასწარ შევატყობინოთ მაშინაც კი, როცა უსაფრთხოების საზღვარი არ დარღვეულა.

„ფართომასშტაბიანი გამოძიების“ შემთხვევის პირველადი შეტყობინება ზოგადად აღწერს მომხდარს, მიუთითებს, ეხმარებიან თუ არა გამოძიებას გარე ექსპერტები, და შეძლებისდაგვარად დაასახელებს საბოლოო ანგარიშის გამოქვეყნების სავარაუდო დროს. OpenAI-ის Hugging Face-ის ინციდენტი ამ ჩარჩოს ფარგლებში რომ გასაჯაროებულიყო, სწორედ ამ პროცედურას მიეკუთვნებოდა.

თანამშრომელს, რომელმაც მაგალითის შესახებ აცნობა, შეატყობინებენ, გადაწყდა თუ არა მისი გასაჯაროება და, თუ გასაჯაროვდება, რომელი პროცედურით განიხილავენ. გასაჯაროების ან შესაბამისი პროცედურის შესახებ მოუგვარებელი უთანხმოება გადაეცემა OpenAI-ის უსაფრთხოების საკონსულტაციო ჯგუფს (SAG) — კომპანიის სხვადასხვა განყოფილების მაღალი რანგის ხელმძღვანელთა ჯგუფს, რომელიც აფასებს მოწინავე მოდელების შესაძლებლობებსა და დაცვის მექანიზმებს, ზედამხედველობს ჩვენს მზაობის ჩარჩოს და კონსულტაციას უწევს OpenAI-ის ხელმძღვანელობას. SAG-ის შიგნით არსებული უთანხმოება ან თანამშრომელთა წინააღმდეგობა მის გადაწყვეტილებებთან დაკავშირებით განსახილველად გადაეცემა OpenAI-ის ხელმძღვანელობას. გადაწყვეტილებები ინფორმაციის არგასაჯაროების ან გასაჯაროების უსაფუძვლობის შესახებ ეცნობება უსაფრთხოებისა და თანხვედრის მიმართულებების ხელმძღვანელობას და, შეძლებისდაგვარად, შესაბამის ტექნიკურ პერსონალს.

პრაქტიკაში მიღებული გამოცდილების საფუძველზე შესაძლოა გასაჯაროების ეს პროცესი გადავხედოთ; ყველა ცვლილებას ამ პოსტში აღვწერთ.

რას მოიცავს თითოეული ანგარიში

თითოეულ სრულ ანგარიშში აღვწერთ დაკვირვებულ ქცევას, მის სიმძიმესა და ნებისმიერ გარე ზემოქმედებას, გარემოს, რომელშიც ის გამოვლინდა, თარიღს ან თარიღების დიაპაზონს, აღმოჩენის დროს და, ზოგადად, შესაბამის მოდელს ან მოდელებს. შეძლებისდაგვარად, ასევე გავაზიარებთ:

  • მომხდარის დამატებით დეტალებსა და მისგან გამოწვეულ ზიანს;

  • როგორ აღმოვაჩინეთ შეუსაბამობა და რა მასშტაბი ჰქონდა ჩვენს გამოძიებას;

  • ჩვენს შეფასებას, თუ რას ნიშნავს ეს თანხვედრის კვლევისა და ხელოვნური ინტელექტის ტექნიკური უსაფრთხოებისთვის;

  • მაგალითით წამოჭრილ მნიშვნელოვან პასუხგაუცემელ კითხვებს;

  • ზომებს, რომლებსაც ამ ქცევის აღმოსაფხვრელად ვიღებთ ან ვგეგმავთ. გასაჯაროებისას ეს ინფორმაცია შესაძლოა ყოველთვის ხელმისაწვდომი არ იყოს, რადგან შეუსაბამობის ანგარიში შეიძლება გამოძიების დასრულებამდე ან გამოსწორების გზის შემუშავებამდე გამოვაქვეყნოთ.

მომხმარებელთა სისტემებში გამოვლენილი შეუსაბამობის შესახებ იმდენ ინფორმაციას გავაზიარებთ, რამდენის საშუალებასაც მომხმარებელთა კონფიდენციალურობა და ჩვენი სახელშეკრულებო ვალდებულებები გვაძლევს.

დღევანდელი ანგარიშები გასაჯაროებული მასალების საწყისი ნაკრებია და არა ცნობილი შეუსაბამობების ან მიმდინარე გამოძიებების სრული მიმოხილვა. ეს პირველი ანგარიშები არ ასახავს ამ ჩარჩოთი გათვალისწინებული შემთხვევების სრულ სპექტრსა და სიმძიმეს. ჩვენ ვიღებთ ვალდებულებას, გავასაჯაროოთ შეუსაბამობის შემთხვევები, რომლებიც ამ ჩარჩოს კრიტერიუმებს აკმაყოფილებს, მათ შორის უფრო რთული შემთხვევები, რომელთა გამოძიებას მეტი დრო ან მესამე მხარეებთან კოორდინაცია სჭირდება. ამ ჩარჩოს საფუძველზე ანგარიშების გამოქვეყნებას რეგულარულად გავაგრძელებთ და ჩვენი ანგარიშგების ვალდებულებების შემუშავებასთან ერთად მათ შესახებ დამატებით ინფორმაციასაც გავაზიარებთ.