გადადით მთავარ შინაარსზე
OpenAI
იტვირთება…

დღეს გამოვუშვით GPT‑6 Astra — ყველაზე ძლიერი მოდელი, რომელიც ფართოდ დაგვინერგავს. Astra ჩვენი პირველი მოდელია, რომელმაც მზაობის ჩარჩოს მიხედვით კიბერუსაფრთხოების შესაძლებლობების კრიტიკულ დონეს მიაღწია.

ამ გამოშვების უსაფრთხოების შესახებ ყველაზე მნიშვნელოვანია იცოდეთ შემდეგი:

  1. GPT‑6 Astra კიბერშესაძლებლობების მნიშვნელოვანი წინსვლაა და ჩვენს კრიტიკულ ზღვარს აკმაყოფილებს. ეს ნიშნავს, რომ სათანადო სათანადო ხელსაწყოებისა და წვდომის შემთხვევაში GPT‑6 Astra-ს შეუძლია, ადამიანის მიერ თითოეული ნაბიჯის მართვის გარეშე, ბევრ კარგად დაცულ სისტემაში აქამდე უცნობი უსაფრთხოების ხარვეზები იპოვოს და მათი გამოყენების ახალი გზები შეიმუშაოს. შესაბამისად, მნიშვნელოვნად გავაძლიერეთ დაცვა მოდელის მიერ საზიანო კიბერმოქმედებების შესრულებისგან — იქნება ეს ბოროტად გამოყენების თუ მიზნებთან შეუსაბამობის შედეგი. ასევე მივიღეთ ზომები Astra-სა და მსგავსი მოდელების შიდა შემუშავებისა და დანერგვის დასაცავად, მათ შორის: უფრო მკაცრი იზოლაცია, საკონტროლო წერტილების დაშიფვრა, სრული ტრაექტორიების საყოველთაო მონიტორინგი აზროვნების ჯაჭვების (CoT) ჩათვლით და შიდა გამოყენებამდე შესაბამისობის სავალდებულო შეფასება.
  2. GPT‑6 Astra წინამორბედებზე მნიშვნელოვნად უფრო მდგრადია. მდგრადობაზე ორიენტირებული უსაფრთხოების სწავლების ახალი მეთოდების დანერგვის შედეგად, GPT‑6 Astra მწარმოებლის შეზღუდვების მოხსნის მიმართ GPT‑5.6 Sol-ზე მნიშვნელოვნად უფრო მდგრადია, მათ შორის გრძელ ტრაექტორიებზეც. ეს ვიცით ოფლაინტესტებიდან და მწარმოებლის შეზღუდვების მოხსნის მკაცრი შიდა და გარე ტესტირებისა და ხარვეზების აღმოფხვრის ჩვენი პროგრამიდან. პოტენციურად მაღალი რისკის მქონედ მონიშნული მომხმარებლებისთვის მოდელი დამატებით გავწვრთენით, რათა უარის თქმის ზღვარი უფრო კონსერვატიულად შეცვალოს და ორმაგი დანიშნულების რისკების უფრო ფართო სპექტრი მოიცვას. რეგრესიულ ტესტირებას ვიყენებთ, რათა დავრწმუნდეთ, რომ Astra წინა სატესტო პერიოდებში აღმოჩენილი მწარმოებლის შეზღუდვების მოხსნის მეთოდების მიმართ მდგრადია. გაუმჯობესებების დასადასტურებლად ასევე ჩავატარეთ ავტომატიზებული შეტევითი ტესტირების (red teaming) ახალი რაუნდები ჩვენი უახლესი შეტევითი ტესტირების აგენტების გამოყენებით.
  3. GPT‑6 Astra მიზნებთან GPT‑5.6 Sol-ზე უკეთაა შესაბამისობაში. Astra მოდელის შესაბამისობის კუთხით მნიშვნელოვანი წინსვლაა და აერთიანებს გაუმჯობესებებს, რომლებიც მოიცავს როგორც წინასწარი სწავლების მონაცემების შემადგენლობას, ისე განმამტკიცებელი სწავლებისას ჩვენს შეფასებას. წარმოგიდგენთ შესაბამისობის შეფასებების ახალ ნაკრებს(იხსნება ახალ ფანჯარაში). შედეგები აჩვენებს, რომ GPT‑6 Astra უკეთ იცავს უსაფრთხოებისა და დაცულობის საზღვრებს და მოქმედებს მინიჭებული უფლებამოსილების ფარგლებში. სიმულაციაში, რომელიც მოიცავდა Codex-ის 54,000-ზე მეტ შიდა დავალებას(იხსნება ახალ ფანჯარაში), Astra-მ მაღალი სიმძიმის შეუსაბამო ქცევის გამო Sol-ზე დაახლოებით ორჯერ ნაკლები მონიშვნა მიიღო.
  4. შეუსაბამო ქცევის მონიტორინგს ფართოდ ვნერგავთ. მოდელის მიზნებთან შესაბამისობა მიგვაჩნია მთავარ ბერკეტად ჩვენი მოდელების პოტენციურად შეუსაბამო ქცევის თავიდან ასაცილებლად. ამასთან, მონიტორინგი მოწინავე მოდელის ქცევაზე ფართო დაკვირვების შესაძლებლობას გვაძლევს და შესაბამისობისა და უსაფრთხოების შემდგომი გაუმჯობესების გზებს წარმოაჩენს. გარდა ამისა, მონიტორინგი აღმოჩენილი შეუსაბამო ქცევისგან დაცვის დამატებითი ფენაა. ამ მიზეზებით, Astra-ს გარე დანერგვაში ხელსაწყოების გამოყენებასთან დაკავშირებულ ყველა ინფერენციას შეუსაბამო ქცევის მონიტორინგიც დავუმატეთ, რაც მნიშვნელოვან გამოთვლით რესურსს მოითხოვს. ეს სისტემა ჩვენს შიდა გარემოს იმეორებს.
  5. GPT‑6 Astra-ს მონიტორინგის შესაძლებლობა GPT‑5.6 Sol-თან შედარებით შემცირდა. საფუძვლიანად გამოვიკვლიეთ GPT‑6 Astra-ს მონიტორინგის შესაძლებლობა(იხსნება ახალ ფანჯარაში) და მართვადობა(იხსნება ახალ ფანჯარაში). დავადგინეთ, რომ GPT‑6 Astra საკუთარ CoT-ს GPT‑5.6 Sol-ზე უკეთ აკონტროლებს და ნაკლებად მოსალოდნელია, საკუთარ CoT-ში მამხილებელი ინფორმაცია მოხვდეს. წინააღმდეგობრივ პირობებში, როდესაც მოდელს ჩვენი მონიტორებისთვის თავის არიდებას ვავალებთ, შეფასებებისას შესაძლებლობების მიზანმიმართული შემცირების შემთხვევაში ის შეუმჩნეველი რჩება და გარკვეული საბოტაჟის დავალებების(იხსნება ახალ ფანჯარაში) შესრულებისას ზოგჯერ ჩვენს შიდა მონიტორებსაც უვლის გვერდს. სტეგანოგრაფიული CoT-მსჯელობის ნიშნები არ გვინახავს (მაგალითად, ფარული მსჯელობის დამალვა ჩვეულებრივ და ერთი შეხედვით დაუკავშირებელ ტექსტში), რაც მიუთითებს, რომ თავის არიდების რისკი შესაძლოა ძირითადად ნაკლებად რთული მსჯელობის დავალებებით შემოიფარგლებოდეს.
    • ეს მიგნებები მიუთითებს, რომ Astra-ს კლასის მოდელებს წინააღმდეგობრივ პირობებში ჩვენი CoT-მონიტორებისთვის თავის არიდება შეუძლიათ. ამ ეტაპზე ეს მიგნებები ძირითადად წინააღმდეგობრივ პირობებში განხორციელებულ შეფასებებს ეფუძნება, ანუ შემთხვევებს, როდესაც მოდელს მონიტორინგისთვის თავის არიდებას ვავალებთ. ამასთან, შესაბამისობის შეფასებები მთლიანობაში აჩვენებს, რომ Astra GPT‑5.6 Sol-ზე ნაკლებად არღვევს დაცულობისა და უსაფრთხოების შეზღუდვებს.
    • თუმცა, ამ ტენდენციას სერიოზულად ვეკიდებით და მოდელების შესაძლებლობების ზრდასთან ერთად კვლავ ვიკვლევთ ამ მიგნებებსა და მათ გავლენას მონიტორინგის შესაძლებლობაზე. OpenAI მუშაობდა აზროვნების ჯაჭვის მონიტორინგის შენარჩუნებასა და გამოყენებაზე, ხოლო CoT-ის მონიტორინგის შესაძლებლობის შენარჩუნება კვლევითი პროგრამის ერთ-ერთი მთავარი მიზანია. ამასთან, ეს შედეგები ხაზს უსვამს მოდელის აზროვნების ჯაჭვის შესწავლის მიღმა შესაბამისობის აუდიტის მეთოდების შემუშავების მნიშვნელობას.
  6. GPT‑6 Astra ვებდათვალიერებისა და სამუშაო გარემოებში უფრო პასუხისმგებლიანად მოქმედებს: GPT‑6 Astra მოთხოვნის ინექციების მიმართ GPT‑5.6 Sol-ზე მნიშვნელოვნად უფრო მდგრადია. მოდელის ქცევა ვებდათვალიერებისა და პროფესიული კომპიუტერული მუშაობის რეალისტურ გარემოებშიც გამოვცადეთ. GPT‑5.6 Sol-თან შედარებით, მოდელი მნიშვნელოვნად ნაკლებად ასრულებს შეუსაბამო და პოტენციურად დამაზიანებელ მოქმედებებს, როგორიცაა უნებართვო ტრანზაქციები, მონაცემთა დაკარგვა, ზედმეტი წვდომა ან კონტროლის ზომებისთვის გვერდის ავლა. აგენტურ გარემოებში ის საზიანო მოთხოვნებსაც უფრო უსაფრთხოდ ამუშავებს, მაგალითად, ძალადობრივი თავდასხმის დაგეგმვაში დახმარების ან თაღლითობის ჩადენის მოთხოვნებს.
  7. GPT‑6 Astra მაღალი რისკის სცენარებში მნიშვნელოვნად უფრო უსაფრთხოა. GPT‑6 Astra საწარმოო გარემოდან და ადამიანების მიერ ჩატარებული წინააღმდეგობრივი შეტევითი ტესტირებიდან (red teaming) აღებულ რთულ მოთხოვნებს GPT‑5.6 Sol-ზე უსაფრთხოდ პასუხობს. Astra პარეტოს გაუმჯობესებას აღწევს: სახიფათო მოთხოვნებს უსაფრთხოდ ასრულებს და უვნებელ მოთხოვნებზე ზედმეტ უარს ნაკლებად ამბობს. ეს გაუმჯობესებები ვრცელდება მაღალი სიმძიმის სცენარებზეც, რომლებშიც ზიანის რისკი არა აშკარა მოთხოვნიდან, არამედ უფრო ფართო კონტექსტიდან წარმოიშობა. Astra ასევე უფრო თანმიმდევრულად იყენებს ასაკის შესაბამის უსაფრთხოების საზღვრებს 18 წლამდე მომხმარებლებისთვის.

დამატებითი ინფორმაციისთვის იხილეთ სრული სისტემური ბარათი(იხსნება ახალ ფანჯარაში).