ვიწყებთ GPT‑5.6 სერიის შეზღუდულ წინასწარ ვერსიას: Sol — ჩვენი მოწინავე მოდელი; Terra — დაბალანსებული მოდელი ყოველდღიური სამუშაოსთვის; და Luna — სწრაფი და ხელმისაწვდომი მოდელი. Terra-ს GPT‑5.5‑ის კონკურენტული წარმადობა აქვს, თუმცა 2-ჯერ იაფია, ხოლო Luna ძლიერ შესაძლებლობებს ჩვენს ყველაზე დაბალ ფასად გვთავაზობს.
GPT‑5.6 Sol გამოდის ჩვენი დღემდე ყველაზე გამძლე უსაფრთხოების სისტემით. ჩვენ გავაძლიერეთ დაცვის მექანიზმები მაღალი რისკის შემცველი აქტივობებისთვის, სენსიტიური კიბერმოთხოვნებისა და განმეორებითი ბოროტად გამოყენების შემთხვევებისთვის, და რამდენიმე კვირა დავუთმეთ სუსტი წერტილების გამოვლენას, ჩვენი სისტემის სტრეს-ტესტირებას და მის გამყარებას რეალური შეტევების წინააღმდეგ.
გვჯერა ფართო წვდომის და ვგეგმავთ, GPT‑5.6 Sol, Terra და Luna უახლოეს კვირებში საყოველთაოდ ხელმისაწვდომი გავხადოთ. აშშ-ის მთავრობასთან ჩვენი მიმდინარე თანამშრომლობის ფარგლებში, დღევანდელ გაშვებამდე წინასწარ გავუზიარეთ ჩვენი გეგმები და მოდელების შესაძლებლობები. მათი თხოვნით, უფრო ფართო გამოშვებამდე ვიწყებთ შეზღუდული წინასწარი ვერსიით სანდო პარტნიორების მცირე ჯგუფისთვის, რომელთა მონაწილეობაც მთავრობას ეცნობა. ამ წინასწარი ვერსიისას გავაგრძელებთ ტესტირებას და პარტნიორებთან მჭიდრო კოორდინაციას, სანამ უფრო ფართო ხელმისაწვდომობაზე ვიმუშავებთ. არ მიგვაჩნია, რომ მთავრობისთვის ასეთი წვდომის პროცესი გრძელვადიან ნაგულისხმევ წესად უნდა იქცეს. ეს საუკეთესო ინსტრუმენტებს აშორებს მომხმარებლებს, დეველოპერებს, საწარმოებს, კიბერდამცველებსა და გლობალურ პარტნიორებს, რომლებსაც ისინი სჭირდებათ. ამ მოკლევადიან ნაბიჯს იმიტომ ვდგამთ, რადგან გვჯერა, რომ ეს არის ყველაზე საიმედო გზა უახლოეს კვირებში ფართო ხელმისაწვდომობის მისაღწევად, სანამ ადმინისტრაციასთან ერთად ვმუშაობთ კიბერუსაფრთხოების შესახებ აღმასრულებელი ბრძანების ჩარჩოსა და მომავალში მოდელების გამოშვების განმეორებადი პროცესის შემუშავებაზე.
GPT‑5.6 Sol ჩვენი ყველაზე ძლიერი მოდელია დღემდე. მოდელის წარმადობის წინასწარ საჩვენებლად ვაზიარებთ შეფასებების ნაკრებს, რომელიც კოდირებაში, ბიოლოგიასა და კიბერუსაფრთხოებაში გაუმჯობესებულ აგენტურ შესაძლებლობებს აჩვენებს; დამატებითი უსაფრთხოებისა და მზადყოფნის შეფასებები ხელმისაწვდომია ჩვენს სისტემურ ბარათში(იხსნება ახალ ფანჯარაში). შეფასების შედეგების გაფართოებულ ნაკრებს მაშინ გავაზიარებთ, როცა მოდელს ფართოდ გავხდით ხელმისაწვდომს.
GPT‑5.6‑თან ერთად შემოგვაქვს ახალი `max` მსჯელობის ძალისხმევა, რათა Sol-ს ღრმა მსჯელობისთვის ყველაზე მეტი დრო მიეცეს. გარდა ამისა, შემოგვაქვს ახალი `ultra` რეჟიმი, რომელიც ქვეაგენტების გამოყენებით აჩქარებს რთულ სამუშაოს და ერთი აგენტის შესაძლებლობებს სცდება.
კოდირების სამუშაო პროცესებისთვის GPT‑5.6 Sol ახალ მოწინავე შედეგს აჩვენებს Terminal‑Bench 2.1-ზე, რომელიც ამოწმებს ბრძანების ხაზის პროცესებს, სადაც დაგეგმვა, იტერაცია და ინსტრუმენტების კოორდინაციაა საჭირო.
GPT‑5.6 Sol ასევე ფართო გაუმჯობესებებს აჩვენებს ბიოლოგიის სამუშაო პროცესებში. GeneBench v1-ზე, რომელიც გრძელჰორიზონტიან გენომიკასა და რაოდენობრივი ბიოლოგიის ანალიზებს აფასებს, ის GPT‑5.5-ზე ძლიერ შედეგებს აღწევს ნაკლები ტოკენის გამოყენებით.
GPT‑5.6 Sol ჩვენი ყველაზე ძლიერი მოდელია კიბერუსაფრთხოების მიმართულებით. ის ცვლის შესრულება–ეფექტიანობის საზღვარს გრძელვადიანი უსაფრთხოების ამოცანებისთვის, მათ შორის დაუცველობების კვლევისა და ექსპლუატაციის სფეროში. ExploitBench²-ზე GPT‑5.6 Sol კონკურენტულია Mythos Preview-სთან, გამოტანის ტოკენების მხოლოდ დაახლოებით 1/3-ის გამოყენებით. ExploitGym(იხსნება ახალ ფანჯარაში)3-ზე, რომელიც UC Berkeley-ის მკვლევრებმა OpenAI-სა და სხვა მოწინავე ლაბორატორიებთან თანამშრომლობით შექმნეს, GPT‑5.6 Sol, Terra და Luna მოდელები მსჯელობის გაზრდასთან ერთად კიბერშესაძლებლობებში ძლიერ გაუმჯობესებებს აჩვენებენ.
ჩვენ შევქმენით GPT‑5.6 Sol, Terra და Luna ჩვენი დღემდე ყველაზე მტკიცე დამცავი მექანიზმებით, რომელთა კონფიგურაციებიც მორგებულია თითოეული მოდელის შესაძლებლობებსა და სიმძლავრეს. მოდელის შესაძლებლობების ზრდასთან ერთად, ჩვენ ისე ვავითარებთ უსაფრთხოების სისტემებს, რომ მათ სულ უფრო მეტად გაუძლონ რეალურ მოწინააღმდეგეთა ზეწოლას და, ამავდროულად, შეინარჩუნონ წვდომა ისეთ ლეგიტიმურ საქმიანობაზე, როგორიცაა კოდის რევიზია, მოწყვლადობების კვლევა, პატჩების შექმნა, გამართვა, უსაფრთხოების სწავლება და თავდაცვითი ტესტირება. ჩვენი მიზანია, აკრძალული შეტევითი აქტივობა უფრო რთული, გაურკვეველი და შესამჩნევი გავხადოთ ისე, რომ ამ სასარგებლო გამოყენებებს ზედმეტი შეზღუდვები არ დავუწესოთ. მოდელისა და დაცვების ჩვენეული შეფასებით, ლეგიტიმურ თავდაცვით სამუშაოს მნიშვნელოვანი სარგებელი ექნება, ხოლო აკრძალული შეტევითი გამოყენება არსებითად შეიზღუდება.
GPT‑5.6 Sol-ს უფრო კარგად გამოსდის ადამიანების დახმარება მოწყვლადობების პოვნასა და გამოსწორებაში, ვიდრე თავდასხმების სრულად, საიმედოდ განხორციელება. ამ შესაძლებლობების განვითარებასთან ერთად, ჩვენი პრიორიტეტია, უზრუნველვყოთ, რომ ისინი მცველებამდე მივიდეს და მათ სარგებლობა მოუტანოს, რათა მათ ეს ინსტრუმენტები სისუსტეების საპოვნელად, პატჩების შესამუშავებლად და სისტემების უფრო ფართოდ გასაძლიერებლად გამოიყენონ.
GPT‑5.6 Sol არ კვეთს Cyber Critical ზღურბლს ჩვენი Preparedness Framework-ის მიხედვით. Chromium-სა და Firefox-თან დაკავშირებულ შეფასებებში მან აღმოაჩინა ბაგები და ექსპლუატაციის პრიმიტივები — ექსპლოიტის საშენი ბლოკები — მაგრამ ტესტირებულ პირობებში ავტონომიურად არ შექმნა ფუნქციური სრული ჯაჭვის ექსპლოიტი.მიუხედავად ამისა, ბენჩმარკების ზღვრული მაჩვენებლები ვერ მოიცავს მოდელის გამოყენების ან სხვა ინსტრუმენტებთან მისი კომბინირების ყველა შესაძლო გზას. სწორედ ეს გაურკვევლობა, მოდელის შესაძლებლობების უფრო ფართო, ეტაპობრივ ცვლილებასთან ერთად, არის მიზეზი, რის გამოც ჩვენ მოდელის გაზრდილ შესაძლებლობებს უფრო ძლიერ დამცავ ზომებთან და ეტაპობრივ გამოშვებასთან ვაკავშირებთ. ჩვენს დამცავ მექანიზმებზე მეტ დეტალს ვაზიარებთ GPT‑5.6 Preview-ის სისტემურ ბარათში(იხსნება ახალ ფანჯარაში).
არც ერთი ცალკეული დამცავი მექანიზმი საკმარისი არ არის მიზანმიმართული ან ადაპტირებადი ბოროტად გამოყენების წინააღმდეგ. GPT‑5.6-ის წინასწარ ვერსიაში ვიყენებთ მრავალშრიან დაცვებს, რომელთა ზუსტი კონფიგურაციები მოდელებს შორის განსხვავდება, და მათ რეალური შეტევებით ვცდით. ეს მოიცავს მოდელში გაწვრთნილ დაცვებს, რეალურ დროში შემოწმებებს გენერირებისას, ანგარიშის დონის სიგნალებს, დიფერენცირებულ წვდომას, მონიტორინგს, აღსრულებას და უწყვეტ ტესტირებას.
GPT‑5.6 გაწვრთნილია იმგვარად, რომ უარი თქვას აკრძალულ კიბერდახმარებაზე, მათ შორის იმ შემთხვევებშიც, როდესაც მომხმარებლები ცდილობენ თავიანთი განზრახვის შენიღბვას ან მოდელის ჯეილბრეიკს (jailbreak). მოდელის დონეზე არსებული ეს დამცავი მექანიზმები აყალიბებს პირველ საზღვარს იმისა, თუ რაში უნდა გაუწიოს და რაში არ უნდა გაუწიოს დახმარება მოდელმა მომხმარებელს.
რეალური დროის კიბერ და ბიოლოგიური ბოროტად გამოყენების კლასიფიკატორები უზრუნველყოფენ დაცვის კიდევ ერთ შრეს, რაც გულისხმობს გენერირების პროცესშივე გამომავალი ინფორმაციის შეფასებას.უფრო მაღალი რისკის შემთხვევებში, პოტენციური დარღვევის აღმოჩენისას, გენერირება შესაძლოა შეჩერდეს, რათა უფრო დიდმა მსჯელობის მოდელმა გადახედოს დიალოგსა და მის კონტექსტს. თუ გამომავალი ინფორმაცია შეფასდება როგორც დაუშვებელი, ის დაიბლოკება მომხმარებლამდე მიღწევამდე.
მონიშნულმა აქტივობამ ასევე შეიძლება გამოიწვიოს ანგარიშის დონის გადამოწმება შესაბამისი დიალოგებისა და რისკის სიგნალების გათვალისწინებით, რაც შეესაბამება ჩვენს პირობებსა და პოლიტიკას კონტენტის შენახვისა და გადახედვის შესახებ. ერთი კონკრეტული საუბრის მიღმა დაკვირვება ეხმარება ჩვენს სისტემებს, განასხვავონ მიზანმიმართული მავნე ქცევა ლეგიტიმური, ორმაგი დანიშნულების უსაფრთხოების სამუშაოსგან, სადაც მსგავსი ტექნიკური ცნებები შესაძლოა სრულიად განსხვავებულ კონტექსტში ფიგურირებდეს.
ერთობლიობაში, ეს შრეები მთლიან მიდგომას ბევრად უფრო მდგრადს ხდის, ვიდრე ნებისმიერი ცალკეული დამცავი მექანიზმი. მოდელის ქცევა ამცირებს მავნე პასუხების ალბათობას, რეალური დროის სისტემებს შეუძლიათ ჩაერიონ გენერირების პროცესში, ანგარიშის დონის გადამოწმებას შეუძლია უფრო ფართო კანონზომიერებების იდენტიფიცირება, ხოლო დიფერენცირებული წვდომა ინარჩუნებს მნიშვნელოვან თავდაცვით სამუშაოებს ისე, რომ ყველაზე სენსიტიურ შესაძლებლობებს ნაგულისხმევი წესით საყოველთაოდ ხელმისაწვდომს არ ხდის.
განსაკუთრებით წინასწარი განხილვის (preview) პერიოდში, მომხმარებლები შესაძლოა წააწყდნენ დამცავ მექანიზმებს, რომლებიც ბლოკავს ან უარყოფს ზოგიერთ მოთხოვნას. სხვა მოთხოვნების დამუშავებას შესაძლოა დასჭირდეს მეტი დრო, რადგან გენერირების პროცესი შეჩერდება დამატებითი გადამოწმებისთვის. დამცავი მექანიზმები შეიძლება დროდადრო შეეხოს ლეგიტიმურ სამუშაოებსაც, განსაკუთრებით ორმაგი დანიშნულების სფეროებში, სადაც თავდაცვითი და თავდამსხმელობითი აქტივობები თავდაპირველად შესაძლოა ერთმანეთის მსგავსად გამოიყურებოდეს.
ეს არის სწორედ ის, რის შესამოწმებადაც არის განკუთვნილი წინასწარი ვერსია. ჩვენ გვსურს გავიგოთ არა მხოლოდ ის, თუ რამდენად ზღუდავს დამცავი მექანიზმები ბოროტად გამოყენებას, არამედ ისიც, შეუძლიათ თუ არა ლეგიტიმურ მომხმარებლებს ჩვეული სამუშაოს საიმედოდ და ეფექტურად შესრულება. წინასწარი განხილვისას მიღებული უკუკავშირი დაგვეხმარება ზედმეტი ბლოკირებებისა და დაყოვნებების შემცირებაში, დამცავი მექანიზმების მიერ კონტექსტის აღქმის გაუმჯობესებასა და უფრო შეუფერხებელი სამუშაო გარემოს შექმნაში მოდელის უფრო ფართო გამოშვებამდე.
ასევე ვმუშაობთ კორპორაციულ მომხმარებლებთან გრძელვადიან მიდგომებზე — მათ შორის კონფიდენციალურობის დამცავ დეტექციაზე, მომხმარებლის მიერ მართვად უსაფრთხოების კონტროლებზე და წვდომის რეგულირებაზე, რომელიც მორგებულია მომხმარებლის, კლიენტის ან სამუშაო დატვირთვის რისკის დონეზე — რათა გავაუმჯობესოთ უსაფრთხოება და ამავდროულად დავაკმაყოფილოთ კორპორაციული კონფიდენციალურობის მოთხოვნები.
დაცვის მექანიზმები ეფექტიანი უნდა დარჩეს მაშინაც, როცა თავდამსხმელები საკუთარ ტაქტიკას ადაპტირებენ. დაცვა, რომელიც მუშაობს მხოლოდ ცნობილი შეტევების ფიქსირებულ ნაკრებზე, მოწინავე მოდელისთვის საკმარისად მდგრადი არ არის.
სწორედ ამიტომ უსაფრთხოებისთვის ვხმარობთ უფრო მეტ ინტელექტსა და გამოთვლით რესურსს, ვიდრე ოდესმე — ჩვენსავე მოდელებს ვიყენებთ სისუსტეების აღმოსაჩენად და დაცვის მექანიზმების უფრო სწრაფად გასაუმჯობესებლად. ჩვენ 700 000-ზე მეტი A100-ეკვივალენტური GPU-საათი დავუთმეთ ავტომატიზებულ შეტევით ტესტირებას (red teaming), რომლის მიზანიც იყო უნივერსალური მწარმოებლის შეზღუდვების მოხსნის აღმოჩენა: შეტევები, რომლებიც შეიძლება მუშაობდეს მრავალ მოთხოვნასა თუ კონტექსტში და არა მხოლოდ ერთ ვიწრო გარემოში. ამ უფრო რთულ, უფრო ზოგად შეტევებზე ფოკუსირებამ მოგვცა შესაძლებლობა, დაგვეტესტა დაცვის მექანიზმები ცნობილი ხარვეზების ფიქსირებული ნაკრების ფარგლებს მიღმა. ეს ასევე გვაძლევს საშუალებას, გამოვიკვლიოთ გაცილებით მეტი შეტევის შაბლონი, ვიდრე ამას მხოლოდ ადამიანური ტესტირება შეძლებდა, უფრო ადრე გამოვავლინოთ ხარვეზის შაბლონები და შევამოკლოთ გზა სისუსტის აღმოჩენიდან მის აღმოფხვრამდე.
ავტომატიზებული შეტევითი ტესტირების (red teaming) გარდა, ჩვენ ვიმუშავეთ მესამე მხარის ტესტერებთანაც, რათა ჩაგვეტარებინა ფართომასშტაბიანი ადამიანური, ექსპერტული შეტევითი ტესტირება (red teaming), რომელიც გაგრძელდება წინასწარი განხილვის პერიოდში. ადამიანური შეტევითი ტესტირება (red teaming) ავსებს ავტომატიზებულ სამუშაოს იმით, რომ ამოწმებს დაცვის მექანიზმებს კრეატიული ექსპერტების წინააღმდეგ, რომლებიც ცდილობენ მოდელის არასწორად გამოყენებას იმ გზებით, რომელთაც ჩვენი სისტემები, შესაძლოა, წინასწარ ვერ განსაზღვრავდნენ.
ვერცერთი შეფასება ვერ ასახავს პროდუქტის ყველა კონფიგურაციას, მრავალსაფეხურიან შეტევას ან რეალურ სამუშაო პროცესს. ამიტომ ჩვენ ვინარჩუნებთ სწრაფი რეაგირების პროცესს, ახლად აღმოჩენილი მწარმოებლის შეზღუდვების მოხსნის რეპროდუცირების, შეფასების, პრიორიტეტულობის დასადგენად და გამოსწორებისთვის, რის შემდეგაც მათ ვამატებთ ჩვენს მიმდინარე შეფასებებში, რათა მომავალში მსგავსი ხარვეზების წინააღმდეგ ტესტირება შევძლოთ.
წინასწარი ვერსიის პერიოდში GPT‑5.6 მოდელი თავდაპირველად ხელმისაწვდომი იქნება API-ისა და Codex-ის მეშვეობით სანდო პარტნიორებისა და ორგანიზაციების შერჩეული ჯგუფისთვის. უახლოეს პერიოდში ვგეგმავთ, რომ ისინი უფრო ფართოდ გავხადოთ ხელმისაწვდომი ChatGPT‑ის, Codex-ისა და API-ის მომხმარებლებისთვის.
GPT‑5.6‑თან ერთად შემოღებულ ამ ახალ დასახელების სისტემაში რიცხვი მიუთითებს მოდელის თაობას, ხოლო Sol, Terra და Luna — მდგრად შესაძლებლობათა დონეებს, რომლებიც შეიძლება საკუთარი ტემპით განვითარდეს. ერთად ეს ოჯახი ადამიანებსა და დეველოპერებს აძლევს უფრო მკაფიო არჩევანს ინტელექტის, სიჩქარისა და ღირებულების მიხედვით.
GPT‑5.6‑ის ფასი 1M ტოკენზე განისაზღვრება სამ მოდელის ზომაში: Sol — 5 $ შეყვანა / 30 $ გამოტანა; Terra — 2,50 $ შეყვანა / 15 $ გამოტანა; Luna — 1 $ შეყვანა / 6 $ გამოტანა. GPT‑5.6 ასევე შემოაქვს მოთხოვნის ქეშირების უფრო პროგნოზირებადი მექანიზმი, მათ შორის აშკარა ქეშის წყვეტის წერტილების მხარდაჭერა და ქეშის სიცოცხლის მინიმუმ 30-წუთიანი ვადა. GPT‑5.6-ისა და შემდგომი მოდელებისთვის ქეშში ჩაწერა დაიბეგრება მოდელის არაქეშირებული შეყვანის ტარიფის 1,25x-ით, ხოლო ქეშიდან წაკითხვა კვლავ იმოქმედებს ქეშირებული შეყვანის 90%-იან ფასდაკლებას.
ასევე, ივლისში Cerebras-ზე ვუშვებთ GPT‑5.6 Sol-ს წამში 750 ტოკენამდე სიჩქარით, რაც მომხმარებლებს უპრეცედენტო სიჩქარით მიაწვდის მოწინავე ინტელექტს. თავდაპირველად, სანამ სიმძლავრეს გავზრდით, წვდომა შეზღუდული იქნება შერჩეული მომხმარებლებისთვის.
მოხარულები ვართ, რომ ამ წინასწარი ტესტირების პერიოდიდან სწავლას გავაგრძელებთ და მალე GPT‑5.6 Sol, Terra და Luna უფრო მეტ ადამიანს მივაწვდით.
1. ლატენტობასა და API-ის ღირებულებას ვაფასებთ ჩვენი მოდელების საწარმოო ქცევაზე დაკვირვებით და ოფლაინ სიმულაციით. ეს შეფასებები ითვალისწინებს ინსტრუმენტის გამოძახების დეტალებს, შერჩეულ ტოკენებს და შეყვანის ტოკენებს. რეალურ პირობებში შედეგები შეიძლება მნიშვნელოვნად განსხვავდებოდეს და დამოკიდებულია მრავალ ფაქტორზე, რომლებიც ჩვენს სიმულაციაში არ არის ასახული. ლატენტობის სიმულაციას ვახდენთ API-ს მაღალი სიჩქარეებით, ხოლო ღირებულებას — ჩვეულებრივი API-ის ფასებით.
2. ყველა მოდელი შეფასებულია ExploitBench API სარტყელის გამოყენებით 5 seed-ით და მსჯელობის უწყვეტობით.
3. ჩვენ ExploitGym გავუშვით ჩვენს ალფა API-ზე, რომელიც პასუხებს უფრო სწრაფად აბრუნებს, ვიდრე ჩვენი საჯარო API, შემდეგ კი შედეგები გადავაფასეთ , რათა ისინი საჯარო API-ს შესაბამის სიჩქარეს მოვარგოთ. საჯარო API-სთვის მოსალოდნელ სიჩქარეებამდე დაყოვნების დროის გადათვლამ გამოიწვია ის, რომ ზოგიერთმა სავარაუდო დაყოვნებამ გადააჭარბა 2h და 6h საათიან დროის ლიმიტებს, მიუხედავად იმისა, რომ შეფასების გაშვებისას ეს ლიმიტები ზუსტად იყო დაცული.დროის მიმართ მგრძნობიარე სამუშაოებისთვის უფრო სწრაფი სიჩქარის მისაღებად, API-ში ვთავაზობთ პრიორიტეტულ დამუშავებას, ხოლო Codex-ში — სწრაფ რეჟიმს.
4. მოდელი, რომლისთვისაც არ არის მითითებული გამოტანის ტოკენები, ლატენტობა ან ღირებულება, გრაფიკზე ნაჩვენებია ჰორიზონტალური წერტილოვანი ხაზებით.


