გადადით მთავარ შინაარსზე
OpenAI

როგორ აერთიანებს GPT‑5.6 მოწინავე ინტელექტსა და ეფექტიანობას

იტვირთება…

GPT‑5.6 მოდელების ოჯახი ისე შევქმენით, რომ ჩვენი მოდელებით შესრულებული ამოცანების მთელ სპექტრში შესაძლებლობები და ხარჯი დაგვებალანსებინა. ჩვენი ფლაგმანური მოდელი GPT‑5.6 Sol მაქსიმალური მსჯელობით Artificial Analysis Coding Agent Index-ში Claude Fable 5-ს აჯობებს და ამასთან, მისი ხარჯი ნახევარზე ნაკლებია. ინტელექტის საორიენტაციო ტესტებში Terra GPT‑5.5-ის დონეზე მუშაობს ნახევარ ფასად, ხოლო Luna ჩვენი ყველაზე სწრაფი და ხელმისაწვდომი მოდელია — მისი ფასი Sol-ის ხარჯზე 80%-ით ნაკლებია. ამ ეფექტიანობის მისაღწევად ჩვენმა კვლევითმა და ტექნიკურმა გუნდებმა სტეკის ყველა ძირითად დონეზე მნიშვნელოვანი ოპტიმიზაცია განახორციელეს. ეს გაუმჯობესებები მოიცავს ჩვენს მოდელებს, ინფერენსს — როგორ ვუშვებთ მოდელებს გამომავლის შესაქმნელად — და აგენტურ სარტყელს, რომელსაც Codex-იც და ChatGPT მუშაობაც იყენებს.

გასული ოთხი წლის განმავლობაში, როცა ჩვენი მოდელების მასშტაბი 1 მილიარდ აქტიურ მომხმარებლამდე და 2 მილიონზე მეტ ბიზნესამდე გავზარდეთ, ეფექტიანობა გადამწყვეტი იყო ინტელექტის სარგებლის ყველასთვის გასაზიარებლად. ჩვენი მისიაა, ზოგადი ხელოვნური ინტელექტი მთელი კაცობრიობისთვის სასარგებლო იყოს. ამ წლების განმავლობაში მუდმივად ვცდილობდით სტეკის ყველა დონეზე უფრო ფართო ოპტიმიზაციის შესაძლებლობების შექმნას, რათა ხარჯისა და ინტელექტის მრუდის თითოეულ წერტილში უმაღლესი წარმადობის მოდელები შემოგვეთავაზებინა. GPT‑5.6‑ით მივაღწიეთ ინტელექტის ყველაზე მაღალ ეფექტიანობას თითოეულ ტოკენზე — მოდელი გაწვრთნილია, რომ თითოეული ტოკენით მეტი სამუშაო შეასრულოს. წვრთნისას ვაუმჯობესებთ როგორც ამოცანის წარმატებით შესრულებას, ისე ეფექტიანობას და მოდელს ამოცანის გადასაჭრელად უფრო პირდაპირი გზის არჩევას ვასწავლით.

ამ პოსტში მოდელების მიღმაც გავიხედავთ და გაჩვენებთ, როგორ გავზარდეთ ეფექტიანობა სტეკის კიდევ ორ ძირითად ნაწილში: 1) ინფერენსში — დატვირთვის დაბალანსების, სპეკულაციური დეკოდირების, ქეშირებისა და ბირთვების ოპტიმიზაციით, რათა იმავე აპარატურით მეტი შედეგი მივიღოთ; და 2) ჩვენს აგენტურ სარტყელში — კონტექსტის ზედმეტი ზრდის, ხელსაწყოების გამოყენებისა და განმეორებითი სამუშაოს უკეთ მართვით. ასევე მოგიყვებით, რა როლი შეასრულა GPT‑5.6 Sol-მა ამ შედეგებიდან რამდენიმეს ავტონომიურად მიღწევაში. ცალკე აღებული ნებისმიერი გაუმჯობესება შეიძლება მცირე ჩანდეს, მაგრამ ეს მიღწევები ერთმანეთს ემატება და საშუალებას გვაძლევს, ინტელექტისა და ეფექტიანობის მოწინავე ზღვარს ორივე მიმართულებით მივაღწიოთ.

დიაგრამა აჩვენებს GPT-5.6-ის ეფექტიანობას აგენტის სარტყელში, API-ის ორკესტრაციასა და მოდელის ინფერენსში, რის შედეგადაც ქსელში ნაკლები მონაცემი იგზავნება, CPU ნაკლებ სამუშაოს ასრულებს, ხოლო GPU მეტ შედეგს ქმნის.

ინფერენსის აჩქარება GPT‑5.6 Sol-ით

გამოთვლითი რესურსებით შეზღუდულ სამყაროში, სადაც მოდელებზე მოთხოვნა შესაძლებლობებზე სწრაფად იზრდება, ეფექტიანობა ნებისმიერი სისტემის დიზაინის საფუძველია. ეს განსაკუთრებით ეხება ჩვენს ინფერენსის სტეკს, რომელიც პასუხების შესაქმნელად გაწვრთნილ მოდელებს უშვებს. ჩვენი მთავარი მიზანია, იმავე აპარატურით მეტ ტოკენს მოვემსახუროთ და ამავდროულად შევინარჩუნოთ ინტელექტი, დაყოვნება, ხელმისაწვდომობა და საიმედოობა, რასაც მომხმარებლები მოელიან.

ამის მისაღწევად მთელი სისტემის ოპტიმიზაციაა საჭირო. ცალკე აღებული მოდელი შეიძლება მეტად ეფექტიანი იყოს, მაგრამ მისი მომსახურება მაინც ძვირი დაჯდეს, თუ მოთხოვნები ცუდად ნაწილდება, აპარატურა უმოქმედოდაა ან მონაცემთა გადაადგილება გამოთვლებს ანელებს. თითოეულ დონეზე მიღწეული გაუმჯობესებები ერთმანეთს ემატება: სარგებელი მოდის მარშრუტიზაციის (სად იგზავნება მოთხოვნები), დაგეგმვის (როდის იგზავნება მოთხოვნები), ბირთვების (GPU-ებზე გაშვებული პროგრამები), ქეშირების (შენახული და ხელახლა გამოყენებული სამუშაო) და მოდელის იმპლემენტაციის (GPU კოდის შესრულების თანმიმდევრობა) ოპტიმიზაციიდან. Codex-ში GPT‑5.6 Sol-მა ყველა ამ ოპტიმიზაციაში გადამწყვეტი როლი შეასრულა.

პირველი მნიშვნელოვანი მაგალითი დატვირთვის დაბალანსებაა. გლობალურად მოთხოვნებს ვამისამართებთ ისეთი ფაქტორების მიხედვით, როგორიცაა გეოგრაფიული მდებარეობა, ხელმისაწვდომი სიმძლავრე და ამაჩქარებლის ტიპი — GPU-ის ან სპეციალიზებული ჩიპის ტიპი, რომელზეც მოდელი მუშაობს. კლასტერში სამუშაოს მოდელის ინსტანციებს შორის ვანაწილებთ დატვირთვის, კონტექსტის სიგრძის, ქეშის ხელმისაწვდომობისა და მოთხოვნის სხვა მახასიათებლების მიხედვით. შემდეგ თითოეულ ინსტანციაში სამუშაო ეფექტიანად უნდა განაწილდეს ამაჩქარებლებს, მოდელის ქვექსელებსა და გამოთვლით ბირთვებს შორის. Codex-ში GPT‑5.6 Sol გვეხმარება საწარმოო ტრაფიკის ანალიზში, დისბალანსის აქამდე შეუმჩნეველი წყაროების აღმოჩენაში, მარშრუტიზაციის ახალი სტრატეგიების გამოცდასა და ამ ევრისტიკების მუდმივ დახვეწაში. მხოლოდ დატვირთვის დაბალანსების ამ გაუმჯობესებებმა ჩვენი მოდელების მომსახურების ხარჯი მკვეთრად შეამცირა.

GPT‑5.6 Sol მოდელის წინსვლითი გავლის ოპტიმიზაციისთვისაც გამოვიყენეთ — ეს არის გამოთვლა, რომელიც შეყვანილ მონაცემებს შემდეგი ტოკენის პროგნოზად გარდაქმნის. მაშინაც კი, როცა ცალკეული ოპერაციები სწრაფია, მეხსიერებაში მონაცემების ჭარბმა გადაადგილებამ, სინქრონიზაციამ და მონაცემთა არაეფექტიანმა განლაგებამ შეიძლება GPU-ები უმოქმედოდ დატოვოს. ამის თავიდან ასაცილებლად GPT‑5.6 Sol-მა გამოავლინა სამუშაო, რომლის წინასწარ გამოთვლა, გამოტოვება ან პარალელურად შესრულება შეიძლებოდა. Codex-ის გამოყენებით GPT‑5.6 Sol-მა ავტონომიურად გადაწერა და ოპტიმიზაცია გაუკეთა ჩვენს საწარმოო ბირთვებს — ძირითად კოდს, რომელიც მოდელის შემადგენელ მათემატიკურ ოპერაციებს ასრულებს. ეს ნაწილობრივ იმიტომ გახდა შესაძლებელი, რომ GPT‑5.6 გავწვრთენით OpenAI-ის მიერ მხარდაჭერილ ორ ღია კოდის მქონე GPU-პროგრამირების ენაში — Triton(იხსნება ახალ ფანჯარაში)-სა და Gluon(იხსნება ახალ ფანჯარაში)-ში — ბირთვების ეფექტიანად დასაწერად და გასაუმჯობესებლად. ამ ძალისხმევამ, GPT‑5.6 Sol-ის მიერ ბირთვების უფრო ფართო გაუმჯობესებებთან ერთად, მომსახურების სრული ხარჯები 20%-ით შეამცირა. ასევე დიდი ინვესტიცია ჩავდეთ შემოწმების ხელსაწყოებში, მათ შორის ღია კოდის ხელსაწყო FpSan(იხსნება ახალ ფანჯარაში)-ში (მცოცავმძიმიანი რიცხვების სანიტაიზერი), რათა GPT‑5.6 Sol-ის მიერ დაწერილი ბირთვების სისწორე გადავამოწმოთ.

სპეკულაციური დეკოდირება სიჩქარისა და ეფექტიანობის გაუმჯობესების კიდევ ერთი საშუალებაა. ეს მეთოდი ძირითადი მოდელის პარალელურად უფრო მცირე საპროექტო („სპეკულატორი“) მოდელის გაშვებას გულისხმობს, რომელიც რამდენიმე ტოკენს სთავაზობს ძირითად მოდელს პარალელურად შესამოწმებლად. როცა ეს შეთავაზებები მიიღება, სისტემას ძირითადი მოდელის ერთი გავლის შედეგად რამდენიმე გამომავალი ტოკენის შექმნა შეუძლია, რაც ძვირადღირებული თანმიმდევრული გამოთვლების მოცულობას ამცირებს. GPT‑5.6 Sol-მა საკუთარი საპროექტო მოდელი გააუმჯობესა: მის არქიტექტურაზე ასობით ექსპერიმენტი დაგეგმა და ჩაატარა, ზომის, სტრუქტურისა და ფუნქციების ცვლილებები კი გამოცადა. გარდა ამისა, GPT‑5.6 Sol-მა სპეკულატორის წვრთნის პროცესი გაუშვა და აკონტროლა, ხოლო პრობლემების წარმოქმნისას, მათ შორის აპარატურის მწყობრიდან გამოსვლისა და წვრთნის არასტაბილურობის დროს, ავტონომიურად ჩაერია. შედეგად მიღებულმა გაუმჯობესებებმა ტოკენების გენერირების ეფექტიანობა 15%-ზე მეტით გაზარდა.

ქეშში არმყოფი შეყვანის ტოკენების დამუშავებისას მოდელი გასაღები-მნიშვნელობის (KV) ქეშს ერთი რესურსტევადი გავლით ქმნის; შედეგის გენერირებისას კი ამ ქეშიდან მონაცემებს განმეორებით კითხულობს და მას აფართოებს. მომსახურების ოპტიმალური კონფიგურაცია — მაგალითად, პაკეტებად გაერთიანება, დაყოფა და KV-ის მართვა — მნიშვნელოვნადაა დამოკიდებული დატვირთვაზე: მოთხოვნისა და შედეგის სიგრძეზე, პაკეტის ზომაზე, ქეშის დამთხვევის მაჩვენებელზე, მოთხოვნის მახასიათებლებსა და სხვა ფაქტორებზე. თუმცა ადრე კონფიგურაციების სივრცე სისტემური გამართვისთვის ზედმეტად დიდი იყო, რის გამოც ინჟინრებს ზოგად ევრისტიკებზე დაყრდნობა უწევდათ. Codex-ში GPT‑5.6 Sol-ის მეშვეობით შევძელით საწარმოო დატვირთვების გაანალიზება, შესაძლო კონფიგურაციების შექმნა და შეფასება, ასევე თითოეული სცენარისთვის ძრავისა და მოდელის კონფიგურაციის ზედმიწევნით ოპტიმიზაცია. ეს პრაქტიკულს ხდის დატვირთვაზე მორგებული ოპტიმიზაციის ახალ დონეს და იმავე აპარატურით მეტი სასარგებლო ინფერენსის მიღების საშუალებას იძლევა.

ინფერენსის ოპტიმიზაცია უწყვეტი უკუკავშირის ციკლია. ვზომავთ საწარმოო გარემოში სისტემის ქცევას, ვავლენთ ყველაზე დიდ ხარვეზებს, შეგვაქვს ცვლილებები და ვამოწმებთ, რომ ისინი აუმჯობესებს მთელ სისტემას და არა მხოლოდ ცალკეულ საორიენტაციო ტესტს. GPT‑5.6 Sol და Codex ამ ციკლის ყველა ნაწილს აჩქარებენ. შედეგად, ჩვენს გუნდს შეუძლია მეტი იდეა გამოიკვლიოს, დატვირთვის ცვლილებებს უფრო სწრაფად უპასუხოს და შექმნას ინფერენსის სტეკი, რომელიც მომხმარებლებს ნაკლებ დაყოვნებას, მეტ სიმძლავრესა და დაბალ ხარჯებს სთავაზობს.

როგორ ამარტივებს ჩვენი აგენტური სარტყელი განმეორებით სამუშაოს

ChatGPT მუშაობა და Codex რთულ ამოცანებს მოდელის მოთხოვნებისა და ხელსაწყოების გამოძახებების თანმიმდევრობით ასრულებენ. ერთი სვლის განმავლობაში — მომხმარებლის მოთხოვნიდან საბოლოო პასუხამდე — Codex-მა შეიძლება შეამოწმოს საწყისი კოდი, მოძებნოს განთავსების ისტორია, წაიკითხოს ინციდენტების ანგარიშები, ჩაასწოროს ფაილი და გაუშვას ტესტები. თითოეულ ნაბიჯს შეიძლება ცალკე მოთხოვნა დასჭირდეს.

კონტექსტის მომზადებას, მონაცემების გადაცემას, ინფერენსის გაშვებას, ხელსაწყოების გამოძახებასა და პროცესების დაწყებას დრო და გამოთვლითი რესურსი სჭირდება. თუ ამოცანას მოდელის 30 მოთხოვნა სჭირდება, თითოეულზე დამატებული ერთი წამი საბოლოოდ დიდ დროს შეადგენს. საერთო წარმადობის გაუმჯობესება მთელ სისტემაში განმეორებითი სამუშაოს შემცირებას ნიშნავს და არა მხოლოდ მოდელის აჩქარებას.

მომხმარებლის ამოცანა გადაეცემა მოდელს, რომელსაც შეუძლია ხელსაწყო გამოიძახოს, შედეგი მიიღოს და ამოცანის დასრულებამდე განმეორებით მიიღოს მომდევნო გადაწყვეტილება.

მომხმარებლის ერთი სვლა შეიძლება მოდელისა და ხელსაწყოს მრავალ იტერაციას მოიცავდეს. განმეორებად მონაკვეთში გაწეული ნებისმიერი ხარჯი შესაძლოა მრავალჯერ იქნეს გადახდილი.

ეს მულტიპლიკაციური ეფექტები გავითვალისწინეთ ჩვენი აგენტური სარტყლის შექმნისას — ეს არის Rust-ზე აგებული საორკესტრაციო ფენა, რომელიც ჩვენს მოდელებს, ხელსაწყოებსა და მომხმარებლის გარემოს აკავშირებს. შემდეგ განვიხილავთ, როგორ ზრდის თითოეული მოთხოვნის ეფექტიანობას კონტექსტის ზედმეტი ზრდის თავიდან აცილება, ხელსაწყოების ჩატვირთვა და სამუშაოს ხელახლა გამოყენება.

თავიდან აიცილეთ კონტექსტის ზედმეტი ზრდა

აგენტებისთვის მეტი ხელსაწყოს, უნარის, დანამატისა და საუბრის ისტორიის ხელმისაწვდომობის ზრდასთან ერთად კონტექსტური ფანჯრები ადვილად ფართოვდება. ეს ზრდის ხარჯს, მოდელს ყურადღებას უფანტავს და არასაჭირო მსჯელობას იწვევს. სარტყელს შეუძლია ამ ზედნადები ხარჯის შემცირება გადავადებული აღმოჩენის მეშვეობით, რის შედეგადაც ინტეგრაციები, მორგებული MCP ხელსაწყოები, უნარები და დანამატები მხოლოდ საჭიროებისას ხდება ხელმისაწვდომი. სარტყელი ასევე ხელს უშლის ცალკეულ ხელსაწყოებსა და MCP ინტეგრაციებს, რომ კონტექსტური ფანჯარა მოულოდნელად შეავსონ. თუ მოდელი სხვა ზღვარს არ მოითხოვს, ხელსაწყოს შედეგი ნაგულისხმევად 10 000 ტოკენით იზღუდება.

მოთხოვნის ქეშირებისთვის ზუსტი პრეფიქსების შენარჩუნება

როგორც უკვე აღვნიშნეთ, აგენტის ციკლმა ერთი სვლის განმავლობაში შეიძლება GPU-ებს რამდენჯერმე გაუგზავნოს ერთი და იგივე ინსტრუქციები, საუბრის ისტორია, ხელსაწყოების აღწერილობები და წინა შედეგები. ამ განმეორებითი შეყვანის დამუშავება ძვირია, ამიტომ მოთხოვნის ქეშირება ხელახლა იყენებს ადრე დამუშავებულ მოთხოვნის პრეფიქსთან დაკავშირებულ გამოთვლებს. ამ პრეფიქსის შესანარჩუნებლად სარტყელი მოდელისთვის ხილულ მთელ ისტორიას მხოლოდ დამატებად მონაცემად განიხილავს: ახალი შეტყობინებები, ხელსაწყოების შედეგები და გარემოს განახლებები ბოლოში ემატება და არა ადრინდელ კონტექსტში ჩაისმება. ხელსაწყოებიც განსაზღვრული თანმიმდევრობით არის წარმოდგენილი, ხოლო შესრულების გარემოს პარამეტრები, მაგალითად დამტკიცების წესები, ხელსაწყოების აღწერილობებში ჩაშენების ნაცვლად უშუალოდ შესრულებისას გამოიყენება. ეს არქიტექტურული არჩევანი ხელს უწყობს Codex-სა და ChatGPT მუშაობაში მოთხოვნის ქეშის დამთხვევის საერთო მაღალი მაჩვენებლების მიღწევას.

სამი მოთხოვნა ადარებს მუდმივი კავშირით გაგზავნილი ბაიტების რაოდენობას მოდელისთვის ხილულ მზარდ კონტექსტსა და ქეშიდან ხელახლა გამოყენებისთვის ვარგის პრეფიქსს.

ინკრემენტული გადაცემა ცვლის იმას, რაც ქსელში იგზავნება; მოთხოვნის ქეშირება კი იმას, რისი ხელახლა გამოთვლაც მოდელს შეუძლია აირიდოს. სიგანეები კონცეპტუალურია, ხოლო შეკუმშვის დამატებითი ფენა ნაჩვენები არ არის.

ეფექტიანობა ინტელექტის მთელ მრუდზე

GPT‑5.6‑ით მიღწეული ეფექტიანობის ზრდა წლების განმავლობაში ტექნოლოგიური სტეკის ყველა დონეზე დაგროვილი გაუმჯობესებების შედეგია — კვლევიდან და ინფერენსიდან ჩვენს აგენტურ სარტყლამდე. ამ გაუმჯობესებებიდან ბევრის მიღწევაში GPT‑5.6‑ის როლი გვაძლევს ოპტიმიზაციის ტემპის დაჩქარების იმედს. ჩვენ გავაგრძელებთ უფრო მასშტაბურ ოპტიმიზაციას ისეთ სფეროებში, როგორიცაა ბირთვების ოპტიმიზაცია, და ამავდროულად საფუძვლიანად გავაუმჯობესებთ ჩვენს სტეკს. მოხარული ვიქნებით, თუ ამ უწყვეტ შიდა გაუმჯობესებებს მომხმარებლებსა და კლიენტებს უფრო ფართოდ ხელმისაწვდომი, ხარჯეფექტიანი ინტელექტის სახით გადავცემთ.

განსაკუთრებული მადლობა ტექნიკური გუნდის წევრებს — Matthew Ferrari-ს, Philippe Tillet-ს, Ahmed Ibrahim-ს, Joe Gershenson-სა და Steve Coffey-ს — ამ პოსტში შეტანილი წვლილისთვის.

ავტორი

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson და Steve Coffey