წარმოგიდგენთ GPT‑6 Sol-სა და Luna-ს
თქვენს ყოველდღიურ საქმიანობაში მოწინავე ინტელექტის გამოყენების მეტი გზა.
ამ თვის დასაწყისში წარმოვადგინეთ GPT‑6 Astra — მსოფლიოში ყველაზე ინტელექტუალური და თანხვედრილი მოდელი. ყველაზე რთული და მნიშვნელოვანი პროექტებისთვის კვლავ Astra-ს სრული შესაძლებლობებია საჭირო, თუმცა სამუშაო განსხვავებული მასშტაბით, ტემპითა და ბიუჯეტით სრულდება.
სწორედ ამიტომ ვაფართოებთ GPT‑6‑ის სამყაროს მოდელებით GPT‑6 Sol და GPT‑6 Luna. GPT‑6 Astra-მ ინტელექტის ახალი თაობა წარმოადგინა, ეს მოდელები კი ხარჯთეფექტიანობის საზღვრების გაფართოებით ამ ინტელექტის სარგებელს უფრო ხელმისაწვდომს ხდის. GPT‑6 Astra-ს მსგავსი მეთოდებით გავწვრთენით GPT‑6 Sol და Luna, ხოლო პროფესიულ საქმიანობაში, ფაქტობრივ სიზუსტეში, პროგრამირებაში, კომპიუტერის გამოყენებასა და თანხვედრილობაში Astra-ს უახლესი მიღწევები უფრო სწრაფ და ხელმისაწვდომ მოდელებში გადავიტანეთ.
GPT‑6-ის მოდელები ხარჯისა და ინტელექტის თანაფარდობის მთელ დიაპაზონში ლიდერობს: თითოეულ დონეზე გამორჩეულ შესაძლებლობებს აერთიანებს ინფრასტრუქტურასთან, რომელიც მათ მასშტაბურად და ეფექტიანად უზრუნველყოფს. კეშირებისა და ინფერენსის გაუმჯობესებამ ამ მოდელების უფრო დაბალ ფასად მიწოდების საშუალება მოგვცა. ამ დანაზოგს პირდაპირ მომხმარებლებსა და კლიენტებს ვუზიარებთ და GPT‑5.6-ის სარეკლამო ფასებთან შედარებით Sol-ისა და Luna-ს API-ის ფასებს 50%-ით ვამცირებთ. ერთობლივად, ეს გაუმჯობესებები მოწინავე AI-ს უფრო მეტი ყოველდღიური ამოცანისა და მასშტაბური გამოყენებისთვის პრაქტიკულს ხდის.
მოდელი | შეტანა | გამოტანა | ფასის შემცირება |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50%-ით იაფი |
GPT‑6 Luna | $0,20 → $0,10 | $1,20 → $0,50 | 50%-ით იაფი |
ფასები მითითებულია 1 მილიონ ტოკენზე.
GPT‑6 Astra კვლავ ჩვენი საუკეთესო უნივერსალური მოდელია. აირჩიეთ, როცა საუკეთესო შედეგები და უკომპრომისო გამოცდილება გსურთ.
GPT‑6 Sol-სა და Luna-ს ინტელექტისა და ხარჯთეფექტიანობის გაუმჯობესებები შემოაქვს თქვენთვის უკვე ნაცნობ მოდელებში, განსაკუთრებით იმ შესაძლებლობებში, რომლებიც რთული სამუშაოს შესასრულებლად ყველაზე სასარგებლოა.
GPT‑6 Sol რთულ სამუშაო ამოცანებს უმკლავდება, ხოლო გამოყენების უფრო მაღალი ლიმიტები და დაბალი ღირებულება გამეორებითი მუშაობის მეტ საშუალებას გაძლევთ. ის მსგავსი ფასის კონკურენტ მოდელებთან შედარებით მეტ ინტელექტსა და უკეთეს შედეგებს გთავაზობთ.
AutomationBench-ზე, რომელიც აპებში ბიზნესპროცესებს ამოწმებს, GPT‑6 Sol (ძალიან მაღალი ძალისხმევით) აღემატება Claude Opus 5-ს (მაქსიმალური ძალისხმევით), თანაც თითო ამოცანაზე Opus 5-ის ღირებულების მხოლოდ 9% ღირს. მაღალი ძალისხმევისას GPT‑6 Luna წინამორბედის შედეგს 5,4 პროცენტული პუნქტით აუმჯობესებს, თითო ამოცანის ღირებულება კი 58%-ით ნაკლებია.
AutomationBench 1.0.6(იხსნება ახალ ფანჯარაში)-ში AI-აგენტები მოწმდება სრულ სამუშაო პროცესებზე 47 ხელსაწყოს გამოყენებით, გაყიდვების, მარკეტინგის, ოპერაციების, მხარდაჭერის, ფინანსებისა და ადამიანური რესურსების სფეროებში. Claude Fable 5.1-ის მონაცემი მის რეალურ ღირებულებას შემცირებულად აჩვენებს, რადგან არ ითვალისწინებს Opus 5-ზე სარეზერვო გადართვის ხარჯს, რაც ამოცანების დაახლოებით 40%-ში მოხდა.
GPT‑6 Sol გაცილებით დაბალ ფასად Claude Fable 5.1-საც აღემატება და დაბალი ძალისხმევით მომუშავე GPT‑6 Astra-საც კი სჯობნის.
მოდელი (და ძალისხმევა) | ქულა | დანახარჯი თითო ამოცანაზე |
|---|---|---|
GPT‑6 Sol (ძალიან მაღალი) | 33,2% | $0,27 |
GPT‑6 Astra (დაბალი) | 30,3% | GPT‑6 Sol-ზე 3,9-ჯერ მეტი |
Claude Opus 5 (მაქსიმალური) | 26,9% | GPT‑6 Sol-ზე 11,1-ჯერ მეტი |
Claude Fable 5.1, Opus 5-ზე სარეზერვო გადართვით (მაქსიმალური) | 31,4% | GPT‑6 Sol-ზე >8,9-ჯერ მეტი (სარეზერვო გადართვის ღირებულება მითითებული არ არის) |
Agents’ Last Exam-ზე, რომელიც აგენტებს რთულ პროფესიულ სამუშაო პროცესებში აფასებს, GPT‑6 Sol მაქსიმალური ძალისხმევით 56,4%-ს აგროვებს, რაც შეფასებაში Claude Opus 5-ის საუკეთესო შედეგზე მაღალია, თითო ამოცანის ღირებულება კი 60%-ით ნაკლებია.
Agents’ Last Exam V1(იხსნება ახალ ფანჯარაში)-ში AI-აგენტები ფასდება ხანგრძლივ, ეკონომიკურად ღირებულ ამოცანებზე 55 ქვედარგში, რომლებიც კომპიუტერზე შესასრულებელი პროფესიული საქმიანობის ძირითად სფეროთა უმეტესობას მოიცავს.
პასუხის სარგებლიანობა ფაქტების სიზუსტეზეა დამოკიდებული, ამიტომ ფაქტობრივი სანდოობის გაუმჯობესებას განვაგრძობთ. ფაქტობრივი სიზუსტის ჩვენს შიდა შეფასებაში, რომელიც ეფუძნება დეიდენტიფიცირებულ რეალურ საუბრებს, სადაც მომხმარებლებმა ჩვენი მოდელების შეცდომები მონიშნეს, GPT‑6 Sol წინამორბედზე დაახლოებით ორჯერ ნაკლებ შეცდომას უშვებს და გაცილებით დაბალ ფასად Astra-ს სანდოობის დონეს უახლოვდება. GPT‑6 Luna-ც მნიშვნელოვნად გაუმჯობესდა: ძალისხმევის მაღალ დონეებზე იგი GPT‑5.6 Sol-ის შედეგს უტოლდება, ხოლო ღირებულებით დაახლოებით მისი მეასედია.
აქ ფაქტობრივ სიზუსტეს ვაფასებთ ChatGPT‑ის დეიდენტიფიცირებულ საუბრებში, რომლებშიც მომხმარებლებმა წინა მოდელის ფაქტობრივი შეცდომა მონიშნეს. შეცდომების გამომწვევი ეს საუბრები არ ასახავს ტიპურ გამოყენებას, სადაც ფაქტობრივი შეცდომები უფრო იშვიათია. ქულები პასუხის სიგრძის მიხედვით არ არის გაკონტროლებული, თუმცა მრავალსიტყვაობის სხვადასხვა დონის ტესტირებამ პასუხის სიგრძეზე თითქმის არავითარი დამოკიდებულება არ აჩვენა.
წელს პროგრამირების აგენტებმა უპრეცედენტოდ რთული, მასშტაბური და ხანგრძლივი ამოცანების შესრულება დაიწყო. OpenAI-ში ჩვენი შიდა გამოყენება ექსპონენციალურად გაიზარდა. API-ის ფასებით შეფასებისას, ტოკენების ყოველდღიურმა გამოყენებამ მედიანური მკვლევრისთვის $600-ს, ხოლო 90-ე პერცენტილის მკვლევრებისთვის $7000-ს გადააჭარბა (კვლევის დაჩქარება: ხედი OpenAI-ის შიგნიდან). რაც უფრო ხანგრძლივ და რთულ ამოცანებს იღებს პროგრამირების აგენტები, მით უფრო მნიშვნელოვანი ხდება უწყვეტი გამოყენების ხარჯი. GPT‑6 Sol და Luna პროგრამირების მაღალ შედეგებს API-ის დაბალ ფასებთან აერთიანებს, რაც დეველოპერებს გამეორებითი მუშაობის მეტ საშუალებას აძლევს, გუნდებს კი — თავდაჯერებას, რომ Codex-ს უფრო ამბიციური ამოცანები მიანდონ.
FrontierCode-ზე, რომელიც აფასებს, ქმნის თუ არა პროგრამირების აგენტები რეალურ კოდის ბაზებში შერწყმისთვის მზა ცვლილებებს, GPT‑6 Sol მნიშვნელოვნად აღემატება GPT‑5.6 Sol-ს და გაცილებით დაბალ ფასად Claude Fable 5.1-ის ძალიან მაღალი ძალისხმევის შედეგს უტოლდება.
FrontierCode 1.1 Main-ში(იხსნება ახალ ფანჯარაში) AI-აგენტების მიერ დაწერილი კოდი ფასდება არა მხოლოდ სისწორით, არამედ „შერწყმადობითაც“, მაგალითად, ტესტების ხარისხით, სამუშაოს ფარგლების დაცვით, კოდის სტილითა და კოდის ბაზის სტანდარტებთან შესაბამისობით.
DeepSWE v1.1-ზე, რომელიც რეალურ კოდის ბაზებში პროგრამული ინჟინერიის რთულ ამოცანებზე მუშაობას ამოწმებს, GPT‑6 Sol მაქსიმალური ძალისხმევით 68,8%-ს აგროვებს — შეფასებაში Claude Fable 5-ის საუკეთესო შედეგს, ძალიან მაღალი ძალისხმევით მიღებულ 69,9%-ს, მხოლოდ 1,1 პროცენტული პუნქტით ჩამორჩება, თითო ამოცანის ღირებულება კი დაახლოებით 80%-ით ნაკლებია.
GPT‑6 Luna მაქსიმალური ძალისხმევით 66,6%-ს აგროვებს, რაც საშუალო ძალისხმევით მომუშავე Claude Opus 5-ისა და Fable 5-ის შედეგების თანაზომადია. ამ შედარებებში თითო ამოცანაზე Luna-ს ღირებულება Opus 5-ზე 93%-ით, ხოლო Fable 5-ზე 96%-ით ნაკლებია.
DeepSWE 1.1(იხსნება ახალ ფანჯარაში)-ში AI-აგენტები პროგრამული ინჟინერიის ორიგინალურ, ხანგრძლივ ამოცანებს წყვეტს.
მიუხედავად იმისა, რომ GPT‑6 Astra კომპიუტერის გამოყენებისთვის მსოფლიოში საუკეთესო მოდელად რჩება, GPT‑6 Sol და Luna წინამორბედებზე უფრო ხარჯთეფექტიან შედეგებს გვთავაზობს. OSWorld 2.0-ის კავშირგარეშე ტესტში GPT‑6 Sol ძალიან მაღალი ძალისხმევით საშუალო ძალისხმევის Claude Opus 5-ის მსგავს შედეგს აღწევს — 60,5% და 60,3% — თითო ამოცანაზე დაახლოებით 80%-ით ნაკლები ხარჯით. GPT‑6 Luna (მაქს. ძალისხმევა) სჯობნის GPT‑5.6 Sol-ს (საშუალო ძალისხმევა) და ათჯერ უფრო იაფია ღირებულების მიხედვით.
OSWorld 2.0(იხსნება ახალ ფანჯარაში)-ში AI-აგენტები ცდილობს ყოველდღიური და პროფესიული ამოცანების მომცველი, კომპიუტერის გამოყენების ხანგრძლივი სამუშაო პროცესების შესრულებას. წარმოგიდგენთ v2026.08.08 გამოშვების კავშირგარეშე ნაკრებზე მიღებულ ნაწილობრივ ქულას.
GPT‑6 Astra-ს გაუმჯობესებული კომუნიკაციის სტილი Sol-სა და Luna-შიც გადავიტანეთ, რაც, ჩვენი აზრით, განსაკუთრებით შესამჩნევი იქნება ტექნიკურ და პროგრამირებასთან დაკავშირებულ საუბრებში. პასუხები უფრო მკაფიო, ნაკლებად ჟარგონული და მთლიანობაში ოდნავ მოკლე იქნება, უცნაური გამოთქმებისა და ნაკლებად ღირებული დეტალების რაოდენობა კი შემცირდება — შინაარსის დაკარგვის გარეშე.
მართალია, სტილი სუბიექტურია, მაგრამ აქ GPT‑6 Sol-ის პასუხს ვამჯობინებთ. ის ნაჩქარევ დასკვნებს ნაკლებად აკეთებს, ნაკლებ დროს უთმობს ისეთი დეტალების გამეორებას, რომლებიც კითხვის ავტორისთვის შეიძლება ისედაც ცხადი იყოს (მაგალითად, რომ ვებსაიტს ოთხი გვერდი აქვს), ნაკლებ ბუნდოვან ენას იყენებს (მაგალითად, „ბენტოს შთაბეჭდილება“, „ამ სისტემის გარშემო გარდაქმნა“), უფრო გულღიად ამბობს, რა შეამოწმა და რა არა, და ზედმეტად არ გვიზიარებს განხორციელების ისეთ დეტალებს, როგორიცაა გამოსახულების ხელსაწყოსთვის მიცემული პრომპტი.
ტოკენების დაბალ ფასებთან ერთად, GPT‑6‑ზე მომუშავე დეველოპერებს ვეხმარებით, კიდევ უფრო დაზოგონ აპლიკაციების მიერ ხელახლა გამოყენებულ კონტექსტზე. GPT‑6‑ის პრომპტის კეშირება გავაუმჯობესეთ, რათა ნაგულისხმევად კეშში მოხვედრის უფრო მაღალი მაჩვენებელი უზრუნველვყოთ. შედეგად, აგენტები მეტ კონტექსტს იყენებს ხელახლა, უფრო სწრაფად აბრუნებს პასუხს და კეშირებული შემავალი ტოკენების წაკითხვაზე 90%-იანი ფასდაკლებით სარგებლობს.
დეველოპერებს კეშირების ეფექტიანობის გაზომვისა და ოპტიმიზაციის მეტი გზაც აქვთ:
მონიტორინგი და დიაგნოსტიკა. პრომპტის კეშირების მართვის პანელი(იხსნება ახალ ფანჯარაში) აჩვენებს, შეყვანილი მონაცემების რა ნაწილი ინახება კეშში და როგორ იცვლება ეს დროთა განმავლობაში. დიაგნოსტიკის ხელსაწყო(იხსნება ახალ ფანჯარაში) გეხმარებათ გაიგოთ, რატომ ვერ მოხერხდა კეშირების შესაძლებლობების გამოყენება და რა არის გამოსასწორებელი.
შეცვალეთ მსჯელობის ძალისხმევა და ხელსაწყოების ხელმისაწვდომობა კეშის დარღვევის გარეშე. რთული ამოცანებისთვის გაზარდეთ მსჯელობის ძალისხმევა(იხსნება ახალ ფანჯარაში), მარტივი დამატებითი კითხვებისთვის კი შეამცირეთ; აგენტის საჭიროებების ცვლილებისას ასევე შეგიძლიათ ხელსაწყოები ჩართოთ ან გამორთოთ(იხსნება ახალ ფანჯარაში). ახლა მართვის ორივე ელემენტი ადრინდელი კონტექსტის შენარჩუნების საშუალებას იძლევა კეშის ხელახლა გამოყენებისთვის.
განსაზღვრეთ, რომელი პრეფიქსები შეინახოს კეშმა. ცხადად მითითებული გამყოფი წერტილები დეველოპერებს საშუალებას აძლევს, აირჩიონ, სად დასრულდეს კეშირებული პრომპტის პრეფიქსები. ეს დეველოპერებს კეშის ხელახლა გამოყენებაზე მეტ კონტროლს აძლევს და ეფექტიანობას აუმჯობესებს.
GitHub-ის ცნობით, ბოლო რამდენიმე თვის განმავლობაში ამ გაუმჯობესებებმა OpenAI-ის მოდელებთან მილიარდობით მოთხოვნაში ახლიდან დასამუშავებელი პრომპტის ტოკენების წილი 50%-ზე მეტით შეამცირა და Copilot-ს პასუხების დაჩქარებაში დაეხმარა.
GPT‑6 Sol და Luna ეფუძნება თანხვედრილობასთან დაკავშირებულ სამუშაოს, რომელიც Astra-სთან — ჩვენს დღემდე ყველაზე მეტად თანხვედრილ მოდელთან — ერთად წარმოვადგინეთ. ჩვენს თანხვედრილობის შეფასებებში Sol და Luna თავიანთ GPT‑5.6 ანალოგებთან შედარებით გაუმჯობესებას აჩვენებს, მათ შორის, ნაკლებად ხშირად აკეთებს შეცდომაში შემყვან განცხადებებს პროგრამირებასთან დაკავშირებული სამუშაოს შესახებ.
ქვემოთ მოცემული შეფასებები განზრახ ამოწმებს რთულ სიტუაციებს და ტიპური გამოყენებისას წარუმატებლობის სიხშირეს არ ზომავს. სრული შედეგები იხილეთ სისტემურ ბარათში(იხსნება ახალ ფანჯარაში).
GPT‑6 Sol და GPT‑6 Luna დღეიდან ხელმისაწვდომია ChatGPT Work-სა და Codex-ში Plus, Pro, ბიზნესზე მორგებული, კორპორაციული და საგანმანათლებლო გეგმების ყველა მომხმარებლისთვის. უფასო და Go გეგმების მომხმარებლებს GPT‑6 Luna-ზე წვდომა სამაგიდო აპიდან შეუძლიათ. ეს მოდელები ჩატში ჯერ არ არის ხელმისაწვდომი. OpenAI API-ში ისინი ხელმისაწვდომია სახელებით gpt-6-sol და gpt-6-luna.
სერვისი ყველასთვის სტაბილური რომ დარჩეს, ვგეგმავთ ამ მოდელების ChatGPT‑ში ეტაპობრივად, დღის განმავლობაში დანერგვას. თუ ახალ მოდელებს ChatGPT Work-ში ან Codex-ში ვერ ხედავთ, მოგვიანებით ხელახლა სცადეთ.
GPT‑ის შეფასებები ჩვენს კვლევით გარემოში ან API-ის მეშვეობით ჩატარდა. სისტემურ პრომპტებში, ხელმისაწვდომ ხელსაწყოებსა და სხვა პარამეტრებში არსებული განსხვავებების გამო, შედეგები შეიძლება საექსპლუატაციო გარემოში გაშვებული ChatGPT‑ის შედეგებისგან ოდნავ განსხვავდებოდეს. კონკურენტი მოდელების შეფასებები საჯაროდ ხელმისაწვდომი ანგარიშებიდან ავიღეთ. როდესაც Claude Fable 5.1-ის ქულები ხელმისაწვდომი არ იყო, Claude Fable 5-ის ქულები გამოვიყენეთ.


