გადადით მთავარ შინაარსზე
OpenAI

GPT-6.1Sol

Astra-სთან მიახლოებული ინტელექტი ხუთჯერ დაბალ ფასად — სტაბილურად მოწინავე შედეგებისთვის

წარმოგიდგენთ GPT‑6.1 Sol-ს — GPT‑6 Sol-ის განახლებულ ვერსიას, გამორჩეულად ძლიერი შედეგებით აგენტურ პროგრამირებაში, კომპიუტერის გამოყენებასა და პროფესიულ საქმიანობაში. რთულ ამოცანებში ის Sol-ს GPT‑6 Astra-ს უახლოებს, შეყვანისა და გამოტანის ტოკენების ფასები კი Astra-ს სტანდარტულ ფასებზე ხუთჯერ დაბალია. ეს დეველოპერებს იმავე ბიუჯეტით ძლიერი აგენტების შექმნისა და გაშვების მეტ შესაძლებლობას აძლევს.

GPT‑6.1 Sol Astra-სთან მიახლოებულ შედეგებს Sol-ის ფასად გთავაზობთ, რაც მას დღეს ხელმისაწვდომ მოდელებს შორის ფასისა და შესაძლებლობების თანაფარდობით ყველაზე ეკონომიურს ხდის. ქეშირებული შეყვანა მილიონ ტოკენზე მხოლოდ $0.10 ღირს — სტანდარტულ ფასზე 95%-ით ნაკლები. ეს ამცირებს იმ აგენტური ამოცანების ხარჯებს, რომლებიც განმეორებით მოთხოვნებში კონტექსტის ხელახლა გამოყენებას საჭიროებს.

GPT‑6 Astra მთლიანობაში კვლავ ჩვენს ყველაზე ძლიერ მოწინავე მოდელად რჩება. GPT‑6.1 Sol შესაძლებლობებისა და ფასის ახალ ბალანსს სთავაზობს როგორც მომხმარებლებს, რომლებსაც მნიშვნელოვანი საქმის უფრო ხშირად შესრულება სურთ, ისე API-ს კლიენტებს, რომლებიც აპლიკაციებს ფართო მასშტაბით ქმნიან და ამუშავებენ.

სამი მოდელის ბარათი: GPT-6 Astra, ჩვენი ყველაზე ინტელექტუალური მოდელი საუკეთესო შედეგებისთვის — შეყვანა $10, გამოტანა $50, ქეშირებული შეყვანა $1; GPT-6.1 Sol, Astra-სთან მიახლოებული ინტელექტი ხუთჯერ დაბალ ფასად — შეყვანა $2, გამოტანა $10, ქეშირებული შეყვანა $0.10; GPT-6 Luna, სწრაფი და ეფექტიანი ყოველდღიური მუშაობა ფართო მასშტაბით — შეყვანა $0.10, გამოტანა $0.50, ქეშირებული შეყვანა $0.01.

უფრო ძლიერი Sol სხვადასხვა ამოცანისთვის

GPT‑6.1 Sol მნიშვნელოვნად უსწრებს GPT‑6 Sol-ს რთულ პროფესიულ საქმიანობაში — კოდის წერიდან და გამართვიდან დოკუმენტების გააზრებასა და მრავალსაფეხურიანი ბიზნესპროცესების შესრულებამდე. რამდენიმე ამ შეფასებაში ის GPT‑6 Astra-ს შედეგებს უახლოვდება მნიშვნელოვნად დაბალი ხარჯით.

პროგრამირება

DeepSWE v1.1-ში, რომელიც რეალურ კოდურ ბაზებში პროგრამული ინჟინერიის რთულ ამოცანებს აფასებს, GPT‑6.1 Sol უტოლდება GPT‑6 Astra-ს დაახლოებით ხუთჯერ დაბალი ხარჯით. ამასთან, მსჯელობის უფრო დაბალი ინტენსივობითა და ნაკლები ხარჯით ის GPT‑6 Sol-ის საუკეთესო შედეგს 6.4 პროცენტული პუნქტით აჭარბებს.

შეფასების ტესტში DeepSWE 1.1⁠⁠(იხსნება ახალ ფანჯარაში) ხელოვნური ინტელექტის აგენტები წყვეტენ პროგრამული ინჟინერიის ორიგინალურ ამოცანებს, რომელთა შესრულებასაც ხანგრძლივი მუშაობა სჭირდება.

პროფესიული საქმიანობა

GDP.pdf ზომავს, რამდენად ზუსტად პასუხობენ მოდელები პროფესიულ კითხვებს რთული PDF დოკუმენტების გამოყენებით, მათ შორის ცხრილებით, გრაფიკებით, დიაგრამებითა და წვრილი შრიფტით მოცემული დეტალებით. ამ ტესტში, მსჯელობის შემოწმებულ პარამეტრებზე, GPT‑6.1 Sol უკეთეს შედეგს აჩვენებს, ვიდრე Opus 5.5 სარეზერვო მოდელებით, ამოცანის ღირებულება კი ორჯერ მეტად დაბალია. ის ასევე უახლოვდება GPT‑6 Astra-ს წამყვან შედეგს, ამოცანის დაახლოებით ხუთჯერ დაბალი ღირებულებით.

შეფასების ტესტში GDP.pdf⁠(იხსნება ახალ ფანჯარაში) მოდელებმა უნდა უპასუხონ რეალურ სამუშაო მოთხოვნებს, რომლებიც ფინანსების, ჯანდაცვის, სამართლისა და კიდევ შვიდი პროფესიული სფეროს სამუშაო პროცესებიდან აღებულ რთულ PDF დოკუმენტებს ეხება.

AutomationBench-ში, რომელიც ზომავს, რამდენად სწორად ასრულებენ აგენტები მრავალსაფეხურიან ბიზნესპროცესებს, მსჯელობის საშუალო ინტენსივობაზე GPT‑6.1 Sol-ის შედეგი Opus 5.5-ისას 2.2 პროცენტული პუნქტით აღემატება, ხარჯი კი დაახლოებით სამჯერ დაბალია. ეს შედეგი ასევე 4.8 პროცენტული პუნქტით აღემატება GPT‑6 Sol-ის შედეგს იმავე პარამეტრზე.

In AutomationBench 1.0.6⁠⁠(იხსნება ახალ ფანჯარაში), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

კომპიუტერის გამოყენება

GPT‑6.1 Sol მნიშვნელოვან პროგრესს აჩვენებს იმ ამოცანებშიც, რომლებიც კომპიუტერულ აპლიკაციებთან ურთიერთქმედებას მოითხოვს. OSWorld 2.0-ის ოფლაინ ნაკრებში, რომელიც აგენტებს კომპიუტერის გამოყენების რთული სამუშაო პროცესებით აფასებს, მსჯელობის მაქსიმალურ ინტენსივობაზე GPT‑6.1 Sol უსწრებს GPT‑6 Sol-ს შვიდი პროცენტული პუნქტით, ხარჯი კი ორჯერ მეტად დაბალია. მსჯელობის მაქსიმალურ ინტენსივობაზე ის Astra-ს შედეგს მხოლოდ 2.1 პროცენტული პუნქტით ჩამორჩება, ამოცანის ღირებულება კი დაახლოებით შვიდჯერ დაბალია.

In OSWorld 2.0⁠⁠(იხსნება ახალ ფანჯარაში), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

სამეცნიერო კვლევა

Terminal-Bench Science 0.1-ში, რომელიც სამეცნიერო სამუშაო პროცესებს აფასებს, მათ შორის მონაცემთა ანალიზს, სიმულაციასა და თეორემების დამტკიცებას, მსჯელობის მაქსიმალურ ინტენსივობაზე GPT‑6.1 Sol ორჯერ მეტად აჭარბებს GPT‑6 Sol-ის ქულას, ამოცანის ღირებულება კი ორჯერ მეტად დაბალია. მსჯელობის მაქსიმალურ ინტენსივობაზე GPT‑6.1 Sol-ის საშუალო ღირებულება ამოცანაზე $5.47-ია, Opus 5.5-ის — $23.21, Astra-სი კი — $23.80. ამგვარად, ის ძლიერ სამეცნიერო შესაძლებლობებს ორივე მოდელზე 75%-ზე მეტად დაბალი ხარჯით გთავაზობთ.

გამოცდილ მოდელებს შორის უმაღლეს შედეგს, 68.1%-ს, კვლავ GPT‑6 Astra აღწევს და ყველაზე რთული სამეცნიერო-კვლევითი ამოცანებისთვის სწორედ მისი გამოყენებაა რეკომენდებული.

შეფასების ტესტში Terminal-Bench Science 0.1⁠(იხსნება ახალ ფანჯარაში) აგენტები კოდისა და ტერმინალის ხელსაწყოების გამოყენებით ასრულებენ სამეცნიერო კვლევის სამუშაო პროცესებს, მათ შორის მონაცემთა ანალიზს, სიმულაციების გაშვებასა და მოდელების მორგებას.

ფაქტობრივი სიზუსტე

GPT‑6.1 Sol ასევე აუმჯობესებს ფაქტობრივ სიზუსტეს რთულ პრომპტებზე. მსჯელობის ძალიან მაღალ ინტენსივობაზე მისი ფაქტობრივი შეცდომების სიხშირე 4.1%-ია, GPT‑6 Sol-ის 4.5%-თან შედარებით, და უფრო ახლოსაა იმავე პარამეტრზე Astra-ს 4.0%-თან. ამასთან, ამოცანის ღირებულება Astra-სთან შედარებით დაახლოებით 83%-ით ნაკლებია.

ეს შეფასება ზომავს სულ მცირე ერთი ფაქტობრივი შეცდომის შემცველი პასუხების წილს დეიდენტიფიცირებულ საუბრებში, რომლებშიც მომხმარებლებმა წინა მოდელის შეცდომა მონიშნეს. ეს განზრახ რთულად შერჩეული პრომპტები არ ასახავს ჩვეულებრივ გამოყენებას.

ფაქტობრივ სიზუსტეს ვაფასებთ ChatGPT‑ის დეიდენტიფიცირებული საუბრებით, რომლებშიც მომხმარებლებმა წინა მოდელის ფაქტობრივი შეცდომა მონიშნეს. ეს შეცდომების გამომწვევი საუბრები არ ასახავს ჩვეულებრივ გამოყენებას, რომლის დროსაც ფაქტობრივი შეცდომები უფრო იშვიათია.

GPT‑6.1 Sol-ის უსაფრთხოდ დანერგვა

მიზნებთან შესაბამისობის ჩვენს შეფასებებში GPT‑6.1 Sol მნიშვნელოვნად უკეთეს შედეგებს აჩვენებს GPT‑6 Sol-თან შედარებით და GPT‑6 Astra-ს უახლოვდება.

GPT‑6.1 Sol უფრო გამჭვირვალედ გვაცნობს საკუთარ შეზღუდვებს და უფრო საიმედოდ იცავს მომხმარებლის განზრახვასა და უსაფრთხოების შეზღუდვებს. რთულ შეფასებებში მას GPT‑6 Sol-ზე ნაკლები ხარვეზი აქვს საძიებო ხელსაწყოების გაუმართაობის გამჟღავნების, მკაფიო შეზღუდვების დაცვისა და აგენტური ამოცანების დროს უნებართვო შედეგების თავიდან აცილების კუთხით. უსაფრთხოების ავტომატური შემმოწმებლის გვერდის ავლის მცდელობები არ დაგვიფიქსირებია, ისევე როგორც GPT‑6 Astra-სა და GPT‑6 Sol-ის შემთხვევაში.

ქვემოთ მოცემული შეფასებები განზრახ ამოწმებს რთულ სიტუაციებს და არ ზომავს ხარვეზების სიხშირეს ჩვეულებრივი გამოყენებისას.

ფასი და ხელმისაწვდომობა

GPT‑6.1 Sol დღეიდან ხელმისაწვდომია Plus, Pro, Business, Enterprise და Edu გეგმების ყველა მომხმარებლისთვის ChatGPT მუშაობასა და Codex-ში. ეს მოდელები ჯერ არ არის ხელმისაწვდომი რეჟიმში ჩატი. დეველოპერებს მასზე წვდომა OpenAI API-დანაც შეუძლიათ, სახელით gpt-6.1-sol. მისი სტანდარტული API ფასებია: $2 მილიონ შეყვანის ტოკენზე, $0.10 მილიონ ქეშირებული შეყვანის ტოკენზე და $10 მილიონ გამოტანის ტოკენზე.

ამასთან ერთად ვუშვებთ GPT‑6 Astra Ultrafast-ს — მსოფლიოში ყველაზე სწრაფ მოწინავე მოდელს, რომელიც GPT‑6 Astra-ზე 8-ჯერ უფრო სწრაფია, ასევე GPT‑6.1 Sol Ultrafast-ს. ისინი ხელმისაწვდომია API-ში, ასევე ChatGPT მუშაობასა და Codex-ში ჩვენი ახალი Pro დონის მომხმარებლებისთვის. ეს დონე გამოყენების ყველაზე მაღალ ლიმიტებს გთავაზობთ თვეში $500-ად. GPT‑6.1 Sol Ultrafast-ით დეველოპერები იღებენ Astra-სთან მიახლოებულ ინტელექტს 8-ჯერ მეტი სიჩქარით, დაახლოებით იმავე API ხარჯით, რაც ადრე GPT‑6 Astra-ს სჭირდებოდა.

ავტორი

OpenAI

Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.