გადადით მთავარ შინაარსზე
OpenAI

6 ოქტომბერი, 2026

პუბლიკაცია

კომპიუტერის გამოყენების შესაძლებლობების განვითარება Ironclad-თან ერთად

როგორ გვეხმარება ხელშეკრულებების სფეროში კვლევითი თანამშრომლობა რთულ პროფესიულ სამუშაოზე ხელოვნური ინტელექტის აგენტების წვრთნასა და შეფასებაში.

იტვირთება…

როდესაც წარვადგინეთ GPT‑6 Astra, ვაჩვენეთ, რამდენად წინ წავიდნენ ჩვენი მოდელები პროფესიული სამუშაოსთვის კომპიუტერის გამოყენებაში — დოკუმენტების მომზადებიდან ვებსაიტების ტესტირებამდე. ჩვენი შემდეგი მიზანია, აგენტებმა სპეციალიზებული პროგრამული უზრუნველყოფა უფრო ეფექტიანად და უკეთ გამოიყენონ რთული ბიზნესამოცანების გადასაჭრელად. ვიკვლევთ, როგორ გავწვრთნათ მოდელები ისე, რომ გაიგონ კომპანიის ბიზნესწესები, შეასრულონ მრავალეტაპიანი სამუშაო პროცესები და შეამოწმონ, შეესაბამება თუ არა მათი ნამუშევარი თავდაპირველ მოთხოვნებს.

ამ კვლევის დასაჩქარებლად უშუალოდ ვთანამშრომლობთ პროგრამული უზრუნველყოფის კომპანიების მცირე ჯგუფთან, რომელიც ამ სამუშაო პროცესებს ყველაზე კარგად იცნობს. ერთად ვარჩევთ რთულ, დიდი პრაქტიკული ღირებულების მქონე დავალებებს და მათ ჩვენი მოდელების წვრთნისა და შეფასებისთვის კვლევით ამოცანებად ვაქცევთ. საბოლოოდ, ეს მოდელებს მეტ შესაძლებლობას აძლევს და ბიზნესში პრაქტიკული გამოყენებისთვის უფრო გამოსადეგს ხდის.

ჩვენი პირველი პარტნიორია Ironclad — ხელოვნური ინტელექტით ხელშეკრულებების მართვის სფეროს ერთ-ერთი ლიდერი. Ironclad-ის გუნდთან მჭიდრო თანამშრომლობით შევიმუშავეთ დავალებები, რომლებიც აგენტებისგან ხელშეკრულებების, დამტკიცების პროცედურებისა და მრავალჯერადი გამოყენების იურიდიული პირობების გამართვას მოითხოვს, და ამ რთულ სამუშაო პროცესებში წინსვლა ვაჩვენეთ. Ironclad-ის გამოცდილებამ გადამწყვეტი როლი შეასრულა წარმატების კრიტერიუმების განსაზღვრასა და მომხმარებელთა რეალური საჭიროებების უშუალოდ მოწინავე მოდელის შემუშავებაში გათვალისწინებაში. მადლობელი ვართ ამ პარტნიორობისთვის და მოხარული ვართ, გაგიზიაროთ ის, რასაც ერთად მივაღწიეთ.

GPT‑6 Astra ჩვენი პირველი მოწინავე მოდელია, რომელიც Ironclad-ის დავალებებზე გავწვრთენით. ჩვენს კვლევით შეფასებაში მისი საშუალო ქულა GPT‑5.6 Sol-ის ქულაზე 32%-ით მაღალი იყო, ხოლო თითოეული მცდელობის სავარაუდო დრო — 48%-ით ნაკლები.1

ხელშეკრულებებთან დაკავშირებული სამუშაო პროცესების საწვრთნელ დავალებებად გარდაქმნა

წარმოიდგინეთ იურიდიული ოპერაციების გუნდი, რომელიც პროგრამული უზრუნველყოფის შესყიდვის პროცესს აწყობს. გარკვეულ თანხაზე მეტი ღირებულების შესყიდვებს შეიძლება ფინანსური გუნდის თანხმობა სჭირდებოდეს, ზოგიერთი მოთხოვნა უსაფრთხოების გუნდმა უნდა განიხილოს, ხოლო არასტანდარტული პირობები — იურიდიულმა გუნდმა. პირმა, რომელიც პროცესს აწყობს, ამ მოკლე ჩამონათვალის საფუძველზე უნდა შექმნას მოთხოვნის ფორმა, დოკუმენტების შაბლონები, დამტკიცების წესები და საბოლოო ხელშეკრულების ჩანაწერი.

ხელოვნური ინტელექტის აგენტს, რომელიც იმავე სამუშაოს ასრულებს, პროგრამაში მუშაობის ყველა ეტაპზე უნდა ახსოვდეს ეს მოთხოვნები. მაგალითად, მან უნდა დააყენოს ფინანსური გუნდის თანხმობის მოთხოვნა იმ ხარჯებისთვის, რომლებიც დადგენილ ზღვარს აჭარბებს, და შეამოწმოს, რომ ამ ზღვარზე მეტი და ნაკლები თანხის მოთხოვნები სათანადო გზას გადის. ცალკეული ნაბიჯების სწორად შესრულება საკმარისი არ არის: საბოლოო პროცესი უნდა მუშაობდეს ყველა იმ სიტუაციაში, რომლისთვისაც შეიქმნა.

Ironclad-ის თანამშრომლები და OpenAI-ში Ironclad-ის მომხმარებლები ჩვენს მკვლევრებს დაეხმარნენ 11 დავალების შერჩევაში იურიდიული, კომერციული და შესყიდვების საქმიანობიდან. მათ შორის იყო კონფიდენციალურობის შეთანხმებების გამართვა, შესყიდვების დამტკიცების პროცესების შექმნა და მრავალჯერადი გამოყენების იურიდიული დებულების განახლება ისე, რომ ის მოთხოვნის ავტორის მიერ არჩეულ იურისდიქციას შეესაბამებოდეს. ჩვენი შეფასებით, გამოცდილ მომხმარებელს თითოეული ასეთი დავალების შესასრულებლად საშუალოდ დაახლოებით 30–40 წუთი დასჭირდებოდა.

თითოეული დავალება მისი სირთულის მიხედვით 8-დან 50-მდე კრიტერიუმით შევაფასეთ. ამან დაგვანახა, რომელი ნაწილები შეასრულა მოდელმა სწორად და სად ვერ მიაღწია სასურველ შედეგს. Ironclad-მა ასევე უზრუნველყო თავისი პროდუქტის სერვერზე განთავსებული პროგრამული გარემოები, სადაც მოდელებს ამ დავალებებზე ვარჯიში შეეძლოთ. ჩვენმა მკვლევრებმა ტიპური სამუშაო პროცესების საფუძველზე სინთეზური საწვრთნელი დავალებები2 შეიმუშავეს და განმამტკიცებელი სწავლება გამოიყენეს, რათა მოდელები პრაქტიკისა და უკუკავშირის მეშვეობით გაუმჯობესებულიყო. საქმის მცოდნე ადამიანებთან ერთად შერჩეული დავალებების, დეტალური კრიტერიუმებისა და სავარჯიშო გარემოს ეს ერთობლიობა უზრუნველყოფს, რომ მოდელები ჩვენი მომხმარებლებისთვის ყველაზე მნიშვნელოვან რეალურ დავალებებში გავაუმჯობესოთ.

რა შედეგები აჩვენა Astra-მ

Astra და GPT‑5.6 Sol შევადარეთ მსჯელობის დონეებით: Astra-სთვის — „მაქსიმალური“, Sol-ისთვის — „მაღალი“. სწორედ ამ პარამეტრებით მიიღო თითოეულმა მოდელმა თავისი უმაღლესი ქულა. 11 კვლევით დავალებაში Astra-ს საშუალო ქულა 55.0% იყო, GPT‑5.6 Sol-ისა კი — 41.6%. ამასთან, თითოეული მცდელობის სავარაუდო საშუალო დრო Sol-ის 37.0 წუთიდან Astra-ს 19.2 წუთამდე შემცირდა.3 Astra-ს შემუშავებისას გამოყენებულმა შიდა მოდელმა ამ დავალებებში კიდევ უკეთესი შედეგი — 63.7% — აჩვენა და ჩვენი მიზანია, ეს დამატებითი გაუმჯობესებაც მომავალ მოდელებში ავსახოთ.

მაჩვენებელი

GPT‑5.6 Sol
მსჯელობის დონე: მაღალი

GPT‑6 Astra
მსჯელობის დონე: მაქსიმალური

შეფასების კრიტერიუმებით მიღებული საშუალო ქულა

41.6%

55.0%

თითოეული მცდელობის სავარაუდო საშუალო დრო

37.0 წუთი

19.2 წუთი

Astra-მ დავალების მეტი მოთხოვნა დააკმაყოფილა და თითოეულ მცდელობაზე სიმულაციით შეფასებული ნაკლები დრო დახარჯა. ქვემოთ მოცემული ორი ვიდეო აჩვენებს, როგორ შეასრულეს მოდელებმა ერთი და იგივე კვლევითი დავალება. Astra-მ (პირველი ვიდეო) დავალების კრიტერიუმების დაახლოებით 94% სავარაუდოდ 20 წუთში დააკმაყოფილა, GPT‑5.6 Sol-მა (მეორე ვიდეო) კი — დაახლოებით 85% სავარაუდოდ 32 წუთში.

მოდელმა GPT‑6 Astra დავალების კრიტერიუმების დაახლოებით 94% სავარაუდოდ 20 წუთში დააკმაყოფილა.

მოდელმა GPT‑5.6 Sol დავალების კრიტერიუმების დაახლოებით 85% სავარაუდოდ 32 წუთში დააკმაყოფილა.

რას ნიშნავს ეს თანამშრომლობა Ironclad-ისთვის

ამ საქმიანობაში Ironclad-ის როლი ასახავს გამოწვევას, რომელსაც მისი მომხმარებლები კარგად იცნობენ: ხელშეკრულებებთან მუშაობის პროცესი გამონაკლისებსაც უნდა ითვალისწინებდეს და იმავდროულად იცავდეს წესებს, რომლებსაც ბიზნესი ეყრდნობა. თუ აგენტს დავალების შესრულებისას რომელიმე ასეთი წესი გამორჩება, პროგრამული უზრუნველყოფის კომპანია ვეღარ შეძლებს, მას სამუშაოს ისეთივე ფართო სპექტრი მიანდოს. სწორედ ამიტომ რჩება ადამიანის ზედამხედველობა მნიშვნელოვანი მაშინაც, როცა აგენტები ხელშეკრულებებთან დაკავშირებულ რთულ დავალებებს უკეთ ასრულებენ, და კვლავ აუცილებელია ხელშეკრულებების მართვის სრულფასოვანი პლატფორმა. ჩვენს მკვლევრებთან თანამშრომლობა Ironclad-ს საშუალებას აძლევს, ეს პრობლემები საბაზისო მოდელის შემუშავების პროცესში შემოიტანოს, სადაც მათ ერთად შევისწავლით.

მოდელების შესაძლებლობების ზრდასთან ერთად Ironclad-ს საშუალება ეძლევა, ისინი საკუთარ პროდუქტებში უფრო ფართოდ გამოიყენოს. იურიდიული და ბიზნესგუნდებისთვის ეს შეიძლება ნიშნავდეს, რომ ხელოვნური ინტელექტი ხელშეკრულებებთან დაკავშირებული რთული სამუშაოს მეტ ნაწილს შეასრულებს და თან შეინარჩუნებს კონტროლის მექანიზმებს, რომლებსაც ეს გუნდები ეყრდნობიან.

“იმისთვის, რომ ხელოვნური ინტელექტი ხელშეკრულებებთან დაკავშირებულ რთულ სამუშაოში მართლაც გამოსადეგი იყოს, მხოლოდ ცალკეული მოქმედებების შესრულება არ კმარა. აგენტებს უნდა ესმოდეთ ხელშეკრულების სრული სასიცოცხლო ციკლი, მათ შორის, როგორ უკავშირდება ერთმანეთს ბიზნესპროცესები ისე, რომ შენარჩუნდეს კონტროლის მექანიზმები, რომლებსაც გუნდები ეყრდნობიან. OpenAI-სთან ჩვენი თანამშრომლობა ამ რეალურ გამოწვევებს კვლევის პროცესში აქცევს და ტექნოლოგიის განვითარებას უწყობს ხელს.”
— სუნიტა ვერმა, Ironclad-ის ტექნოლოგიური დირექტორი

ითანამშრომლეთ ჩვენთან რთული პროფესიული სამუშაოსთვის ხელოვნური ინტელექტის გასავითარებლად

პროგრამული უზრუნველყოფის კომპანიების მცირე ჯგუფს ვიწვევთ ჩვენს კვლევით და საინჟინრო გუნდებთან უშუალო თანამშრომლობისთვის მნიშვნელოვან პროფესიულ დავალებებზე, რომლებსაც დღევანდელი აგენტები ჯერ საიმედოდ ვერ ასრულებენ. თუ თქვენს გუნდსაც აქვს ასეთი დავალება, გვსურს, ვნახოთ კონკრეტული მაგალითი: რას ავალებთ აგენტს, რა ადასტურებს მის წარუმატებლობას და როგორ შეაფასებდით წარმატებულ შედეგს. პარტნიორებს ასევე უნდა შეეძლოთ საქმეში ღრმად ჩახედული სპეციალისტების ჩართვა, ტესტირებისთვის უსაფრთხო გარემოსა და კვლევაში უსაფრთხოდ გამოსაყენებელი მონაცემების უზრუნველყოფა. ეს საწყის საფუძველს მოგვცემს წარუმატებლობის მიზეზების შესასწავლად და იმის გასაზომად, უმჯობესდება თუ არა მოდელი.

ავტორი

OpenAI

სქოლიოები

  1. 1

    ეს შედეგები ეხება 11 კვლევით დავალებას და არა Ironclad-ის ყველა სამუშაო პროცესს. მითითებული დრო სიმულაციითაა შეფასებული, მოდელის დამუშავებისა და გენერირების სავარაუდო სიჩქარის საფუძველზე; ის არ ასახავს მომხმარებლების მიერ რეალურად დაზოგილ დროს.

  2. 2

    სიმულირებული დავალებები შევქმენით SEC-ის EDGAR მონაცემთა ბაზაში საჯაროდ ხელმისაწვდომი ხელშეკრულებების საფუძველზე, მას შემდეგ, რაც მათზე პერსონალური ინფორმაციის წასაშლელად განკუთვნილი ფილტრები გამოვიყენეთ. წვრთნისა თუ შეფასებისთვის არ გამოგვიყენებია OpenAI-ის მომხმარებელთა მონაცემები, OpenAI-ის შიდა ხელშეკრულებები ან Ironclad-ის მომხმარებელთა არასაჯარო მონაცემები თუ ხელშეკრულებები.

  3. 3

    იხილეთ ზემოთ მოცემული სქოლიო კვლევითი შეფასების შესახებ.