კომპიუტერის გამოყენების შესაძლებლობების განვითარება Ironclad-თან ერთად
როგორ გვეხმარება ხელშეკრულებების სფეროში კვლევითი თანამშრომლობა რთულ პროფესიულ სამუშაოზე ხელოვნური ინტელექტის აგენტების წვრთნასა და შეფასებაში.
როდესაც წარვადგინეთ GPT‑6 Astra, ვაჩვენეთ, რამდენად წინ წავიდნენ ჩვენი მოდელები პროფესიული სამუშაოსთვის კომპიუტერის გამოყენებაში — დოკუმენტების მომზადებიდან ვებსაიტების ტესტირებამდე. ჩვენი შემდეგი მიზანია, აგენტებმა სპეციალიზებული პროგრამული უზრუნველყოფა უფრო ეფექტიანად და უკეთ გამოიყენონ რთული ბიზნესამოცანების გადასაჭრელად. ვიკვლევთ, როგორ გავწვრთნათ მოდელები ისე, რომ გაიგონ კომპანიის ბიზნესწესები, შეასრულონ მრავალეტაპიანი სამუშაო პროცესები და შეამოწმონ, შეესაბამება თუ არა მათი ნამუშევარი თავდაპირველ მოთხოვნებს.
ამ კვლევის დასაჩქარებლად უშუალოდ ვთანამშრომლობთ პროგრამული უზრუნველყოფის კომპანიების მცირე ჯგუფთან, რომელიც ამ სამუშაო პროცესებს ყველაზე კარგად იცნობს. ერთად ვარჩევთ რთულ, დიდი პრაქტიკული ღირებულების მქონე დავალებებს და მათ ჩვენი მოდელების წვრთნისა და შეფასებისთვის კვლევით ამოცანებად ვაქცევთ. საბოლოოდ, ეს მოდელებს მეტ შესაძლებლობას აძლევს და ბიზნესში პრაქტიკული გამოყენებისთვის უფრო გამოსადეგს ხდის.
ჩვენი პირველი პარტნიორია Ironclad — ხელოვნური ინტელექტით ხელშეკრულებების მართვის სფეროს ერთ-ერთი ლიდერი. Ironclad-ის გუნდთან მჭიდრო თანამშრომლობით შევიმუშავეთ დავალებები, რომლებიც აგენტებისგან ხელშეკრულებების, დამტკიცების პროცედურებისა და მრავალჯერადი გამოყენების იურიდიული პირობების გამართვას მოითხოვს, და ამ რთულ სამუშაო პროცესებში წინსვლა ვაჩვენეთ. Ironclad-ის გამოცდილებამ გადამწყვეტი როლი შეასრულა წარმატების კრიტერიუმების განსაზღვრასა და მომხმარებელთა რეალური საჭიროებების უშუალოდ მოწინავე მოდელის შემუშავებაში გათვალისწინებაში. მადლობელი ვართ ამ პარტნიორობისთვის და მოხარული ვართ, გაგიზიაროთ ის, რასაც ერთად მივაღწიეთ.
GPT‑6 Astra ჩვენი პირველი მოწინავე მოდელია, რომელიც Ironclad-ის დავალებებზე გავწვრთენით. ჩვენს კვლევით შეფასებაში მისი საშუალო ქულა GPT‑5.6 Sol-ის ქულაზე 32%-ით მაღალი იყო, ხოლო თითოეული მცდელობის სავარაუდო დრო — 48%-ით ნაკლები.1
წარმოიდგინეთ იურიდიული ოპერაციების გუნდი, რომელიც პროგრამული უზრუნველყოფის შესყიდვის პროცესს აწყობს. გარკვეულ თანხაზე მეტი ღირებულების შესყიდვებს შეიძლება ფინანსური გუნდის თანხმობა სჭირდებოდეს, ზოგიერთი მოთხოვნა უსაფრთხოების გუნდმა უნდა განიხილოს, ხოლო არასტანდარტული პირობები — იურიდიულმა გუნდმა. პირმა, რომელიც პროცესს აწყობს, ამ მოკლე ჩამონათვალის საფუძველზე უნდა შექმნას მოთხოვნის ფორმა, დოკუმენტების შაბლონები, დამტკიცების წესები და საბოლოო ხელშეკრულების ჩანაწერი.
ხელოვნური ინტელექტის აგენტს, რომელიც იმავე სამუშაოს ასრულებს, პროგრამაში მუშაობის ყველა ეტაპზე უნდა ახსოვდეს ეს მოთხოვნები. მაგალითად, მან უნდა დააყენოს ფინანსური გუნდის თანხმობის მოთხოვნა იმ ხარჯებისთვის, რომლებიც დადგენილ ზღვარს აჭარბებს, და შეამოწმოს, რომ ამ ზღვარზე მეტი და ნაკლები თანხის მოთხოვნები სათანადო გზას გადის. ცალკეული ნაბიჯების სწორად შესრულება საკმარისი არ არის: საბოლოო პროცესი უნდა მუშაობდეს ყველა იმ სიტუაციაში, რომლისთვისაც შეიქმნა.
Ironclad-ის თანამშრომლები და OpenAI-ში Ironclad-ის მომხმარებლები ჩვენს მკვლევრებს დაეხმარნენ 11 დავალების შერჩევაში იურიდიული, კომერციული და შესყიდვების საქმიანობიდან. მათ შორის იყო კონფიდენციალურობის შეთანხმებების გამართვა, შესყიდვების დამტკიცების პროცესების შექმნა და მრავალჯერადი გამოყენების იურიდიული დებულების განახლება ისე, რომ ის მოთხოვნის ავტორის მიერ არჩეულ იურისდიქციას შეესაბამებოდეს. ჩვენი შეფასებით, გამოცდილ მომხმარებელს თითოეული ასეთი დავალების შესასრულებლად საშუალოდ დაახლოებით 30–40 წუთი დასჭირდებოდა.
თითოეული დავალება მისი სირთულის მიხედვით 8-დან 50-მდე კრიტერიუმით შევაფასეთ. ამან დაგვანახა, რომელი ნაწილები შეასრულა მოდელმა სწორად და სად ვერ მიაღწია სასურველ შედეგს. Ironclad-მა ასევე უზრუნველყო თავისი პროდუქტის სერვერზე განთავსებული პროგრამული გარემოები, სადაც მოდელებს ამ დავალებებზე ვარჯიში შეეძლოთ. ჩვენმა მკვლევრებმა ტიპური სამუშაო პროცესების საფუძველზე სინთეზური საწვრთნელი დავალებები2 შეიმუშავეს და განმამტკიცებელი სწავლება გამოიყენეს, რათა მოდელები პრაქტიკისა და უკუკავშირის მეშვეობით გაუმჯობესებულიყო. საქმის მცოდნე ადამიანებთან ერთად შერჩეული დავალებების, დეტალური კრიტერიუმებისა და სავარჯიშო გარემოს ეს ერთობლიობა უზრუნველყოფს, რომ მოდელები ჩვენი მომხმარებლებისთვის ყველაზე მნიშვნელოვან რეალურ დავალებებში გავაუმჯობესოთ.
Astra და GPT‑5.6 Sol შევადარეთ მსჯელობის დონეებით: Astra-სთვის — „მაქსიმალური“, Sol-ისთვის — „მაღალი“. სწორედ ამ პარამეტრებით მიიღო თითოეულმა მოდელმა თავისი უმაღლესი ქულა. 11 კვლევით დავალებაში Astra-ს საშუალო ქულა 55.0% იყო, GPT‑5.6 Sol-ისა კი — 41.6%. ამასთან, თითოეული მცდელობის სავარაუდო საშუალო დრო Sol-ის 37.0 წუთიდან Astra-ს 19.2 წუთამდე შემცირდა.3 Astra-ს შემუშავებისას გამოყენებულმა შიდა მოდელმა ამ დავალებებში კიდევ უკეთესი შედეგი — 63.7% — აჩვენა და ჩვენი მიზანია, ეს დამატებითი გაუმჯობესებაც მომავალ მოდელებში ავსახოთ.
მაჩვენებელი | GPT‑5.6 Sol | GPT‑6 Astra |
შეფასების კრიტერიუმებით მიღებული საშუალო ქულა | 41.6% | 55.0% |
თითოეული მცდელობის სავარაუდო საშუალო დრო | 37.0 წუთი | 19.2 წუთი |
Astra-მ დავალების მეტი მოთხოვნა დააკმაყოფილა და თითოეულ მცდელობაზე სიმულაციით შეფასებული ნაკლები დრო დახარჯა. ქვემოთ მოცემული ორი ვიდეო აჩვენებს, როგორ შეასრულეს მოდელებმა ერთი და იგივე კვლევითი დავალება. Astra-მ (პირველი ვიდეო) დავალების კრიტერიუმების დაახლოებით 94% სავარაუდოდ 20 წუთში დააკმაყოფილა, GPT‑5.6 Sol-მა (მეორე ვიდეო) კი — დაახლოებით 85% სავარაუდოდ 32 წუთში.
მოდელმა GPT‑6 Astra დავალების კრიტერიუმების დაახლოებით 94% სავარაუდოდ 20 წუთში დააკმაყოფილა.
მოდელმა GPT‑5.6 Sol დავალების კრიტერიუმების დაახლოებით 85% სავარაუდოდ 32 წუთში დააკმაყოფილა.
ამ საქმიანობაში Ironclad-ის როლი ასახავს გამოწვევას, რომელსაც მისი მომხმარებლები კარგად იცნობენ: ხელშეკრულებებთან მუშაობის პროცესი გამონაკლისებსაც უნდა ითვალისწინებდეს და იმავდროულად იცავდეს წესებს, რომლებსაც ბიზნესი ეყრდნობა. თუ აგენტს დავალების შესრულებისას რომელიმე ასეთი წესი გამორჩება, პროგრამული უზრუნველყოფის კომპანია ვეღარ შეძლებს, მას სამუშაოს ისეთივე ფართო სპექტრი მიანდოს. სწორედ ამიტომ რჩება ადამიანის ზედამხედველობა მნიშვნელოვანი მაშინაც, როცა აგენტები ხელშეკრულებებთან დაკავშირებულ რთულ დავალებებს უკეთ ასრულებენ, და კვლავ აუცილებელია ხელშეკრულებების მართვის სრულფასოვანი პლატფორმა. ჩვენს მკვლევრებთან თანამშრომლობა Ironclad-ს საშუალებას აძლევს, ეს პრობლემები საბაზისო მოდელის შემუშავების პროცესში შემოიტანოს, სადაც მათ ერთად შევისწავლით.
მოდელების შესაძლებლობების ზრდასთან ერთად Ironclad-ს საშუალება ეძლევა, ისინი საკუთარ პროდუქტებში უფრო ფართოდ გამოიყენოს. იურიდიული და ბიზნესგუნდებისთვის ეს შეიძლება ნიშნავდეს, რომ ხელოვნური ინტელექტი ხელშეკრულებებთან დაკავშირებული რთული სამუშაოს მეტ ნაწილს შეასრულებს და თან შეინარჩუნებს კონტროლის მექანიზმებს, რომლებსაც ეს გუნდები ეყრდნობიან.
პროგრამული უზრუნველყოფის კომპანიების მცირე ჯგუფს ვიწვევთ ჩვენს კვლევით და საინჟინრო გუნდებთან უშუალო თანამშრომლობისთვის მნიშვნელოვან პროფესიულ დავალებებზე, რომლებსაც დღევანდელი აგენტები ჯერ საიმედოდ ვერ ასრულებენ. თუ თქვენს გუნდსაც აქვს ასეთი დავალება, გვსურს, ვნახოთ კონკრეტული მაგალითი: რას ავალებთ აგენტს, რა ადასტურებს მის წარუმატებლობას და როგორ შეაფასებდით წარმატებულ შედეგს. პარტნიორებს ასევე უნდა შეეძლოთ საქმეში ღრმად ჩახედული სპეციალისტების ჩართვა, ტესტირებისთვის უსაფრთხო გარემოსა და კვლევაში უსაფრთხოდ გამოსაყენებელი მონაცემების უზრუნველყოფა. ეს საწყის საფუძველს მოგვცემს წარუმატებლობის მიზეზების შესასწავლად და იმის გასაზომად, უმჯობესდება თუ არა მოდელი.
თუ თქვენი გუნდი ამ პირობებს აკმაყოფილებს, გამოგზავნეთ განაცხადი კვლევითი თანამშრომლობის შესაძლებლობის განსახილველად.
ავტორი
სქოლიოები
- 1
- 2
სიმულირებული დავალებები შევქმენით SEC-ის EDGAR მონაცემთა ბაზაში საჯაროდ ხელმისაწვდომი ხელშეკრულებების საფუძველზე, მას შემდეგ, რაც მათზე პერსონალური ინფორმაციის წასაშლელად განკუთვნილი ფილტრები გამოვიყენეთ. წვრთნისა თუ შეფასებისთვის არ გამოგვიყენებია OpenAI-ის მომხმარებელთა მონაცემები, OpenAI-ის შიდა ხელშეკრულებები ან Ironclad-ის მომხმარებელთა არასაჯარო მონაცემები თუ ხელშეკრულებები.
- 3


