Rozwijamy umiejętność korzystania z komputerów z Ironclad
Jak współpraca badawcza w obszarze obsługi umów pomaga nam trenować i oceniać agentów AI wykonujących złożone zadania zawodowe.
Gdy wprowadziliśmy GPT‑6 Astra, pokazaliśmy, jak duże postępy poczyniły nasze modele w korzystaniu z komputerów do pracy zawodowej — od przygotowywania dokumentów po testowanie stron internetowych. Naszym kolejnym celem jest zwiększenie umiejętności i efektywności agentów w korzystaniu ze specjalistycznego oprogramowania do rozwiązywania złożonych problemów biznesowych. Badamy, jak trenować modele, by rozumiały reguły biznesowe firmy, realizowały wieloetapowe procesy i sprawdzały, czy ich praca spełnia pierwotne wymagania.
Aby przyspieszyć te badania, podejmujemy bezpośrednią współpracę z niewielką grupą producentów oprogramowania, którzy najlepiej rozumieją te procesy. Wspólnie identyfikujemy trudne zadania o dużej wartości biznesowej i przekształcamy je w problemy badawcze służące trenowaniu i ocenie naszych modeli. Dzięki temu docelowo zwiększamy ich możliwości i przydatność w rzeczywistych zastosowaniach biznesowych.
Naszym pierwszym partnerem jest Ironclad, lider w dziedzinie obsługi umów z wykorzystaniem AI. W ścisłej współpracy z zespołem Ironclad opracowaliśmy zadania wymagające od agentów konfigurowania umów, zatwierdzeń i postanowień umownych wielokrotnego użytku oraz wykazaliśmy postępy w realizacji tych złożonych procesów. Wiedza ekspertów Ironclad odegrała kluczową rolę w określeniu kryteriów sukcesu i bezpośrednim uwzględnieniu rzeczywistych potrzeb klientów w rozwoju pionierskich modeli. Jesteśmy wdzięczni za tę współpracę i z radością dzielimy się tym, co wspólnie osiągnęliśmy.
GPT‑6 Astra to nasz pierwszy pionierski model trenowany na zadaniach w Ironclad. W naszej ocenie badawczej uzyskał średni wynik o 32% wyższy niż GPT‑5.6 Sol, a szacowany czas na próbę był o 48% krótszy.1
Wyobraźmy sobie zespół ds. operacji prawnych, który przygotowuje proces zakupu oprogramowania. Dział finansowy może musieć zatwierdzać zakupy powyżej określonej kwoty, dział bezpieczeństwa — weryfikować wybrane wnioski, a dział prawny — sprawdzać niestandardowe warunki umów. Osoba konfigurująca proces musi na podstawie tej krótkiej listy przygotować formularz zgłoszeniowy, szablony dokumentów, reguły zatwierdzania i sposób rejestrowania ostatecznej umowy.
Agent AI wykonujący tę samą pracę musi pamiętać o tych wymaganiach podczas korzystania z kolejnych funkcji oprogramowania. Musi na przykład skonfigurować zatwierdzenie przez dział finansowy po przekroczeniu progu wydatków i sprawdzić, czy wnioski powyżej i poniżej tego progu trafiają na właściwe ścieżki. Poprawne wykonanie pojedynczych kroków nie wystarczy: gotowy proces musi działać we wszystkich sytuacjach, do których obsługi został zaprojektowany.
Pracownicy Ironclad oraz osoby korzystające z Ironclad w OpenAI pomogli naszym badaczom wybrać 11 zadań z obszaru prawa, działalności handlowej i zakupów. Obejmowały one między innymi konfigurowanie umów o zachowaniu poufności, tworzenie procesów zatwierdzania zakupów oraz aktualizowanie klauzuli prawnej wielokrotnego użytku tak, by uwzględniała jurysdykcję wybraną przez wnioskodawcę. Szacujemy, że doświadczony użytkownik potrzebowałby średnio około 30–40 minut na wykonanie każdego z tych zadań.
Każde zadanie ocenialiśmy według 8–50 kryteriów, zależnie od jego złożoności. Dzięki temu mogliśmy zobaczyć, z którymi elementami model poradził sobie dobrze, a gdzie nie spełnił wymagań. Ironclad udostępnił też hostowane środowiska swojego produktu, w których modele mogły ćwiczyć wykonywanie tych zadań. Nasi badacze opracowali syntetyczne zadania treningowe2 oparte na reprezentatywnych procesach i zastosowali uczenie przez wzmacnianie, aby modele doskonaliły się dzięki praktyce i informacjom zwrotnym. To połączenie — zadań wybranych wspólnie z osobami znającymi tę pracę, szczegółowych kryteriów i środowiska do ćwiczeń dla modeli — sprawia, że poprawiamy wyniki w rzeczywistych zadaniach, które są najważniejsze dla naszych klientów.
Porównaliśmy modele Astra i GPT‑5.6 Sol, ustawiając poziom rozumowania Maks dla modelu Astra i Wysoki dla modelu Sol — ustawienia, przy których każdy z modeli uzyskał najwyższy wynik. W 11 zadaniach badawczych średni wynik modelu Astra wyniósł 55,0%, wobec 41,6% dla GPT‑5.6 Sol. Jednocześnie szacowany średni czas na próbę spadł z 37,0 minut dla modelu Sol do 19,2 minut dla modelu Astra.3 Wewnętrzny model używany podczas prac nad modelem Astra osiągnął w tych zadaniach jeszcze lepszy wynik — 63,7%. Chcemy, by przyszłe modele również korzystały z tych dalszych postępów.
Wskaźnik | GPT‑5.6 Sol | GPT‑6 Astra |
Średni wynik według kryteriów oceny | 41,6% | 55,0% |
Szacowany średni czas na próbę | 37,0 min | 19,2 min |
Model Astra spełnił więcej wymagań zadań przy krótszym symulowanym czasie na próbę. Dwa poniższe nagrania pokazują, jak modele poradziły sobie z tym samym zadaniem badawczym. Model Astra (pierwsze nagranie) spełnił około 94% kryteriów zadania w szacowanym czasie 20 minut, a GPT‑5.6 Sol (drugie) — około 85% w szacowanym czasie 32 minut.
GPT‑6 Astra spełnił około 94% kryteriów zadania w szacowanym czasie 20 minut.
GPT‑5.6 Sol spełnił około 85% kryteriów zadania w szacowanym czasie 32 minut.
Rola Ironclad w tych pracach wiąże się z wyzwaniem dobrze znanym klientom firmy: proces obsługi umów musi uwzględniać wyjątki, a zarazem zachowywać reguły, na których opiera się działalność firmy. Jeśli agent w trakcie zadania zapomni o jednej z tych reguł, ogranicza to zakres prac, które producent oprogramowania może mu z przekonaniem powierzyć. Pokazuje to, dlaczego nadzór człowieka nadal ma znaczenie, choć agenci coraz lepiej radzą sobie ze złożonymi zadaniami dotyczącymi umów, i dlaczego kompleksowa platforma do ich obsługi pozostaje niezbędna. Dzięki współpracy z naszymi badaczami Ironclad może uwzględnić te problemy w rozwoju modelu, na którym opiera się rozwiązanie, abyśmy mogli wspólnie je badać.
Wraz ze wzrostem możliwości modeli Ironclad ma szansę wykorzystywać je w większej liczbie swoich produktów. Dla zespołów prawnych i biznesowych może to oznaczać przejęcie przez AI większej części pracy przy obsłudze złożonych umów, z zachowaniem mechanizmów kontroli, na których te zespoły polegają.
Zapraszamy niewielką grupę producentów oprogramowania do bezpośredniej współpracy z naszymi zespołami badawczymi i inżynieryjnymi nad ważnymi zadaniami zawodowymi, których dzisiejsi agenci wciąż nie potrafią niezawodnie wykonywać. Jeśli Twój zespół ma takie zadanie, chcielibyśmy poznać konkretny przykład: co zlecacie agentowi, jakie macie dowody na to, gdzie zawodzi, i jak ocenilibyście, czy wynik jest udany. Partnerzy powinni też zapewnić udział osób z dogłębną znajomością tej pracy, bezpieczne środowisko testowe oraz dane, które można bezpiecznie wykorzystać do badań. Daje nam to punkt wyjścia do zbadania przyczyn niepowodzenia i zmierzenia postępów modelu.
Jeśli Twój zespół spełnia te warunki, zgłoś się, by omówić możliwości współpracy badawczej.
Autorzy
Przypisy
- 1
- 2
Stworzyliśmy symulowane zadania na podstawie umów publicznie dostępnych w bazie EDGAR amerykańskiej Komisji Papierów Wartościowych i Giełd (SEC), po zastosowaniu filtrów służących usuwaniu danych osobowych. Do trenowania ani oceny nie używaliśmy danych klientów OpenAI, wewnętrznych umów OpenAI ani niepublicznych danych lub umów klientów Ironclad.
- 3


