Przejdź do treści głównej
OpenAI

6 października 2026

Publikacja

Rozwijamy umiejętność korzystania z komputerów z Ironclad

Jak współpraca badawcza w obszarze obsługi umów pomaga nam trenować i oceniać agentów AI wykonujących złożone zadania zawodowe.

Ładowanie…

Gdy wprowadziliśmy GPT‑6 Astra, pokazaliśmy, jak duże postępy poczyniły nasze modele w korzystaniu z komputerów do pracy zawodowej — od przygotowywania dokumentów po testowanie stron internetowych. Naszym kolejnym celem jest zwiększenie umiejętności i efektywności agentów w korzystaniu ze specjalistycznego oprogramowania do rozwiązywania złożonych problemów biznesowych. Badamy, jak trenować modele, by rozumiały reguły biznesowe firmy, realizowały wieloetapowe procesy i sprawdzały, czy ich praca spełnia pierwotne wymagania.

Aby przyspieszyć te badania, podejmujemy bezpośrednią współpracę z niewielką grupą producentów oprogramowania, którzy najlepiej rozumieją te procesy. Wspólnie identyfikujemy trudne zadania o dużej wartości biznesowej i przekształcamy je w problemy badawcze służące trenowaniu i ocenie naszych modeli. Dzięki temu docelowo zwiększamy ich możliwości i przydatność w rzeczywistych zastosowaniach biznesowych.

Naszym pierwszym partnerem jest Ironclad, lider w dziedzinie obsługi umów z wykorzystaniem AI. W ścisłej współpracy z zespołem Ironclad opracowaliśmy zadania wymagające od agentów konfigurowania umów, zatwierdzeń i postanowień umownych wielokrotnego użytku oraz wykazaliśmy postępy w realizacji tych złożonych procesów. Wiedza ekspertów Ironclad odegrała kluczową rolę w określeniu kryteriów sukcesu i bezpośrednim uwzględnieniu rzeczywistych potrzeb klientów w rozwoju pionierskich modeli. Jesteśmy wdzięczni za tę współpracę i z radością dzielimy się tym, co wspólnie osiągnęliśmy.

GPT‑6 Astra to nasz pierwszy pionierski model trenowany na zadaniach w Ironclad. W naszej ocenie badawczej uzyskał średni wynik o 32% wyższy niż GPT‑5.6 Sol, a szacowany czas na próbę był o 48% krótszy.1

Od procesów obsługi umów do zadań treningowych

Wyobraźmy sobie zespół ds. operacji prawnych, który przygotowuje proces zakupu oprogramowania. Dział finansowy może musieć zatwierdzać zakupy powyżej określonej kwoty, dział bezpieczeństwa — weryfikować wybrane wnioski, a dział prawny — sprawdzać niestandardowe warunki umów. Osoba konfigurująca proces musi na podstawie tej krótkiej listy przygotować formularz zgłoszeniowy, szablony dokumentów, reguły zatwierdzania i sposób rejestrowania ostatecznej umowy.

Agent AI wykonujący tę samą pracę musi pamiętać o tych wymaganiach podczas korzystania z kolejnych funkcji oprogramowania. Musi na przykład skonfigurować zatwierdzenie przez dział finansowy po przekroczeniu progu wydatków i sprawdzić, czy wnioski powyżej i poniżej tego progu trafiają na właściwe ścieżki. Poprawne wykonanie pojedynczych kroków nie wystarczy: gotowy proces musi działać we wszystkich sytuacjach, do których obsługi został zaprojektowany.

Pracownicy Ironclad oraz osoby korzystające z Ironclad w OpenAI pomogli naszym badaczom wybrać 11 zadań z obszaru prawa, działalności handlowej i zakupów. Obejmowały one między innymi konfigurowanie umów o zachowaniu poufności, tworzenie procesów zatwierdzania zakupów oraz aktualizowanie klauzuli prawnej wielokrotnego użytku tak, by uwzględniała jurysdykcję wybraną przez wnioskodawcę. Szacujemy, że doświadczony użytkownik potrzebowałby średnio około 30–40 minut na wykonanie każdego z tych zadań.

Każde zadanie ocenialiśmy według 8–50 kryteriów, zależnie od jego złożoności. Dzięki temu mogliśmy zobaczyć, z którymi elementami model poradził sobie dobrze, a gdzie nie spełnił wymagań. Ironclad udostępnił też hostowane środowiska swojego produktu, w których modele mogły ćwiczyć wykonywanie tych zadań. Nasi badacze opracowali syntetyczne zadania treningowe2 oparte na reprezentatywnych procesach i zastosowali uczenie przez wzmacnianie, aby modele doskonaliły się dzięki praktyce i informacjom zwrotnym. To połączenie — zadań wybranych wspólnie z osobami znającymi tę pracę, szczegółowych kryteriów i środowiska do ćwiczeń dla modeli — sprawia, że poprawiamy wyniki w rzeczywistych zadaniach, które są najważniejsze dla naszych klientów.

Jak wypadł model Astra

Porównaliśmy modele Astra i GPT‑5.6 Sol, ustawiając poziom rozumowania Maks dla modelu Astra i Wysoki dla modelu Sol — ustawienia, przy których każdy z modeli uzyskał najwyższy wynik. W 11 zadaniach badawczych średni wynik modelu Astra wyniósł 55,0%, wobec 41,6% dla GPT‑5.6 Sol. Jednocześnie szacowany średni czas na próbę spadł z 37,0 minut dla modelu Sol do 19,2 minut dla modelu Astra.3 Wewnętrzny model używany podczas prac nad modelem Astra osiągnął w tych zadaniach jeszcze lepszy wynik — 63,7%. Chcemy, by przyszłe modele również korzystały z tych dalszych postępów.

Wskaźnik

GPT‑5.6 Sol
Poziom rozumowania: Wysoki

GPT‑6 Astra
Poziom rozumowania: Maks

Średni wynik według kryteriów oceny

41,6%

55,0%

Szacowany średni czas na próbę

37,0 min

19,2 min

Model Astra spełnił więcej wymagań zadań przy krótszym symulowanym czasie na próbę. Dwa poniższe nagrania pokazują, jak modele poradziły sobie z tym samym zadaniem badawczym. Model Astra (pierwsze nagranie) spełnił około 94% kryteriów zadania w szacowanym czasie 20 minut, a GPT‑5.6 Sol (drugie) — około 85% w szacowanym czasie 32 minut.

GPT‑6 Astra spełnił około 94% kryteriów zadania w szacowanym czasie 20 minut.

GPT‑5.6 Sol spełnił około 85% kryteriów zadania w szacowanym czasie 32 minut.

Co ta współpraca oznacza dla Ironclad

Rola Ironclad w tych pracach wiąże się z wyzwaniem dobrze znanym klientom firmy: proces obsługi umów musi uwzględniać wyjątki, a zarazem zachowywać reguły, na których opiera się działalność firmy. Jeśli agent w trakcie zadania zapomni o jednej z tych reguł, ogranicza to zakres prac, które producent oprogramowania może mu z przekonaniem powierzyć. Pokazuje to, dlaczego nadzór człowieka nadal ma znaczenie, choć agenci coraz lepiej radzą sobie ze złożonymi zadaniami dotyczącymi umów, i dlaczego kompleksowa platforma do ich obsługi pozostaje niezbędna. Dzięki współpracy z naszymi badaczami Ironclad może uwzględnić te problemy w rozwoju modelu, na którym opiera się rozwiązanie, abyśmy mogli wspólnie je badać.

Wraz ze wzrostem możliwości modeli Ironclad ma szansę wykorzystywać je w większej liczbie swoich produktów. Dla zespołów prawnych i biznesowych może to oznaczać przejęcie przez AI większej części pracy przy obsłudze złożonych umów, z zachowaniem mechanizmów kontroli, na których te zespoły polegają.

“Aby AI była naprawdę przydatna w złożonych obszarach obsługi umów, musi robić więcej niż tylko wykonywać pojedyncze czynności. Agenci muszą rozumieć cały cykl życia umowy, w tym powiązania między procesami biznesowymi, a przy tym zachowywać mechanizmy kontroli, na których polegają zespoły. Nasza współpraca z OpenAI pozwala uwzględniać te praktyczne wyzwania w procesie badawczym i pomaga rozwijać technologię.”
— Sunita Verma, dyrektorka ds. technologii, Ironclad

Rozwijaj z nami AI do złożonych zadań zawodowych

Zapraszamy niewielką grupę producentów oprogramowania do bezpośredniej współpracy z naszymi zespołami badawczymi i inżynieryjnymi nad ważnymi zadaniami zawodowymi, których dzisiejsi agenci wciąż nie potrafią niezawodnie wykonywać. Jeśli Twój zespół ma takie zadanie, chcielibyśmy poznać konkretny przykład: co zlecacie agentowi, jakie macie dowody na to, gdzie zawodzi, i jak ocenilibyście, czy wynik jest udany. Partnerzy powinni też zapewnić udział osób z dogłębną znajomością tej pracy, bezpieczne środowisko testowe oraz dane, które można bezpiecznie wykorzystać do badań. Daje nam to punkt wyjścia do zbadania przyczyn niepowodzenia i zmierzenia postępów modelu.

Jeśli Twój zespół spełnia te warunki, zgłoś się, by omówić możliwości współpracy badawczej.

Autorzy

OpenAI

Przypisy

  1. 1

    Wyniki te dotyczą 11 zadań badawczych, a nie wszystkich procesów w Ironclad. Podane czasy są szacunkami z symulacji opartymi na założonych prędkościach przetwarzania i generowania przez modele, a nie zmierzonymi oszczędnościami czasu klientów.

  2. 2

    Stworzyliśmy symulowane zadania na podstawie umów publicznie dostępnych w bazie EDGAR amerykańskiej Komisji Papierów Wartościowych i Giełd (SEC), po zastosowaniu filtrów służących usuwaniu danych osobowych. Do trenowania ani oceny nie używaliśmy danych klientów OpenAI, wewnętrznych umów OpenAI ani niepublicznych danych lub umów klientów Ironclad.

  3. 3

    Zobacz powyższy przypis dotyczący oceny badawczej.