A számítógép-használat fejlesztése az Ironcladdal
Hogyan segíti egy szerződéskezelési kutatási együttműködés az AI-ügynökök tanítását és értékelését összetett szakmai feladatokon?
A GPT‑6 Astra bemutatásakor megmutattuk, mennyit fejlődtek modelljeink a szakmai célú számítógép-használatban, a dokumentumkészítéstől a weboldalak teszteléséig. Következő célunk, hogy az ügynökök még felkészültebben és hatékonyabban használják a speciális szoftvereket összetett üzleti problémák megoldására. Azt vizsgáljuk, hogyan taníthatók meg a modellek arra, hogy megértsék egy vállalat üzleti szabályait, többlépéses munkafolyamatokat hajtsanak végre, és ellenőrizzék, hogy munkájuk megfelel-e az eredeti követelményeknek.
A kutatás felgyorsítása érdekében közvetlenül együttműködünk néhány olyan szoftvercéggel, amely a legjobban ismeri ezeket a munkafolyamatokat. Közösen választunk ki nehéz, nagy értékű feladatokat, és kutatási problémákká alakítjuk őket modelljeink tanításához és értékeléséhez. Ezzel végső soron azt érjük el, hogy modelljeink többre legyenek képesek, és hasznosabbá váljanak a valós üzleti alkalmazásokban.
Első partnerünk az Ironclad, az AI-alapú szerződéskezelés egyik vezető vállalata. Az Ironclad csapatával szorosan együttműködve olyan feladatokat dolgoztunk ki, amelyekben az ügynököknek megállapodásokat, jóváhagyásokat és újrafelhasználható jogi feltételeket kell beállítaniuk, és előrelépést értünk el ezekben az összetett munkafolyamatokban. Az Ironclad szakértelme kulcsfontosságú volt a siker feltételeinek meghatározásában és abban, hogy a valós ügyféligények közvetlenül megjelenjenek az élvonalbeli modellek fejlesztésében. Hálásak vagyunk az együttműködésükért, és örömmel osztjuk meg közös eredményeinket.
A GPT‑6 Astra az első olyan élvonalbeli modellünk, amelyet Ironclad-feladatokon tanítottunk. Kutatási értékelésünkben átlagos pontszáma 32%-kal volt magasabb a GPT‑5.6 Sol eredményénél, miközben az egy próbálkozásra jutó becsült idő 48%-kal alacsonyabb volt.1
Vegyünk egy jogi operációs csapatot, amely szoftverbeszerzési folyamatot alakít ki. Előfordulhat, hogy egy bizonyos összeg felett a pénzügyi részlegnek kell jóváhagynia a vásárlást, bizonyos kérelmeket a biztonsági részlegnek kell ellenőriznie, a szokásostól eltérő feltételeket pedig a jogi részlegnek kell átnéznie. A folyamatot kialakító munkatársnak ebből a rövid listából kell létrehoznia az igénylőlapot, a dokumentumsablonokat, a jóváhagyási szabályokat és a végleges megállapodás nyilvántartási bejegyzését.
Az ugyanezt a munkát végző AI-ügynöknek a szoftver használata során végig szem előtt kell tartania ezeket a követelményeket. Be kell állítania például, hogy az értékhatár feletti kiadásokhoz pénzügyi jóváhagyás szükséges, és ellenőriznie kell, hogy az értékhatár feletti és alatti kérelmek a megfelelő útvonalon haladnak-e. Nem elég helyesen elvégezni az egyes lépéseket: a kész folyamatnak minden olyan helyzetben működnie kell, amelynek kezelésére tervezték.
Az Ironclad munkatársai és az OpenAI-nál az Ironcladot használó kollégák segítettek kutatóinknak kiválasztani 11 feladatot a jogi, kereskedelmi és beszerzési munka területéről. Ezek között szerepelt titoktartási megállapodások beállítása, beszerzési jóváhagyási folyamatok létrehozása, valamint egy újrafelhasználható jogi kikötés frissítése úgy, hogy az az igénylő által kiválasztott joghatóságnak feleljen meg. Becslésünk szerint egy tapasztalt felhasználónak ez a munka feladatonként átlagosan körülbelül 30–40 percet venne igénybe.
Minden feladatot az összetettségétől függően 8–50 kritérium alapján értékeltünk. Így láthattuk, mely részeket oldotta meg helyesen a modell, és hol voltak hiányosságai. Az Ironclad a saját termékéhez üzemeltetett szoftverkörnyezeteket is biztosított, amelyekben a modellek gyakorolhatták ezeket a feladatokat. Kutatóink jellemző munkafolyamatokra épülő szintetikus tanítási feladatokat2 dolgoztak ki, és megerősítéses tanulással segítették a modellek fejlődését a gyakorlás és a visszajelzések révén. A munkát jól ismerő szakemberekkel közösen kiválasztott feladatok, a részletes kritériumok és a modellek számára biztosított gyakorlókörnyezet együttesen gondoskodnak arról, hogy az ügyfeleinknek legfontosabb valós feladatokban érjünk el javulást.
Az Astra és a GPT‑5.6 Sol összehasonlításakor az Astránál a Max, a Solnál az Erős érvelési beállítást használtuk: mindkét modell ezekkel érte el a legmagasabb pontszámot. A 11 kutatási feladatban az Astra átlagos pontszáma 55,0% volt, szemben a GPT‑5.6 Sol 41,6%-ával, miközben az egy próbálkozásra jutó becsült átlagos idő a Sol 37,0 percéről az Astra esetében 19,2 percre csökkent.3 Az Astra fejlesztése során használt belső modell még jobb, 63,7%-os eredményt ért el ezeken a feladatokon. Célunk, hogy ezt a további javulást a jövőbeli modellekben is elérhetővé tegyük.
Mutató | GPT‑5.6 Sol | GPT‑6 Astra |
Átlagos pontszám az értékelési szempontrendszer alapján | 41,6% | 55,0% |
Egy próbálkozás becsült átlagos időigénye | 37,0 perc | 19,2 perc |
Az Astra több feladatkövetelményt teljesített, miközben próbálkozásonként kevesebb szimulált időt használt fel. Az alábbi két videó azt mutatja be, hogyan oldották meg a modellek ugyanazt a kutatási feladatot. Az Astra (az első videóban) a feladat követelményeinek mintegy 94%-át teljesítette, becslések szerint 20 perc alatt; a GPT‑5.6 Sol (a másodikban) körülbelül 85%-át, becslések szerint 32 perc alatt.
A GPT‑6 Astra a feladat követelményeinek mintegy 94%-át teljesítette, becslések szerint 20 perc alatt.
A GPT‑5.6 Sol a feladat követelményeinek mintegy 85%-át teljesítette, becslések szerint 32 perc alatt.
Az Ironclad szerepe ebben a munkában egy olyan kihívásra világít rá, amelyet ügyfelei jól ismernek: a szerződéskezelési folyamatnak úgy kell kezelnie a kivételeket, hogy közben betartja a vállalat működéséhez nélkülözhetetlen szabályokat. Ha egy ügynök a feladat végrehajtása közben szem elől téveszt egy ilyen szabályt, az korlátozza, hogy egy szoftvercég milyen feladatokat bízhat rá biztonsággal. Ez rávilágít arra, miért fontos továbbra is az emberi felügyelet, miközben az ügynökök egyre jobban teljesítenek az összetett szerződéskezelési feladatokban, és miért marad nélkülözhetetlen egy teljes körű szerződéskezelési platform. A kutatóinkkal való együttműködés révén az Ironclad ezeket a problémákat közvetlenül az alapul szolgáló modell fejlesztése során vetheti fel, így közösen vizsgálhatjuk őket.
Ahogy a modellek képességei fejlődnek, az Ironclad egyre több saját termékében használhatja őket. A jogi és üzleti csapatok számára ez azt jelentheti, hogy az AI többet vállal át az összetett szerződéskezeléssel járó munkából, miközben megőrzi azokat az ellenőrzési mechanizmusokat, amelyekre a csapatok támaszkodnak.
Néhány szoftvercéget közvetlen együttműködésre hívunk kutató- és mérnökcsapatainkkal olyan fontos szakmai feladatok kapcsán, amelyeket a mai ügynökök még nem tudnak megbízhatóan elvégezni. Ha az Önök csapatánál is van ilyen feladat, szívesen látnánk egy konkrét példát: mit kérnek az ügynöktől, milyen bizonyítékok mutatják, hol hibázik, és mi alapján ítélnék sikeresnek az eredményt. Partnereinktől azt is várjuk, hogy biztosítsanak a munkát alaposan ismerő szakembereket, biztonságos tesztkörnyezetet és kutatásra biztonságosan felhasználható adatokat. Ez kiindulópontot ad a hiba kivizsgálásához és annak méréséhez, hogy javul-e a modell teljesítménye.
Ha mindez igaz az Önök csapatára, jelentkezzenek, hogy közösen feltérképezhessük a kutatási együttműködés lehetőségeit.
Szerző
Lábjegyzetek
- 1
- 2
A szimulált feladatokat a SEC EDGAR adatbázisában nyilvánosan elérhető szerződésekből készítettük, miután személyes adatok eltávolítására szolgáló szűrőket alkalmaztunk. Sem a tanításhoz, sem az értékeléshez nem használtuk fel az OpenAI ügyféladatait vagy belső szerződéseit, illetve az Ironclad ügyfeleinek nem nyilvános adatait vagy szerződéseit.
- 3


