Langsung ke konten utama
OpenAI

6 Oktober 2026

Publikasi

Memajukan penggunaan komputer bersama Ironclad

Bagaimana kolaborasi riset di bidang pengelolaan kontrak membantu kami melatih dan mengevaluasi agen AI untuk pekerjaan profesional yang kompleks.

Memuat…

Saat memperkenalkan GPT‑6 Astra, kami menunjukkan sejauh mana model kami telah berkembang dalam menggunakan komputer untuk pekerjaan profesional, mulai dari menyiapkan dokumen hingga menguji situs web. Tujuan kami berikutnya adalah meningkatkan kemampuan dan efisiensi agen dalam menggunakan perangkat lunak khusus untuk memecahkan masalah bisnis yang kompleks. Kami sedang mengeksplorasi cara melatih model agar dapat memahami aturan bisnis perusahaan, menjalankan alur kerja bertahap, dan memverifikasi bahwa hasil kerjanya memenuhi persyaratan awal.

Untuk mempercepat riset ini, kami bermitra langsung dengan sejumlah kecil perusahaan perangkat lunak yang paling memahami alur kerja tersebut. Bersama-sama, kami mengidentifikasi tugas yang menantang dan bernilai tinggi, lalu menjadikannya permasalahan riset untuk melatih dan mengevaluasi model kami. Pada akhirnya, upaya ini meningkatkan kemampuan dan manfaat model kami dalam penerapan bisnis di dunia nyata.

Mitra pertama kami adalah Ironclad, salah satu pemimpin dalam pengelolaan kontrak berbasis AI. Melalui kerja sama erat dengan tim Ironclad, kami telah mengembangkan tugas yang mengharuskan agen mengonfigurasi perjanjian, persetujuan, dan ketentuan hukum yang dapat digunakan kembali, serta menunjukkan kemajuan dalam menjalankan alur kerja kompleks ini. Keahlian Ironclad berperan penting dalam menetapkan tolok ukur keberhasilan dan membawa kebutuhan nyata pelanggan langsung ke dalam pengembangan model terdepan. Kami berterima kasih atas kemitraan ini dan antusias untuk berbagi pencapaian kami bersama.

GPT‑6 Astra adalah model terdepan pertama kami yang dilatih menggunakan tugas Ironclad. Dalam evaluasi riset kami, skor rata-ratanya 32% lebih tinggi dibandingkan GPT‑5.6 Sol, sementara estimasi waktu per percobaannya 48% lebih singkat.1

Mengubah alur kerja pengelolaan kontrak menjadi tugas pelatihan

Bayangkan sebuah tim operasional hukum yang sedang menyiapkan proses pembelian perangkat lunak. Tim Keuangan mungkin perlu menyetujui pembelian di atas nilai tertentu, tim Keamanan mungkin perlu meninjau permintaan tertentu, dan tim Hukum mungkin perlu meninjau ketentuan yang tidak standar. Orang yang menyiapkan proses tersebut harus menerjemahkan daftar singkat itu menjadi formulir pengajuan, templat dokumen, aturan persetujuan, dan catatan perjanjian final.

Agen AI yang mengerjakan tugas yang sama harus terus memperhatikan persyaratan tersebut saat mengoperasikan perangkat lunak. Misalnya, agen harus mengatur agar pengeluaran di atas ambang batas memerlukan persetujuan tim Keuangan, serta memastikan bahwa permintaan di atas dan di bawah batas tersebut mengikuti jalur yang tepat. Menjalankan tiap langkah dengan benar saja tidak cukup: proses yang telah disiapkan harus berfungsi dalam berbagai situasi yang memang dirancang untuk ditanganinya.

Karyawan Ironclad dan pengguna Ironclad di OpenAI membantu peneliti kami mengidentifikasi 11 tugas di bidang hukum, komersial, dan pengadaan. Tugas-tugas ini mencakup penyiapan perjanjian kerahasiaan, pembuatan proses persetujuan pengadaan, serta pembaruan klausul hukum yang dapat digunakan kembali agar sesuai dengan yurisdiksi yang dipilih pemohon. Kami memperkirakan pengguna berpengalaman memerlukan waktu rata-rata sekitar 30 hingga 40 menit per tugas untuk menyelesaikan pekerjaan ini.

Kami mengevaluasi setiap tugas berdasarkan 8 hingga 50 kriteria, tergantung pada tingkat kerumitannya. Dengan begitu, kami dapat melihat bagian mana yang dikerjakan model dengan benar dan bagian mana yang masih kurang. Ironclad juga menyediakan lingkungan perangkat lunak yang dihosting untuk produknya, tempat model dapat berlatih mengerjakan tugas-tugas ini. Peneliti kami mengembangkan tugas pelatihan sintetis2 berdasarkan alur kerja yang representatif dan menggunakan reinforcement learning untuk membantu model meningkatkan kemampuannya melalui latihan dan umpan balik. Kombinasi tugas yang dipilih bersama orang yang memahami pekerjaan tersebut, kriteria yang terperinci, dan tempat bagi model untuk berlatih memastikan bahwa kami meningkatkan kemampuan model pada tugas nyata yang paling penting bagi pelanggan kami.

Kinerja Astra

Kami membandingkan Astra dan GPT‑5.6 Sol dengan tingkat penalaran Max untuk Astra dan Tinggi untuk Sol, yaitu pengaturan yang menghasilkan skor tertinggi bagi masing-masing model. Pada 11 tugas riset tersebut, skor rata-rata Astra mencapai 55,0%, dibandingkan dengan 41,6% untuk GPT‑5.6 Sol. Sementara itu, estimasi waktu rata-rata per percobaan turun dari 37,0 menit untuk Sol menjadi 19,2 menit untuk Astra.3 Model internal yang digunakan dalam pengembangan Astra meraih skor lebih tinggi lagi, yaitu 63,7% pada tugas-tugas ini, dan kami menargetkan peningkatan lebih lanjut ini hadir pada model mendatang.

Metrik

GPT‑5.6 Sol
Penalaran Tinggi

GPT‑6 Astra
Penalaran Max

Skor rata-rata rubrik

41,6%

55,0%

Estimasi waktu rata-rata per percobaan

37,0 menit

19,2 menit

Astra memenuhi lebih banyak persyaratan tugas dengan waktu simulasi yang lebih singkat per percobaan. Dua klip di bawah ini menunjukkan bagaimana kedua model menangani tugas riset yang sama. Astra (pertama) memenuhi sekitar 94% kriteria tugas dalam estimasi waktu 20 menit; GPT‑5.6 Sol (kedua) memenuhi sekitar 85% dalam estimasi waktu 32 menit.

GPT‑6 Astra memenuhi sekitar 94% kriteria tugas dalam estimasi waktu 20 menit.

GPT‑5.6 Sol memenuhi sekitar 85% kriteria tugas dalam estimasi waktu 32 menit.

Arti kolaborasi ini bagi Ironclad

Peran Ironclad dalam upaya ini mencerminkan tantangan yang sangat dipahami pelanggannya: proses pengelolaan kontrak harus mampu menangani pengecualian sambil tetap menjaga aturan yang menjadi landasan bisnis. Jika agen mengabaikan salah satu aturan tersebut di tengah pengerjaan tugas, perusahaan perangkat lunak akan lebih terbatas dalam menentukan tugas yang dapat dipercayakan kepadanya. Hal ini menegaskan mengapa pengawasan manusia tetap penting seiring meningkatnya kemampuan agen dalam menangani tugas pengelolaan kontrak yang kompleks, dan mengapa platform pengelolaan kontrak yang lengkap tetap diperlukan. Bekerja sama dengan peneliti kami memungkinkan Ironclad membawa permasalahan ini ke dalam pengembangan model yang mendasarinya, sehingga kami dapat mengkajinya bersama.

Seiring meningkatnya kemampuan model, Ironclad berpeluang memanfaatkannya di lebih banyak produknya sendiri. Bagi tim hukum dan bisnis, ini bisa berarti AI mengambil alih lebih banyak pekerjaan dalam pengelolaan kontrak yang kompleks sambil tetap mempertahankan mekanisme kontrol yang mereka andalkan.

“Agar AI benar-benar bermanfaat dalam aspek pengelolaan kontrak yang kompleks, kemampuannya harus melampaui penyelesaian tindakan satu per satu. Agen perlu memahami seluruh siklus pengelolaan kontrak, termasuk keterkaitan antaralur kerja bisnis, sambil tetap menjaga mekanisme kontrol yang diandalkan tim. Kolaborasi kami dengan OpenAI membawa tantangan nyata ini ke dalam proses riset dan membantu memajukan teknologi.”
—Sunita Verma, Direktur Teknologi, Ironclad

Bekerja samalah dengan kami untuk memajukan AI bagi pekerjaan profesional yang kompleks

Kami mengundang sejumlah kecil perusahaan perangkat lunak untuk bekerja langsung dengan tim riset dan rekayasa kami dalam menangani tugas profesional penting yang belum dapat diselesaikan secara andal oleh agen saat ini. Jika tim Anda memiliki tugas semacam itu, kami ingin melihat contoh konkretnya: apa yang Anda minta agen lakukan, bukti kegagalannya, dan bagaimana Anda menilai keberhasilan hasilnya. Mitra juga harus dapat melibatkan orang yang benar-benar memahami pekerjaan tersebut, menyediakan lingkungan pengujian yang aman, serta data yang dapat digunakan dengan aman untuk riset. Hal ini memberi kami titik awal untuk menyelidiki kegagalan tersebut dan mengukur apakah kemampuan model meningkat.

Jika tim Anda memenuhi kriteria tersebut, daftarkan diri untuk menjajaki kolaborasi riset.

Penulis

OpenAI

Catatan kaki

  1. 1

    Hasil ini mencakup 11 tugas riset, bukan seluruh alur kerja Ironclad. Waktu yang tercantum merupakan estimasi simulasi berdasarkan asumsi kecepatan pemrosesan dan pembuatan output model, bukan penghematan waktu pelanggan yang diukur secara langsung.

  2. 2

    Kami membuat tugas simulasi dari kontrak yang tersedia untuk umum di basis data EDGAR milik SEC setelah menerapkan filter yang dirancang untuk menghapus informasi pribadi. Kami tidak menggunakan data pelanggan OpenAI, kontrak internal OpenAI, maupun data atau kontrak pelanggan Ironclad yang tidak tersedia untuk umum dalam pelatihan atau evaluasi.

  3. 3

    Lihat catatan kaki tentang evaluasi riset di atas.