Nâng cao khả năng sử dụng máy tính cùng Ironclad
Cách hợp tác nghiên cứu trong lĩnh vực hợp đồng giúp chúng tôi huấn luyện và đánh giá các tác nhân AI trong công việc chuyên môn phức tạp.
Khi giới thiệu GPT‑6 Astra, chúng tôi đã cho thấy các mô hình của mình tiến xa đến đâu trong việc sử dụng máy tính cho công việc chuyên môn, từ soạn thảo tài liệu đến kiểm thử trang web. Mục tiêu tiếp theo của chúng tôi là nâng cao năng lực và hiệu suất của các tác nhân khi sử dụng phần mềm chuyên dụng để giải quyết những bài toán kinh doanh phức tạp. Chúng tôi đang tìm hiểu cách huấn luyện mô hình để hiểu các quy tắc nghiệp vụ của công ty, thực hiện quy trình nhiều bước và xác minh rằng công việc đã làm đáp ứng các yêu cầu ban đầu.
Để đẩy nhanh nghiên cứu này, chúng tôi đang hợp tác trực tiếp với một số ít công ty phần mềm am hiểu nhất về các quy trình này. Chúng tôi cùng xác định những tác vụ khó và có giá trị cao, rồi chuyển chúng thành bài toán nghiên cứu để huấn luyện và đánh giá mô hình, qua đó nâng cao năng lực và tính hữu ích của mô hình trong các ứng dụng kinh doanh thực tế.
Đối tác đầu tiên của chúng tôi là Ironclad, một đơn vị hàng đầu về ứng dụng AI trong công việc hợp đồng. Thông qua hợp tác chặt chẽ với đội ngũ Ironclad, chúng tôi đã xây dựng các tác vụ yêu cầu tác nhân cấu hình thỏa thuận, quy trình phê duyệt và điều khoản pháp lý có thể tái sử dụng, đồng thời cho thấy tiến bộ trong việc xử lý những quy trình phức tạp này. Chuyên môn của Ironclad đóng vai trò then chốt trong việc xác định tiêu chuẩn thành công và đưa nhu cầu thực tế của khách hàng trực tiếp vào quá trình phát triển mô hình tiên phong. Chúng tôi trân trọng sự hợp tác của Ironclad và rất hào hứng chia sẻ những thành quả hai bên đã cùng đạt được.
GPT‑6 Astra là mô hình tiên phong đầu tiên của chúng tôi được huấn luyện trên các tác vụ Ironclad. Trong bài đánh giá nghiên cứu của chúng tôi, điểm trung bình của mô hình này cao hơn GPT‑5.6 Sol 32%, trong khi thời gian ước tính cho mỗi lần thực hiện thấp hơn 48%.1
Hãy hình dung một nhóm vận hành pháp chế đang thiết lập quy trình mua phần mềm. Bộ phận Tài chính có thể cần phê duyệt các khoản mua vượt một mức nhất định, bộ phận Bảo mật có thể cần xem xét một số yêu cầu, và bộ phận Pháp chế có thể cần rà soát các điều khoản không theo mẫu chuẩn. Người thiết lập quy trình phải chuyển danh sách ngắn đó thành biểu mẫu tiếp nhận yêu cầu, mẫu tài liệu, quy tắc phê duyệt và hồ sơ lưu trữ thỏa thuận cuối cùng.
Một tác nhân AI thực hiện cùng công việc phải luôn theo sát những yêu cầu đó trong suốt quá trình thao tác trên phần mềm. Ví dụ, tác nhân phải cấu hình bước phê duyệt của bộ phận Tài chính cho các khoản chi vượt ngưỡng, đồng thời kiểm tra xem yêu cầu trên và dưới ngưỡng đó có được chuyển theo đúng luồng hay không. Làm đúng từng bước riêng lẻ là chưa đủ: quy trình hoàn chỉnh phải vận hành được trong mọi tình huống mà nó được thiết kế để xử lý.
Nhân viên Ironclad và những người sử dụng Ironclad tại OpenAI đã giúp các nhà nghiên cứu của chúng tôi xác định 11 tác vụ thuộc lĩnh vực pháp chế, thương mại và mua sắm. Trong số đó có các tác vụ như thiết lập thỏa thuận bảo mật thông tin, tạo quy trình phê duyệt mua sắm và cập nhật một điều khoản pháp lý có thể tái sử dụng để phù hợp với khu vực tài phán mà người yêu cầu chọn. Chúng tôi ước tính một người dùng có kinh nghiệm sẽ mất trung bình khoảng 30 đến 40 phút để hoàn thành mỗi tác vụ.
Chúng tôi đánh giá mỗi tác vụ theo 8 đến 50 tiêu chí, tùy mức độ phức tạp. Nhờ đó, chúng tôi có thể thấy mô hình làm đúng phần nào và còn thiếu sót ở đâu. Ironclad cũng cung cấp các môi trường chạy sản phẩm của họ trên máy chủ để các mô hình có thể thực hành những tác vụ này. Các nhà nghiên cứu của chúng tôi đã xây dựng tác vụ huấn luyện tổng hợp2 dựa trên những quy trình tiêu biểu và sử dụng học tăng cường để giúp mô hình cải thiện thông qua thực hành và phản hồi. Sự kết hợp giữa các tác vụ được lựa chọn cùng người am hiểu công việc, tiêu chí chi tiết và môi trường để mô hình thực hành giúp đảm bảo chúng tôi đang cải thiện khả năng xử lý những tác vụ thực tế quan trọng nhất với khách hàng.
Chúng tôi so sánh Astra và GPT‑5.6 Sol với mức suy luận Max cho Astra và mức suy luận Cao cho Sol — những thiết lập mà mỗi mô hình đạt điểm cao nhất. Trên 11 tác vụ nghiên cứu, Astra đạt điểm trung bình 55,0%, so với 41,6% của GPT‑5.6 Sol, trong khi thời gian trung bình ước tính cho mỗi lần thực hiện giảm từ 37,0 phút với Sol xuống 19,2 phút với Astra.3 Một mô hình nội bộ được dùng trong quá trình phát triển Astra còn đạt kết quả cao hơn, ở mức 63,7% trên các tác vụ này, và chúng tôi đặt mục tiêu đưa những cải tiến bổ sung này vào các mô hình tương lai.
Chỉ số | GPT‑5.6 Sol | GPT‑6 Astra |
Điểm trung bình theo bộ tiêu chí | 41,6% | 55,0% |
Thời gian trung bình ước tính cho mỗi lần thực hiện | 37,0 phút | 19,2 phút |
Astra đáp ứng nhiều yêu cầu của tác vụ hơn, với thời gian mô phỏng cho mỗi lần thực hiện ngắn hơn. Hai video bên dưới cho thấy cách các mô hình xử lý cùng một tác vụ nghiên cứu. Astra (video đầu tiên) đáp ứng khoảng 94% tiêu chí của tác vụ trong thời gian ước tính 20 phút; GPT‑5.6 Sol (video thứ hai) đáp ứng khoảng 85% trong thời gian ước tính 32 phút.
GPT‑6 Astra đáp ứng khoảng 94% tiêu chí của tác vụ trong thời gian ước tính là 20 phút.
GPT‑5.6 Sol đáp ứng khoảng 85% tiêu chí của tác vụ trong thời gian ước tính là 32 phút.
Vai trò của Ironclad trong công việc này phản ánh một thách thức mà khách hàng của họ hiểu rõ: quy trình hợp đồng phải xử lý được các ngoại lệ mà vẫn tuân thủ những quy tắc thiết yếu đối với hoạt động của doanh nghiệp. Nếu một tác nhân bỏ sót một trong những quy tắc đó giữa chừng khi thực hiện tác vụ, phạm vi công việc mà công ty phần mềm có thể yên tâm giao cho tác nhân sẽ bị hạn chế. Điều này cho thấy vì sao sự giám sát của con người vẫn quan trọng khi các tác nhân ngày càng giỏi xử lý tác vụ hợp đồng phức tạp, và vì sao một nền tảng hợp đồng toàn diện vẫn là yếu tố thiết yếu. Hợp tác với các nhà nghiên cứu của chúng tôi giúp Ironclad đưa những vấn đề này vào quá trình phát triển mô hình nền tảng, để hai bên có thể cùng nghiên cứu.
Khi năng lực của các mô hình ngày càng cao, Ironclad có cơ hội ứng dụng chúng vào nhiều sản phẩm hơn của mình. Đối với các nhóm pháp chế và kinh doanh, điều đó có thể giúp AI đảm nhận nhiều phần việc hơn trong các quy trình hợp đồng phức tạp, đồng thời duy trì những cơ chế kiểm soát mà các nhóm này cần.
Chúng tôi đang mời một số ít công ty phần mềm làm việc trực tiếp với đội ngũ nghiên cứu và kỹ thuật của mình về những tác vụ chuyên môn quan trọng mà các tác nhân hiện nay vẫn chưa thể hoàn thành một cách đáng tin cậy. Nếu nhóm của bạn có tác vụ như vậy, chúng tôi muốn xem một ví dụ cụ thể: bạn yêu cầu tác nhân làm gì, bằng chứng cho thấy tác nhân thất bại ở đâu, và bạn sẽ đánh giá thế nào là một kết quả thành công. Đối tác cũng cần có khả năng cung cấp nhân sự am hiểu sâu sắc công việc, môi trường thử nghiệm bảo mật và dữ liệu có thể sử dụng an toàn cho nghiên cứu. Đó là cơ sở để chúng tôi bắt đầu tìm hiểu nguyên nhân thất bại và đo lường xem mô hình có cải thiện hay không.
Nếu nhóm của bạn đáp ứng những điều kiện này, hãy đăng ký để tìm hiểu cơ hội hợp tác nghiên cứu.
Tác giả
Chú thích
- 1
- 2
Chúng tôi tạo các tác vụ mô phỏng từ những hợp đồng được công khai trong cơ sở dữ liệu EDGAR của SEC, sau khi áp dụng các bộ lọc được thiết kế để loại bỏ thông tin cá nhân. Chúng tôi không sử dụng dữ liệu khách hàng của OpenAI, hợp đồng nội bộ của OpenAI, hay dữ liệu hoặc hợp đồng không công khai của khách hàng Ironclad để huấn luyện hoặc đánh giá.
- 3


