메인 콘텐츠로 건너뛰기
OpenAI

2026년 10월 6일

발표

Ironclad와 함께 발전시키는 컴퓨터 사용 역량

계약 분야의 연구 협력이 복잡한 전문 업무를 수행하는 AI 에이전트의 학습과 평가에 어떻게 기여하는지 소개합니다.

로딩 중...

OpenAI는 GPT‑6 Astra를 소개하면서 문서 작성부터 웹사이트 테스트까지, 컴퓨터로 전문 업무를 수행하는 모델의 역량이 얼마나 발전했는지 보여 드렸습니다. 다음 목표는 에이전트가 전문 소프트웨어를 활용해 복잡한 비즈니스 문제를 해결하는 능력과 효율성을 높이는 것입니다. 이를 위해 모델이 기업의 업무 규칙을 이해하고, 여러 단계의 워크플로를 실행하며, 작업 결과가 당초 요구사항을 충족하는지 검증하도록 학습시키는 방법을 모색하고 있습니다.

이 연구에 속도를 내기 위해 해당 워크플로를 가장 잘 이해하는 소수의 소프트웨어 기업과 직접 협력하고 있습니다. 파트너사와 함께 난도가 높고 가치 있는 업무를 찾아 모델 학습과 평가를 위한 연구 과제로 만들고 있습니다. 이를 통해 궁극적으로 실제 비즈니스 현장에서 모델의 역량과 유용성을 높이고자 합니다.

첫 번째 파트너는 AI 기반 계약 분야를 선도하는 Ironclad입니다. Ironclad 팀과 긴밀히 협력해 에이전트가 계약서, 승인 절차, 재사용 가능한 법률 조항을 설정해야 하는 과제를 개발했으며, 이러한 복잡한 워크플로에서 진전을 보여 주었습니다. Ironclad의 전문성은 성공 기준을 정의하고 실제 고객의 요구를 프런티어 모델 개발에 직접 반영하는 데 핵심적인 역할을 했습니다. Ironclad의 협력에 감사드리며, 함께 이룬 성과를 기쁜 마음으로 공유합니다.

GPT‑6 Astra는 Ironclad 과제로 학습한 OpenAI 최초의 프런티어 모델입니다. 연구 평가에서 평균 점수는 GPT‑5.6 Sol보다 32% 높았고, 시도당 예상 소요 시간은 48% 짧았습니다.1

계약 워크플로를 학습 과제로 전환하기

법무 운영팀이 소프트웨어 구매 프로세스를 구축하는 상황을 생각해 보겠습니다. 일정 금액을 넘는 구매에는 재무팀의 승인이, 특정 요청에는 보안팀의 검토가, 비표준 조항에는 법무팀의 검토가 필요할 수 있습니다. 프로세스를 구축하는 담당자는 이 짧은 요구사항 목록을 요청 접수 양식, 문서 템플릿, 승인 규칙, 최종 계약 기록으로 구체화해야 합니다.

같은 업무를 수행하는 AI 에이전트도 소프트웨어 안에서 작업하는 내내 이러한 요구사항을 놓치지 않아야 합니다. 예를 들어 지출 기준액을 초과하면 재무팀의 승인을 받도록 설정하고, 기준액을 초과하는 요청과 그렇지 않은 요청이 각각 올바른 경로로 진행되는지 확인해야 합니다. 개별 단계를 올바르게 처리하는 것만으로는 충분하지 않습니다. 완성된 프로세스는 설계 시 고려한 여러 상황에서 제대로 작동해야 합니다.

Ironclad 직원과 OpenAI 내 Ironclad 사용자들은 연구진이 법무, 영업, 조달 업무 전반에서 11개의 과제를 선정하도록 도왔습니다. 여기에는 비밀유지계약 설정, 조달 승인 프로세스 생성, 요청자가 선택한 관할권이 반영되도록 재사용 가능한 법률 조항을 수정하는 작업 등이 포함되었습니다. 숙련된 사용자가 이 업무를 수행한다면 과제당 평균 약 30~40분이 걸릴 것으로 추정합니다.

각 과제는 복잡도에 따라 8~50개의 기준으로 평가했습니다. 이를 통해 모델이 어떤 부분을 잘 수행했고 어디에서 부족했는지 확인할 수 있었습니다. Ironclad는 모델이 이러한 과제를 연습할 수 있도록 자사 제품의 호스팅된 소프트웨어 환경도 제공했습니다. OpenAI 연구진은 대표적인 워크플로를 중심으로 합성 학습 과제2를 개발하고, 강화학습을 활용해 모델이 연습과 피드백을 통해 개선되도록 했습니다. 업무에 정통한 사람들과 함께 선정한 과제, 상세한 기준, 모델이 연습할 수 있는 환경을 결합함으로써 고객에게 가장 중요한 실제 업무에서 모델의 역량을 개선하고 있습니다.

Astra의 성능

Astra와 GPT‑5.6 Sol을 비교할 때는 각 모델이 가장 높은 점수를 기록한 설정인 Astra의 Max 추론과 Sol의 High 추론을 사용했습니다. 11개 연구용 과제에서 Astra의 평균 점수는 55.0%로 GPT‑5.6 Sol의 41.6%보다 높았으며, 시도당 예상 평균 소요 시간은 Sol의 37.0분에서 Astra의 19.2분으로 줄었습니다.3 Astra 개발에 사용된 내부 모델은 이 과제들에서 63.7%로 더 높은 점수를 달성했으며, 앞으로 출시할 모델에도 이러한 추가 성과를 반영하는 것이 목표입니다.

지표

GPT‑5.6 Sol
High 추론

GPT‑6 Astra
Max 추론

평가 기준에 따른 평균 점수

41.6%

55.0%

시도당 예상 평균 소요 시간

37.0분

19.2분

Astra는 시뮬레이션상 시도당 소요 시간이 더 짧으면서도 더 많은 과제 요구사항을 충족했습니다. 아래 두 영상은 두 모델이 동일한 연구용 과제를 어떻게 처리했는지 보여 줍니다. 첫 번째 영상의 Astra는 약 20분으로 추정되는 시간 안에 과제 기준의 약 94%를 충족했고, 두 번째 영상의 GPT‑5.6 Sol은 약 32분으로 추정되는 시간 안에 약 85%를 충족했습니다.

GPT‑6 Astra는 약 20분으로 추정되는 시간 안에 과제 기준의 약 94%를 충족했습니다.

GPT‑5.6 Sol은 약 32분으로 추정되는 시간 안에 과제 기준의 약 85%를 충족했습니다.

이번 협력이 Ironclad에 갖는 의미

이번 연구에서 Ironclad가 맡은 역할에는 고객들이 잘 아는 과제가 반영되어 있습니다. 계약 프로세스는 기업 운영의 기반이 되는 규칙을 유지하면서도 예외 상황을 처리할 수 있어야 합니다. 에이전트가 작업 도중 이 규칙 중 하나라도 놓친다면, 소프트웨어 기업이 안심하고 맡길 수 있는 업무의 범위는 제한될 수밖에 없습니다. 이는 에이전트의 복잡한 계약 업무 처리 능력이 향상되더라도 사람의 감독이 여전히 중요하고, 계약 업무 전반을 아우르는 플랫폼이 반드시 필요한 이유를 보여 줍니다. Ironclad는 OpenAI 연구진과의 협력을 통해 이러한 문제를 기반 모델의 개발 과정에 반영하고 함께 연구할 수 있습니다.

모델의 역량이 높아질수록 Ironclad는 더 많은 자사 제품에 모델을 활용할 기회를 얻게 됩니다. 법무팀과 사업팀 입장에서는 업무에 필요한 통제 체계를 유지하면서도 복잡한 계약 업무에 드는 수고를 AI에 더 많이 맡길 수 있게 된다는 의미입니다.

“AI가 복잡한 계약 업무에서 실질적인 도움이 되려면 개별 작업을 완료하는 것 이상의 능력이 필요합니다. 에이전트는 각 팀에 필요한 통제 체계를 유지하면서 업무 워크플로가 어떻게 연결되는지를 포함해, 계약의 전체 수명 주기를 이해해야 합니다. OpenAI와의 협력은 이러한 현장의 과제를 연구 과정에 반영하고 기술을 발전시키는 데 도움이 됩니다.”
—수니타 베르마, Ironclad 최고기술책임자

복잡한 전문 업무를 위한 AI 발전에 함께해 주세요

OpenAI는 현재의 에이전트가 아직 안정적으로 완수하지 못하는 중요한 전문 업무를 주제로 연구·엔지니어링 팀과 직접 협력할 소수의 소프트웨어 기업을 모집합니다. 여러분의 팀에 그런 업무가 있다면 구체적인 사례를 알려 주세요. 에이전트에 어떤 일을 맡기는지, 어디서 실패하는지 보여 주는 근거는 무엇인지, 성공적인 결과를 어떤 기준으로 판단하는지 궁금합니다. 파트너사는 해당 업무에 정통한 인력, 보안이 확보된 테스트 환경, 연구에 안전하게 활용할 수 있는 데이터도 제공할 수 있어야 합니다. 이는 실패 원인을 조사하고 모델의 개선 여부를 측정하는 출발점이 됩니다.

이러한 조건에 부합하는 팀이라면 연구 협력 신청을 통해 가능성을 함께 모색해 보세요.

작성자

OpenAI

각주

  1. 1

    이 결과는 연구용 과제 11개에 대한 것으로, Ironclad의 모든 워크플로를 대상으로 한 것은 아닙니다. 소요 시간은 모델의 처리 및 생성 속도를 가정해 시뮬레이션한 추정치이며, 고객의 실제 시간 절감 효과를 측정한 값이 아닙니다.

  2. 2

    미국 증권거래위원회(SEC)의 EDGAR 데이터베이스에 공개된 계약서에 개인정보 제거용 필터를 적용한 뒤, 이를 바탕으로 모의 과제를 만들었습니다. 학습이나 평가에는 OpenAI 고객 데이터, OpenAI 내부 계약서, 비공개 Ironclad 고객 데이터 또는 계약서를 사용하지 않았습니다.

  3. 3

    위의 연구 평가 관련 각주를 참조하세요.