OpenAI는 GPT‑6 Astra를 소개하면서 문서 작성부터 웹사이트 테스트까지, 컴퓨터로 전문 업무를 수행하는 모델의 역량이 얼마나 발전했는지 보여 드렸습니다. 다음 목표는 에이전트가 전문 소프트웨어를 활용해 복잡한 비즈니스 문제를 해결하는 능력과 효율성을 높이는 것입니다. 이를 위해 모델이 기업의 업무 규칙을 이해하고, 여러 단계의 워크플로를 실행하며, 작업 결과가 당초 요구사항을 충족하는지 검증하도록 학습시키는 방법을 모색하고 있습니다.
이 연구에 속도를 내기 위해 해당 워크플로를 가장 잘 이해하는 소수의 소프트웨어 기업과 직접 협력하고 있습니다. 파트너사와 함께 난도가 높고 가치 있는 업무를 찾아 모델 학습과 평가를 위한 연구 과제로 만들고 있습니다. 이를 통해 궁극적으로 실제 비즈니스 현장에서 모델의 역량과 유용성을 높이고자 합니다.
첫 번째 파트너는 AI 기반 계약 분야를 선도하는 Ironclad입니다. Ironclad 팀과 긴밀히 협력해 에이전트가 계약서, 승인 절차, 재사용 가능한 법률 조항을 설정해야 하는 과제를 개발했으며, 이러한 복잡한 워크플로에서 진전을 보여 주었습니다. Ironclad의 전문성은 성공 기준을 정의하고 실제 고객의 요구를 프런티어 모델 개발에 직접 반영하는 데 핵심적인 역할을 했습니다. Ironclad의 협력에 감사드리며, 함께 이룬 성과를 기쁜 마음으로 공유합니다.
GPT‑6 Astra는 Ironclad 과제로 학습한 OpenAI 최초의 프런티어 모델입니다. 연구 평가에서 평균 점수는 GPT‑5.6 Sol보다 32% 높았고, 시도당 예상 소요 시간은 48% 짧았습니다.1
법무 운영팀이 소프트웨어 구매 프로세스를 구축하는 상황을 생각해 보겠습니다. 일정 금액을 넘는 구매에는 재무팀의 승인이, 특정 요청에는 보안팀의 검토가, 비표준 조항에는 법무팀의 검토가 필요할 수 있습니다. 프로세스를 구축하는 담당자는 이 짧은 요구사항 목록을 요청 접수 양식, 문서 템플릿, 승인 규칙, 최종 계약 기록으로 구체화해야 합니다.
같은 업무를 수행하는 AI 에이전트도 소프트웨어 안에서 작업하는 내내 이러한 요구사항을 놓치지 않아야 합니다. 예를 들어 지출 기준액을 초과하면 재무팀의 승인을 받도록 설정하고, 기준액을 초과하는 요청과 그렇지 않은 요청이 각각 올바른 경로로 진행되는지 확인해야 합니다. 개별 단계를 올바르게 처리하는 것만으로는 충분하지 않습니다. 완성된 프로세스는 설계 시 고려한 여러 상황에서 제대로 작동해야 합니다.
Ironclad 직원과 OpenAI 내 Ironclad 사용자들은 연구진이 법무, 영업, 조달 업무 전반에서 11개의 과제를 선정하도록 도왔습니다. 여기에는 비밀유지계약 설정, 조달 승인 프로세스 생성, 요청자가 선택한 관할권이 반영되도록 재사용 가능한 법률 조항을 수정하는 작업 등이 포함되었습니다. 숙련된 사용자가 이 업무를 수행한다면 과제당 평균 약 30~40분이 걸릴 것으로 추정합니다.
각 과제는 복잡도에 따라 8~50개의 기준으로 평가했습니다. 이를 통해 모델이 어떤 부분을 잘 수행했고 어디에서 부족했는지 확인할 수 있었습니다. Ironclad는 모델이 이러한 과제를 연습할 수 있도록 자사 제품의 호스팅된 소프트웨어 환경도 제공했습니다. OpenAI 연구진은 대표적인 워크플로를 중심으로 합성 학습 과제2를 개발하고, 강화학습을 활용해 모델이 연습과 피드백을 통해 개선되도록 했습니다. 업무에 정통한 사람들과 함께 선정한 과제, 상세한 기준, 모델이 연습할 수 있는 환경을 결합함으로써 고객에게 가장 중요한 실제 업무에서 모델의 역량을 개선하고 있습니다.
Astra와 GPT‑5.6 Sol을 비교할 때는 각 모델이 가장 높은 점수를 기록한 설정인 Astra의 Max 추론과 Sol의 High 추론을 사용했습니다. 11개 연구용 과제에서 Astra의 평균 점수는 55.0%로 GPT‑5.6 Sol의 41.6%보다 높았으며, 시도당 예상 평균 소요 시간은 Sol의 37.0분에서 Astra의 19.2분으로 줄었습니다.3 Astra 개발에 사용된 내부 모델은 이 과제들에서 63.7%로 더 높은 점수를 달성했으며, 앞으로 출시할 모델에도 이러한 추가 성과를 반영하는 것이 목표입니다.
지표 | GPT‑5.6 Sol | GPT‑6 Astra |
평가 기준에 따른 평균 점수 | 41.6% | 55.0% |
시도당 예상 평균 소요 시간 | 37.0분 | 19.2분 |
Astra는 시뮬레이션상 시도당 소요 시간이 더 짧으면서도 더 많은 과제 요구사항을 충족했습니다. 아래 두 영상은 두 모델이 동일한 연구용 과제를 어떻게 처리했는지 보여 줍니다. 첫 번째 영상의 Astra는 약 20분으로 추정되는 시간 안에 과제 기준의 약 94%를 충족했고, 두 번째 영상의 GPT‑5.6 Sol은 약 32분으로 추정되는 시간 안에 약 85%를 충족했습니다.
GPT‑6 Astra는 약 20분으로 추정되는 시간 안에 과제 기준의 약 94%를 충족했습니다.
GPT‑5.6 Sol은 약 32분으로 추정되는 시간 안에 과제 기준의 약 85%를 충족했습니다.
이번 연구에서 Ironclad가 맡은 역할에는 고객들이 잘 아는 과제가 반영되어 있습니다. 계약 프로세스는 기업 운영의 기반이 되는 규칙을 유지하면서도 예외 상황을 처리할 수 있어야 합니다. 에이전트가 작업 도중 이 규칙 중 하나라도 놓친다면, 소프트웨어 기업이 안심하고 맡길 수 있는 업무의 범위는 제한될 수밖에 없습니다. 이는 에이전트의 복잡한 계약 업무 처리 능력이 향상되더라도 사람의 감독이 여전히 중요하고, 계약 업무 전반을 아우르는 플랫폼이 반드시 필요한 이유를 보여 줍니다. Ironclad는 OpenAI 연구진과의 협력을 통해 이러한 문제를 기반 모델의 개발 과정에 반영하고 함께 연구할 수 있습니다.
모델의 역량이 높아질수록 Ironclad는 더 많은 자사 제품에 모델을 활용할 기회를 얻게 됩니다. 법무팀과 사업팀 입장에서는 업무에 필요한 통제 체계를 유지하면서도 복잡한 계약 업무에 드는 수고를 AI에 더 많이 맡길 수 있게 된다는 의미입니다.
OpenAI는 현재의 에이전트가 아직 안정적으로 완수하지 못하는 중요한 전문 업무를 주제로 연구·엔지니어링 팀과 직접 협력할 소수의 소프트웨어 기업을 모집합니다. 여러분의 팀에 그런 업무가 있다면 구체적인 사례를 알려 주세요. 에이전트에 어떤 일을 맡기는지, 어디서 실패하는지 보여 주는 근거는 무엇인지, 성공적인 결과를 어떤 기준으로 판단하는지 궁금합니다. 파트너사는 해당 업무에 정통한 인력, 보안이 확보된 테스트 환경, 연구에 안전하게 활용할 수 있는 데이터도 제공할 수 있어야 합니다. 이는 실패 원인을 조사하고 모델의 개선 여부를 측정하는 출발점이 됩니다.
이러한 조건에 부합하는 팀이라면 연구 협력 신청을 통해 가능성을 함께 모색해 보세요.
작성자
각주
- 1
- 2
- 3


