우리는 AGI가 인류 전체에 혜택을 주려면 민주적으로 관리되어야 한다고 믿습니다. 이는 뛰어난 능력을 갖춘 AI 시스템의 역량과 위험, 안전장치에 대해 충분한 정보를 바탕으로 한 공개 논의가 이루어질 때에만 실현될 수 있습니다. 전 세계 사람들이 프런티어 AI가 앞으로 어떻게 발전해 나갈지 이해해야, AI 개발 방식에 대해 의미 있는 목소리를 낼 수 있습니다.
특정 위험과 사고, 안전장치에 대한 투명성은 필요하지만 그것만으로는 충분하지 않습니다. 대중도 가장 뛰어난 역량을 갖춘 시스템이 프런티어 연구소 내부에서 어떻게 발전하고 있는지, 그리고 그러한 시스템이 연구 진전을 어떻게 이끌고 있는지 이해할 필요가 있다고 생각합니다.
우리의 목표는 인간의 감독 아래 작동하면서 딥러닝과 정렬 분야의 진전을 이루고 반복적인 개선을 가능하게 하는 자동화된 AI 연구원을 안전하게 구축하는 것입니다. 자체 측정 결과, 지난가을에 발표했던(새 창에서 열기) ‘올해 9월까지 자동화된 연구 인턴을 확보한다’는 목표를 이제 달성했습니다. ‘연구 인턴’이란 사람의 지시에 따라 명확히 정의된 연구 작업을 수행할 수 있는 시스템을 말하며, 여기에는 숙련된 연구원도 며칠이 걸릴 만한 작업이 포함됩니다. 2028년 3월까지 자동화된 AI 연구원을 개발한다는 목표를 향해 큰 진전을 이루고 있습니다.
올 한 해 동안 OpenAI 연구원의 일상 업무는 크게 달라졌습니다. 연구원은 코딩 에이전트를 하루 종일 사용하고 있으며, 여러 세션을 동시에 실행하는 경우도 많습니다. 전체 사용량도 가파르게 늘어 OpenAI 내 다른 팀의 증가세를 앞지르고 있습니다. 연구원이 코드를 더 빠르게 작성하고, 더 많은 실험을 수행하고 있습니다. 연구원이 에이전트를 활용하는 방식도 달라지고 있습니다. 에이전트는 갈수록 복잡한 작업을 처리하고 있으며, 이를 성공적으로 완수하는 경우도 점점 늘고 있습니다. AI 연구는 잠재적 병목이 많은 복잡한 과정이므로, 전반적인 발전 속도가 이러한 개별 지표만큼 빠르지는 않을 것입니다. 다만 전체적으로 보면, 이러한 결과는 에이전트 도구가 연구 진전 속도를 유의미하게 높이고 있다는 사내 다수의 인식과도 일치합니다. 여전히 사람이 우리의 연구 우선순위를 정하고, 어떤 아이디어와 결과를 더 발전시킬지 판단하며, 시스템을 확장할지 일시 중단할지 배포할지를 결정합니다.
책임감 있게 추진한다면 자동화된 AI 연구가 인류의 복지를 직접 증진하고 OpenAI의 사명 실현을 앞당기는 모델을 만들어 낼 것이라고 믿습니다. 이를 통해 고도화된 지능의 비용을 낮춰 전 세계 사람들이 그 혜택을 누릴 수 있습니다. 우리가 이 작업을 추진하는 이유 중 하나는 자동화된 연구가 정렬 문제를 해결하고 점점 더 뛰어난 역량을 갖춘 AI에 대한 방어 체계를 구축하는 데 도움이 될 수 있기 때문입니다. 자동화된 AI 연구원은 자동화된 안전 연구원이나 정렬 연구원의 역할도 수행할 수 있습니다. 역량이 더 뛰어나고 정렬된 시스템은 핵심 인프라를 보호하고, 위험한 AI 에이전트를 막아 내며, 새로운 보호 조치를 개발하는 데 도움이 될 수 있습니다.
이러한 점은 실제로 도움이 되는 자동화된 연구 역량을 개발해야 할 이유가 되기는 하지만, 그렇다고 빠른 RSI(재귀적 자기 개선)가 반드시 우리가 지향해야 할 결과라는 뜻은 아닙니다. 진행 여부와 그 방식은 인간의 통제력을 유지할 수 있는 우리의 역량, 그리고 이점과 위험을 충분히 이해한 상태에서 이루어지는 민주적 선택에 따라 결정되어야 합니다.
정렬되고 완전한 RSI에 안전하게 도달하는 방법은 아직 알지 못합니다. 우리는 역량이 향상되는 속도에 맞춰 정렬 및 안전 조치도 함께 확대해 나가고 있습니다. 그러나 정렬과 안전 분야의 진전이 역량 발전 속도를 따라갈 것이라고 단정할 수는 없으며, 시스템은 역량이 강해질수록 모니터링하기가 더 어려워질 수 있습니다. 이러한 노력의 중심에는 세심한 정렬 및 안전 작업이 있으며, 그 출발점은 오늘날 에이전트 기반 코딩 시스템에서 나타나는 안전 문제를 측정하고 완화하는 일입니다. 계속 진행하는 것이 용인할 수 없는 안전상 위험을 초래한다고 판단될 경우, 우리는 안전을 충분히 보장할 수 없다고 판단되는 시스템의 개발이나 배포를 늦추거나 중단하는 등 적절한 조치를 취할 것입니다.
최근 Hugging Face 사건 이후 우리는 이 약속을 행동으로 옮겼습니다. 배포를 목적으로 하는 최신 모델의 강화학습(RL)을 일시 중단하고, 그동안 연구 환경을 한층 강화하고 레드팀 테스트를 실시했으며 모니터링 시스템의 적용 범위도 넓혔습니다. 이로 인해 모든 연구가 멈춘 것은 아닙니다. 일부 워크로드는 더 강화된 통제 아래 재개되었고, 나머지는 그대로 중단된 상태였습니다. 우리는 안전 및 정렬 기준을 한층 강화하고 안전 관련 작업을 모델 수명 주기에 더 깊이 통합했으며, 학습 전 과정에서 정렬된 행동을 뒷받침하는 더 강력한 증거를 확보하도록 요건을 높였습니다.
오늘 우리는 최근 몇 달간 에이전트 시스템이 RSI를 향한 진전에 어떻게 기여했는지를 상세히 정리해 공유합니다. 에이전트 시스템은 새롭고 빠르게 변화하고 있으며, 이를 측정하는 방법 역시 아직 초기 단계입니다. 이러한 초기 결과와 그 바탕이 되는 방법론을 공유해 대중에게 정보를 알리고, 정보 공개가 규범으로 자리 잡도록 장려하며, 이 분야가 공통의 측정 표준으로 나아가도록 돕고자 합니다.
궁극적으로는 프런티어 정책 청사진에서 밝힌 바와 같이, 우리를 포함한 기업들이 RSI를 향한 진척 상황을 공개적으로 추적하도록 의무화해야 한다고 봅니다. 그러한 요구 사항이 없더라도 RSI 진행 상황은 앞으로도 투명하게 공개할 계획입니다. 우리는 보안과 기밀 정보를 보호해야 할 필요성을 함께 고려하면서, 측정 기법과 이해도가 높아지는 만큼 투명성에 대한 접근 방식도 계속 발전시켜 나가겠습니다.
올해 초 OpenAI에서 에이전트 사용량 기준 중앙값에 해당하는 연구원은 코딩 에이전트를 그리 많이 사용하지 않았습니다. 8월 중순 무렵 중앙값에 해당하는 연구원은 에이전트를 매일 업무에 활용했고, API 가격 기준으로 하루 600달러어치가 넘는 추론을 사용하고 있었습니다. 현재 우리 연구 조직에서 90번째 백분위수에 해당하는 사용자는 하루에 7,000달러어치가 넘는 토큰을 사용합니다.
2026년 6월 이전에는 연구 조직 전체의 에이전트 실행 시간 총합이 여전히 인간의 총 노동 시간에 미치지 못했습니다. 그 이후로 상황이 달라졌습니다. 8월 중순 현재, 연구 조직은 표준 8시간 근무일을 기준으로 인간 노동 1근무일당 총 3.1 에이전트 근무일에 해당하는 작업량을 활용하고 있습니다.
이를 살펴보는 또 다른 방법은 동시성이 높은 워크플로(예: 에이전트 4개 이상 동시 실행)를 사용하는 연구원이 얼마나 되는지 파악하는 것입니다. 아래에서 확인할 수 있듯이 이 수치는 증가하고 있습니다. 이 수치에는 사용자가 직접 실행한 에이전트와 그로부터 파생된 서브에이전트의 일일 최대치가 모두 포함됩니다.
AI 연구의 상당 부분은 노동 집약적인 과정으로, 모델의 지능이나 성능을 새롭게 개선한 요소를 우리 핵심 모델 가운데 하나에 반영하는 것을 목표로 합니다. 이 과정은 여러 단계로 이루어지며, 모든 단계가 제대로 맞물려 돌아갈 때 비로소 역량이 발전합니다. 연구원은 새로운 개선 사항을 설계하고, 모델 성능을 판단할 평가를 작성하며, 이러한 개선 사항을 대규모로 테스트할 인프라를 구축하고, 학습 중 발생하는 버그는 물론 안전하지 않거나 정렬되지 않은 행동까지 잡아내며, 성공적인 아이디어를 핵심 학습 과정에 통합해야 합니다. 연구 과정 중 어느 한 단계에서라도 실패가 발생하면 루프 전체가 제약을 받을 수 있습니다.
코드 작성과 실험 수행은 연구원이 업무에서 맡는 두 가지 핵심 활동으로, 이러한 과정이 빨라지고 있다는 증거가 확인되고 있습니다.
이러한 지표는 측정하기는 비교적 쉽지만, 해석하기는 어려울 수 있습니다. 자동화가 진행될수록 자동화하기 가장 어려운 작업이 연구원이 들이는 노력에서 차지하는 비중이 커지고, 앞으로의 발전을 가로막는 주요 병목이 될 것입니다. 컴퓨팅 역시 발전을 제약하는 요인이며, 시간이 지나 다른 병목이 해소될수록 그 중요성은 더욱 커질 수 있습니다.
2026년 내내 활성 실험자 1인당 실험 횟수가 증가했으며, 2026년 8월에는 2025년 1월 추적을 시작한 이후 역대 최고치를 기록했습니다. 이는 Codex 도입 증가와 상관관계가 있습니다. 다만 2025년 이후 우리의 가용 컴퓨팅도 크게 늘었다는 점을 함께 밝혀 둡니다.
현장에서 느끼는 체감과 내부 데이터 모두 연구원이 코딩 에이전트에 맡기는 작업의 구성이 달라지고 있음을 보여 줍니다. 시간이 지날수록 수준이 더 높고 시간 범위가 더 긴 작업을 맡기는 사례가 점차 보편화되고 있습니다.
이러한 추세를 더 명확히 파악하기 위해, Epoch AI가 개발해 최근 발표한 AI R&D 수명 주기 전반의 작업 유형 분류 체계(새 창에서 열기)를 바탕으로 연구 조직의 최근 사용 현황을 분석했습니다. 이 분류 체계는 오랫동안 다양한 직무를 분류해 온 O*NET 시스템에서 착안한 것으로, 프런티어 AI R&D에 특화되도록 설계되어 그 과정을 다음 6가지 주요 단계로 나눕니다.
결정: 어떤 작업을 진행할지, 무엇을 계속할지, 자원을 어디에 배분할지
설계: 연구 아이디어 및 기술 명세
구축: 코드 및 데이터셋
실행: 학습/평가 실행, 하드웨어, 서빙
분석: 실험, 모델, 배포, 외부 작업
소통: 발견 사항, 피드백, 진행 상황, 결정 사항
아래에서는 이 분류 체계에 따라 코딩 에이전트 토큰을 분류합니다.
2026년 1월부터 8월까지 모든 범주의 연구 활동이 증가한 것을 확인할 수 있습니다. 1월에는 연구와 인프라 코드가 주요 범주였습니다. 이 범주는 확대되었으나, 특히 기술 지원과 실행 모니터링을 비롯한 다른 범주에서도 뚜렷한 증가세가 나타났습니다. 상위 수준의 계획은 여전히 에이전트가 내놓는 출력 토큰 중 미미한 비중만 차지합니다.
동료들의 경험담에 따르면 코딩 에이전트는 내부 연구 인프라 문제를 해결하는 데 탁월하며, 이는 연구 진전의 중요한 병목 가운데 하나를 해소합니다. 연구원이 실험 문제를 해결하도록 돕기 위해 오피스 아워를 운영해 온 여러 팀은 2026년 들어 참석자가 줄어드는 것을 확인했고, 그중 한 팀은 세션 운영을 아예 중단하고 대신 다른 시스템 개선에 집중하기로 했습니다.
여기서는 연구원이 다른 팀에 기술 지원을 요청하는 주요 내부 채널 중 한 곳의 일별 원글 수를 그래프로 나타냈습니다. 우리가 파악한 바로는, 해당 채널의 활동이 줄어든 것은 문의가 사람이 응대하는 다른 기술 지원 채널로 옮겨 갔기 때문이 아닙니다. 트래픽 감소는 이러한 전반적인 변화와 궤를 같이합니다.
또한 코딩 에이전트가 연구원이 요청한 작업을 성공적으로 수행하고 있는지도 살펴볼 수 있습니다. 에이전트 기반 분류기로 분석한 결과, 1월부터 7월까지 실제 결과를 확인할 수 있는 작업에서는 여러 난이도 구간(사람이 해당 작업을 완료하는 데 걸릴 것으로 예상되는 시간을 대리 지표로 사용)에 걸쳐 성공률이 전반적으로 높아졌습니다. 그러나 에이전트가 성과를 내려면 여전히 사람이 상당 부분 방향을 잡아 주어야 하며, 작업이 복잡할수록 더욱 그렇습니다. 지난 6개월간 성공적으로 완료된 4~8시간 규모의 작업 중 절반 이상은 한 번 이상 개입을 거쳤습니다.
연구원 작업의 성공률은 시간이 지날수록 높아졌습니다. 이 그래프에서는 결과가 불확실한 분류와 세션 수 50개 미만 또는 고유 사용자 수 50명 미만인 데이터 포인트를 제외했습니다.
작업 시간 범위별로 분류한 1월부터 7월까지의 작업 성공률 및 개입률. 결과가 불확실한 분류 항목은 제외했습니다.
안전하고 유익한 AGI를 위해 더 뛰어난 역량을 갖춘 시스템으로 나아가는 과정은 그러한 작업에 필요한 안전장치를 얼마나 갖추느냐에도 좌우됩니다. 위험을 더 깊이 이해하게 될수록 어떤 안전장치가 필요한지에 대한 판단도 달라질 수 있습니다.
앞서 설명한 대로 모니터링, 정렬, 보안에 관한 기준을 최근 업데이트했습니다. 여기서는 최근의 제한 조치가 연구 활동의 한 측면에 어떤 영향을 미쳤는지 보여 줍니다.
*여기서 7월 20일부터 8월 6일까지 표시된 Astra 컴퓨팅은 대부분 안전 및 보안 개선 사항 구현을 테스트하기 위한 것이었습니다.
7월 20일, 에이전트가 연구 인프라를 침해한 사실을 확인한 뒤 학습에 사용하던 컨테이너 서비스를 일시 중단했고, 이후 상당한 수준의 추가 제한을 적용해 복구했습니다.
그 결과 각 팀이 강화된 연구 환경에서 작업할 수 있도록 워크플로를 재구성하는 동안 RL 학습용 컴퓨팅이 급감했습니다. 위 그래프에는 배포를 목적으로 개발 중인 OpenAI 최신 모델의 강화학습을 2주간 일시 중단한 기간이 포함되어 있습니다. 7월 20일부터 8월 6일까지 진행된 Astra급 RL 실험에서는 대부분의 실행(GPU 할당 기준)이 안전 및 보안 개선 사항 구현을 테스트하기 위한 것이었습니다.
8월 7일에는 Astra가 중대한 사이버 역량을 갖췄을 가능성을 보여 주는 예비 증거가 준비성 평가 프레임워크(새 창에서 열기)에 따른 검토에서 나왔습니다. 이에 따라 모델별 보안 제한이 추가로 시행되어 Astra 모델을 보안 수준이 더 높은 연구 환경에서 실행해야 했습니다. 그다음 주에는 Astra급 모델에 배정된 GPU 할당이 59.2% 더 감소한 반면, 다른 모델 클래스의 할당은 17.2% 증가했습니다. 이러한 증가로 Astra급 감소분의 약 85%가 상쇄되면서, 분석 대상 RL 워크로드의 전체 할당은 거의 그대로 유지되었습니다. 이러한 패턴은 Astra 관련 작업이 제한된 기간에 일부 학습과 실험을 Astra 외 모델로 옮겨 진행한 양상과 맞아떨어지며, 새 제약이 적용된 워크로드에 더는 쓸 수 없게 된 컴퓨팅을 연구원이 다른 용도로 활용했다는 경험담과도 일치합니다.
이 데이터는 학습과 안전에 관해 진행 중인 논의에 유용한 시사점을 제공합니다. 새로운 통제 조치가 도입되더라도 컴퓨팅은 여전히 가치가 높고 유연하게 쓸 수 있어, 연구 조직 안에서 자연스럽게 다른 용도에 투입됩니다. 장기적으로는 AI 발전 속도에 관한 논의의 범위도 넓어져야 합니다. 새로 도입되었거나 도입이 제안된 통제 조치가 적용되는 컴퓨팅을 어떻게 가장 잘 활용할 것인지까지 함께 다뤄야 합니다.
정렬된 RSI를 향해 진전을 이루고 그 진척 상황을 파악하는 일은 우리 사명을 이루는 데 중요합니다. 우리는 방법론을 지속적으로 정교화하고, 새로 이해한 내용을 공유하며, 프런티어 시스템을 둘러싼 충분한 정보에 기반한 공개 논의와 의미 있는 민주적 거버넌스가 이루어지도록 노력하겠습니다.
에이전트 기반 AI 연구는 아직 초기 단계이며, 우리도 이를 어떻게 측정할지 알아가는 중입니다. 우리 연구 팀이 작성하는 코드의 양처럼 비교적 쉽게 수집할 수 있는 지표도 있지만, 이런 지표는 연구 진전과 어떤 관계가 있는지 분명하지 않아 해석하기가 어렵습니다. 연구 진전을 더 직접적으로 보여 주는 지표, 예를 들어 에이전트가 연구원이 맡긴 작업을 얼마나 자주 성공적으로 완수하는지 같은 지표는 더 유용할 수 있지만, 개발하고 검증하기가 복잡합니다. 연구원이 의존하는 도구와 시스템이 빠르게 발전하고 있다는 점도 어려움을 더합니다. 연구 가속화에 대한 우리의 이해를 심화하는 일은 OpenAI 전반에서 중요하게 다루는 과제입니다.
본 분석 전반에서 별도로 명시하지 않는 한,
‘연구원’은 우리 연구 조직에 속한 모든 구성원을 폭넓게 가리키는 표현으로, 연구 인프라를 구축하거나 연구 프로젝트를 관리하는 인력, 그 밖의 방식으로 조직 전반을 지원하는 인력도 여기에 포함됩니다.
연구원이 의존하는 도구와 시스템이 빠르게 발전하고 있는 만큼, 코딩 에이전트 사용 지표는 전체 사용량은 아니지만 대부분을 포괄합니다.


