지난 몇 주간 두 가지 상황이 전개되면서, 갈수록 강력해지는 AI 시스템과 관련된 위험이 커지고 있음을 확인했습니다. 하나는 OpenAI-Hugging Face 사고이며, 다른 하나는 출시 예정 모델 중 하나인 Astra가 OpenAI의 준비성 평가 프레임워크에 따라 핵심 사이버 보안 역량 기준을 충족할 수 있다는 예비 증거입니다. 이러한 상황과 내부 연구의 빠른 진전으로 인해, 훈련 과정의 모든 단계에서 모니터링과 정렬, 격리 보호 조치를 강화하는 일이 더욱 시급해졌습니다.
모델의 역량이 강해질수록 이를 내부에서 개발하고 테스트하는 데 따르는 위험도 커집니다. 모니터링, 정렬, 보안에 관한 OpenAI의 기준은 이러한 위험을 앞서 나가야 합니다. 우리는 이러한 기준을 충족하는 데 필요한 시간을 확보하고자 확장 속도를 일시적으로 늦췄습니다. 그 일환으로 연구 환경의 보안을 한층 강화하고 레드팀 테스트를 진행하는 한편 모니터링 시스템의 적용 범위를 확대하면서, 배포 예정인 최신 모델의 강화학습(RL) 훈련을 2주간 중단했습니다. 계획된 최대 규모의 프런티어 RL 훈련은 계속 보류하고 있습니다. 그동안 소규모 훈련과 평가를 통해 모델의 행동을 평가하고 보호 조치를 검증하며, 진행에 앞서 정렬에 관한 더 많은 증거를 확보하고 있습니다.
AI 시스템이 의도대로 작동하고 인간의 감독에 적절히 대응하도록 만드는 작업인 정렬은 오랫동안 OpenAI 연구 프로그램의 핵심이었습니다. 이미 진행 중인 연구와 평가를 토대로, 이제 우리는 훈련 전 과정에서 정렬된 행동에 관한 더욱 확실한 증거를 요구하고 있습니다. 갈수록 강력해지는 시스템들을 정렬 상태로 유지하는 일은 AI 분야 전체가 해결해야 할 과제입니다. 출시 예정 모델의 발전 과정에서 나타나는 신호를 보면, 현행 준비성 평가 프레임워크를 토대로 하되 그 범위를 넘어서는 더 폭넓은 접근 방식이 필요하다는 점이 분명합니다.
OpenAI는 접근 방식이 어떻게 바뀌고 있는지 투명하게 공개하는 것이 중요하다고 생각합니다. 아래에서는 연구 절차와 인프라에 이미 적용한 변경 사항과 현재 진행 중인 작업을 설명합니다.
더 강력한 모델을 개발하기 위한 OpenAI의 접근 방식은 서로 보완하는 세 가지 보호 조치를 기반으로 합니다.
- 우려되는 행동을 감지하고 이에 대응할 수 있게 해주는 모니터링.
- 유해하거나 승인되지 않은 행동의 가능성을 줄이는 정렬.
- AI 시스템이 접근하거나 영향을 미칠 수 있는 범위를 제한하는 보안 조치.
다른 모델에 대한 방어를 포함해 대부분의 보안 업무를 곧 모델이 주도할 것으로 예상합니다. 이를 통해 세 가지 보호 조치를 모두 모델 역량에 맞춰 확장할 수 있으며, OpenAI는 이를 매우 중요하게 보고 있습니다.
이러한 보호 조치를 연구와 배포 전반에 적용하고 각 모델의 역량, 운영 환경, 위험 수준에 맞게 조정합니다.
프런티어 모델의 사이버 보안 역량이 강해짐에 따라, OpenAI는 모델을 훈련하고 평가하는 환경의 보안 기준을 높이고 있습니다. 이러한 기준을 충족하려면 상당한 엔지니어링 작업이 필요하며, 프런티어 연구에도 큰 비용과 지연이 발생했습니다. OpenAI-Hugging Face 사고* 직후, 우리는 코드를 실행하거나 인터넷에 접근할 수 있는 도구를 사용하는 연구 클러스터 작업에 대해 프런티어 모델 추론을 중단했습니다. 이후 더 제한적이고 안전한 코드 실행 경로를 비교적 빠르게 복구한 다음, 각 워크로드를 개별적으로 검토해 안전하게 재개할 수 있는지 판단했습니다. 일부 연구 워크로드는 새로운 통제 조치 아래 재개했지만, 나머지는 추가 변경이 필요했습니다.
그 후 몇 주에 걸쳐 프런티어 연구 워크로드에 적용할 더욱 엄격한 보안 요건을 정하고 구현하기 시작했습니다. 예를 들면 다음과 같습니다.
- 워크로드 격리: 이제 모델이 생성한 코드나 그 밖의 신뢰할 수 없는 코드를 실행하는 워크로드에 더욱 강력한 격리 환경(‘샌드박스’)을 요구합니다. 이는 모델 출력을 처리하는 동안 침해될 수 있는 소프트웨어에도 적용됩니다.
- 네트워크 격리: 위험도가 높거나 신뢰할 수 없는 워크로드를 인터넷에서 격리하기 위한 통제 조치를 확대했습니다. 워크로드나 지원 서비스 하나가 침해되더라도 그것만으로 인터넷이나 다른 내부 네트워크에 무단으로 접근할 수 없도록 이러한 통제 조치를 설계했습니다.
- 지속적인 보안 테스트: 잠재적으로 취약한 공유 서비스를 제거하고 상시 권한을 축소하며 보안 및 신뢰 경계를 강화하도록 환경을 재구성했습니다. 보안 로그를 수집하고 모니터링하는 역량도 개선하고 있습니다. 마지막으로 모델을 활용한 자동화에 투자해, 모의 공격으로 이러한 경계를 지속적으로 테스트하고 있습니다.
이러한 통제 조치들은 함께 심층 방어 체계를 이루어 공격으로부터 연구 환경을 보호하는 데 도움이 됩니다. Astra 모델이 핵심 수준의 사이버 역량을 갖췄을 가능성이 있다는 판단 아래, 이제 Astra 또는 사이버 모델과 관련된 워크로드에 가장 엄격한 수준의 보안 조치를 요구합니다. 이러한 보호 조치는 그 밖의 모든 사이버 관련 워크로드에도 적용됩니다.
일부 Astra 훈련과 평가는 해당 요건을 충족하지만, 상당수 워크로드는 전체 마이그레이션을 완료하고 새로운 보안 기준에 맞춰 강화할 때까지 중단 상태를 유지합니다. 안전 및 정렬 워크로드를 이러한 새 환경으로 우선 이전하고 있습니다.
모니터링은 오랫동안 모델 개발 과정에서 중요한 역할을 해왔으며, 여기에는 내부 코딩 에이전트 모니터링과 장시간 실행 세션도 포함됩니다. 모니터링은 특히 프런티어 모델의 내부 배포와 프런티어 RL 훈련 작업에 집중했습니다. 고도화된 모델 역량에 도구, 민감한 시스템, 내부 또는 외부 네트워크 접근 권한이 결합될 수 있어 위험도가 가장 높은 워크로드라고 판단했기 때문입니다. 도구를 사용하는 모든 추론 및 훈련 작업에 적용되지는 않았습니다. 새로운 모니터링 체계를 도입하면서 접근 방식을 개편하고 확대했습니다.
새로운 모니터링 체계는 여러 단계로 이루어집니다. 샘플링된 모든 토큰마다 활성화 분류기(모델의 내부 활동을 검사하는 감지기)가 작동하고, 잠재적 우려 사항을 갈수록 정교하고 많은 연산을 사용하는 자동 조사 시스템으로 넘깁니다. 이러한 시스템은 도구 사용 행동, 확인 가능한 추론, 전체 활동 순서를 조사해 무단 접근, 데이터 절도, 파괴적 행동, 보호 조치 무력화 시도를 찾아냅니다. 모니터링 시스템에서 우려되는 활동을 포착한 후 30분 이내에 경보를 발령하는 것이 목표입니다. 모니터링 시스템이 핵심 보안 경계 위반 가능성을 식별하는 경우, 최고 우선순위 경보가 생성됩니다. 현재 구현에서는 안전, 보안, 연구팀에 긴급 호출이 전송됩니다. 해당 표시가 오탐이라고 30분 이내에 확실히 판단하지 못하면 관련 팀은 해당 활동을 중단해야 합니다.
이 모니터링은 Sol급 이상의 역량을 지닌 모델이 도구를 사용하는 모든 RL 훈련 및 평가에 필수입니다. 8월 7일 Astra가 핵심 사이버 역량을 갖췄을 가능성이 있다고 판단한 후, RL 훈련과 평가뿐 아니라 도구를 사용하는 모든 Astra 추론에도 추가 모니터링 요건을 적용했습니다.
이러한 보호 조치에는 상당한 연산 자원이 필요합니다. 현재 추산으로는 모니터링 오버헤드가 대상 추론 연산량의 약 20%에 달하지만, 비용은 훈련 및 평가 워크로드에 따라 크게 달라집니다. 이 시스템에 관한 자세한 내용은 곧 게시할 블로그 글에서 공유하겠습니다.
정렬 연구는 OpenAI의 사명에서 핵심적인 역할을 합니다. OpenAI의 사명은 범용 인공지능이 모든 인류에게 혜택을 주도록 하는 것입니다. 모델이 사이버 공격 능력 같은 고급 역량을 확보하고 더 복잡한 환경에서 작동하게 되면, 보상 해킹(의도한 결과를 실제로 달성하지 않고도 훈련에서 높은 보상을 받을 방법을 찾는 행위), 기만, 무단 접근과 같은 정렬되지 않은 행동이 갈수록 심각한 위험을 초래합니다.
가장 강력한 모델에 RL 훈련을 할 때, 이제 핵심 정렬 기법을 훈련 과정의 더 많은 단계에 적용하고 있습니다. 여기에는 다양한 작업과 환경에서 안전하지 않은 행동을 더 잘 감지하고 억제하도록 보상 모델을 개선하는 것, 모델이 자신의 행동과 역량, 한계를 더 솔직히 밝히도록 훈련하는 것, 보상이나 채점기, 도구, 감독의 약점을 악용하는 행동을 줄이는 것이 포함됩니다. 모델이 외부 시스템이나 리소스와 상호작용할 때 피해를 일으킬 수 있는 행동에 대한 훈련 범위도 확대하고 있습니다.
OpenAI는 정렬 연구에 계속 적극적으로 투자하고 평가 범위를 확대하며, 그 과정에서 얻은 교훈을 훈련과 보호 조치에 반영하고 있습니다. 모델 행동에 관해 새롭게 알게 된 점과 발견한 새로운 과제를 포함해 정렬 연구에 관한 훨씬 더 많은 내용을 조만간 공유할 계획입니다.
훈련과 배포 전반에서 이러한 보호 조치를 통합하고, 그런 보호 조치들이 작동하는 미래 모델과 운영 환경의 역량을 더 잘 반영하도록 준비성 평가 프레임워크를 발전시킬 것입니다. 그러한 역량에 맞춰 확장할 수 있는 방법을 개발하려면 모델 지원 보안과 더 효과적인 모니터링에 꾸준히 투자하고, 정렬 연구를 지속적으로 발전시켜야 합니다. 접근 방식을 발전시키는 과정에서 외부 기관의 참여를 확대하고, 얻은 교훈을 더 많이 공유할 계획입니다.
프런티어 모델의 역량은 빠르게 향상되고 있습니다. 모델을 이해하고 정렬하며 안전하게 보호하는 OpenAI의 역량은 그보다 앞서 나가야 합니다.
*앞으로 몇 주 안에 이번 경험에서 얻은 교훈을 담은 기술 보고서를 발표할 예정입니다.

