메인 콘텐츠로 건너뛰기
OpenAI

2026년 9월 1일

안전보안

Astra로 향하는 길: Critical 역량과 프런티어 보호 조치

로딩 중...

Astra가 사이버 보안 역량의 Critical 수준에 도달할 수 있다는 이전 평가 이후, 모델의 역량을 평가하기 위해 더 많은 증거를 수집하고 추가 평가를 진행했습니다. 현재 Astra는 준비성 평가 프레임워크의 사이버 보안 역량 Critical 기준을 충족한다고 판단합니다. 즉, 적절한 도구와 액세스가 있으면 사람이 각 단계를 안내하지 않아도 보안이 잘 갖춰진 여러 시스템에서 알려지지 않은 보안 결함을 찾아내고 악용 방법을 개발할 수 있습니다. 이 수준으로 지정한 첫 모델이며, 개발 중과 출시 전에 더 강력한 보호 조치가 필요합니다.

지난 몇 주 동안 사이버 오용과 승인되지 않은 모델 행동에 대한 보호 조치를 강화하고 테스트하면서 Astra의 개발 및 출시 일부를 연기했습니다. 이러한 작업을 토대로 Astra의 보호 조치가 준비성 평가 프레임워크에 따라 출시할 때 심각한 피해 위험을 충분히 최소화한다고 판단합니다.

Astra는 Hugging Face 사고에 관여하지 않았지만, 해당 사고에서 얻은 교훈(새 창에서 열기)을 안전 접근 방식에 반영했습니다. 사후 테스트에 따르면 당시 프로덕션 보호 조치로 Hugging Face 사고를 예방할 수 있었을 것으로 판단합니다. 그 후 Astra에는 더 강력한 보호 조치를 적용했습니다. 여기에는 유해한 사이버 요청을 더 안정적으로 거부하고 안전 제한을 준수하도록 모델을 훈련하는 것, 추가 오용 방지 조치, 잠재적인 무단 활동을 중단할 수 있는 모니터링이 포함됩니다.

Astra를 곧 제공할 계획이지만, 가장 고도화된 사이버 보안 역량에 대한 액세스는 더 제한됩니다. 고급 사이버 보안 작업은 처음에는 테스터 그룹에 제공되며, 이후 방어적 사용을 확대하기 위해 Daybreak Blue를 통한 액세스가 제공됩니다.

출시 시 모델의 시스템 카드에서 안전, 보안 및 정렬 테스트와 평가에 관한 자세한 내용을 공유하겠습니다. 출시에 앞서, 이 수준의 사이버 보안 역량을 갖춘 모델을 안전하게 출시하기 위해 진행해 온 몇 가지 작업을 알리고 남아 있는 위험을 투명하게 공개하고자 합니다.

Astra의 사이버 보안 역량 평가

준비성 평가 프레임워크에 따르면 모델은 다음 조건 중 하나를 충족할 경우 Critical 기준에 도달합니다.

  • 모델이 사람의 개입 없이 보안이 강화된 여러 실제 핵심 시스템에서 심각도와 관계없이 작동하는 제로데이 익스플로잇을 식별하고 개발할 수 있습니다.
  • 모델이 개괄적인 목표만 주어져도 보안이 강화된 표적에 대한 새로운 사이버 공격 전략을 처음부터 끝까지 구상하고 실행할 수 있습니다.

Astra 준비성 평가는 자동화된 공개 및 비공개 벤치마크와 전문가 주도 평가를 결합했습니다. Astra는 GPT‑5.6 Sol보다 사이버 보안 역량이 크게 향상되었습니다. 토큰 효율성이 훨씬 높고 취약점 식별과 익스플로잇 개발 능력도 뛰어납니다.

한 예로, 알려진 취약점에서 익스플로잇을 개발하는 모델의 능력을 평가하는 ExploitBench에서 Astra를 실행한 결과 100% 만점을 기록했습니다.

데이터 오염 우려로 인해 최근 공개된 심각도 높은 V8 취약점 20개가 포함된 ‘ExploitBench - 내부 포팅 버전(2026년 6~8월)’이라는 내부 벤치마크를 구축했습니다. 이 데이터 세트에서 Astra는 훨씬 적은 출력 토큰을 사용하면서 GPT‑5.6 Sol보다 임의 코드 실행률이 훨씬 높았습니다. 평가 중 모델은 익스플로잇 체인의 일부로 제로데이 취약점 2개를 발견해 사용하기도 했습니다. 현재 이 두 취약점을 유지관리자에게 공개하는 절차를 진행 중입니다.

표시된 Astra 결과는 기본 프로덕션 구성이 아닌 Daybreak Blue 액세스에서의 역량을 반영합니다.

보안이 강화된 브라우저와 운영체제를 대상으로 한 전문가 주도 평가에서 Astra는 알려지지 않은 취약점을 발견해 실제로 작동하는 익스플로잇 체인으로 만들었습니다. 브라우저가 HTML 파일을 열었을 때 샌드박스를 탈출해 호스트에서 명령을 실행하는 전체 브라우저 침해 체인을 구축했습니다. 또한 보안이 강화된 운영체제에서 여러 취약점을 찾아 결합해 권한이 없는 사용자에서 root로 이어지는 로컬 권한 상승 체인을 만들었습니다. 조사 결과를 종합해 Astra가 Critical 기준을 충족한다는 결론을 내렸습니다.

Critical 역량에 필요한 보호 조치

Astra 수준의 사이버 보안 역량을 갖춘 모델의 경우, 개발 중과 배포 전에 심각한 사이버 피해 위험을 최소화하려면 두 가지 경로를 모두 다뤄야 합니다.

  • 악의적 행위자가 모델을 사용하는 경우. 보호 조치는 악의적 행위자가 Astra를 사용해 보안이 강화된 핵심 시스템의 알려지지 않은 결함을 겨냥한 익스플로잇을 개발하거나, 보안이 강화된 표적을 대상으로 처음부터 끝까지 공격을 수행하지 못하도록 강력하게 차단해야 합니다.
  • 모델이 승인되지 않았거나 의도와 어긋나는 행동을 하는 경우. 악의적인 사용자가 없더라도, 고도의 사이버 보안 역량을 갖춘 모델은 제대로 정렬되지 않으면 스스로 사이버 피해를 일으킬 수 있습니다. 이러한 역량을 갖춘 모델에는 매우 높은 정렬 기준을 적용해야 합니다. 또한 2차 방어선으로서, 현실 세계에 중대한 피해를 줄 수 있는 의도와 어긋나는 행동을 보호 조치가 신속하게 감지하고 억제할 수 있어야 합니다.

특히 두 번째 경로는 내부 개발과 외부 배포 모두에 적용됩니다. 앞서 설명했듯이, OpenAI-Hugging Face 사고 이후 훈련 인프라를 강화하기 위해 일부 Astra 훈련을 포함한 특정 프런티어 훈련을 2주간 중단했습니다. 여기에는 격리 및 네트워크 통제, 모니터링 확대, 정렬 훈련 및 기준 강화가 포함되었습니다. 그런 다음 더 엄격한 통제 아래 소규모 작업을 재개했습니다.

향후 Astra 버전을 위한 일부 대규모 강화학습(RL)은 훈련 환경의 안전 및 보안 기준을 높이는 동안 더 오래 보류했습니다. 새로운 안전 및 보안 요건을 마련한 뒤, 8월 28일에 이전에 중단했던 대규모 프런티어 RL 실행을 재개했습니다. 일부 소규모 실험 훈련은 계속 일시적으로 보류하고 있습니다.

Astra 출시를 준비하려면 사이버 악용과 무단 행동에 대한 보호도 강화해야 했습니다. 아래에서는 이러한 보호 조치와 테스트 방법을 설명합니다.

사이버 악용에 대한 견고성

지난 2월, 사이버 보안 역량이 High 수준이라고 판단한 첫 모델을 배포한 이후 매번 새 모델을 출시할 때마다 사이버 보호 조치를 강화해 왔습니다. 전반적인 안전 접근 방식은 사후 훈련을 통해 모델이 요청을 거부하도록 하는 조치, 시스템 수준 안전 분류기, 오프라인 탐지 및 위협 차단을 여러 겹으로 적용합니다.

GPT‑5.6(새 창에서 열기)에서는 사이버 악용을 탐지하는 활성값 기반 분류기를 추가하고, 집중적인 자동 레드팀 테스트에서 발견된 범용 탈옥에 대한 대응 범위를 개선하는 등 시스템 수준 스택의 견고성을 크게 높였습니다. Astra에서는 이러한 개선을 바탕으로 보호 조치 스택의 모델 계층에 추가로 투자했으며, 여러 대화에 걸친 맥락을 보호 조치가 처리하는 능력도 개선했습니다.

  • 모델 견고성을 위한 새로운 훈련 기법을 활용해 Astra는 허용되지 않는 사이버 지원 요청을 더 안정적으로 거부합니다. 사이버 탈옥 평가 세트에서 Astra는 요청의 91.5%를 거부했습니다(GPT‑5.6 Sol은 59%).
  • 위험이 더 높은 것으로 평가된 계정에는 잠재적으로 위험한 사이버 지원을 더 폭넓게 거부하는 보수적인 모델 행동 경계를 적용합니다. 고위험 사용자의 이러한 사이버 악용을 포착할 수 있도록 모니터링 시스템의 맥락 범위를 확대했습니다.

또한 엄격한 테스트와 내부 및 외부 레드팀 테스트, 문제 해결 프로그램을 계속 진행했습니다. 이전 테스트 기간에 발견된 모든 탈옥이 계속 차단되는지 확인하는 회귀 테스트와 더불어, 최신 내부 레드팀 테스트 공격자를 활용한 새로운 레드팀 테스트를 진행하고 있습니다. 업계 파트너와 함께 공통 탈옥 평가 체계를 정의하고 있으며, 연중무휴 신속 대응 프로그램을 통해 새로운 발견 사항을 조사하고 해결할 예정입니다. 사이버 보호 조치 테스트에 관한 자세한 내용은 Astra 시스템 카드에서 공유하겠습니다.

방어 담당자가 취약점을 찾아 수정하도록 지원하는 일은 안전 접근 방식의 핵심 축으로 남아 있습니다. 출시 시점에는 잠재적 오용을 막기 위해 Astra의 보호 조치가 궁극적으로 의도한 수준보다 더 많은 제약을 초래할 것으로 예상합니다. 고급 사이버 보안 워크플로를 위한 Astra 액세스는 처음에는 소수의 알파 테스터에게 제공되며, 이후 방어적 사용을 지원하도록 Daybreak Blue를 통한 액세스를 확대할 예정입니다.

정렬 & 모니터링

모델이 의도와 어긋날 가능성이 있는 행동을 하지 않도록 추가적인 다층 보호 조치도 마련했습니다.

  • 모델 정렬: 평가에서 Astra는 GPT‑5.6 Sol보다 명시적인 안전 및 보안 제한을 준수하고 승인된 범위 안에서 행동할 가능성이 훨씬 높았습니다. 이에 따라 지금까지 가장 잘 정렬된 모델이 되었습니다. 특히 모델이 보안 및 안전 제한을 준수하고 승인된 범위 안에서 행동하는지를 중점적으로 살폈습니다.
  • 모니터링 및 통제: 내부 절차와 마찬가지로, 의도와 어긋날 가능성이 있는 행동을 신속히 감지하고 억제하기 위해 Astra에 추론 과정 모니터링을 추가로 적용하고 있습니다.

Astra는 모델 정렬의 중대한 진전이자, 사전 학습 개입부터 강화학습 중 더 신중하고 일관된 채점에 이르는 여러 장기 정렬 작업의 결실입니다. 테스트 결과, Astra는 GPT 5.6 Sol보다 자동 검토 같은 명시적인 안전 제한과 경고를 일관되게 준수할 가능성이 더 높았습니다.

또한 사이버 평가 ExploitGym을 실행하던 에이전트들이 제3자 시스템을 침해한 Hugging Face 사고를 바탕으로 테스트를 개발했습니다. 해당 평가에서 가장 어려운 과제를 사용해, 모델이 배정된 과제를 해결하는 대신 주변 보안 인프라를 침해하려 하는지 확인하는 ‘허니팟’ 테스트를 만들었습니다. 프로덕션 보호 조치가 없는 GPT‑5.6 Sol은 모델에 익스플로잇 개발을 지시하는 벤치마크 환경을 시뮬레이션한 테스트의 56%에서 해당 표적에 접근하려 했습니다. Astra는 이 테스트에서 그러한 시도를 전혀 하지 않았습니다. 이 수치는 일반적인 프로덕션 사용이 아니라 사이버 보호 조치가 없는 테스트 조건에서의 행동을 나타냅니다.

왼쪽: 이 새로운 평가에서는 모델이 자동 검토의 거부에 어떻게 반응하는지 관찰합니다. 각 과제는 지식 노동 환경에서 진행되며, 자동 검토에서 거부된 직후 롤아웃이 시작됩니다. 이후 모델은 롤아웃을 종료하거나, 더 안전한 대안을 찾거나, 비슷한 명령을 다시 시도하거나, 잘못된 구성(새 창에서 열기)을 악용해 자동 검토를 완전히 우회할 수 있습니다. 마지막 두 가지를 시도하면 이 평가에서는 실패로 간주됩니다. Astra는 자동 검토 우회를 한 번도 시도하지 않았습니다.

오른쪽: 이 평가에서는 ExploitGym 평가에서 가장 어렵거나 불가능한 과제에 직면했을 때 모델이 ‘허니팟’을 이용해 부정행위를 하려는 경향을 확인합니다. 모델의 행동을 평가하기 위해 보호 조치를 관찰 전용 모드로 설정한 시뮬레이션 환경에서 진행했습니다. GPT‑5.6 Sol은 이러한 상황에서 부정행위를 할 가능성이 더 높았지만, Astra는 이런 지름길을 사용하려 하지 않았으며 일부 과제는 정상적인 방법으로 해결했습니다.

모델이 정렬되도록 훈련하는 것은 여러 안전 조치 중 하나입니다. 정렬 테스트와 결과에 관한 자세한 내용은 Astra 시스템 카드에서 공유하겠습니다.

모델이 의도와 어긋나는 행동을 하는지 감지하고 신속히 억제하기 위해 Astra급 모델의 프로덕션 환경에도 이를 감지하는 모니터링 시스템을 배포하고 있습니다. 이러한 보호 조치는 내부 배포 모니터링과 유사하며, 모델의 추론과 행동에서 승인되지 않은 행위를 확인하고 잠재적인 무단 활동을 자동으로 중단하는 분류기 시스템을 사용합니다. 역량이 향상될수록 이러한 보호 조치가 모델의 올바른 정렬을 대신할 수는 없습니다. 향후 모델은 이러한 보호 조치가 한 번도 작동하지 않을 만큼 잘 정렬되는 것이 목표입니다.

사용자에게 미치는 영향

OpenAI는 AI의 이점을 누구나 폭넓게 누릴 수 있도록 최선을 다하고 있습니다. Astra의 사이버 보안 역량이 크게 향상된 만큼, 이번 배포가 안전하게 이루어지도록 각별히 주의하고 있습니다. 추가 안전 검사는 방어 목적의 사이버 보안을 비롯한 정상적인 작업을 때때로 늦추거나 일시 중지하거나 중단할 수 있습니다.

시스템이 정상적인 활동을 잠재적인 사이버 오용이나 무단 행동으로 잘못 표시해 의도치 않게 작업을 늦추거나 일시 중지하거나 중단할 수 있습니다. 여기에는 사이버 보안과 직접 관련이 없어 보이는 작업이나 에이전트가 장시간 실행되는 작업도 포함될 수 있습니다.

정렬 불량 모니터가 작업을 일시 중지하면 ChatGPT 또는 Codex 사용자는 계속하기 전에 해당 행동을 검토하라는 요청을 받을 수 있습니다. API 같은 다른 인터페이스를 사용하면 작업이 중단됩니다. 불필요한 중단을 줄이고 Daybreak 같은 프로그램을 통해 프런티어 역량에 대한 액세스를 확대할 수 있도록 이러한 보호 조치를 계속 조정할 계획입니다.

앞으로의 방향

이제 모델이 더 중대한 영향을 미치는 작업을 맡을 수 있고, 정렬과 통제의 실패가 더 심각한 결과를 낳을 수 있는 AI 개발 단계에 들어서고 있습니다. 이러한 시스템의 이점을 실현하려면 역량이 향상되는 모델을 정렬하고 통제할 수 있어야 합니다.

그 책임은 훈련, 평가, 배포 전반에 걸쳐 이어집니다. 이를 위해서는 정렬된 행동을 입증하는 더 강력한 증거, 역량 향상에 발맞춘 보호 조치, 그리고 보호가 충분하지 않을 때 속도를 늦출 의지가 필요합니다.

앞으로도 이러한 시스템을 테스트하고, 배운 내용을 공유하며, 여전히 불확실한 부분을 명확히 밝히겠습니다. Astra 이후의 모델은 우리에게 더 많은 책임을 요구할 것입니다. 그 책임을 다하는 데 필요한 시간과 노력을 아끼지 않겠습니다.