메인 콘텐츠로 건너뛰기
OpenAI

2026년 8월 7일

보안

Critical 수준의 사이버 역량이라는 새로운 프런티어에 대응하기

로딩 중...

모델의 역량이 발전하면서 사이버 보안 환경도 빠르게 변화하고 있습니다. 이제 모델은 사이버 방어를 강화하는 동시에, 전례 없는 속도와 규모로 공격을 수행할 수 있는 역량까지 갖추고 있습니다.

최근 며칠간 진행한 차기 모델 Astra에 대한 내부 평가 결과, 에이전트 기반 코딩과 사이버 보안 분야에서 상당한 발전이 확인되었습니다. 이러한 결과와 전문가 평가를 종합한 끝에 OpenAI는 어젯밤, 준비성 평가 프레임워크(새 창에서 열기)상 Astra가 Critical 수준의 사이버 역량에 해당할 가능성을 배제할 수 없다는 결론을 내렸습니다.

OpenAI는 이러한 잠재적인 역량 변화에 대해 일반 대중과 안전·보안 커뮤니티에 투명하게 알리는 것이 중요하다고 판단해 이번 내용을 공개합니다.

OpenAI는 모델이 생물학, 화학, 사이버 보안, AI 자기 개선 분야에서 현재와 같은 수준의 역량에 도달하기 훨씬 전인 2023년 12월에 준비성 평가 프레임워크를 처음 공개했습니다. 이 프레임워크는 모델의 역량 발전을 평가하고, 새로운 역량이 등장할 경우 OpenAI가 어떤 대응을 해야 하는지 판단하기 위한 기준으로 마련되었습니다. GPT‑5.6‑Sol을 비롯한 이전 모델들은 프런티어 사이버 역량 평가에서 Critical 기준이 아닌 High 기준으로 평가되었습니다.

Critical 수준의 사이버 보안 역량 평가 

준비성 평가 프레임워크에서는 모델이 다음 두 조건 가운데 하나를 충족할 경우 Critical 수준의 사이버 보안 기준에 도달한 것으로 평가합니다. 첫째, 사람의 개입 없이 실제 보안이 강화된 여러 핵심 시스템에서 모든 심각도 수준의 실질적으로 활용 가능한 제로데이 익스플로잇을 찾아내고 개발할 수 있는 경우입니다. 둘째, 공격 목표만 제시된 상태에서 보안이 강화된 대상을 겨냥한 새로운 엔드투엔드 사이버 공격 전략을 스스로 수립하고 실행할 수 있는 경우입니다. 

OpenAI는 Astra에 대한 벤치마크와 평가를 계속 진행하고 있습니다. 다만 현재까지의 예비 평가 결과는 이 모델이 Critical 수준의 역량에 해당할 가능성을 배제할 수 없을 만큼 충분히 높은 성능을 보여주고 있습니다. Astra는 아직 출시되지 않은 모델이며, Hugging Face 보안 사고와는 관련이 없습니다.

OpenAI가 취하고 있는 조치

이에 따라 OpenAI는 이러한 수준의 역량을 안전하게 배포할 수 있도록 안전장치와 보안 통제에 대한 견고성 테스트를 확대했습니다. 또한 앞으로도 이 모델을 안전하고 보안이 유지되는 환경에서 개발할 수 있도록 내부적으로 다음과 같은 조치를 시행하고 있습니다. 

  • OpenAI는 더 높은 수준의 역량을 갖춘 모델과 관련 활동에 대해 더욱 엄격한 보안 통제를 적용하고 있습니다. 여기에는 격리된 테스트 환경, 제한된 네트워크 및 도구 접근 권한, 강화된 모델 가중치 보호 및 암호화, 추가적인 모니터링 및 탐지 기능, 그리고 샌드박스 환경에서의 실행이 포함됩니다.
  • 강화된 보안 통제 요건을 아직 충족하지 않는 Astra 관련 내부 활동은 모두 일시 중단했습니다.
  • OpenAI는 학습과 평가를 포함한 Astra의 모든 에이전틱 활용 사례에 대해 위험한 행동과 정렬 실패를 감시하는 포괄적인 모니터링 체계를 구축했습니다. 모니터링 시스템은 모델의 추론 과정을 평가하고, 위험도가 높은 활동이 감지되면 이를 검토하고 중단하기 위한 보안 대응을 실행합니다.
  • OpenAI는 관련 정부 기관 및 일부 AI 안전 기관과 협력해 이 모델의 역량을 검증할 예정입니다.
  • 또한 위험도가 높은 평가와 워크로드를 안전하게 수행할 수 있도록 제3자 테스트 파트너에게 권장 보안 통제를 제공할 예정입니다. 

준비성 평가 프레임워크는 이전에도 모델의 역량 수준이 변화하는 과정에서 중요한 기준이 되어 왔습니다. 2025년 6월에는 모델이 준비성 평가 프레임워크상 생물학 분야의 High 수준 역량 기준에 근접함에 따라, 안전장치를 강화하고 테스트를 확대하며 외부 전문가와 협력하고 추가적인 보안 통제를 도입하기 위해 취하고 있던 조치를 공개한 바 있습니다. 이번에도 같은 원칙을 적용하고 있습니다.

OpenAI는 고도화된 사이버 역량을 갖춘 모델이 공격자보다 먼저 방어자가 취약점을 발견하고 대응할 수 있도록 지원해야 한다고 믿습니다. 앞으로도 정부, AI 안전 연구기관, 시민사회와 긴밀히 협력하여 Astra를 비롯한 앞으로 등장할 모델들의 프런티어 역량이 책임감 있게 배포되고, 모든 인류의 이익을 위해 폭넓게 활용될 수 있도록 노력하겠습니다.

작성자

OpenAI