메인 콘텐츠로 건너뛰기
OpenAI

2026년 7월 21일

보안

OpenAI와 Hugging Face, 모델 평가 중 발생한 보안 사고에 공동 대응

로딩 중...

지난주 Hugging Face는 자사 인프라를 침해한 AI 에이전트를 탐지해 차단한 후 새로운 유형의 보안 사고(새 창에서 열기)를 공개했습니다. 사이버 역량이 더욱 향상된 모델이 확산됨에 따라 이러한 유형의 사고는 앞으로 점차 더 흔해질 것으로 예상됩니다. 조사 결과, 이번 사고는 사이버 역량 벤치마크(새 창에서 열기)를 대상으로 내부 평가를 수행하던 중 발생한 것으로 확인되었습니다. 당시 GPT‑5.6 Sol과 이보다 더 뛰어난 성능의 출시 전 모델을 포함한 여러 OpenAI 모델이 함께 사용되었으며, 모두 평가 목적으로 사이버 관련 요청에 대한 거부(refusal)를 완화한 상태였습니다.

OpenAI는 이번 사고를 최첨단 사이버 역량이 동원된 전례 없는 사이버 사고로 판단하고 있으며, 이에 맞춰 대응하고 있습니다. 현재 단계에서 초기 조사 결과를 공개하는 것은 보안 담당자들이 이번 사고의 경위를 이해하고, 현재 AI 모델이 어느 수준의 역량을 갖추고 있는지 보다 정확하게 판단하는 데 도움이 되도록 하기 위함입니다. OpenAI는 Hugging Face와 함께 철저한 조사를 계속 진행할 예정이며, 조사가 완료되는 대로 취약점, 사고 경위 및 조사 결과에 대한 자세한 내용을 추가로 공유하겠습니다.

이번 사고에서 발생한 일

이번 사고는 모델의 사이버 역량을 정량적으로 평가하기 위해, 복잡한 공격 경로를 활용한 고도화된 악용을 수행하도록 모델을 유도하는 내부 평가 과정에서 발생했습니다. OpenAI는 모델이 고위험 사이버 활동을 수행하지 못하도록 운영 환경에서 사용하는 분류기를 적용하지 않은 상태로 이 평가를 실행해, 모델이 발휘할 수 있는 최대 수준의 사이버 역량을 평가합니다. 이 벤치마크는 고도로 격리된 환경에서 실행되며, 네트워크 접근은 패키지 레지스트리의 프록시 및 캐시 역할을 하는 내부 호스팅 서드파티 소프트웨어를 통해 패키지를 설치하는 기능으로만 제한되어 있습니다.

이 모델들은 OpenAI의 연구 환경과 Hugging Face의 운영 인프라 전반에 걸쳐 취약점을 찾아 이를 연계해 악용했으며, 그 결과 Hugging Face의 운영 데이터베이스에서 테스트 정답을 직접 확보했습니다. 현재까지 확보된 모든 증거에 따르면, 모델은 ExploitGym의 정답을 찾는 데 극도로 집중했으며, 비교적 제한적인 테스트 목표를 달성하기 위해 가능한 모든 수단을 동원한 것으로 보입니다.

샌드박스 테스트 환경에서 작동하는 동안, OpenAI 모델은 평가 과제를 해결하기 위해 공개 인터넷에 접근할 수 있는 방법을 찾는 데 상당한 양의 추론 연산 자원을 사용했습니다. 이를 위해 모델은 패키지 레지스트리 캐시 프록시에서 제로데이 취약점을 찾아 이를 악용했으며(해당 취약점은 현재 책임 있는 공개 절차에 따라 공급업체에 알린 상태입니다), 이를 통해 접근 권한을 확보했습니다. 이후 OpenAI 모델은 연구 테스트 환경에서 일련의 권한 상승과 측면 이동을 수행하며, 인터넷에 접근할 수 있는 노드에 도달했습니다.

인터넷에 접근한 후, OpenAI 모델은 Hugging Face에 ExploitGym용 모델, 데이터세트 및 정답이 저장되어 있을 가능성이 있다고 추론했습니다. 이를 바탕으로 모델은 평가를 속이는 데 활용할 수 있는 기밀 정보에 접근할 방법을 찾기 시작했고, 실제로 접근 방법을 찾아냈습니다. 한 사례에서는 탈취한 자격 증명과 제로데이 취약점을 포함한 여러 공격 벡터를 연계해 Hugging Face 서버에서 원격 코드 실행(RCE)이 가능한 경로를 찾아냈습니다. 이러한 비정상적인 활동은 OpenAI 보안팀이 내부적으로 탐지했습니다.

Hugging Face의 보안팀과 AI 에이전트는 자사 인프라에서 이러한 활동을 탐지해 차단했으며, OpenAI 팀과 협력하기 전부터 자체 오픈 소스 모델을 활용해 격리 조치와 포렌식 재구성을 이미 진행하고 있었습니다. OpenAI는 Hugging Face와 긴밀히 협력하며 이번 사고에 대한 조사를 계속 진행하고 있습니다. 또한 조사와 대응 과정에서 보여준 Hugging Face의 신속하고 긴밀한 협력에 깊이 감사드립니다.

현재 진행 중인 조치

  1. OpenAI는 조사가 진행되는 동안 취약점에 대한 패치가 완료될 때까지 연구 속도를 일부 희생하더라도 인프라 구성에 대한 엄격한 통제를 시행하고 있습니다. 또한 이러한 통제 조치와 그 영향에 대해 안전 및 보안 위원회(Safety and Security Committee)에 정기적으로 보고하고 있습니다.
  2. OpenAI는 이번 사고에 대한 포렌식 조사를 위해 Hugging Face와 긴밀히 협력하고 있습니다.
  3. 내부에서 호스팅하는 서드파티 소프트웨어에서 확인된 제로데이 취약점은 책임 있는 공개 절차에 따라 해당 업체에 알렸으며, 현재 함께 패치를 진행하고 있습니다.
  4. Hugging Face를 Trusted Access 프로그램에 포함했으며, Hugging Face 팀이 OpenAI 모델의 역량을 활용해 보안 방어 체계를 신속하게 강화할 수 있도록 지원하고 있습니다.
  5. OpenAI는 향후 학습 및 평가 과정에 적용되는 보호 조치를 강화하고 있으며, 새로운 보호 장치도 추가하고 있습니다. 이번 주에는 장기 추론(long-horizon) 모델 시대의 안전성과 정렬을 강화하기 위한 방안을 다룬 블로그를 공개했습니다. 이번 평가는 사이버 취약점을 시험하는 것이 목적이었기 때문에 배포 시 적용되는 이러한 보호 장치는 의도적으로 활성화하지 않았습니다. 이번 사고를 통해 모델의 정렬, 평가 과정에서의 사이버 보안, 내부 테스트 중 모니터링을 더욱 강화해야 할 필요성을 확인했습니다.

고도화된 사이버 역량 평가 방식

최근 공유한 바와 같이 AI는 취약점을 발견하고 악용하는 속도를 높이고 있습니다. 이번 사고를 통해 얻은 가장 중요한 교훈은 모델의 보안과 안전성 역시 빠르게 발전하는 모델 역량에 발맞춰 강화되어야 한다는 점입니다. OpenAI는 모델 개발 과정에서 적용하는 격리 조치, 모니터링, 접근 제어 및 평가 절차를 강화하고 있습니다.

영국 AI Security Institute(AISI)의 평가에 따르면 GPT‑5.6 Sol과 같은 모델은 장기간에 걸쳐 복잡한 다단계 사이버 작업을 지속적으로 수행할 수 있는 역량을 점점 더 갖추고 있습니다. 이번 사고는 이러한 이론적 역량이 실제 환경에서도 발휘될 수 있음을 보여줍니다.

장기 사이버 평가 환경에서 최신 오픈 웨이트 모델과 프런티어 모델을 비교한 영국 AI Security Institute의 차트.

이번 사고는 고도화된 모델이 소스 코드에 접근하지 않고도 실제 시스템에서 새로운 공격 경로를 찾아 이를 악용할 수 있음을 분명히 보여주었습니다. 또한 고도화된 사이버 역량은 더욱 강력한 보호 장치와 방어 도구를 함께 발전시키며 개발되어야 한다는 점도 보여줍니다.

OpenAI는 고도화된 사이버 역량을 갖춘 모델이 공격자보다 먼저 보안 취약점을 찾아내고, 여러 취약점이 어떻게 연계되어 악용될 수 있는지 파악하며, 이를 기계 수준의 속도로 해결할 수 있도록 보안팀을 지원해야 한다고 믿습니다. OpenAI는 이러한 역량을 활용해 인프라 구성과 모델 평가 환경의 보호 체계를 지속적으로 강화하고 있으며, 앞으로 확인되는 결과와 모범 사례도 공유할 예정입니다. 또한 다른 보안 담당자들도 Trusted Access를 신청해 지금부터 이러한 모델을 활용해 보시기를 권장합니다. 이를 통해 더욱 효과적인 예방, 더 빠른 탐지, 더 효율적인 사고 대응이 가능해질 것입니다.

“이번 사안을 비롯한 여러 분야에서 OpenAI와 협력하게 되어 감사하게 생각합니다. 이번 사고는 최초의 사례일 가능성이 있으며, 우리가 오래전부터 믿어 온 사실을 다시 한번 보여주었습니다. AI 안전은 어느 한 기업이 비공개로 해결할 수 있는 문제가 아닙니다. 모든 보안 담당자가 AI를 폭넓게 활용할 수 있는 환경에서, 열린 협력과 공동의 노력을 통해 해결될 것입니다.”
—클렘 들랑그, Hugging Face 공동 창립자 겸 CEO

작성자

OpenAI