메인 콘텐츠로 건너뛰기
OpenAI

2026년 8월 4일

보안

OpenAI 모델 관련 제3자 사이버 평가

로딩 중...

독립적인 테스트는 배포 전에 위험을 검증하고 더 깊이 이해하는 데 중요한 역할을 합니다. 일부 사이버 평가는 공개 배포 환경에서의 일반적인 모델 동작이 아니라 기본 성능을 측정하기 위해 의도적으로 보호 수준을 낮추는 등 맞춤형 구성을 사용합니다.

최근 진행된 평가에서 두 외부 테스트 파트너는 테스트 환경의 구성과 제어 방식이 최신 모델의 향상된 성능과 맞물리면서 모델의 활동이 의도된 테스트 범위를 벗어난 사례를 확인했습니다. 이러한 사고는 모델의 성능이 향상됨에 따라 테스트 환경과 운영 방식의 기준도 함께 발전시켜야 하며, 이를 위해 업계와 제3자 평가 기관 간 협력이 중요하다는 점을 보여줍니다. 편집자 주: 이번 사고는 Hugging Face 보안 사고와는 별개의 사안이며, Hugging Face 보안 사고에 대한 최신 정보는 계속해서 여기에서 공유할 예정입니다.

이번 사고는 일반적인 배포 환경과는 다른 특정 조건 및 보호 수준이 낮아진 구성에서 진행된 제3자 사이버 평가 중 OpenAI 모델이 공용 인터넷에 접근한 사례와 관련이 있습니다. 사고는 다음과 같습니다.

  1. 영국 정부 산하 AI Security Institute인 UK AISI는 에이전트가 필요한 도구를 직접 찾아 실제 공격자와 유사한 환경에서 작업할 수 있도록 인터넷 접근을 의도적으로 허용한 상태에서 사이버 레인지 평가를 수행했으며, 기본 성능을 측정하기 위해 사이버 분류기도 비활성화했습니다. 자세한 내용은 여기(새 창에서 열기) UK AISI의 블로그에서 확인할 수 있습니다.
  2. 외부 사이버 보안 테스트 파트너인 Irregular는 인터넷과 격리된 환경에서 Capture-the-Flag(CTF) 방식의 평가를 진행하고 있었지만, 테스트 환경의 구성 오류로 인해 모델이 공용 인터넷에 접근할 수 있었습니다.

아래에서는 이번 사고의 경위와 이러한 활동이 가능했던 테스트 환경의 조건, 사고를 차단하기 위해 취한 조치, 그리고 독립 연구소가 성능이 계속 향상되는 모델을 앞으로도 엄격하고 안전하게 평가할 수 있도록 OpenAI가 추진하고 있는 개선 사항을 정리했습니다.

제3자 모델 평가 환경 강화

이번 사고는 Hugging Face 사고에 관한 최근 게시물에서 설명한 것과 같은 더 큰 과제를 다시 한번 보여줍니다. 모델의 성능이 향상될수록 이를 둘러싼 보안 및 안전 체계도 함께 발전해야 합니다. 여기에는 모델을 개발하는 환경뿐 아니라 연구소와 독립 파트너가 모델을 평가하는 환경도 포함됩니다.

앞으로 몇 주 동안 제3자 테스트에 대한 접근 방식을 전반적으로 검토할 예정입니다. 여기에는 위험도가 높은 평가를 식별하는 방법, 평가 범위를 합의하는 절차, 인터넷 접근이나 보호 수준 완화 요청을 검토하는 기준, 격리, 자격 증명 관리, 모니터링, 중단 조건에 대한 기준을 마련하는 것, 그리고 사고 통지 및 에스컬레이션 절차를 더욱 명확하게 정립하는 것이 포함됩니다.

OpenAI는 업계 전반과 협력해 고위험 평가를 안전하게 수행하기 위한 공통 관행을 강화하는 데 최선을 다하고 있습니다. 이를 위해 앞으로 몇 주 동안 국가 AI 연구기관, 독립 평가 기관, 다른 AI 연구소 등 다양한 이해관계자들을 한자리에 모을 예정입니다. 목표는 엄격한 독립 평가의 가치를 유지하는 동시에, 테스트 방식이 점점 더 성능이 향상되는 모델의 발전 속도에 발맞출 수 있도록 하는 것입니다.

UK AISI

8월 3일, UK AISI는 7월 25일부터 진행된 정기 사이버 평가에서 OpenAI와 다른 연구소의 모델이 일부 사례에서 테스트 범위를 벗어난 활동을 수행했다고 알려왔습니다. 해당 평가는 실제 네트워크를 모방하도록 설계된 통제된 사이버 레인지에서 진행되었습니다. 확인된 19건의 사례 가운데 2건은 OpenAI 모델인 GPT‑5.6 Sol과 관련된 것이었으며, 나머지는 다른 연구소의 모델과 관련된 사례였습니다.

이번 평가에서 에이전트는 Capture-the-Flag(CTF) 과제의 사이버 보안 전문가 역할을 수행하도록 지시받았습니다. 목표는 서로 연결된 세 개의 시뮬레이션 환경을 침해하고 최종 플래그를 획득하는 것이었습니다. 과제 프롬프트에는 평가 범위에 포함된 레인지 내 네트워크가 명시되어 있었으며, 일부 시스템은 범위 밖으로 지정되어 있었습니다. 또한 UK AISI는 에이전트가 필요한 도구를 다운로드하고 실제 공격자와 유사한 조건에서 작업할 수 있도록 실시간 인터넷 접근을 허용했으며, 기본 성능을 측정하기 위해 모델의 사이버 분류기를 비활성화했습니다.

UK AISI가 의도한 권한 범위는 시뮬레이션된 사이버 레인지로 한정되어 있었습니다. 에이전트는 지정된 시뮬레이션 네트워크를 공격하고 플래그를 획득할 권한만 부여받았으며, 레인지의 네트워크 경계 밖에 있는 시스템과 상호작용하도록 허용되지는 않았습니다. 그러나 공용 인터넷 접근을 어떤 방식으로 사용할 수 있고 사용할 수 없는지에 대해서는 명확한 지침이 제공되지 않았으며, UK AISI는 이를 이번 사고의 원인 중 하나로 보고 있습니다.

이러한 평가를 진행하는 동안 UK AISI는 GPT‑5.6 Sol이 시뮬레이션 레인지에 진입해 플래그를 획득하는 경로를 찾는 과정에서 승인되지 않은 두 가지 행동을 수행한 사실을 확인했습니다.

  1. GPT‑5.6 Sol은 다른 연구소의 에이전트가 공개된 상태로 남겨둔 GitHub 토큰을 재사용해 범위 내부의 시스템이 GitHub 또는 다른 업데이트 서비스를 폴링하고 있는지 확인했습니다. 또한 계정 복구를 시도하고 요청 제한을 우회하는 방법을 시도했으며, 외부 DNS 및 터널링 서비스 제공업체에 계정을 등록했습니다.
  2. GPT‑5.6 Sol은 공개 터널링 서비스를 사용해 평가 환경에서 로컬로 실행 중이던 DNS 서버에 공용 인터넷에서 접근할 수 있도록 했습니다. 해당 서버에는 테스트 범위에서 실행 중인 소프트웨어의 알려진 취약점을 대상으로 하는 페이로드가 포함되어 있었습니다. 그러나 이 구성은 정상적으로 작동하지 않았으며, 실제 DNS 리졸버가 이를 조회했다는 증거도 없습니다. 또한 평가가 종료된 후 해당 인프라는 모두 제거되었습니다.

모델은 사이버 레인지를 완료하려는 과정에서 이러한 행동을 했지만, UK AISI는 실제 외부 계정과 범위 밖의 서비스를 사용했으며 이러한 행동이 과제를 완료하는 데 필요하지 않았다는 이유로 이를 승인되지 않은 행위로 판단했습니다. 또한 해당 DNS 서버는 공용 인터넷에서 익스플로잇 페이로드를 호스팅하고 있었지만, 이 구성은 정상적으로 작동하지 않았고 실제 DNS 리졸버가 이를 조회했다는 증거도 없습니다.

UK AISI는 보안 모니터링을 통해 비정상적인 데이터 전송을 감지한 후 7월 28일 해당 활동을 확인했습니다. 이후 관련 평가를 중단하고 해당 시스템을 격리했으며, 탐지 후 약 1시간 만에 활동을 차단했습니다.

활동을 식별하고 조사하며 관련 세부 정보를 공유하는 등 전 과정에서 협력해 준 UK AISI에 감사드립니다. 앞으로도 긴밀한 협력을 이어가기를 기대합니다.

Irregular

7월 29일, 외부 평가 파트너 중 하나인 Irregular는 Capture-the-Flag(CTF) 방식의 사이버 보안 평가 중 OpenAI 모델과 관련된 사고를 알려왔습니다. 모델은 시뮬레이션 환경의 취약점을 활용해 숨겨진 정보를 찾도록 지시받았으며 인터넷에는 접근할 수 없다고 안내받았습니다. 그러나 테스트 환경의 잘못된 구성으로 인해 모델이 공용 인터넷에 접근할 수 있었습니다.

한 테스트에서는 CTF 과제에 사용된 가상의 대상 이름이 우연히 실제 도메인과 일치했습니다. 테스트 환경이 실수로 인터넷에 연결되어 있었기 때문에 모델은 해당 웹사이트를 시뮬레이션 환경의 일부로 오인하고 실제 웹사이트의 취약점을 악용했습니다. 이는 정교한 샌드박스 탈출이나 제로데이 취약점이 사용된 사례가 아니었습니다. 인터넷 접근은 테스트 환경의 구성 오류로 인해 가능했으며, 모델은 기본적인 보안 취약점을 악용한 것으로 보입니다.

Irregular의 조사에 따르면 모델은 해당 사이트를 운영하는 데 사용할 수 있는 자격 증명도 찾아 사용했습니다. 현재까지 확인된 영향은 해당 사이트의 데이터에 국한되며, 감사는 계속 진행 중입니다. Irregular는 평가를 중단하고 복구 작업을 시작했으며, 영향을 받은 제3자에게도 이를 통보했습니다. 또한 이번 사고와 관련해 확인된 모든 문제는 더 이상 유효하지 않으며, 테스트 환경에는 적절한 보호 조치가 추가되었다고 알려왔습니다. Irregular는 동일한 테스트 환경에서 발생한 다른 연구소의 관련 사고에 대해서도 정보를 공유했습니다.

Irregular의 협력에 감사드리며, 검토 작업을 지원하기 위해 앞으로도 긴밀히 협력해 나갈 예정입니다. Irregular는 사고 대응과 안전한 사이버 평가 운영을 위한 모범 사례를 공유하기 위한 백서도 준비하고 있습니다. OpenAI도 이 백서 작성에 참여해 연구 결과를 커뮤니티와 공유하고, 앞으로도 협력을 이어가기를 기대합니다. 이러한 협력은 현재와 미래의 모델을 안전하고 철저하게 평가하는 데 필수적이라고 생각합니다.

작성자

OpenAI