조직적인 모델 증류 활동 차단
OpenAI는 최근 자사 모델에서 보호된 추론을 추출하려는 조직적인 활동을 적발하고 차단했습니다. 해당 활동이 처음 관측된 시점은 7월 첫째 주였습니다. 이 활동은 적대적 증류의 양상과 일치합니다. 적대적 증류란 한 모델의 출력이나 추론을 체계적으로 무단 사용해 다른 모델의 학습, 재현 또는 개선에 활용하는 행위입니다. 보호된 추론은 모델이 작업을 수행하는 과정의 내부 기록입니다. 이를 추출하면 최종 답변에서 제외된 정보가 드러날 수 있고, 다른 주체가 해당 모델의 역량을 재현하는 데 도움이 될 수 있습니다.
공격자들이 OpenAI의 암호화를 해독하거나 데이터베이스를 침해한 것은 아니며, 저장된 사용자 대화에 직접 접근한 것도 아닙니다. 대신 모델과의 상호작용을 조작해 보호된 추론이 요청자에게 보이는 형태로 재현되도록 했습니다. 이는 OpenAI의 서비스 약관을 위반하는 조직적이고 대규모적인 행위였습니다. 이러한 조작은 OpenAI 모델만의 취약점을 이용한 것이 아닙니다. OpenAI는 적대적 증류에 대한 공동 방어 역량을 강화하고자 프런티어 모델 포럼을 통해 업계 파트너들과 관련 정보를 공유했습니다.
이 글을 공개하기에 앞서 활동의 범위와 잠재적 영향을 조사하고 자체 완화 조치를 적용했습니다. 또한 연구자 및 업계 파트너들과 정보를 공유하고 의견을 수렴해 이러한 유형의 공격에 대한 보호 조치가 마련되도록 했습니다. 추가 완화 조치와 조사도 계속 진행하고 있습니다. 지금까지 파악한 내용을 공유하는 것이 생태계 전반의 방어 역량 강화에 도움이 될 것이라 믿습니다.
공격자들이 새로운 방식으로 보호된 추론을 추출하려는 시도를 관측했습니다. 한 대화에서 암호화된 추론을 복사한 뒤, 다른 대화에서 모델에 숨겨진 추론 내용을 복호화해 그대로 적어 달라고 요청하는 방식 등이 있었습니다.
독립 보안 연구자들(새 창에서 열기)도 책임 있는 취약점 공개 절차를 통해 모델 간 상호작용 및 대화의 컨텍스트 압축과 관련된 취약점을 제보했습니다. OpenAI는 연구자들의 조사 결과를 검토하고, 이들이 발견한 공격 경로가 실제로 존재함을 확인했습니다. 이들의 연구는 해당 공격 유형을 더 폭넓게 이해하고 완화 조치를 신속히 추진하는 데 도움이 되었습니다.
이 활동은 7월 1일에 시작되었으며, 초기에는 소규모로 이루어졌습니다. 이후 7월 24일과 25일에 활동량이 급증하면서 4,000명이 넘는 사용자가 관련 추출 패턴을 사용한 요청 16,000건1을 보낸 것이 관측되었습니다. 추가 조사에서는 15,000명이 넘는 사용자 집단 전반에서 관련 프롬프트 패턴을 사용하는 활동을 확인했으며, 7월 28일까지 이를 완전히 차단했습니다.
이 활동은 시간이 지나면서 변화했습니다. 이는 적대적 증류가 여러 층위의 방어와 지속적인 대응 조정을 필요로 하는 광범위한 보안 과제임을 보여줍니다.
해당 기간에 관측된 모든 공격자가 단일 주체에 속했는지는 불분명합니다. 다만 핵심적인 활동 집단은 Kimi 개발사인 Moonshot AI와 연관된 개인들로 판단하고 있습니다.
적대적 증류는 안전과 국가 안보에 위험을 초래합니다. 추출된 추론은 원래 모델의 사용자 대상 출력에 적용된 안전장치를 유지하지 않은 채 다른 모델을 학습시키는 데 사용될 수 있습니다. 또한 대규모 증류는 안전에 같은 수준으로 투자하지 않고도 첨단 역량의 이전을 가속할 수 있습니다. 모델이 민군 겸용 분야에서 역량을 갖춰 갈수록 이러한 우려는 커집니다.
이 위험은 OpenAI만의 문제가 아닙니다. 앞서 언급했듯이 유사한 기법은 다른 첨단 AI 시스템에도 영향을 미칠 수 있습니다. 따라서 이는 업계 전반의 공조가 필요한 공동의 보안 과제입니다.
OpenAI는 계정 제재, 기술적 통제, 파트너와의 공조를 병행해 이번 증류 활동에 대응했습니다. 부정 계정을 차단하거나 제한하고, 가입 및 인프라 통제를 강화했으며, 관련 네트워크에 대한 모니터링을 확대했습니다.
또한 사용자, 워크스페이스, 조직, 모델 계열 전반에서 숨겨진 추론을 보호하는 조치를 강화했습니다. 다른 사용자의 암호화된 추론을 이미 보유한 사람이 이를 재전송해 내용을 복원할 수 있었던 경로를 차단했습니다. 추론을 노출할 가능성이 있는 스트리밍 출력을 탐지하고 전송을 보류하는 검사 절차도 추가했습니다. 관련 활동이 타사 서비스를 통해 이루어지는 경우, 해당 서비스 제공업체와 협력해 연루된 계정을 식별하고 차단했습니다.
마지막으로 프런티어 모델 포럼과 적절한 정부 정보 공유 채널을 통해 관련 조사 결과를 공유했습니다. 이를 통해 다른 프런티어 모델 개발사와 공공 부문 파트너들이 유사한 활동을 찾아내고 자체 방어 역량을 강화할 수 있도록 했습니다. 추론 산출물의 이동이나 재전송을 지원하는 시스템도 유사한 위험에 직면할 수 있습니다.
프런티어 모델이 발전하고 공격자들이 더 적은 비용으로 그 역량을 모방할 방법을 찾으면서, 적대적 증류 시도도 더욱 정교해질 것으로 예상합니다. 이러한 활동을 방어하려면 다층적인 통제와 지속적인 대응 조정이 필요합니다.
이 작업은 아직 끝나지 않았습니다. 파트너가 호스팅하는 배포 환경에도 직접 제공하는 서비스와 동일한 보호 조치가 필요합니다. 또한 도구 출력을 이용한 공격에 대응하려면 눈에 보이는 일반 텍스트 이외의 내용까지 검사하는 보호 조치가 필요합니다. OpenAI는 도구 방어 체계, 분류기의 탐지 범위, 모델의 요청 거부 기능을 지속적으로 개선하고 있으며, 관련 통제 조치를 클라우드 파트너 전반으로 확대 적용하고 있습니다.
앞으로도 세 가지 영역에 집중해 대응하겠습니다. 추출을 막는 기술적 보호 조치를 강화하고, 조직적인 활동에 대한 탐지와 제재를 개선하며, 업계와 정부 간 위협 정보 공유를 심화하겠습니다.

