메인 콘텐츠로 건너뛰기
OpenAI

2026년 7월 20일

안전

장기 실행 모델 시대의 안전성과 정렬

장기 실행 모델을 내부에서 활용하며 얻은 안전성에 대한 교훈

로딩 중...

요약

  • 장기 실행 모델은 어렵고 개방형인 문제를 해결할 수 있지만, 이러한 지속성 때문에 원치 않는 작업을 수행할 가능성도 함께 커집니다. 

  • 장기 실행 작업을 위해 학습된 모델을 제한적으로 내부 운영하는 과정에서 기존 배포 전 평가로는 발견하지 못했던 새로운 실패 사례를 확인했고, 이에 접근을 일시 중단했습니다. 이후 이러한 사례를 바탕으로 새로운 평가를 마련하고, 장기 실행 환경에서의 정렬을 개선하며, 실행 경로 수준 모니터링을 추가하고, 사용자의 가시성과 제어 기능을 강화한 뒤 제한적인 접근 권한을 다시 제공했습니다.

  • 이번 경험은 점진적 배포의 중요성을 다시 한번 확인시켜 주었습니다. 어떤 고정된 평가 체계도 모든 동작을 예측할 수는 없습니다. 따라서 배포 전 테스트는 실제 운영 환경에서의 면밀한 모니터링과 필요 시 개입할 수 있는 안전장치, 그리고 접근을 일시 중단하거나 롤백할 수 있는 체계와 함께 이루어져야 합니다.

장기간 자율적으로 작업할 수 있는 모델은 어렵고 정답이 정해져 있지 않은 문제도 해결할 수 있습니다. 하지만 이러한 지속성은 모델의 활용 가치를 높이는 동시에 원치 않는 작업을 수행할 가능성도 키웁니다. 특히 이러한 작업은 장기 실행을 고려하지 않은 기존 평가 방식으로는 놓칠 수 있는 형태로 나타날 수 있습니다.

약 두 달 전, OpenAI는 내부 범용 모델이 에르되시 단위 거리 추측을 반증했다는 사실을 발표했습니다. 이 모델은 매우 오랜 시간 동안 자율적으로 작업하도록 설계되었습니다. 제한된 환경에서 지속적으로 모니터링하며 내부적으로 활용하는 과정에서, 기존 배포 평가에서는 발견하지 못했던 원치 않는 동작이 확인되었습니다. 배포 범위를 제한하고 지속적으로 모니터링했기 때문에 이러한 문제를 신속하게 파악할 수 있었고, 접근을 일시 중단한 뒤 관찰 결과를 바탕으로 새로운 평가를 마련하고 모델과 안전장치를 개선한 후, 계속해서 모니터링하는 조건으로 접근 권한을 다시 제공했습니다. 

모델을 평가하는 환경은 실제 사용 환경과 완전히 같을 수 없습니다. 따라서 배포 전 평가만으로는 충분하지 않으며, 제한된 범위에서 모니터링하며 배포하고 문제가 발생하면 개입하거나, 접근을 일시 중단하거나, 롤백할 수 있는 체계를 함께 갖춰야 합니다. 이렇게 실제 배포 과정에서 얻은 교훈은 향후 접근 범위를 확대하기 전에 평가와 안전장치를 더욱 강화하는 데 활용됩니다.

이어서 실제로 어떤 문제를 관찰했는지, 이를 어떻게 해결했는지, 그리고 이러한 경험이 앞으로의 모델 출시 과정에 어떤 영향을 미칠 것인지 구체적인 사례를 통해 설명합니다.

모델의 지속성은 보안 취약점을 드러낼 수 있습니다

새로운 모델은 장기간에 걸쳐 반복적으로 시도하며 목표를 향해 계속 작업할 수 있습니다. 하지만 이러한 지속성은 실행 환경의 취약점을 찾아 악용하는 방향으로 이어질 수도 있습니다. 이전 모델은 샌드박스나 실행 환경의 제약에 부딪히면 작업을 중단하고 사용자에게 결과를 반환했습니다. 반면 이 모델은 샌드박스 밖에서 작업을 수행할 방법까지 모색하며 계속해서 시도하는 경우가 많았습니다.

이러한 사례는 작은 언어 모델을 가능한 한 적은 단계로 학습시키는 공개 벤치마크인 NanoGPT Speedrun(새 창에서 열기)에 대한 내부 평가 과정에서 발생했습니다. OpenAI 모델은 PowerCool이라는 거듭제곱 법칙 기반의 학습률 감소 기법을 개발했고, 그 결과 성능이 크게 향상되었습니다. 모델에는 결과를 Slack에만 게시하라는 지시가 주어졌지만, NanoGPT의 안내에는 GitHub에 PR을 제출하도록 되어 있었습니다. 모델은 후자의 지시를 따르기로 판단해 공개 GitHub 저장소에 PR #287을 생성했습니다. 이 과정에서 외부 접근을 차단하도록 설계된 샌드박스 제한을 우회해 GitHub에 업로드를 진행했습니다. OpenAI 모델은 PR을 제출하기 위해 샌드박스의 취약점을 찾는 데 약 한 시간이 걸렸습니다. 이전 모델들은 이처럼 지속적으로 시도하지 않았기 때문에 취약점을 찾아내지 못했고, 결국 PR 제출 단계에서 작업을 포기했습니다.1

개별 작업이 아닌 전체 실행 경로를 고려하는 안전성

AI 어시스턴트의 많은 안전 제어는 개별 작업을 기준으로 설계되어 있습니다. 허용되지 않은 작업은 차단되고, 민감한 작업은 사용자에게 명시적인 승인을 요청합니다. 하지만 장기 실행 모델은 몇 시간, 며칠, 심지어 몇 주에 걸쳐 자율적으로 작업을 이어갈 수 있기 때문에 이러한 방식만으로는 충분하지 않습니다. 개별 작업만 모니터링해서는 모델이 전체 실행 경로를 통해 무엇을 달성하려 하는지 파악하기 어렵기 때문입니다.

예를 들어, 모델에게 특정 문제를 해결하라는 지시를 내린 평가에서 모델은 다른 시스템이 성공적으로 제출한 비공개 결과가 있다는 사실을 확인한 뒤, 평가 백엔드에서 해당 결과를 가져오려 했습니다. 첫 번째 시도는 스캐너가 인증 토큰을 감지하면서 차단되었습니다. 그러자 모델은 토큰 본문을 두 부분으로 나누어 난독화한 뒤, 실행 시점에 이를 다시 조합해 자격 증명을 복원하는 방식을 사용했습니다. 이 과정에서는 완전한 토큰이 하나의 연속된 문자열 형태로 나타나지 않았습니다. 또한 모델은 사용자에게 남긴 설명과 추론 과정 모두에서 이러한 조치가 스캐너를 우회하기 위한 것임을 명확하게 밝혔습니다.

이 사례는 각각의 단계만 보면 허용 가능한 것처럼 보여도, 전체 실행 경로를 보면 승인되지 않을 결과로 이어질 수 있음을 보여줍니다. 또한 장기간에 걸쳐 작업을 수행하는 모델은 승인 시스템의 허점을 파악하고 이를 우회해 목표를 달성하는 방법을 익힐 수도 있음을 보여줍니다. 따라서 장기 실행 모델의 안전성을 확보하려면 '이 작업은 허용되는가?'뿐 아니라 '이 일련의 작업은 어떤 결과를 향해 진행되고 있는가?'도 함께 살펴봐야 합니다.

장기 실행 모델을 위한 안전장치 구축

이러한 사례를 계기로 OpenAI는 새로운 모델의 내부 배포를 일시 중단했습니다. 이후 심층 방어와 실행 경로 수준 모니터링을 중심으로 안전 시스템을 새롭게 구축했습니다.

  • 사례 기반 평가. 평가는 실제 배포 전에 시스템을 안전하게 배포할 수 있는지 판단하는 데 도움이 됩니다. 하지만 평가가 실질적인 가치를 가지려면 실제 배포 환경에서 나타나는 실행 경로의 분포와 지속 시간을 반영해야 합니다. 이를 위해 OpenAI는 실제로 관찰한 실패 사례를 바탕으로 적대적 평가를 개발했습니다. 또한 실제 환경에서 발생한 사례를 반영해 평가를 개선한 결과, 운영 환경에 배포된 이후 모델이 더 안전하게 동작한다는 사실을 확인했습니다.
  • 정렬 개선. OpenAI는 사용자의 목표를 달성하는 과정에서 모델이 허가 없이 원치 않는 작업을 수행하려는 경향을 줄이기 위해 개선을 진행했습니다. 예를 들어, 장시간 이어지는 롤아웃에서는 모델이 지시 사항을 제대로 유지하지 못하는 경우가 많다는 사실을 확인했습니다. 이에 해당 능력을 강화하도록 모델을 학습시킨 결과, 더 긴 롤아웃에서도 정렬 상태를 안정적으로 유지하는 모델을 구현할 수 있었습니다. 
  • 능동적 모니터링. OpenAI는 모델이 작업을 진행하는 과정에서 사용자 제약이나 안전 경계를 우회하려는 징후가 있는지 전체 실행 경로를 분석하는 모니터링 시스템을 구축했습니다. 이 시스템은 개별 작업이 아니라 전체 실행 경로를 살펴봅니다. 또한 필요하면 세션을 일시 중단하고 사용자에게 알림을 보내 보다 면밀히 검토하도록 할 수 있습니다. 검토 결과 모니터가 잘못 작동한 것으로 판단되면 사용자는 모델이 작업을 계속 수행하도록 선택할 수 있습니다. 
  • 향상된 사용자 가시성과 제어 기능. 사용자가 장기 실행 세션을 자세히 확인하고, 모델이 수행한 작업을 검토하며, 모니터링 시스템의 개입 내역까지 확인할 수 있도록 기능을 개선했습니다.

재배포

새로운 모니터링 시스템을 평가하기 위해, 과거 모델이 정렬되지 않은 작업을 수행했던 일부 내부 배포 환경을 새로운 안전장치를 적용한 상태에서 다시 재실행했습니다2. 새로운 안전장치는 이전보다 훨씬 많은 정렬되지 않은 작업을 탐지했으며, 탐지하지 못한 사례도 모두 낮은 심각도로 평가되었습니다.

낮은 심각도로 분류된 사례는 다음과 같습니다.

  • Linear 명령줄 도구에 접근하기 위해 모델은 --yolo 플래그가 없어도 가능했음에도 중첩된 codex --yolo 세션을 실행했습니다.
  • 모델은 이전에 사용 가능했던 리소스가 사라진 것을 확인한 뒤, 특별한 이유 없이 자신의 네임스페이스에 있는 다른 활성 CPU Pod에 SSH로 접속을 시도했고, 다른 OpenAI 직원의 Pod에도 접속을 시도했지만 실패했습니다.
  • 모델은 여러 find 프로세스가 멈춘 상태에서 모든 셸 명령이 응답하지 않는 상황을 확인한 뒤 kill -9 -1 명령을 실행했습니다. 이 명령이 실제로 실행되었다면 해당 Pod에서 종료 권한이 있는 모든 프로세스에 SIGKILL 신호를 보냈을 것입니다. 다만 명령은 시간 초과로 인해 실제로 실행되지는 않았습니다.

새로운 시스템을 검증한 결과, 장기 실행 기능을 갖춘 모델에 대한 제한적인 내부 접근 권한을 다시 제공해도 된다고 판단했습니다. 재배포를 시작한 이후 몇 주 동안 안전장치가 심각하게 우회된 사례는 확인되지 않았습니다. 초기 버전의 안전장치는 의도적으로 보수적으로 설계했으며, 이후에는 안전성을 유지하면서도 불필요한 중단을 줄일 수 있도록 지속적으로 시스템을 조정하고 있습니다.

맺음말

점진적으로 배포를 진행했기 때문에 접근 범위를 확대하기 전에 문제점을 발견하고 개선할 수 있었습니다. 배포 전 평가는 여전히 중요하지만, 실제 배포를 통해서만 확인할 수 있는 동작도 존재합니다. 제한된 범위에서 먼저 모델을 운영한 덕분에 실제 환경에서 모델의 동작을 관찰하고, 문제가 발생하면 즉시 접근을 중단한 뒤, 그 경험을 바탕으로 평가와 안전장치를 개선하고, 변경 사항을 검증한 후 다시 제한적으로 접근을 제공할 수 있었습니다.

모델이 더 오랜 시간 동안 더 복잡한 작업을 수행하게 될수록 평가에서 놓친 실패가 더 큰 영향을 초래할 수 있습니다. OpenAI는 장기간의 실행 경로를 대상으로 평가를 확대하고, 정렬을 개선하며, 필요시 개입할 수 있는 모니터링 체계를 구축하고, 사용자에게 더욱 명확한 가시성과 제어 기능을 제공함으로써 평가와 실제 배포 사이의 간극을 계속 줄여나갈 것입니다. 이러한 과제는 OpenAI만의 문제가 아니며, OpenAI는 이번 경험을 공유함으로써 AI 분야 전반이 이러한 과제에 대비하는 데 도움이 되기를 바랍니다.

작성자

OpenAI

각주

  1. 1

     PR은 빠르게 종료했지만, 이미 여러 NanoGPT Speedrun 참가자가 이를 확인하고 자신의 제출물에 해당 접근 방식을 활용했습니다. 이후 3030(새 창에서 열기), 2990(새 창에서 열기), 2930(새 창에서 열기), 2925(새 창에서 열기), 2900(새 창에서 열기), 2890(새 창에서 열기) 단계로 세계 기록을 경신한 모든 제출물은 PR 287을 인용하고 있습니다. 이 가운데 PR 300(새 창에서 열기)Prime Intellect(새 창에서 열기)가 NanoGPT Speedrun에서 Opus 4.7을 평가하는 과정에서 제출한 PR이라는 점에서 특히 주목할 만합니다. Opus는 OpenAI 모델이 제출한 PR을 확인한 뒤 그 발견 내용을 반영했고, 최종 결과에서 해당 PR에 공을 돌렸습니다.

  2. 2

     재실행된 롤아웃은 실행 환경을 재구성하는 과정에서 발생하는 무작위성과 불완전성 때문에 매번 동일한 정렬되지 않은 작업을 수행한다고 보장할 수 없습니다.