메인 콘텐츠로 건너뛰기
OpenAI

2026년 9월 28일

안전

프런티어 AI 학습의 안전성 입증 자료를 향하여

로딩 중...

우리는 모든 프런티어 강화학습 실행을 계속 진행하기에 앞서 체계적인 안전성 문서가 요구되어야 하는 새로운 시대에 진입하고 있다고 생각합니다. 이상적으로 이러한 문서는 안전이 핵심인 다른 산업에서 사용되는 ‘안전성 입증 자료’ 수준에 도달해야 합니다. 이는 위험에 관해 증거에 기반하여 포괄적이고 체계적으로 구성한 논증을 뜻합니다. 우리는 안전성 입증 자료를 장기적으로 지향하며 구축해 나갈 목표로 삼고 있습니다. 다만 AI 역량이 새로운 수준에 도달할 때마다 새로운 복잡성이 나타나기 때문에, AI 모델의 안전성 입증 자료를 항공이나 원자력 분야만큼 엄밀하게 만드는 데 어려움이 있다는 점도 인정합니다. 이러한 관행을 명문화하기 위한 프레임워크를 마련하고 있습니다.

아래는 프런티어 AI 학습을 위한 안전성 입증 자료에 포함되어야 한다고 생각하는 초기 지침입니다. 이 모범 사례에는 지금까지 얻은 교훈이 반영되어 있습니다. 신중한 개발을 위한 내부 절차를 지속적으로 개선하면서 모범 사례도 발전해 나갈 것으로 기대합니다. 현재의 생각을 투명하게 공개하고 커뮤니티의 의견을 듣고자 지금 공유합니다. 이 문서는 프런티어 강화학습에 초점을 맞추고 있습니다. 내부 및 외부 배포에서는 훨씬 더 폭넓은 정렬 속성을 고려해야 합니다.

1. 기술적 안전장치

안전성 입증 자료는 기술 스택의 세 가지 측면인 정렬 학습, 격리, 모니터링을 다뤄야 합니다. 이러한 안전장치는 모델이 비정렬 행동을 시도하지 않도록 돕습니다. 설령 시도하더라도 격리 환경을 벗어나기 어렵게 하고, 피해가 발생하기 전에 모니터링을 통해 이를 탐지하도록 합니다.

  • 모델 정렬: 첫 번째 방어선은 모델을 정렬되도록, 즉 우리가 의도한 방식으로 일관되게 행동하도록 학습시키는 것이어야 합니다. 여기에는 다음 사항이 포함될 수 있습니다.

    • 학습 환경 및 채점: 학습 중 보상 해킹이 긍정적으로 강화되지 않도록 하여, 모델이 비정렬 행동을 습득할 위험을 줄여야 합니다. 여기에는 다음 사항이 포함될 수 있습니다.

      • 자동화된 데이터셋 검토: 에이전트를 활용하여, 의도된 행동이 아닌 허점 악용으로 비정렬 행동 경로에 높은 보상이 주어질 수 있는 결함 있는 강화학습 환경을 찾아 수정해야 합니다. 이를 통해 학습 중 비정렬이 강화될 기회를 줄여야 합니다.

      • 수동 데이터셋 검토: 데이터셋에 대한 수동 검토와 품질 점검으로 자동화된 레드팀 테스트를 보완하여, 비정렬 행동을 의도치 않게 강화할 수 있는 결함 있는 과제를 찾아야 합니다.

      • 채점기 조정: 학습 중 모델이 강화학습 환경의 허점을 악용하거나 해킹하려는 시도에 불이익을 주도록 채점기를 조정해야 합니다.

      • 이전 학습 실행 분석: 이전 실험의 실행 기록에 분류기를 적용하여 채점기가 의도대로 작동하는지 확인해야 합니다.

    • 정렬 측정: 모델의 비정렬 성향을 추적하는 평가를 실시하여 정렬 학습의 효과를 측정해야 합니다. 여기에는 다음 사항이 포함될 수 있습니다.

      • 오프라인 정렬 평가: 프런티어 학습 실행 중 정렬 평가를 실시하여 학습이 의도대로 이루어지는지 확인하고, 유의미한 성능 저하가 있으면 조사해야 합니다.

      • 백테스트: 과거 사고에 정렬 평가를 적용하는 백테스트를 실시하여, 평가가 과거의 비정렬 모델을 탐지하고 특정 사고에 과적합되지 않는지 확인해야 합니다.

      • 평가 편법 추적: 행동 변화를 유발할 수 있는 평가 상황 인지 또는 메타게이밍(모델이 테스트받고 있음을 인식하는 현상)을 추적하고, 구체적인 차단 임계값을 설정해야 합니다. 예를 들어 정렬 평가에서 평가 상황 인지 및 메타게이밍 모니터를 활성화할 수 있습니다.

      • 최악의 상황에 대한 스트레스 테스트: 최악의 문제 행동을 유도하고, 하나 이상의 평가가 이 행동을 탐지할 수 있는지 확인해야 합니다.

    • 추론 과정을 대상으로 한 학습 방지: 모델이 추론 과정 모니터를 회피하는 방향으로 발전하지 않도록, 강화학습 중 자동 채점기가 추론 과정을 볼 수 없게 해야 합니다.

  • 격리: 모델이 비정렬 상태가 되더라도 유해한 행동이 발생하지 않도록 샌드박싱과 보안을 충분히 강화해야 합니다. 여기에는 다음 사항이 포함될 수 있습니다.

    • 다층 인프라 보안: 샌드박스 탈출이 발생하더라도 추가적인 보호 계층이 있도록, 모델이 실행되는 샌드박스와 이를 호스팅하는 연구 인프라 양쪽의 보안 강화에 적극적으로 투자해야 합니다.

    • 격리 환경 레드팀 테스트: 안전성 분석을 거친 뒤 프런티어 학습 실행의 체크포인트를 활용하여 샌드박스, 연구 인프라, 경계 보안 시스템에 반복적으로 레드팀 테스트를 수행해야 합니다. 이를 통해 허점을 찾아 보완하고 보안을 개선해야 합니다. 또한 모델이 학습 중 접근할 수 있는 모든 서비스(예: 인터넷 캐시)에 대해서도 레드팀 테스트를 수행해야 합니다.

    • 샘플 간 통신: 고대역폭 샘플 간 통신을 다중 에이전트 도구 같은 승인된 경로로 제한하고, 에이전트가 쉽게 발견할 수 있는 고대역폭 인프라 부채널을 차단해야 합니다.

    • 변경 불가능한 대화 기록: 모든 강화학습, 평가, 내부 배포에서 에이전트의 대화 기록을 적절한 기간 동안 변경 불가능한 형태로 보관해야 합니다(예: 한 번만 쓸 수 있는 스토리지 계정에 저장). 이를 통해 신뢰할 수 있는 사고 조사가 가능하도록 하고 의도치 않은 수정을 방지해야 합니다.

  • 모니터링: 모델이 비정렬 행동을 하기 시작하면 잠재적인 비정렬을 탐지할 수 있도록 실시간 모니터링 시스템을 갖춰야 합니다. 또한 심각한 사고가 발생하기 전에 우선순위가 높은 문제에 신속히 대응해야 합니다. 여기에는 다음 사항이 포함될 수 있습니다.

    • 모니터링 가능성 확보: 우려되는 행동을 조기에 탐지할 수 있도록, 명확한 임계값을 갖춘 모니터링 가능성 평가와 모니터 회피 평가를 통해 모델이 계속 모니터링 가능한 상태인지 확인해야 합니다.

    • 알려진 문제에 대한 높은 재현율: 별도로 분리해 둔 평가 데이터에서 모니터링 시스템이 과거 사고에 대해 높은 재현율을 보이는지 확인해야 합니다.

    • 모니터 평가의 최신성: 모니터의 재현율과 정밀도 측정이 최신 위험을 반영하도록, 새로운 학습 실행에서 새롭게 나타나는 위험을 대표하는 평가 데이터 항목을 만들어야 합니다.

    • 신속한 대응: 모델이 피해를 일으키기 전에 당직 담당자를 호출하거나 해당 학습 실행을 자동으로 일시 중지하여, 정해진 서비스 수준 협약(SLA) 내에 조치로 이어지는 우선 알림을 구현해야 합니다. 예를 들어 주간 사고 발생 시 보안 당직 담당자와 학습 실행 책임자를 호출하고, 야간에 알림이 확인되지 않으면 학습 실행을 자동으로 일시 중지할 수 있습니다.

2. 운영 지침

기술적 안전장치에 관한 권고와 함께, 프런티어 AI 학습 실행의 안전성 입증 자료를 위한 운영 모범 사례도 마련하고 있습니다. 여기에는 다음 사항이 포함될 수 있습니다.

  • 반대 의견(사전 실패 분석): 안전성 입증 자료의 초안이 작성되면 다른 팀의 구성원이 반대 의견을 작성하여 잠재적인 허점을 찾고 위험에 대한 균형 잡힌 판단을 공유해야 합니다. 이후 학습 담당 팀이 이에 대응하여 안전성 입증 자료의 완성도를 높여야 합니다.

  • 승인: 고위 경영진(예: 연구 조직 책임자 또는 부사장, 안전 총괄, 수석 과학자)이 안전성 입증 자료를 검토해야 합니다. 학습 실행에 대한 내부 견제가 여러 단계에서 이루어지도록 이들 각자에게 실행을 거부할 권한이 있어야 합니다.

  • 책임: 학습 실행을 책임지는 고위 경영진(예: 연구 조직 책임자 또는 연구 담당 부사장)은 안전성 입증 자료와 모든 사고 대응에 책임을 져야 하며, 이를 성과 평가에도 반영해야 합니다. 이를 통해 학습 담당 팀도 안전성과 정렬을 적극적으로 추진할 동기를 갖도록 해야 합니다.

  • 일시 중지: 안전성 입증 자료의 유효성을 무너뜨릴 수 있는 문제(예: 새로운 보안 문제)가 발견되면, 해당 자료가 포괄하는 모든 학습 실행을 일시 중지할 수 있도록 운영 절차서, 기술적 통제 수단, 서비스 수준 협약(SLA)을 마련해야 합니다.

  • 내부 투명성: 내부 감독 기구(예: 안전 및 보안 위원회)가 안전성 입증 자료를 열람할 수 있어야 합니다.

  • 감사: 감사 담당자가 안전성 입증 자료의 주장이 유효하고 타당한지 검증하고, 미비점을 발견하면 지적할 수 있도록 충분한 접근 권한을 제공해야 합니다.

  • 상위 보고: 비정렬 문제를 상위 의사결정자에게 보고하는 명확한 절차와 비정렬 심각도 등급표가 있어야 합니다. 또한 학습 실행 중 문제가 일정 심각도에 도달하면 경영진(예: CEO)을 호출할 수 있는 비정렬 대응 당직 담당자가 있어야 합니다.

  • 기술적 통제: 사람과 에이전트가 규정을 준수하지 않는 학습 실행을 시작하기 어렵게 해야 합니다. 모니터링과 자동 일시 중지 같은 안전 기능은 장애가 발생하면 실행을 차단하는 방식으로 작동해야 합니다. 예를 들어 적절한 모니터링을 활성화하지 않은 상태에서는 학습 실행을 시작할 수 없어야 하며, 강화학습, 평가 또는 내부 배포 환경에서 모니터를 비활성화할 수 없어야 합니다.

  • 롤백 기능: 필요할 때 비정렬 출력의 영향을 되돌릴 수 있도록, 학습 과정에서 비정렬 모델이 활용되는 모든 후속 용도(예: 데이터 생성 또는 채점)를 쉽게 파악할 수 있어야 합니다.

  • 잔여 위험의 포괄적 파악: 충분한 정보를 바탕으로 위험 수용 여부를 결정할 수 있도록, 안전성 입증 자료에는 현재 시행 중인 완화 조치로 해결되지 않는 잔여 위험을 최대한 빠짐없이 나열해야 합니다.

이는 현재의 권고 사항이며, OpenAI에서 도입을 진행하고 있습니다. 앞으로 몇 주에 걸쳐 이러한 관행을 계속 발전시켜 나갈 것으로 예상합니다.

3. 비정렬 사고 조사

심각한 AI 비정렬 사고를 조사하기 위한 모범 사례도 마련하고 있습니다. 연구 기관은 향후 유사한 사고를 방지할 수 있도록 개별 사고에서 최대한 많은 교훈을 얻어야 합니다. 이는 사고의 파급력이 큰 다른 산업의 조사 관행⁠(새 창에서 열기)과 유사합니다. 이를 위한 조치에는 다음과 같은 예가 있습니다.

  • 내부 투명성: 조사가 끝날 때까지 상당한 시간이 걸릴 수 있으므로, 사고 조사 진행 상황을 내부에 주기적으로 공유해야 합니다(예: 진행 중인 조사의 일일 현황 공유). 안전하고 업무와 관련이 있는 경우, 직원이 대화 기록 원문 열람이나 비정렬 모델의 출력 샘플링 등 추가적인 접근 권한을 얻을 수 있는 명확한 절차가 있어야 합니다.

  • 비정렬의 근본 원인: 연구자는 학습 과정의 동역학에서 근본 원인을 찾아 비정렬 행동이 어떻게 생겨났는지 파악해야 합니다(예: 특정 요소를 제거하는 실험이나 재샘플링 실험 활용). 이를 통해 비정렬에 대한 과학적 이해를 높이고 향후 비정렬을 더 효과적으로 예방해야 합니다.

  • 사후 분석: 문제가 왜 생겼는지, 사고 전에 왜 탐지되지 않았거나 상위에 보고되지 않았는지 등 사고에 기여한 모든 원인을 파악하기 위해 운영 및 조직 문화 측면의 사후 분석을 수행해야 합니다.

  • 탐지: 사고에서 얻은 정보(예: 대화 기록이나 사고 요약)에 직접 맞춰 반복 최적화하지 않으면서도, 해당 사고를 일으킬 성향을 발견할 수 있는 정렬 테스트 방법을 개발해야 합니다. 향후 모델이 매우 유사한 사고 상황에서 비정렬 성향을 보이지 않도록, 사고를 바탕으로 한 평가를 ‘회귀 테스트’로 마련해야 합니다.

  • 대외 공개: 조사가 끝나면 조사 결과, 사후 분석, 운영상의 변경 사항을 대중에게 공개해야 합니다. 영향을 받은 제3자에게는 가능한 한 빨리 알려야 합니다.

작성자

OpenAI