메인 콘텐츠로 건너뛰기
OpenAI

2026년 9월 22일

안전

효과적인 제3자 평가를 위한 우선순위와 원칙

로딩 중...

프런티어 AI 연구소에는 모델을 안전하게 학습·평가·배포할 막중한 책임이 있습니다. 제3자 평가는 이러한 책임의 균형을 맞추고, AI 안전성에 관한 의견 수렴 기회를 확대하며, 대중에게 정보를 제공하고, 명확하고 독립적으로 뒷받침된 안전성 주장에 대해 연구소가 책임지게 하는 데 핵심적인 역할을 합니다.

OpenAI는 프런티어 발전 속도에 보조를 맞추려는 노력의 일환으로, 학습·평가·배포 전반에 대한 심층적인 접근 권한을 제공해 독립 평가를 지원하고자 합니다. 이러한 접근 권한을 통해 평가자는 우리의 가정에 이의를 제기하고, 우리가 놓쳤을 수 있는 위험을 파악하며, 보호장치의 효과에 관해 독자적인 결론을 내릴 수 있어야 합니다.

우리는 오랫동안 모델 개발 및 배포 절차의 여러 단계에서 제3자 평가자와 협력해 왔습니다. 또한 제3자 평가를 준비성 평가 프레임워크 관행에 통합하고, 더욱 엄격하고 책임 있는 절차를 지지하는 단체와 법률을 지원해 왔습니다. 이러한 협력 과정에서 기술적 보호장치에 관한 정보, 가시적인 추론 과정에 대한 접근 권한, 사고 대응과 모니터 레드팀 테스트를 위한 전례 없는 수준의 기밀 데이터 및 내부 배포 접근 권한 등 심층적인 접근 방식을 제공했습니다. 여기서 공유하는 우선순위와 원칙은 민간 및 비영리 부문의 독립 평가 기관과 수행하는 기술 안전성 평가에 중점을 둡니다. 이는 역할과 책임의 차이에 따라 다른 접근법이 필요할 수 있는 정부와의 테스트 및 평가 작업을 보완합니다.

이러한 평가가 효과적이려면 강력한 독립성 보장 체계, 과학적 엄밀성, 견고한 보안 관행 및 명확한 책임이 필요합니다. 연구소는 민감한 정보를 보호하면서도 실질적인 검증이 이루어지도록 할 책임이 있습니다. 연구소와 독립 평가자는 이 일을 올바르게 수행할 책임을 함께 지며, 안전 및 보안 관행에 관한 국제 공통 기준에 따라 운영해야 합니다. 아래에서는 엄격하고 안전하며 독립적인 업무 수행 원칙과 함께, 심층 평가를 위한 네 가지 우선순위 영역을 제안합니다.

평가 우선순위 영역

제3자 평가는 구체적이고 중대한 질문을 다룰 때 가장 유용합니다. 증거가 연구소의 안전성 논증과 안전성 주장을 뒷받침하는가? 평가는 측정하려는 위험을 충분히 검증하는가? 보호장치는 현실적인 조건에서도 효과적으로 작동하는가?

여기서 설명하는 평가는 검토할 안전성 문제에 따라 다양한 형태로 진행될 수 있습니다. 일부 평가는 몇 주, 다른 평가는 수개월에 걸쳐 진행하는 등 기간을 달리해 여러 평가를 병행 지원할 예정입니다. 제3자 평가는 배포 전 작업의 일부로서 배포 결정에 참고될 수도 있지만, 여기서 설명하는 작업은 일반적으로 장기적이고 출시 여부와 무관하며, 특정 안전성 주장을 장기간 심층 검토하는 데 초점을 둡니다.

우선순위 영역과 원칙 전반에서 안전성 주장과 안전성 논증이라는 용어를 사용합니다. 이 용어들의 의미는 다음과 같습니다.

안전성 주장: 모델 또는 시스템의 역량, 동작이나 보호장치에 관한 구체적인 주장으로, 안전성과 관련되며 증거에 비추어 평가할 수 있습니다. 주장에는 다루려는 위험과 조건은 물론, 관련 가정과 한계도 명시해야 합니다.

안전성 논증: 학습, 평가 또는 배포와 같은 특정 활동에서 모델이나 시스템의 위험이 적절히 관리되는 이유를 증거에 근거해 설명하는 체계적인 논증입니다. 안전성 논증은 개별 안전성 주장과 이를 뒷받침하는 증거를 연결하고, 결론에 영향을 줄 수 있는 가정과 불확실성, 잔여 위험을 명확히 밝힙니다.

엄격하고 안전하며 독립적인 업무 수행 원칙과 함께, 심층 평가를 위한 네 가지 우선순위 영역을 제안합니다.

  1. 학습, 평가, 내부 배포 및 외부 배포 전반의 안전성 논증에 대한 독립 평가

    안전성 논증을 평가하려면 정렬, 모니터링과 같은 제어 방식, 사이버 보안, 생물학적·화학적 오용 및 레드팀 테스트에 관한 전문성이 필요합니다. 안전성 논증은 학습, 역량 평가 및 보호장치 등에 관한 주장으로 구성되며, 전체 또는 일부로 나누어 평가할 수 있습니다(아래 우선순위 2와 3 참조). 여러 평가자가 각자의 전문성을 바탕으로 논증의 서로 다른 부분을 검토해야 할 가능성이 큽니다. 이러한 평가를 종합해 다음과 같은 질문에 답해야 합니다.

    1. 학습, 평가 및 배포에 관한 안전성 논증의 증거가 충분히 입증되었는가? 학습, 평가 및 배포 과정에서 안전성 논증의 조건을 준수했는가?

    2. 안전성 논증이 평가 과정에서 확인된 가장 시급한 위험을 포괄하는가? 안전성 주장이 전반적인 안전성 논증을 뒷받침하는가? 미비점이나 개선할 영역이 있는가?

    3. 기만, 보상 해킹, 파괴적 행동 또는 제한 우회를 보상할 수 있는 학습 유인을 파악하고 줄이는 효과적인 방법을 사용하고 있는가?

  2. 내부 및 외부 배포 전반의 핵심 보호장치 평가

    보호장치 체계는 변화하는 역량과 환경에 대응하기 위해 끊임없이 발전하고 있습니다. 보호장치는 학습, 내부 배포 및 외부 배포 전반에 적용됩니다. 현재 보호장치에는 모델 수준 보호장치, 정책 집행 보호장치, 보안 보호장치와 정렬 불일치 모니터가 포함되며, 통제력 상실과 사이버·생물학·화학 분야의 오용 등 다양한 위험을 포괄합니다. 기술 파트너십을 통해 현재 보호장치의 취약점을 파악하는 동시에 평가 방법을 개선하고 기준 개발을 앞당길 수 있습니다. 이는 프런티어 발전 속도에 대응할 향후 공공 정책에 더욱 탄탄한 기술적 토대를 제공합니다. 특히 안전 및 보안 기준이 아직 초기 단계인 내부 배포에 중요합니다.

    독립 평가는 이러한 보호장치가 얼마나 효과적으로 작동하고 어디에서 부족할 수 있는지 다음과 같은 질문을 통해 검토해야 합니다.

    1. “그레이박스” 접근 권한을 활용할 때 보호장치는 적대적 테스트(탈옥)를 견딜 만큼 견고하며, 고위험 영역(예: 사이버, 생물학)에서 역량이 향상되는 것을 충분히 방지하는가? 적대적 테스트와 레드팀 테스트가 가장 중요한 위험을 포괄하는가?

    2. 현실적인 운영 조건에서 승인된 테스트를 수행할 때 에이전트는 접근 통제, 샌드박싱, 탐지 및 대응 시스템 등의 사이버 방어 체계와 어떻게 상호작용하는가? 어떤 방어 체계가 유해한 행동을 예방·탐지·억제하며, 어디에서 실패하는가?

    3. 내부 및 외부 배포 모두에서 통제력 상실이나 심각한 정렬 불일치를 초래할 수 있는 중대한 미비점이 정렬 불일치 모니터에 존재하는가? 모델 역량이 향상됨에 따라 추론 과정 모니터링은 안전성 또는 정렬의 증거로서 얼마나 신뢰할 수 있는가?

    4. 관련된 모든 학습, 평가 및 배포에 쉽게 비활성화할 수 없는 적절한 모니터링이 구현되어 있는가?

    5. 역량에 상응하는 보호장치가 구현되어 있는가?

  3. 준비성 평가 리스크 범주(화학 및 생물학적 위험, 사이버 보안, AI 자기 개선)를 포괄하는 역량 평가와 정렬 불일치 위험에 대한 정렬 평가 검토

    준비성 평가 프레임워크는 주요 프런티어 리스크 영역을 평가하도록 요구합니다. 임계치를 넘어서고 평가가 포화됨에 따라 준비성 평가 리스크 영역의 역량을 측정하는 평가와 심각한 정렬 불일치 위험을 측정하려는 정렬 평가를 지속적으로 갱신하고, 그 범위와 품질을 보장하는 것이 중요합니다.

    관련 질문은 다음과 같습니다.

    1. 준비성 평가 리스크를 측정하는 평가가 준비성 평가 리스크 임계치의 정의를 충분히 포괄하는가? 이러한 평가의 임계치가 올바르게 설정되어 있는가?

    2. 모델이 지속적으로 최고 점수를 달성하면 평가를 갱신하며, 새로운 테스트가 더 발전된 역량을 의미 있게 측정하는가?

    3. 정렬 평가가 심각한 정렬 불일치 위험을 충분히 포괄하며, 어떤 중요한 행동이나 조건을 놓칠 수 있는가?

  4. 중대한 정렬 불일치 사고에 대한 독립 조사

    독립 조사는 다양한 중대 AI 안전 사고를 다루는 데 유용할 수 있습니다. 여기서는 승인 없이 행동하거나 감독을 회피하는 모델 등 모델의 정렬 불일치에 중점을 둡니다. 이러한 사례는 의도적인 오용이 없더라도 정렬 방식과 보호장치의 취약점을 드러낼 수 있습니다.

    OpenAI Hugging Face 사고와 같은 일부 상황에서는 독립적인 정렬 불일치 사고 조사를 위해 외부 제3자를 참여시키는 것이 유용할 수 있습니다. 사고 조사에 참여하는 제3자는 조사에 필요한 전문성을 반드시 갖춰야 합니다. 해당되는 경우 사이버 포렌식과 정렬 관련 전문성, 대규모 추론 과정 분석 역량, 적시에 조사를 수행할 인력과 자원이 포함됩니다. 사고 대응 과정에서 민감한 내부 데이터와 제3자 데이터에 접근할 수 있으므로, 일부 세부 정보는 공개하거나 접근하기에 민감할 수 있습니다. 독립 조사 결과는 모델의 정렬 상태와 이전에 관찰된 정렬 불일치를 개선하기 위해 취한 조치의 효과에 관한 주장을 평가할 증거를 제공함으로써 모델의 안전성 논증에도 활용될 수 있습니다.

    정렬 불일치 사고와 관련해서는 다음 항목에 대한 독립 평가를 우선합니다.

    1. 사고 과정에서 어떤 모델 동작이나 정렬 불일치 문제가 발생했으며, 주요 원인은 무엇인가?

    2. 보호장치와 개선 조치가 향후 유사 사고를 효과적으로 완화할 수 있는가?

효과적인 평가를 위한 원칙

  • 명확한 범위와 상호 합의된 평가 주장: 평가에 앞서 범위에 상호 합의하고, 평가 활동을 시작하기 전에 명확히 정의한 안전성 주장을 사전 등록해야 합니다. 제3자와 연구소는 해당 주장이 평가 대상 기업이 평가를 위해 제시하려는 것인지, 아니면 제3자 평가자가 독립적으로 평가하고자 하며 연구소가 그 기준에 따른 평가에 동의한 것인지 명확히 해야 합니다. 제3자가 데이터에 접근하기 어렵거나 평가자의 전문성이 부족한 경우, 또는 긴급한 평가에 합리적인 시간 제약이 있는 경우 등 다양한 이유로 일부 주장이 범위에서 제외될 수 있습니다. 연구소와 평가자는 추가 조사가 필요한지를 포함해 원래 범위 밖에서 확인된 중대한 위험을 검토하는 절차를 마련해야 합니다. 결론에는 상호 합의한 범위와 관련해 무엇을 평가했고 무엇을 평가하지 않았는지 명확히 밝혀야 합니다.

  • 비례적인 접근 권한: 법률, 보안 및 지식재산권의 제약 범위 내에서 가능한 경우, 평가자는 합의된 주장을 평가하는 데 필요한 수준의 접근 권한을 가져야 합니다. 직접 접근이 어렵거나 불가능한 경우, 평가자는 기업이 지정한 담당자와 협력하거나 기초 정보를 보호할 수 있는 간접적 또는 개인정보 보호형 접근 방식을 모색할 수 있습니다.

  • 투명한 방법론과 기준: 평가자는 활용 가능한 확립된 기준을 바탕으로 평가 방법, 평가 기준 및 불확실성을 설명해야 합니다. 아직 확립된 기준이 없다면 사용한 기준의 근거를 명확히 설명해야 합니다. 보고서는 직접 확인한 결과와 해석을 구분하고 불확실성을 설명하며, 증거가 어떤 결론을 뒷받침하는지 명확히 밝혀야 합니다.

  • 전문성과 독립성: 평가자는 관련 기술 전문성을 입증하고, 금전적 유인, 개발자와의 관계, 평가 대상 작업에 대한 과거 참여 등 조직과 개인의 이해 상충을 파악해 공개하고 해소해야 합니다. 상업적 압력과 보상 체계가 조사 결과에 영향을 주지 않도록 보호조치를 설계해야 하며, 여기에는 회피나 적절한 제척 기간이 포함될 수 있습니다.

  • 보안 및 기밀 유지: 평가자는 접근하는 시스템과 정보의 민감도에 비례하는 정보 보안 관행을 입증하고, 소속 인력에게 적용되는 강제력 있는 기밀 보호조치를 시행해야 합니다. 이러한 보호조치는 지식재산권, 민감한 정보 및 평가 기록을 포괄해야 합니다. 평가자가 자체 환경에서 보안 요건을 충족할 수 없거나 접근하는 데이터가 특히 민감한 경우, 기업이 관리하는 기기나 시설을 통한 접근이 적절할 수 있습니다.

  • 실행 가능한 조사 결과와 개선 기간: 평가는 구체적인 미비점을 파악하고 연구소가 이를 해결하는 데 충분한 세부 정보를 제공해야 합니다. 적절한 경우, 연구소에는 공개 전에 문제를 개선할 합리적인 기간이 주어져야 합니다. 관련이 있는 경우, 보고서는 에이전트 개발자, 배포자 및 방어 담당자를 위한 시사점과 실질적인 이행 권고안도 설명해야 합니다.

  • 책임 있는 공개 관행: 평가 보고서는 증거에 근거해야 하며, 민감한 기밀 정보를 보호하면서 가능한 한 공개적으로 공유해야 합니다. 전면 공개가 불가능한 경우, 적절한 감독 기관(예: 기업의 거버넌스 기구나 이사회)에 기밀로 보고하면 책임성을 강화할 수 있습니다. 독립성과 기밀성의 균형을 유지하려면 원칙에 따른 삭제 보호조치와 정책을 마련하고, 피드백과 부정확한 내용의 정정에 관한 기대 사항을 명확히 정해야 합니다. 평가자는 기밀 유지와 지식재산권 보호를 보장하면서 편집상의 독립성을 유지해야 합니다. 평가자는 연구소가 민감한 정보의 삭제를 요청할 수 있도록 명확한 삭제 정책을 채택해야 하며, 평가자는 중요한 내용이 삭제된 부분과 그로 인해 평가 보고서가 받은 영향을 명시할 수 있어야 합니다.

앞으로의 방향

우리는 향후 법률과 민간 거버넌스 기관을 통해 독립 평가자를 지원하고, 효과적인 제3자 평가를 위한 더욱 명확한 국제 공통 기준을 확립하는 데 전념하고 있습니다. 독립 평가 생태계는 아직 성장 중이지만, 프런티어 안전성 문제 전반에 깊은 전문성을 갖춘 다양한 독립 평가자 커뮤니티를 지원하고 협력함으로써 그 성장을 도울 것입니다. 어떤 제3자도 긴급한 프런티어 안전성 문제를 단독으로 모두 다룰 수도, 다루어서도 안 됩니다. 우리는 신중하고 명확한 목적에 따라 역량을 확대하고, 성장하는 제3자 생태계가 모범 관행과 원칙에 합의하도록 지원하겠습니다. 현재 위 우선순위 영역에 부합하는 제안에 관해 여러 제3자와 논의하고 있습니다.

작성자

Lama Ahmad