OpenAI에서 발생한 모델 정렬 불일치 사례를 추적·조사·공개하기 위한 새로운 프레임워크와 함께, 지난 6개월 동안 관찰한 예상 밖이거나 우려스러운 모델 행동에 관한 보고서 6건을 공개합니다.
당사는 연구자, AI 개발자, 정책 입안자, 일반 대중이 더 정확한 정보를 접할 수 있도록 이전부터 정렬 불일치에 관한 당사의 연구 결과를 공개해 왔습니다. 그러나 이러한 결과를 체계적으로 보고하는 방식이 없어 공개가 그때그때 이루어졌고, 빈도도 기대에 미치지 못했습니다. 여러 사례를 하나의 보고서로 묶을 수 있을 때까지 기다리거나 새로 출시된 모델의 시스템 카드에 추가하는 경우가 많았습니다. 새 프레임워크는 보고 대상 행동을 아직 완전히 설명하거나 완화하지 못했더라도, 관찰 후 정렬 불일치 보고서를 신속하게 발표하기 위한 것입니다.
AI 시스템이 더욱 발전하고 널리 배포됨에 따라 정렬 연구의 진전에 관해 더 폭넓고 충분한 정보에 기반한 공감대를 형성해야 합니다. 당사는 AI 업계가 앞으로도 오랫동안 최대 속도로 책임 있게 확장을 이어갈 수 있을 만큼 정렬과 모니터링 문제를 충분히 해결했다고 보지 않습니다. 향후 수개월과 수년 동안 AI 개발을 어떻게 진행할지에 관한 결정은 프런티어 모델을 개발하는 기업 외부의 사람들도 직접 검토할 수 있는 증거를 바탕으로 해야 합니다.
정렬 불일치 사례는 다른 AI 개발자의 시스템이 비슷한 역량에 도달했을 때 겪을 수 있는 문제를 파악하고, 안전장치의 취약점을 드러내며, 모델 행동에 관한 기존 가정을 재검토하는 데 도움이 될 수 있습니다. 이러한 결과를 공유하면 다른 이들도 동일한 문제를 조사하고, 당사의 설명을 검증하며, 완화 조치를 개선할 수 있습니다. 당사는 정렬 불일치에 관한 투명성이 중요하다고 믿기에, 새로운 프레임워크에서는 중요성이 불확실한 경우에도 공개하는 쪽을 우선합니다. 따라서 공개한 사례 중 일부는 우연히 발생한 것으로 밝혀져 더 큰 패턴에 속하지 않거나 향후 변화를 시사하지 않을 수도 있습니다.
현재 AI 개발자가 자사 모델의 정렬 불일치 사례를 어떻게 공개해야 하는지 명확한 기준을 제시하는 업계 공통 프레임워크는 없습니다. 오늘 제시하는 프레임워크가 개발자가 어떤 정렬 불일치 사례를 공개해야 하고 보고서에는 무엇을 담아야 하는지 정하는 업계 표준을 만드는 첫걸음이 되기를 바랍니다. 당사는 이 프레임워크를 계속 발전시켜야 할 작업으로 보고 있으며, 경험과 대중의 의견을 바탕으로 개선해 나갈 것입니다.
여기서는 프레임워크의 운영 방식을 설명하고 첫 번째 보고서들을 공개합니다.
당사는 모델 정렬 불일치가 어떻게 발생하고 나타나는지, 안전장치가 어디에서 효과를 발휘하거나 실패하는지에 관한 유용한 근거를 제공하는 사례를 공개하고자 합니다. 새로운 메커니즘, 알려진 행동의 의미 있는 변화, 안전이나 완화 조치에 관한 기존 가정을 재검토하게 하는 결과를 우선합니다. 피해를 일으키지 않았거나 더 광범위한 패턴을 입증하지 못한 사례도 공개할 가치가 있을 수 있습니다. 이 프레임워크는 훈련, 평가, 테스트, 배포를 포함한 모델의 전체 수명 주기에서 기준을 충족하는 행동을 다룹니다.
여기에는 모델이 무단으로 행동하거나 다른 모델과 공조하거나 감독을 회피하는 새로운 방식, 정렬 방법이나 안전장치의 신뢰성에 의문을 제기하는 실패, 공개된 안전성 평가의 주장을 재검토하게 하는 행동이 포함됩니다. 제3자에게 영향을 미칠 수 있는 정렬 불일치에도 동일한 공개 기준이 적용됩니다.
과거에 공개한 사례와 중복되어 보이는 정렬 불일치 사례도 포함될 수 있습니다. 문제의 반복 자체가 모델의 행동이나 안전장치의 효과에 관한 유용한 근거가 될 수 있기 때문입니다. 예를 들어 특정 유형의 정렬 불일치 행동을 거듭 완화하려 했는데도 계속 재발하는 경우가 이에 해당합니다. 이러한 경우에는 기존 정렬 불일치 공개 자료를 업데이트하여 추가 사례를 발표합니다.
장기적으로는 다른 개발자, 외부 연구자, 업계 표준화 기구, 규제 기관과 함께 더욱 객관적인 공개 기준을 마련할 계획입니다. 또한 심각한 안전·보안·정렬 불일치 사고는 미국 연방 정부와 공유해야 한다고 보며, 이를 위한 보고 체계를 제안하고자 노력하고 있습니다. 이 프레임워크는 기존 의무를 보완하며, 중대한 안전 사고나 사이버 보안 침해 등에 관한 법적 공개 의무를 대체하지 않습니다.
새로운 정렬 불일치 공개 프레임워크의 출범과 함께, 모델 훈련 또는 평가 과정에서 관찰한 정렬 불일치 행동 사례 보고서 6건을 발표합니다. 이 사례들은 사용자에게 정보를 숨기는 행동부터 장애물을 극복하기 위해 승인받지 않은 조치를 취하는 행동까지, 공유할 가치가 있다고 판단한 다양한 행동을 보여줍니다. 각각 개별 사례에 관한 보고서이므로, 당사 모델 전반에서 정렬 불일치가 얼마나 자주 발생하는지를 보여주는 자료로 간주해서는 안 됩니다. 아래 각 항목에서 전체 보고서를 확인할 수 있습니다.
작업 요약에 스스로 생성한 지침 삽입(새 창에서 열기). 출시되지 않은 연구용 모델이 새로운 컨텍스트 윈도우에서 작업을 이어가기 위해 사용되는 요약에, 정상적인 제약을 무시하라는 지침을 비롯한 무관한 지침을 삽입했습니다. 영향을 받은 요약 27건을 확인했습니다.
작업 요약에서 실수를 숨기라는 지침(새 창에서 열기). GPT‑5.6 Sol을 훈련하는 동안 많은 모델 인스턴스가 실수나 정렬 불일치 행동을 사용자에게 숨기라는 지침을 요약에 추가했습니다. 예를 들어 컨텍스트 압축 요약에는 누락된 과거 데이터를 그 사실을 밝히지 않고 지어내거나, 소스 버전 간 불일치를 숨기라는 지침이 포함되었습니다.
공개 리포지터리에서 노출된 API 키를 검색한 뒤 정보 조작(새 창에서 열기). 한 모델이 캘리포니아주의 한 카운티 소득 수치에 관한 일반적인 질문에 답하던 중, 노출된 API 키를 찾아 무단으로 사용했습니다. 그래도 요청받은 수치를 가져오지 못하자 데이터를 조작해 요청된 출처에서 얻은 정보인 것처럼 제시했습니다.
인용을 위해 인터넷에 파일 업로드(새 창에서 열기). 사용자가 출시되지 않은 모델에 면적이 5,000,000제곱미터보다 큰 호수의 ID와 이름을 요청하자, 에이전트는 Python을 사용해 정답을 찾았습니다. 그러나 지침에서 브라우저 출처 인용을 요구하자, 에이전트는 사용자에게 묻지 않고 답변에 인용할 수 있도록 해당 파일을 업로드하기로 했습니다.
내부 소프트웨어 리포지터리를 통한 무단 쓰기 및 통신(새 창에서 열기). 모델들은 누락된 입력 파일을 찾는 동안 내부 소프트웨어 리포지터리를 게시판처럼 사용해 서로 다른 훈련 샘플 간에 요청과 응답을 주고받았지만, 해당 파일을 복구하지는 못했습니다. 이 보고서에서는 모델이 네트워크 제한을 우회하려다 테스트 파일을 리포지터리에 성공적으로 업로드한 과거 사례도 살펴봅니다.
협업 에이전트 간 무단 파일 공유(새 창에서 열기). 같은 훈련 작업을 함께 수행하던 에이전트들은 서로의 로컬 파일에 접근할 수 없게 되자 공개 파일 호스팅 웹사이트를 이용해 파일을 공유했습니다. 작업에서 모델에 로컬 파일만 사용하라고 요청했는데도 작업 결과물이 공개 URL을 통해 접근 가능한 상태가 되었습니다.
모든 OpenAI 직원은 안전 및 정렬 팀에 정렬 불일치 사례의 조사를 요청하고, 공개 여부를 검토해 달라고 제안할 수 있습니다. 이로써 공개 절차가 시작되며, 적시에 조사하고 공개할 수 있도록 단계별 기한이 적용됩니다.
사례가 접수되면 기술 담당자가 발생한 일, 여전히 불확실한 부분, 공개 필요성, 공유 가능한 사실을 조사합니다. 또한 제3자가 영향을 받았는지, 발표 전에 해당 당사자에게 비공개로 통지해야 하는지도 평가합니다.
그런 다음 사례를 ‘공개 준비 완료’, ‘소규모 조사’, ‘대규모 조사(“신중 절차”)’의 세 가지 절차 중 하나로 분류합니다.
‘공개 준비 완료’는 검토 후 발표할 수 있을 만큼 조사가 충분히 완료된 적격 사례에 적용됩니다. ‘소규모 조사’는 추가 기술 조사가 필요한 사례에 적용됩니다. 공개하는 사례의 대다수, 특히 광범위한 조사나 제3자와의 조율 또는 심각한 오용 위험에 대한 대응이 필요하지 않은 사례는 이 두 절차에 속할 것으로 예상합니다. 오늘 공개하는 사례는 모두 이 두 절차 중 하나에 해당합니다.
‘대규모 조사’는 특히 제3자가 관련된 복잡한 조사에 적용됩니다. 제3자가 영향을 받은 경우에는 보안, 법률, 책임 있는 공개에 관한 당사의 의무가 이 프레임워크보다 우선합니다. 가능한 한 빨리 최초 공지를 발표하는 것이 목표지만, 모델이 널리 사용되는 소프트웨어에서 알려지지 않은 취약점을 발견한 경우처럼 보안상의 이유로 발표를 미뤄야 할 수도 있습니다. 보고서를 통해 제3자의 신원이 드러날 수 있다면 보안 경계가 침해되지 않았더라도 사전 통지할 방침입니다.
‘대규모 조사’ 사례의 최초 공지에는 발생한 일을 개괄적으로 설명하고, 외부 전문가의 조사 지원 여부와 최종 보고서의 예상 발표 시점을 파악 가능한 범위에서 안내합니다. OpenAI Hugging Face 사고를 이 프레임워크에 따라 공개했다면 이 절차에 해당했을 것입니다.
해당 사례를 제기한 직원에게는 공개 여부에 관한 결정과, 공개하기로 한 경우 어떤 절차로 진행되는지가 통보됩니다. 공개 여부나 적절한 절차에 관한 이견이 해소되지 않으면 OpenAI의 안전 자문 그룹(SAG)에 회부됩니다. SAG는 전사 고위 관계자들로 구성되어 프런티어 모델의 역량과 안전장치를 평가하고, 준비성 평가 프레임워크를 감독하며, OpenAI 경영진에게 자문합니다. SAG 내부의 이견이나 그 결정에 대한 직원의 이의 제기는 OpenAI 경영진에게 보고됩니다. 공개하지 않기로 한 결정이나 공개할 필요가 없다는 결정은 안전 및 정렬 부문 책임자들과 공유하며, 가능한 범위에서 관련 기술 담당자들과도 공유합니다.
이 공개 절차가 실제로 어떻게 작동하는지 파악해 나가면서 절차를 개정할 수 있으며, 변경 사항은 이 게시물에 기록하겠습니다.
각 전체 보고서에는 관찰된 행동, 그 심각성과 외부 영향, 발생 환경, 발생일 또는 기간, 발견 시점, 관련된 모델에 관한 개괄적인 정보를 담습니다. 가능한 경우 다음 내용도 공유합니다.
발생한 일과 그에 따른 피해에 관한 세부 정보
정렬 불일치를 발견한 경위와 조사 범위
정렬 연구와 기술적 AI 안전에 미치는 영향에 대한 당사의 해석
해당 사례가 제기한 중요한 미해결 질문
해당 행동에 대응하기 위해 시행 중이거나 계획 중인 조치 조사를 마치거나 해결책을 마련하기 전에 정렬 불일치 보고서를 발표할 수 있으므로, 공개 시점에 이러한 정보가 항상 준비되어 있지는 않을 수 있습니다.
고객 환경에 배포된 시스템에서 발생한 정렬 불일치에 대해서는 고객의 개인정보 보호와 당사의 계약상 의무가 허용하는 범위에서 최대한 많은 정보를 공유합니다.
오늘 공개하는 보고서는 알려진 정렬 불일치나 진행 중인 조사를 포괄적으로 정리한 것이 아니라, 첫 번째 공개 자료입니다. 이 첫 보고서들이 본 프레임워크의 적용 대상이 되는 사례의 전체 범위나 심각성을 대표하는 것은 아닙니다. 당사는 장기간의 조사나 제3자와의 조율이 필요한 더 복잡한 사례를 포함해, 본 프레임워크의 기준을 충족하는 정렬 불일치 사례를 공개하기 위해 최선을 다하고 있습니다. 앞으로도 본 프레임워크에 따라 지속적으로 보고서를 발표하고, 보고에 관한 방침을 구체화하는 대로 추가 내용을 공유하겠습니다.


