메인 콘텐츠로 건너뛰기
OpenAI

2026년 9월 3일

안전

안전 개요: GPT‑6 Astra

로딩 중...

오늘 OpenAI는 지금까지 광범위하게 배포한 모델 중 가장 뛰어난 GPT‑6 Astra를 출시합니다. Astra는 준비성 평가 프레임워크에 따라 사이버 보안 역량이 ‘Critical’ 수준에 도달한 OpenAI 최초의 모델입니다.

이번 출시의 안전성과 관련해 알아야 할 가장 중요한 사항은 다음과 같습니다.

  1. GPT‑6 Astra의 사이버 역량은 크게 향상되었으며 OpenAI의 ‘Critical’ 기준을 충족합니다. 이는 적절한 도구와 접근 권한이 주어지면 GPT‑6 Astra가 각 단계를 사람이 일일이 안내하지 않아도 보안이 철저한 여러 시스템에서 이전에 알려지지 않은 보안 취약점을 찾아내고 새로운 악용 방법을 개발할 수 있다는 뜻입니다. 이에 따라 오용이나 정렬 실패로 인해 모델이 유해한 사이버 활동을 수행하지 못하도록 보호 조치를 대폭 강화했습니다. 또한 더 엄격한 격리, 체크포인트 암호화, 사고 과정(CoT)을 포함한 전체 작업 흐름의 전면적 모니터링, 내부 사용 전 차단형 정렬 평가 절차 등을 도입해 Astra 및 유사 모델의 내부 개발과 배포를 안전하게 보호했습니다.
  2. GPT‑6 Astra는 이전 모델보다 훨씬 더 견고합니다. 새로운 견고성 안전 학습 기법을 적용한 GPT‑6 Astra는 긴 작업 흐름을 비롯한 여러 상황에서 GPT‑5.6 Sol보다 탈옥에 훨씬 더 강합니다. 이는 오프라인 테스트와 엄격한 내외부 탈옥 테스트 및 문제 해결 프로그램을 통해 확인했습니다. 잠재적으로 위험도가 높은 것으로 분류된 사용자에 대해서는 모델의 거부 경계를 더 보수적으로 조정해 더 광범위한 이중 용도 위험을 포괄하는 능력도 학습시켰습니다. Astra가 이전 테스트 기간에 발견된 탈옥에 견고한지 확인하기 위해 회귀 테스트를 실시했으며, 개선 사항을 검증하고자 최신 내부 레드팀 공격 모델을 활용해 새로운 자동 레드팀 테스트도 여러 차례 수행했습니다.
  3. GPT‑6 Astra는 GPT‑5.6 Sol보다 더 잘 정렬되어 있습니다. Astra는 모델 정렬 측면에서 크게 발전했으며, 사전 학습 데이터 구성부터 강화학습 중 평가에 이르기까지 전 과정에 걸쳐 정렬을 개선했습니다. OpenAI는 새로운 정렬 평가 모음(새 창에서 열기)을 공개했으며, GPT‑6 Astra가 안전 및 보안 경계를 준수하고 승인된 범위 안에서 작동하는 능력이 더 뛰어남을 확인했습니다. 54,000개가 넘는 내부 Codex 작업(새 창에서 열기)을 활용한 시뮬레이션에서도 Astra가 심각도가 높은 비정렬 행동으로 표시된 횟수는 Sol의 절반 정도였습니다.
  4. 비정렬 모니터링을 광범위하게 배포하고 있습니다. OpenAI는 모델 정렬이 모델의 잠재적인 비정렬 행동을 방지하는 핵심 수단이라고 봅니다. 한편 모니터링은 프런티어 모델의 행동을 폭넓게 파악하게 해주며 정렬과 안전성을 한층 더 개선할 기회를 밝혀줍니다. 또한 모니터링은 탐지된 비정렬 행동에 대응하는 추가 보호 계층으로 기능합니다. 이러한 이유로 상당한 컴퓨팅 비용을 감수하면서 Astra의 외부 배포에 사용되는 모든 도구 활용 추론에 비정렬 모니터링을 추가했습니다. 이 시스템은 OpenAI의 내부 구성과 유사합니다.
  5. GPT‑6 Astra의 모니터링 가능성은 GPT‑5.6 Sol보다 낮아졌습니다. OpenAI는 GPT‑6 Astra의 모니터링 가능성(새 창에서 열기)제어 가능성(새 창에서 열기)을 광범위하게 조사했습니다. 그 결과 GPT‑6 Astra는 GPT‑5.6 Sol보다 자체 CoT를 제어하는 능력이 뛰어나고, CoT에 불리한 증거가 될 정보를 포함할 가능성은 더 낮은 것으로 나타났습니다. 적대적 환경에서 모델이 모니터를 피하도록 유도한 결과, 모델은 평가에서 의도적으로 성능을 낮추면서도 탐지되지 않을 수 있었고, 특정 방해 공작(새 창에서 열기)을 수행하라는 요청을 받으면 때때로 내부 모니터를 회피할 수 있었습니다. 스테가노그래피 방식의 CoT 추론, 즉 평범하고 무관해 보이는 텍스트 안에 숨겨진 추론을 감추는 행동의 증거는 발견되지 않았습니다. 이는 회피 위험이 대체로 낮은 수준의 추론 작업에 국한될 수 있음을 시사합니다.
    • 이러한 결과는 Astra 계열 모델이 적대적 환경에서 OpenAI의 CoT 모니터를 회피할 수 있음을 보여줍니다. 현재 이러한 결과는 주로 모델에 모니터링을 피하라고 지시하는 적대적 평가에 기반합니다. 전반적인 정렬 평가에서는 Astra가 GPT‑5.6 Sol보다 보안 및 안전 제한을 위반할 가능성이 낮은 것으로 나타났습니다.
    • 하지만 OpenAI는 이러한 추세를 심각하게 받아들이고 있으며, 모델의 역량이 향상됨에 따라 관련 결과와 이것이 모니터링 가능성에 미치는 영향을 계속 조사하고 있습니다. OpenAI는 사고 과정 모니터링을 보존하고 활용하기 위해 노력해 왔으며, CoT 모니터링 가능성을 유지하는 것은 연구 프로그램의 핵심 목표입니다. 다만 이러한 결과는 모델의 사고 과정을 조사하는 것에서 더 나아가 새로운 정렬 감사 기법을 개발하는 일이 중요하다는 점도 강조합니다.
  6. GPT‑6 Astra는 브라우징 및 업무 환경에서 더 책임감 있게 작동합니다. GPT‑6 Astra는 GPT‑5.6 Sol보다 프롬프트 인젝션에 훨씬 더 강합니다. 또한 현실적인 브라우징 및 업무용 컴퓨터 환경에서 모델의 행동을 테스트한 결과, GPT‑6 Astra는 GPT‑5.6 Sol보다 비정렬 행동이나 잠재적으로 파괴적인 행동(예: 무단 거래, 데이터 손실, 과도한 접근 또는 통제 우회)을 수행할 가능성이 현저히 낮았습니다. 폭력적 공격 계획을 돕거나 사기를 저질러 달라는 요청 등 에이전트형 환경에서 유해한 요청을 처리할 때도 더 안전하게 행동합니다.
  7. GPT‑6 Astra는 위험도가 높은 상황에서 훨씬 더 안전합니다. GPT‑6 Astra는 실제 서비스 환경과 적대적 인간 레드팀 테스트에서 수집한 까다로운 요청에 GPT‑5.6 Sol보다 더 안전하게 응답합니다. Astra는 위험한 요청을 안전하게 처리하면서도 무해한 요청을 불필요하게 거부하지 않는 두 측면 모두에서 파레토 개선을 달성했습니다. 이러한 개선은 명시적인 요청이 아니라 더 넓은 맥락에서 위해 위험이 발생하는 심각한 상황에도 적용됩니다. Astra는 18세 미만 사용자에게 연령에 적합한 안전 경계를 더욱 일관되게 적용합니다.

자세한 내용은 전체 시스템 카드(새 창에서 열기)에서 확인하세요.