Jäta vahele ja mine põhisisu juurde
OpenAI

3. september 2026

Ohutus

Ohutusülevaade: GPT‑6 Astra

Laadimine…

Täna anname välja GPT‑6 Astra, kõige võimekama mudeli, mille oleme seni laialdaselt kasutusele võtnud. Astra on meie esimene mudel, mis on Valmisoleku raamistiku järgi saavutanud küberturbevõimekuse kriitilise taseme.

Selle väljalaske ohutuse kohta on kõige olulisem teada järgmist.

  1. GPT‑6 Astra kübersuutlikkus on teinud suure arenguhüppe ja vastab meie kriitilise taseme lävendile. See tähendab, et õigete tööriistade ja juurdepääsu korral suudab GPT‑6 Astra leida seni tundmatuid turvanõrkusi ning töötada välja uusi viise nende ärakasutamiseks paljudes hästi kaitstud süsteemides, ilma et inimene peaks iga sammu juhendama. Seetõttu tugevdasime märkimisväärselt kaitsemeetmeid, mis takistavad mudelil kahjulikke kübertoiminguid teha, olenemata sellest, kas põhjuseks on väärkasutus või joondamatus. Samuti võtsime meetmeid Astra ja sarnaste mudelite sisemise arenduse ning juurutamise turvamiseks. Nende hulka kuuluvad rangem isoleerimine, kontrollpunktide krüptimine, terviklike tegevuskäikude, sealhulgas mõttekäikude (CoT) üldine seire ning enne sisekasutust toimuv joondatuse hindamine, mille tulemus võib kasutuse blokeerida.
  2. GPT‑6 Astra on oma eelkäijatest märkimisväärselt vastupidavam. Tänu uutele vastupidavust suurendavatele ohutuskoolituse meetoditele on GPT‑6 Astra jailbreak’ide suhtes märkimisväärselt vastupidavam kui GPT‑5.6 Sol, sealhulgas pikemate tegevuskäikude puhul. Seda kinnitavad võrguvälised katsed ning meie põhjalik sisemine ja väline jailbreak’ide katsetamise ja kõrvaldamise programm. Võimaliku suure riskiga kasutajate puhul oleme mudelit lisaks õpetanud keeldumispiiri konservatiivsemaks kohandama, et hõlmata rohkem kahesuguse kasutusega seotud riske. Regressioontestidega kontrollime, et Astra oleks varasematel katseperioodidel leitud jailbreak’ide suhtes vastupidav. Täiustuste kinnitamiseks tegime ka uued automatiseeritud lööktestimise voorud oma uusimate sisemiste lööktestijatega.
  3. GPT‑6 Astra on paremini joondatud kui GPT‑5.6 Sol. Astra on mudeli joondamisel suur edasiminek ning hõlmab täiustusi alates eelkoolituse andmete koosseisust kuni kinnistava õppimise käigus hindamiseni. Tutvustame uut joondatuse hindamiste komplekti(avaneb uues aknas) ja leiame, et GPT‑6 Astra järgib paremini ohutus- ja turbepiire ning püsib talle antud volituste piires. Simulatsioonis, milles kasutati enam kui 54 000 sisemist Codexi ülesannet(avaneb uues aknas), sai Astra raskemate joondamata käitumisjuhtumite eest ka ligikaudu poole vähem märgiseid kui Sol.
  4. Võtame joondamatuse seire laialdaselt kasutusele. Peame mudeli joondamist peamiseks vahendiks, millega ennetada oma mudelite võimalikku joondamata käitumist. Seire annab siiski laia ülevaate tipptasemel mudelite käitumisest ning aitab leida võimalusi joondatuse ja ohutuse edasiseks parandamiseks. Lisaks pakub seire täiendavat kaitsekihti tuvastatud joondamata käitumise vastu. Seetõttu oleme lisanud joondamatuse seire ka kõigile Astra välise juurutamisega seotud ja tööriistu kasutavatele inferentsidele, ehkki see nõuab märkimisväärselt arvutusressurssi. See süsteem sarnaneb meie sisemise lahendusega.
  5. GPT‑6 Astra jälgitavus on võrreldes GPT‑5.6 Soliga vähenenud. Oleme põhjalikult uurinud GPT‑6 Astra jälgitavust(avaneb uues aknas) ja juhitavust(avaneb uues aknas). Leidsime, et GPT‑6 Astra suudab oma mõttekäiku paremini juhtida kui GPT‑5.6 Sol ning lisab sellesse väiksema tõenäosusega teda paljastavat teavet. Vastandlikes tingimustes, kus suuname mudelit meie seirest kõrvale hoidma, suudab mudel hindamistel strateegilise alasoorituse korral märkamatuks jääda ja võib mõnikord meie sisemisest seirest kõrvale hoida, kui tal palutakse täita teatud sabotaažiülesandeid(avaneb uues aknas). Me ei ole leidnud tõendeid steganograafilise CoT-arutluse kohta, näiteks varjatud arutluse peitmisest tavalisse ja näiliselt seoseta teksti. See osutab, et seirest kõrvalehoidmise risk võib suuresti piirduda vähem arutlust nõudvate ülesannetega.
    • Need leiud näitavad, et Astra klassi mudelid võivad vastandlikes tingimustes meie CoT-seirest kõrvale hoida. Praegu põhinevad need leiud suuresti vastandlikel hindamistel, mille käigus anname mudelile korralduse seirest kõrvale hoida. Üldiselt näitavad meie joondatuse hindamised siiski, et Astra rikub turbe- ja ohutuspiiranguid väiksema tõenäosusega kui GPT‑5.6 Sol.
    • Võtame seda suundumust siiski tõsiselt ning jätkame leidude ja nende jälgitavusele avalduva mõju uurimist sedamööda, kuidas meie mudelid võimekamaks muutuvad. OpenAI on töötanud mõttekäikude seire säilitamise ja kasutamise nimel ning CoT jälgitavuse säilitamine on uurimisprogrammi üks põhieesmärke. Need tulemused rõhutavad aga ka vajadust töötada välja joondatuse auditeerimise meetodeid, mis ei piirdu mudeli mõttekäigu uurimisega.
  6. GPT‑6 Astra tegutseb veebis ja töökeskkonnas vastutustundlikumalt. GPT‑6 Astra on viibasüstide suhtes märkimisväärselt vastupidavam kui GPT‑5.6 Sol. Oleme lisaks katsetanud mudeli käitumist realistlikes veebisirvimise ja tööalastes arvutikeskkondades. Võrreldes GPT‑5.6 Soliga teeb mudel märkimisväärselt väiksema tõenäosusega joondamata ja potentsiaalselt hävitavaid toiminguid, nagu volitamata tehingud, andmekadu, liigne juurdepääs või kontrollimeetmetest möödahiilimine. Samuti tegutseb see agentsetes olukordades kahjulikke taotlusi käsitledes ohutumalt, näiteks kui palutakse aidata kavandada vägivaldset rünnakut või toime panna pettus.
  7. GPT‑6 Astra on suurema riskiga olukordades märkimisväärselt ohutum. GPT‑6 Astra vastab tootmiskeskkonnast ja inimeste tehtud vastandlikust lööktestimisest pärinevatele keerukatele taotlustele ohutumalt kui GPT‑5.6 Sol. Astra saavutab Pareto paranemise: ta käsitleb ohtlikke taotlusi ohutumalt ja väldib kahjututest taotlustest tarbetut keeldumist. Need täiustused hõlmavad ka tõsiste tagajärgedega olukordi, kus kahjuoht tuleneb laiemast kontekstist, mitte otsesest taotlusest. Samuti rakendab Astra alla 18-aastaste kasutajate puhul eakohaseid ohutuspiire järjekindlamalt.