Ugrás a fő tartalomra
OpenAI

2026. szeptember 3.

Biztonság

Biztonsági áttekintés: GPT‑6 Astra

Betöltés…

Ma adjuk ki a GPT‑6 Astrát, az eddigi legnagyobb képességű, széles körben bevezetett modellünket. Az Astra az első modellünk, amely a Felkészültségi keretrendszerünk szerint elérte a Kritikus kiberbiztonsági képességszintet.

A kiadás biztonságáról a következőket a legfontosabb tudni:

  1. A GPT‑6 Astra jelentős előrelépést képvisel a kiberképességek terén, és eléri a Kritikus küszöbértékünket. Ez azt jelenti, hogy a megfelelő eszközökkel és hozzáféréssel a GPT‑6 Astra korábban ismeretlen biztonsági hibákat találhat, és új módszereket dolgozhat ki azok kihasználására számos jól védett rendszerben anélkül, hogy minden lépését ember irányítaná. Ennek megfelelően jelentősen megerősítettük a védelmet az ellen, hogy a modell káros kiberműveleteket hajtson végre, akár visszaélés, akár hibás összehangolás miatt. Intézkedéseket tettünk az Astra és a hasonló modellek belső fejlesztésének és bevezetésének biztonságáért is. Ezek közé tartozik a szigorúbb elkülönítés, az ellenőrzőpontok titkosítása, a teljes folyamatok általános monitorozása – beleértve a gondolatmeneteket (CoT) is –, valamint egy olyan összehangolási értékelési folyamat, amely a belső használat előtt megakadályozhatja a továbblépést.

  2. A GPT‑6 Astra jelentősen robusztusabb az elődeinél. Az új robusztussági biztonsági tanítási módszereknek köszönhetően a GPT‑6 Astra a GPT‑5.6 Solnál jóval ellenállóbb a jailbreakekkel szemben, a hosszabb folyamatokat is beleértve. Ezt offline tesztek, valamint szigorú belső és külső jailbreak-tesztelési és hibajavítási programunk eredményei igazolják. A potenciálisan magas kockázatúként megjelölt felhasználók esetében arra is betanítottuk a rendszert, hogy konzervatívabbá tegye a modell elutasítási küszöbét, és a kettős felhasználású kockázatok szélesebb körét fedje le. Regressziós teszteléssel gondoskodunk arról, hogy az Astra ellenálló legyen a korábbi tesztidőszakokban feltárt jailbreakekkel szemben. Emellett újabb automatizált támadásszimulációs köröket végeztünk legújabb belső támadásszimulációs rendszereinkkel, hogy igazoljuk a fejlesztéseinket.

  3. A GPT‑6 Astra jobban összehangolt, mint a GPT‑5.6 Sol. Az Astra jelentős előrelépés a modellek összehangolásában: az előtanítási adatok összeállításától a megerősítéses tanulás során alkalmazott értékelésig számos fejlesztést tartalmaz. Bemutatunk egy új összehangolási értékeléscsomagot⁠(új ablakban nyílik meg), amely szerint a GPT‑6 Astra hatékonyabban tartja tiszteletben a biztonsági és védelmi korlátokat, és megbízhatóbban marad az engedélyezett működési körén belül. Egy több mint 54 000 belső Codex-feladatot⁠(új ablakban nyílik meg) felhasználó szimulációban az Astrát nagyjából feleannyiszor jelölték meg súlyosabb, hibásan összehangolt viselkedés miatt, mint a Solt.

  4. Széles körben bevezetjük a hibás összehangolás monitorozását. A modellek összehangolását tekintjük az elsődleges eszköznek modelljeink esetleges hibásan összehangolt viselkedésének megelőzésére. A monitorozás ugyanakkor átfogó képet ad az élvonalbeli modellek viselkedéséről, és rávilágít az összehangolás és a biztonság további javításának lehetőségeire. Emellett a monitorozás további védelmi réteget biztosít az észlelt, hibásan összehangolt viselkedéssel szemben. Ezért az Astra külső bevezetése során minden eszközhasználattal járó következtetési folyamatot kiegészítettünk a hibás összehangolás monitorozásával, ami jelentős számítási költséggel jár. Ez a rendszer a belső megoldásunkat követi.

  5. A GPT‑6 Astra monitorozhatósága romlott a GPT‑5.6 Solhoz képest. Alaposan vizsgáltuk a GPT‑6 Astra monitorozhatóságát⁠(új ablakban nyílik meg) és irányíthatóságát⁠(új ablakban nyílik meg). Megállapítottuk, hogy a GPT‑6 Astra a GPT‑5.6 Solnál jobban képes irányítani saját gondolatmenetét, és kisebb valószínűséggel foglal abba terhelő információkat. Ellenséges körülmények között – amikor arra ösztönözzük a modellt, hogy kerülje ki a monitorainkat – a modell képes észrevétlen maradni, amikor az értékeléseken szándékosan alulteljesít (szándékos alulteljesítés), és időnként belső monitorainkat is ki tudja kerülni, ha bizonyos szabotázsfeladatok⁠(új ablakban nyílik meg) végrehajtására kérik. Nem találtunk szteganografikus CoT-érvelésre utaló bizonyítékot – például arra, hogy a rejtett érvelést hétköznapi és látszólag független szövegbe rejtené –, ami arra utal, hogy a kijátszás kockázata nagyrészt az alacsonyabb szintű érvelési feladatokra korlátozódhat.

    • Ezek az eredmények arra utalnak, hogy az Astra-osztályú modellek ellenséges körülmények között kijátszhatják CoT-monitorainkat. Jelenleg ezek az eredmények nagyrészt ellenséges értékeléseken alapulnak – vagyis olyan helyzeteken, amikor arra utasítjuk a modellt, hogy kerülje ki a monitorozást –, összehangolási értékeléseink összességében mégis azt mutatják, hogy az Astra a GPT‑5.6 Solnál kisebb valószínűséggel sérti meg a védelmi és biztonsági korlátozásokat.

    • A tendenciát azonban komolyan vesszük, és modelljeink képességeinek növekedésével tovább vizsgáljuk ezeket az eredményeket, valamint a monitorozhatóságra gyakorolt hatásukat. Az OpenAI azon dolgozik, hogy megőrizze és hasznosítsa a gondolatmenetek monitorozását; a CoT monitorozhatóságának fenntartása a kutatási program egyik alapvető célja. Ezek az eredmények ugyanakkor azt is hangsúlyozzák, hogy olyan összehangolás-ellenőrzési módszereket kell kidolgozni, amelyek túlmutatnak a modell gondolatmenetének vizsgálatán.

  6. A GPT‑6 Astra felelősségteljesebben kezeli a böngészési és munkahelyi környezeteket: a GPT‑6 Astra a GPT‑5.6 Solnál lényegesen ellenállóbb az utasításbefecskendezéssel szemben. A modell viselkedését valósághű böngészési és professzionális számítógépes környezetekben is teszteltük. A GPT‑5.6 Solhoz képest jelentősen kisebb valószínűséggel hajt végre hibásan összehangolt és potenciálisan káros műveleteket, például jogosulatlan tranzakciókat, adatvesztést okozó műveleteket, túlzott hozzáférést vagy a védelmi intézkedések megkerülését. Ügynöki környezetekben a káros kéréseket is biztonságosabban kezeli, például ha erőszakos támadás megtervezéséhez vagy csalás elkövetéséhez kérnek segítséget.

  7. A GPT‑6 Astra jelentősen biztonságosabb a magasabb kockázatú helyzetekben. A GPT‑6 Astra a GPT‑5.6 Solnál biztonságosabban válaszol az éles használatból és az emberek által végzett ellenséges támadásszimulációkból származó, nehéz kérésekre. Az Astra Pareto-javulást ér el: biztonságosabban teljesíti a veszélyes kéréseket, miközben ritkábban utasít el szükségtelenül ártalmatlan kéréseket. Ezek a fejlesztések azokra a súlyos helyzetekre is kiterjednek, amelyekben a károkozás kockázata nem egy kifejezett kérésből, hanem a tágabb összefüggésből ered. Az Astra a 18 év alatti felhasználóknál következetesebben alkalmazza az életkoruknak megfelelő biztonsági korlátokat is.

További információért tekintse meg a teljes rendszerkártyát⁠(új ablakban nyílik meg).