Ugrás a fő tartalomra
OpenAI

2026. szeptember 3.

Biztonság

Biztonsági áttekintés: GPT‑6 Astra

Betöltés…

Ma adjuk ki a GPT‑6 Astrát, az eddigi legnagyobb képességű, széles körben bevezetett modellünket. Az Astra az első modellünk, amely a Felkészültségi keretrendszerünk szerint elérte a Kritikus kiberbiztonsági képességszintet.

A kiadás biztonságáról a következőket a legfontosabb tudni:

  1. A GPT‑6 Astra jelentős előrelépést képvisel a kiberképességek terén, és eléri a Kritikus küszöbértékünket. Ez azt jelenti, hogy a megfelelő eszközökkel és hozzáféréssel a GPT‑6 Astra korábban ismeretlen biztonsági hibákat találhat, és új módszereket dolgozhat ki azok kihasználására számos jól védett rendszerben anélkül, hogy minden lépését ember irányítaná. Ennek megfelelően jelentősen megerősítettük a védelmet az ellen, hogy a modell káros kiberműveleteket hajtson végre, akár visszaélés, akár hibás összehangolás miatt. Intézkedéseket tettünk az Astra és a hasonló modellek belső fejlesztésének és bevezetésének biztonságáért is. Ezek közé tartozik a szigorúbb elkülönítés, az ellenőrzőpontok titkosítása, a teljes folyamatok általános monitorozása – beleértve a gondolatmeneteket (CoT) is –, valamint egy olyan összehangolási értékelési folyamat, amely a belső használat előtt megakadályozhatja a továbblépést.
  2. A GPT‑6 Astra jelentősen robusztusabb az elődeinél. Az új robusztussági biztonsági tanítási módszereknek köszönhetően a GPT‑6 Astra a GPT‑5.6 Solnál jóval ellenállóbb a jailbreakekkel szemben, a hosszabb folyamatokat is beleértve. Ezt offline tesztek, valamint szigorú belső és külső jailbreak-tesztelési és hibajavítási programunk eredményei igazolják. A potenciálisan magas kockázatúként megjelölt felhasználók esetében arra is betanítottuk a rendszert, hogy konzervatívabbá tegye a modell elutasítási küszöbét, és a kettős felhasználású kockázatok szélesebb körét fedje le. Regressziós teszteléssel gondoskodunk arról, hogy az Astra ellenálló legyen a korábbi tesztidőszakokban feltárt jailbreakekkel szemben. Emellett újabb automatizált támadásszimulációs köröket végeztünk legújabb belső támadásszimulációs rendszereinkkel, hogy igazoljuk a fejlesztéseinket.
  3. A GPT‑6 Astra jobban összehangolt, mint a GPT‑5.6 Sol. Az Astra jelentős előrelépés a modellek összehangolásában: az előtanítási adatok összeállításától a megerősítéses tanulás során alkalmazott értékelésig számos fejlesztést tartalmaz. Bemutatunk egy új összehangolási értékeléscsomagot(új ablakban nyílik meg), amely szerint a GPT‑6 Astra hatékonyabban tartja tiszteletben a biztonsági és védelmi korlátokat, és megbízhatóbban marad az engedélyezett működési körén belül. Egy több mint 54 000 belső Codex-feladatot(új ablakban nyílik meg) felhasználó szimulációban az Astrát nagyjából feleannyiszor jelölték meg súlyosabb, hibásan összehangolt viselkedés miatt, mint a Solt.
  4. Széles körben bevezetjük a hibás összehangolás monitorozását. A modellek összehangolását tekintjük az elsődleges eszköznek modelljeink esetleges hibásan összehangolt viselkedésének megelőzésére. A monitorozás ugyanakkor átfogó képet ad az élvonalbeli modellek viselkedéséről, és rávilágít az összehangolás és a biztonság további javításának lehetőségeire. Emellett a monitorozás további védelmi réteget biztosít az észlelt, hibásan összehangolt viselkedéssel szemben. Ezért az Astra külső bevezetése során minden eszközhasználattal járó következtetési folyamatot kiegészítettünk a hibás összehangolás monitorozásával, ami jelentős számítási költséggel jár. Ez a rendszer a belső megoldásunkat követi.
  5. A GPT‑6 Astra monitorozhatósága romlott a GPT‑5.6 Solhoz képest. Alaposan vizsgáltuk a GPT‑6 Astra monitorozhatóságát(új ablakban nyílik meg) és irányíthatóságát(új ablakban nyílik meg). Megállapítottuk, hogy a GPT‑6 Astra a GPT‑5.6 Solnál jobban képes irányítani saját gondolatmenetét, és kisebb valószínűséggel foglal abba terhelő információkat. Ellenséges körülmények között – amikor arra ösztönözzük a modellt, hogy kerülje ki a monitorainkat – a modell képes észrevétlen maradni, amikor az értékeléseken szándékosan alulteljesít (szándékos alulteljesítés), és időnként belső monitorainkat is ki tudja kerülni, ha bizonyos szabotázsfeladatok(új ablakban nyílik meg) végrehajtására kérik. Nem találtunk szteganografikus CoT-érvelésre utaló bizonyítékot – például arra, hogy a rejtett érvelést hétköznapi és látszólag független szövegbe rejtené –, ami arra utal, hogy a kijátszás kockázata nagyrészt az alacsonyabb szintű érvelési feladatokra korlátozódhat.
    • Ezek az eredmények arra utalnak, hogy az Astra-osztályú modellek ellenséges körülmények között kijátszhatják CoT-monitorainkat. Jelenleg ezek az eredmények nagyrészt ellenséges értékeléseken alapulnak – vagyis olyan helyzeteken, amikor arra utasítjuk a modellt, hogy kerülje ki a monitorozást –, összehangolási értékeléseink összességében mégis azt mutatják, hogy az Astra a GPT‑5.6 Solnál kisebb valószínűséggel sérti meg a védelmi és biztonsági korlátozásokat.
    • A tendenciát azonban komolyan vesszük, és modelljeink képességeinek növekedésével tovább vizsgáljuk ezeket az eredményeket, valamint a monitorozhatóságra gyakorolt hatásukat. Az OpenAI azon dolgozik, hogy megőrizze és hasznosítsa a gondolatmenetek monitorozását; a CoT monitorozhatóságának fenntartása a kutatási program egyik alapvető célja. Ezek az eredmények ugyanakkor azt is hangsúlyozzák, hogy olyan összehangolás-ellenőrzési módszereket kell kidolgozni, amelyek túlmutatnak a modell gondolatmenetének vizsgálatán.
  6. A GPT‑6 Astra felelősségteljesebben kezeli a böngészési és munkahelyi környezeteket: a GPT‑6 Astra a GPT‑5.6 Solnál lényegesen ellenállóbb az utasításbefecskendezéssel szemben. A modell viselkedését valósághű böngészési és professzionális számítógépes környezetekben is teszteltük. A GPT‑5.6 Solhoz képest jelentősen kisebb valószínűséggel hajt végre hibásan összehangolt és potenciálisan káros műveleteket, például jogosulatlan tranzakciókat, adatvesztést okozó műveleteket, túlzott hozzáférést vagy a védelmi intézkedések megkerülését. Ügynöki környezetekben a káros kéréseket is biztonságosabban kezeli, például ha erőszakos támadás megtervezéséhez vagy csalás elkövetéséhez kérnek segítséget.
  7. A GPT‑6 Astra jelentősen biztonságosabb a magasabb kockázatú helyzetekben. A GPT‑6 Astra a GPT‑5.6 Solnál biztonságosabban válaszol az éles használatból és az emberek által végzett ellenséges támadásszimulációkból származó, nehéz kérésekre. Az Astra Pareto-javulást ér el: biztonságosabban teljesíti a veszélyes kéréseket, miközben ritkábban utasít el szükségtelenül ártalmatlan kéréseket. Ezek a fejlesztések azokra a súlyos helyzetekre is kiterjednek, amelyekben a károkozás kockázata nem egy kifejezett kérésből, hanem a tágabb összefüggésből ered. Az Astra a 18 év alatti felhasználóknál következetesebben alkalmazza az életkoruknak megfelelő biztonsági korlátokat is.

További információért tekintse meg a teljes rendszerkártyát(új ablakban nyílik meg).