Aqbeż għall-kontenut prinċipali
OpenAI

3 ta’ Settembru 2026

Sigurtà

Ħarsa ġenerali lejn is-sikurezza: GPT‑6 Astra

Qed jillowdja…

Illum qed inniedu GPT‑6 Astra, l-aktar mudell kapaċi li qatt skjerajna fuq skala wiesgħa. Astra huwa l-ewwel mudell tagħna li laħaq il-livell Kritiku ta’ kapaċità taċ-ċibersigurtà skont il-Qafas tat-Tħejjija tagħna.

Dawn huma l-aktar affarijiet importanti li għandek tkun taf dwar is-sikurezza ta’ din it-tnedija:

  1. GPT‑6 Astra jirrappreżenta qabża sinifikanti fil-kapaċitajiet ċibernetiċi u jilħaq il-limitu Kritiku tagħna. Dan ifisser li, bl-għodod u l-aċċess xierqa, GPT‑6 Astra jista’ jsib difetti tas-sigurtà li qabel ma kinux magħrufa u jiżviluppa modi ġodda kif jisfruttahom f’ħafna sistemi protetti sew, mingħajr ma persuna tiggwida kull pass. Għaldaqstant, saħħaħna b’mod sinifikanti l-protezzjonijiet tagħna kontra azzjonijiet ċibernetiċi dannużi mill-mudell, kemm jekk minħabba użu ħażin kif ukoll minħabba nuqqas ta’ allinjament. Ħadna wkoll passi biex niżguraw l-iżvilupp u l-iskjerament interni tagħna ta’ Astra u mudelli simili, inklużi iżolament aktar strett, kriptaġġ tal-punti ta’ kontroll, monitoraġġ universali tat-trajettorji sħaħ inklużi l-ktajjen tal-ħsieb (CoT), u proċess obbligatorju ta’ evalwazzjoni tal-allinjament qabel l-użu intern.
  2. GPT‑6 Astra huwa ferm aktar robust mill-predeċessuri tiegħu. Bis-saħħa ta’ tekniki ġodda ta’ taħriġ tas-sikurezza għar-robustezza, GPT‑6 Astra huwa ferm aktar reżistenti għal attakki jailbreak minn GPT‑5.6 Sol, anke tul trajettorji itwal. Dan nafuh minn testijiet offline u mill-programm rigoruż tagħna ta’ ttestjar u rimedju ta’ attakki jailbreak, kemm intern kif ukoll estern. Għall-utenti identifikati bħala potenzjalment ta’ riskju għoli, ħarriġna wkoll il-mudell biex jaġġusta l-limitu tar-rifjut tiegħu ħalli jkun aktar kawt u jkopri firxa usa’ ta’ riskji ta’ użu doppju. Nużaw testijiet ta’ rigressjoni biex niżguraw li Astra jibqa’ robust kontra attakki jailbreak misjuba f’fażijiet preċedenti ta’ ttestjar, u wettaqna fażijiet ġodda ta’ red teaming awtomatizzat bl-aħħar attakkanti interni tagħna tar-red teaming biex nivvalidaw it-titjib.
  3. GPT‑6 Astra huwa allinjat aħjar minn GPT‑5.6 Sol. Astra jirrappreżenta pass sinifikanti ’l quddiem fl-allinjament tal-mudell, b’titjib li jkopri mill-kompożizzjoni tad-data tagħna ta’ qabel it-taħriġ sal-klassifikazzjoni waqt l-apprendiment ta' tisħiħ. Aħna nippubblikaw ġabra ġdida ta’ evalwazzjonijiet tal-allinjament(jinfetaħ f’tieqa ġdida), u sibna li GPT‑6 Astra jirrispetta aħjar il-limiti tas-sikurezza u s-sigurtà u jibqa’ fil-kamp ta’ applikazzjoni awtorizzat tiegħu. F’simulazzjoni li użat aktar minn 54,000 kompitu intern ta’ Codex(jinfetaħ f’tieqa ġdida), Astra rċieva wkoll madwar nofs in-numru ta’ indikazzjonijiet għal imġiba mhux allinjata ta’ severità ogħla meta mqabbel ma’ Sol.
  4. Qed niskjeraw b’mod wiesa’ l-monitoraġġ tan-nuqqas ta’ allinjament. Aħna nqisu l-allinjament tal-mudell bħala l-mezz ewlieni biex nipprevjenu mġiba potenzjalment mhux allinjata mill-mudelli tagħna. Madankollu, il-monitoraġġ jagħti viżibbiltà wiesgħa fuq l-imġiba tal-mudelli avvanzati, u jiżvela opportunitajiet biex inkomplu ntejbu l-allinjament u s-sikurezza. Barra minn hekk, il-monitoraġġ iservi bħala saff addizzjonali ta’ protezzjoni kontra mġiba mhux allinjata li tiġi identifikata. Għal dawn ir-raġunijiet, żidna wkoll il-monitoraġġ tan-nuqqas ta’ allinjament mal-inferenza kollha li tuża għodod fl-iskjerament estern tagħna ta’ Astra, minkejja l-ispiża komputazzjonali sinifikanti. Din is-sistema tirrifletti l-konfigurazzjoni interna tagħna.
  5. Il-possibbiltà li jiġi mmonitorjat GPT‑6 Astra naqset meta mqabbla ma’ GPT‑5.6 Sol. Wettaqna investigazzjonijiet estensivi dwar il-possibbiltà ta’ monitoraġġ(jinfetaħ f’tieqa ġdida) u l-kontrollabbiltà(jinfetaħ f’tieqa ġdida) ta’ GPT‑6 Astra. Sibna li GPT‑6 Astra huwa aktar kapaċi jikkontrolla l-CoT tiegħu stess minn GPT‑5.6 Sol, u huwa inqas probabbli li jinkludi informazzjoni inkriminanti fil-CoT tiegħu. F’kuntesti avversarjali, fejn nippruvaw inġiegħlu lill-mudell jevita l-monitors tagħna, sibna li l-mudell jista’ jibqa’ ma jinqabadx meta deliberatament jagħti prestazzjoni aktar baxxa fl-evalwazzjonijiet (sandbagging), u xi drabi jista’ jevita l-monitors interni tagħna meta jintalab iwettaq ċerti kompiti ta’ sabotaġġ(jinfetaħ f’tieqa ġdida). Ma rajniex evidenza ta’ raġunament CoT steganografiku, pereżempju l-ħabi ta’ raġunament moħbi f’test ordinarju li jidher mhux relatat. Dan jindika li r-riskju ta’ evitar jista’ jkun fil-biċċa l-kbira limitat għal kompiti b’livell aktar baxx ta’ raġunament.
    • Dawn is-sejbiet jindikaw li l-mudelli tal-klassi Astra jistgħu jevitaw il-monitors tal-CoT tagħna f’kundizzjonijiet avversarjali. Bħalissa, dawn is-sejbiet huma fil-biċċa l-kbira bbażati fuq evalwazzjonijiet avversarjali, jiġifieri meta nagħtu struzzjonijiet lill-mudell biex jevita l-monitoraġġ. B’mod ġenerali, l-evalwazzjonijiet tal-allinjament tagħna juru li Astra huwa inqas probabbli minn GPT‑5.6 Sol li jikser ir-restrizzjonijiet tas-sigurtà u s-sikurezza.
    • Madankollu, qed nieħdu din ix-xejra bis-serjetà u nkomplu ninvestigaw dawn is-sejbiet u l-implikazzjonijiet tagħhom għall-possibbiltà ta’ monitoraġġ hekk kif il-mudelli tagħna jsiru aktar kapaċi. OpenAI ħadmet biex tippreserva u tuża l-monitoraġġ tal-katina tal-ħsieb, u ż-żamma tal-possibbiltà li jiġi mmonitorjat il-CoT hija għan ewlieni tal-programm ta’ riċerka. Madankollu, dawn ir-riżultati jenfasizzaw ukoll l-importanza li jiġu żviluppati tekniki ta’ awditjar tal-allinjament li jmorru lil hinn mill-eżami tal-katina tal-ħsieb tal-mudell.
  6. GPT‑6 Astra jaġixxi b’aktar responsabbiltà waqt il-browsing u f’ambjenti tax-xogħol: GPT‑6 Astra huwa ferm aktar robust kontra l-injezzjonijiet ta’ prompt minn GPT‑5.6 Sol. Ittestjajna wkoll l-imġiba tal-mudell f’ambjenti realistiċi ta’ browsing u f’ambjenti professjonali fuq il-kompjuter. Sibna li, meta mqabbel ma’ GPT‑5.6 Sol, il-mudell huwa ferm inqas probabbli li jwettaq azzjonijiet mhux allinjati u potenzjalment distruttivi, bħal tranżazzjonijiet mhux awtorizzati, telf ta’ data, aċċess eċċessiv jew evitar tal-kontrolli. Jaġixxi wkoll b’mod aktar sikur meta jittratta talbiet dannużi f’kuntesti aġentiċi, bħal talbiet biex jgħin fl-ippjanar ta’ attakk vjolenti jew biex iwettaq frodi.
  7. GPT‑6 Astra huwa ferm aktar sikur f’xenarji ta’ riskju ogħla. GPT‑6 Astra jirrispondi b’mod aktar sikur minn GPT‑5.6 Sol għal talbiet diffiċli meħuda mill-produzzjoni u mir-red teaming avversarjali mwettaq minn persuni. Astra jikseb titjib ta’ Pareto billi jindirizza b’mod sikur talbiet mhux sikuri u jevita rifjuti bla bżonn ta’ talbiet li ma jagħmlux ħsara. Dan it-titjib jestendi għal xenarji ta’ severità għolja fejn ir-riskju ta’ ħsara jirriżulta mill-kuntest usa’ aktar milli minn talba espliċita. Astra japplika wkoll b’mod aktar konsistenti limiti tas-sikurezza xierqa għall-età għall-utenti taħt it-18-il sena.