Kalo te përmbajtja kryesore
OpenAI

3 shtator 2026

Siguria

Përmbledhje e sigurisë: GPT‑6 Astra

Duke ngarkuar…

Sot po nxjerrim GPT‑6 Astra, modelin më të aftë që kemi vënë ndonjëherë gjerësisht në përdorim. Astra është modeli ynë i parë që arrin nivelin Kritik të aftësive të sigurisë kibernetike sipas Preparedness Framework.

Aspektet më të rëndësishme që duhen ditur për sigurinë e kësaj nxjerrjeje janë si më poshtë:

  1. GPT‑6 Astra shënon një përparim të rëndësishëm në aftësitë kibernetike dhe përmbush pragun tonë Kritik. Kjo do të thotë se, me mjetet dhe aksesin e duhur, GPT‑6 Astra mund të gjejë dobësi sigurie të panjohura më parë dhe të zhvillojë mënyra të reja për t’i shfrytëzuar ato në shumë sisteme të mbrojtura mirë, pa qenë nevoja që një person të udhëzojë çdo hap. Për këtë arsye, i forcuam ndjeshëm masat tona mbrojtëse kundër veprimeve të dëmshme kibernetike nga modeli, qoftë për shkak të keqpërdorimit apo mospërputhjes. Gjithashtu morëm masa për të siguruar zhvillimin dhe vënien e brendshme në përdorim të Astra-s dhe modeleve të ngjashme, duke përfshirë izolim më të rreptë, enkriptim të pikave të kontrollit, monitorim universal të trajektoreve të plota, përfshirë zinxhirët e mendimit (CoT), si dhe një proces vlerësimi të përafrimit me fuqi bllokuese përpara përdorimit të brendshëm.
  2. GPT‑6 Astra është ndjeshëm më rezistent se paraardhësit e tij. Falë teknikave të reja të trajnimit të sigurisë për rritjen e rezistencës, GPT‑6 Astra është ndjeshëm më rezistent ndaj heqjeve të kufizimeve mbrojtëse sesa GPT‑5.6 Sol, edhe përgjatë trajektoreve më të gjata. Këtë e dimë nga testet jashtë linje dhe nga programi ynë rigoroz i testimit dhe korrigjimit, të brendshëm e të jashtëm, për heqjen e kufizimeve mbrojtëse. Për përdoruesit e identifikuar si potencialisht me rrezik të lartë, e kemi trajnuar më tej modelin që ta zhvendosë pragun e refuzimit drejt një aksesi më konservator dhe të mbulojë një gamë më të gjerë rreziqesh nga përdorimi i dyfishtë. Përdorim testimin e regresionit për t’u siguruar që Astra është rezistent ndaj heqjeve të kufizimeve mbrojtëse të zbuluara në periudhat e mëparshme të testimit dhe zhvilluam raunde të reja të automatizuara të simulimit të sulmeve me sulmuesit tanë më të fundit të brendshëm, për të vërtetuar përmirësimet tona.
  3. GPT‑6 Astra është më i përafruar se GPT‑5.6 Sol. Astra shënon një përparim të rëndësishëm në përafrimin e modelit dhe përfshin përmirësime që shtrihen nga përbërja e të dhënave tona të paratrajnimit deri te vlerësimi gjatë trajnimit përforcues. Paraqesim një grup të ri vlerësimesh të përafrimit(hapet në një dritare të re) dhe konstatojmë se GPT‑6 Astra respekton më mirë kufijtë e sigurisë dhe qëndron brenda fushës së autorizuar. Në një simulim me më shumë se 54 000 detyra të brendshme të Codex(hapet në një dritare të re), Astra mori gjithashtu afërsisht gjysmën e sinjalizimeve të Sol për sjellje të papërputhura me ashpërsi më të lartë.
  4. Po e zbatojmë gjerësisht monitorimin e mospërputhjes. Përafrimin e modelit e konsiderojmë mekanizmin kryesor për të parandaluar sjelljen e mundshme të papërputhur të modeleve tona. Megjithatë, monitorimi ofron një pamje të gjerë të sjelljes së modeleve avangardë, duke nxjerrë në pah mundësi për përmirësime të mëtejshme të përafrimit dhe sigurisë. Për më tepër, monitorimi shërben si një shtresë shtesë mbrojtjeje ndaj sjelljeve të papërputhura që zbulohen. Për këto arsye, kemi shtuar monitorimin e mospërputhjes në të gjitha proceset e inferencës që përdorin mjete gjatë vënies së jashtme në përdorim të Astra-s, me kosto të konsiderueshme llogaritëse. Ky sistem pasqyron konfigurimin tonë të brendshëm.
  5. Monitorueshmëria e GPT‑6 Astra është ulur krahasuar me GPT‑5.6 Sol. Kemi kryer hetime të konsiderueshme mbi monitorueshmërinë(hapet në një dritare të re) dhe kontrollueshmërinë(hapet në një dritare të re) e GPT‑6 Astra. Kemi zbuluar se GPT‑6 Astra është më i aftë ta kontrollojë CoT-në e vet sesa GPT‑5.6 Sol dhe ka më pak gjasa të përfshijë në të informacione fajësuese. Në kushte kundërshtuese, ku e nxitim modelin t’u shmanget monitorëve tanë, konstatojmë se modeli mund të mbetet i pazbuluar kur e ul në mënyrë strategjike performancën në vlerësime (ulje e performancës) dhe ndonjëherë mund t’u shmanget monitorëve tanë të brendshëm kur i kërkohet të kryejë disa detyra sabotimi(hapet në një dritare të re). Nuk kemi parë prova të arsyetimit steganografik në CoT, si fshehja e arsyetimit të padukshëm brenda një teksti të zakonshëm dhe në dukje të palidhur, çka tregon se rreziku i shmangies mund të kufizohet kryesisht te detyrat që kërkojnë më pak arsyetim.
    • Këto gjetje tregojnë se modelet e klasës Astra mund t’u shmangen monitorëve tanë të CoT-së në kushte kundërshtuese. Aktualisht, këto gjetje bazohen kryesisht në vlerësime kundërshtuese (pra, kur e udhëzojmë modelin t’i shmanget monitorimit), ndërsa, në përgjithësi, vlerësimet tona të përafrimit tregojnë se Astra ka më pak gjasa se GPT‑5.6 Sol të shkelë kufizimet e mbrojtjes dhe sigurisë.
    • Megjithatë, e marrim seriozisht këtë prirje dhe vazhdojmë të hetojmë këto gjetje dhe rrjedhojat e tyre për monitorueshmërinë, ndërsa modelet tona bëhen më të afta. OpenAI ka punuar për ruajtjen dhe përdorimin e monitorimit të zinxhirit të mendimit dhe ruajtja e monitorueshmërisë së CoT-së është një synim themelor i programit kërkimor. Megjithatë, këto rezultate theksojnë edhe rëndësinë e zhvillimit të teknikave të auditimit të përafrimit që shkojnë përtej shqyrtimit të zinxhirit të mendimit të modelit.
  6. GPT‑6 Astra vepron më me përgjegjësi gjatë shfletimit dhe në mjediset e punës: GPT‑6 Astra është ndjeshëm më rezistent ndaj injektimeve të kërkesave sesa GPT‑5.6 Sol. Gjithashtu kemi testuar sjelljen e modelit në mjedise realiste shfletimi dhe përdorimi profesional të kompjuterit dhe kemi zbuluar se, krahasuar me GPT‑5.6 Sol, modeli ka ndjeshëm më pak gjasa të kryejë veprime të papërputhura dhe potencialisht shkatërruese, si transaksione të paautorizuara, humbje të dhënash, akses të tepruar ose anashkalim të kontrolleve. Ai vepron më sigurt edhe kur trajton kërkesa të dëmshme në mjedise agjentike, si kërkesat për të ndihmuar në planifikimin e një sulmi të dhunshëm ose në kryerjen e mashtrimit.
  7. GPT‑6 Astra është ndjeshëm më i sigurt në skenarë me rrezik më të lartë. GPT‑6 Astra u përgjigjet më sigurt se GPT‑5.6 Sol kërkesave sfiduese të marra nga përdorimi real dhe nga simulimi kundërshtues i sulmeve nga njerëzit. Astra arrin një përmirësim Pareto në trajtimin e sigurt të kërkesave të pasigurta dhe në shmangien e refuzimeve të panevojshme të kërkesave të padëmshme. Këto përmirësime shtrihen edhe në skenarë me pasoja të rënda, ku rreziku i dëmit lind nga konteksti më i gjerë dhe jo nga një kërkesë e drejtpërdrejtë. Astra zbaton gjithashtu në mënyrë më të qëndrueshme kufij sigurie të përshtatshëm për moshën për përdoruesit nën 18 vjeç.