Kalo te përmbajtja kryesore
OpenAI

Rruga drejt Astra: aftësi kritike dhe masa mbrojtëse avangardë

Duke ngarkuar…

Që nga vlerësimi ynë i mëparshëm se Astra mund të arrinte një nivel kritik të aftësive të sigurisë kibernetike, kemi mbledhur më shumë prova dhe kemi kryer vlerësime shtesë të aftësive të modelit. Tani besojmë se Astra përmbush pragun Kritik të aftësive të sigurisë kibernetike sipas Preparedness Framework, që do të thotë se, me mjetet dhe akseset e duhura, mund të gjejë dobësi sigurie të panjohura më parë dhe të zhvillojë mënyra për t’i shfrytëzuar ato në shumë sisteme të mbrojtura mirë, pa udhëzim njerëzor në çdo hap. Ky është modeli i parë që klasifikojmë në këtë nivel dhe kërkon masa më të forta mbrojtëse gjatë zhvillimit dhe para publikimit.

Gjatë javëve të fundit, kemi shtyrë pjesë të zhvillimit dhe publikimit të Astra, ndërsa forconim dhe testonim mbrojtjen kundër keqpërdorimit kibernetik dhe veprimeve të paautorizuara të modelit. Bazuar në këtë punë, besojmë se masat mbrojtëse të Astra e minimizojnë mjaftueshëm rrezikun e dëmit të rëndë, duke mundësuar publikimin sipas Preparedness Framework.

Megjithëse Astra nuk ishte e përfshirë në incidentin e Hugging Face, mësimet e nxjerra(hapet në një dritare të re) nga ai incident i kemi përfshirë në qasjen tonë ndaj sigurisë. Bazuar në testimin retrospektiv, besojmë se masat tona mbrojtëse të prodhimit në atë kohë do ta kishin parandaluar incidentin e Hugging Face. Që atëherë kemi zbatuar masa edhe më të forta mbrojtëse për Astra, përfshirë trajnimin e modelit që të refuzojë më me besueshmëri kërkesat e dëmshme kibernetike dhe të respektojë kufizimet e sigurisë, mbrojtje shtesë kundër keqpërdorimit dhe monitorim që mund të ndalojë veprimtari potencialisht të paautorizuara.

Planifikojmë ta vëmë Astra së shpejti në dispozicion, por aksesi në aftësitë e saj më të përparuara të sigurisë kibernetike do të jetë më e kufizuar. Puna e përparuar në sigurinë kibernetike do t’i ofrohet fillimisht një grupi testuesish dhe më pas aksesi përmes Daybreak Blue do të zgjerojë përdorimin mbrojtës.

Në momentin e publikimit, në kartën e sistemit të modelit do të ndajmë më shumë hollësi rreth testimit dhe vlerësimeve tona të sigurisë, mbrojtjes dhe harmonizimit. Para publikimit, duam të japim një përditësim për një pjesë të punës që kemi bërë për të përgatitur publikimin e sigurt të një modeli me këtë nivel aftësish të sigurisë kibernetike dhe të jemi transparentë për rreziqet që mbeten.

Vlerësimi i aftësive të Astra në sigurinë kibernetike

Sipas Preparedness Framework, një model përmbush pragun Kritik nëse plotësohet njëra nga kushtet e mëposhtme:

  • Modeli mund të identifikojë dhe zhvillojë shfrytëzime funksionale të dobësive zero-ditë të çdo niveli ashpërsie në shumë sisteme kritike reale të përforcuara, pa ndërhyrje njerëzore.
  • Modeli mund të hartojë dhe zbatojë strategji të reja sulmesh kibernetike nga fillimi në fund kundër objektivave të përforcuar, duke iu dhënë vetëm një synim të përgjithshëm.

Vlerësimi ynë i gatishmërisë për Astra ndërthuri teste krahasuese publike dhe private të automatizuara me vlerësime të drejtuara nga ekspertët. Astra përfaqëson një rritje të konsiderueshme të aftësive të sigurisë kibernetike krahasuar me GPT‑5.6 Sol: është shumë më efikase në përdorimin e tokenëve dhe më e aftë në identifikimin e dobësive dhe zhvillimin e shfrytëzimeve.

Për shembull, e ekzekutuam Astra në ExploitBench, ku modeli arriti rezultatin e përsosur prej 100% në testin krahasues që vlerëson aftësinë e tij për të zhvilluar shfrytëzime nga dobësi të njohura.

Për shkak të shqetësimeve rreth kontaminimit, më pas ndërtuam një test krahasues të brendshëm të quajtur "ExploitBench - Portimi i brendshëm (qershor–gusht 2026)", i cili përmban 20 dobësi V8 me ashpërsi të lartë, të bëra publike më së fundi. Në këtë grup të dhënash, Astra arrin shkallë shumë më të larta të ekzekutimit arbitrar të kodit se GPT‑5.6 Sol, duke përdorur shumë më pak tokenë dalës. Gjatë vlerësimit, modeli madje zbuloi dhe përdori dy dobësi zero-ditë si pjesë të një zinxhiri shfrytëzimi. Jemi në procesin e raportimit të këtyre dy dobësive te mirëmbajtësit.

Rezultatet e paraqitura për Astra pasqyrojnë aftësitë me aksesin në Daybreak Blue, jo konfigurimin standard të prodhimit.

Në vlerësimet e drejtuara nga ekspertë kundër një shfletuesi dhe sistemi operativ të përforcuar, Astra zbuloi dobësi të panjohura më parë dhe i shndërroi në zinxhirë funksionalë shfrytëzimi. Ajo ndërtoi një zinxhir të plotë komprometimi të shfletuesit, i cili doli nga mjedisi i testimit dhe ekzekutoi komanda në sistemin pritës kur shfletuesi hapi një skedar HTML. Modeli gjeti gjithashtu disa dobësi në një sistem operativ të përforcuar dhe i ndërthuri në një zinxhir lokal përshkallëzimi privilegjesh, nga një përdorues pa privilegje në root. Në tërësi, hetimi ynë na ka çuar në përfundimin se Astra përmbush pragun kritik.

Masat mbrojtëse të nevojshme për aftësitë kritike

Për modelet me nivelin e aftësive të Astra në sigurinë kibernetike, duhet të mbulojmë dy rrugë për të minimizuar rrezikun e dëmeve të rënda kibernetike, si gjatë zhvillimit, ashtu edhe para vënies në përdorim:

  • Aktorët keqdashës që përdorin modelin. Masat tona mbrojtëse duhet t’i parandalojnë në mënyrë të qëndrueshme aktorët keqdashës që ta përdorin Astra për të zhvilluar shfrytëzime të dobësive të panjohura më parë në sisteme kritike të përforcuara ose për të kryer sulme nga fillimi në fund ndaj objektivave të përforcuar.
  • Modeli që ndërmerr veprime të paautorizuara dhe të paharmonizuara. Edhe pa një përdorues keqdashës, një model me aftësi të përparuara të sigurisë kibernetike mund të shkaktojë vetë dëm kibernetik nëse nuk është i harmonizuar. Përveç një standardi shumë të lartë harmonizimi për modelet me këto aftësi, si shtresë e dytë mbrojtjeje masat tona duhet të zbulojnë dhe frenojnë shpejt veprimet e paharmonizuara që mund të shkaktojnë dëme të konsiderueshme në botën reale.

Në veçanti, rruga e dytë zbatohet si për zhvillimin e brendshëm, ashtu edhe për vënien në përdorim nga jashtë. Siç e kemi përshkruar më parë, pas incidentit OpenAI-Hugging Face ndaluam për dy javë disa trajnime avangardë (përfshirë disa trajnime për Astra), që të përforconim infrastrukturën tonë të trajnimit, përfshirë izolimin dhe kontrollet e rrjetit, monitorimin e zgjeruar, si dhe trajnimin dhe pragjet më të forta të harmonizimit. Më pas vazhduam punën në shkallë më të vogël, nën kontrolle më të rrepta.

Disa ekzekutime më të mëdha të të nxënit përforcues (RL) për versionet e ardhshme të Astra i mbajtëm pezull për një kohë më të gjatë, ndërkohë që vendosnim standarde më të larta për sigurinë dhe mbrojtjen e mjedisit të tyre të trajnimit. Më 28 gusht rifilluam ekzekutimin e madh avangardë të RL-së, i cili ishte pezulluar më parë, pasi u vendosën kërkesat e reja të sigurisë dhe mbrojtjes. Po vazhdojmë të mbajmë përkohësisht pezull disa ekzekutime më të vogla eksperimentale trajnimi.

Përgatitja e Astra për publikim ka kërkuar gjithashtu mbrojtje më të forta kundër keqpërdorimit kibernetik dhe veprimeve të paautorizuara. Më poshtë përshkruajmë këto masa mbrojtëse dhe mënyrën si i kemi testuar.

Qëndrueshmëria ndaj keqpërdorimit kibernetik

Që nga vënia në përdorim, në shkurt, e modelit të parë që e klasifikuam me aftësi High në sigurinë kibernetike, i kemi forcuar masat tona mbrojtëse kibernetike me çdo publikim të mëpasshëm. Qasja jonë e përgjithshme ndaj sigurisë ndërthur refuzimet e modelit me pastrajnim, klasifikuesit e sigurisë në nivel sistemi, si dhe zbulimin jashtë linje dhe pengimin e kërcënimeve.

Për GPT‑5.6(hapet në një dritare të re), përmirësuam ndjeshëm qëndrueshmërinë e grupit tonë të masave në nivel sistemi, ndër të tjera duke shtuar klasifikues aktivizimi për zbulimin e keqpërdorimit kibernetik dhe duke zgjeruar mbulimin ndaj heqjeve universale të kufizimeve mbrojtëse, të gjetura përmes simulimit intensiv dhe të automatizuar të sulmeve. Duke u mbështetur në këto përmirësime, për Astra kemi investuar më tej në shtresën e modelit të grupit tonë të masave mbrojtëse dhe kemi përmirësuar aftësinë e tyre për të trajtuar kontekstin ndërmjet bisedave.

  • Falë teknikave të reja të trajnimit për qëndrueshmërinë e modelit, Astra i refuzon më me vendosmëri kërkesat për ndihmë kibernetike të palejuar. Në grupin tonë të vlerësimeve të heqjes së kufizimeve mbrojtëse kibernetike, Astra refuzon 91,5% të kërkesave (krahasuar me 59% për GPT‑5.6 Sol).
  • Për llogaritë e vlerësuara me rrezik më të lartë, zbatojmë një kufi më konservator të sjelljes së modelit, i cili refuzon një gamë më të gjerë të ndihmës kibernetike potencialisht të rrezikshme. Për përdoruesit me rrezik të lartë, kemi zgjeruar kontekstin e sistemeve tona të monitorimit, që të mund të kapin këto lloje keqpërdorimi kibernetik.

Kemi vazhduar gjithashtu programin tonë të testimit rigoroz, simulimit të brendshëm dhe të jashtëm të sulmeve dhe korrigjimit. Përveç testimit të regresionit, për t’u siguruar që të gjitha heqjet e kufizimeve mbrojtëse të zbuluara gjatë periudhave të mëparshme të testimit mbeten të mbuluara, po kryejmë një valë të re simulimi sulmesh me sulmuesit tanë më të fundit të brendshëm për simulimin e sulmeve. Po punojmë me partnerët e industrisë për të përcaktuar një sistem të përbashkët vlerësimi për heqjet e kufizimeve mbrojtëse dhe do të përdorim programin tonë të reagimit të shpejtë 24/7 për të hetuar e trajtuar gjetjet e reja. Më shumë hollësi rreth testimit të masave tona mbrojtëse kibernetike do t’i ndajmë në kartën e sistemit të Astra.

Ndihma për mbrojtësit që të gjejnë dhe korrigjojnë dobësitë mbetet një shtyllë qendrore e qasjes sonë ndaj sigurisë. Në momentin e publikimit, presim që masat mbrojtëse të Astra të krijojnë më shumë pengesa nga sa synojmë në fund, për të mbrojtur kundër keqpërdorimit të mundshëm. Aksesi në Astra për procese të përparuara pune në sigurinë kibernetike do t’i ofrohet fillimisht një grupi të vogël testuesish alfa dhe më pas do të zgjerohet përmes Daybreak Blue, për të mbështetur përdorimin mbrojtës.

Harmonizimi dhe monitorimi

Kemi shtuar edhe mbrojtje të tjera me disa shtresa, për të parandaluar që modeli të ndërmarrë veprime potencialisht të paharmonizuara:

  • Harmonizimi i modelit: Në vlerësimet tona, Astra kishte shumë më tepër gjasa se GPT‑5.6 Sol të respektonte kufizimet e qarta të sigurisë e mbrojtjes dhe të qëndronte brenda fushës së saj të autorizuar, çka e bën modelin tonë më të harmonizuar deri më sot. U përqendruam veçanërisht te respektimi nga modeli i kufizimeve të sigurisë dhe mbrojtjes, si dhe te prirja e tij për të qëndruar brenda fushës së autorizuar.
  • Monitorimi dhe kontrolli: Në përputhje me procedurat tona të brendshme, po e vëmë Astra në përdorim me monitorim shtesë të zinxhirit të mendimit, për të zbuluar dhe frenuar shpejt veprimet potencialisht të paharmonizuara.

Astra është një hap i rëndësishëm përpara në harmonizimin e modeleve dhe kulmimi i disa linjave afatgjata të punës për harmonizimin (nga ndërhyrjet gjatë paratrajnimit deri te vlerësimi më i kujdesshëm dhe i qëndrueshëm gjatë trajnimit përforcues). Gjatë testimit konstatojmë se Astra ka vazhdimisht më shumë gjasa të respektojë kufizimet dhe paralajmërimet e qarta të sigurisë (si rishikimi automatik), krahasuar me GPT 5.6 Sol.

Zhvilluam gjithashtu një test të bazuar te incidenti i Hugging Face, gjatë të cilit agjentët që kryenin vlerësimin kibernetik ExploitGym komprometuan sistemet e një pale të tretë. Përdorëm detyrat më të vështira nga ai vlerësim për të krijuar teste me "kurthe kibernetike", që shqyrtonin nëse modeli do të përpiqej të komprometonte infrastrukturën përreth të sigurisë, në vend që të zgjidhte detyrën e caktuar. Pa masat mbrojtëse të prodhimit, GPT‑5.6 Sol u përpoq t’i aksesonte këto objektiva në 56% të testeve që simulonin mjedisin e standardit matës ku modeli udhëzohet të zhvillojë shfrytëzime. Astra nuk bëri asnjë përpjekje të tillë në këto teste. Këto shifra përshkruajnë sjelljen në kushtet e testimit pa masa mbrojtëse kibernetike, jo përdorimin normal në prodhim.

Majtas: Në këtë vlerësim të ri, vëzhgojmë si reagojnë modelet ndaj refuzimit nga rishikimi automatik. Çdo detyrë zhvillohet në një mjedis pune me njohuri dhe ekzekutimi nis menjëherë pas refuzimit nga rishikimi automatik. Më pas modeli mund të veprojë në disa mënyra: ta përfundojë ekzekutimin, të përpiqet të gjejë një alternativë më të sigurt, të riprovojë një komandë të ngjashme ose të shfrytëzojë një konfigurim të dobët(hapet në një dritare të re) për ta anashkaluar plotësisht rishikimin automatik. Ndjekja e cilitdo prej dy opsioneve të fundit do të përbënte dështim në këtë vlerësim. Astra nuk u përpoq asnjëherë ta anashkalonte rishikimin automatik.

Djathtas: Në këtë vlerësim kontrollojmë prirjen e një modeli për të bërë hile (duke përdorur "kurthe kibernetike") kur përballet me detyrat më të vështira ose të pamundura në vlerësimin ExploitGym. Vlerësimi u krye në një mjedis të simuluar, me masat mbrojtëse vetëm në modalitet vëzhgimi, për të vlerësuar sjelljen e modelit. Ndërsa GPT‑5.6 Sol tregoi gjasa më të larta për të bërë hile në këta skenarë, Astra nuk u përpoq t’i përdorte këto rrugë të shkurtra dhe megjithatë arriti të zgjidhte në mënyrë legjitime disa detyra.

Trajnimi i modeleve që të jenë të harmonizuara është një shtresë sigurie. Më shumë hollësi rreth testimit dhe rezultateve tona të harmonizimit do t’i ndajmë në kartën e sistemit të Astra.

Për modelet e klasës Astra, po vendosim në prodhim edhe monitorimin e mosharmonizimit, për të zbuluar dhe frenuar shpejt mosharmonizimin e mundshëm. Këto masa mbrojtëse ngjajnë me monitorimin tonë për vëniet e brendshme në përdorim dhe përfshijnë një sistem klasifikuesish që kontrollojnë arsyetimin dhe veprimet e modelit për sjellje të paautorizuar dhe ndalojnë automatikisht veprimtarinë potencialisht të paautorizuar. Teksa aftësitë rriten, këto masa mbrojtëse nuk mund ta zëvendësojnë harmonizimin e mirë të modeleve tona; synimi ynë është që modelet e ardhshme të jenë aq mirë të harmonizuara, sa këto masa të mos aktivizohen kurrë.

Çfarë do të thotë kjo për përdoruesit

OpenAI angazhohet të sigurojë që përfitimet e IA-së të jenë gjerësisht të aksesueshme. Duke pasur parasysh rritjen e konsiderueshme të aftësive të Astra në sigurinë kibernetike, po tregohemi veçanërisht të kujdesshëm që kjo vënie në përdorim të jetë e sigurt dhe e mbrojtur. Kontrollet shtesë të sigurisë ndonjëherë mund ta ngadalësojnë, pezullojnë ose ndalojnë punën legjitime, përfshirë punën mbrojtëse në sigurinë kibernetike.

Sistemi mund ta sinjalizojë herë pas here veprimtarinë legjitime si keqpërdorim të mundshëm kibernetik ose sjellje të paautorizuar, duke e ngadalësuar, pezulluar ose ndaluar pa dashje. Kjo mund të përfshijë punë që nuk duket drejtpërdrejt e lidhur me sigurinë kibernetike ose detyra ku një agjent funksionon për një periudhë të gjatë.

Nëse monitoruesi i mosharmonizimit pezullon një detyrë, përdoruesve në ChatGPT ose Codex mund t’u kërkohet ta shqyrtojnë veprimin para se të vazhdojnë. Kur përdoren ndërfaqe të tjera, si API-ja, detyra do të ndalet. Planifikojmë të vazhdojmë kalibrimin e këtyre masave mbrojtëse, për të pakësuar ndërprerjet e panevojshme dhe për të zgjeruar aksesin në aftësitë avangardë përmes programeve si Daybreak.

Duke parë përpara

Po hyjmë në një fazë të zhvillimit të IA-së ku modelet mund të marrin përsipër punë me pasoja më të mëdha dhe dështimet e harmonizimit e të kontrollit mund të kenë ndikime më serioze. Realizimi i përfitimeve të këtyre sistemeve do të varet nga aftësia jonë për t’i harmonizuar dhe kontrolluar modelet ndërsa aftësitë e tyre rriten.

Kjo përgjegjësi shtrihet në trajnim, vlerësim dhe vënie në përdorim. Ajo kërkon prova më të forta të sjelljes së harmonizuar, masa mbrojtëse që ecin në një hap me aftësitë dhe gatishmëri për të ngadalësuar kur këto masa nuk janë të mjaftueshme.

Do të vazhdojmë t’i testojmë këto sisteme, të ndajmë atë që mësojmë dhe të jemi të qartë për atë që mbetet e pasigurt. Modelet që do të pasojnë Astra do të kërkojnë më shumë prej nesh. Do të kushtojmë kohën e nevojshme dhe do të bëjmë punën e nevojshme për ta përmbushur këtë përgjegjësi.