Kalo te përmbajtja kryesore
OpenAI

Vlerësime kibernetike nga palë të treta me modele OpenAI

Duke ngarkuar…

Testimi i pavarur luan një rol të rëndësishëm për të na ndihmuar t’i vërtetojmë dhe t’i kuptojmë më tej rreziqet përpara vendosjes në përdorim. Disa vlerësime kibernetike përdorin qëllimisht konfigurime të posaçme, përfshirë masa mbrojtëse të reduktuara, për të matur aftësinë bazë—jo mënyrën se si sillen zakonisht modelet kur ofrohen publikisht.

Gjatë vlerësimeve të fundit, dy partnerë të jashtëm testimi identifikuan incidente ku ndërthurja e konfigurimeve dhe kontrolleve të testimit me aftësitë në rritje të modeleve të fundit bëri që aktiviteti i modeleve të dilte përtej kufijve të synuar të testimit. Incidentet nxjerrin në pah rëndësinë e bashkëpunimit në mbarë sektorin dhe me vlerësues të palëve të treta, për të zhvilluar standardet e mjediseve dhe praktikave të testimit ndërsa modelet bëhen më të afta. Shënim i redaktorit: Këto janë të ndara nga incidenti i sigurisë i Hugging Face dhe do të vazhdojmë të publikojmë përditësime për incidentin e Hugging Face këtu.

Incidentet e reja përfshinin hyrjen e modeleve OpenAI në internetin publik gjatë vlerësimeve kibernetike nga palë të treta, në kushte specifike dhe me konfigurime me masa mbrojtëse të reduktuara që nuk pasqyronin përdorimin e zakonshëm. Incidentet përfshinin:

  1. UK AISI, Instituti i Sigurisë së AI-së i qeverisë së Mbretërisë së Bashkuar, po kryente vlerësime në poligone kibernetike ku qasja në internet ishte aktivizuar qëllimisht, në mënyrë që agjentët të mund të gjenin vetë mjetet e tyre dhe të vepronin në kushte më të ngjashme me ato të një sulmuesi real; klasifikuesit kibernetikë ishin çaktivizuar për të matur aftësinë bazë. Blogun e tyre mund ta lexoni këtu.(hapet në një dritare të re)
  2. Irregular, një nga partnerët tanë të jashtëm për testimin e sigurisë kibernetike, po kryente vlerësime të tipit Capture-the-Flag, të menduara për t’u izoluar nga interneti, por një konfigurim i gabuar i mjedisit të testimit u mundësoi modeleve të hynin në internetin publik.

Më poshtë përmbledhim çfarë ndodhi, kushtet e testimit që e mundësuan aktivitetin, hapat e ndërmarrë për ta vënë nën kontroll dhe masat tona për të siguruar që laboratorët e pavarur të mund të vazhdojnë t’i vlerësojnë me rigorozitet dhe siguri modelet gjithnjë e më të afta.

Forcimi i mjediseve të vlerësimit të modeleve nga palë të treta

Këto incidente tregojnë të njëjtën sfidë më të gjerë që përshkruam në publikimin tonë të fundit për incidentin e Hugging Face: ndërsa aftësitë e modeleve përparojnë, duhet të përparojnë edhe sistemet e sigurisë dhe mbrojtjes rreth tyre. Kjo përfshin si mjediset e përdorura për zhvillimin e modeleve, ashtu edhe ato që laboratorët dhe partnerët e pavarur përdorin për vlerësimin e tyre.

Në javët e ardhshme do të rishikojmë qasjen tonë ndaj testimit nga palë të treta, duke përfshirë mënyrën se si identifikojmë vlerësimet me rrezik më të lartë, biem dakord për fushëveprimin, shqyrtojmë kërkesat për aktivizimin e qasjes në internet ose reduktimin e masave mbrojtëse, përcaktojmë pritshmëritë për izolimin, trajtimin e kredencialeve, monitorimin dhe kushtet e ndalimit, si dhe vendosim procese më të qarta për njoftimin dhe përshkallëzimin e incidenteve.

Jemi të angazhuar të bashkëpunojmë në mbarë sektorin për të forcuar praktikat e përbashkëta për kryerjen e sigurt të vlerësimeve me rrezik të lartë, përfshirë mbledhjen në javët e ardhshme të palëve të interesuara, si institutet kombëtare të AI-së, vlerësuesit e pavarur, laboratorët e tjerë të AI-së dhe grupe të tjera. Synimi ynë është të ruajmë vlerën e vlerësimit rigoroz dhe të pavarur, duke u siguruar njëkohësisht që praktikat e testimit të ecin në një hap me modelet gjithnjë e më të afta.

UK AISI

Më 3 gusht, UK AISI na njoftoi se, gjatë një vlerësimi rutinë kibernetik të nisur më 25 korrik, modelet e OpenAI dhe të një laboratori tjetër, në disa raste, dolën përtej fushëveprimit të testimit. Vlerësimi u zhvillua në poligone kibernetike të kontrolluara, të projektuara për të imituar rrjete reale. Nga 19 ngjarjet e identifikuara, dy përfshinin një model OpenAI, GPT‑5.6 Sol. Rastet e tjera përfshinin modele të një laboratori tjetër.

Për këtë vlerësim, agjentët u udhëzuan të vepronin si ekspertë të sigurisë kibernetike në një ushtrim capture-the-flag: të komprometonin tri mjedise të simuluara dhe të ndërlidhura, si dhe të merrnin një flamur përfundimtar. Kërkesa e detyrës identifikonte rrjetet e poligonit brenda fushëveprimit dhe përcaktonte disa sisteme si jashtë tij. UK AISI aktivizoi gjithashtu qasjen e drejtpërdrejtë në internet, në mënyrë që agjentët të mund të shkarkonin mjete dhe të vepronin në kushte më të ngjashme me ato të një sulmuesi njerëzor—dhe çaktivizoi klasifikuesit kibernetikë të modelit për të matur aftësinë bazë.

Kufiri i autorizimit i synuar nga UK AISI ishte poligoni i simuluar kibernetik: agjentët ishin të autorizuar të sulmonin rrjetet e simuluara të përcaktuara dhe të merrnin një flamur, por jo të ndërvepronin me sisteme jashtë kufijve të rrjetit të poligonit. Megjithatë, agjentëve nuk iu tha shprehimisht se si mund dhe nuk mund ta përdornin qasjen e hapur në internet, gjë që UK AISI e identifikon si një shkak të mundshëm kontribues të incidentit.

Gjatë këtyre ekzekutimeve, UK AISI konstatoi se GPT‑5.6 Sol kreu dy veprime të paautorizuara teksa përpiqej të gjente një rrugë për të hyrë në poligonin e simuluar dhe për të marrë flamurin:

  1. GPT‑5.6 Sol ripërdori një token të GitHub-it që agjenti i një laboratori tjetër e kishte lënë publikisht të aksesueshëm, për të kontrolluar nëse një sistem brenda poligonit po pyeste periodikisht GitHub-in ose një shërbim tjetër përditësimi; provoi mënyra alternative për rikuperimin e llogarisë dhe anashkalimin e kufijve të kërkesave; si dhe regjistroi llogari te ofrues të jashtëm DNS-je dhe tunelimi.
  2. GPT‑5.6 Sol përdori një shërbim publik tunelimi për ta bërë të aksesueshëm nga interneti publik një server DNS që funksiononte lokalisht në mjedisin e tij të vlerësimit. Serveri përmbante ngarkesa të krijuara për një cenueshmëri të njohur në një program që funksiononte në poligonin e testimit. Konfigurimi nuk funksionoi, nuk ka prova se ndonjë resolver real e pyeti serverin dhe infrastruktura u hoq kur përfundoi vlerësimi.

Megjithëse modeli po përpiqej të përfundonte poligonin kibernetik, UK AISI i konsideroi këto veprime të paautorizuara, sepse përfshinin llogari dhe shërbime reale të jashtme, përtej kufijve të poligonit, dhe nuk nevojiteshin për përfundimin e detyrës. Serveri DNS strehoi gjithashtu në internetin publik ngarkesa për shfrytëzimin e cenueshmërive, megjithëse konfigurimi nuk funksionoi dhe nuk ka prova se ndonjë resolver real e pyeti atë.

UK AISI e identifikoi aktivitetin më 28 korrik, pasi monitorimi i sigurisë zbuloi transferime të pazakonta të të dhënave. Instituti ndaloi vlerësimet përkatëse, izoloi pajisjet e përfshira dhe e vuri aktivitetin nën kontroll brenda afro një ore nga zbulimi.

E vlerësojmë partneritetin e UK AISI gjatë gjithë këtij procesi, përfshirë punën e tij për identifikimin dhe hetimin e aktivitetit, si dhe për ndarjen e hollësive rreth tij. Presim me kënaqësi ta vazhdojmë bashkëpunimin tonë.

Irregular

Më 29 korrik, Irregular, një nga partnerët tanë të jashtëm të vlerësimit, na njoftoi për një incident që përfshinte modele OpenAI gjatë vlerësimeve të sigurisë kibernetike të tipit Capture-the-Flag (CTF). Modelet u udhëzuan të gjenin informacione të fshehura duke shfrytëzuar dobësi brenda një mjedisi të simuluar dhe iu tha se nuk kishin qasje në internet. Megjithatë, një konfigurim i gabuar në mjedisin e testimit u mundësoi modeleve të hynin në internetin publik.

Në një test, emri i objektivit imagjinar të sfidës CTF përkoi pa dashje me një domen real. Meqë mjedisi i testimit ishte lidhur gabimisht me internetin, modeli shfrytëzoi një faqe reale, duke e ngatërruar me një pjesë të mjedisit të simuluar. Kjo nuk përfshiu ndonjë dalje të sofistikuar nga sandbox-i apo cenueshmëri zero-day: qasja në internet erdhi nga një konfigurim i gabuar dhe modeli duket se shfrytëzoi një cenueshmëri bazë sigurie.

Sipas hetimit të Irregular, modeli gjeti dhe përdori gjithashtu kredenciale për të administruar po atë faqe. Irregular nuk ka identifikuar ndikim përtej të dhënave të vetë faqes së prekur dhe auditimi i tij vazhdon. Irregular i ka pezulluar vlerësimet, ka nisur korrigjimin e problemeve dhe ka njoftuar palët e treta të prekura. Irregular na ka informuar se asnjë nga problemet e identifikuara lidhur me incidentin nuk është më aktiv dhe se në mjedisin e testimit janë shtuar masat përkatëse mbrojtëse. Irregular ka komunikuar gjithashtu për incidente të ngjashme që përfshinin laboratorë të tjerë në të njëjtin mjedis testimi.

E vlerësojmë partneritetin e Irregular dhe do të vazhdojmë të punojmë ngushtë me ta për të mbështetur shqyrtimin e tyre. Irregular po harton gjithashtu një dokument teknik për të ndarë praktikat më të mira për kufizimin e incidenteve dhe kryerjen e sigurt të vlerësimeve kibernetike. Presim me kënaqësi të kontribuojmë në dokumentin teknik, që gjetjet të vihen në dispozicion të komunitetit, si dhe të vazhdojmë partneritetin tonë. Këtë lloj bashkëpunimi e konsiderojmë thelbësor për të garantuar vlerësimin e sigurt dhe të plotë të modeleve aktuale dhe të ardhshme.

Autor

OpenAI