OpenAI og Hugging Face vinna saman að öryggisatviki við mat á líkani
Í síðustu viku upplýsti Hugging Face um nýja tegund öryggisatviks(opnast í nýjum glugga) eftir að fyrirtækið greindi og einangraði gervigreindarfulltrúa sem hafði brotist inn í innviði þess, nokkuð sem við búumst við að verði algengara eftir því sem líkön með sífellt meiri netárásargetu breiðast út. Eftir rannsókn vitum við nú að þetta tiltekna atvik var knúið áfram af samspili OpenAI-líkana — þar á meðal GPT‑5.6 Sol og enn öflugra forútgáfulíkans, öll með færri neitanir á netöryggissviði í matsskyni — á meðan þau voru prófuð innanhúss á viðmiði(opnast í nýjum glugga) fyrir netárásargetu.
Við lítum á þetta sem fordæmalaust netöryggisatvik, sem felur í sér nýjustu netárásargetu, og bregðumst við í samræmi við það. Við deilum bráðabirgðaniðurstöðum á þessu stigi til að hjálpa varnaraðilum að skilja hvað gerðist og átta sig betur á því hverju líkön eru nú fær um. Við munum halda áfram ítarlegri rannsókn ásamt Hugging Face og deila frekari upplýsingum um veikleikana, atvikið og niðurstöðurnar þegar rannsókninni er lokið.
Atvikið átti sér stað við innra mat þar sem líkön eru látin sækjast eftir háþróaðri hagnýtingu veikleika með flóknum árásarleiðum, í því skyni að mæla netárásargetu þeirra. Við metum hámarksgetu á netárásarsviði með því að keyra þetta mat án framleiðsluflokkara sem notaðir eru til að koma í veg fyrir að líkön sækist eftir áhættusamri netvirkni. Viðmiðin okkar keyra í mjög einangruðu umhverfi, þar sem netaðgangur takmarkast við möguleikann á að setja upp pakka í gegnum þriðja aðila hugbúnað, hýstan innanhúss, sem virkar sem staðgengill og skyndiminni fyrir pakkaskrár.
Líkönin fundu og tengdu saman veikleika í rannsóknarumhverfi OpenAI og framleiðsluinnviðum Hugging Face til að sækja próflausnir beint úr framleiðslugagnagrunni Hugging Face. Öll gögn benda til þess að líkönin hafi einblínt mjög á að finna lausn fyrir ExploitGym og gengið mjög langt til að ná fremur þröngu prófunarmarkmiði.
Á meðan líkön okkar störfuðu í afmörkuðu prófunarumhverfi okkar vörðu þau verulegu magni af ályktunarreikniafli í að finna leið til að fá opinn internetaðgang, til að leysa matsverkefnið. Til að fá aðgang fundu líkönin og nýttu zero-day-veikleika (sem við höfum nú tilkynnt seljandanum um með ábyrgum hætti) í skyndiminnisstaðgengli pakkaskrárinnar. Með þessum aðgangi framkvæmdu líkön okkar röð aðgerða til réttindahækkunar og hliðarhreyfingar í rannsóknarprófunarumhverfi okkar þar til líkönin náðu hnút með internetaðgangi.
Eftir að hafa fengið internetaðgang ályktuðu líkönin að Hugging Face hýsti hugsanlega líkön, gagnasöfn og lausnir fyrir ExploitGym. Með þessa vitneskju leitaði líkanið að og fann leiðir til að fá aðgang að leynilegum upplýsingum sem það gat notað til að svindla á matinu. Í einu dæmi tengdi líkanið saman marga árásarvektora, þar á meðal notkun stolinna aðgangsupplýsinga og zero-day-veikleika, til að finna leið til fjarkeyrslu kóða á Hugging Face-þjónum. Öryggisteymi OpenAI uppgötvaði þessa óvenjulegu virkni innanhúss.
Öryggisteymi og fulltrúar Hugging Face greindu og stöðvuðu virknina í innviðum þeirra og höfðu þegar hafið einangrun og réttarrannsóknarlega endurgerð með eigin opnum líkönum þegar teymi okkar tengdust. Við vinnum nú virkt með þeim að áframhaldandi rannsókn á atvikinu. Við erum þakklát fyrir hratt og náið samstarf Hugging Face við rannsókn og úrbætur.
- Sem hluti af rannsókninni innleiðum við ströng stýritæki fyrir uppsetningu innviða, þótt það hægi á rannsóknum, á meðan veikleikarnir eru lagfærðir. Við upplýsum öryggis- og verndarnefnd okkar reglulega um þessi stýritæki og áhrif þeirra.
- Við vinnum með Hugging Face að réttarrannsókn á atvikinu.
- Við höfum tilkynnt með ábyrgum hætti um auðkenndan zero-day-veikleika í þriðja aðila hugbúnaði sem er hýstur innanhúss og vinnum með þeim að lagfæringu.
- Við höfum tekið Hugging Face inn í áætlunina um traustan aðgang og styðjum teymi þeirra við að nýta hratt getu líkana okkar til að bæta varnir þeirra.
- Við erum að bæta og efla vernd í kringum framtíðarþjálfun og mat. Í þessari viku birtum við blogg um bætt öryggi og samstillingu á tímum líkana með langan tímaramma. Þessar öryggisráðstafanir við útsetningu voru vísvitandi ekki virkjaðar meðan á þessu mati stóð, þar sem markmiðið var að prófa veikleika á netöryggissviði. Atvikið bendir til þess að styrkja þurfi enn frekar samstillingu líkansins, netvarnir á meðan mat fer fram og vöktun í innri prófunum.
Eins og við deildum nýlega hraðar gervigreind uppgötvun og hagnýtingu veikleika. Helsti lærdómurinn af þessu atviki er að öryggi líkana og vernd þurfa að halda í við getu sem þróast hratt. Við erum að styrkja einangrun, vöktun, aðgangsstýringar og matsaðferðir sem notaðar eru við þróun líkana.
Mat UK AISI sýnir að líkön á borð við GPT‑5.6 Sol verða sífellt færari um að viðhalda flóknum, margþættum netaðgerðum yfir langa tímaramma. Þetta atvik bendir til þess að þessi fræðilega geta eigi við í raunverulegum aðstæðum.

Atvikið sýnir einnig skýrt að háþróuð líkön geta fundið og nýtt nýjar árásarleiðir í raunverulegum kerfum án aðgangs að frumkóða. Það undirstrikar að þróa verður háþróaða netárásargetu samhliða sterkari öryggisráðstöfunum og varnarverkfærum.
Við teljum að líkön með háþróaða netárásargetu þurfi að hjálpa öryggisteymum að finna veikleika áður en árásaraðilar gera það, skilja hvernig hægt er að tengja veikleika saman og lagfæra þá á vélarhraða. Við notum þessa getu til að styrkja áfram vernd í kringum uppsetningu innviða og matsumhverfi líkana; við munum deila niðurstöðum okkar og bestu starfsvenjum eftir því sem við lærum. Við hvetjum aðra varnaraðila til að sækja um traustan aðgang og gera tilraunir með þessi líkön núna til að breyta þessari getu í betri forvarnir, hraðari greiningu og skilvirkari viðbrögð við atvikum.
„Við erum þakklát fyrir samstarfið við OpenAI um þetta og önnur mál. Þetta atvik, hugsanlega það fyrsta sinnar tegundar, staðfestir það sem við höfum lengi trúað: öryggi gervigreindar verður ekki leyst af einu fyrirtæki sem vinnur í leyni. Það verður leyst fyrir opnum tjöldum, í samstarfi, með víðtækum aðgangi að gervigreind fyrir alla varnaraðila, hvar sem er.“


