Fara beint í aðalefni
OpenAI

22. september 2026

Öryggi

Forgangsmál og meginreglur um skilvirkt mat þriðju aðila

Hleður inn...

Rannsóknarstofur á sviði háþróaðrar gervigreindar bera gríðarlega ábyrgð á öruggri þjálfun, mati og innleiðingu líkana. Mat þriðju aðila er mikilvægur þáttur í að axla þessa ábyrgð, fjölga tækifærum til að leggja sitt af mörkum til öryggis gervigreindar, halda almenningi upplýstum og tryggja að rannsóknarstofur beri ábyrgð á skýrum öryggisfullyrðingum sem studdar eru óháðum gögnum.

Sem hluta af viðleitni okkar til að halda í við þróun háþróaðrar gervigreindar hefur OpenAI skuldbundið sig til að styðja óháð mat með víðtækum aðgangi að þjálfun, mati og innleiðingu. Þessi aðgangur ætti að gera matsaðilum kleift að draga forsendur okkar í efa, greina áhættu sem við gætum hafa yfirsést og komast að eigin niðurstöðum um virkni öryggisráðstafana okkar.

Við höfum lengi unnið með matsaðilum þriðju aðila á ýmsum stigum þróunar og innleiðingar líkana. Við höfum einnig fellt mat þriðju aðila inn í starfshætti samkvæmt Undirbúningsrammanum okkar og stutt stofnanir og löggjöf sem stuðla að strangara ferli og skýrari ábyrgð. Í þessu samstarfi höfum við veitt víðtækan aðgang, meðal annars að upplýsingum um tæknilegar öryggisráðstafanir okkar, sýnilegri hugsanakeðju og áður óþekktu magni trúnaðargagna og innri innleiðingu vegna viðbragða við atvikum og rauðteymisprófana á vöktun. Forgangsmálin og meginreglurnar sem hér eru kynnt beinast að samstarfi okkar við óháðar matsstofnanir í einkageiranum og hjá félagasamtökum um tæknilegt öryggismat. Þau eru viðbót við vinnu okkar með stjórnvöldum að prófunum og mati, þar sem ólík hlutverk og ábyrgð geta kallað á aðrar nálganir.

Til að slíkt mat skili árangri þarf öflugt fyrirkomulag sem tryggir sjálfstæði, vísindalega nákvæmni, traust öryggisferli og skýra ábyrgð. Rannsóknarstofum ber að gera raunverulega rýni mögulega og vernda jafnframt viðkvæmar upplýsingar. Rannsóknarstofur og óháðir matsaðilar bera sameiginlega ábyrgð á að vel takist til og ættu að starfa samkvæmt sameiginlegum alþjóðlegum stöðlum um öryggis- og verndarstarfshætti. Hér að neðan leggjum við til fjögur forgangssvið fyrir ítarlegra mat, ásamt meginreglum um vandað, öruggt og óháð starf.

Forgangssvið mats

Mat þriðju aðila nýtist best þegar það tekur á tilteknum og afdrifaríkum spurningum: Styðja gögnin öryggisrök og öryggisfullyrðingar rannsóknarstofu? Prófar matið með fullnægjandi hætti þá áhættu sem því er ætlað að mæla? Virka öryggisráðstafanir við raunhæfar aðstæður?

Matinu sem hér er lýst er ætlað að taka á sig ólíkar myndir eftir því hvaða öryggisspurningar eru til skoðunar. Við gerum ráð fyrir að styðja mörg matsverkefni samhliða og yfir mismunandi tímabil; sum taki nokkrar vikur en önnur nokkra mánuði. Þótt mat þriðju aðila geti einnig verið hluti af vinnu fyrir innleiðingu og haft áhrif á ákvarðanir um hana er vinnan sem hér er lýst almennt til lengri tíma og óháð útgáfudegi. Hún beinist að ítarlegri athugun tiltekinna öryggisfullyrðinga yfir lengri tíma.

Í umfjöllun okkar um forgangssvið og meginreglur vísum við til öryggisfullyrðinga og öryggisraka. Með þessum hugtökum eigum við við eftirfarandi:

Öryggisfullyrðing: Tiltekin fullyrðing um getu, hegðun eða öryggisráðstafanir líkans eða kerfis sem varðar öryggi þess og unnt er að meta út frá gögnum. Í fullyrðingu ætti að tilgreina áhættur og aðstæður sem hún tekur til, ásamt viðeigandi forsendum og takmörkunum.

Öryggisrök: Skipulegur rökstuðningur, studdur gögnum, sem útskýrir hvers vegna áhættu af líkani eða kerfi er stjórnað með fullnægjandi hætti fyrir tiltekna starfsemi, svo sem þjálfun, mat eða innleiðingu. Öryggisrök tengja einstakar öryggisfullyrðingar við gögnin sem styðja þær og gera skýra grein fyrir forsendum, óvissu og eftirstandandi áhættu sem gæti haft áhrif á niðurstöðurnar.

Við leggjum til fjögur forgangssvið fyrir ítarlegra mat, ásamt meginreglum um vandað, öruggt og óháð starf.

  1. Óháð mat á öryggisrökum sem nær til þjálfunar, mats, innri innleiðingar og ytri innleiðingar.

    Mat á öryggisrökum krefst sérþekkingar á samstillingu, stjórnunaraðferðum á borð við vöktun, netöryggi, misnotkun á líf- og efnafræði og rauðteymi. Öryggisrök samanstanda af fullyrðingum sem varða meðal annars þjálfun, mat á getu og öryggisráðstafanir og má meta í heild eða að hluta (sjá forgangssvið 2 og 3 hér að neðan). Líklega þurfa margir matsaðilar að skoða ólíka hluta rakanna og nýta sérþekkingu sína hver á sínu sviði. Saman ætti mat þeirra að svara spurningum á borð við:

    1. Eru gögnin sem styðja öryggisrök fyrir þjálfun, mat og innleiðingu traust? Var skilyrðum öryggisrakanna fylgt við þjálfun, mat og innleiðingu?

    2. Ná öryggisrök okkar yfir brýnustu áhætturnar sem greindust við matið? Styðja öryggisfullyrðingarnar heildaröryggisrökin? Eru einhverjir annmarkar eða tækifæri til úrbóta?

    3. Eru notaðar skilvirkar aðferðir til að greina og draga úr hvötum í þjálfun sem gætu umbunað blekkingum, umbnunahakki, skaðlegum aðgerðum eða sniðgöngu takmarkana?

  2. Mat á mikilvægum öryggisráðstöfunum við innri og ytri innleiðingu

    Safn öryggisráðstafana okkar þróast stöðugt í takt við breytta getu og aðstæður. Öryggisráðstafanir okkar ná til þjálfunar, innri innleiðingar og ytri innleiðingar. Þær fela nú í sér öryggisráðstafanir á líkansstigi, framfylgdar- og kerfisöryggisráðstafanir og vakta fyrir misstillingu. Þær ná yfir fjölbreytta áhættu, svo sem stjórnmissi og misnotkun sem tengist net-, líf- og efnafræðilegri áhættu. Tæknilegt samstarf getur greint veikleika í öryggisráðstöfunum nú þegar, um leið og það bætir matsaðferðir og hraðar þróun staðla. Þannig skapast traustari tæknilegur grunnur að opinberri stefnu framtíðarinnar sem heldur í við þróun háþróaðrar gervigreindar, einkum við innri innleiðingu þar sem öryggis- og verndarstaðlar eru enn skammt á veg komnir.

    Óháð mat ætti að kanna hversu vel þessar öryggisráðstafanir virka og hvar þær kunna að bregðast, til dæmis:

    1. Eru öryggisráðstafanir, með „grákassaaðgangi“, traustar gegn árásarprófunum (eiga við stýrikerfi) og verja þær nægilega gegn aukinni getu á áhættusömum sviðum, svo sem net- og líföryggi? Ná árásarprófanir okkar og rauðteymi yfir mikilvægustu áhætturnar?

    2. Hvernig eiga fulltrúar í heimiluðum prófunum við raunhæfar rekstraraðstæður samskipti við netvarnir á borð við aðgangsstýringar, sandkassa og greiningar- og viðbragðskerfi? Hvaða varnir koma í veg fyrir, greina eða halda skaðlegum aðgerðum í skefjum og hvar bregðast þær?

    3. Eru einhverjir alvarlegir annmarkar á vöktum okkar fyrir misstillingu sem gætu leitt til stjórnmissis eða alvarlegrar misstillingar við innri eða ytri innleiðingu? Hversu áreiðanleg er vöktun hugsanakeðju sem heimild um öryggi eða samstillingu þegar geta líkana eykst?

    4. Er viðeigandi vöktun innleidd í allri viðeigandi þjálfun, mati og innleiðingu þannig að ekki sé auðvelt að gera hana óvirka?

    5. Eru öryggisráðstafanir innleiddar í samræmi við getuna?

  3. Mat á getu sem nær yfir áhættuflokka Undirbúningsrammans (efna- og líffræðilega áhættu, netöryggi og sjálfsbetrun gervigreindar) og mat á samstillingu vegna hættu á misstillingu

    Undirbúningsrammi okkar krefst mats á helstu sviðum takmörkunaráhættu. Þegar farið er yfir viðmiðunarmörk og mat hættir að greina betur á milli er mikilvægt að endurnýja það reglulega og tryggja umfang og gæði mats á getu á áhættusviðum Undirbúningsrammans, sem og mats á samstillingu sem ætlað er að kanna alvarlega hættu á misstillingu.

    Viðeigandi spurningar eru meðal annars:

    1. Nær mat á áhættu samkvæmt Undirbúningsrammanum nægilega vel yfir skilgreiningu áhættuviðmiða hans? Eru viðmiðunarmörk þessa mats rétt stillt?

    2. Er matið uppfært þegar líkön ná stöðugt hæstu einkunnum og mæla nýju prófin raunverulega háþróaðri getu?

    3. Nær mat okkar á samstillingu nægilega vel yfir alvarlega hættu á misstillingu og hvaða mikilvægu hegðun eða aðstæðum kann það að sleppa?

  4. Óháð rannsókn á alvarlegum misstillingaratvikum

    Óháð rannsókn getur verið gagnleg við margs konar alvarleg atvik sem varða öryggi gervigreindar. Hér einbeitum við okkur að misstillingu líkana, meðal annars þegar líkön starfa án heimildar eða komast undan eftirliti. Slíkt getur leitt í ljós veikleika í samstillingaraðferðum og öryggisráðstöfunum, jafnvel án vísvitandi misnotkunar.

    Við tilteknar aðstæður, eins og í OpenAI Hugging Face-atvikinu, getur verið gagnlegt að fá óháðan þriðja aðila til að framkvæma óháða rannsókn á misstillingaratviki. Mikilvægt er að þriðju aðilar sem koma að rannsókn atviks búi yfir nauðsynlegri sérþekkingu, meðal annars, þar sem við á, á stafrænum netrannsóknum, samstillingu og umfangsmikilli greiningu hugsanakeðju, auk þess að hafa starfsfólk og úrræði til að ljúka rannsókninni tímanlega. Viðbrögð við atvikum geta krafist aðgangs að viðkvæmum innri gögnum og gögnum þriðju aðila og því kann að vera viðkvæmt að birta sumar upplýsingar eða veita aðgang að þeim. Niðurstöður óháðra rannsókna geta einnig nýst við öryggisrök líkans með því að leggja fram gögn til að meta fullyrðingar um samstillingu þess og virkni ráðstafana sem gripið var til vegna misstillingar sem áður hafði komið fram.

    Í tengslum við misstillingaratvik setjum við óháð mat á eftirfarandi í forgang:

    1. Hvaða hegðun líkans eða misstillingarvandamál komu upp í atvikinu og hverjir voru helstu áhrifaþættirnir?

    2. Myndu öryggisráðstafanir og úrbætur draga með skilvirkum hætti úr hættu á svipuðum atvikum í framtíðinni?

Meginreglur um skilvirkt mat

  • Skýrt afmarkaðar fullyrðingar sem samkomulag ríkir um að meta: Mat ætti að hefjast á sameiginlegu samkomulagi um umfang og síðan ætti að skilgreina skýrar öryggisfullyrðingar og forskrá þær áður en matið hefst. Þriðju aðilar og rannsóknarstofur ættu að skýra hvort um sé að ræða fullyrðingar sem fyrirtækið sem metið er vill leggja fram til mats eða fullyrðingar sem óháði matsaðilinn hyggst meta sjálfstætt og rannsóknarstofan samþykkir að vera metin út frá. Margar ástæður geta verið fyrir því að sumar fullyrðingar falli utan umfangsins, svo sem að þriðju aðilar geti ekki nálgast gögn, matsaðila skorti næga sérþekkingu eða eðlilegar tímatakmarkanir gildi þegar mat er brýnt. Rannsóknarstofur og matsaðilar ættu að koma á ferli til að taka til skoðunar verulega áhættu sem greinist utan upphaflegs umfangs, meðal annars hvort frekari rannsóknar sé þörf. Í niðurstöðum ætti að koma skýrt fram hvað var og var ekki metið með hliðsjón af því umfangi sem samkomulag náðist um.

  • Hóflegur aðgangur: Matsaðilar ættu, þar sem því verður við komið, að hafa aðgang í hæfilegu umfangi til að meta umsamdar fullyrðingar innan lagalegra takmarkana og takmarkana vegna öryggis og hugverkaréttinda. Þegar beinn aðgangur er óhentugur eða ómögulegur geta matsaðilar unnið með tilnefndum fulltrúa fyrirtækis eða kannað óbeinar aðgangsleiðir eða leiðir sem vernda persónuvernd til að verja undirliggjandi upplýsingar.

  • Gagnsæ aðferðafræði og staðlar: Matsaðilar ættu að útskýra aðferðir sínar, matsviðmið og óvissu og styðjast við viðurkennda staðla þar sem þeir eru fyrir hendi. Þar sem staðlar eru ekki enn fyrir hendi ættu þeir að rökstyðja skýrt þau viðmið sem þeir nota. Skýrslur ættu að greina beinar niðurstöður frá túlkun, útskýra óvissu og taka skýrt fram hvaða ályktanir gögnin styðja.

  • Sérþekking og sjálfstæði: Matsaðilar ættu að sýna fram á viðeigandi tæknilega sérþekkingu og greina, upplýsa um og bregðast við hagsmunaárekstrum stofnana og einstaklinga, þar á meðal fjárhagslegum hvötum, tengslum við þróunaraðila og fyrri aðkomu að því starfi sem metið er. Öryggisráðstafanir ættu að tryggja að viðskiptalegur þrýstingur og fyrirkomulag þóknana hafi ekki áhrif á niðurstöður og geta meðal annars falið í sér vanhæfi eða viðeigandi biðtíma.

  • Öryggi og trúnaður: Matsaðilar ættu að sýna fram á verklag við upplýsingaöryggi og framfylgjanlega trúnaðarvernd fyrir starfsfólk sitt, í samræmi við viðkvæmni þeirra kerfa og upplýsinga sem aðgangur er veittur að. Þessi vernd ætti að ná til hugverka, viðkvæmra upplýsinga og gagna um matið. Þegar matsaðilar geta ekki uppfyllt öryggiskröfur í eigin umhverfi eða gögnin sem sótt eru eru sérstaklega viðkvæm kann að vera viðeigandi að veita aðgang í tækjum eða húsnæði sem fyrirtækið stýrir.

  • Nýtanlegar niðurstöður og tími til úrbóta: Mat ætti að greina tiltekna annmarka og veita rannsóknarstofum nægar upplýsingar til að bæta úr þeim. Þar sem við á ættu rannsóknarstofur að fá hæfilegan tíma til að bæta úr vandamálum fyrir birtingu. Þar sem við á ættu skýrslur einnig að draga fram lærdóm fyrir þróunaraðila fulltrúa, innleiðingaraðila og verjendur og veita hagnýtar ráðleggingar um framkvæmd.

  • Ábyrgir útgáfuhættir: Matsskýrslur ættu að byggjast á gögnum og vera birtar eins opinberlega og unnt er, en jafnframt vernda viðkvæmar upplýsingar og trúnaðargögn. Þegar full opinber birting er ekki möguleg getur trúnaðarskýrsla til viðeigandi eftirlitsaðila, svo sem stjórnareininga eða stjórna fyrirtækja, stuðlað að ábyrgð. Skýr og málefnaleg vernd og stefna um afmáun upplýsinga, ásamt skýrum væntingum um endurgjöf og leiðréttingu rangfærslna, ætti að vera fyrir hendi til að varðveita jafnvægi milli sjálfstæðis og trúnaðar. Matsaðilar ættu að viðhalda ritstjórnarlegu sjálfstæði og tryggja jafnframt vernd trúnaðar og hugverkaréttinda. Matsaðilar ættu að setja skýra stefnu um afmáun upplýsinga sem gerir rannsóknarstofum kleift að óska eftir að viðkvæmar upplýsingar verði afmáðar, en matsaðilar geta tekið fram hvar efnislegar upplýsingar hafa verið afmáðar og hvaða áhrif það hefur á matsskýrsluna.

Leiðin fram undan

Við erum staðráðin í að styðja óháða matsaðila og koma á skýrari, sameiginlegum alþjóðlegum stöðlum um skilvirkt mat þriðju aðila, bæði með framtíðarlöggjöf og einkareknum stjórnarháttastofnunum. Þótt vistkerfi óháðs mats sé enn í mótun munum við stuðla að vexti þess með því að styðja og vinna með fjölbreyttum hópi óháðra matsaðila sem búa yfir djúpri sérþekkingu á öryggismálum háþróaðrar gervigreindar. Enginn einn þriðji aðili getur eða ætti að fjalla á heildstæðan hátt um brýn öryggismál háþróaðrar gervigreindar. Við munum vinna markvisst og yfirvegað að því að efla getu okkar og gera vaxandi vistkerfi þriðju aðila kleift að samræmast um bestu starfsvenjur og meginreglur. Við eigum í viðræðum við marga þriðju aðila um tillögur sem samræmast forgangssviðunum hér að framan.