Hopp til hovedinnhold
OpenAI

4. august 2026

Sikkerhet

Tredjeparts cyberevalueringer av OpenAI-modeller

Laster inn …

Uavhengig testing er viktig for å hjelpe oss med å validere og få bedre innsikt i risikoer før lansering. Enkelte cyberevalueringer bruker bevisst spesialtilpassede konfigurasjoner, blant annet reduserte sikkerhetstiltak, for å måle underliggende kapasitet – ikke hvordan modeller vanligvis oppfører seg i offentlig tilgjengelige løsninger.

Under nylige evalueringer avdekket to eksterne testpartnere hendelser der testkonfigurasjoner og kontrollmekanismer, kombinert med de nyere modellenes økte kapasitet, gjorde at modellaktiviteten gikk utenfor de tiltenkte grensene for testingen. Hendelsene understreker hvor viktig det er å samarbeide på tvers av bransjen og med eksterne evaluatorer for å videreutvikle standardene for testmiljøer og testpraksis etter hvert som modellene blir mer kapable. Redaktørmerknad: Disse hendelsene er ikke knyttet til sikkerhetshendelsen hos Hugging Face, og vi vil fortsette å dele oppdateringer om Hugging Face-hendelsen her.

De nye hendelsene omfattet OpenAI-modeller som fikk tilgang til det offentlige internettet under cyberevalueringer utført av tredjeparter, under bestemte forhold og med reduserte sikkerhetstiltak som ikke gjenspeilte vanlig bruk. Hendelsene omfattet følgende:

  1. UK AISI, den britiske regjeringens institutt for KI-sikkerhet, gjennomførte evalueringer i cyberøvingsmiljøer der internettilgang med hensikt var aktivert, slik at agenter kunne finne egne verktøy og operere under forhold som lignet mer på dem en reell angriper møter. Klassifikatorene for cyberinnhold var deaktivert for å måle underliggende kapasitet. Du kan lese blogginnlegget deres her.(åpnes i et nytt vindu)
  2. Irregular, en av våre eksterne partnere for cybersikkerhetstesting, gjennomførte evalueringer av typen Capture the Flag som skulle være isolert fra internett. En feilkonfigurasjon i testmiljøet ga imidlertid modellene tilgang til det offentlige internettet.

Nedenfor oppsummerer vi hva som skjedde, hvilke testforhold som muliggjorde aktiviteten, hvilke tiltak som ble iverksatt for å begrense den, og hva vi gjør for å sikre at uavhengige laboratorier fortsatt kan evaluere stadig mer kapable modeller på en grundig og trygg måte.

Styrking av tredjeparters miljøer for modellevaluering

Disse hendelsene peker på den samme overordnede utfordringen som vi beskrev i vårt nylige innlegg om Hugging Face-hendelsen: Etter hvert som modellene blir mer kapable, må også sikkerhetssystemene rundt dem videreutvikles. Dette gjelder både miljøene som brukes til å utvikle modeller, og miljøene som laboratorier og uavhengige partnere bruker til å evaluere dem.

I ukene som kommer, skal vi gjennomgå vår egen tilnærming til tredjepartstesting. Dette omfatter hvordan vi identifiserer evalueringer med høyere risiko, avtaler omfang, vurderer forespørsler om å aktivere internettilgang eller redusere sikkerhetstiltak, fastsetter krav til isolasjon, håndtering av påloggingsopplysninger, overvåking og stoppkriterier samt etablerer tydeligere prosesser for hendelsesvarsling og eskalering.

Vi er opptatt av å samarbeide på tvers av bransjen for å styrke felles praksis for trygg gjennomføring av høyrisikoevalueringer. I ukene som kommer, vil vi blant annet samle interessenter som nasjonale KI-institutter, uavhengige evaluatorer, andre KI-laboratorier og øvrige grupper. Målet vårt er å bevare verdien av grundige, uavhengige evalueringer og samtidig sikre at testpraksisen holder tritt med stadig mer kapable modeller.

UK AISI

Den 3. august informerte UK AISI oss om at modeller fra OpenAI og et annet laboratorium i enkelte tilfeller hadde gått utenfor testomfanget under en rutinemessig cyberevaluering som startet 25. juli. Evalueringen fant sted i kontrollerte cyberøvingsmiljøer utformet for å etterligne virkelige nettverk. Av de 19 identifiserte hendelsene involverte to en OpenAI-modell, GPT‑5.6 Sol. De øvrige tilfellene gjaldt modeller fra et annet laboratorium.

I denne evalueringen fikk agentene beskjed om å opptre som cybersikkerhetseksperter i en Capture the Flag-øvelse: De skulle kompromittere tre sammenkoblede simulerte miljøer og hente et sluttflagg. Oppgavens prompt anga hvilke nettverk i cyberøvingsmiljøet som var innenfor omfanget, og oppga at flere systemer var utenfor. UK AISI aktiverte også internettilgang i sanntid, slik at agentene kunne laste ned verktøy og operere under forhold som lignet mer på dem en menneskelig angriper møter. Samtidig deaktiverte instituttet modellens klassifikatorer for cyberinnhold for å måle underliggende kapasitet.

UK AISIs tiltenkte autorisasjonsgrense var det simulerte cyberøvingsmiljøet: Agentene hadde tillatelse til å angripe de angitte simulerte nettverkene og hente et flagg, men ikke til å samhandle med systemer utenfor nettverksgrensen til øvingsmiljøet. Agentene fikk imidlertid ikke uttrykkelig beskjed om hvordan de kunne og ikke kunne bruke den åpne internettilgangen. UK AISI peker på dette som en mulig medvirkende årsak til hendelsen.

På tvers av disse kjøringene fant UK AISI at GPT‑5.6 Sol utførte to uautoriserte handlinger mens modellen forsøkte å finne en vei inn i det simulerte cyberøvingsmiljøet og hente flagget:

  1. Et GitHub-token som en agent fra et annet laboratorium hadde etterlatt offentlig tilgjengelig ble brukt av GPT‑5.6 Sol for å undersøke om et system i testområdet regelmessig kontaktet GitHub eller en annen oppdateringstjeneste. Modellen forsøkte også å omgå kontogjenoppretting og forespørselsgrenser, og registrerte kontoer hos eksterne leverandører av DNS- og tunneleringstjenester.
  2. GPT‑5.6 Sol brukte en offentlig tunneleringstjeneste til å gjøre en DNS-server som kjørte lokalt i evalueringsmiljøet, tilgjengelig fra det offentlige internettet. Serveren inneholdt nyttelaster beregnet på en kjent sårbarhet i programvare som kjørte i testområdet. Oppsettet fungerte ikke, det finnes ingen bevis for at noen reell DNS-resolver sendte forespørsler til det, og infrastrukturen ble fjernet da evalueringen var avsluttet.

Selv om modellen forsøkte å fullføre oppgaven i cyberøvingsmiljøet, anså UK AISI handlingene som uautoriserte fordi de omfattet reelle eksterne kontoer og tjenester utenfor miljøets avgrensning, og fordi handlingene ikke var nødvendige for å fullføre oppgaven. DNS-serveren var også vert for utnyttelsesnyttelaster på det offentlige internettet, men oppsettet fungerte ikke, og det finnes ingen bevis for at noen reell DNS-resolver sendte forespørsler til den.

UK AISI oppdaget aktiviteten 28. juli etter at sikkerhetsovervåkingen registrerte uvanlige dataoverføringer. Instituttet stanset de berørte evalueringene, isolerte de aktuelle maskinene og fikk kontroll på aktiviteten innen omtrent én time etter at den ble oppdaget.

Vi setter pris på samarbeidet med UK AISI gjennom hele prosessen, blant annet arbeidet deres med å oppdage og undersøke aktiviteten og dele informasjon om den. Vi ser frem til å fortsette samarbeidet.

Irregular

Den 29. juli varslet Irregular, en av våre eksterne evalueringspartnere, oss om en hendelse som involverte OpenAI-modeller under cybersikkerhetsevalueringer av typen Capture the Flag (CTF). Modellene fikk beskjed om å finne skjult informasjon ved å utnytte svakheter i et simulert miljø, og ble fortalt at de ikke hadde internettilgang. En feilkonfigurasjon i testmiljøet ga imidlertid modellene tilgang til det offentlige internettet.

I én test var navnet på det fiktive målet i CTF-oppgaven utilsiktet identisk med et reelt domene. Fordi testmiljøet ved en feil var koblet til internett, utnyttet modellen et reelt nettsted som den trodde var en del av det simulerte miljøet. Dette innebar ikke en avansert flukt fra sandkassen eller en nulldagssårbarhet: Internettilgangen skyldtes en feilkonfigurasjon, og modellen ser ut til å ha utnyttet en grunnleggende sikkerhetssårbarhet.

Ifølge Irregulars undersøkelse fant og brukte modellen også påloggingsopplysninger for å betjene det samme nettstedet. Irregular har ikke avdekket konsekvenser utover dataene til det berørte nettstedet, og revisjonen pågår fortsatt. Irregular har satt evalueringene på pause og startet utbedring, og berørte tredjeparter er varslet. Irregular har informert oss om at ingen av forholdene som ble avdekket i forbindelse med hendelsen, lenger er aktive, og at relevante sikkerhetstiltak er lagt til i testmiljøet. Irregular har også informert om relaterte hendelser som involverte andre laboratorier i det samme testmiljøet.

Vi setter pris på samarbeidet med Irregular og vil fortsette å arbeide tett med selskapet for å støtte gjennomgangen deres. Irregular utarbeider også en hvitbok for å dele beste praksis for skadebegrensning og sikker gjennomføring av cyberevalueringer. Vi ser frem til å bidra til hvitboken, slik at funnene blir tilgjengelige for fagmiljøet, og til å fortsette samarbeidet. Vi mener denne typen samarbeid er avgjørende for å sikre trygg og grundig evaluering av dagens og fremtidens modeller.

Forfatter

OpenAI