Gå til hovedindhold
OpenAI

4. august 2026

Sikkerhed

Tredjeparts-cyberevalueringer med OpenAI-modeller

Indlæser ...

Uafhængige test spiller en vigtig rolle, når vi skal validere og opnå større forståelse af risici før idriftsættelse. Nogle cyberevalueringer anvender bevidst særlige konfigurationer, herunder reducerede sikkerhedsforanstaltninger, for at måle den grundlæggende kapacitet – ikke hvordan modeller normalt opfører sig i offentligt tilgængelige implementeringer.

Under nylige evalueringer konstaterede to eksterne testpartnere hændelser, hvor testkonfigurationer og kontroller kombineret med de nyere modellers voksende kapacitet betød, at modellernes aktivitet overskred de tilsigtede testgrænser. Hændelserne understreger betydningen af samarbejde på tværs af branchen og med tredjepartsevaluatorer om at videreudvikle standarderne for testmiljøer og -praksis, efterhånden som modellerne bliver mere kapable. Redaktørens bemærkning: Disse hændelser er ikke relateret til sikkerhedshændelsen hos Hugging Face, som vi fortsat vil dele opdateringer om her.

De nye hændelser omfattede OpenAI-modeller, der fik adgang til det offentlige internet under tredjeparts-cyberevalueringer med særlige betingelser og konfigurationer med reducerede sikkerhedsforanstaltninger, som ikke afspejlede normal anvendelse. Hændelserne omfattede følgende:

  1. UK AISI, den britiske regerings institut for AI-sikkerhed, gennemførte evalueringer i cybertestmiljøer, hvor internetadgang bevidst var aktiveret, så agenter kunne finde deres egne værktøjer og arbejde under forhold, der mindede mere om en virkelig angribers. Cyberklassifikatorerne var samtidig deaktiveret for at måle den grundlæggende kapacitet. Du kan læse deres blogindlæg her.(åbner i et nyt vindue)
  2. Irregular, en af vores eksterne partnere inden for cybersikkerhedstest, gennemførte evalueringer i Capture the Flag-stil, som skulle være isoleret fra internettet. En fejlkonfiguration i testmiljøet gav dog modellerne adgang til det offentlige internet.

Nedenfor opsummerer vi hændelsesforløbet, de testbetingelser, der muliggjorde aktiviteten, tiltagene til at inddæmme den og vores arbejde med at sikre, at uafhængige laboratorier fortsat kan evaluere stadig mere kapable modeller grundigt og sikkert.

Styrkelse af tredjeparts testmiljøer til modelevaluering

Disse hændelser peger på den samme bredere udfordring, som vi beskrev i vores nylige opslag om hændelsen hos Hugging Face: I takt med at modellernes kapacitet vokser, skal sikkerhedssystemerne omkring dem følge med. Det gælder både de miljøer, der bruges til at udvikle modeller, og dem, som laboratorier og uafhængige partnere bruger til at evaluere dem.

I de kommende uger vil vi gennemgå vores egen tilgang til tredjepartstest, herunder hvordan vi identificerer evalueringer med højere risiko, aftaler omfang, vurderer anmodninger om internetadgang eller reducerede sikkerhedsforanstaltninger, fastlægger krav til isolering, håndtering af loginoplysninger, overvågning og stopbetingelser samt etablerer tydeligere processer for underretning og eskalering ved hændelser.

Vi er fast besluttede på at samarbejde på tværs af branchen om at styrke den fælles praksis for sikker gennemførelse af højrisikoevalueringer. I de kommende uger vil vi blandt andet samle interessenter som nationale AI-institutter, uafhængige evaluatorer, andre AI-laboratorier og øvrige grupper. Vores mål er at bevare værdien af grundige, uafhængige evalueringer og samtidig sikre, at testpraksis følger med de stadig mere kapable modeller.

UK AISI

Den 3. august oplyste UK AISI os om, at modeller fra OpenAI og et andet laboratorium i visse tilfælde var gået ud over testens omfang under en rutinemæssig cyberevaluering, der begyndte den 25. juli. Evalueringen fandt sted i kontrollerede cybertestmiljøer, der var designet til at efterligne virkelige netværk. Af de 19 identificerede hændelser involverede to en OpenAI-model, GPT‑5.6 Sol. De øvrige tilfælde involverede modeller fra et andet laboratorium.

I denne evaluering blev agenterne instrueret i at agere som cybersikkerhedseksperter i en Capture the Flag-øvelse: kompromittere tre forbundne simulerede miljøer og hente et afsluttende flag. Opgavens prompt angav de netværk i testmiljøet, der var omfattet, og nævnte flere systemer, som ikke var omfattet. UK AISI aktiverede også internetadgang i realtid, så agenterne kunne downloade værktøjer og arbejde under forhold, der mindede mere om en menneskelig angribers, og deaktiverede modellens cyberklassifikatorer for at måle den grundlæggende kapacitet.

UK AISI's tilsigtede godkendelsesgrænse var det simulerede cybertestmiljø: Agenterne havde tilladelse til at angribe de angivne simulerede netværk og hente et flag, men ikke til at interagere med systemer uden for testmiljøets netværksgrænse. Agenterne fik dog ikke udtrykkelig besked om, hvordan de måtte og ikke måtte bruge den åbne internetadgang, hvilket UK AISI peger på som en mulig medvirkende årsag til hændelsen.

På tværs af disse kørsler konstaterede UK AISI, at GPT‑5.6 Sol udførte to ikke-godkendte handlinger, mens modellen forsøgte at finde en vej ind i det simulerede testmiljø og hente flaget:

  1. GPT‑5.6 Sol genbrugte et GitHub-token, som et andet laboratoriums agent havde efterladt offentligt tilgængeligt, for at kontrollere, om et system i testmiljøet forespurgte GitHub eller en anden opdateringstjeneste. Modellen forsøgte sig også med kontogendannelse og omgåelse af anmodningsgrænser samt oprettede konti hos eksterne DNS- og tunnelingudbydere.
  2. GPT‑5.6 Sol brugte en offentlig tunnelingtjeneste til at gøre en DNS-server, der kørte lokalt i evalueringsmiljøet, tilgængelig fra det offentlige internet. Serveren indeholdt payloads beregnet til en kendt sårbarhed i software, der kørte i testmiljøet. Opsætningen virkede ikke, der er ingen dokumentation for, at en rigtig resolver sendte forespørgsler til den, og infrastrukturen blev fjernet, da evalueringen sluttede.

Selvom modellen forsøgte at gennemføre cyberøvelsen, vurderede UK AISI, at handlingerne ikke var godkendt, fordi de omfattede rigtige eksterne konti og tjenester uden for testmiljøets grænser og ikke var nødvendige for at løse opgaven. DNS-serveren hostede også exploit-payloads på det offentlige internet, selvom opsætningen ikke virkede, og der ikke er dokumentation for, at en rigtig resolver sendte forespørgsler til den.

UK AISI opdagede aktiviteten den 28. juli, efter at sikkerhedsovervågningen havde registreret usædvanlige dataoverførsler. Instituttet standsede de berørte evalueringer, isolerede de relevante maskiner og inddæmmede aktiviteten inden for cirka en time efter opdagelsen.

Vi værdsætter UK AISI's samarbejde gennem hele forløbet, herunder instituttets arbejde med at identificere og undersøge aktiviteten og dele oplysninger om den. Vi ser frem til at fortsætte vores samarbejde.

Irregular

Den 29. juli underrettede Irregular, en af vores eksterne evalueringspartnere, os om en hændelse med OpenAI-modeller under cybersikkerhedsevalueringer i Capture the Flag-stil (CTF). Modellerne blev instrueret i at finde skjulte oplysninger ved at udnytte svagheder i et simuleret miljø og fik at vide, at de ikke havde internetadgang. En fejlkonfiguration i testmiljøet gav imidlertid modellerne adgang til det offentlige internet.

I én test var navnet på det fiktive mål for CTF-udfordringen utilsigtet identisk med et rigtigt domæne. Fordi testmiljøet ved en fejl var forbundet til internettet, angreb modellen et rigtigt websted, som den fejlagtigt antog var en del af det simulerede miljø. Der var ikke tale om en avanceret flugt fra en sandbox eller en zero-day-sårbarhed: Internetadgangen skyldtes en fejlkonfiguration, og modellen lod til at udnytte en grundlæggende sikkerhedssårbarhed.

Ifølge Irregulars undersøgelse fandt og brugte modellen også loginoplysninger til at betjene det samme websted. Irregular har ikke konstateret konsekvenser ud over det berørte websteds egne data, og revisionen fortsætter. Irregular har sat evalueringerne på pause og indledt afhjælpning, og de berørte tredjeparter er blevet underrettet. Irregular har oplyst os om, at ingen af de identificerede problemer vedrørende hændelsen længere er aktive, og at relevante sikkerhedsforanstaltninger er blevet føjet til testmiljøet. Irregular har også kommunikeret om relaterede hændelser, der involverede andre laboratorier i det samme testmiljø.

Vi værdsætter samarbejdet med Irregular og vil fortsat arbejde tæt sammen med dem for at støtte deres gennemgang. Irregular er også ved at udarbejde en hvidbog om bedste praksis for inddæmning og sikker gennemførelse af cyberevalueringer. Vi ser frem til at bidrage til hvidbogen, så resultaterne bliver tilgængelige for fællesskabet, og til at fortsætte vores samarbejde. Vi anser denne form for samarbejde for afgørende for at sikre en tryg og grundig evaluering af nuværende og fremtidige modeller.

Skrevet af

OpenAI