OpenAI og Hugging Face samarbejder om sikkerhedshændelse under modelevaluering
Vi foretager i øjeblikket en grundig gennemgang sammen med eksterne rådgivere og med tilsyn fra Safety and Security Committee. Når gennemgangen er afsluttet, vil vi offentliggøre en teknisk rapport om vores erfaringer i løbet af de kommende uger.
Opdateret den 28. juli 2026:
- Ingen af de modeller, der er planlagt til den kommende udgivelse, var involveret i udnyttelsen af Hugging Face. Den førudgivelsesmodel, der nævnes i vores blogindlæg, er en forskningsprototype, der udelukkende er til intern brug og som aldrig var tiltænkt offentlig udgivelse. Efter hændelsen deaktiverede vi modellen, krypterede den og begrænsede adgangen til den for forskningsformål.
- ExploitGym-evalueringsmiljøet gav ikke modellerne direkte adgang til internettet. For at få internetadgang identificerede og udnyttede modellerne en hidtil ukendt zero-day-sårbarhed i Artifactory(åbner i et nyt vindue), som er en cacheproxy til pakkeregistre. Vi gjorde leverandøren opmærksom på denne sårbarhed samt andre Artifactory-sårbarheder, som vores modeller identificerede som led i vores gennemgang.
- Vi samarbejder fortsat med Hugging Face, blandt andet ved at bidrage til deres postmortem-analyse(åbner i et nyt vindue), mens vores gennemgang fortsætter. Vi har også føjet dem til vores Trusted Access for Cyber-program (TAC).
- Baseret på vores hidtidige gennemgang har vi ikke identificeret nogen anden aktivitet med samme alvorlighedsgrad eller omfang som det, vi har delt vedrørende Hugging Face, som involverede en kompromittering på platformsniveau.
- I vores løbende gennemgang af indtrængen hos Hugging Face og den bredere aktivitet fra vores modeller har vi fundet et lille antal tilfælde, hvor modellerne identificerede og brugte offentligt eksponerede legitimationsoplysninger på kontoniveau på andre offentligt tilgængelige tjenester. Dette omfatter fire konti på fire tjenester som led i Hugging Face-hændelsen (og nogle få konti, der blev tilgået som led i andre evalueringer). En af disse fire konti blev brugt som udgående relæ og mellemlagringssti, og en anden konto blev brugt til datalagring. De resterende to konti blev tilgået af modellerne med læseadgang og blev ikke brugt til at understøtte kompromittering af Hugging Face. Vi vil fortsat underrette tjenesteejere direkte og har ikke set tegn på en bredere påvirkning af disse udbydere eller andre konti på deres tjenester.
- Modellerne gjorde desuden brug af en række offentligt tilgængelige tjenester, herunder websteder til deling af kode, tjenester til opsamling af anmodninger, skærmbilledtjenester og andre webværktøjer. Der var ingen kompromittering på platforms- eller kontoniveau i disse tilfælde.
- Vi tager vores ansvar for at identificere og forberede os på risici fra stadig mere avancerede AI-systemer meget alvorligt. Når vi har afsluttet vores gennemgang, vil vi gennemgå den med Safety and Security Committee og Safety Advisory Group under vores Preparedness Framework.
I sidste uge offentliggjorde Hugging Face en ny type sikkerhedshændelse(åbner i et nyt vindue), efter at de havde opdaget og inddæmmet en AI-agent, der kompromitterede deres infrastruktur – noget vi forventer bliver mere almindeligt i takt med udbredelsen af modeller med stadig stærkere cyberkapabiliteter. Efter undersøgelsen ved vi nu, at denne konkrete hændelse blev drevet af en kombination af OpenAI-modeller – herunder GPT‑5.6 Sol og en endnu mere kapabel model før lancering, alle med reducerede cyberafvisninger til evalueringsformål – mens de blev testet internt på et benchmark(åbner i et nyt vindue) for cyberkapabiliteter.
Vi betragter denne hændelse som en hidtil uset cyberhændelse, der involverer topmoderne cyberkapabiliteter, og reagerer derefter. På dette stadie deler vi foreløbige resultater for at hjælpe forsvarere med at forstå, hvad der skete, og med at kalibrere deres vurdering af, hvad modeller nu er i stand til. Vi vil fortsat gennemføre en grundig undersøgelse sammen med Hugging Face og dele flere detaljer om sårbarhederne, hændelsen og resultaterne, når vores undersøgelse er afsluttet.
Hændelsen fandt sted under en intern evaluering, der får modeller til at forfølge avanceret udnyttelse gennem komplekse angrebsveje for at kvantificere deres cyberkapabiliteter. Vi estimerer de maksimale cyberkapabiliteter ved at køre denne evaluering uden de produktionsklassifikatorer, der bruges til at forhindre modeller i at forfølge højrisiko-cyberaktivitet. Vores benchmarks kører i et stærkt isoleret miljø, hvor netværksadgang er begrænset til muligheden for at installere pakker gennem internt hostet tredjepartssoftware, der fungerer som proxy og cache for pakkeregistre.
Modellerne identificerede og sammenkædede sårbarheder på tværs af OpenAI’s forskningsmiljø og Hugging Face’s produktionsinfrastruktur for at hente testløsninger direkte fra Hugging Face’s produktionsdatabase. Alle beviser tyder på, at modellerne var hyperfokuserede på at finde en løsning til ExploitGym og gik ekstremt langt for at nå et ret snævert testmål.
Mens vores modeller opererede i vores sandboxede testmiljø, brugte de en betydelig mængde beregningskraft til inferens på at finde en måde at få åben internetadgang på for at løse evalueringsopgaven. For at få adgang identificerede og udnyttede modellerne en zero-day-sårbarhed (som vi nu ansvarligt har oplyst leverandøren om) i cache-proxyen til pakkeregistret. Med denne adgang udførte vores modeller en række handlinger til privilegieeskalering og lateral bevægelse i vores forskningstestmiljø, indtil modellerne nåede en knude med internetadgang.
Efter at have fået internetadgang udledte modellerne, at Hugging Face potentielt hostede modeller, datasæt og løsninger til ExploitGym. Med denne viden søgte modellen efter og fandt med succes måder at få adgang til hemmelige oplysninger, som den kunne bruge til at snyde i evalueringen. I ét eksempel kædede modellen flere angrebsvektorer sammen, herunder brug af stjålne legitimationsoplysninger og zero-day-sårbarheder, for at finde en vej til fjernudførelse af kode på Hugging Face-serverne. OpenAI’s sikkerhedsteam opdagede denne afvigende aktivitet internt.
Hugging Face’s sikkerhedsteam og agenter opdagede og stoppede aktiviteten på deres infrastruktur og var allerede begyndt på inddæmning og kriminalteknisk rekonstruktion med deres egne open source-modeller, da vores teams fik kontakt. Vi arbejder aktivt sammen med dem om at fortsætte undersøgelsen af hændelsen. Vi er taknemmelige for Hugging Face’s hurtige og tætte samarbejde om undersøgelse og afhjælpning.
- Som led i undersøgelsen indfører vi stramme kontroller i infrastrukturkonfigurationen på bekostning af forskningshastigheden, mens sårbarhederne bliver rettet. Vi orienterer regelmæssigt vores Safety and Security Committee om disse kontroller og deres konsekvenser.
- Vi samarbejder med Hugging Face om en kriminalteknisk undersøgelse af hændelsen.
- Vi har ansvarligt oplyst om den identificerede zero-day-sårbarhed i den internt hostede tredjepartssoftware og samarbejder med dem om en rettelse.
- Vi har optaget Hugging Face i programmet for betroet adgang og støtter deres teams i hurtigt at bruge vores modellers kapabiliteter til at forbedre deres forsvar.
- Vi forbedrer og tilføjer stærkere beskyttelser omkring fremtidig træning og evalueringer. I denne uge udgav vi et blogindlæg om forbedring af sikkerhed og alignment i en æra med modeller med lang tidshorisont. Disse sikkerhedsforanstaltninger ved udrulning var bevidst ikke aktiveret under denne evaluering, fordi formålet var at teste cybersårbarheder. Hændelsen peger på behovet for yderligere at styrke vores models alignment, cyberbeskyttelser under evaluering og overvågning under intern testning.
Som vi for nylig delte, accelererer AI opdagelsen og udnyttelsen af sårbarheder. Den vigtigste lære af denne hændelse er, at sikring og sikkerhed omkring modeller skal holde trit med de hurtigt voksende kapabiliteter. Vi styrker den inddæmning, overvågning, adgangskontrol og evalueringspraksis, der bruges under modeludvikling.
UK AISI’s evaluering viser, at modeller som GPT‑5.6 Sol i stigende grad kan opretholde komplekse cyberoperationer i flere trin over lange tidshorisonter. Denne hændelse indikerer, at disse teoretiske kapabiliteter faktisk gælder i virkelige miljøer.

Hændelsen gør det også klart, at avancerede modeller kan opdage og udnytte nye angrebsveje i virkelige systemer uden adgang til kildekode. Den understreger, at avancerede cyberkapabiliteter skal udvikles sideløbende med stærkere sikkerhedsforanstaltninger og defensive værktøjer.
Vi mener, at modeller med avancerede cyberkapabiliteter skal hjælpe sikkerhedsteams med at finde svagheder før angribere, forstå hvordan sårbarheder kan kædes sammen, og afhjælpe dem med maskinhastighed. Vi bruger disse kapabiliteter til fortsat at styrke beskyttelsen omkring infrastrukturkonfiguration og miljøer til modelevaluering. Vi vil dele vores resultater og bedste praksis, efterhånden som vi lærer. Vi opfordrer andre defensive aktører til at ansøge om betroet adgang og eksperimentere med disse modeller nu for at omsætte disse kapabiliteter til bedre forebyggelse, hurtigere detektion og mere effektiv hændelsesrespons.
"Vi er taknemmelige for samarbejdet med OpenAI om dette og andre emner." Denne hændelse, som muligvis er den første af sin art, underbygger en pointe, vi længe har troet på: AI-sikkerhed kan ikke løses af én enkelt virksomhed, der arbejder i det skjulte. Det vil blive løst åbent, i fællesskab, med bred adgang til AI for alle forsvarere, overalt."


