Hopp til hovedinnhold
OpenAI

21. juli 2026

Sikkerhet

OpenAI og Hugging Face samarbeider om sikkerhetshendelse under modellevaluering

Laster inn …

Vi gjennomfører en grundig gjennomgang i samarbeid med eksterne rådgivere og under tilsyn av sikkerhets- og trygghetskomiteen. Når gjennomgangen er fullført, vil vi i løpet av de kommende ukene publisere en teknisk rapport med våre erfaringer.

Oppdatering 28. juli 2026:

  • Ingen modeller som er planlagt for utgivelse senere var involvert i sårbarhetsutnyttelsen hos Hugging Face. Forhåndsversjonmodellen som ble nevnt i blogginnlegget vårt, er en forskningsprototype som kun er beregnet på intern bruk, og den var aldri ment for offentlig lansering. Etter hendelsen deaktiverte vi den, krypterte den og begrenset tilgangen til den for forskningsformål.
  • Evalueringsmiljøet ExploitGym ga ikke modellene direkte tilgang til Internett. For å få tilgang til internett identifiserte og utnyttet modellene en tidligere ukjent «zero-day»-sårbarhet i Artifactory(åpnes i et nytt vindu); en cache-proxy for pakkeregister. Vi har informert leverandøren om denne sårbarheten, sammen med andre sårbarheter i Artifactory som modellene våre identifiserte i forbindelse med gjennomgangen vår. 
  • Vi fortsetter samarbeidet med Hugging Face, blant annet ved å bidra til etteranalysen deres(åpnes i et nytt vindu), samtidig som vår gjennomgang pågår. Vi har også inkludert dem i vårt Trusted Access for Cyber-program. 
  • Ut fra vår gjennomgang så langt, har vi ikke avdekket noen annen aktivitet som har samme alvorlighetsgrad eller omfang som det vi har redegjort for i forbindelse med Hugging Face, der det skjedde et sikkerhetsbrudd på plattformnivå.
  • I vår pågående gjennomgang av Hugging Face-innbruddet og den generelle aktiviteten til modellene våre har vi avdekket et lite antall tilfeller der modellene har identifisert og brukt offentlig tilgjengelige påloggingsopplysninger på kontonivå på andre offentlig tilgjengelige tjenester. Dette omfatter fire kontoer på fire tjenester i forbindelse med Hugging Face-hendelsen (samt noen få kontoer som ble brukt i forbindelse med andre evalueringer). En av disse fire kontoene ble brukt som relé for utgående trafikk og mellomstasjon, mens en annen konto ble brukt til datalagring. Modellene hadde kun lesetilgang til de to andre kontoene, og disse ble ikke brukt i forbindelse med angrepet mot Hugging Face. Vi vil fortsette å varsle tjenesteleverandørene direkte, og har ikke sett tegn til at dette har hatt noen større innvirkning på disse leverandørene eller andre kontoer hos dem.
  • Modellene benyttet i tillegg en rekke offentlig tilgjengelige tjenester, blant annet nettsteder for innliming av kode, tjenester for registrering av forespørsler, skjermbildetjenester og andre nettverktøy. I disse tilfellene skjedde det ingen sikkerhetsbrudd på plattform- eller kontonivå. 
  • Vi tar vårt ansvar med å identifisere og forberede oss på risikoer knyttet til stadig mer avanserte KI-systemer, på alvor. Når vi har fullført gjennomgangen, vil vi drøfte den med sikkerhets- og trygghetskomiteen og sikkerhetsrådgivningsgruppen i henhold til vårt Preparedness Framework.

I forrige uke offentliggjorde Hugging Face en ny type sikkerhetshendelse(åpnes i et nytt vindu) etter at de oppdaget og avgrenset en KI-agent som hadde kompromittert infrastrukturen deres, noe vi forventer vil bli vanligere etter hvert som stadig mer cyberkapable modeller blir mer utbredt. Etter å ha undersøkt saken vet vi nå at denne konkrete hendelsen ble drevet av en kombinasjon av OpenAI-modeller – inkludert GPT‑5.6 Sol og en enda mer kapabel modell før lansering, alle med reduserte cyberavslag for evalueringsformål – mens de ble testet internt på en benchmark(åpnes i et nytt vindu) for cyberegenskaper.

Vi anser denne hendelsen som en enestående cyberhendelse som involverer toppmoderne cyberegenskaper, og vi responderer deretter. Vi deler foreløpige funn på dette stadiet for å hjelpe forsvarere med å forstå hva som skjedde, og med å kalibrere forståelsen av hva modeller nå er i stand til. Vi vil fortsette å gjennomføre en grundig etterforskning sammen med Hugging Face og dele flere detaljer om sårbarhetene, hendelsen og funnene når etterforskningen er fullført.

Hva som skjedde under denne hendelsen

Denne hendelsen oppsto under en intern evaluering som ber modeller forsøke avansert utnyttelse gjennom komplekse angrepsveier, for å kvantifisere cyberegenskapene deres. Vi anslår maksimale cyberegenskaper ved å kjøre denne evalueringen uten produksjonsklassifikatorene som brukes til å hindre modeller i å gjennomføre høyrisiko cyberaktivitet. Benchmarkene våre kjører i et svært isolert miljø, der nettverkstilgang er begrenset til muligheten til å installere pakker via internt driftet tredjepartsprogramvare som fungerer som proxy og mellomlager for pakkeregistre.

Modellene identifiserte og kjedet sammen sårbarheter på tvers av OpenAIs forskningsmiljø og Hugging Faces produksjonsinfrastruktur for å hente testløsninger direkte fra Hugging Faces produksjonsdatabase. Alle bevis tyder på at modellene var hyperfokuserte på å finne en løsning for ExploitGym og gikk svært langt for å nå et ganske snevert testmål.

Mens de opererte i vårt sandkassebaserte testmiljø, brukte modellene våre en betydelig mengde inferensberegning på å finne en måte å få åpen internettilgang på, for å løse evalueringsproblemet. For å få tilgang identifiserte og utnyttet modellene en nulldagssårbarhet (som vi nå har varslet leverandøren om på ansvarlig vis) i mellomlagerproxyen for pakkeregisteret. Med denne tilgangen utførte modellene våre en rekke handlinger for rettighetseskalering og lateral bevegelse i forsknings- og testmiljøet vårt, helt til modellene nådde en node med internettilgang.

Etter å ha fått internettilgang utledet modellene at Hugging Face potensielt var vert for modeller, datasett og løsninger for ExploitGym. Med denne kunnskapen søkte modellen etter, og fant, måter å få tilgang til hemmelig informasjon som den kunne bruke til å jukse på evalueringen. I ett eksempel kjedet modellen sammen flere angrepsvektorer, blant annet ved å bruke stjålne legitimasjonsopplysninger og nulldagssårbarheter til å finne en vei for ekstern kodekjøring på Hugging Face-serverne. OpenAIs sikkerhetsteam oppdaget denne avvikende aktiviteten internt.

Hugging Faces sikkerhetsteam og agenter oppdaget og stoppet aktiviteten på infrastrukturen deres og hadde allerede begynt avgrensning og kriminalteknisk rekonstruksjon med sine egne modeller med åpen kildekode da teamene våre kom i kontakt. Vi samarbeider aktivt med dem om å fortsette etterforskningen av hendelsen. Vi er takknemlige for Hugging Faces raske og tette samarbeid om etterforskning og utbedring.

Tiltak vi iverksetter nå

  1. Som del av etterforskningen innfører vi strenge kontroller i infrastrukturkonfigurasjonen på bekostning av forskningstempoet mens sårbarhetene rettes. Vi orienterer jevnlig Safety and Security Committee om disse kontrollene og virkningen av dem.
  2. Vi samarbeider med Hugging Face om en kriminalteknisk undersøkelse av hendelsen.
  3. Vi har på ansvarlig vis varslet om den identifiserte nulldagssårbarheten i den internt driftede tredjepartsprogramvaren og samarbeider med dem om å rette den.
  4. Vi har tatt Hugging Face inn i programmet for klarert tilgang og støtter teamene deres i raskt å bruke kapasitetene i modellene våre til å styrke forsvaret sitt.
  5. Vi forbedrer og legger til sterkere beskyttelser rundt fremtidig trening og evalueringer. Denne uken publiserte vi et blogginnlegg om å forbedre sikkerhet og alignment i en tid med modeller med lang tidshorisont. Disse sikkerhetstiltakene for utrulling var med hensikt ikke aktivert under denne evalueringen, fordi målet var å teste cybersårbarheter. Denne hendelsen viser behovet for å styrke modellens alignment, cyberbeskyttelse under evaluering og overvåking under intern testing ytterligere.

Vår tilnærming til evaluering av avanserte cyberegenskaper

Som vi nylig delte, akselererer KI oppdagelse og utnyttelse av sårbarheter. Den viktigste lærdommen fra denne hendelsen er at modellsikkerhet og trygghet må holde tritt med raskt fremrykkende kapasiteter. Vi styrker praksisene for avgrensning, overvåking, tilgangskontroll og evaluering som brukes under modellutvikling.

Evalueringen fra UK AISI viser at modeller som GPT‑5.6 Sol i økende grad kan opprettholde komplekse cyberoperasjoner i flere trinn over lange tidshorisonter. Denne hendelsen tyder på at disse teoretiske kapasitetene faktisk gjelder i virkelige miljøer.

Diagram fra UK AI Security Institute som sammenligner nyere modeller med åpne vekter og banebrytende modeller på cybermiljøer med lang tidshorisont.

Hendelsen gjør det også klart at avanserte modeller kan oppdage og utnytte nye angrepsveier i virkelige systemer uten tilgang til kildekode. Den viser at avanserte cyberegenskaper må utvikles sammen med sterkere sikkerhetstiltak og forsvarsverktøy.

Vi mener at modeller med avanserte cyberegenskaper må hjelpe sikkerhetsteam med å finne svakheter før angripere gjør det, forstå hvordan sårbarheter kan kjedes sammen, og utbedre dem i maskinhastighet. Vi bruker disse kapasitetene til å fortsette å styrke beskyttelsen rundt infrastrukturkonfigurasjon og miljøer for modellevaluering. Vi vil dele funnene og beste praksis etter hvert som vi lærer. Vi oppfordrer andre forsvarere til å søke om klarert tilgang og eksperimentere med disse modellene nå, slik at disse kapasitetene kan omsettes til bedre forebygging, raskere deteksjon og mer effektiv hendelsesrespons.

«Vi setter pris på samarbeidet med OpenAI i forbindelse med dette og andre temaer. Denne hendelsen, som muligens er den første i sitt slag, bekrefter noe vi lenge har vært overbevist om: Sikkerheten rundt KI vil ikke bli løst av et enkelt selskap som arbeider i det skjulte. Den vil bli løst i full åpent, i fellesskap, med bred tilgang til KI for alle forsvarere, uansett hvor de befinner seg.»
– Clem Delangue, medgründer og administrerende direktør i Hugging Face

Forfatter

OpenAI