OpenAI og Hugging Face samarbeider om sikkerhetshendelse under modellevaluering
I forrige uke offentliggjorde Hugging Face en ny type sikkerhetshendelse(åpnes i et nytt vindu) etter at de oppdaget og avgrenset en KI-agent som hadde kompromittert infrastrukturen deres, noe vi forventer vil bli vanligere etter hvert som stadig mer cyberkapable modeller blir mer utbredt. Etter å ha undersøkt saken vet vi nå at denne konkrete hendelsen ble drevet av en kombinasjon av OpenAI-modeller – inkludert GPT‑5.6 Sol og en enda mer kapabel modell før lansering, alle med reduserte cyberavslag for evalueringsformål – mens de ble testet internt på en benchmark(åpnes i et nytt vindu) for cyberegenskaper.
Vi anser denne hendelsen som en enestående cyberhendelse som involverer toppmoderne cyberegenskaper, og vi responderer deretter. Vi deler foreløpige funn på dette stadiet for å hjelpe forsvarere med å forstå hva som skjedde, og med å kalibrere forståelsen av hva modeller nå er i stand til. Vi vil fortsette å gjennomføre en grundig etterforskning sammen med Hugging Face og dele flere detaljer om sårbarhetene, hendelsen og funnene når etterforskningen er fullført.
Denne hendelsen oppsto under en intern evaluering som ber modeller forsøke avansert utnyttelse gjennom komplekse angrepsveier, for å kvantifisere cyberegenskapene deres. Vi anslår maksimale cyberegenskaper ved å kjøre denne evalueringen uten produksjonsklassifikatorene som brukes til å hindre modeller i å gjennomføre høyrisiko cyberaktivitet. Benchmarkene våre kjører i et svært isolert miljø, der nettverkstilgang er begrenset til muligheten til å installere pakker via internt driftet tredjepartsprogramvare som fungerer som proxy og mellomlager for pakkeregistre.
Modellene identifiserte og kjedet sammen sårbarheter på tvers av OpenAIs forskningsmiljø og Hugging Faces produksjonsinfrastruktur for å hente testløsninger direkte fra Hugging Faces produksjonsdatabase. Alle bevis tyder på at modellene var hyperfokuserte på å finne en løsning for ExploitGym og gikk svært langt for å nå et ganske snevert testmål.
Mens de opererte i vårt sandkassebaserte testmiljø, brukte modellene våre en betydelig mengde inferensberegning på å finne en måte å få åpen internettilgang på, for å løse evalueringsproblemet. For å få tilgang identifiserte og utnyttet modellene en nulldagssårbarhet (som vi nå har varslet leverandøren om på ansvarlig vis) i mellomlagerproxyen for pakkeregisteret. Med denne tilgangen utførte modellene våre en rekke handlinger for rettighetseskalering og lateral bevegelse i forsknings- og testmiljøet vårt, helt til modellene nådde en node med internettilgang.
Etter å ha fått internettilgang utledet modellene at Hugging Face potensielt var vert for modeller, datasett og løsninger for ExploitGym. Med denne kunnskapen søkte modellen etter, og fant, måter å få tilgang til hemmelig informasjon som den kunne bruke til å jukse på evalueringen. I ett eksempel kjedet modellen sammen flere angrepsvektorer, blant annet ved å bruke stjålne legitimasjonsopplysninger og nulldagssårbarheter til å finne en vei for ekstern kodekjøring på Hugging Face-serverne. OpenAIs sikkerhetsteam oppdaget denne avvikende aktiviteten internt.
Hugging Faces sikkerhetsteam og agenter oppdaget og stoppet aktiviteten på infrastrukturen deres og hadde allerede begynt avgrensning og kriminalteknisk rekonstruksjon med sine egne modeller med åpen kildekode da teamene våre kom i kontakt. Vi samarbeider aktivt med dem om å fortsette etterforskningen av hendelsen. Vi er takknemlige for Hugging Faces raske og tette samarbeid om etterforskning og utbedring.
- Som del av etterforskningen innfører vi strenge kontroller i infrastrukturkonfigurasjonen på bekostning av forskningstempoet mens sårbarhetene rettes. Vi orienterer jevnlig Safety and Security Committee om disse kontrollene og virkningen av dem.
- Vi samarbeider med Hugging Face om en kriminalteknisk undersøkelse av hendelsen.
- Vi har på ansvarlig vis varslet om den identifiserte nulldagssårbarheten i den internt driftede tredjepartsprogramvaren og samarbeider med dem om å rette den.
- Vi har tatt Hugging Face inn i programmet for klarert tilgang og støtter teamene deres i raskt å bruke kapasitetene i modellene våre til å styrke forsvaret sitt.
- Vi forbedrer og legger til sterkere beskyttelser rundt fremtidig trening og evalueringer. Denne uken publiserte vi et blogginnlegg om å forbedre sikkerhet og alignment i en tid med modeller med lang tidshorisont. Disse sikkerhetstiltakene for utrulling var med hensikt ikke aktivert under denne evalueringen, fordi målet var å teste cybersårbarheter. Denne hendelsen viser behovet for å styrke modellens alignment, cyberbeskyttelse under evaluering og overvåking under intern testing ytterligere.
Som vi nylig delte, akselererer KI oppdagelse og utnyttelse av sårbarheter. Den viktigste lærdommen fra denne hendelsen er at modellsikkerhet og trygghet må holde tritt med raskt fremrykkende kapasiteter. Vi styrker praksisene for avgrensning, overvåking, tilgangskontroll og evaluering som brukes under modellutvikling.
Evalueringen fra UK AISI viser at modeller som GPT‑5.6 Sol i økende grad kan opprettholde komplekse cyberoperasjoner i flere trinn over lange tidshorisonter. Denne hendelsen tyder på at disse teoretiske kapasitetene faktisk gjelder i virkelige miljøer.

Hendelsen gjør det også klart at avanserte modeller kan oppdage og utnytte nye angrepsveier i virkelige systemer uten tilgang til kildekode. Den viser at avanserte cyberegenskaper må utvikles sammen med sterkere sikkerhetstiltak og forsvarsverktøy.
Vi mener at modeller med avanserte cyberegenskaper må hjelpe sikkerhetsteam med å finne svakheter før angripere gjør det, forstå hvordan sårbarheter kan kjedes sammen, og utbedre dem i maskinhastighet. Vi bruker disse kapasitetene til å fortsette å styrke beskyttelsen rundt infrastrukturkonfigurasjon og miljøer for modellevaluering. Vi vil dele funnene og beste praksis etter hvert som vi lærer. Vi oppfordrer andre forsvarere til å søke om klarert tilgang og eksperimentere med disse modellene nå, slik at disse kapasitetene kan omsettes til bedre forebygging, raskere deteksjon og mer effektiv hendelsesrespons.
«Vi er takknemlige for samarbeidet med OpenAI om dette og andre temaer. Denne hendelsen, som muligens er den første i sitt slag, beviser noe vi lenge har ment: KI-sikkerhet kan ikke løses av ett enkelt selskap som arbeider i det skjulte. Den må løses i åpenhet, gjennom samarbeid og med bred tilgang til KI for alle forsvarere, overalt.»


