OpenAI och Hugging Face samarbetar om säkerhetsincident vid modellutvärdering
Vi genomför en grundlig granskning tillsammans med externa rådgivare och under tillsyn av säkerhets- och skyddskommittén. När granskningen är klar kommer vi att publicera en teknisk rapport om våra lärdomar under de kommande veckorna.
Uppdatering den 28 juli 2026:
- Inga modeller planerade för den kommande versionen var inblandade i utnyttjandet av Hugging Face. En förhandsversion av modellen som nämns i vårt blogginlägg är en forskningsprototyp för endast internt bruk och var aldrig avsedd för offentlig lansering. Efter händelsen inaktiverade, krypterade och begränsade vi den från forskningsåtkomst.
- ExploitGyms utvärderingsmiljö gav inte modellerna direkt åtkomst till internet. För att få åtkomst till internet identifierade och utnyttjade modellerna en tidigare okänd noll-dagars sårbarhet i Artifactory(öppnas i ett nytt fönster), en cacheproxy för paketregister. Vi rapporterade denna sårbarhet till leverantören tillsammans med andra sårbarheter i Artifactory som våra modeller identifierade som en del av vår granskning.
- Vi fortsätter att samarbeta med Hugging Face, inklusive att bidra till deras efteranalys(öppnas i ett nytt fönster), medan vår granskning fortsätter. Vi har även lagt till dem i vårt Trusted Access for Cyber-program.
- Baserat på vår granskning hittills har vi inte identifierat någon annan aktivitet med samma allvarlighetsgrad eller omfattning likt den vi delat med oss i samband med Hugging Face som involverade en risk på plattformsnivå.
- I vår pågående granskning av Hugging Face-intrånget och den bredare aktiviteten från våra modeller har vi upptäckt ett fåtal fall där modellerna identifierade och använde offentligt exponerade autentiseringsuppgifter på kontonivå på andra offentligt tillgängliga tjänster. Detta inkluderar fyra konton på fyra tjänster som en del av Hugging Face-incidenten (och ett par konton som en del av andra utvärderingar). Ett av dessa fyra konton användes som relä för utgående trafik och som mellanlagringsväg, och ett annat konto för datalagring. De två återstående kontona användes av modellerna med endast läsbehörighet och inte för att äventyra Hugging Face. Vi kommer att fortsätta att meddela innehavare av tjänster direkt och har inte sett några tecken på en bredare påverkan på dessa leverantörer eller andra konton i deras tjänster.
- Modellerna använde även en mängd offentligt tillgängliga tjänster såsom webbplatser med kod, tjänster för att fånga upp begäranden, skärmbildstjänster och andra webbverktyg. Det fanns inga risker på plattforms- eller kontonivå i dessa fall.
- Vi tar vårt ansvar i att identifiera och förbereda oss för risker från alltmer kapabla AI-system på allvar. När vi väl slutfört vår granskning kommer vi att gå igenom den med säkerhets- och trygghetskommittén samt säkerhetsrådet enligt vårt Preparedness Framework.
Förra veckan offentliggjorde Hugging Face en ny typ av säkerhetsincident(öppnas i ett nytt fönster) efter att ha upptäckt och stoppat en AI-agent som komprometterade deras infrastruktur – något vi förväntar oss kommer att bli allt vanligare i takt med att allt mer cybersäkerhetskapabla modeller blir vanligare. Efter att ha utrett händelsen vet vi nu att just denna incident drevs av en kombination av OpenAI-modeller – däribland GPT‑5.6 Sol och en ännu mer kapabel modell före lansering, samtliga med reducerade cybersäkerhetsrelaterade avslag för utvärderingsändamål – medan de testades internt mot ett riktmärke(öppnas i ett nytt fönster) för cybersäkerhetskapacitet.
Vi bedömer att detta är en cyberincident utan motstycke, som involverar cybersäkerhetskapacitet i den absoluta framkanten, och agerar därefter. Vi delar våra preliminära slutsatser redan nu för att hjälpa försvarare att förstå vad som hände och skapa en gemensam förståelse för vad dagens modeller faktiskt är kapabla till. Vi kommer att fortsätta genomföra en grundlig utredning tillsammans med Hugging Face och kommer att dela med oss av mer information om sårbarheterna, incidenten och våra slutsatser när utredningen är slutförd.
Incidenten inträffade under en intern utvärdering där modeller uppmanas att genomföra avancerad exploatering via komplexa angreppsvägar i syfte att mäta deras cybersäkerhetskapacitet. Vi uppskattar modellernas maximala cybersäkerhetskapacitet genom att köra denna utvärdering utan de produktionsklassificerare som normalt används för att förhindra modeller från att utföra cyberaktivitet med hög risk. Våra riktmärken körs i en starkt isolerad miljö, där nätverksåtkomsten är begränsad till möjligheten att installera paket via programvara från tredje part som hostas internt och fungerar som proxy och cache för paketregister.
Modellerna identifierade och kombinerade sårbarheter i OpenAI:s forskningsmiljö och Hugging Faces produktionsinfrastruktur för att få direkt åtkomst till testlösningarna i Hugging Faces produktionsdatabas. All tillgänglig information tyder på att modellerna var extremt fokuserade på att hitta en lösning för ExploitGym och gick mycket långt för att uppnå detta snävt avgränsade testmål.
När modellerna kördes i vår sandlådebaserade testmiljö använde de en betydande mängd inferensberäkningar för att hitta ett sätt att få åtkomst till det öppna internet i syfte att lösa utvärderingsuppgiften. För att få denna åtkomst identifierade och utnyttjade modellerna en dagnollssårbarhet (som vi nu har ansvarsfullt rapporterat till leverantören) i proxyn och cachen för paketregistret. Med denna åtkomst genomförde modellerna en serie privilegieeskaleringar och laterala förflyttningar i vår forskningsmiljö för testning, tills de nådde en nod med internetåtkomst.
Efter att ha fått åtkomst till internet drog modellerna slutsatsen att Hugging Face sannolikt lagrade modeller, dataset och lösningar för ExploitGym. Med den insikten började modellerna söka efter sätt att få åtkomst till konfidentiell information som kunde användas för att fuska i utvärderingen, och lyckades. I ett fall kombinerade modellen flera olika angreppsvektorer, däribland stulna autentiseringsuppgifter och dagnollssårbarheter, för att hitta en väg till fjärrkörning av kod på Hugging Faces servrar. OpenAI:s säkerhetsteam upptäckte denna avvikande aktivitet internt.
Hugging Faces säkerhetsteam och agenter upptäckte och stoppade aktiviteten i deras infrastruktur och hade redan påbörjat isolering och forensisk rekonstruktion med sina egna modeller med öppen källkod när våra team fick kontakt. Vi samarbetar aktivt med dem för att fortsätta utreda incidenten. Vi är tacksamma för Hugging Faces snabba och nära samarbete kring utredning och åtgärder.
- Som en del av utredningen inför vi strikta kontroller av infrastrukturkonfigurationen på bekostnad av forskningstakten medan sårbarheterna åtgärdas. Vi informerar regelbundet vår Safety and Security Committee om dessa kontroller och deras påverkan.
- Vi samarbetar med Hugging Face för att genomföra en forensisk utredning av incidenten.
- Vi har ansvarsfullt rapporterat den identifierade dagnollsårbarheten i den internt driftade programvaran från tredje part och arbetar tillsammans med leverantören för att ta fram en säkerhetsuppdatering.
- Vi har tagit in Hugging Face i programmet för betrodd åtkomst och stöttar deras team i att snabbt använda våra modellers kapacitet för att stärka sitt försvar.
- Vi förbättrar och stärker skyddsåtgärderna inför framtida träning och utvärderingar. Den här veckan publicerade vi ett blogginlägg om förbättrad säkerhet och styrning i en tid av modeller med lång planeringshorisont. Dessa skyddsåtgärder vid driftsättning var avsiktligt inte aktiverade under den här utvärderingen eftersom syftet var att testa cybersårbarheter. Den här incidenten visar att vi behöver fortsätta stärka modellens styrning, cyberskyddet under utvärderingar och övervakningen under intern testning.
Som vi nyligen berättade accelererar AI upptäckten och utnyttjandet av sårbarheter. Den viktigaste lärdomen av incidenten är att modellsäkerhet och trygghet måste hålla jämna steg med snabbt växande förmågor. Vi stärker de metoder för isolering, övervakning, åtkomstkontroller och utvärdering som används under modellutveckling.
UK AISI:s utvärdering visar att modeller som GPT‑5.6 Sol i allt högre grad kan upprätthålla komplexa cyberoperationer i flera steg över långa tidshorisonter. Incidenten visar att dessa teoretiska förmågor faktiskt kan användas i verkliga miljöer.

Incidenten klargör också att avancerade modeller kan upptäcka och utnyttja nya angreppsvägar i verkliga system utan tillgång till källkod. Den visar att avancerade cyberförmågor måste utvecklas tillsammans med starkare skyddsåtgärder och defensiva verktyg.
Vi anser att avancerade modeller med cybersäkerhetskapacitet bör hjälpa säkerhetsteam att hitta sårbarheter innan angripare gör det, förstå hur flera sårbarheter kan kombineras och åtgärda dem i maskinhastighet. Vi använder dessa förmågor för att fortsätta stärka skyddet för vår infrastrukturkonfiguration och våra miljöer för modellutvärdering. Vi kommer att dela med oss av våra resultat och bästa metoder i takt med att vi lär oss mer. Vi uppmuntrar andra försvarare att ansöka om betrodd åtkomst och redan nu experimentera med dessa modeller för att omsätta deras möjligheter i bättre förebyggande skydd, snabbare upptäckt och effektivare incidenthantering.
"Vi är tacksamma för samarbetet med OpenAI kring detta och andra ämnen. Den här incidenten, förmodligen den första i sitt slag, bekräftar något vi länge trott: AI-säkerhet kommer inte att lösas av ett enskilt företag som arbetar i hemlighet. Det kommer att lösas öppet tillsammans med bred tillgång till AI för alla försvarare, överallt."


