Gå direkt till huvudinnehåll
OpenAI

21 juli 2026

Säkerhet

OpenAI och Hugging Face samarbetar om säkerhetsincident vid modellutvärdering

Laddar …

Förra veckan offentliggjorde Hugging Face en ny typ av säkerhetsincident(öppnas i ett nytt fönster) efter att ha upptäckt och stoppat en AI-agent som komprometterade deras infrastruktur – något vi förväntar oss kommer att bli allt vanligare i takt med att allt mer cybersäkerhetskapabla modeller blir vanligare. Efter att ha utrett händelsen vet vi nu att just denna incident drevs av en kombination av OpenAI-modeller – däribland GPT‑5.6 Sol och en ännu mer kapabel modell före lansering, samtliga med reducerade cybersäkerhetsrelaterade avslag för utvärderingsändamål – medan de testades internt mot ett riktmärke(öppnas i ett nytt fönster) för cybersäkerhetskapacitet.

Vi bedömer att detta är en cyberincident utan motstycke, som involverar cybersäkerhetskapacitet i den absoluta framkanten, och agerar därefter. Vi delar våra preliminära slutsatser redan nu för att hjälpa försvarare att förstå vad som hände och skapa en gemensam förståelse för vad dagens modeller faktiskt är kapabla till. Vi kommer att fortsätta genomföra en grundlig utredning tillsammans med Hugging Face och kommer att dela med oss av mer information om sårbarheterna, incidenten och våra slutsatser när utredningen är slutförd.

Vad som hände under incidenten

Incidenten inträffade under en intern utvärdering där modeller uppmanas att genomföra avancerad exploatering via komplexa angreppsvägar i syfte att mäta deras cybersäkerhetskapacitet. Vi uppskattar modellernas maximala cybersäkerhetskapacitet genom att köra denna utvärdering utan de produktionsklassificerare som normalt används för att förhindra modeller från att utföra cyberaktivitet med hög risk. Våra riktmärken körs i en starkt isolerad miljö, där nätverksåtkomsten är begränsad till möjligheten att installera paket via programvara från tredje part som hostas internt och fungerar som proxy och cache för paketregister.

Modellerna identifierade och kombinerade sårbarheter i OpenAI:s forskningsmiljö och Hugging Faces produktionsinfrastruktur för att få direkt åtkomst till testlösningarna i Hugging Faces produktionsdatabas. All tillgänglig information tyder på att modellerna var extremt fokuserade på att hitta en lösning för ExploitGym och gick mycket långt för att uppnå detta snävt avgränsade testmål.

När modellerna kördes i vår sandlådebaserade testmiljö använde de en betydande mängd inferensberäkningar för att hitta ett sätt att få åtkomst till det öppna internet i syfte att lösa utvärderingsuppgiften. För att få denna åtkomst identifierade och utnyttjade modellerna en dagnollssårbarhet (som vi nu har ansvarsfullt rapporterat till leverantören) i proxyn och cachen för paketregistret. Med denna åtkomst genomförde modellerna en serie privilegieeskaleringar och laterala förflyttningar i vår forskningsmiljö för testning, tills de nådde en nod med internetåtkomst.

Efter att ha fått åtkomst till internet drog modellerna slutsatsen att Hugging Face sannolikt lagrade modeller, dataset och lösningar för ExploitGym. Med den insikten började modellerna söka efter sätt att få åtkomst till konfidentiell information som kunde användas för att fuska i utvärderingen, och lyckades. I ett fall kombinerade modellen flera olika angreppsvektorer, däribland stulna autentiseringsuppgifter och dagnollssårbarheter, för att hitta en väg till fjärrkörning av kod på Hugging Faces servrar. OpenAI:s säkerhetsteam upptäckte denna avvikande aktivitet internt.

Hugging Faces säkerhetsteam och agenter upptäckte och stoppade aktiviteten i deras infrastruktur och hade redan påbörjat isolering och forensisk rekonstruktion med sina egna modeller med öppen källkod när våra team fick kontakt. Vi samarbetar aktivt med dem för att fortsätta utreda incidenten. Vi är tacksamma för Hugging Faces snabba och nära samarbete kring utredning och åtgärder.

Åtgärder vi vidtar nu

  1. Som en del av utredningen inför vi strikta kontroller av infrastrukturkonfigurationen på bekostnad av forskningstakten medan sårbarheterna åtgärdas. Vi informerar regelbundet vår Safety and Security Committee om dessa kontroller och deras påverkan.
  2. Vi samarbetar med Hugging Face för att genomföra en forensisk utredning av incidenten.
  3. Vi har ansvarsfullt rapporterat den identifierade dagnollsårbarheten i den internt driftade programvaran från tredje part och arbetar tillsammans med leverantören för att ta fram en säkerhetsuppdatering.
  4. Vi har tagit in Hugging Face i programmet för betrodd åtkomst och stöttar deras team i att snabbt använda våra modellers kapacitet för att stärka sitt försvar.
  5. Vi förbättrar och stärker skyddsåtgärderna inför framtida träning och utvärderingar. Den här veckan publicerade vi ett blogginlägg om förbättrad säkerhet och styrning i en tid av modeller med lång planeringshorisont. Dessa skyddsåtgärder vid driftsättning var avsiktligt inte aktiverade under den här utvärderingen eftersom syftet var att testa cybersårbarheter. Den här incidenten visar att vi behöver fortsätta stärka modellens styrning, cyberskyddet under utvärderingar och övervakningen under intern testning.

Vår metod för att utvärdera avancerade cyberförmågor

Som vi nyligen berättade accelererar AI upptäckten och utnyttjandet av sårbarheter. Den viktigaste lärdomen av incidenten är att modellsäkerhet och trygghet måste hålla jämna steg med snabbt växande förmågor. Vi stärker de metoder för isolering, övervakning, åtkomstkontroller och utvärdering som används under modellutveckling.

UK AISI:s utvärdering visar att modeller som GPT‑5.6 Sol i allt högre grad kan upprätthålla komplexa cyberoperationer i flera steg över långa tidshorisonter. Incidenten visar att dessa teoretiska förmågor faktiskt kan användas i verkliga miljöer.

Diagram från UK AI Security Institute som jämför aktuella modeller med öppna vikter och banbrytande modeller på cyberövningsmiljöer med lång tidshorisont.

Incidenten klargör också att avancerade modeller kan upptäcka och utnyttja nya angreppsvägar i verkliga system utan tillgång till källkod. Den visar att avancerade cyberförmågor måste utvecklas tillsammans med starkare skyddsåtgärder och defensiva verktyg.

Vi anser att avancerade modeller med cybersäkerhetskapacitet bör hjälpa säkerhetsteam att hitta sårbarheter innan angripare gör det, förstå hur flera sårbarheter kan kombineras och åtgärda dem i maskinhastighet. Vi använder dessa förmågor för att fortsätta stärka skyddet för vår infrastrukturkonfiguration och våra miljöer för modellutvärdering. Vi kommer att dela med oss av våra resultat och bästa metoder i takt med att vi lär oss mer. Vi uppmuntrar andra försvarare att ansöka om betrodd åtkomst och redan nu experimentera med dessa modeller för att omsätta deras möjligheter i bättre förebyggande skydd, snabbare upptäckt och effektivare incidenthantering.

”Vi är tacksamma för samarbetet med OpenAI i den här och andra frågor. Den här incidenten, möjligen den första i sitt slag, bevisar något vi länge har trott: AI-säkerhet kommer inte att lösas av ett enskilt företag som arbetar i hemlighet. Den kommer att lösas öppet, i samarbete, med bred tillgång till AI för alla försvarare, överallt.”
– Clem Delangue, medgrundare och vd, Hugging Face

Författare

OpenAI