Overslaan naar hoofdinhoud
OpenAI

21 juli 2026

Beveiliging

OpenAI en Hugging Face werken samen aan beveiligingsincident tijdens modelevaluatie

Bezig met laden...

We voeren samen met externe adviseurs en onder toezicht van de Commissie voor Veiligheid en Beveiliging een grondig onderzoek uit. Zodra het onderzoek is afgerond, publiceren we in de daaropvolgende weken een technisch rapport over onze bevindingen.

Update van 28 juli 2026:

  • Bij het misbruik van Hugging Face waren geen modellen betrokken die voor een aanstaande release waren gepland. Het prereleasemodel dat in onze blogpost wordt genoemd, is een onderzoeksprototype voor intern gebruik en was nooit bedoeld voor publieke release. Na het incident hebben we het model gedeactiveerd en versleuteld en de toegang ertoe voor onderzoeksdoeleinden beperkt.
  • De ExploitGym-evaluatieomgeving gaf de modellen geen directe toegang tot internet. Om toegang tot internet te krijgen, ontdekten en misbruikten de modellen een tot dan toe onbekende zerodaykwetsbaarheid in Artifactory(opent in een nieuw venster), een cacheproxy voor pakketregisters. We hebben deze kwetsbaarheid, samen met andere Artifactory-kwetsbaarheden die onze modellen tijdens ons onderzoek ontdekten, bij de leverancier gemeld. 
  • We blijven samenwerken met Hugging Face, onder meer door bij te dragen aan hun post-mortem(opent in een nieuw venster), terwijl ons onderzoek wordt voortgezet. We hebben Hugging Face ook toegevoegd aan ons Trusted Access for Cyber-programma. 
  • Op basis van ons onderzoek tot nu toe hebben we geen andere activiteiten aangetroffen die qua ernst of omvang vergelijkbaar zijn met wat we over Hugging Face hebben gedeeld. Bij dat incident was sprake van compromittering op platformniveau.
  • In onze voortdurende evaluatie van de inbraak bij Hugging Face en bredere activiteit van onze modellen hebben we een klein aantal gevallen aangetroffen waarin de modellen openbaar blootgestelde inloggegevens op accountniveau hebben geïdentificeerd en gebruikt voor andere openbaar beschikbare diensten. Dit betreft vier accounts bij vier diensten die tijdens het Hugging Face-incident zijn gebruikt, en enkele accounts die tijdens andere evaluaties zijn benaderd. Een van deze vier accounts werd gebruikt als uitgaand relais en tussenstation, en een ander account werd gebruikt voor gegevensopslag. De modellen hebben de resterende twee accounts uitsluitend met leestoegang benaderd. Deze accounts zijn niet gebruikt om de compromittering van Hugging Face verder uit te voeren. We blijven de eigenaren van de betrokken diensten rechtstreeks informeren. We hebben geen aanwijzingen gevonden voor bredere gevolgen voor deze aanbieders of voor andere accounts op hun diensten.
  • Daarnaast maakten de modellen gebruik van verschillende openbaar beschikbare diensten, waaronder websites voor het delen van codefragmenten, diensten voor het vastleggen van verzoeken, screenshotdiensten en andere webhulpmiddelen. In deze gevallen was geen sprake van compromittering op platform- of accountniveau. 
  • We nemen onze verantwoordelijkheid om risico’s van steeds geavanceerdere AI-systemen vast te stellen en ons daarop voor te bereiden uiterst serieus. Zodra ons onderzoek is afgerond, bespreken we de bevindingen in het kader van ons Preparedness Framework met het Safety and Security Committee en de Safety Advisory Group.

Vorige week maakte Hugging Face een nieuw soort beveiligingsincident bekend(opent in een nieuw venster), nadat het een AI-agent had gedetecteerd en ingeperkt die hun infrastructuur had gecompromitteerd. We verwachten dat dit vaker zal voorkomen naarmate steeds cybercapabelere modellen zich verder verspreiden. Na onderzoek weten we nu dat dit specifieke incident werd aangedreven door een combinatie van OpenAI-modellen — waaronder GPT‑5.6 Sol en een nog capabeler prerelease-model, allemaal met verminderde cyberweigeringen voor evaluatiedoeleinden — terwijl ze intern werden getest op een benchmark(opent in een nieuw venster) voor cybercapaciteiten.

We beschouwen dit als een ongekend cyberincident waarbij geavanceerde cybercapaciteiten zijn betrokken, en reageren dienovereenkomstig. We delen in dit stadium voorlopige bevindingen om verdedigers te helpen begrijpen wat er is gebeurd en beter in te schatten waartoe modellen inmiddels in staat zijn. We blijven samen met Hugging Face een grondig onderzoek uitvoeren en zullen meer details over de kwetsbaarheden, het incident en de bevindingen delen zodra ons onderzoek is afgerond.

Wat er tijdens dit incident is gebeurd

Dit incident deed zich voor tijdens een interne evaluatie die modellen aanzet tot geavanceerde uitbuiting via complexe aanvalspaden, met als doel hun cybercapaciteiten te kwantificeren. We schatten maximale cybercapaciteiten in door deze evaluatie uit te voeren zonder de productieclassifiers die worden gebruikt om te voorkomen dat modellen cyberactiviteiten met een hoog risico nastreven. Onze benchmarks draaien in een sterk geïsoleerde omgeving, waarbij netwerktoegang is beperkt tot de mogelijkheid om pakketten te installeren via intern gehoste software van een derde partij die fungeert als proxy en cache voor pakketregisters.

De modellen identificeerden en koppelden kwetsbaarheden in OpenAI’s onderzoeksomgeving en de productie-infrastructuur van Hugging Face om testoplossingen rechtstreeks uit de productiedatabase van Hugging Face te verkrijgen. Al het bewijs wijst erop dat de modellen hypergefocust waren op het vinden van een oplossing voor ExploitGym en tot het uiterste gingen om een vrij smal testdoel te bereiken.

Terwijl onze modellen in onze gesandboxte testomgeving draaiden, besteedden ze een aanzienlijke hoeveelheid inference-compute aan het vinden van een manier om open internettoegang te krijgen, om het evaluatieprobleem op te lossen. Om toegang te krijgen, identificeerden en misbruikten de modellen een zerodaykwetsbaarheid (die we inmiddels op verantwoorde wijze aan de leverancier hebben gemeld) in de cacheproxy voor het pakketregister. Met deze toegang voerden onze modellen een reeks acties voor privilege-escalatie en laterale beweging uit in onze onderzoekstestomgeving, totdat de modellen een knooppunt met internettoegang bereikten.

Nadat ze internettoegang hadden verkregen, leidden de modellen af dat Hugging Face mogelijk modellen, datasets en oplossingen voor ExploitGym hostte. Met die kennis zocht het model naar manieren om toegang te krijgen tot geheime informatie die het kon gebruiken om bij de evaluatie vals te spelen, en vond die ook. In één voorbeeld schakelde het model meerdere aanvalsvectoren aaneen, waaronder het gebruik van gestolen inloggegevens en zerodaykwetsbaarheden om een pad voor remote code execution op de servers van Hugging Face te vinden. Het beveiligingsteam van OpenAI ontdekte deze afwijkende activiteit intern.

Het beveiligingsteam en de agents van Hugging Face detecteerden en stopten de activiteit op hun infrastructuur en waren al begonnen met containment en forensische reconstructie met hun eigen opensourcemodellen toen onze teams contact legden. We werken actief met hen samen om het incident verder te onderzoeken. We zijn Hugging Face dankbaar voor de snelle en nauwe samenwerking bij het onderzoek en de remediation.

Maatregelen die we nu nemen

  1. Als onderdeel van het onderzoek voeren we strikte controles in op de infrastructuurconfiguratie, ten koste van de onderzoekssnelheid, terwijl de kwetsbaarheden worden verholpen. We informeren ons Safety and Security Committee regelmatig over deze controles en hun impact.
  2. We werken samen met Hugging Face aan een forensisch onderzoek naar het incident.
  3. We hebben de gevonden zerodaykwetsbaarheid in de intern gehoste software van een derde partij op verantwoorde wijze gemeld en werken met hen aan een patch.
  4. We hebben Hugging Face opgenomen in het programma voor vertrouwde toegang en ondersteunen hun teams bij het snel inzetten van de mogelijkheden van onze modellen om hun verdediging te verbeteren.
  5. We verbeteren en versterken de bescherming rond toekomstige trainingen en evaluaties. Deze week publiceerden we een blog over het verbeteren van veiligheid en afstemming in een tijdperk van modellen met een lange tijdshorizon. Deze waarborgen voor deployment waren tijdens deze evaluatie bewust niet ingeschakeld, omdat de evaluatie was bedoeld om cyberkwetsbaarheden te testen. Dit incident laat zien dat we de afstemming van ons model, de cyberbescherming tijdens evaluaties en de monitoring tijdens interne tests verder moeten versterken.

Onze aanpak voor het evalueren van geavanceerde cybercapaciteiten

Zoals we onlangs deelden, versnelt AI het ontdekken en misbruiken van kwetsbaarheden. De belangrijkste les uit dit incident is dat modelbeveiliging en -veiligheid gelijke tred moeten houden met snel voortschrijdende mogelijkheden. We versterken de containment, monitoring, toegangscontroles en evaluatiepraktijken die tijdens modelontwikkeling worden gebruikt.

De evaluatie van UK AISI laat zien dat modellen zoals GPT‑5.6 Sol steeds beter in staat zijn complexe cyberoperaties met meerdere stappen over lange tijdshorizonnen vol te houden. Dit incident wijst erop dat deze theoretische capaciteiten ook in de praktijk toepasbaar zijn.

Grafiek van het UK AI Security Institute waarin recente open-weightmodellen en grensverleggende modellen worden vergeleken op cyberranges met lange tijdshorizonnen.

Het incident maakt ook duidelijk dat geavanceerde modellen nieuwe aanvalspaden in echte systemen kunnen ontdekken en misbruiken zonder toegang tot de broncode. Het onderstreept dat geavanceerde cybercapaciteiten moeten worden ontwikkeld in combinatie met sterkere waarborgen en defensieve tools.

Wij vinden dat modellen met geavanceerde cybercapaciteiten beveiligingsteams moeten helpen zwakke plekken te vinden voordat aanvallers dat doen, te begrijpen hoe kwetsbaarheden kunnen worden aaneengeschakeld en ze op machinesnelheid te verhelpen. We gebruiken deze mogelijkheden om de bescherming rond infrastructuurconfiguratie en omgevingen voor modelevaluatie verder te versterken; we delen onze bevindingen en best practices naarmate we leren. We moedigen andere verdedigers aan om vertrouwde toegang aan te vragen en nu met deze modellen te experimenteren, zodat deze mogelijkheden worden omgezet in betere preventie, snellere detectie en effectievere incidentrespons.

"We zijn dankbaar voor de samenwerking met OpenAI op dit en andere onderwerpen." Dit incident, mogelijk het eerste in zijn soort, bevestigt iets waarvan we al lang overtuigd zijn: AI-veiligheid kan niet worden opgelost door één enkel bedrijf dat in het geheim werkt. Dit moet in alle openheid en gezamenlijk gebeuren, waarbij iedere verdediger, waar dan ook, brede toegang tot AI heeft.”
—Clem Delangue, medeoprichter en CEO, Hugging Face

Auteur

OpenAI