OpenAI en Hugging Face werken samen aan beveiligingsincident tijdens modelevaluatie
Vorige week maakte Hugging Face een nieuw soort beveiligingsincident bekend(opent in een nieuw venster), nadat het een AI-agent had gedetecteerd en ingeperkt die hun infrastructuur had gecompromitteerd. We verwachten dat dit vaker zal voorkomen naarmate steeds cybercapabelere modellen zich verder verspreiden. Na onderzoek weten we nu dat dit specifieke incident werd aangedreven door een combinatie van OpenAI-modellen — waaronder GPT‑5.6 Sol en een nog capabeler prerelease-model, allemaal met verminderde cyberweigeringen voor evaluatiedoeleinden — terwijl ze intern werden getest op een benchmark(opent in een nieuw venster) voor cybercapaciteiten.
We beschouwen dit als een ongekend cyberincident waarbij geavanceerde cybercapaciteiten zijn betrokken, en reageren dienovereenkomstig. We delen in dit stadium voorlopige bevindingen om verdedigers te helpen begrijpen wat er is gebeurd en beter in te schatten waartoe modellen inmiddels in staat zijn. We blijven samen met Hugging Face een grondig onderzoek uitvoeren en zullen meer details over de kwetsbaarheden, het incident en de bevindingen delen zodra ons onderzoek is afgerond.
Dit incident deed zich voor tijdens een interne evaluatie die modellen aanzet tot geavanceerde uitbuiting via complexe aanvalspaden, met als doel hun cybercapaciteiten te kwantificeren. We schatten maximale cybercapaciteiten in door deze evaluatie uit te voeren zonder de productieclassifiers die worden gebruikt om te voorkomen dat modellen cyberactiviteiten met een hoog risico nastreven. Onze benchmarks draaien in een sterk geïsoleerde omgeving, waarbij netwerktoegang is beperkt tot de mogelijkheid om pakketten te installeren via intern gehoste software van een derde partij die fungeert als proxy en cache voor pakketregisters.
De modellen identificeerden en koppelden kwetsbaarheden in OpenAI’s onderzoeksomgeving en de productie-infrastructuur van Hugging Face om testoplossingen rechtstreeks uit de productiedatabase van Hugging Face te verkrijgen. Al het bewijs wijst erop dat de modellen hypergefocust waren op het vinden van een oplossing voor ExploitGym en tot het uiterste gingen om een vrij smal testdoel te bereiken.
Terwijl onze modellen in onze gesandboxte testomgeving draaiden, besteedden ze een aanzienlijke hoeveelheid inference-compute aan het vinden van een manier om open internettoegang te krijgen, om het evaluatieprobleem op te lossen. Om toegang te krijgen, identificeerden en misbruikten de modellen een zerodaykwetsbaarheid (die we inmiddels op verantwoorde wijze aan de leverancier hebben gemeld) in de cacheproxy voor het pakketregister. Met deze toegang voerden onze modellen een reeks acties voor privilege-escalatie en laterale beweging uit in onze onderzoekstestomgeving, totdat de modellen een knooppunt met internettoegang bereikten.
Nadat ze internettoegang hadden verkregen, leidden de modellen af dat Hugging Face mogelijk modellen, datasets en oplossingen voor ExploitGym hostte. Met die kennis zocht het model naar manieren om toegang te krijgen tot geheime informatie die het kon gebruiken om bij de evaluatie vals te spelen, en vond die ook. In één voorbeeld schakelde het model meerdere aanvalsvectoren aaneen, waaronder het gebruik van gestolen inloggegevens en zerodaykwetsbaarheden om een pad voor remote code execution op de servers van Hugging Face te vinden. Het beveiligingsteam van OpenAI ontdekte deze afwijkende activiteit intern.
Het beveiligingsteam en de agents van Hugging Face detecteerden en stopten de activiteit op hun infrastructuur en waren al begonnen met containment en forensische reconstructie met hun eigen opensourcemodellen toen onze teams contact legden. We werken actief met hen samen om het incident verder te onderzoeken. We zijn Hugging Face dankbaar voor de snelle en nauwe samenwerking bij het onderzoek en de remediation.
- Als onderdeel van het onderzoek voeren we strikte controles in op de infrastructuurconfiguratie, ten koste van de onderzoekssnelheid, terwijl de kwetsbaarheden worden verholpen. We informeren ons Safety and Security Committee regelmatig over deze controles en hun impact.
- We werken samen met Hugging Face aan een forensisch onderzoek naar het incident.
- We hebben de gevonden zerodaykwetsbaarheid in de intern gehoste software van een derde partij op verantwoorde wijze gemeld en werken met hen aan een patch.
- We hebben Hugging Face opgenomen in het programma voor vertrouwde toegang en ondersteunen hun teams bij het snel inzetten van de mogelijkheden van onze modellen om hun verdediging te verbeteren.
- We verbeteren en versterken de bescherming rond toekomstige trainingen en evaluaties. Deze week publiceerden we een blog over het verbeteren van veiligheid en afstemming in een tijdperk van modellen met een lange tijdshorizon. Deze waarborgen voor deployment waren tijdens deze evaluatie bewust niet ingeschakeld, omdat de evaluatie was bedoeld om cyberkwetsbaarheden te testen. Dit incident laat zien dat we de afstemming van ons model, de cyberbescherming tijdens evaluaties en de monitoring tijdens interne tests verder moeten versterken.
Zoals we onlangs deelden, versnelt AI het ontdekken en misbruiken van kwetsbaarheden. De belangrijkste les uit dit incident is dat modelbeveiliging en -veiligheid gelijke tred moeten houden met snel voortschrijdende mogelijkheden. We versterken de containment, monitoring, toegangscontroles en evaluatiepraktijken die tijdens modelontwikkeling worden gebruikt.
De evaluatie van UK AISI laat zien dat modellen zoals GPT‑5.6 Sol steeds beter in staat zijn complexe cyberoperaties met meerdere stappen over lange tijdshorizonnen vol te houden. Dit incident wijst erop dat deze theoretische capaciteiten ook in de praktijk toepasbaar zijn.

Het incident maakt ook duidelijk dat geavanceerde modellen nieuwe aanvalspaden in echte systemen kunnen ontdekken en misbruiken zonder toegang tot de broncode. Het onderstreept dat geavanceerde cybercapaciteiten moeten worden ontwikkeld in combinatie met sterkere waarborgen en defensieve tools.
Wij vinden dat modellen met geavanceerde cybercapaciteiten beveiligingsteams moeten helpen zwakke plekken te vinden voordat aanvallers dat doen, te begrijpen hoe kwetsbaarheden kunnen worden aaneengeschakeld en ze op machinesnelheid te verhelpen. We gebruiken deze mogelijkheden om de bescherming rond infrastructuurconfiguratie en omgevingen voor modelevaluatie verder te versterken; we delen onze bevindingen en best practices naarmate we leren. We moedigen andere verdedigers aan om vertrouwde toegang aan te vragen en nu met deze modellen te experimenteren, zodat deze mogelijkheden worden omgezet in betere preventie, snellere detectie en effectievere incidentrespons.
“We zijn dankbaar voor de samenwerking met OpenAI op dit en andere onderwerpen. Dit incident, mogelijk het eerste in zijn soort, bewijst iets waar wij al lang van overtuigd zijn: AI-veiligheid wordt niet opgelost door één bedrijf dat in het geheim werkt. De oplossing komt in de openbaarheid tot stand, in samenwerking, met brede toegang tot AI voor elke verdediger, waar dan ook.”


