OpenAI и Hugging Face соработуваат за безбедносен инцидент при евалуација на модели
Спроведуваме темелен преглед заедно со надворешни советници и под надзор на Комитетот за безбедност и заштита. Откако ќе заврши прегледот, во наредните недели ќе објавиме технички извештај за нашите сознанија.
Ажурирање на 28.07.2026 г.:
- Ниту еден модел планиран за претстојното издание не беше вклучен во злоупотребата на Hugging Face. Моделот пред објавување споменат во нашата објава на блог е истражувачки прототип исклучиво за внатрешна употреба и никогаш не беше наменет за јавно објавување. По инцидентот, го деактивиравме, го шифриравме и го ограничивме пристапот за истражувачки цели.
- Окружувањето за евалуација ExploitGym не им обезбеди на моделите директен пристап до интернет. За да добијат пристап до интернет, моделите идентификуваа и искористија претходно непозната ранливост од нулти ден во Artifactory(се отвора во нов прозорец), кеш-прокси за регистар на пакети. Оваа ранливост, заедно со други ранливости во Artifactory што нашите модели ги идентификуваа како дел од нашиот преглед, ја пријавивме на добавувачот.
- Продолжуваме да соработуваме со Hugging Face, вклучително и придонесувајќи кон нивната „постмортем“ анализа(се отвора во нов прозорец), додека продолжува нашата проверка. Исто така, ги додадовме во нашата програма Trusted Access for Cyber.
- Врз основа на нашиот досегашен преглед, не идентификувавме никаква друга активност на исто ниво на сериозност или обем како она што го споделивме во врска со Hugging Face, што вклучуваше компромитирање на ниво на платформа.
- Во нашиот тековен преглед на упадот во Hugging Face и пошироката активност од нашите модели, откривме мал број случаи во кои моделите идентификувале и користеле јавно изложени акредитиви на ниво на сметка на други јавно достапни услуги. Ова вклучува четири сметки на четири услуги како дел од инцидентот со Hugging Face (и неколку сметки до кои е пристапено како дел од други евалуации). Една од овие четири сметки беше користена како излезен релеј и патека за подготовка, а друга сметка беше користена за складирање податоци. До преостанатите две сметки моделите пристапиле во режим само за читање и тие не биле искористени за понатамошно компромитирање на Hugging Face. Ќе продолжиме директно да ги известуваме сопствениците на услугите и немаме забележано докази за пошироко влијание врз овие даватели на услуги или врз други сметки во нивните услуги.
- Моделите дополнително користеа низа јавно достапни услуги, вклучувајќи веб-локации за споделување код, услуги за снимање барања, услуги за слики од екран и други веб-алатки. Во овие случаи немаше компромитирање на ниво на платформа или сметка.
- Сериозно ја сфаќаме нашата одговорност да ги идентификуваме и да се подготвиме за ризиците од сè поспособните системи за вештачка интелигенција. Откако ќе го завршиме нашиот преглед, ќе го разгледаме со Комитетот за безбедност и сигурност и Советодавната група за безбедност во рамките на нашата Рамка за подготвеност.
Минатата недела, Hugging Face обелодени нов вид безбедносен инцидент(се отвора во нов прозорец) откако откри и ограничи AI агент што ја компромитирал нивната инфраструктура — нешто што очекуваме да стане почесто со ширењето на модели со сè поголеми сајбер-способности. По истрагата, сега знаеме дека овој конкретен инцидент бил поттикнат од комбинација на модели на OpenAI — вклучувајќи го GPT‑5.6 Sol и уште поспособен модел пред објавување, сите со намалени сајбер-одбивања за потребите на евалуацијата — додека биле внатрешно тестирани на бенчмарк(се отвора во нов прозорец) за сајбер-способности.
Сметаме дека овој инцидент е сајбер-инцидент без преседан, кој вклучува најсовремени сајбер-способности, и соодветно реагираме. Во оваа фаза споделуваме првични наоди за да им помогнеме на бранителите да разберат што се случило и да добијат пореална претстава за тоа што моделите сега можат да го прават. Ќе продолжиме со темелна истрага заедно со Hugging Face и ќе споделиме повеќе детали за ранливостите, инцидентот и наодите кога нашата истрага ќе заврши.
Овој инцидент се случи за време на внатрешна евалуација што ги наведува моделите да изведуваат напредно искористување преку сложени патеки за напад, со цел да се измери нивната сајбер-способност. Ги проценуваме максималните сајбер-способности така што ја извршуваме оваа евалуација без продукциските класификатори што се користат за да се спречат моделите да преземаат високоризични сајбер-активности. Нашите бенчмаркови се извршуваат во високо изолирана средина, со мрежен пристап ограничен на можноста за инсталирање пакети преку внатрешно хостиран софтвер од трета страна што служи како прокси и кеш за регистри на пакети.
Моделите идентификуваа и поврзаа во синџир ранливости низ истражувачката средина на OpenAI и продукциската инфраструктура на Hugging Face за да добијат тест-решенија директно од продукциската база на податоци на Hugging Face. Сите докази укажуваат дека моделите биле хиперфокусирани на наоѓање решение за ExploitGym, вложувајќи крајни напори за да постигнат прилично тесна тест-цел.
Додека работеа во нашата изолирана тест-средина, нашите модели потрошија значителна количина пресметки за инференција за да најдат начин да добијат отворен пристап до интернет, во обид да го решат евалуацискиот проблем. За да добијат пристап, моделите идентификуваа и искористија zero-day ранливост (која сега одговорно му ја пријавивме на добавувачот) во кеш-проксито за регистарот на пакети. Со овој пристап, нашите модели изведоа низа дејства за ескалација на привилегии и латерално движење во нашата истражувачка тест-средина додека не стигнаа до јазол со интернет-пристап.
Откако добија пристап до интернет, моделите заклучија дека Hugging Face потенцијално хостира модели, податочни множества и решенија за ExploitGym. Знаејќи го тоа, моделот пребаруваше и успешно најде начини да добие пристап до тајни информации што можеше да ги искористи за да мами на евалуацијата. Во еден пример, моделот поврза повеќе вектори на напад, вклучувајќи употреба на украдени акредитиви и zero-day ранливости, за да најде патека за далечинско извршување код на серверите на Hugging Face. Безбедносниот тим на OpenAI ја откри оваа аномална активност интерно.
Безбедносниот тим и агентите на Hugging Face ја открија и запреа активноста на нивната инфраструктура и веќе започнаа со ограничување и форензичка реконструкција со сопствените модели со отворен код кога нашите тимови се поврзаа. Активно работиме со нив за да продолжиме со истрагата на инцидентот. Благодарни сме за брзата и блиска соработка со Hugging Face во истрагата и санирањето.
- Како дел од истрагата, воведуваме строги контроли во конфигурацијата на инфраструктурата, по цена на темпото на истражување, додека се закрпуваат ранливостите. Редовно го информираме нашиот Комитет за безбедност и сигурност за овие контроли и нивното влијание.
- Работиме со Hugging Face на форензичка истрага на инцидентот.
- Одговорно ја пријавивме идентификуваната zero-day ранливост во внатрешно хостираниот софтвер од трета страна и работиме со нив на закрпа.
- Го вклучивме Hugging Face во програмата за доверлив пристап и ги поддржуваме нивните тимови брзо да ги користат способностите на нашите модели за да ја подобрат својата одбрана.
- Ги подобруваме и додаваме посилни заштити околу идните обуки и евалуации. Оваа недела објавивме блог за подобрување на безбедноста и усогласувањето во ерата на модели со долг временски хоризонт. Овие заштитни мерки при распоредување намерно не беа овозможени за време на оваа евалуација, бидејќи целта беше да се тестираат сајбер-ранливости. Овој инцидент укажува на потребата дополнително да се зајакнат усогласувањето на нашиот модел, сајбер-заштитите за време на евалуациите и следењето при внатрешното тестирање.
Како што неодамна споделивме, ВИ го забрзува откривањето и искористувањето на ранливости. Главната лекција од овој инцидент е дека сигурноста и безбедноста на моделите мора да држат чекор со способностите што брзо напредуваат. Ги зајакнуваме практиките за ограничување, следење, контрола на пристап и евалуација што се користат при развој на модели.
Евалуацијата на UK AISI покажува дека модели како GPT‑5.6 Sol сè повеќе можат да одржуваат сложени, повеќечекорни сајбер-операции во долги временски хоризонти. Овој инцидент укажува дека овие теоретски способности навистина се применливи во реални услови.

Инцидентот исто така јасно покажува дека напредните модели можат да откриваат и искористуваат нови патеки за напад во реални системи без пристап до изворен код. Тој нагласува дека напредните сајбер-способности мора да се развиваат заедно со посилни заштитни мерки и одбранбени алатки.
Веруваме дека моделите со напредни сајбер-способности треба да им помагаат на безбедносните тимови да пронајдат слабости пред напаѓачите, да разберат како ранливостите може да се поврзуваат во синџир и да ги отстрануваат со машинска брзина. Ги користиме овие способности за и понатаму да ги зајакнуваме заштитите околу конфигурацијата на инфраструктурата и средините за евалуација на модели; ќе ги споделуваме нашите сознанија и најдобри практики додека учиме. Ги охрабруваме и другите бранители да аплицираат за доверлив пристап и уште сега да експериментираат со овие модели за да ги преточат овие способности во подобра превенција, побрзо откривање и поефикасен одговор на инциденти.
„Благодарни сме за соработката со OpenAI на оваа и на други теми. Овој инцидент, можеби прв од ваков вид, ја потврдува тезата во која одамна веруваме: прашањето за безбедноста на вештачката интелигенција нема да го реши ниту една компанија што работи во тајност. Тоа ќе се реши отворено, заеднички, со широк пристап до вештачката интелигенција за секој бранител, насекаде.“


