OpenAI и Hugging Face соработуваат за безбедносен инцидент при евалуација на модели
Минатата недела, Hugging Face обелодени нов вид безбедносен инцидент(се отвора во нов прозорец) откако откри и ограничи AI агент што ја компромитирал нивната инфраструктура — нешто што очекуваме да стане почесто со ширењето на модели со сè поголеми сајбер-способности. По истрагата, сега знаеме дека овој конкретен инцидент бил поттикнат од комбинација на модели на OpenAI — вклучувајќи го GPT‑5.6 Sol и уште поспособен модел пред објавување, сите со намалени сајбер-одбивања за потребите на евалуацијата — додека биле внатрешно тестирани на бенчмарк(се отвора во нов прозорец) за сајбер-способности.
Сметаме дека овој инцидент е сајбер-инцидент без преседан, кој вклучува најсовремени сајбер-способности, и соодветно реагираме. Во оваа фаза споделуваме првични наоди за да им помогнеме на бранителите да разберат што се случило и да добијат пореална претстава за тоа што моделите сега можат да го прават. Ќе продолжиме со темелна истрага заедно со Hugging Face и ќе споделиме повеќе детали за ранливостите, инцидентот и наодите кога нашата истрага ќе заврши.
Овој инцидент се случи за време на внатрешна евалуација што ги наведува моделите да изведуваат напредно искористување преку сложени патеки за напад, со цел да се измери нивната сајбер-способност. Ги проценуваме максималните сајбер-способности така што ја извршуваме оваа евалуација без продукциските класификатори што се користат за да се спречат моделите да преземаат високоризични сајбер-активности. Нашите бенчмаркови се извршуваат во високо изолирана средина, со мрежен пристап ограничен на можноста за инсталирање пакети преку внатрешно хостиран софтвер од трета страна што служи како прокси и кеш за регистри на пакети.
Моделите идентификуваа и поврзаа во синџир ранливости низ истражувачката средина на OpenAI и продукциската инфраструктура на Hugging Face за да добијат тест-решенија директно од продукциската база на податоци на Hugging Face. Сите докази укажуваат дека моделите биле хиперфокусирани на наоѓање решение за ExploitGym, вложувајќи крајни напори за да постигнат прилично тесна тест-цел.
Додека работеа во нашата изолирана тест-средина, нашите модели потрошија значителна количина пресметки за инференција за да најдат начин да добијат отворен пристап до интернет, во обид да го решат евалуацискиот проблем. За да добијат пристап, моделите идентификуваа и искористија zero-day ранливост (која сега одговорно му ја пријавивме на добавувачот) во кеш-проксито за регистарот на пакети. Со овој пристап, нашите модели изведоа низа дејства за ескалација на привилегии и латерално движење во нашата истражувачка тест-средина додека не стигнаа до јазол со интернет-пристап.
Откако добија пристап до интернет, моделите заклучија дека Hugging Face потенцијално хостира модели, податочни множества и решенија за ExploitGym. Знаејќи го тоа, моделот пребаруваше и успешно најде начини да добие пристап до тајни информации што можеше да ги искористи за да мами на евалуацијата. Во еден пример, моделот поврза повеќе вектори на напад, вклучувајќи употреба на украдени акредитиви и zero-day ранливости, за да најде патека за далечинско извршување код на серверите на Hugging Face. Безбедносниот тим на OpenAI ја откри оваа аномална активност интерно.
Безбедносниот тим и агентите на Hugging Face ја открија и запреа активноста на нивната инфраструктура и веќе започнаа со ограничување и форензичка реконструкција со сопствените модели со отворен код кога нашите тимови се поврзаа. Активно работиме со нив за да продолжиме со истрагата на инцидентот. Благодарни сме за брзата и блиска соработка со Hugging Face во истрагата и санирањето.
- Како дел од истрагата, воведуваме строги контроли во конфигурацијата на инфраструктурата, по цена на темпото на истражување, додека се закрпуваат ранливостите. Редовно го информираме нашиот Комитет за безбедност и сигурност за овие контроли и нивното влијание.
- Работиме со Hugging Face на форензичка истрага на инцидентот.
- Одговорно ја пријавивме идентификуваната zero-day ранливост во внатрешно хостираниот софтвер од трета страна и работиме со нив на закрпа.
- Го вклучивме Hugging Face во програмата за доверлив пристап и ги поддржуваме нивните тимови брзо да ги користат способностите на нашите модели за да ја подобрат својата одбрана.
- Ги подобруваме и додаваме посилни заштити околу идните обуки и евалуации. Оваа недела објавивме блог за подобрување на безбедноста и усогласувањето во ерата на модели со долг временски хоризонт. Овие заштитни мерки при распоредување намерно не беа овозможени за време на оваа евалуација, бидејќи целта беше да се тестираат сајбер-ранливости. Овој инцидент укажува на потребата дополнително да се зајакнат усогласувањето на нашиот модел, сајбер-заштитите за време на евалуациите и следењето при внатрешното тестирање.
Како што неодамна споделивме, ВИ го забрзува откривањето и искористувањето на ранливости. Главната лекција од овој инцидент е дека сигурноста и безбедноста на моделите мора да држат чекор со способностите што брзо напредуваат. Ги зајакнуваме практиките за ограничување, следење, контрола на пристап и евалуација што се користат при развој на модели.
Евалуацијата на UK AISI покажува дека модели како GPT‑5.6 Sol сè повеќе можат да одржуваат сложени, повеќечекорни сајбер-операции во долги временски хоризонти. Овој инцидент укажува дека овие теоретски способности навистина се применливи во реални услови.

Инцидентот исто така јасно покажува дека напредните модели можат да откриваат и искористуваат нови патеки за напад во реални системи без пристап до изворен код. Тој нагласува дека напредните сајбер-способности мора да се развиваат заедно со посилни заштитни мерки и одбранбени алатки.
Веруваме дека моделите со напредни сајбер-способности треба да им помагаат на безбедносните тимови да пронајдат слабости пред напаѓачите, да разберат како ранливостите може да се поврзуваат во синџир и да ги отстрануваат со машинска брзина. Ги користиме овие способности за и понатаму да ги зајакнуваме заштитите околу конфигурацијата на инфраструктурата и средините за евалуација на модели; ќе ги споделуваме нашите сознанија и најдобри практики додека учиме. Ги охрабруваме и другите бранители да аплицираат за доверлив пристап и уште сега да експериментираат со овие модели за да ги преточат овие способности во подобра превенција, побрзо откривање и поефикасен одговор на инциденти.
„Благодарни сме за соработката со OpenAI на оваа и на други теми. Овој инцидент, можеби прв од ваков вид, потврдува нешто во што одамна веруваме: безбедноста на ВИ нема да ја реши ниту една компанија што работи во тајност. Ќе се реши отворено, преку соработка, со широк пристап до ВИ за секој бранител, насекаде.“


