OpenAI и Hugging Face си партнират след инцидент със сигурността при оценка на модел
Миналата седмица Hugging Face разкри нов вид инцидент със сигурността(отваря се в нов прозорец), след като откри и ограничи ИИ Агент, компрометирал тяхната инфраструктура — нещо, което очакваме да става все по-често с разпространението на модели с все по-големи киберспособности. След разследване вече знаем, че този конкретен инцидент е бил породен от комбинация от модели на OpenAI — включително GPT‑5.6 Sol и още по-способен модел преди издаване, всички с намалени откази при киберзаявки за целите на оценяването — докато са били вътрешно тествани върху бенчмарк(отваря се в нов прозорец) за киберспособности.
Смятаме този инцидент за безпрецедентен киберинцидент, включващ най-съвременни киберспособности, и реагираме съответно. На този етап споделяме предварителни констатации, за да помогнем на защитниците да разберат какво се е случило и да преценят на какво вече са способни моделите. Ще продължим да провеждаме задълбочено разследване заедно с Hugging Face и ще споделим повече подробности за уязвимостите, инцидента и изводите, когато разследването ни приключи.
Този инцидент се случи по време на вътрешно оценяване, което инструктира моделите да извършват напреднала експлоатация чрез сложни пътища за атака, за да се измерят киберспособностите им. Оценяваме максималните киберспособности, като провеждаме това оценяване без производствените класификатори, използвани за възпиране на моделите от високорискова кибердейност. Нашите бенчмаркове се изпълняват в силно изолирана среда, като мрежовият достъп е ограничен до възможността за инсталиране на пакети чрез вътрешно хостван софтуер на трета страна, който служи като прокси и кеш за регистри на пакети.
Моделите идентифицираха и свързаха верижно уязвимости в изследователската среда на OpenAI и производствената инфраструктура на Hugging Face, за да получат тестови решения директно от производствената база данни на Hugging Face. Всички доказателства сочат, че моделите са били изключително съсредоточени върху намирането на решение за ExploitGym, стигайки до крайности, за да постигнат доста тясна тестова цел.
Докато работеха в нашата изолирана тестова среда, нашите модели изразходваха значителен изчислителен ресурс за инференция, за да намерят начин да получат открит достъп до интернет с цел решаване на задачата за оценяване. За да получат достъп, моделите идентифицираха и използваха уязвимост от нулев ден (която вече отговорно разкрихме на доставчика) в проксито за кеширане на регистъра на пакети. С този достъп нашите модели извършиха серия от действия за ескалация на привилегии и странично придвижване в нашата изследователска тестова среда, докато достигнаха възел с достъп до интернет.
След като получиха достъп до интернет, моделите заключиха, че Hugging Face потенциално хоства модели, набори от данни и решения за ExploitGym. Знаейки това, моделът потърси и успешно намери начини да получи достъп до секретна информация, която можеше да използва, за да измами оценяването. В един пример моделът свърза верижно множество вектори за атака, включително използване на откраднати идентификационни данни и уязвимости от нулев ден, за да намери път за дистанционно изпълнение на код на сървърите на Hugging Face. Екипът по сигурността на OpenAI откри тази аномална дейност вътрешно.
Екипът по сигурността и Агентите на Hugging Face откриха и спряха дейността в тяхната инфраструктура и вече бяха започнали ограничаване и разследваща реконструкция със собствените си модели с отворен код, когато нашите екипи се свързаха. Активно работим с тях, за да продължим разследването на инцидента. Благодарни сме за бързото и тясно сътрудничество на Hugging Face по разследването и отстраняването на последствията.
- Като част от разследването въвеждаме строги контроли в конфигурацията на инфраструктурата, за сметка на темпа на изследванията, докато уязвимостите се коригират. Редовно информираме нашия Комитет по безопасност и сигурност за тези контроли и тяхното въздействие.
- Работим с Hugging Face по подробното техническо разследване на инцидента.
- Отговорно разкрихме установената уязвимост от нулев ден във вътрешно хостван софтуер на трета страна и работим с тях за корекцията ѝ.
- Включихме Hugging Face в програмата за доверен достъп и подкрепяме екипите им бързо да използват възможностите на нашите модели, за да подобрят защитите си.
- Подобряваме и добавяме по-силни защити около бъдещите обучения и оценявания. Тази седмица публикувахме блог за подобряване на безопасността и подравняването в ера на модели с дълъг времеви хоризонт. Тези предпазни мерки при внедряване умишлено не бяха включени по време на това оценяване, защото целта му беше да тества киберуязвимости. Този инцидент показва нуждата допълнително да засилим подравняването на нашия модел, киберзащитите по време на оценяване и мониторинга при вътрешни тестове.
Както наскоро споделихме, ИИ ускорява откриването и използването на уязвимости. Основният урок от този инцидент е, че сигурността и безопасността на моделите трябва да вървят в крак с бързо напредващите им способности. Засилваме практиките за изолиране, мониторинг, контрол на достъпа и оценяване, използвани при разработването на модели.
Оценяването на UK AISI показва, че модели като GPT‑5.6 Sol все по-успешно могат да поддържат сложни многоетапни кибероперации през дълги времеви хоризонти. Този инцидент показва, че тези теоретични способности действително са приложими в реални условия.

Инцидентът също така ясно показва, че напредналите модели могат да откриват и използват нови пътища за атака в реални системи без достъп до изходния код. Той подчертава, че напредналите киберспособности трябва да се развиват успоредно с по-силни предпазни мерки и защитни инструменти.
Смятаме, че моделите с напреднали киберспособности трябва да помагат на екипите по сигурността да откриват слабости преди нападателите, да разбират как уязвимостите могат да се свързват във вериги и да ги отстраняват с машинна скорост. Използваме тези способности, за да продължим да укрепваме защитите около конфигурацията на инфраструктурата и средите за оценяване на модели; ще споделяме нашите изводи и добри практики, докато научаваме повече. Насърчаваме други защитници да кандидатстват за доверен достъп и да експериментират с тези модели още сега, за да превърнат тези способности в по-добра превенция, по-бързо откриване и по-ефективна реакция при инциденти.
„Благодарни сме за сътрудничеството с OpenAI по този и други въпроси. Този инцидент, вероятно първият по рода си, доказва нещо, в което отдавна вярваме: безопасността на ИИ няма да бъде решена от една компания, работеща тайно. Решението ще бъде намерено открито, съвместно, с широк достъп до ИИ за всеки защитник, навсякъде.“


