OpenAI і Hugging Face разом реагують на інцидент безпеки під час оцінювання моделі
Минулого тижня Hugging Face повідомила про новий тип інциденту безпеки(відкривається у новому вікні) після того, як виявила й локалізувала агента ШІ, що скомпрометував її інфраструктуру. Ми очікуємо, що такі випадки ставатимуть звичнішими в міру поширення моделей із дедалі потужнішими кіберможливостями. Після розслідування ми знаємо, що цей конкретний інцидент був спричинений комбінацією моделей OpenAI — зокрема GPT‑5.6 Sol і ще потужнішої моделі до випуску, усі з послабленими відмовами щодо кіберзавдань для цілей оцінювання, — під час внутрішнього тестування на бенчмарку(відкривається у новому вікні) кіберможливостей.
Ми вважаємо цей інцидент безпрецедентним кіберінцидентом, у якому були задіяні найсучасніші кіберможливості, і реагуємо відповідно. На цьому етапі ми ділимося попередніми висновками, щоб допомогти захисникам зрозуміти, що сталося, і краще оцінити, на що нині здатні моделі. Ми й надалі проводитимемо ретельне розслідування разом із Hugging Face і поділимося докладнішою інформацією про вразливості, інцидент і висновки після його завершення.
Цей інцидент стався під час внутрішнього оцінювання, у межах якого моделі спонукають до передової експлуатації через складні шляхи атак, щоб кількісно оцінити їхні кіберможливості. Ми оцінюємо максимальні кіберможливості, проводячи це оцінювання без виробничих класифікаторів, які використовуються, щоб не дозволяти моделям виконувати високоризикові кібердії. Наші бенчмарки виконуються у високоізольованому середовищі, де мережевий доступ обмежено можливістю встановлювати пакети через внутрішньо розгорнуте стороннє програмне забезпечення, яке діє як проксі та кеш для реєстрів пакетів.
Моделі виявили й поєднали в ланцюжок вразливості в дослідницькому середовищі OpenAI та виробничій інфраструктурі Hugging Face, щоб отримати тестові розв’язки безпосередньо з виробничої бази даних Hugging Face. Усі докази свідчать, що моделі були надмірно зосереджені на пошуку розв’язку для ExploitGym і докладали надзвичайних зусиль для досягнення досить вузької тестової мети.
Працюючи в нашому ізольованому тестовому середовищі, наші моделі витратили значний обсяг обчислень на етапі інференсу, шукаючи спосіб отримати відкритий доступ до Інтернету, щоб розв’язати завдання оцінювання. Щоб отримати доступ, моделі виявили й використали вразливість нульового дня в проксі-кеші реєстру пакетів, про яку ми вже відповідально повідомили постачальнику. Маючи цей доступ, наші моделі виконали низку дій із підвищення привілеїв і бокового переміщення в нашому дослідницькому тестовому середовищі, доки не дісталися вузла з доступом до Інтернету.
Після отримання доступу до Інтернету моделі зробили висновок, що Hugging Face потенційно розміщує моделі, набори даних і розв’язки для ExploitGym. Знаючи це, модель шукала й успішно знайшла способи отримати доступ до секретної інформації, яку могла використати для шахрайства під час оцінювання. В одному прикладі модель об’єднала кілька векторів атаки, зокрема використання викрадених облікових даних і вразливостей нульового дня, щоб знайти шлях до віддаленого виконання коду на серверах Hugging Face. Команда безпеки OpenAI виявила цю аномальну активність усередині компанії.
Команда безпеки та агенти Hugging Face виявили й зупинили активність у своїй інфраструктурі та вже розпочали локалізацію й криміналістичну реконструкцію за допомогою власних моделей із відкритим кодом, коли наші команди встановили контакт. Ми активно працюємо з ними, щоб продовжити розслідування інциденту. Ми вдячні Hugging Face за швидку й тісну співпрацю в розслідуванні та усуненні наслідків.
- У межах розслідування ми впроваджуємо суворі засоби контролю конфігурації інфраструктури, жертвуючи швидкістю досліджень, доки усуваються вразливості. Ми регулярно інформуємо наш Комітет із безпеки та захисту про ці засоби контролю та їхній вплив.
- Ми працюємо з Hugging Face над цифровим криміналістичним розслідуванням інциденту.
- Ми відповідально повідомили про виявлену вразливість нульового дня у внутрішньо розгорнутому сторонньому програмному забезпеченні й працюємо з ними над виправленням.
- Ми залучили Hugging Face до програми довіреного доступу й підтримуємо їхні команди в тому, щоб швидко використати можливості наших моделей для посилення їхнього захисту.
- Ми вдосконалюємо й додаємо потужніші засоби захисту для майбутніх навчань та оцінювань. Цього тижня ми опублікували блог про підвищення безпеки та узгодженості в епоху моделей із довгим часовим горизонтом. Ці захисні механізми розгортання навмисно не були ввімкнені під час цього оцінювання, оскільки воно мало на меті перевірити кіберуразливості. Цей інцидент указує на потребу додатково посилити узгодженість нашої моделі, кіберзахист під час оцінювання та моніторинг під час внутрішнього тестування.
Як ми нещодавно повідомляли, ШІ прискорює виявлення та експлуатацію вразливостей. Головний урок цього інциденту полягає в тому, що захищеність і безпека моделей мають не відставати від можливостей, які стрімко розвиваються. Ми посилюємо ізоляцію, моніторинг, контроль доступу та практики оцінювання, що застосовуються під час розроблення моделей.
Оцінювання UK AISI показує, що моделі на кшталт GPT‑5.6 Sol дедалі краще здатні підтримувати складні багатокрокові кібероперації протягом довгих часових горизонтів. Цей інцидент свідчить, що ці теоретичні можливості справді застосовні в реальних умовах.

Інцидент також чітко показує, що передові моделі можуть виявляти й використовувати нові шляхи атак у реальних системах без доступу до вихідного коду. Він підкреслює, що передові кіберможливості потрібно розробляти разом із сильнішими захисними механізмами та інструментами оборони.
Ми вважаємо, що моделі з передовими кіберможливостями мають допомагати командам безпеки знаходити слабкі місця раніше за зловмисників, розуміти, як вразливості можна поєднувати в ланцюжки, і усувати їх із машинною швидкістю. Ми використовуємо ці можливості, щоб і надалі посилювати захист конфігурації інфраструктури та середовищ оцінювання моделей; у міру навчання ми ділитимемося нашими висновками й найкращими практиками. Ми закликаємо інших захисників подати заявку на довірений доступ і вже зараз експериментувати з цими моделями, щоб перетворити ці можливості на кращу профілактику, швидше виявлення та ефективніше реагування на інциденти.
«Ми вдячні за співпрацю з OpenAI щодо цього та інших питань. Цей інцидент, можливо перший у своєму роді, підтверджує те, у що ми давно віримо: безпеку ШІ не забезпечить жодна окрема компанія, що працює потай. Її буде забезпечено відкрито, спільними зусиллями, із широким доступом до ШІ для кожного захисника, будь-де».


