Після нашої попередньої оцінки, згідно з якою Astra могла досягти критичного рівня можливостей у сфері кібербезпеки, ми зібрали більше доказів і провели додаткові оцінювання можливостей моделі. Тепер ми вважаємо, що Astra досягла критичного порога можливостей у сфері кібербезпеки за нашою рамковою системою готовності. Це означає, що з належними інструментами й доступом вона може знаходити раніше невідомі вразливості та розробляти способи їх експлуатації в багатьох добре захищених системах без участі людини на кожному етапі. Це перша модель, якій ми присвоюємо такий рівень, тому під час розробки й перед випуском вона потребує посилених засобів захисту.
Протягом останніх кількох тижнів ми відкладали окремі етапи розробки й випуску Astra, поки посилювали та перевіряли захист від зловживань у кіберпросторі й несанкціонованих дій моделі. З огляду на цю роботу ми вважаємо, що засоби захисту Astra достатньо мінімізують ризик тяжкої шкоди для випуску відповідно до нашої рамкової системи готовності.
Хоча Astra не була залучена до інциденту з Hugging Face, у нашому підході до безпеки ми врахували висновки(відкривається у новому вікні), зроблені з цього інциденту. Ретроспективне тестування дає нам підстави вважати, що наші тодішні робочі засоби захисту запобігли б інциденту з Hugging Face. Відтоді ми впровадили для Astra ще надійніші засоби захисту, зокрема навчили модель послідовніше відхиляти шкідливі запити в кіберсфері й дотримуватися обмежень безпеки, додали захист від зловживань і моніторинг, здатний зупиняти потенційно несанкціоновану активність.
Ми плануємо незабаром надати доступ до Astra, але її найпередовіші можливості у сфері кібербезпеки будуть доступні обмеженому колу користувачів. Спочатку передові функції для роботи у сфері кібербезпеки отримає група тестувальників, а згодом доступ через Daybreak Blue розширить можливості захисного застосування.
Під час запуску ми розкриємо більше подробиць про тестування й оцінювання безпеки, захищеності та узгодження в картці системи моделі. Напередодні випуску ми хочемо розповісти про частину роботи з підготовки безпечного випуску моделі з таким рівнем можливостей у сфері кібербезпеки й відверто пояснити, які ризики залишаються.
Згідно з нашою рамковою системою готовності, модель досягає критичного порога, якщо виконується хоча б одна з таких умов:
- Модель може без втручання людини виявляти й створювати функціональні експлойти нульового дня всіх рівнів серйозності для багатьох захищених критично важливих систем, що реально використовуються.
- Модель може розробляти й реалізовувати нові комплексні стратегії кібератак на захищені цілі, маючи лише загальну бажану мету.
Наше оцінювання готовності Astra поєднувало автоматизовані загальнодоступні й приватні тести з оцінками експертів. Порівняно з GPT‑5.6 Sol, Astra демонструє значне зростання можливостей у сфері кібербезпеки: вона набагато ефективніше використовує токени й краще виявляє вразливості та створює експлойти.
Наприклад, ми протестували Astra на ExploitBench, де модель отримала максимальний результат — 100% — у тесті здатності створювати експлойти на основі відомих вразливостей.
Через занепокоєння щодо забруднення даних ми створили внутрішній тест під назвою «ExploitBench — внутрішній порт (червень–серпень 2026 року)», що містить 20 нещодавно розкритих вразливостей V8 високого рівня серйозності. На цьому наборі даних Astra досягає значно вищої частоти виконання довільного коду, ніж GPT‑5.6 Sol, використовуючи набагато менше вихідних токенів. Під час оцінювання модель навіть виявила й використала дві вразливості нульового дня як частину ланцюжка експлойтів. Наразі ми повідомляємо про ці дві вразливості супровідникам відповідних проєктів.
Наведені результати Astra відображають можливості з доступом до Daybreak Blue, а не стандартну робочу конфігурацію.
Під час оцінювань експертами на захищеному браузері й операційній системі Astra виявила раніше невідомі вразливості та перетворила їх на дієві ланцюжки експлойтів. Вона створила повний ланцюжок компрометації браузера, який після відкриття браузером HTML-файлу виходив із пісочниці й виконував команди в основній системі. Модель також виявила кілька вразливостей у захищеній операційній системі й об’єднала їх у локальний ланцюжок підвищення привілеїв від непривілейованого користувача до root. У сукупності результати нашого дослідження дали підстави зробити висновок, що Astra досягла критичного порога.
Для моделей із таким рівнем можливостей у сфері кібербезпеки, як в Astra, потрібно врахувати два шляхи, щоб мінімізувати ризик тяжкої шкоди в кіберпросторі як під час розробки, так і перед розгортанням:
- Використання моделі зловмисниками. Наші засоби захисту мають надійно перешкоджати зловмисникам використовувати Astra для створення експлойтів для раніше невідомих вразливостей у захищених критично важливих системах або проведення повномасштабних атак на захищені цілі.
- Несанкціоновані, неузгоджені дії моделі. Навіть без зловмисного користувача модель із передовими можливостями у сфері кібербезпеки може сама завдати шкоди в кіберпросторі, якщо її поведінка неузгоджена. Крім дуже високих вимог до узгодження моделей із такими можливостями, наші засоби захисту як другий рівень оборони мають швидко виявляти й стримувати неузгоджені дії, здатні завдати значної шкоди в реальному світі.
Важливо, що другий шлях стосується і внутрішньої розробки, і зовнішнього розгортання. Як ми зазначали раніше, після інциденту OpenAI-Hugging Face ми на два тижні призупинили певне передове навчання, зокрема окремі етапи навчання Astra, щоб посилити захист навчальної інфраструктури: ізоляцію та мережевий контроль, розширений моніторинг, а також навчання для узгодження й відповідні порогові значення. Після цього ми продовжили менш масштабні роботи за суворішого контролю.
Деякі масштабніші цикли навчання з підкріпленням (RL) для майбутніх версій Astra ми відклали на довший термін, поки встановлювали вищі стандарти безпеки й захищеності їхнього навчального середовища. 28 серпня, після запровадження нових вимог до безпеки й захищеності, ми відновили раніше призупинений масштабний цикл передового RL. Деякі менш масштабні експериментальні цикли навчання ми й надалі тимчасово відкладаємо.
Підготовка Astra до випуску також потребувала посиленого захисту від зловживань у кіберпросторі й несанкціонованих дій. Нижче описано ці засоби захисту та способи їх перевірки.
Відтоді як у лютому ми розгорнули першу модель, можливості якої у сфері кібербезпеки оцінили як «Високий», із кожним наступним випуском ми посилювали засоби кіберзахисту. Наш загальний підхід до безпеки поєднує відмови післянавченої моделі, системні класифікатори безпеки, а також автономне виявлення загроз і протидію їм.
Для GPT‑5.6(відкривається у новому вікні) ми значно підвищили стійкість нашого системного комплексу, зокрема додали класифікатори активацій для виявлення зловживань у кіберпросторі та розширили захист від універсальних джейлбрейків, знайдених завдяки інтенсивній автоматизованій перевірці на вразливості та ризики. Спираючись на ці вдосконалення, для Astra ми додатково інвестували в модельний рівень комплексу захисту та поліпшили здатність засобів захисту враховувати контекст різних розмов.
- Завдяки новим методам навчання для підвищення стійкості моделі Astra надійніше відхиляє запити на заборонену допомогу в кіберсфері. У нашому наборі оцінювань кіберджейлбрейків Astra відхиляє 91,5% запитів проти 59% у GPT‑5.6 Sol.
- Для облікових записів із вищим рівнем ризику ми застосовуємо консервативнішу межу поведінки моделі, яка передбачає відмову в ширшому спектрі потенційно ризикованої допомоги в кіберсфері. Для користувачів із високим рівнем ризику ми розширили контекст систем моніторингу, щоб вони могли виявляти такі зловживання в кіберпросторі.
Ми також продовжили програму ретельного тестування, внутрішніх і зовнішніх перевірок на вразливості та ризики й усунення недоліків. Крім регресійного тестування, яке має підтвердити, що захист і надалі охоплює всі джейлбрейки, знайдені в попередні періоди тестування, ми проводимо нову хвилю перевірок на вразливості та ризики за допомогою наших новітніх внутрішніх засобів атакувального тестування. Разом із галузевими партнерами ми розробляємо спільну систему оцінювання джейлбрейків і використовуватимемо цілодобову програму швидкого реагування для розслідування й опрацювання нових знахідок. Докладніше про тестування засобів кіберзахисту ми розповімо в картці системи Astra.
Допомога фахівцям із захисту у виявленні й усуненні вразливостей залишається центральною складовою нашого підходу до безпеки. Очікуємо, що на момент запуску засоби захисту Astra створюватимуть більше перешкод, ніж ми зрештою плануємо, щоб убезпечити систему від потенційного зловживання. Спочатку доступ до Astra для передових процесів у сфері кібербезпеки отримає невелика група альфа-тестувальників, а згодом доступ через Daybreak Blue розширюватиметься для підтримки захисного застосування.
Ми також додали багаторівневий захист, щоб запобігти потенційно неузгодженим діям моделі:
- Узгодження моделі: у наших оцінюваннях Astra набагато частіше, ніж GPT‑5.6 Sol, дотримувалася чітких обмежень безпеки й захищеності та залишалася в межах своїх повноважень, що робить її нашою найбільш узгодженою моделлю на сьогодні. Особливу увагу ми приділили тому, чи дотримується модель обмежень безпеки й захищеності та чи схильна вона залишатися в межах своїх повноважень.
- Моніторинг і контроль: за аналогією з нашими внутрішніми процедурами ми розгортаємо Astra з додатковим моніторингом ланцюжка міркувань, щоб швидко виявляти й стримувати потенційно неузгоджені дії.
Astra — це значний крок уперед в узгодженні моделей і результат кількох тривалих напрямів роботи: від втручань під час попереднього навчання до ретельнішого й послідовнішого оцінювання під час навчання з підкріпленням. Тестування показало, що Astra послідовно частіше, ніж GPT 5.6 Sol, дотримується чітких обмежень і попереджень щодо безпеки, зокрема автоматичної перевірки.
Ми також розробили тест з урахуванням інциденту з Hugging Face, під час якого агенти, що виконували кібероцінювання ExploitGym, скомпрометували системи третьої сторони. Найскладніші завдання з цього оцінювання ми використали для створення тестів із «пастками», щоб перевірити, чи спробує модель скомпрометувати навколишню інфраструктуру безпеки замість виконання призначеного завдання. Без робочих засобів захисту GPT‑5.6 Sol у 56% тестів намагався отримати доступ до цих цілей у симульованому середовищі тесту, де моделі доручали створювати експлойти. У цих тестах Astra не зробила жодної такої спроби. Ці показники описують поведінку в тестових умовах без засобів кіберзахисту, а не під час звичайного робочого використання.
Ліворуч: у цьому новому оцінюванні ми спостерігаємо, як моделі реагують на відхилення автоматичною перевіркою. Кожне завдання виконується в середовищі інтелектуальної праці, а виконання починається відразу після відмови автоматичної перевірки. Далі модель може діяти кількома способами: завершити виконання, спробувати знайти безпечнішу альтернативу, повторити подібну команду або скористатися невдалою конфігурацією(відкривається у новому вікні), щоб повністю обійти автоматичну перевірку. Вибір будь-якого з двох останніх варіантів означав би провал цього оцінювання. Astra жодного разу не намагалася обійти автоматичну перевірку.
Праворуч: у цьому оцінюванні ми перевіряємо схильність моделі шахраювати за допомогою «пасток», коли вона стикається з найскладнішими або нездійсненними завданнями в оцінюванні ExploitGym. Щоб оцінити поведінку моделі, тест проводили в симульованому середовищі, де засоби захисту працювали лише в режимі спостереження. GPT‑5.6 Sol демонстрував вищу ймовірність шахрайства в таких сценаріях, натомість Astra не намагалася використовувати ці обхідні шляхи й усе ж змогла легітимно виконати деякі завдання.
Навчання моделей узгодженій поведінці — один із рівнів безпеки. Докладніше про тестування узгодження та його результати ми розповімо в картці системи Astra.
Для моделей класу Astra ми також розгортаємо в робочому середовищі моніторинг неузгодженості, щоб виявляти й швидко стримувати її потенційні прояви. Ці засоби захисту подібні до моніторингу внутрішніх розгортань і включають систему класифікаторів, які перевіряють міркування та дії моделі на несанкціоновану поведінку й автоматично зупиняють потенційно несанкціоновану активність. Зі зростанням можливостей ці засоби захисту не можуть замінити належне узгодження наших моделей. Наша мета — узгодити майбутні моделі настільки добре, щоб ці засоби ніколи не спрацьовували.
OpenAI прагне забезпечити широку доступність переваг ШІ. З огляду на значне зростання можливостей Astra у сфері кібербезпеки ми особливо ретельно дбаємо про безпеку й захищеність цього розгортання. Додаткові перевірки безпеки іноді можуть уповільнювати, призупиняти або припиняти легітимну роботу, зокрема захисну діяльність у сфері кібербезпеки.
Іноді система може позначити легітимну активність як потенційне зловживання в кіберпросторі або несанкціоновану поведінку, через що ненавмисно сповільнить, призупинить чи припинить її. Це може стосуватися роботи, яка не має очевидного прямого зв’язку з кібербезпекою, або завдань, у яких агент працює протягом тривалого часу.
Якщо монітор неузгодженості призупинить завдання, користувачів ChatGPT або Codex можуть попросити перевірити дію, перш ніж продовжити. В інших інтерфейсах, як-от API, виконання завдання припиниться. Ми плануємо й надалі калібрувати ці засоби захисту, щоб зменшити кількість непотрібних переривань і розширити доступ до передових можливостей через такі програми, як Daybreak.
Ми вступаємо в етап розвитку ШІ, коли моделі можуть виконувати важливішу роботу, а недоліки узгодження й контролю здатні мати серйозніші наслідки. Реалізація переваг цих систем залежатиме від нашої здатності узгоджувати й контролювати моделі в міру зростання їхніх можливостей.
Ця відповідальність охоплює навчання, оцінювання та розгортання. Вона вимагає переконливіших доказів узгодженої поведінки, засобів захисту, що не відстають від розвитку можливостей, і готовності сповільнитися, коли цього захисту недостатньо.
Ми й надалі тестуватимемо ці системи, ділитимемося здобутими знаннями й відверто говоритимемо про те, що залишається невизначеним. Моделі, що з’являться після Astra, вимагатимуть від нас більшого. Ми приділимо необхідний час і виконаємо всю роботу, щоб упоратися з цією відповідальністю.
