Завантаження…
Сьогодні ми випускаємо GPT‑6 Astra — найпотужнішу модель, яку ми коли-небудь розгортали для широкого використання. Astra — перша наша модель, яка досягла рівня «Критичний» щодо кіберзахисних можливостей за нашою рамковою системою готовності.
Найважливіше, що варто знати про безпеку цього запуску:
- GPT‑6 Astra демонструє суттєвий стрибок у кіберможливостях і досягає встановленого нами рівня «Критичний». Це означає, що за наявності належних інструментів і доступу GPT‑6 Astra може знаходити раніше невідомі вразливості та розробляти нові способи їх використання в багатьох добре захищених системах без участі людини на кожному кроці. Тому ми суттєво посилили захист від шкідливих кібердій моделі — незалежно від того, спричинені вони зловживанням чи проблемами узгодженості (misalignment). Ми також ужили заходів для захисту внутрішньої розробки й розгортання Astra та подібних моделей, зокрема запровадили суворішу ізоляцію, шифрування контрольних точок, суцільний моніторинг повних траєкторій, включно з ланцюжками міркувань (chain of thought, CoT), а також обов’язкову перевірку узгодженості перед внутрішнім використанням.
- GPT‑6 Astra значно стійкіша за своїх попередників. Завдяки новим методикам навчання безпеки, спрямованим на підвищення стійкості, GPT‑6 Astra значно краще протистоїть спробам обходу обмежень (jailbreak) порівняно з GPT‑5.6 Sol, зокрема й у довших послідовностях взаємодії. Про це свідчать офлайн-тести та наша програма ретельного внутрішнього й зовнішнього тестування на джейлбрейки та усунення виявлених проблем. Для користувачів, позначених як потенційно високоризикові, ми додатково навчили модель коригувати межу відмови в бік більшої обережності, охоплюючи ширший спектр ризиків подвійного призначення. За допомогою регресійного тестування ми перевіряємо стійкість Astra до джейлбрейків, виявлених під час попередніх тестувань, а для підтвердження поліпшень провели нові раунди автоматизованої перевірки на вразливості та ризики з використанням наших найновіших внутрішніх атакувальних систем.
- GPT‑6 Astra краще узгоджена, ніж GPT‑5.6 Sol. Astra являє собою суттєвий крок уперед у сфері узгодженості моделі та включає вдосконалення на всіх етапах — від складу даних попереднього навчання до оцінювання під час навчання з підкріпленням. Ми представляємо новий набір оцінювань узгодженості(відкривається у новому вікні), результати якого показують, що GPT‑6 Astra краще дотримується меж безпеки й захисту та не виходить за межі наданих їй повноважень. У симуляції з використанням понад 54 000 внутрішніх завдань Codex(відкривається у новому вікні) Astra також отримала приблизно вдвічі менше позначок про неузгоджену поведінку високої серйозності порівняно із Sol.
- Ми впроваджуємо моніторинг неузгодженості на широкому рівні. Ми вважаємо узгодження моделі головним засобом запобігання потенційно неузгодженій поведінці наших моделей. Водночас моніторинг дає широке уявлення про поведінку передової моделі й допомагає виявляти можливості для подальшого вдосконалення узгодженості та безпеки. Крім того, моніторинг слугує додатковим рівнем захисту від виявленої неузгодженої поведінки. Саме тому ми також запровадили моніторинг неузгодженої поведінки для всіх операцій логічного виведення з використанням інструментів у межах зовнішнього розгортання Astra, попри значні обчислювальні витрати. Ця система аналогічна нашій внутрішній конфігурації.
- Можливість моніторингу GPT‑6 Astra знизилася порівняно з GPT‑5.6 Sol. Ми провели ґрунтовні дослідження можливості моніторингу(відкривається у новому вікні) та керованості(відкривається у новому вікні) GPT‑6 Astra. Ми виявили, що GPT‑6 Astra краще, ніж GPT‑5.6 Sol, здатна контролювати власний ланцюжок міркувань (CoT) і рідше включає викривальну інформацію до нього. В умовах цілеспрямованих атак (коли ми навмисно спонукаємо модель уникати нашого моніторингу) ми виявили, що модель здатна залишатися непоміченою під час стратегічного заниження результатів в оцінюваннях (так званий саботаж (від англ. — sandbagging)), а іноді може обходити наші внутрішні системи моніторингу, коли їй доручають виконати певні саботажні дії(відкривається у новому вікні). Ми не виявили ознак стеганографічних міркувань у CoT (тобто приховування прихованих міркувань у звичайному й на перший погляд не пов'язаному тексті), що вказує на те, що ризик уникнення моніторингу, ймовірно, значною мірою обмежується завданнями нижчого рівня складності міркувань.
- Ці результати свідчать, що моделі класу Astra можуть обходити наші засоби моніторингу CoT, якщо їх цілеспрямовано до цього спонукати. Наразі такі висновки ґрунтуються переважно на тестах, у яких ми самі доручали моделі уникати моніторингу, а загальні оцінювання узгодженості показують, що Astra порушує обмеження щодо захисту й безпеки рідше, ніж GPT‑5.6 Sol.
- Проте ми серйозно ставимося до цієї тенденції та продовжуємо досліджувати отримані результати і їхні наслідки для можливості моніторингу в міру зростання можливостей наших моделей. OpenAI працює над збереженням і застосуванням моніторингу ланцюжків міркувань, а збереження можливості моніторингу CoT є однією з головних цілей дослідницької програми. Водночас ці результати підкреслюють важливість розроблення методів аудиту узгодженості, які не обмежуються вивченням ланцюжка міркувань моделі.
- GPT‑6 Astra відповідальніше працює в браузері та робочому середовищі: GPT‑6 Astra значно стійкіша до вставлення шкідливих запитів, ніж GPT‑5.6 Sol. Ми також перевірили поведінку моделі в реалістичних сценаріях роботи в браузері та професійних комп’ютерних середовищах. Порівняно з GPT‑5.6 Sol модель значно рідше виконує неузгоджені й потенційно руйнівні дії, як-от несанкціоновані транзакції, втрата даних, надмірне розширення доступу чи обхід засобів контролю. Вона також безпечніше реагує на шкідливі запити в агентних сценаріях, зокрема на прохання допомогти спланувати насильницький напад або вчинити шахрайство.
- GPT‑6 Astra значно безпечніша в сценаріях підвищеного ризику. GPT‑6 Astra безпечніше за GPT‑5.6 Sol відповідає на складні запити з робочого середовища та перевірок на вразливості та ризики за участю людей. Astra забезпечує поліпшення за Парето: безпечніше опрацьовує небезпечні запити й водночас уникає зайвих відмов на нешкідливі запити. Ці поліпшення поширюються й на сценарії з тяжкими наслідками, де ризик шкоди виникає із ширшого контексту, а не з явно сформульованого запиту. Astra також послідовніше застосовує належні вікові межі безпеки для користувачів до 18 років.
Докладніше див. у повній картці системи(відкривається у новому вікні).
Автор
OpenAI


