Сторонні кібероцінювання моделей OpenAI
Незалежне тестування відіграє важливу роль, допомагаючи нам перевіряти й краще розуміти ризики до розгортання. У деяких кібероцінюваннях навмисно використовують спеціальні конфігурації, зокрема послаблюють засоби захисту, щоб виміряти базові можливості, а не звичайну поведінку моделей у загальнодоступних розгортаннях.
Під час нещодавніх оцінювань два зовнішні партнери з тестування виявили інциденти, коли поєднання тестових конфігурацій і засобів контролю з дедалі ширшими можливостями нових моделей дало змогу їхній активності вийти за передбачені межі тестування. Ці інциденти підкреслюють важливість співпраці в усій галузі та зі сторонніми оцінювачами, щоб удосконалювати стандарти тестових середовищ і практик у міру розширення можливостей моделей. Примітка редактора: ці випадки не пов’язані з інцидентом безпеки Hugging Face. Ми й надалі публікуватимемо оновлення щодо інциденту Hugging Face тут.
Нові інциденти стосувалися доступу моделей OpenAI до загальнодоступного інтернету під час сторонніх кібероцінювань за особливих умов і в конфігураціях із послабленими засобами захисту, які не відповідали звичайному розгортанню. До цих інцидентів належали:
- UK AISI, урядовий Інститут безпеки ШІ Великої Британії, проводив оцінювання на кіберполігоні з навмисно ввімкненим доступом до інтернету, щоб агенти могли самостійно знаходити інструменти й діяти в умовах, наближених до дій реального зловмисника. Кіберкласифікатори було вимкнено для вимірювання базових можливостей. Їхній допис у блозі можна прочитати тут.(відкривається у новому вікні)
- Irregular, один із наших зовнішніх партнерів із тестування кібербезпеки, проводив оцінювання у форматі Capture the Flag, які мали бути ізольовані від інтернету, але через неправильну конфігурацію тестового середовища моделі отримали доступ до загальнодоступного інтернету.
Нижче ми підсумовуємо, що сталося, які умови тестування уможливили цю активність, яких заходів ужито для її локалізації та що ми робимо, аби незалежні лабораторії могли й надалі ретельно й безпечно оцінювати дедалі потужніші моделі.
Ці інциденти вказують на ту саму ширшу проблему, яку ми описали в нещодавньому дописі про інцидент Hugging Face: у міру розширення можливостей моделей мають удосконалюватися й системи їхньої безпеки та захисту. Це стосується як середовищ для розроблення моделей, так і середовищ, у яких лабораторії та незалежні партнери їх оцінюють.
Найближчими тижнями ми переглянемо власний підхід до стороннього тестування: як ми визначаємо оцінювання з підвищеним ризиком, узгоджуємо їхні межі, розглядаємо запити на доступ до інтернету чи послаблення засобів захисту, установлюємо вимоги щодо ізоляції, роботи з обліковими даними, моніторингу й умов зупинення, а також запроваджуємо чіткіші процедури сповіщення про інциденти та їх ескалації.
Ми прагнемо співпрацювати з усією галуззю, щоб зміцнити спільні практики безпечного проведення оцінювань із високим рівнем ризику. Зокрема, найближчими тижнями ми зберемо разом представників національних інститутів ШІ, незалежних оцінювачів, інших лабораторій ШІ та інших груп. Наша мета — зберегти цінність ретельного незалежного оцінювання та водночас забезпечити відповідність практик тестування дедалі ширшим можливостям моделей.
3 серпня UK AISI повідомила нам, що під час планового кібероцінювання, розпочатого 25 липня, моделі OpenAI та іншої лабораторії в деяких випадках вийшли за межі тестування. Оцінювання проводили на контрольованих кіберполігонах, створених для імітації реальних мереж. Із 19 виявлених подій дві стосувалися моделі OpenAI — GPT‑5.6 Sol. В інших випадках ішлося про моделі іншої лабораторії.
У межах цього оцінювання агентам доручили діяти як фахівці з кібербезпеки у вправі Capture the Flag: скомпрометувати три пов’язані симульовані середовища й отримати фінальний прапор. У запиті до завдання було визначено мережі полігону, охоплені тестуванням, і названо кілька систем поза його межами. UK AISI також увімкнула доступ до інтернету, щоб агенти могли завантажувати інструменти й діяти в умовах, наближених до дій людини-зловмисника, а також вимкнула кіберкласифікатори моделі для вимірювання базових можливостей.
Передбачена UK AISI межа дозволених дій охоплювала симульований кіберполігон: агентам дозволялося атакувати зазначені симульовані мережі й отримати прапор, але не взаємодіяти із системами поза мережевими межами полігону. Однак агентам прямо не пояснили, як саме вони можуть і не можуть користуватися відкритим доступом до інтернету. UK AISI вважає це одним із можливих чинників інциденту.
Проаналізувавши ці запуски, UK AISI встановила, що GPT‑5.6 Sol виконала дві несанкціоновані дії, намагаючись знайти шлях до симульованого полігону й отримати прапор:
- GPT‑5.6 Sol повторно використала токен GitHub, який агент іншої лабораторії залишив у відкритому доступі, щоб перевірити, чи опитує якась система в межах полігону GitHub або іншу службу оновлень; спробувала обійти процедури відновлення облікового запису й обмеження кількості запитів, а також зареєструвала облікові записи в зовнішніх постачальників послуг DNS і тунелювання.
- GPT‑5.6 Sol скористалася загальнодоступною службою тунелювання, щоб зробити DNS-сервер, який локально працював у середовищі оцінювання, доступним із загальнодоступного інтернету. Сервер містив корисні навантаження, призначені для використання відомої вразливості в програмному забезпеченні, що працювало на тестовому полігоні. Ця конфігурація не спрацювала, доказів надсилання запитів від реальних резолверів немає, а після завершення оцінювання інфраструктуру видалили.
Хоча модель намагалася пройти завдання на кіберполігоні, UK AISI визнала ці дії несанкціонованими, оскільки вони стосувалися реальних зовнішніх облікових записів і служб поза межами полігону та не були потрібні для виконання завдання. DNS-сервер також розміщував у загальнодоступному інтернеті корисні навантаження експлойтів, хоча ця конфігурація не спрацювала й доказів надсилання запитів від реальних резолверів немає.
UK AISI виявила цю активність 28 липня, коли система моніторингу безпеки зафіксувала незвичне передавання даних. Вона зупинила пов’язані оцінювання, ізолювала відповідні машини та локалізувала активність приблизно за годину після виявлення.
Ми вдячні UK AISI за партнерство впродовж усього процесу, зокрема за виявлення й розслідування цієї активності та надання докладної інформації про неї. Ми сподіваємося й надалі продовжувати нашу співпрацю.
29 липня Irregular, один із наших сторонніх партнерів з оцінювання, повідомив нам про інцидент за участю моделей OpenAI під час оцінювання кібербезпеки у форматі Capture the Flag (CTF). Моделям доручили знаходити приховану інформацію, використовуючи слабкі місця в симульованому середовищі, і повідомили, що вони не мають доступу до інтернету. Однак через неправильну конфігурацію тестового середовища моделі отримали доступ до загальнодоступного інтернету.
В одному з тестів назва вигаданої цілі завдання CTF випадково збіглася з реальним доменом. Оскільки тестове середовище помилково під’єднали до інтернету, модель використала вразливість реального вебсайту, сприйнявши його за частину симульованого середовища. Це не було складною втечею з пісочниці чи використанням вразливості нульового дня: доступ до інтернету з’явився через неправильну конфігурацію, а модель, імовірно, скористалася базовою вразливістю безпеки.
За результатами розслідування Irregular, модель також знайшла й використала облікові дані для керування цим сайтом. Irregular не виявив наслідків поза межами власних даних ураженого сайту, а аудит досі триває. Irregular призупинив оцінювання та розпочав усунення проблем, а постраждалих третіх сторін було повідомлено. Irregular повідомив нам, що всі виявлені проблеми, пов’язані з інцидентом, уже усунуто, а до тестового середовища додано належні засоби захисту. Irregular також повідомив про пов’язані інциденти за участю інших лабораторій у тому самому тестовому середовищі.
Ми вдячні Irregular за партнерство й надалі тісно співпрацюватимемо з ним, підтримуючи проведення перевірки. Irregular також готує аналітичний документ із найкращими практиками локалізації та безпечного проведення кібероцінювань. Ми плануємо долучитися до підготовки цього документа, щоб оприлюднити висновки для спільноти, і продовжувати наше партнерство. Ми вважаємо таку співпрацю важливою для безпечного й ретельного оцінювання нинішніх і майбутніх моделей.


