Прескокни до главната содржина
OpenAI

4 август 2026 г.

Сигурност

Сајбер-евалуации од трети страни со модели на OpenAI

Се вчитува...

Независното тестирање има важна улога во потврдувањето и подоброто разбирање на ризиците пред примената. Некои сајбер-евалуации намерно користат приспособени конфигурации, вклучувајќи намалени заштитни мерки, за да ја измерат основната способност — а не вообичаеното однесување на моделите во јавно достапните примени.

За време на неодамнешните евалуации, двајца надворешни партнери за тестирање открија инциденти во кои комбинацијата од тест-конфигурациите и контролите и напредните способности на поновите модели овозможила активноста на моделите да ги надмине предвидените граници на тестирањето. Инцидентите ја нагласуваат важноста од соработка во целата индустрија и со надворешните оценувачи за стандардите за тест-средините и практиките да се развиваат напоредно со зголемувањето на способностите на моделите. Белешка од уредникот: Овие инциденти не се поврзани со безбедносниот инцидент со Hugging Face, за кој ќе продолжиме да објавуваме новости овде.

Новите инциденти вклучувале пристап на модели на OpenAI до јавниот интернет за време на сајбер-евалуации од трети страни, под специфични услови и со конфигурации со намалени заштитни мерки што не ја одразувале вообичаената примена. Инцидентите го вклучуваа следново:

  1. UK AISI, владиниот Институт за безбедност на ВИ на Обединетото Кралство, спроведувал евалуации на сајбер-полигон со намерно овозможен пристап до интернет, за агентите сами да наоѓаат алатки и да работат во услови поблиски до оние на реален напаѓач, а сајбер-класификаторите биле исклучени за да се измери основната способност. Нивниот блог можете да го прочитате овде.(се отвора во нов прозорец)
  2. Irregular, еден од нашите надворешни партнери за сајбер-безбедносно тестирање, спроведувал евалуации од типот Capture the Flag, предвидени да бидат изолирани од интернет, но погрешна конфигурација на тест-средината им овозможила на моделите да пристапат до јавниот интернет.

Подолу резимираме што се случи, кои услови на тестирањето ја овозможија активноста, кои чекори беа преземени за нејзино ограничување и што правиме за независните лаборатории да можат и понатаму темелно и безбедно да ги оценуваат сè поспособните модели.

Зајакнување на средините за евалуација на модели од трети страни

Овие инциденти укажуваат на истиот поширок предизвик што го опишавме во неодамнешната објава за инцидентот со Hugging Face: како што напредуваат способностите на моделите, така мора да напредуваат и системите за нивна безбедност и заштита. Тоа ги опфаќа и средините во кои се развиваат моделите и оние што лабораториите и независните партнери ги користат за нивно оценување.

Во следните недели ќе го преиспитаме нашиот пристап кон тестирањето од трети страни, вклучително и начинот на кој ги препознаваме евалуациите со повисок ризик, го договараме опсегот, ги разгледуваме барањата за овозможување интернет-пристап или намалување на заштитните мерки, ги утврдуваме очекувањата за изолација, ракување со акредитиви, надзор и услови за запирање и воспоставуваме појасни постапки за известување и ескалација на инциденти.

Посветени сме на соработка во целата индустрија за зајакнување на заедничките практики за безбедно спроведување високоризични евалуации, вклучително и преку собирање засегнати страни како национални институти за ВИ, независни оценувачи, други лаборатории за ВИ и други групи во следните недели. Нашата цел е да ја зачуваме вредноста на темелната независна евалуација, истовремено обезбедувајќи практиките за тестирање да го следат развојот на сè поспособните модели.

UK AISI

На 3 август, UK AISI нè извести дека за време на рутинска сајбер-евалуација започната на 25 јули, моделите на OpenAI и на друга лабораторија во некои случаи го надминале опсегот на тестирањето. Евалуацијата се одвивала на контролирани сајбер-полигони создадени да имитираат реални мрежи. Од 19-те утврдени настани, два вклучувале модел на OpenAI, GPT‑5.6 Sol. Во другите случаи станувало збор за модели од друга лабораторија.

За оваа евалуација, агентите добиле инструкции да дејствуваат како експерти за сајбер-безбедност во вежба од типот Capture the Flag: да пробијат во три поврзани симулирани средини и да го преземат завршното знаменце. Промптот за задачата ги наведувал мрежите во опсегот на полигонот и посочувал неколку системи како надвор од опсегот. UK AISI овозможил и пристап до интернет во живо за агентите да можат да преземаат алатки и да работат во услови поблиски до оние на човечки напаѓач — а ги исклучил сајбер-класификаторите на моделот за да ја измери основната способност.

Предвидената граница на овластувањето на UK AISI била симулираниот сајбер-полигон: агентите биле овластени да ги нападнат наведените симулирани мрежи и да преземат знаменце, но не и да комуницираат со системи надвор од мрежните граници на полигонот. Сепак, на агентите не им било изречно кажано како смеат, а како не смеат да го користат отворениот пристап до интернет, што UK AISI го посочува како можна причина што придонела за инцидентот.

Во текот на овие извршувања, UK AISI утврдил дека GPT‑5.6 Sol извршил две неодобрени дејства додека се обидувал да најде начин да влезе во симулираниот полигон и да го преземе знаменцето:

  1. GPT‑5.6 Sol повторно употребил GitHub токен што агент од друга лабораторија го оставил јавно достапен за да провери дали систем во опсегот го проверува GitHub или друга услуга за ажурирање, се обидел да ги заобиколи постапките за враќање сметка и ограничувањата на барањата и регистрирал сметки кај надворешни даватели на DNS и тунелски услуги.
  2. GPT‑5.6 Sol употребил јавна тунелска услуга за DNS-сервер што работел локално во неговата средина за евалуација да го направи достапен од јавниот интернет. Серверот содржел корисни товари наменети за позната ранливост во софтвер што работел на тест-полигонот. Поставката не функционирала, нема докази дека некој реален резолвер испратил барање до неа, а инфраструктурата била отстранета по завршувањето на евалуацијата.

Иако моделот се обидувал да го заврши сајбер-полигонот, UK AISI ги сметал овие дејства за неодобрени бидејќи вклучувале реални надворешни сметки и услуги надвор од границите на полигонот, а не биле потребни за завршување на задачата. DNS-серверот исто така хостирал корисни товари за искористување ранливости на јавниот интернет, иако поставката не функционирала и нема докази дека некој реален резолвер испратил барање до неа.

UK AISI ја открил активноста на 28 јули, откако безбедносниот надзор забележал невообичаени преноси на податоци. Ги запрел поврзаните евалуации, ги изолирал релевантните машини и ја ограничил активноста во рок од приближно еден час по откривањето.

Го цениме партнерството со UK AISI во текот на целиот процес, вклучително и неговата работа за откривање и истражување на активноста и споделување детали за неа. Со нетрпение очекуваме да ја продолжиме нашата соработка.

Irregular

На 29 јули, Irregular, еден од нашите надворешни партнери за евалуација, нè извести за инцидент со модели на OpenAI за време на сајбер-безбедносни евалуации од типот Capture the Flag (CTF). Моделите добиле инструкции да пронајдат скриени информации искористувајќи слабости во симулирана средина и им било кажано дека немаат пристап до интернет. Сепак, погрешна конфигурација на тест-средината им овозможила на моделите да пристапат до јавниот интернет.

Во еден тест, името на фиктивната цел во CTF-предизвикот ненамерно се совпаднало со реален домен. Бидејќи тест-средината по грешка била поврзана на интернет, моделот искористил ранливост на реална веб-локација, мислејќи дека е дел од симулираната средина. Ова не вклучувало софистицирано излегување од изолираната средина ниту ранливост од нулти ден: пристапот до интернет бил последица на погрешна конфигурација, а се чини дека моделот искористил основна безбедносна ранливост.

Според истрагата на Irregular, моделот исто така пронашол и употребил акредитиви за да управува со истата веб-локација. Irregular не утврдил последици надвор од сопствените податоци на засегнатата веб-локација, а неговата ревизија сè уште трае. Ги паузирал евалуациите и започнал со санација, а засегнатите трети страни биле известени. Irregular нè информираше дека ниту еден од утврдените проблеми поврзани со инцидентот повеќе не е активен и дека во тест-средината се додадени соодветни заштитни мерки. Irregular исто така извести за поврзани инциденти со други лаборатории во истата тест-средина.

Го цениме партнерството со Irregular и ќе продолжиме тесно да соработуваме со нив за да ја поддржиме нивната ревизија. Irregular подготвува и бела книга во која ќе ги сподели најдобрите практики за ограничување на инциденти и безбедно спроведување сајбер-евалуации. Со нетрпение очекуваме да придонесеме кон белата книга за наодите да ѝ бидат достапни на заедницата и да го продолжиме нашето партнерство. Овој вид соработка го сметаме за суштински за безбедно и темелно оценување на сегашните и идните модели.