Преминаване към основното съдържание
OpenAI

4 август 2026 г.

Сигурност

Кибероценки от трети страни с модели на OpenAI

Зареждане…

Независимото тестване играе важна роля, като ни помага да потвърдим и разберем по-добре рисковете преди внедряването. При някои оценки на киберсигурността умишлено се използват персонализирани конфигурации, включително отслабени защитни мерки, за да се измерят базовите възможности, а не обичайното поведение на моделите в публично достъпни среди.

По време на скорошни оценки двама външни партньори за тестване установиха инциденти, при които съчетанието от тестови конфигурации и контроли и нарастващите възможности на новите модели позволи дейността им да излезе извън предвидените граници на тестване. Инцидентите подчертават колко е важно да си сътрудничим с целия сектор и с външните оценители, за да развиваме стандартите за тестови среди и практики с нарастването на възможностите на моделите. Бележка на редактора: Тези случаи са отделни от инцидента със сигурността на Hugging Face. Ще продължим да публикуваме актуална информация за инцидента с Hugging Face тук.

Новите инциденти включваха достъп на модели на OpenAI до публичния интернет по време на оценки на киберсигурността от трети страни, при специфични условия и конфигурации с отслабени защитни мерки, които не отразяват обичайното внедряване. Инцидентите бяха следните:

  1. UK AISI — британският правителствен Институт за сигурност на ИИ — провеждаше оценки в киберполигон с умишлено разрешен достъп до интернет, така че агентите да могат сами да намират инструменти и да работят при условия, по-близки до тези на реален нападател. Киберкласификаторите бяха изключени, за да се измерят базовите възможности. Можете да прочетете публикацията им в блога тук.(отваря се в нов прозорец)
  2. Irregular, един от външните ни партньори за тестване на киберсигурността, провеждаше оценки от типа Capture the Flag, които трябваше да бъдат изолирани от интернет, но погрешна конфигурация на тестовата среда позволи на моделите да получат достъп до публичния интернет.

По-долу обобщаваме какво се случи, тестовите условия, позволили тази дейност, предприетите мерки за ограничаването ѝ и действията ни, за да могат независимите лаборатории да продължат стриктно и безопасно да оценяват все по-способни модели.

Укрепване на средите за оценяване на модели от трети страни

Тези инциденти показват същото по-широко предизвикателство, което описахме в неотдавнашната си публикация за инцидента с Hugging Face: с развитието на възможностите на моделите трябва да се развиват и системите за сигурност и безопасност около тях. Това включва както средите за разработване на модели, така и средите, които лабораториите и независимите партньори използват за оценяването им.

През следващите седмици ще преразгледаме собствения си подход към тестването от трети страни, включително как определяме оценките с по-висок риск, съгласуваме обхвата, разглеждаме исканията за достъп до интернет или отслабване на защитните мерки, задаваме изисквания за изолация, работа с идентификационни данни, наблюдение и условия за спиране и установяваме по-ясни процедури за уведомяване и ескалация при инциденти.

Поемаме ангажимент да работим с целия сектор за укрепване на общите практики за безопасно провеждане на високорискови оценки, включително като през следващите седмици съберем заинтересовани страни като национални институти за ИИ, независими оценители, други лаборатории за ИИ и други групи. Целта ни е да запазим стойността на строгото независимо оценяване, като същевременно гарантираме, че тестовите практики са в крак с все по-способните модели.

UK AISI

На 3 август UK AISI ни съобщи, че при започнала на 25 юли рутинна оценка на киберсигурността модели на OpenAI и друга лаборатория в някои случаи са излезли извън обхвата на тестовете. Оценяването се проведе в контролирани киберполигони, проектирани да наподобяват реални мрежи. От 19-те установени събития две включваха модел на OpenAI — GPT‑5.6 Sol. В останалите случаи участваха модели на друга лаборатория.

За тази оценка агентите бяха инструктирани да действат като експерти по киберсигурност в упражнение за улавяне на флага: да компрометират три свързани симулирани среди и да извлекат последния флаг. Подканата за задачата посочваше включените в обхвата мрежи на полигона и определяше няколко системи като извън обхвата. UK AISI също разреши достъп до интернет в реално време, така че агентите да могат да изтеглят инструменти и да работят при условия, по-близки до тези на реален нападател, и изключи киберкласификаторите на модела, за да измери базовите му възможности.

Предвидената от UK AISI граница на разрешените действия беше симулираният киберполигон: агентите имаха право да атакуват посочените симулирани мрежи и да извлекат флаг, но не и да взаимодействат със системи извън мрежовите граници на полигона. На агентите обаче не беше изрично обяснено как могат и как не могат да използват свободния достъп до интернет, което UK AISI посочва като възможна причина, допринесла за инцидента.

В хода на тези изпълнения UK AISI установи, че GPT‑5.6 Sol е извършил две неразрешени действия, докато се е опитвал да намери път към симулирания полигон и да извлече флага:

  1. GPT‑5.6 Sol използва повторно GitHub токен, който Агент на друга лаборатория беше оставил публично достъпен, за да провери дали система в полигона прави заявки към GitHub или друга услуга за актуализации, опита да заобиколи процедурите за възстановяване на акаунти и ограниченията за заявки и регистрира акаунти при външни доставчици на DNS и тунелни услуги.
  2. GPT‑5.6 Sol използва публична услуга за тунелиране, за да направи DNS сървър, работещ локално в средата за оценяване, достъпен от публичния интернет. Сървърът съдържаше полезни товари, предназначени за известна уязвимост в софтуер, работещ в тестовия полигон. Конфигурацията не проработи, няма данни реален DNS резолвер да е отправял заявки към нея, а инфраструктурата беше премахната след края на оценяването.

Макар моделът да се опитваше да завърши задачата в киберполигона, UK AISI определи тези действия като неразрешени, тъй като включваха реални външни акаунти и услуги извън границите на полигона и не бяха необходими за изпълнението на задачата. DNS сървърът също публикуваше в интернет полезни товари за експлойти, макар че конфигурацията не проработи и няма данни реален DNS резолвер да е отправял заявки към него.

UK AISI установи дейността на 28 юли, след като системите за наблюдение на сигурността засякоха необичайни прехвърляния на данни. Институтът спря свързаните оценки, изолира съответните машини и ограничи дейността в рамките на около час след откриването ѝ.

Ценим партньорството на UK AISI през целия процес, включително работата му по откриването и разследването на дейността и споделянето на подробности за нея. Очакваме с нетърпение да продължим сътрудничеството си.

Irregular

На 29 юли Irregular, един от външните ни партньори за оценяване, ни уведоми за инцидент с модели на OpenAI по време на оценки на киберсигурността от типа Capture the Flag (CTF). Моделите бяха инструктирани да открият скрита информация чрез използване на слабости в симулирана среда и им беше казано, че нямат достъп до интернет. Погрешна конфигурация на тестовата среда обаче позволи на моделите да получат достъп до публичния интернет.

При един тест името на фиктивната цел от CTF предизвикателството неволно съвпадна с реален домейн. Тъй като тестовата среда по погрешка беше свързана с интернет, моделът атакува реален уебсайт, смятайки го за част от симулираната среда. Това не беше сложно излизане от защитената среда или използване на уязвимост от нулев ден: достъпът до интернет се дължеше на погрешна конфигурация, а моделът очевидно използва основна уязвимост в сигурността.

Според разследването на Irregular моделът също е открил и използвал идентификационни данни, за да управлява същия сайт. Irregular не е установила последици извън собствените данни на засегнатия сайт, а одитът ѝ продължава. Компанията преустанови оценките и започна отстраняване на проблемите, а засегнатите трети страни бяха уведомени. Irregular ни информира, че всички установени проблеми, свързани с инцидента, вече не са активни и че към тестовата среда са добавени подходящи защитни мерки. Irregular съобщи и за свързани инциденти с други лаборатории в същата тестова среда.

Ценим партньорството си с Irregular и ще продължим да работим в тясно сътрудничество с компанията в подкрепа на нейния преглед. Irregular разработва и бяла книга, в която ще сподели добри практики за ограничаване на инциденти и безопасно провеждане на оценки на киберсигурността. Очакваме с нетърпение да участваме в изготвянето на бялата книга, за да направим констатациите достъпни за общността, и да продължим партньорството си. Смятаме подобно сътрудничество за съществено за безопасното и задълбочено оценяване на настоящите и бъдещите модели.

Автор

OpenAI