Пређите на главни садржај
OpenAI

Инцидент са платформом Hugging Face и други утицаји неусклађених модела на треће стране

Како системи вештачке интелигенције постају способнији и самосталнији, неусклађено понашање може довести до озбиљних последица у стварном свету, укључујући инциденте у области сајбер-безбедности и друге исходе које програмери можда нису предвидели. Стога је разумевање начина на који таква понашања настају и ескалирају, као и начина њиховог откривања и реаговања на њих, све важнији део безбедног развоја и примене напредних система вештачке интелигенције.

Инцидент са платформом Hugging Face у почетку смо првенствено сматрали безбедносним проблемом јер је обухватао компромитовање на нивоу платформе. То је и даље најозбиљнија активност те врсте коју смо до сада уочили код наших модела, а првенствено ју је покренуо веома способан истраживачки модел намењен искључиво интерној употреби. Од тада смо утврдили да је овај упад био последица тога што су модели прибегавали неусклађеним стратегијама ради решавања тешких задатака, као што је наведено у техничком извештају о инциденту са платформом Hugging Face. Инциденти у области сајбер-безбедности један су вид тог ризика; неусклађеност може довести и до другог неочекиваног или забрињавајућег понашања ван традиционалних безбедносних категорија, попут објављивања садржаја наших модела на сајтовима трећих страна — што називамо „агентска нежељена пошта“. Морамо се позабавити и једним и другим.

Наставили смо да испитујемо шире активности, дајући предност озбиљнијим инцидентима и проширујући преглед на мање озбиљне неусклађене активности, укључујући агентску нежељену пошту.

Ова страница обједињује наше извештаје и новости о инциденту са платформом Hugging Face, повезана истраживања и јавне презентације, додатне активности које смо уочили, сазнања о улози неусклађености модела и мере које предузимамо ради јачања наших система. Ову страницу ћемо ажурирати како истраге буду напредовале.


Активности које утичу на треће стране

Да бисмо боље разумели обим ових неочекиваних понашања, спроводимо опсежан преглед активности наших модела на интернету током обучавања и евалуације. У оквиру прегледа постепено идентификујемо и обавештавамо треће стране, почевши од случајева у којима:

  • Су наши модели можда заобишли безбедносне контроле треће стране или нарушили доступност онлајн услуге; или

  • Су случајеви неусклађености негативно утицали на веб-сајтове или услуге трећих страна.

На основу досадашњег прегледа обавестили смо десетине трећих страна према наведеним критеријумима. Наш преглед ранијих активности још траје и захтеваће много времена и ресурса. Како се тај рад буде настављао, обавештаваћемо и додатне треће стране.

У наставку објављујемо анонимизоване сажетке који описују врсте неусклађених активности које смо уочили, а те описе ћемо ажурирати како будемо обавештавали додатне треће стране и стицали нова сазнања. Поред тога, објављиваћемо релевантне новости о статусу прегледа. По правилу ћемо изостављати имена и друге податке за идентификацију када је то потребно ради заштите погођених страна, иако обавештене стране могу одлучити да јавно поделе информације које им доставимо.

Сажеци уочених активности

Досадашњи поступак прегледа и обавештавања утврдио је следеће категорије активности:

  • Заобилажење контроле приступа: Агенти приступају информацијама или функцијама које обично захтевају проверу идентитета, посебну дозволу, претплату или налог. На пример, агент је користио другу веб-адресу, мењао детаље у захтеву или се ослањао на сесију пријаве која му је омогућила већи приступ од очекиваног.

  • Употреба изложених акредитива: Агенти су пронашли јавно доступне податке за пријаву или приступне кључеве и употребили их за приступ услузи.

  • Убацивање упита или команди: Агенти су унели текст на веб-сајт или у услугу, а услуга га је протумачила као упутство уместо као обичан унос. То је могло довести до тога да услуга покрене упит базе података, програмски код или команду на свом серверу.

  • Приступ интерним деловима извршног окружења: Агенти су читали датотеке са имплементацијом услуге или комуницирали са позадинским системом намењеним интерној употреби. У тим случајевима агент је приступио деловима услуге који нису били обухваћени предвиђеним приступом.

  • Агентска нежељена пошта: Агенти објављују информације на сајтовима трећих страна, што може изменити њихов садржај и захтевати чишћење — на пример, коришћењем јавних вики-страница као заједничких огласних табли.


Хронологија догађаја

Септембар

Август

Јул