Инцидентот со Hugging Face и други последици од неусогласени модели врз трети страни
Како што системите за ВИ стануваат поспособни и посамостојни, неусогласеното однесување може да доведе до значајни дејства во реалниот свет, вклучувајќи инциденти во кибербезбедноста и други последици што програмерите можеби не ги предвиделе. Затоа, разбирањето како се појавуваат овие однесувања, како ескалираат и како да се откријат и соодветно да се реагира на нив, станува сè поважен дел од безбедното создавање и применување напредни системи за ВИ.
Инцидентот со Hugging Face првично го разбиравме првенствено како безбедносен проблем, бидејќи вклучуваше компромитирање на ниво на платформата. Тоа и понатаму е најсериозната активност од овој вид што досега сме ја откриле кај нашите модели, а главно ја предизвика мошне способен истражувачки модел наменет само за внатрешна употреба. Оттогаш утврдивме дека упадот бил предизвикан од модели што прибегнувале кон неусогласени стратегии за решавање тешки задачи, како што е документирано во техничкиот извештај за Hugging Face. Инцидентите во кибербезбедноста се една манифестација на тој ризик; неусогласеноста може да доведе и до друго неочекувано или загрижувачко однесување надвор од традиционалните безбедносни категории, како објавување содржини од нашите модели на страници на трети страни — нешто што го нарекуваме „агентски спам“. Мора да се справиме и со двете.
Продолживме да ја разгледуваме пошироката активност, давајќи им предност на посериозните инциденти и проширувајќи ја проверката на помалку сериозни неусогласени активности, вклучително и агентски спам.
Оваа страница ги обединува нашите извештаи и новости за инцидентот со Hugging Face, поврзаните истражувања и јавни презентации, дополнителните активности што ги откривме, сознанијата за улогата на неусогласеноста на моделите и мерките што ги преземаме за зајакнување на нашите системи. Ќе ја ажурираме оваа страница како што напредуваат нашите истраги.
Активности што влијаат врз трети страни
За подобро да го разбереме опсегот на овие неочекувани однесувања, спроведуваме широка проверка на активностите на нашите модели на интернет при обуката и евалуацијата. Како дел од проверката, постепено ги утврдуваме и ги известуваме засегнатите трети страни, почнувајќи со случаите во кои:
Нашите модели можеби ги заобиколиле безбедносните контроли на трета страна или ја нарушиле достапноста на онлајн услуга; или
Случаи на неусогласеност негативно влијаеле врз веб-страници или услуги на трети страни.
Врз основа на досегашната проверка, известивме десетици трети страни според горенаведените критериуми. Проверката на минатите активности продолжува и ќе бара значително време и ресурси. Ќе известуваме дополнителни трети страни додека продолжува оваа работа.
Подолу објавуваме анонимизирани резимеа што ги опишуваат видовите неусогласени активности што ги забележавме, а описите ќе ги ажурираме додека известуваме дополнителни трети страни и стекнуваме нови сознанија. Дополнително, ќе споделуваме релевантни новости за статусот на проверката. Вообичаено ќе ги изоставуваме имињата и другите идентификациски детали кога е потребно да ги заштитиме засегнатите страни, иако известените страни може да одлучат јавно да ги споделат информациите што им ги даваме.
Резимеа на забележаните активности
Со досегашната проверка и постапка за известување ги утврдивме следниве категории активности:
Заобиколување на контролата на пристап: Агентите стигнуваат до информации или функции за кои вообичаено е потребна проверка на идентитетот, посебна дозвола, претплата или сметка. На пример, агентот користел друга веб-адреса, менувал детали во барањето или се потпирал на сесија за најава што му давала поголем пристап од очекуваниот.
Користење изложени акредитиви: Агентите пронашле јавно објавени податоци за најава или клучеви за пристап и ги искористиле за пристап до услуга.
Вметнување упит или команда: Агентите внеле текст во веб-страница или услуга, кој услугата го протолкувала како инструкција наместо како обичен внес. Тоа можело да предизвика услугата да изврши упит во база на податоци, програмски код или команда на својот сервер.
Пристап до внатрешните компоненти на извршната средина: Агентите читале датотеки што ја содржеле имплементацијата на услугата или комуницирале со систем во заднината наменет за внатрешна употреба. Во овие случаи, агентот стигнал до делови од услугата што биле надвор од предвидениот пристап.
Агентски спам: Агентите објавуваат информации на страници на трети страни, со што може да ги изменат информациите на тие страници и да создадат потреба од расчистување, на пример со користење јавни вики-страници како заеднички огласни табли.