Lumaktaw sa pangunahing content
OpenAI

Ang insidente sa Hugging Face at iba pang epekto sa mga ikatlong partido mula sa mga modelong hindi nakaayon

Habang nagiging mas may kakayahan at nagsasarili ang mga AI system, ang pag-uugaling hindi nakaayon sa layunin ay maaaring humantong sa mga pagkilos na may malalaking kahihinatnan sa totoong mundo, kabilang ang mga insidente sa cybersecurity at iba pang kinalabasang maaaring hindi inasahan ng mga developer. Samakatuwid, ang pag-unawa kung paano umuusbong ang mga pag-uugaling ito, kung paano lumalala ang mga ito, at kung paano matukoy at matugunan ang mga ito ay lalong mahalagang bahagi ng ligtas na pagbuo at pagpapatupad ng mga advanced na AI system.

Noong una, pangunahing naunawaan namin ang insidente sa Hugging Face bilang isang isyu sa seguridad, dahil nasangkot dito ang pagkakompromiso ng plataporma. Nananatili itong pinakamalubhang aktibidad ng ganitong uri na natukoy namin mula sa aming mga modelo hanggang sa kasalukuyan, at pangunahing dulot ito ng isang napakahusay na internal-only na modelo para sa pananaliksik. Mula noon, naunawaan namin na ang panghihimasok na ito ay dulot ng mga modelo na gumagamit ng hindi naaayon na mga estratehiya upang lutasin ang mahihirap na gawain, gaya ng nakadokumento sa teknikal na ulat ng Hugging Face. Ang mga insidente sa cybersecurity ay isang pagpapakita ng panganib na iyon; ang hindi pagkakatugma ay maaari ring humantong sa iba pang hindi inaasahan o nakakabahalang pag-uugali na hindi saklaw ng mga tradisyonal na kategorya ng seguridad, tulad ng pagpo-post ng aming mga modelo sa mga site ng ikatlong partido—na tinatawag naming “agent spam”. At kailangan nating tugunan ang dalawang ito.

Ipinagpatuloy namin ang pagsusuri sa mas malawak na aktibidad, inuuna ang mas malulubhang insidente at pinalalawak ito upang masaklaw ang hindi nakaayon na aktibidad na may mas mababang antas ng kalubhaan, kabilang ang spam ng agent.

Pinagsasama-sama ng pahinang ito ang aming mga ulat at update tungkol sa insidente sa Hugging Face, kaugnay na pananaliksik at mga pampublikong presentasyon, karagdagang aktibidad na aming natukoy, mga natutuhan namin tungkol sa papel ng hindi pagkakatugma ng modelo, at mga hakbang na ginagawa namin upang palakasin ang aming mga sistema. Ia-update namin ang pahinang ito habang umuusad ang aming mga imbestigasyon.


Aktibidad na nakakaapekto sa mga ikatlong partido

Upang mas maunawaan ang lawak ng mga hindi inaasahang pag-uugaling ito, nagsasagawa kami ng malawakang pagsusuri sa mga aktibidad ng aming mga modelo sa internet sa panahon ng pagsasanay at pagsusuri. Bilang bahagi ng aming pagsusuri, unti-unti naming tinutukoy at inaabisuhan ang mga ikatlong partido, simula sa mga kasong kung saan:

  • Maaaring nalampasan ng aming mga modelo ang mga kontrol sa seguridad ng ikatlong partido o maaaring naapektuhan ng mga ito ang pagiging available ng isang online na serbisyo; o

  • Ang mga kaso ng hindi pagkakaayon ay nagdulot ng negatibong epekto sa mga website o serbisyo ng ikatlong partido.

Batay sa aming pagsusuri hanggang sa kasalukuyan, nagbigay kami ng abiso sa dose-dosenang ikatlong partido gamit ang mga pamantayang nabanggit sa itaas. Patuloy ang aming pagsusuri sa nakaraang aktibidad at mangangailangan ito ng malaking oras at mga mapagkukunan. Mag-aabiso kami sa mga karagdagang ikatlong partido habang nagpapatuloy ang gawaing iyon.

Sa ibaba, naglalathala kami ng mga hindi nagpapakilalang buod para ilarawan ang mga uri ng hindi naaangkop na aktibidad na aming naobserbahan, at ia-update namin ang mga paglalarawang ito habang nag-aabiso kami sa iba pang mga ikatlong partido at habang umuunlad ang aming pag-unawa. Bukod dito, magbabahagi kami ng mga kaugnay na update hinggil sa katayuan ng pagsusuri. Karaniwan naming hindi isasama ang mga pangalan at iba pang detalyeng nagpapakilala kung kinakailangan upang maprotektahan ang mga apektadong partido, bagama't maaaring piliin ng mga partidong nabigyan ng impormasyon na ibahagi sa publiko ang impormasyong ibinibigay namin sa kanila.

Mga Buod ng mga Aktibidad na Naobserbahan

Natukoy ng aming pagsusuri at proseso ng pagbibigay ng abiso sa ngayon ang mga sumusunod na kategorya ng aktibidad:

  • Pag-bypass sa access control: Nakaka-access ang mga agent sa impormasyon o mga feature na karaniwang nangangailangan ng pagpapatunay ng pagkakakilanlan, partikular na pahintulot, subscription, o account. Halimbawa, gumamit ito ng ibang web address, binago ang mga detalye sa isang request, o umasa sa login session na nagbigay rito ng mas maraming access kaysa sa inaasahan.

  • Paggamit ng mga nalantad na kredensyal: Nakakita ang mga agent ng mga detalye sa pag-log in o mga access key na ginawang available sa publiko at ginamit ang mga ito para ma-access ang isang serbisyo.

  • Pag-inject ng query o command: Naglagay ang mga agent ng text sa isang website o serbisyo na itinuring ng serbisyo bilang isang instruksyon, sa halip na karaniwang input. Maaari itong maging dahilan para magpatakbo ang serbisyo ng database query, application code, o command sa server nito.

  • Access sa runtime internals: Nagbasa ang mga agent ng mga file na naglalaman ng implementasyon ng isang serbisyo o nakipag-ugnayan sa isang background system na nakalaan para sa internal na paggamit. Sa mga kasong ito, naabot ng agent ang mga bahagi ng serbisyo na lampas sa nilalayong access nito.

  • Spam ng agent: Nagpo-post ang mga agent ng impormasyon sa mga site ng ikatlong partido na maaaring magbago ng impormasyon sa mga site na iyon at mangailangan ng paglilinis, kabilang halimbawa ang paggamit ng mga pampublikong pahina ng wiki bilang mga pinagsasaluhang message board.


Isang timeline ng mga pangyayari

Setyembre

Agosto

Hulyo