Aqbeż għall-kontenut prinċipali
OpenAI

30 ta’ Settembru 2026

Sigurtà

Tfixkil ta’ kampanja kkoordinata ta’ distillazzjoni tal-mudelli

Qed jillowdja…

Dan l-aħħar identifikajna u waqqafna kampanja kkoordinata mfassla biex tislet raġunament protett mill-mudelli tagħna. L-ewwel attività li osservajna seħħet fl-ewwel ġimgħa ta’ Lulju. Din l-attività hija konsistenti mad-distillazzjoni avversarja: l-użu sistematiku u mhux awtorizzat tar-riżultati jew tar-raġunament ta’ mudell biex jgħin fit-taħriġ, fir-riproduzzjoni jew fit-titjib ta’ mudell ieħor. Ir-raġunament protett huwa r-rekord intern tal-mudell tal-proċess biex iwettaq kompitu; l-estrazzjoni tiegħu tista’ tiżvela informazzjoni li ma tkunx ingħatat fit-tweġiba finali u tgħin lil oħrajn jirriproduċu l-kapaċitajiet tal-mudell.

L-operaturi ma kisrux il-kriptaġġ tagħna, ma kkompromettewx bażi tad-data u lanqas kisbu aċċess dirett għal konversazzjonijiet maħżuna tal-utenti. Minflok, immanipulaw l-interazzjonijiet mal-mudelli biex ir-raġunament protett ikun jista’ jiġi riprodott f’forom viżibbli għal min jagħmel it-talba, b’mod ikkoordinat u fuq skala kbira li kiser it-termini tas-servizz tagħna. Din il-manipulazzjoni mhijiex vulnerabbiltà li teżisti biss fil-mudelli ta’ OpenAI, u qsamna informazzjoni dwarha ma’ sħab fl-industrija permezz tal-Frontier Model Forum biex insaħħu d-difiżi kollettivi kontra d-distillazzjoni avversarja.

Qabel il-pubblikazzjoni, investigajna l-firxa u l-impatt potenzjali, implimentajna l-miżuri ta’ mitigazzjoni tagħna stess, u qsamna informazzjoni ma’ riċerkaturi u sħab fl-industrija u qiesna r-rispons tagħhom biex niżguraw li jkun hemm protezzjonijiet kontra dan it-tip ta’ attakk. Għaddejja aktar ħidma ta’ mitigazzjoni u investigazzjoni. Nemmnu li jekk naqsmu issa dak li tgħallimna, ngħinu lill-ekosistema usa’ ssaħħaħ id-difiżi tagħha.

Dak li osservajna

Rajna operaturi jippruvaw jisiltu raġunament protett b’modi ġodda, fosthom billi jikkopjaw raġunament kriptat minn konversazzjoni waħda u jitolbu mudell f’konversazzjoni oħra jiddekripta u jittraskrivi l-kontenut tar-raġunament moħbi.

Riċerkaturi indipendenti tas-sigurtà⁠(jinfetaħ f’tieqa ġdida) ġibdulna wkoll għall-attenzjoni, permezz ta’ divulgazzjoni responsabbli, vulnerabbiltajiet relatati li jinvolvu mudelli differenti u l-kompattazzjoni tal-konversazzjonijiet. Investigajna s-sejbiet tagħhom u kkonfermajna li l-mogħdijiet ta’ attakk li identifikaw kienu reali. Il-ħidma tagħhom għenitna nifhmu l-kategorija usa’ ta’ attakki u nħaffu l-miżuri ta’ mitigazzjoni.

L-attività bdiet fl-1 ta’ Lulju, inizjalment b’volum baxx, sakemm osservajna żidiet qawwija fl-24 u l-25 ta’ Lulju: 16,000 talba1 minn aktar minn 4,000 utent li użaw mudell rilevanti ta’ estrazzjoni. Aktar investigazzjoni identifikat attività relatata b’xejriet ta’ prompts fost grupp ta’ aktar minn 15,000 utent. Sat-28 ta’ Lulju konna waqqafna din l-attività għalkollox.

L-attività evolviet maż-żmien, u dan saħħaħ il-konklużjoni li d-distillazzjoni avversarja hija sfida usa’ għas-sigurtà li teħtieġ difiżi b’diversi saffi u li jadattaw.

Il-valutazzjoni tagħna ta’ min kien responsabbli

Mhuwiex ċar jekk l-operaturi kollha li osservajna matul il-perjodu rilevanti kinux ġejjin minn entità waħda. Madankollu, nattribwixxu grupp ċentrali ta’ din l-attività lil individwi assoċjati ma’ Moonshot AI, l-iżviluppatur ta’ Kimi.

Għaliex dan huwa importanti

Id-distillazzjoni avversarja toħloq riskji għas-sikurezza u għas-sigurtà nazzjonali. Ir-raġunament estratt jista’ jintuża biex jitħarreġ mudell ieħor mingħajr ma jinżammu s-salvagwardji applikati għar-riżultati tal-mudell oriġinali li jintwerew lill-utent. Fuq skala kbira, id-distillazzjoni tista’ wkoll tħaffef it-trasferiment ta’ kapaċitajiet avvanzati mingħajr ma teħtieġ l-istess investiment fis-sikurezza. Dan it-tħassib jiżdied hekk kif il-mudelli jiksbu kapaċitajiet f’oqsma ta’ użu doppju.

Dan ir-riskju mhuwiex limitat għal OpenAI. Kif issemma hawn fuq, tekniki simili jistgħu jaffettwaw sistemi avvanzati oħra tal-IA, u għalhekk din hija sfida komuni għas-sigurtà li teħtieġ koordinazzjoni fl-industrija kollha.

Kif irrispondejna

Mitigajna din il-kampanja reċenti ta’ distillazzjoni permezz ta’ taħlita ta’ infurzar tar-regoli fuq il-kontijiet, kontrolli tekniċi u koordinazzjoni mas-sħab. Imblukkajna jew illimitajna kontijiet frodulenti, saħħaħna l-kontrolli tar-reġistrazzjoni u tal-infrastruttura, u wessajna l-monitoraġġ biex nidentifikaw netwerks relatati.

Saħħaħna wkoll il-protezzjonijiet għar-raġunament moħbi fost l-utenti, l-ispazji tax-xogħol, l-organizzazzjonijiet u l-familji ta’ mudelli. Għalaqna mogħdija li kienet tippermetti lil min diġà kellu r-raġunament kriptat ta’ utent ieħor jerġa’ jissottomettih u jirkupra l-kontenut tiegħu. Żidna wkoll kontrolli biex jidentifikaw u jżommu lura riżultati trażmessi bi streaming li jistgħu jikxfu r-raġunament. Meta attività relatata għaddiet minn servizzi ta’ partijiet terzi, ħdimna ma’ dawk il-fornituri biex nidentifikaw il-kontijiet involuti u nwaqqfu l-attività tagħhom.

Fl-aħħar nett, qsamna s-sejbiet rilevanti permezz tal-Frontier Model Forum u tal-kanali governattivi xierqa għall-qsim tal-informazzjoni, sabiex żviluppaturi oħra tal-mudelli l-aktar avvanzati u sħab fis-settur pubbliku jkunu jistgħu jfittxu attività simili u jsaħħu d-difiżi tagħhom stess. Sistemi li jappoġġjaw artefatti ta’ raġunament li jistgħu jiġu trasferiti jew sottomessi mill-ġdid jistgħu jiffaċċjaw riskji relatati.

X’jiġi wara

Nistennew li t-tentattivi ta’ distillazzjoni avversarja jsiru aktar sofistikati hekk kif jitjiebu l-mudelli l-aktar avvanzati u l-atturi jfittxu modi orħos biex jimitaw il-kapaċitajiet tagħhom. Id-difiża kontra din l-attività teħtieġ kontrolli b’diversi saffi u adattament kontinwu.

Din il-ħidma għadha ma ntemmitx. L-implimentazzjonijiet ospitati mis-sħab jeħtieġu l-istess protezzjonijiet bħas-servizzi tagħna stess, u l-attakki permezz tar-riżultati tal-għodod jeħtieġu protezzjonijiet li jeżaminaw aktar mit-test viżibbli ordinarju. Qed inkomplu ntejbu d-difiżi tal-għodod, il-kopertura tal-klassifikaturi u r-rifjuti tal-mudelli, kif ukoll nestendu l-kontrolli rilevanti għas-sħab kollha tagħna fis-servizzi tal-cloud.

Ir-rispons tagħna se jkompli jiffoka fuq tliet oqsma: protezzjonijiet tekniċi aktar b’saħħithom kontra l-estrazzjoni, identifikazzjoni u infurzar aħjar kontra kampanji kkoordinati, u qsim aktar estensiv ta’ informazzjoni dwar it-theddid bejn l-industrija u l-gvern.

Awtur

OpenAI

Noti f’qiegħ il-paġna

  1. 1

    Dawn iċ-ċifri jirreferu għal tentattivi ta’ estrazzjoni, mhux neċessarjament għal estrazzjonijiet li rnexxew.