Lumaktaw sa pangunahing content
OpenAI

Setyembre 30, 2026

Seguridad

Pagpigil sa koordinadong kampanya ng distillation ng modelo

Naglo-load…

Kamakailan, natukoy at napigilan namin ang isang koordinadong kampanya na naglalayong kunin ang protektadong pangangatwiran ng aming mga modelo. Unang naobserbahan ang aktibidad na ito sa unang linggo ng Hulyo. Tumutugma ang aktibidad na ito sa adversarial distillation: ang sistematiko at hindi awtorisadong paggamit ng mga output o pangangatwiran ng isang modelo upang makatulong sa pagsasanay, paggaya, o pagpapahusay ng isa pang modelo. Ang protektadong pangangatwiran ay ang panloob na tala ng modelo habang nilulutas nito ang isang gawain. Maaaring mailantad ng pagkuha nito ang impormasyong hindi isinama sa pinal na sagot at matulungan ang iba na gayahin ang mga kakayahan ng modelo.

Hindi nabasag ng mga nagsagawa nito ang aming encryption, napasok ang isang database, o direktang na-access ang mga nakaimbak na pag-uusap ng mga user. Sa halip, minanipula nila ang mga pakikipag-ugnayan sa modelo upang mailabas ang protektadong pangangatwiran sa mga anyong nakikita ng humihiling. Ginawa nila ito nang koordinado at malawakan, na lumabag sa aming mga tuntunin ng serbisyo. Hindi lamang mga modelo ng OpenAI ang may kahinaang nagbibigay-daan sa ganitong manipulasyon. Nagbahagi kami ng impormasyon tungkol dito sa mga katuwang sa industriya sa pamamagitan ng Frontier Model Forum upang palakasin ang sama-samang depensa laban sa adversarial distillation.

Bago ito ilathala, inimbestigahan namin ang saklaw at posibleng epekto, ipinatupad ang sarili naming mga hakbang sa pag-iwas, at nagbahagi ng impormasyon at tumanggap ng puna mula sa mga mananaliksik at katuwang sa industriya upang matiyak na may mga proteksyon laban sa ganitong uri ng pag-atake. Patuloy ang karagdagang imbestigasyon at mga hakbang upang mabawasan ang panganib. Naniniwala kaming ang pagbabahagi ngayon ng aming mga natutuhan ay makatutulong sa mas malawak na ekosistema na palakasin ang mga depensa nito.

Ang aming naobserbahan

Nakita naming sinubukan ng mga nagsagawa nito na kunin ang protektadong pangangatwiran sa mga bagong paraan. Kabilang dito ang pagkopya ng naka-encrypt na pangangatwiran mula sa isang pag-uusap at paghiling sa isang modelo sa ibang pag-uusap na i-decrypt at isulat ang nakatagong nilalaman nito.

Ipinaalam din sa amin ng mga independiyenteng mananaliksik sa seguridad⁠(magbubukas sa bagong window) ang mga kaugnay na kahinaan sa pagitan ng mga modelo at sa compaction ng pag-uusap sa pamamagitan ng responsableng pagsisiwalat. Inimbestigahan namin ang kanilang mga natuklasan at nakumpirmang talagang posible ang mga paraan ng pag-atake na natukoy nila. Nakatulong ang kanilang pag-aaral upang maunawaan namin ang mas malawak na kategorya ng pag-atakeng ito at mapabilis ang mga hakbang sa pag-iwas.

Nagsimula ang aktibidad noong Hulyo 1, na kakaunti lamang sa simula. Noong Hulyo 24 at 25, naobserbahan namin ang biglang pagdami nito: 16,000 kahilingan1 mula sa mahigit 4,000 user, na gumagamit ng isang kaugnay na pattern ng pagkuha ng impormasyon. Sa karagdagang imbestigasyon, natukoy ang kaugnay na aktibidad na gumagamit ng mga pattern ng prompt sa isang grupo ng mahigit 15,000 user. Ganap namin itong napigilan pagsapit ng Hulyo 28.

Nagbago ang aktibidad sa paglipas ng panahon. Pinagtitibay nito na ang adversarial distillation ay isang mas malawak na hamon sa seguridad na nangangailangan ng maraming antas ng depensang kayang umangkop.

Ang aming pagtatasa kung sino ang nasa likod nito

Hindi malinaw kung iisang indibidwal o grupo ang nasa likod ng lahat ng nagsagawa ng aktibidad na naobserbahan namin sa panahong iyon. Gayunman, ayon sa aming pagtatasa, isang pangunahing kumpol ng aktibidad ang nagmula sa mga indibidwal na may kaugnayan sa Moonshot AI, ang developer ng Kimi.

Bakit ito mahalaga

Nagdudulot ang adversarial distillation ng mga panganib sa kaligtasan at pambansang seguridad. Maaaring gamitin ang nakuhang pangangatwiran upang sanayin ang isa pang modelo nang hindi pinananatili ang mga pananggalang na inilapat sa mga output ng orihinal na modelo na ipinapakita sa user. Kapag ginawa nang malawakan, maaari ring mapabilis ng distillation ang paglilipat ng mga advanced na kakayahan nang hindi nangangailangan ng katumbas na pamumuhunan sa kaligtasan. Mas tumitindi ang mga alalahaning ito habang nagkakaroon ang mga modelo ng mga kakayahan sa mga larangang maaaring gamitin kapwa sa kapaki-pakinabang at mapaminsalang paraan.

Hindi lamang OpenAI ang nahaharap sa panganib na ito. Gaya ng nabanggit sa itaas, maaaring makaapekto ang mga katulad na pamamaraan sa iba pang advanced na AI system. Kaya isa itong hamon sa seguridad na kinakaharap ng lahat at nangangailangan ng koordinasyon sa buong industriya.

Paano kami tumugon

Nilimitahan namin ang kamakailang kampanyang ito ng distillation sa pamamagitan ng pinagsamang pagpapatupad ng mga patakaran sa account, mga teknikal na kontrol, at pakikipag-ugnayan sa mga katuwang. Ipinagbawal o nilimitahan namin ang mga mapanlinlang na account, pinahigpit ang mga kontrol sa pagpaparehistro at imprastraktura, at pinalawak ang pagsubaybay sa mga kaugnay na network.

Pinalakas din namin ang mga proteksyon para sa nakatagong pangangatwiran sa lahat ng user, workspace, organisasyon, at pamilya ng modelo. Isinara namin ang isang paraang nagbibigay-daan sa sinumang may hawak na ng naka-encrypt na pangangatwiran ng ibang user na muling isumite ito at makuha ang nilalaman nito. Nagdagdag din kami ng mga pagsusuri upang matukoy at pigilang mailabas ang mga naka-stream na output na maaaring maglantad ng pangangatwiran. Nang lumipat sa mga serbisyo ng third party ang kaugnay na aktibidad, nakipagtulungan kami sa mga provider na iyon upang matukoy at mapigilan ang mga sangkot na account.

Panghuli, ibinahagi namin ang mga kaugnay na natuklasan sa pamamagitan ng Frontier Model Forum at mga angkop na daluyan ng pagbabahagi ng impormasyon sa pamahalaan. Sa ganitong paraan, matutukoy rin ng iba pang developer ng frontier na AI at mga katuwang sa pampublikong sektor ang katulad na aktibidad at mapalalakas ang sarili nilang mga depensa. Maaaring maharap sa mga kaugnay na panganib ang mga sistemang sumusuporta sa mga artifact ng pangangatwiran na naililipat o muling naisusumite.

Mga susunod na hakbang

Inaasahan naming magiging mas sopistikado ang mga pagtatangka sa adversarial distillation habang humuhusay ang mga frontier na modelo at naghahanap ang mga nagsasagawa nito ng mas murang paraan upang gayahin ang mga kakayahan ng mga modelo. Ang pagdepensa laban sa aktibidad na ito ay nangangailangan ng maraming antas ng kontrol at patuloy na pag-angkop.

Hindi pa tapos ang gawaing ito. Kailangan ng mga deployment na naka-host sa mga katuwang ang parehong proteksyon gaya ng mga serbisyong kami mismo ang nagpapatakbo. Para naman sa mga pag-atake sa pamamagitan ng output ng tool, kailangan ng mga proteksyong sumusuri sa higit pa sa karaniwang nakikitang teksto. Patuloy naming pinahuhusay ang mga depensa ng tool, saklaw ng classifier, at pagtanggi ng modelo sa mga kahilingan, at ipinapatupad ang mga kaugnay na kontrol sa lahat ng aming katuwang sa cloud.

Patuloy na tutuon ang aming tugon sa tatlong larangan: mas matibay na teknikal na proteksyon laban sa pagkuha ng protektadong impormasyon, mas mahusay na pagtukoy at pagpapatupad ng mga patakaran laban sa mga koordinadong kampanya, at mas malalim na pagbabahagi ng impormasyon tungkol sa mga banta sa pagitan ng industriya at pamahalaan.

May-akda

OpenAI

Mga talababa

  1. 1

    Tumutukoy ang mga bilang na ito sa mga pagtatangkang kumuha ng impormasyon, hindi sa mga tiyak na nagtagumpay.