Ruka hadi kwenye maudhui kuu
OpenAI

28 Septemba 2026

Usalama

Kuelekea hoja za kuthibitisha usalama wa mafunzo ya AI ya mpaka

Inapakia…

Tunaamini tunaingia katika enzi mpya ambapo nyaraka za usalama zilizoandaliwa kwa mpangilio maalumu zinapaswa kuhitajika kabla ya kuendelea na awamu yoyote ya mafunzo ya uimarishaji ya mpaka. Kwa hali bora, nyaraka hizo zingefikia kiwango cha “hoja za kuthibitisha usalama”—hoja za kina kuhusu hatari, zilizo na mpangilio maalumu na zinazotegemea ushahidi, zinazotumika katika sekta nyingine ambako usalama ni muhimu sana. Tunachukulia hoja za kuthibitisha usalama kuwa lengo linalotuongoza na tunalojitahidi kulifikia. Hata hivyo, tunatambua changamoto za kuzifanya ziwe thabiti kwa miundo ya AI kama zilivyo katika usafiri wa anga au nishati ya nyuklia, kutokana na utata mpya unaojitokeza katika kila kiwango kipya cha uwezo wa AI. Tunaandaa mfumo wa kuweka taratibu hizi katika miongozo rasmi.

Hapa chini kuna miongozo ya awali ambayo tunadhani inapaswa kuwa sehemu ya hoja hizo za kuthibitisha usalama wa mafunzo ya AI ya mpaka. Taratibu hizi bora zinaakisi tuliyojifunza kufikia sasa, na tunatarajia zibadilike tunapoendelea kuboresha michakato ya ndani ya kuendeleza AI kwa uangalifu. Tunazishiriki sasa ili kuweka wazi mtazamo wetu wa sasa na kukaribisha maoni kutoka kwa jamii. Kumbuka kuwa hati hii inalenga mafunzo ya uimarishaji ya mpaka; matumizi ya ndani na ya nje yanahitaji kuzingatia vipengele vingi zaidi vya ulinganifu na malengo.

1. Kinga za kiufundi

Hoja za kuthibitisha usalama zinapaswa kushughulikia vipengele vitatu vya mfumo wa kiufundi: mafunzo ya ulinganifu na malengo, udhibiti ndani ya mipaka na ufuatiliaji. Kinga hizi husaidia kuhakikisha kuwa muundo haujaribu kuchukua hatua zisizolingana na malengo, na kwamba hata ukijaribu, itakuwa vigumu kuvuka mipaka ya udhibiti, na ufuatiliaji utagundua hilo kabla ya madhara kutokea.

  • Ulinganifu wa muundo na malengo: Hatua ya kwanza ya kujilinda inapaswa kuwa kuifundisha miundo ilingane na malengo; yaani, itende kwa kutegemewa kwa njia tunazokusudia. Hii inaweza kujumuisha:

    • Mazingira ya mafunzo na utoaji alama: Punguza hatari ya miundo kukuza tabia zisizolingana na malengo kwa kuzuia uimarishaji wa tabia za kupata zawadi kwa ujanja wakati wa mafunzo. Hii inaweza kujumuisha:

      • Ukaguzi wa kiotomatiki wa seti za data: Tumia mawakala kutafuta na kurekebisha mazingira ya RL yenye hitilafu yanayoweza kuruhusu misururu ya hatua zisizolingana na malengo kupata zawadi kubwa kwa kutumia mianya badala ya tabia iliyokusudiwa. Hii itapunguza fursa za kuimarisha kutolingana na malengo wakati wa mafunzo.

      • Ukaguzi wa seti za data unaofanywa na binadamu: Ongeza ukaguzi wa binadamu na uhakiki wa ubora wa seti za data kwenye jaribio la kubaini udhaifu wa mfumo linalofanywa kiotomatiki, ili kutambua kazi zenye dosari zinazoweza kuimarisha bila kukusudia tabia zisizolingana na malengo.

      • Kurekebisha watoaji alama: Rekebisha watoaji alama ili waadhibu majaribio ya muundo ya kutumia mianya au kuvuruga mazingira ya RL wakati wa mafunzo.

      • Uchambuzi wa awamu zilizopita: Tumia mifumo ya uainishaji kuchanganua rekodi za hatua kutoka majaribio ya awali, ili kuhakikisha watoaji alama wanafanya kazi kama ilivyokusudiwa.

    • Kupima ulinganifu na malengo: Fanya tathmini zinazofuatilia mielekeo ya muundo ya kutolingana na malengo ili kupima ufanisi wa mafunzo ya ulinganifu. Hii inaweza kujumuisha:

      • Tathmini za ulinganifu nje ya mfumo unaoendelea kufanya kazi: Fanya tathmini za ulinganifu wakati wa awamu za mafunzo ya mpaka ili kutathmini kama mafunzo yanafanya kazi iliyokusudiwa, na uchunguze kuzorota kokote kwa kiwango kikubwa.

      • Upimaji kwa kutumia matukio ya zamani: Pima tathmini za ulinganifu kwa kutumia matukio yaliyopita ili kuthibitisha kuwa zinagundua miundo ambayo hapo awali haikulingana na malengo, na hazijarekebishwa kupita kiasi kulenga matukio maalumu pekee.

      • Kufuatilia ujanja wa kupita tathmini: Fuatilia utambuzi wa tathmini au ujanja unaotumia maarifa kuhusu jaribio lenyewe (miundo kutambua kwamba inapimwa), ambao unaweza kusababisha mabadiliko ya tabia. Kwa mfano, washa vifuatiliaji vya utambuzi wa tathmini na ujanja huo kwenye tathmini za ulinganifu, ukiweka viwango maalumu vya kuchochea uzuiaji.

      • Majaribio ya hali mbaya zaidi: Chochea tabia mbaya zaidi zinazoweza kutokea na uhakikishe kuwa angalau tathmini moja inaweza kuzigundua.

    • Kuzuia mafunzo yanayotegemea msururu wa mawazo: Usiruhusu watoaji alama wa kiotomatiki kuona msururu wa mawazo katika mafunzo ya uimarishaji, ili kuzuia miundo kujibadilisha na kukwepa vifuatiliaji vya msururu wa mawazo.

  • Udhibiti ndani ya mipaka: Muundo ukikosa kulingana na malengo, hakikisha utengaji wake katika mazingira yaliyofungwa na hatua za ulinzi ni thabiti vya kutosha kuzuia vitendo vyenye madhara. Hii inaweza kujumuisha:

    • Tabaka nyingi za ulinzi wa miundombinu: Wekeza kwa kiasi kikubwa katika kuimarisha mazingira yaliyofungwa ambamo muundo unaendeshwa pamoja na miundombinu ya utafiti inayoyahifadhi, ili kuhakikisha tuna tabaka la ziada la ulinzi iwapo muundo utatoroka mazingira hayo.

    • Jaribio la kubaini udhaifu wa mfumo wa udhibiti ndani ya mipaka: Imarisha ulinzi wa mazingira yaliyofungwa, miundombinu ya utafiti na mipaka ya nje kwa kurudia majaribio ya kubaini udhaifu wa mfumo ukitumia matoleo ya miundo yaliyohifadhiwa katika hatua mbalimbali za awamu za mafunzo ya mpaka, kwa kuzingatia uchambuzi wa usalama, ili kutafuta na kuziba mianya yoyote. Pia jaribu kubaini udhaifu wa huduma zote ambazo muundo unaweza kufikia wakati wa mafunzo (kwa mfano, akiba ya muda ya intaneti).

    • Mawasiliano kati ya sampuli: Ruhusu mawasiliano ya ujazo mkubwa kati ya sampuli kupitia njia zilizoidhinishwa pekee, kama vile zana za mawakala wengi, na ufunge njia za pembeni za miundombinu zenye ujazo mkubwa ambazo mawakala wanaweza kugundua kwa urahisi.

    • Nakala za mazungumzo zisizoweza kubadilishwa: Hifadhi nakala za mazungumzo ya mawakala kwa muda unaofaa bila uwezekano wa kuzibadilisha (kwa mfano, katika akaunti za hifadhi zinazoruhusu kuandika mara moja tu), kwa mafunzo yote ya RL, tathmini na matumizi ya ndani. Hii itawezesha uchunguzi wa matukio unaotegemewa na kuzuia uhariri usiokusudiwa.

  • Ufuatiliaji: Miundo ikianza kuchukua hatua zisizolingana na malengo, kuwe na mfumo wa ufuatiliaji wa wakati halisi wa kubaini dalili zozote za kutolingana na malengo na kushughulikia haraka masuala ya kipaumbele kabla ya tukio kubwa kutokea. Hii inaweza kujumuisha:

    • Kuhakikisha uwezekano wa kufuatilia: Hakikisha miundo inaendelea kuwa na uwezo wa kufuatiliwa, unaopimwa kwa tathmini za uwezekano wa kuifuatilia na za ukwepaji wa vifuatiliaji, zenye viwango wazi, ili kubaini mapema tabia zinazotia wasiwasi.

    • Ugunduzi wa sehemu kubwa ya matatizo yanayojulikana: Hakikisha mfumo wa ufuatiliaji unagundua sehemu kubwa ya matukio ya zamani katika tathmini iliyotengwa na isiyotumika kufundisha mfumo.

    • Kusasisha tathmini za vifuatiliaji: Unda mifano ya data ya tathmini inayowakilisha hatari mpya kabisa kwa awamu mpya, ili vipimo vya kiwango cha ugunduzi na usahihi wa vifuatiliaji visiwe vimepitwa na wakati.

    • Kuchukua hatua haraka: Tekeleza arifa za kipaumbele zinazosababisha hatua kuchukuliwa ndani ya muda uliowekwa katika SLA, kwa kumtumia mhudumu wa zamu arifa ya dharura au kusitisha kiotomatiki awamu iliyoathirika, kabla muundo haujasababisha madhara. Kwa mfano, waarifu mhudumu wa ulinzi wa zamu na msimamizi wa awamu kuhusu matukio ya mchana, na usitishe kiotomatiki awamu zenye arifa ambazo hazijathibitishwa kupokelewa usiku.

2. Miongozo ya utendaji

Pamoja na mapendekezo kuhusu kinga za kiufundi, tumekuwa tukiandaa taratibu bora za utendaji zinazohusu hoja za kuthibitisha usalama wa awamu ya mafunzo ya AI ya mpaka. Taratibu hizi zinaweza kujumuisha:

  • Maoni pinzani (uchambuzi wa mapema wa yanayoweza kwenda vibaya): Baada ya hoja za kuthibitisha usalama kuandaliwa, mshiriki wa timu nyingine anapaswa kuandika maoni pinzani ili kubaini mianya inayoweza kuwepo katika hoja hizo na kutoa mtazamo kuhusu hatari unaolingana na ushahidi uliopo. Timu ya mafunzo inapaswa kisha kushughulikia maoni hayo ili kuimarisha hoja za usalama.

  • Uidhinishaji: Hoja za kuthibitisha usalama zinapaswa kukaguliwa na viongozi waandamizi, ambao kila mmoja anapaswa kuwa na mamlaka ya kuzuia awamu ya mafunzo. Hii itahakikisha kuwa awamu hiyo inapitia ukaguzi wa ndani katika ngazi kadhaa (kwa mfano, mkuu wa kitengo cha utafiti / makamu wa rais, Mkuu wa Usalama na Mwanasayansi Mkuu).

  • Uwajibikaji: Kiongozi mwandamizi anayesimamia awamu ya mafunzo (kwa mfano, mkuu wa kitengo cha utafiti / makamu wa rais wa utafiti) anapaswa kuwajibikia hoja za kuthibitisha usalama na hatua zozote za kushughulikia matukio, ikiwemo katika tathmini za utendaji wake. Hii itahimiza timu za mafunzo pia kusukuma mbele usalama na ulinganifu na malengo yaliyokusudiwa.

  • Kusitisha kwa muda: Iwapo kutagunduliwa matatizo yanayobatilisha hoja za usalama (kwa mfano, tatizo jipya la ulinzi), hakikisha kuna miongozo ya hatua za utekelezaji, vidhibiti vya kiufundi na makubaliano ya kiwango cha huduma (SLA) ya kusitisha kwa muda awamu zote zinazohusika.

  • Uwazi wa ndani: Hoja za kuthibitisha usalama zinapaswa kupatikana kwa vikundi vya ndani vya usimamizi (kwa mfano, Kamati ya Usalama na Ulinzi).

  • Ukaguzi: Wakaguzi wanapaswa kupewa ufikiaji wa kutosha ili kuthibitisha kuwa madai yaliyomo katika hoja za usalama ni halali na yana msingi thabiti, na kuripoti mapengo wakiyapata.

  • Kuwasilisha masuala kwa ngazi za juu: Kunapaswa kuwa na utaratibu wazi wa kuwasilisha masuala ya kutolingana na malengo kwa ngazi za juu, jedwali linalofafanua viwango vya ukali wa masuala hayo, na mhudumu wa zamu anayeweza kuwatumia viongozi wakuu (kwa mfano, Mkurugenzi Mtendaji) arifa za dharura awamu inapofikia kiwango fulani cha ukali.

  • Vidhibiti vya kiufundi: Inapaswa kuwa vigumu kwa binadamu na mawakala kuanzisha awamu zisizotii masharti. Vipengele vya usalama kama vile ufuatiliaji na kusitisha kiotomatiki vinapaswa kuzuia shughuli endapo vitashindwa kufanya kazi. Kwa mfano, isiwezekane kuanzisha awamu bila ufuatiliaji unaofaa kuwashwa, au kuzima kifuatiliaji kutoka ndani ya mafunzo ya RL, tathmini au mfumo uliotumika ndani ya shirika.

  • Uwezo wa kutengua mabadiliko: Inapaswa kuwa rahisi kutambua matumizi yote ya baadaye ya muundo usiolingana na malengo katika mchakato wa mafunzo (kwa mfano, kuzalisha data au kutoa alama), ili kuwezesha kutengua athari za matokeo yasiyolingana na malengo ikihitajika.

  • Ukamilifu wa orodha ya hatari zilizobaki: Hoja za kuthibitisha usalama zinapaswa kuorodhesha kwa ukamilifu kadiri iwezekanavyo hatari zilizobaki ambazo hazijashughulikiwa na hatua za kupunguza hatari zilizotekelezwa sasa, ili maamuzi ya kukubali hatari yafanywe kwa ufahamu.

Haya ndiyo mapendekezo yetu ya sasa, na yanaendelea kutekelezwa katika OpenAI. Tunatarajia taratibu zetu ziendelee kubadilika katika wiki zijazo.

3. Uchunguzi wa matukio ya kutolingana na malengo

Pia tumekuwa tukiandaa taratibu bora za kuchunguza matukio makubwa ya AI kutolingana na malengo. Maabara zinapaswa kujitahidi kujifunza mengi iwezekanavyo kutokana na kila tukio (kama ilivyo kwa taratibu za uchunguzi⁠(fungua katika dirisha jipya) katika sekta nyingine ambako makosa yanaweza kuwa na athari kubwa) ili kuzuia matukio kama hayo siku zijazo. Mifano ya hatua hizo inaweza kujumuisha:

  • Uwazi wa ndani: Kwa kuwa uchunguzi unaweza kuchukua muda mrefu kukamilika, taarifa za maendeleo ya uchunguzi wa matukio zinapaswa kutolewa ndani ya shirika mara kwa mara (kwa mfano, taarifa za kila siku kuhusu uchunguzi unaoendelea). Wafanyakazi wanapaswa kuwa na njia zilizowekwa za kupata ufikiaji zaidi, ikiwemo nakala halisi za mazungumzo na uwezo wa kupata sampuli za matokeo kutoka kwa miundo isiyolingana na malengo, iwapo ni salama na vinahusiana na kazi zao.

  • Chanzo cha kutolingana na malengo: Watafiti wanapaswa kubaini chanzo katika mienendo ya mafunzo (kwa mfano, kupitia majaribio ya kuondoa vipengele maalumu au ya kuchukua sampuli upya) ili kuelewa jinsi tabia zisizolingana na malengo zilivyojitokeza. Hii itasaidia kuelewa zaidi sayansi ya kutolingana na malengo na kuboresha uzuiaji wake siku zijazo.

  • Uchambuzi baada ya tukio: Uchambuzi wa utendaji na utamaduni wa shirika unapaswa kufanywa baada ya tukio ili kuelewa sababu zote zilizochangia, kama vile kwa nini matatizo yaliibuka na hayakugunduliwa wala kuwasilishwa kwa ngazi za juu kabla ya tukio.

  • Ugunduzi: Tunapaswa kuunda mbinu za kupima ulinganifu na malengo zinazoweza kubaini mwelekeo wa kusababisha tukio hilo, bila kuziboresha moja kwa moja kwa kutegemea taarifa zilizotokana na tukio (kwa mfano, nakala za mazungumzo au muhtasari wa tukio). Tathmini zinazotokana na matukio zinapaswa kuundwa kama “majaribio ya kubaini kurejea kwa matatizo”, ili kuhakikisha miundo ya baadaye haionyeshi mwelekeo wa kutolingana na malengo katika matukio yanayofanana sana.

  • Taarifa kwa umma: Matokeo ya uchunguzi, uchambuzi wa baada ya tukio na mabadiliko ya utendaji yanapaswa kutangazwa kwa umma baada ya uchunguzi kukamilika. Wahusika wa nje walioathirika wanapaswa kuarifiwa haraka iwezekanavyo.

Mwandishi

OpenAI