Негізгі мазмұнға өту
OpenAI

2026 ж. 28 қыркүйек

Қауіпсіздік

Озық ЖИ-ді оқытудың қауіпсіздігін негіздеу жолында

Жүктелуде…

Біздіңше, кез келген озық модельді күшейтпелі оқыту барысын жалғастырмас бұрын, қауіпсіздік жөніндегі құрылымды құжаттама талап етілетін жаңа дәуірге қадам басып келеміз. Дұрысы, мұндай құжаттама «қауіпсіздік негіздемелері» деңгейіне жетуі тиіс. Бұл — қауіпсіздігі аса маңызды басқа салаларда қолданылатын, тәуекел туралы жан-жақты, құрылымды әрі дәлелдерге сүйенген дәйектемелер. Қауіпсіздік негіздемелерін біз жетуге ұмтылатын басты бағдар деп санаймыз. Сонымен бірге ЖИ мүмкіндіктерінің әр жаңа деңгейінде туындайтын күрделілік салдарынан, оларды ЖИ модельдері үшін авиациядағы немесе атом энергетикасындағыдай қатаң талаптарға сай жасау қиын екенін мойындаймыз. Осы тәжірибелерді жүйелеп бекітетін тұғырнаманы әзірлеп жатырмыз.

Төменде озық ЖИ-ді оқытудың қауіпсіздік негіздемелеріне кіруі тиіс деп санайтын бастапқы нұсқаулар берілген. Бұл үздік тәжірибелер осы уақытқа дейін үйренгенімізді көрсетеді. ЖИ-ді сақтықпен әзірлеуге арналған ішкі процестерді жетілдірген сайын, олар да өзгеріп отырады деп күтеміз. Қазіргі ұстанымымызды ашық көрсету және қауымдастықтың пікірін білу үшін оларды қазір жариялап отырмыз. Бұл құжат озық модельдерді күшейтпелі оқытуға бағытталғанын ескеріңіз. Ал ішкі және сыртқы қолданысқа енгізу кезінде мақсаттарға сәйкестіктің әлдеқайда кең ауқымды қасиеттерін қарастыру қажет.

1. Техникалық қорғаныс шаралары

Қауіпсіздік негіздемелері техникалық жүйенің үш қырын қамтуы керек: мақсаттарға сәйкестікке оқыту, оқшаулау және бақылау. Бұл қорғаныс шаралары модельдің мақсаттарға сай емес әрекеттерге ұмтылмауын қамтамасыз етуге көмектеседі. Ұмтылған күннің өзінде, оқшаулаудан шығуы қиын болуы, ал бақылау жүйесі оны зиян келтірмей тұрып анықтауы тиіс.

  • Модельдің мақсаттарға сәйкестігі: Қорғаныстың бірінші шебі — модельдерді мақсаттарға сай болуға, яғни біз көздегендей сенімді әрекет етуге оқыту. Оған мыналар кіруі мүмкін:

    • Оқыту орталары және бағалау: Оқыту кезінде сыйақы жүйесін айламен пайдалануды оң ынталандыруға жол бермей, модельдерде мақсаттарға сай емес мінез-құлық қалыптасу қаупін азайту. Оған мыналар кіруі мүмкін:

      • Деректер жиынтықтарын автоматты тексеру: Көзделген мінез-құлықтың орнына осалдықтарды пайдаланып, мақсаттарға сай емес әрекеттер тізбегі үшін жоғары сыйақы алуға мүмкіндік беретін ақаулы күшейтпелі оқыту орталарын агенттер арқылы тауып, түзету. Бұл оқыту кезінде мақсаттарға сай емес әрекеттерді бекіту мүмкіндігін азайтады.

      • Деректер жиынтықтарын қолмен тексеру: Мақсаттарға сай емес мінез-құлықты байқаусызда бекітіп жіберуі мүмкін ақаулы тапсырмаларды анықтау үшін автоматтандырылған редтимингті деректер жиынтықтарын қолмен тексеру және сапаны бақылаумен толықтыру.

      • Бағалағыштарды баптау: Оқыту кезінде модельдің күшейтпелі оқыту орталарындағы осалдықтарды пайдалану не оларды бұзу әрекеттеріне айыптық баға қоятындай етіп бағалағыштарды баптау.

      • Бұрынғы оқыту барысын талдау: Бағалағыштардың көзделгендей жұмыс істейтінін тексеру үшін алдыңғы эксперименттердің әрекет жазбаларын жіктеуіштермен талдау.

    • Мақсаттарға сәйкестікті өлшеу: Мақсаттарға сәйкестікке оқытудың тиімділігін өлшеу үшін модельдің мақсаттарға сай емес әрекетке бейімділігін қадағалайтын бағалаулар жүргізу. Оған мыналар кіруі мүмкін:

      • Мақсаттарға сәйкестікті офлайн бағалау: Озық модельдерді оқыту кезінде оқытудың көзделгендей жүріп жатқанын бағалау үшін мақсаттарға сәйкестікті тексеріп, кез келген елеулі нашарлауды зерттеу.

      • Өткен деректермен тексеру: Бағалаулардың бұрын мақсаттарға сай болмаған модельдерді анықтайтынын және нақты оқиғаларға шамадан тыс бейімделмегенін растау үшін оларды бұрынғы оқиғалармен тексеру.

      • Бағалауды айламен айналып өтуді қадағалау: Мінез-құлықтың өзгеруіне әкелуі мүмкін бағалауды аңғаруды немесе метаойынды (модельдің сыналып жатқанын түсінуін) қадағалап, бұғаттаудың нақты шектерін белгілеу. Мысалы, мақсаттарға сәйкестікті бағалау кезінде бағалауды аңғару мен метаойынды бақылайтын жүйелерді қосу.

      • Ең нашар жағдайға арналған стресс-тесттер: Ең нашар теріс мінез-құлықты әдейі туындатып, оны кемінде бір бағалау анықтай алатынын тексеру.

    • Ойлау тізбегі бойынша оқытуға жол бермеу: Модельдер ойлау тізбегін бақылау жүйелерінен жалтаруды үйренбеуі үшін, күшейтпелі оқыту кезінде автоматты бағалағыштарға ойлау тізбегін көрсетпеу.

  • Оқшаулау: Модель мақсаттарға сай болмай кеткен жағдайда зиянды әрекеттерге жол бермеу үшін оқшауланған орта мен қауіпсіздік шараларының жеткілікті беріктігін қамтамасыз ету. Оған мыналар кіруі мүмкін:

    • Инфрақұрылым қауіпсіздігінің бірнеше қабаты: Модель жұмыс істейтін оқшауланған ортаны да, оны орналастыратын зерттеу инфрақұрылымын да нығайтуға қомақты ресурс бөлу. Бұл модель оқшауланған ортадан шығып кеткен жағдайда қосымша қорғаныс қабатын қамтамасыз етеді.

    • Оқшаулауға редтиминг жүргізу: Қауіпсіздікті талдау нәтижелерін ескере отырып, озық модельдерді оқыту барысындағы аралық нұсқаларды пайдаланып, жүйелерге қайталама редтиминг жүргізу. Осылайша олқылықтарды тауып, жою арқылы оқшауланған ортаның, зерттеу инфрақұрылымының және периметрдің қауіпсіздігін жақсарту. Сондай-ақ оқыту кезінде модель қатынаса алатын барлық қызметке (мысалы, интернет кэшіне) редтиминг жүргізу.

    • Үлгілер арасындағы байланыс: Үлгілер арасындағы өткізу қабілеті жоғары байланысқа тек көпагентті құралдар сияқты мақұлданған арналар арқылы рұқсат беру. Инфрақұрылымдағы өткізу қабілеті жоғары әрі агенттер оңай таба алатын жанама арналарды жабу.

    • Өзгермейтін диалог жазбалары: Оқиғаларды сенімді тергеу және байқаусызда өзгеріс енгізуге жол бермеу үшін барлық күшейтпелі оқыту, бағалау және ішкі қолданыс кезінде агенттердің диалог жазбаларын жеткілікті мерзімге өзгермейтін күйде сақтау (мысалы, бір рет қана жазуға болатын сақтау тіркелгілерінде).

  • Бақылау: Модельдер мақсаттарға сай емес әрекеттер жасай бастаса, ықтимал сәйкессіздікті анықтап, ауыр оқиғаға ұласпай тұрып басым мәселелерді жедел шешуге мүмкіндік беретін нақты уақыттағы бақылау жүйесі болуы керек. Оған мыналар кіруі мүмкін:

    • Бақылану мүмкіндігін қамтамасыз ету: Алаңдататын мінез-құлықты ерте анықтау үшін модельдердің бақылауға келетін күйде қалуын қамтамасыз ету. Мұны нақты шектері бар бақылану мүмкіндігі және бақылаудан жалтару бағалауларымен өлшеу.

    • Белгілі мәселелерді толық анықтау: Оқытуға қатыспаған деректермен бағалау кезінде бақылау жүйесінің бұрынғы оқиғаларды анықтау толықтығы жоғары болуын қамтамасыз ету.

    • Бақылау жүйелеріне арналған бағалаулардың өзектілігі: Бақылау жүйесінің анықтау толықтығы мен дәлдігі көрсеткіштері ескірмеуі үшін, жаңа оқыту барысындағы тың тәуекелдерді көрсететін бағалау деректерін жасау.

    • Жедел ден қою: Модель зиян келтірмей тұрып, белгіленген SLA мерзімінде әрекетке әкелетін басым ескертулерді енгізу: кезекші маманды шұғыл хабардар ету немесе тиісті оқыту барысын автоматты түрде уақытша тоқтату. Мысалы, күндіз оқиға болса, кезекші қауіпсіздік маманы мен оқытуға жауапты адамды хабардар ету, ал түнде ескертудің алынғаны расталмаса, оқытуды автоматты түрде уақытша тоқтату.

2. Жұмысты ұйымдастыру нұсқаулары

Техникалық қорғаныс шаралары жөніндегі ұсынымдармен қатар, озық ЖИ-ді оқыту барысының қауіпсіздігін негіздеуге арналған үздік ұйымдастыру тәжірибелерін де әзірлеп келеміз. Оларға мыналар кіруі мүмкін:

  • Қарсы пікірлер (алдын ала талдау): Қауіпсіздік негіздемесі дайындалған соң, басқа топтың мүшесі оның ықтимал осал тұстарын анықтап, тәуекелге байыпты баға беретін қарсы пікір жазуы керек. Оқыту тобы кейін осы ескертулерді қарастырып, тиісті шаралар қабылдауы тиіс. Бұл қауіпсіздік негіздемелерін нығайтуға көмектеседі.

  • Мақұлдау: Қауіпсіздік негіздемесін жоғары басшылық өкілдері қарап шығуы керек. Оқыту барысына бірнеше деңгейлі ішкі бақылау орнату үшін олардың әрқайсысына оқытуды тоқтатуға тыйым салу құқығы берілуі тиіс (мысалы, зерттеу бөлімінің басшысы / вице-президенті, қауіпсіздік басшысы және бас ғалым).

  • Жауапкершілік: Оқыту барысына жауапты жоғары басшы (мысалы, зерттеу бөлімінің басшысы / зерттеу жөніндегі вице-президент) қауіпсіздік негіздемесі мен кез келген оқиғаға ден қою үшін жауап беруі тиіс, оның ішінде қызмет нәтижелерін бағалау кезінде де. Бұл оқыту топтарын қауіпсіздік пен мақсаттарға сәйкестікті жақсартуға ынталандырады.

  • Уақытша тоқтату: Қауіпсіздік негіздемесін жарамсыз ететін мәселелер (мысалы, жаңа қауіпсіздік осалдығы) табылса, ол қамтитын барлық оқыту барысын уақытша тоқтатуға арналған іс-қимыл нұсқаулықтары, техникалық тетіктер және қызмет көрсету деңгейі туралы келісімдер (SLA) болуы керек.

  • Ішкі ашықтық: Қауіпсіздік негіздемелері ішкі қадағалау топтарына (мысалы, Қауіпсіздік және қорғаныс комитетіне) қолжетімді болуы тиіс.

  • Аудиттер: Аудиторларға қауіпсіздік негіздемесіндегі тұжырымдардың дұрыстығы мен дәйектілігін тексеруге және табылған олқылықтарды хабарлауға жеткілікті қолжетімділік берілуі керек.

  • Мәселені жоғары деңгейге жеткізу: Мақсаттарға сәйкессіздік мәселелерін жоғары деңгейге жеткізудің нақты тәртібі және олардың ауырлық деңгейлері белгіленген кесте болуы тиіс. Оқыту барысында белгілі бір ауырлық деңгейіне жеткенде басшыларды (мысалы, бас директорды) шұғыл хабардар ете алатын кезекші маман да қажет.

  • Техникалық бақылау тетіктері: Адамдар мен агенттердің талаптарға сай емес оқытуды іске қосуы қиын болуы керек. Бақылау және автоматты түрде уақытша тоқтату сияқты қауіпсіздік функциялары істен шықса, жұмысқа жол берілмеуі тиіс (мысалы, тиісті бақылау қосылмай оқытуды бастауға немесе күшейтпелі оқыту, бағалау не ішкі қолданыс ортасынан бақылау жүйесін өшіруге мүмкіндік болмауы керек).

  • Кері қайтару мүмкіндігі: Қажет болса, мақсаттарға сай емес нәтижелердің әсерін жою үшін, оқыту процесінде мақсаттарға сай емес модельдің кейін қайда қолданылғанын (мысалы, дерек жасауға немесе бағалауға) түгел анықтау оңай болуы тиіс.

  • Қалдық тәуекелдерді толық қамту: Тәуекелді қабылдау туралы саналы шешім қабылдау үшін қауіпсіздік негіздемелерінде қолданыстағы азайту шаралары қамтымайтын қалдық тәуекелдер мүмкіндігінше толық тізілуі керек.

Бұл — қазіргі ұсынымдарымыз. Олар қазір OpenAI-де енгізіліп жатыр. Алдағы апталарда тәжірибелеріміз одан әрі жетіле түседі деп күтеміз.

3. Мақсаттарға сәйкессіздік оқиғаларын тергеу

ЖИ-дің мақсаттарға сәйкессіздігіне байланысты ауыр оқиғаларды тергеудің үздік тәжірибелерін де әзірлеп келеміз. Мұндай жағдайлардың қайталануына жол бермеу үшін зертханалар әр оқиғадан барынша көп сабақ алуға ұмтылуы тиіс (тәуекелі жоғары басқа салалардағы тергеу тәжірибелеріне⁠(жаңа терезеде ашылады) ұқсас). Мұндай шараларға мыналар кіруі мүмкін:

  • Ішкі ашықтық: Тергеуді аяқтау ұзақ уақыт алуы мүмкін болғандықтан, оның барысы туралы ұйым ішінде тұрақты түрде ақпарат беріліп тұруы керек (мысалы, жалғасып жатқан тергеулер бойынша күн сайын). Қызметкерлерге көбірек ақпарат алудың, соның ішінде бастапқы диалог жазбаларына қол жеткізудің және мақсаттарға сай емес модельдерден жауап үлгілерін алудың белгіленген жолдары қажет. Бұл олардың жұмысына қатысты әрі қауіпсіз болуы тиіс.

  • Мақсаттарға сәйкессіздіктің түпкі себебі: Зерттеушілер мақсаттарға сай емес мінез-құлықтың қалай пайда болғанын түсіну үшін оқыту динамикасының түпкі себептерін анықтауы керек (мысалы, жекелеген құрамдастарды әдейі алып тастау немесе қайта іріктеу эксперименттері арқылы). Бұл сәйкессіздіктің ғылыми табиғатын жақсырақ түсінуге және келешекте оның алдын алуға көмектеседі.

  • Оқиғадан кейінгі талдау: Оқиғаға ықпал еткен барлық себептерді түсіну үшін жұмыс процестері мен ұйым мәдениетіне талдау жасалуы тиіс. Мысалы, мәселелер неліктен пайда болғанын және оқиғаға дейін неге анықталмағанын немесе жоғары деңгейге жеткізілмегенін зерттеу керек.

  • Анықтау: Біз оқиғадан алынған ақпаратқа (мысалы, диалог жазбаларына немесе оқиға түйіндеріне) сүйеніп тікелей оңтайландырусыз-ақ, осындай оқиға туғызуға бейімділікті анықтай алатын мақсаттарға сәйкестікті тексеру әдістерін әзірлеуіміз керек. Келешектегі модельдер өте ұқсас жағдайларда мақсаттарға сай емес әрекетке бейімділік танытпауын тексеру үшін, оқиғалар негізінде «регрессиялық тесттер» ретінде бағалаулар жасалуы тиіс.

  • Жұртшылыққа жариялау: Тергеу аяқталған соң, оның нәтижелері, оқиғадан кейінгі талдаулар және жұмыс процестеріндегі өзгерістер жұртшылыққа жариялануы керек. Зардап шеккен үшінші тараптар мүмкіндігінше тез хабардар етілуі тиіс.

Автор

OpenAI