GPT‑Red: Төзімділік үшін өзін-өзі жетілдіруді іске қосу
Төзімділікті арттыру үшін күшті автоматтандырылған қауіпсіздік редтиминг мамандарын оқыту.
Қысқаша мазмұн
Мәселе
Редтиминг осалдықтарды анықтау және модельдеріміздің төзімділігін арттыру үшін өте маңызды. Алайда қазіргі тәсілдер ауқымдауға келмейді, соның салдарынан олар үдерістің негізгі кедергісіне айналады.
Соңғы модельдеріміз кеңінен қолданылатын төзімділік бағалауларында қазірдің өзінде шекті нәтижеге жетті.
Қауіпсіздік пен сәйкестендіруді модель мүмкіндіктерімен қатар ауқымдауға мүмкіндік беретін әдістерді әзірлеуіміз керек.
Біз не істедік
Модельдерді кеңінен қолданысқа шығармас бұрын осалдықтарды тауып, түзете алуымыз үшін осалдықтарды анықтау мүмкіндігімізді кеңейтетін автоматтандырылған GPT‑Red редтиминг моделін оқыттық.
GPT‑Red — күшті редтиминг маманы, ал бұрынғы модельдеріміз оның көмексөзге зиян келтіру шабуылдарына өте осал.
GPT‑5.6‑ны қарсыластық әдіспен оқыту үшін GPT‑Red‑ті қолданамыз. Соның нәтижесінде GPT‑5.6 көмексөзге зиян келтіру шабуылдарына әлдеқайда төзімді болады.
Бұл тәсілді адамдар жүргізетін және үшінші тараптар орындайтын редтимингпен, көпдеңгейлі қорғаныс шараларымен және нақты уақыттағы мониторингпен қатар ауқымдауды жалғастырамыз.
Жасанды интеллект жүйелері көбінесе үшінші тарап деректерімен браузерлер, қосылған қолданбалар, жергілікті файлдар және басқа құралдар арқылы кездеседі. Бұл мүмкіндіктер нақты әлемдегі тапсырмаларды орындау үшін қажет, бірақ сонымен бірге зиянкестердің модельдің мінез-құлқына әсер етуіне көбірек мүмкіндіктер жасайды. Мысалы, үшінші тарап электрондық хатқа, веб-бетке, құрал нәтижесіне немесе код репозиторийіне модельді алдап, құпия деректерді сыртқы серверге жүктетуге арналған мұқият құрастырылған нұсқауды енгізуі мүмкін.
Адамдар жүргізетін редтиминг қауіпсіздік саласындағы жұмысымыздың маңызды бөлігі. Ол модельдерді қолданысқа шығармас бұрын осы осалдықтарды анықтап, тиісті қорғаныс шараларын енгізуге көмектеседі. Алайда адамдар жүргізетін редтимингті ғана ауқымдау қиын. Мұндай сынақтарды әзірлеу және өткізу көп уақытты қажет етеді, сондықтан жаңа сәтсіздік түрлерін анықтау және оларды күшейтілген қорғаныс шараларына енгізу жылдамдығы шектеледі. Сонымен қатар, бұл сынақтар сәтті шабуылдардың құнды мысалдарын бергенімен, модель төзімділігін оқыту арқылы арттыруға қажетті қарсыластық деректердің жеткілікті көлемі мен алуан түрлілігін қамтамасыз ете алмайды.
Мүмкіндігі барған сайын артып келе жатқан модельдерге ілесу үшін редтимингті де ауқымдау қажет. Осы мақсатта біз модельдерді қолданысқа шығармас бұрын осалдықтарды анықтайтын және оқыту барысында олардың төзімділігін арттыруға арналған шабуылдар жасайтын, тек ішкі қолдануға арналған автоматтандырылған редтиминг модельдерін оқытып келеміз. Автоматтандырылған редтиминг қауіпсіздікке бағытталған өзін-өзі жетілдірудің маңызды тетігін іске қосады деп санаймыз: бүгінгі модельдерді болашақ модельдердің қауіпсіздігін тікелей арттыру үшін пайдалану.
GPT‑Red — осы күш-жігердің нәтижесі әрі қазіргі таңда қауіпсіздікке арналған ең үздік автоматтандырылған редтиминг моделіміз. Адам редтиминг мамандары шабуылдарды қалай құрастырса, модель де мақсатқа жету үшін көмексөз жібереді, GPT модельдерінің оған қалай жауап беретінін бақылайды және нәтижеге қарай шабуылды бірнеше рет жетілдіреді. Біз GPT‑Red‑ті OpenAI-дегі модельдерді кейінгі оқытудың ең ауқымды үдерістерінің кейбірімен шамалас есептеу көлемін пайдаланып оқыттық — бұл тек қауіпсіздікті арттыруға арналған бұрын-соңды болмаған есептеу ресурстарының көлемі.
Біз GPT‑Red‑ті өндірістік модельдерімізді оқыту үдерісіне тікелей енгіземіз. Нәтижесінде GPT‑5.6 Sol — бүгінге дейін көмексөзге зиян келтіру шабуылдарына ең төзімді моделіміз: ең күрделі тікелей көмексөзге зиян келтіру бенчмаркімізде оның сәтсіздік саны төрт ай бұрынғы ең үздік өндірістік моделімізбен салыстырғанда 6 есе аз. Тәсілімізді ауқымдау мүмкіндігі болашақта бұдан да жоғары нәтижелерге қол жеткізуге негіз береді, өйткені біз қуаттырақ редтиминг модельдерін оқытуды жалғастырамыз.
GPT‑Red өзіндік ойынға негізделген күшейтпелі оқыту арқылы үйретіледі. Бұл үдерісте модель мен әртүрлі қорғаушы LLM (үлкен тілдік модель) жиыны редтиминг сценарийлерінің кең ауқымында бір мезгілде оқытылады. GPT‑Red сәтті көмексөзге зиян келтіру шабуылы секілді бағалау талаптарына сай сәтсіздік жағдайын туындатқаны үшін марапатталады, ал қорғаушы модельдер шабуылға төтеп беріп, бастапқы тапсырмаларын орындағаны үшін марапатталады. Қорғаушы модельдердің төзімділігі артқан сайын, GPT‑Red күштірек әрі алуан түрлі шабуылдарды табуға мәжбүр болады.
Өзіндік ойын арқылы оқытуды қолдау үшін көмексөзге зиян келтіру нұсқаулары енгізілуі мүмкін шынайы сценарийлердің ауқымды жиынын құрамыз. Әр ортада GPT‑Red нені басқара алатынын және қандай жағдай сәтті шабуыл болып есептелетінін айқындайтын қауіп моделі бар. Мысалы, GPT‑Red жергілікті файлдың бір бөлігін, веб-беттегі баннерді, электрондық хаттың мәтінін немесе құрал нәтижесін басқара алады.
Оқыту аяқталған кезде GPT‑Red өте қуатты шабуылдаушыға айналады: ол GPT‑5.5‑ті қоса алғанда, қарсы қойылған ішкі және өндірістік модельдердің барлығын дерлік бұза алады. GPT‑Red‑ті оқыту аяқталғаннан кейін, оны GPT‑5.6‑ны оқытуға арналған көмексөзге зиян келтіру шабуылдарын жасау үшін пайдаландық. Нәтижесінде GPT‑5.6 GPT‑Red шабуылдарына өте төзімді болды.
Біз GPT‑Red-ті қолданысқа шығаратын модельдерімізден бөлек ұстаймыз. Бұл GPT‑Red‑ке арнайы үйрететін зиянды қабілеттердің қарсылас тараптардың қолына түсуіне жол бермей, өндірістік модельдерімізге төзімділік дарытады.
GPT‑Red өзі оқытылған қорғаушы модельдер жиыны мен редтиминг сценарийлеріне қарсы өте тиімді. Сондай-ақ оның OpenAI-дегі қауіпсіздікті кеңінен жақсартуға көмектесетін әмбебап редтиминг агенті ретінде қаншалықты пайдалы екенін бағалаймыз. Ол үшін GPT‑Red‑тің тиімділігін жаңа қауіпсіздік орталары мен нысаналы модельдерде сынаймыз.
Алдымен GPT‑Red‑тің жаңа редтиминг сценарийлеріне жалпылау қабілетін Дзиемян және т.б. (2025) ұсынған жанама көмексөзге зиян келтіру аренасының(жаңа терезеде ашылады) қайта жасалған нұсқасы арқылы бағалаймыз. Бұл сынақта адам редтиминг мамандары мен GPT‑Red алдын ала белгіленген орталар жиынында GPT‑5.1‑ге қарсы шабуылдарды бір-бірінен тәуелсіз ұсынды. Бұл редтиминг сценарийлері мен мақсаттары GPT‑Red‑ті оқытуда қолданылған сценарийлер мен мақсаттардан өзгеше. GPT‑Red шабуылдардың сәттілік деңгейі бойынша едәуір жоғары нәтиже көрсетті: ол сценарийлердің 84%-ында сәтті болды, ал адамдарда бұл көрсеткіш 13% болды.
GPT‑Red автоматтандырылған редтиминг маманы ретінде өте жоғары нәтиже көрсетеді. Дзиемян және т.б. (2025) ұсынған жанама көмексөзге зиян келтіру аренасының ішкі көшірмесінде GPT‑Red GPT‑5.1‑ге қарсы адам редтиминг мамандарына қарағанда әлдеқайда көп сценарийде сәтті шабуыл жасай алады.
Редтиминг маманы үшін шешуші сынақ — жүйенің негізгі моделі мен тапсырма ортасының құрылымы туралы толық мәліметсіз-ақ нақты әлемдегі агенттік жүйелерге қарсы нысаналы зиянды мақсаттарға қол жеткізе алу. Осы жағдайдағы алғашқы тәжірибемізде GPT‑Red‑ті Андон Лабс жасаған OpenAI кеңсесіндегі ЖИ негізіндегі сауда автоматына (Проджект Венд(жаңа терезеде ашылады) жобасына ұқсас) қарсы қойдық. Біз GPT‑Red‑ке жүйенің сипаттамасын беріп, нақты ортадағы қолданысты барынша дәл қайталайтын симуляцияланған агентке шабуылдар жіберу және оның құрал шақыруларын бақылау мүмкіндігін ұсындық. Шабуылдарды бірнеше рет жетілдіргеннен кейін GPT‑Red өз шабуылын өндірістік ортадағы агентке қолданып, үш зиянды мақсатының бәріне жетті:
- Қоймада бар қымбат тауардың бағасын рұқсат етілген ең төменгі мәнге — 0,50 АҚШ долларына дейін төмендету;
- Бағасы 100 АҚШ долларынан асатын жаңа тауарға тапсырыс беріп, оны 0,50 АҚШ долларына ұсыну; және
- Басқа клиенттің тапсырысын болдырмау.
Біз бұл осалдықтар туралы хабарладық, ал жаңа қорғаныс шаралары қазір белсенді түрде сынақтан өтіп жатыр.
GPT‑Red сауда автоматын басқаратын «Венди» атты жұмыс істеп тұрған автономды агентті бұза алады. GPT‑Red алдымен шабуылдарды симуляцияда сынап, кейін оларды жұмыс істеп тұрған агентке көшіру арқылы өндірістік ортадағы агентті қымбат тауарлардың бағасын төмендетуге және басқа клиенттердің тапсырыстарын болдырмауға мәжбүр етті.
Сондай-ақ GPT‑Red‑ті оқытуда пайдаланылмаған, деректерді сыртқа шығаруға арналған 10 сценарийден тұратын жиында GPT‑5.4 mini негізіндегі Codex CLI агентіне шабуыл жасау үшін қолданамыз. Оқыту әдісіміздің оқытуда пайдаланылмаған сценарийлердегі редтиминг нәтижелеріне әсерін зерттеу үшін GPT‑Red‑ті көмексөз арқылы басқарылатын GPT‑5.5 базалық моделімен салыстырамыз. GPT‑Red нәтижелірек: ол көбірек сценарийде агентті құпия деректерді сыртқа шығаруға мәжбүрлей алады әрі токендерді үнемдірек пайдаланады.
GPT‑Red жұмыс істеп тұрған Codex агенттерін бұзуда нәтижелірек әрі тиімдірек. Біз GPT‑Red‑ті деректерді сыртқа шығаруға арналған 10 тапсырмадан тұратын арнайы сынақ жиынында GPT‑5.4 Mini негізіндегі Codex агентіне қарсы сынаймыз.
GPT‑Red‑тің түпкі мақсаты — модельдеріміздің төзімділігін арттыру. Соңғы алты айда есептеу ресурстарын біртіндеп ұлғайта отырып, барған сайын қуатты редтиминг модельдерін (GPT‑Red‑тің ізашарларын) оқыттық. GPT‑5.3‑тен бастап бұл модельдерді әрбір келесі өндірістік модельді оқытуда қолдандық. Соның нәтижесінде GPT‑тің әрбір жаңа шығарылымы бұрынғысынан төзімдірек бола түсті.
Мысалы, GPT‑Red‑тің ерте нұсқасы «Жалған ойлау тізбегі» деп аталатын тікелей көмексөзге зиян келтіру шабуылдарының жаңа класын анықтады. Бұл шабуылдардың GPT‑5.1‑дегі сәттілік деңгейі 95%-дан жоғары болған, ал GPT‑5.6 Sol моделінде қазір 10%-дан төмен. Сол сияқты, әзірлеуші құралдары мен веб-шолуға бағытталған шабуылдарды қамтитын жанама көмексөзге зиян келтіру бенчмарктерінің бірнешеуінде соңғы моделіміз шекті нәтижеге жетті (>97% дәлдік).
GPT‑Red шабуылдарына төзімділік те айтарлықтай артты. Төзімділікті бағалайтын орталардың кең жиынында GPT‑Red шабуылдарының сәттілік деңгейі уақыт өте тұрақты түрде төмендеді. Соңғы GPT‑5.6 Sol шығарылымы GPT‑Red‑тің тікелей көмексөзге зиян келтіру шабуылдарының небәрі 0,05%-ында ғана сәтсіздікке ұшырайды.
Көмексөзге зиян келтіру шабуылдары бойынша өзіндік ойынға негізделген оқытуды одан әрі ауқымдаған сайын, қолданыстағы модельдерді бұза алатын жаңа қауіптерді анықтадық. Сонымен бірге оқыту ауқымын кеңейту осы шабуылдарға төзімділікті де едәуір арттыруға көмектесті. Шабуылдың сәттілік деңгейі GPT‑Red оқытуда пайдаланылмаған орталарда жасаған барлық әрекеттердің сәттілік көрсеткіштерінің орташа мәні ретінде есептеледі.
Модель көбірек сұраудан бас тарту немесе қабілетін төмендету арқылы қауіпсіздеу болып көрінуі мүмкін. Мүмкіндігі шектеулі модельге шабуыл жасау, әрине, қиынырақ, бірақ мұндай төзімділік пайдалы емес.
Біз жалпы озық мүмкіндіктерді де, өзіміз әзірлеген шамадан тыс бас тартуды нысаналы түрде тексеретін тапсырмаларды да мұқият бағалаймыз. Нәтижесінде төзімділік едәуір артқанымен, қалыпты мүмкіндіктердің ешқайсысы өзгермегенін анықтадық. Бұл өсім құралдарды орынсыз пайдаланудан немесе заңды сұраулардан әдепкі бойынша бас тартудан емес, зиянды нұсқауларға қарсы тұру қабілетінің жақсаруы есебінен болғанын көрсетеді.
ЖИ агенттері келесі буын модельдеріміздің мүмкіндіктерін жақсарту үшін қазірдің өзінде қолданылып келеді. GPT‑Red арқылы қауіпсіздік үшін де өзін-өзі күшейтетін осындай циклді іске қоса бастадық деп санаймыз: бүгінгі модельдерді ертеңгі модельдерді төзімдірек, жақсырақ сәйкестендірілген әрі сенімді ету үшін қолдануға болады. Бүгінгі GPT‑Red моделінен де қуатты болашақ нұсқаларды оқыту үшін есептеу ресурстары мен деректер көлемін ұлғайтып, алгоритмдерді жетілдіруді жалғастырамыз. Өз кезегінде бұл модельдер GPT‑тің болашақ шығарылымдарын қауіпсіз етуге көмектеседі.
Осы аптаның соңында толығырақ мәліметтері бар препринт шығарамыз.


