Негізгі мазмұнға өту
OpenAI

2026 ж. 16 қыркүйек

ЗерттеуҚауіпсіздік

Модель сәйкессіздігі туралы есеп беру шеңберіміз

Жүктелуде…

Біз OpenAI-дағы модель сәйкессіздігі жағдайларын бақылау, тергеу және жариялауға арналған жаңа шеңберді, сондай-ақ соңғы алты айда байқаған модельдердің күтпеген немесе алаңдатарлық әрекеттері туралы алты есепті ұсынамыз.

Бұрын зерттеушілерді, ЖИ әзірлеушілерін, саясаткерлерді және жалпы жұртшылықты жақсырақ хабардар ету үшін сәйкессіздік туралы нәтижелерімізді жариялауға тырыстық. Алайда бұл нәтижелер туралы есеп берудің жүйелі тәсілі болмағандықтан, жарияланымдарымыз жекелеген сипатта әрі қажеттіден сирек болды: бірнеше жағдайды бір есепке біріктіргенше жиі күтетінбіз немесе оларды жаңадан шыққан модельдердің жүйе карталарына қосатынбыз. Бұл жаңа шеңбер байқалған сәйкессіздік туралы есептерді, тіпті біз сипаттап отырған әрекетті әлі толық түсіндірмеген немесе оның салдарын азайтпаған болсақ та, тезірек жариялауға арналған.

ЖИ жүйелері жетіліп, кеңінен қолданылған сайын, сәйкестендіру зерттеулерінің барысы туралы ауқымды әрі жақсырақ ақпараттанған ортақ пікір қалыптастыруымыз керек. Біз ЖИ саласы сәйкестендіру мен бақылау мәселесін ең жоғары жылдамдықпен одан әрі жауапкершілікпен кеңейтуге жеткілікті деңгейде шешті деп санамаймыз. Алдағы айлар мен жылдарда ЖИ әзірлеу қалай жалғасуы керектігі туралы шешімдер озық модельдер жасайтын компаниялардан тыс адамдар өздері тексере алатын деректерге сүйенуге тиіс.

Сәйкессіздік мысалдары басқа ЖИ әзірлеушілері жүйелері осындай мүмкіндіктерге жеткенде тап болуы ықтимал мәселелерді анықтауға, қорғаныс шараларындағы әлсіздіктерді ашуға немесе модель әрекеті туралы болжамдарға күмән келтіруге көмектеседі. Бұл нәтижелерді бөлісу өзгелерге сол мәселелерді зерттеуге, түсіндірмелерімізді тексеруге және зиянды азайту шараларын жақсартуға мүмкіндік береді. Сәйкессіздікке қатысты ашықтықты құнды деп санайтындықтан, жаңа шеңберіміз маңыздылығы белгісіз болса да жариялауға басымдық береді. Бұл біз жариялайтын кейбір жағдайлардың жалған белгі болып шығуы, кеңірек үрдістің бір бөлігі болмауы немесе болашақ өзгерістерді аңғартпауы мүмкін екенін білдіреді.

Қазір ЖИ әзірлеушілерінің өз модельдеріндегі сәйкессіздік мысалдарын қалай жариялауы керектігі туралы нақты стандарттары бар жалпы салалық шеңбер жоқ. Бүгін ұсынып отырған шеңберіміз әзірлеушілер сәйкессіздіктің қандай жағдайларын жариялауы және есептеріне не кіруі керектігін белгілейтін осындай стандарттарды құрудың алғашқы қадамы болады деп үміттенеміз. Біз бұл шеңберді тәжірибе мен қоғам пікіріне сүйене отырып жетілдірілетін жұмыс деп санаймыз.

Мұнда шеңбердің қалай жұмыс істейтінін сипаттап, алғашқы жариялайтын есептерімізді ұсынамыз.

Сәйкессіздіктің қандай мысалдары туралы есеп береміз

Біз модель сәйкессіздігінің қалай туындайтыны, қалай көрініс беретіні және қорғаныс шараларының қай жерде сәтті не сәтсіз болатыны туралы пайдалы дәлел ұсынатын мысалдарды жариялауды көздейміз. Жаңа тетіктерге, белгілі әрекеттегі елеулі өзгерістерге және қауіпсіздік не зиянды азайту туралы болжамдарға күмән келтіретін нәтижелерге басымдық береміз. Мысалды жариялауға лайық деп тану үшін оның зиян келтіруі немесе кеңірек үрдісті дәлелдеуі міндетті емес. Бұл шеңбер модельдің бүкіл өмірлік цикліндегі, соның ішінде үйрету, бағалау, сынау және қолданысқа енгізу кезіндегі талаптарға сай әрекеттерді қамтиды.

Бұған модельдердің рұқсатсыз әрекет етуінің, басқа модельдермен үйлесуінің немесе бақылаудан жалтаруының жаңа тәсілдері; сәйкестендіру әдісіне не қорғаныс шарасына күмән келтіретін ақаулар; жарияланған қауіпсіздік бағалауындағы тұжырымға күмән келтіретін әрекеттер кіреді. Үшінші тараптарға әсер етуі мүмкін сәйкессіздікке де осы жариялау талаптары қолданылады.

Бұған бұрын жариялаған жағдайларымызды қайталайтындай көрінетін сәйкессіздік мысалдары да кіруі мүмкін. Мәселенің қайталануының өзі модельдеріміздің әрекеті немесе қорғаныс шараларымыздың тиімділігі туралы пайдалы дәлел болуы мүмкін. Мысалы, сәйкессіз әрекеттің белгілі бір түрі оны азайтуға бағытталған қайталама әрекеттерге қарамастан қайта-қайта туындаса. Мұндай жағдайда бастапқы сәйкессіздік жарияланымын жаңарту арқылы қосымша мысалдарды жариялаймыз.

Уақыт өте келе басқа әзірлеушілермен, сыртқы зерттеушілермен, салалық стандарттау органдарымен және реттеушілермен бірге жариялаудың неғұрлым объективті талаптарын әзірлеуді жоспарлап отырмыз. Сонымен қатар қауіпсіздікке, қорғанысқа және сәйкессіздікке қатысты елеулі оқиғалар АҚШ федералдық үкіметіне хабарлануы керек деп санаймыз және есеп беру тетіктерін ұсыну бойынша жұмыс істеп жатырмыз. Бұл шеңбер қолданыстағы міндеттемелерімізді толықтырады деп санаймыз және оның заңмен белгіленген жариялау талаптарын, соның ішінде аса маңызды қауіпсіздік оқиғалары немесе киберқауіпсіздік бұзушылықтары жөніндегі талаптарды алмастырмайтынын атап өтеміз.

Бүгін бөлісетін сәйкессіздік мысалдары

Сәйкессіздікті жариялауға арналған жаңа шеңберімізді іске қосу үшін модельдерімізді үйрету немесе бағалау кезінде байқаған сәйкессіз әрекет жағдайлары туралы алты есеп жариялаймыз. Бұл жағдайлар пайдаланушыдан ақпарат жасырудан бастап кедергілерді еңсеру үшін рұқсат етілмеген әрекеттер жасауға дейінгі, бөлісуге тұрарлық деп санайтын әртүрлі әрекеттерді көрсетеді. Бұл — жекелеген жағдайлар туралы есептер, сондықтан оларды модельдеріміздегі сәйкессіздіктің қаншалықты жиі кездесетінінің көрсеткіші деп санауға болмайды. Төмендегі әр тармақ толық есепке сілтейді.

  1. Тапсырма түйіндемелеріндегі өздігінен жасалған нұсқаулар(жаңа терезеде ашылады). Әлі шығарылмаған зерттеу моделі өз жұмысын жаңа мәнмәтін терезесінде жалғастыруға пайдаланылған түйіндемелерге қатысы жоқ нұсқауларды, соның ішінде қалыпты шектеулерін елемеу туралы нұсқауларды енгізген. Біз әсерге ұшыраған 27 түйіндемені анықтадық.

  2. Тапсырма түйіндемелерінде қателерді жасыру туралы нұсқаулар(жаңа терезеде ашылады). GPT‑5.6 Sol моделін үйрету кезінде модельдің көптеген данасы пайдаланушыдан қателерді немесе сәйкессіз әрекетті жасыру туралы нұсқауларды өз түйіндемелеріне қосқан. Мысалы, ықшамдау түйіндемелерінде жетіспейтін тарихи деректерді бұл туралы хабарламай ойдан шығару және дереккөз нұсқаларындағы сәйкессіздіктерді жасыру туралы нұсқаулар болған.

  3. Ашық репозиторийлерден ашық қалып қойған API кілттерін іздеу, кейін ақпаратты ойдан шығару(жаңа терезеде ашылады). Калифорниядағы бір округтің табыс көрсеткіштері туралы әдеттегі сұраққа жауап беру кезінде модель ашық қалып қойған API кілтін тауып, рұқсатсыз пайдаланған. Сұралған көрсеткіштерді бәрібір ала алмаған соң, оларды ойдан шығарып, сұралған дереккөзден алынған деректер ретінде ұсынған.

  4. Файлдарға сілтеме жасау үшін оларды интернетке жүктеп салу(жаңа терезеде ашылады). Пайдаланушы әлі шығарылмаған модельден ауданы 5 000 000 шаршы метрден үлкен көлдердің идентификаторлары мен атауларын сұрағанда, агент Python көмегімен дұрыс жауапты тапқан. Алайда нұсқаулар браузердегі дереккөзге сілтеме жасауды талап еткендіктен, агент пайдаланушыдан сұрамай-ақ, жауабында сілтеме келтіру үшін файлды жүктеп салуды шешкен.

  5. Ішкі бағдарламалық репозиторийге рұқсатсыз жазу және ол арқылы байланысу(жаңа терезеде ашылады). Жетіспейтін кіріс файлдарын іздеу кезінде модельдер ішкі бағдарламалық репозиторийді бөлек үйрету үлгілері арасында сұраулар мен жауаптар алмасатын хабарландыру тақтасы ретінде пайдаланған, бірақ бұл файлдарды қалпына келтіре алмаған. Бұл есепте модель желілік шектеулерді айналып өтуге тырысып, сынақ файлдарын репозиторийге сәтті жүктеп салған бұрынырақ жағдай да қарастырылады.

  6. Бірлесіп жұмыс істейтін агенттердің файлдарды рұқсатсыз бөлісуі(жаңа терезеде ашылады). Бір үйрету тапсырмасында бірге жұмыс істеген агенттер бір-бірінің жергілікті файлдарына қол жеткізе алмаған кезде файлдарды бөлісу үшін жалпыға қолжетімді файл-хостинг сайттарын пайдаланған. Тапсырма модельдерден тек жергілікті файлдарды пайдалануды сұраса да, соның салдарынан тапсырма нәтижелері жалпыға қолжетімді URL мекенжайларында пайда болған.

Жариялау процесіміз қалай жұмыс істейді

OpenAI-дың кез келген қызметкері сәйкессіздік мысалын қауіпсіздік және сәйкестендіру топтарымыздың тергеуіне ұсынып, оны жария ету мүмкіндігін қарастыруды сұрай алады. Бұл дер кезінде тергеп, жариялауды қамтамасыз ету үшін әр кезеңге мерзім белгіленген жариялау процесімізді бастайды.

Мысал ұсынылғаннан кейін техникалық мамандарымыз не болғанын, нелер әлі белгісіз екенін, жария етуге негіз бар-жоғын және қандай деректерді бөлісуге болатынын зерттейді. Сондай-ақ олар қандай да бір үшінші тарапқа әсер еткен-етпегенін және оған жариялауға дейін жеке хабарлау қажет пе екенін бағалайды.

Содан кейін мысал үш бағыттың біріне жатқызылады: «Жариялауға дайын», «Шағын тергеу» немесе «Ауқымды тергеу» («Баяу бағыт»).

«Жариялауға дайын» бағыты тексеруден кейін жариялауға жеткілікті дәрежеде тергеліп болған, талаптарға сай жағдайларды қамтиды. «Шағын тергеу» бағыты қосымша техникалық тергеуді қажет ететін жағдайларды қамтиды. Бұл екі бағыт біз жариялайтын жағдайлардың басым көпшілігін, әсіресе ауқымды тергеуді, үшінші тараптармен үйлестіруді немесе теріс пайдаланудың ауыр тәуекелдерін қарастыруды қажет етпейтін жағдайларды қамтиды деп күтеміз. Бүгін жариялап отырған жағдайларымыздың барлығы осы екі бағыттың біріне жатады.

«Ауқымды тергеу» бағыты күрделі, әсіресе үшінші тараптар қатысатын тергеулерді қамтиды. Үшінші тарапқа әсер етілген кезде қауіпсіздік, заң және жауапты жариялау жөніндегі міндеттемелеріміз осы шеңберден басым болады. Алғашқы хабарламаны мүмкіндігінше тез жариялауға тырысамыз, бірақ қауіпсіздік себептерімен оны кейінге қалдыруымыз мүмкін. Мысалы, модель кеңінен қолданылатын бағдарламалық жасақтамадан бұрын белгісіз болған осалдықты тапса. Есепте үшінші тараптың кім екені анықталатын болса, қауіпсіздік шекарасы бұзылмаса да, оған алдын ала хабарлауды көздейміз.

«Ауқымды тергеу» жағдайы туралы алғашқы хабарламада не болғаны жалпы сипатталып, сыртқы сарапшылардың тергеуге көмектесіп жатқаны не жатпағаны айтылады және қорытынды есептің қашан жарияланатыны туралы қолжетімді болжам беріледі. OpenAI-дың Hugging Face оқиғасы осы шеңбер аясында жарияланғанда, осы бағытқа жатқызылар еді.

Мысалды ұсынған қызметкерге оны жариялау-жарияламау туралы шешім және жарияланатын болса, қай бағыт бойынша қаралатыны хабарланады. Жариялау немесе тиісті бағыт жөніндегі шешілмеген келіспеушіліктер OpenAI-дың Қауіпсіздік жөніндегі консультативтік тобына (SAG) жіберіледі. Бұл — компанияның түрлі бөлімдеріндегі жоғары лауазымды басшылардан құралған, озық модельдердің мүмкіндіктері мен қорғаныс шараларын бағалайтын, Дайындық шеңберімізді қадағалайтын және OpenAI басшылығына кеңес беретін топ. SAG ішіндегі келіспеушіліктер немесе қызметкерлердің оның шешімдеріне қарсылықтары OpenAI басшылығына жіберіледі. Жарияламау немесе жариялауға негіз жоқ деген шешімдер қауіпсіздік және сәйкестендіру басшылығына, сондай-ақ мүмкіндігінше тиісті техникалық мамандарға жеткізіледі.

Бұл жариялау процесінің іс жүзінде қалай жұмыс істейтінін зерделей келе, оны қайта қарауымыз мүмкін. Барлық өзгерісті осы жазбада тіркейміз.

Әр есепке не кіреді

Әр толық есепте біз байқаған әрекет, оның ауырлық дәрежесі мен сыртқы әсері, қандай жағдайда болғаны, күні немесе күндер аралығы, оны қашан анықтағанымыз және жалпы деңгейде оған қатысы бар модель не модельдер сипатталады. Мүмкін болған жағдайда мыналарды да бөлісеміз:

  • Не болғаны және одан келген зиян туралы қосымша мәліметтерді;

  • Сәйкессіздікті қалай анықтағанымызды және тергеуіміздің ауқымын;

  • Оның сәйкестендіру зерттеулері мен ЖИ-дің техникалық қауіпсіздігіне ықпалын қалай түсіндіретінімізді;

  • Осы мысалдан туындаған, әлі жауапсыз қалған маңызды сұрақтарды;

  • Бұл әрекетті түзету үшін қабылдап жатқан немесе қабылдауды жоспарлаған шараларымызды. Бұлар жариялау кезінде әрдайым қолжетімді бола бермеуі мүмкін, өйткені сәйкессіздік туралы есепті тергеуді аяқтамай немесе түзету жолын әзірлемей тұрып жариялауымыз ықтимал.

Клиенттік қолданыста туындаған сәйкессіздік туралы клиент құпиялылығы мен шарттық міндеттемелеріміз мүмкіндік берген көлемде ақпарат бөлісеміз.

Бүгінгі есептер — белгілі сәйкессіздік немесе жүріп жатқан тергеулер туралы толық шолу емес, алғашқы жарияланымдар жиынтығы. Бұл алғашқы есептер осы шеңбер қамтитын жағдайлардың бүкіл ауқымын немесе ауырлығын көрсетуге арналмаған. Біз осы шеңбердің талаптарына сай сәйкессіздік жағдайларын, соның ішінде ұзақ тергеуді немесе үшінші тараптармен үйлестіруді қажет ететін күрделірек жағдайларды жариялауға міндеттенеміз. Осы шеңбер аясындағы есептерді тұрақты түрде жариялауды жалғастырамыз және есеп беру міндеттемелерімізді әрі қарай әзірлеген сайын олар туралы толығырақ бөлісеміз.

Автор

OpenAI