Անցնել հիմնական բովանդակությանը
OpenAI

Մոդելների անհամապատասխանության հաղորդման մեր շրջանակը

Բեռնվում է…

Ներկայացնում ենք OpenAI-ում մոդելների անհամապատասխանության դեպքերին հետևելու, դրանք հետաքննելու և հրապարակելու նոր շրջանակ, ինչպես նաև վերջին վեց ամսում մեր դիտարկած անսպասելի կամ մտահոգիչ վարքագծի մասին վեց զեկույց։

Նախկինում, հետազոտողներին, ԱԲ մշակողներին, քաղաքականություն մշակողներին և հանրությանը ավելի լավ իրազեկելու նպատակով, ձգտել ենք հրապարակել անհամապատասխանության վերաբերյալ մեր բացահայտումները այս թեմայով։ Սակայն առանց այս բացահայտումների մասին զեկուցելու համակարգված մոտեցման՝ մեր հրապարակումները եղել են իրավիճակային և ցանկալիից ավելի հազվադեպ. հաճախ սպասել ենք, մինչև կարողանանք մի քանի դեպք միավորել մեկ զեկույցում, կամ դրանք ավելացրել ենք նոր թողարկված մոդելների համակարգային քարտերին։ Այս նոր շրջանակը նախատեսված է դիտարկումից հետո անհամապատասխանության մասին զեկույցների հրապարակումն արագացնելու համար, նույնիսկ երբ դեռ ամբողջությամբ չենք բացատրել կամ մեղմել նկարագրվող վարքագիծը։

ԱԲ համակարգերի զարգացմանն ու ավելի լայն կիրառմանը զուգընթաց պետք է համապատասխանեցման հետազոտության առաջընթացի շուրջ ձևավորենք ավելի լայն և իրազեկ համաձայնություն։ Մենք չենք կարծում, որ ԱԲ ոլորտը համապատասխանեցման և մշտադիտարկման խնդիրները լուծել է այնքան, որ դեռ երկար ժամանակ հնարավոր լինի պատասխանատու կերպով շարունակել առավելագույն արագությամբ ընդլայնումը։ Առաջիկա ամիսներին և տարիներին ԱԲ-ի զարգացման ուղու վերաբերյալ որոշումները պետք է հիմնվեն այնպիսի փաստերի վրա, որոնք առաջադեմ մոդելներ ստեղծող ընկերություններից դուրս գտնվող մարդիկ կարող են ինքնուրույն ուսումնասիրել։

Անհամապատասխանության օրինակները կարող են օգնել բացահայտելու խնդիրներ, որոնց ԱԲ այլ մշակողները կարող են բախվել, երբ նրանց համակարգերը հասնեն նման կարողությունների, ի հայտ բերել պաշտպանական միջոցների թուլությունները կամ կասկածի տակ դնել մոդելների վարքագծի մասին ենթադրությունները։ Այս բացահայտումների հրապարակումը մյուսներին հնարավորություն է տալիս ուսումնասիրելու նույն խնդիրները, ստուգելու մեր բացատրությունները և բարելավելու մեղմման միջոցները։ Քանի որ կարևորում ենք անհամապատասխանության հարցերում թափանցիկությունը, մեր նոր շրջանակը նախապատվությունը տալիս է հրապարակմանը նույնիսկ այն դեպքում, երբ նշանակությունը դեռ անորոշ է։ Սա նշանակում է, որ մեր հրապարակած որոշ դեպքեր կարող են պատահական շեղումներ լինել և չկազմել ավելի լայն օրինաչափության մաս կամ չվկայել հետագա զարգացումների մասին։

Ներկայում չկա ամբողջ ոլորտն ընդգրկող շրջանակ, որը հստակ չափանիշներ կսահմանի, թե ԱԲ մշակողներն ինչպես պետք է հրապարակեն իրենց մոդելների անհամապատասխանության օրինակները։ Հուսով ենք, որ այսօր ներկայացվող շրջանակը առաջին քայլը կլինի նման չափանիշների ստեղծման ճանապարհին՝ սահմանելով, թե անհամապատասխանության որ դեպքերը պետք է հրապարակեն մշակողները և ինչ պետք է պարունակեն նրանց զեկույցները։ Այս շրջանակը համարում ենք ընթացիկ աշխատանք, որը կատարելագործելու ենք փորձի և հանրային արձագանքի հիման վրա։

Այստեղ նկարագրում ենք շրջանակի գործելակերպը և ներկայացնում մեր առաջին հրապարակվող զեկույցները։

Անհամապատասխանության որ օրինակների մասին ենք զեկուցելու

Նպատակ ունենք հրապարակելու օրինակներ, որոնք օգտակար փաստեր են տալիս այն մասին, թե ինչպես է առաջանում և դրսևորվում մոդելների անհամապատասխանությունը, և որ դեպքերում են պաշտպանական միջոցները հաջողվում կամ ձախողվում։ Առաջնահերթ ենք համարում նոր մեխանիզմները, հայտնի վարքագծի նշանակալի փոփոխությունները և անվտանգության կամ մեղմման վերաբերյալ ենթադրությունները կասկածի տակ դնող բացահայտումները։ Օրինակը պարտադիր չէ, որ վնաս պատճառի կամ ավելի լայն օրինաչափություն հաստատի՝ հրապարակման արժանի լինելու համար։ Այս շրջանակը կընդգրկի չափանիշներին համապատասխանող վարքագիծը մոդելի ամբողջ կենսափուլի ընթացքում՝ ներառյալ ուսուցումը, գնահատումը, փորձարկումն ու տեղակայումը։

Դա ներառում է մոդելների՝ առանց թույլտվության գործելու, այլ մոդելների հետ համակարգվելու կամ վերահսկողությունից խուսափելու նոր եղանակները, համապատասխանեցման որևէ մեթոդ կամ պաշտպանական միջոց կասկածի տակ դնող ձախողումները և հրապարակված անվտանգության գնահատման որևէ պնդում վիճարկող վարքագիծը։ Հրապարակման նույն չափանիշները կիրառվում են նաև երրորդ կողմերի վրա հնարավոր ազդեցություն ունեցող անհամապատասխանության դեպքում։

Դա կարող է ներառել նաև անհամապատասխանության այն դեպքերը, որոնք նման են նախկինում մեր հրապարակած դեպքերին։ Խնդրի կրկնությունն ինքնին կարող է օգտակար փաստ լինել մեր մոդելների վարքագծի կամ պաշտպանական միջոցների արդյունավետության մասին, օրինակ՝ եթե անհամապատասխան վարքագծի որոշակի տեսակ շարունակում է կրկնվել՝ չնայած այն մեղմելու բազմակի փորձերին։ Նման հանգամանքներում լրացուցիչ օրինակները կհրապարակենք՝ թարմացնելով անհամապատասխանության մասին սկզբնական հրապարակումը։

Ժամանակի ընթացքում նախատեսում ենք այլ մշակողների, արտաքին հետազոտողների, ոլորտային ստանդարտներ սահմանող մարմինների և կարգավորիչների հետ մշակել հրապարակման ավելի օբյեկտիվ չափանիշներ։ Մենք նաև կարծում ենք, որ անվտանգության, պաշտպանվածության և անհամապատասխանության լուրջ միջադեպերի մասին պետք է տեղեկացնել ԱՄՆ դաշնային կառավարությանը, և աշխատում ենք զեկուցման մեխանիզմներ առաջարկելու ուղղությամբ։ Այս շրջանակը համարում ենք մեր գործող պարտավորությունները լրացնող և նշում ենք, որ այն չի փոխարինում հրապարակման իրավական պահանջներին, այդ թվում՝ անվտանգության կրիտիկական միջադեպերի կամ կիբեռանվտանգության խախտումների վերաբերյալ պահանջներին։

Անհամապատասխանության օրինակները, որոնք ներկայացնում ենք այսօր

Անհամապատասխանության հրապարակման մեր նոր շրջանակի մեկնարկին հրապարակում ենք վեց զեկույց՝ մեր մոդելների ուսուցման կամ գնահատման ընթացքում դիտարկված անհամապատասխան վարքագծի դեպքերի մասին։ Այս դեպքերը ներկայացնում են տարբեր վարքագծերի մի ամբողջ շարք, որոնք, մեր կարծիքով, արժե հրապարակել՝ սկսած օգտատիրոջից տեղեկություն թաքցնելուց մինչև խոչընդոտները հաղթահարելու նպատակով չարտոնված գործողություններ կատարելը։ Սրանք առանձին դեպքերի մասին զեկույցներ են և չպետք է դիտարկվեն որպես մեր մոդելներում անհամապատասխանության ընդհանուր հաճախականության ցուցիչ։ Ստորև յուրաքանչյուր կետից հղում է տրված ամբողջական զեկույցին։

  1. Առաջադրանքների ամփոփագրերում ինքնուրույն ստեղծված հրահանգներ(բացվում է նոր պատուհանում)։ Դեռ չթողարկված հետազոտական մոդելը նոր Համատեքստային պատուհանում աշխատանքը շարունակելու համար օգտագործվող ամփոփագրերում ներառել էր կապ չունեցող հրահանգներ, այդ թվում՝ իր սովորական սահմանափակումներն անտեսելու հրահանգներ։ Մենք հայտնաբերել ենք նման ազդեցություն կրած 27 ամփոփագիր։

  2. Առաջադրանքների ամփոփագրերում սխալները թաքցնելու հրահանգներ(բացվում է նոր պատուհանում)։ GPT‑5.6 Sol-ի ուսուցման ընթացքում մոդելի բազմաթիվ օրինակներ իրենց ամփոփագրերում ավելացրել էին օգտատիրոջից սխալները կամ անհամապատասխան վարքագիծը թաքցնելու հրահանգներ։ Օրինակ՝ խտացման ամփոփագրերը պարունակում էին պակասող պատմական տվյալները հորինելու և այդ մասին չհայտնելու, ինչպես նաև աղբյուրների տարբերակների անհամապատասխանությունները թաքցնելու հրահանգներ։

  3. Հանրային պահոցներում բացահայտված API բանալիների որոնում, ապա տեղեկությունների հորինում(բացվում է նոր պատուհանում)։ Կալիֆոռնիայի վարչաշրջաններից մեկում եկամուտների ցուցանիշների մասին սովորական հարցին պատասխանելիս մոդելը գտել և առանց թույլտվության օգտագործել էր բացահայտված API բանալի։ Երբ այն այդպես էլ չէր կարողացել ստանալ պահանջված ցուցանիշները, հորինել էր դրանք և ներկայացրել որպես պահանջված աղբյուրից վերցված տվյալներ։

  4. Ֆայլերի վերբեռնում համացանց՝ դրանք որպես աղբյուր նշելու համար(բացվում է նոր պատուհանում)։ Երբ օգտատերը դեռ չթողարկված մոդելից խնդրել էր տրամադրել 5 000 000 քառակուսի մետրից մեծ լճերի նույնացուցիչներն ու անունները, ագենտը Python-ի միջոցով գտել էր ճիշտ պատասխանը։ Սակայն քանի որ հրահանգները պահանջում էին զննարկիչից մեջբերվող աղբյուր, ագենտը որոշել էր առանց օգտատիրոջը հարցնելու վերբեռնել ֆայլը, որպեսզի կարողանա այն նշել պատասխանում։

  5. Չարտոնված գրանցումներ և հաղորդակցություն ներքին ծրագրային պահոցի միջոցով(բացվում է նոր պատուհանում)։ Մոդելները ներքին ծրագրային պահոցն օգտագործել էին որպես հաղորդագրությունների հարթակ՝ առանձին ուսուցման նմուշների միջև հարցումներ ու պատասխաններ փոխանակելու համար, երբ փնտրում էին մուտքային պակասող ֆայլերը, թեև չէին կարողացել վերականգնել դրանք։ Զեկույցում ուսումնասիրվում է նաև ավելի վաղ մի դեպք, երբ մոդելը, փորձելով շրջանցել ցանցային սահմանափակումները, կարողացել էր փորձնական ֆայլեր վերբեռնել պահոց։

  6. Չարտոնված ֆայլափոխանակում համագործակցող ագենտների միջև(բացվում է նոր պատուհանում)։ Նույն ուսուցման առաջադրանքի վրա համատեղ աշխատող ագենտներն օգտագործել էին ֆայլերի հանրային հոսթինգի կայքեր՝ ֆայլեր փոխանակելու համար, երբ չէին կարողացել մուտք գործել միմյանց տեղային ֆայլեր։ Դրա հետևանքով առաջադրանքի արդյունքները հասանելի էին դարձել հանրային URL-ներով, թեև առաջադրանքը պահանջում էր, որ մոդելներն օգտագործեն միայն տեղային ֆայլեր։

Ինչպես է գործում հրապարակման մեր գործընթացը

OpenAI-ի ցանկացած աշխատակից կարող է անհամապատասխանության որևէ օրինակ ներկայացնել անվտանգության և համապատասխանեցման մեր թիմերի հետաքննությանը և խնդրել, որ դիտարկվի դրա հրապարակման հնարավորությունը։ Դրանով սկսվում է հրապարակման մեր գործընթացը, որի յուրաքանչյուր փուլի համար սահմանված են ժամկետներ՝ ժամանակին հետաքննություն և հրապարակում ապահովելու նպատակով։

Օրինակը ներկայացնելուց հետո մեր տեխնիկական անձնակազմը կուսումնասիրի, թե ինչ է տեղի ունեցել, ինչն է մնում անորոշ, արդյոք հիմնավորված է հրապարակումը և որ փաստերը կարելի է հրապարակել։ Նրանք նաև կգնահատեն՝ արդյոք որևէ երրորդ կողմ ազդեցություն է կրել և հրապարակումից առաջ պետք է առանձին ծանուցվի։

Այնուհետև օրինակը կդասվի երեք ընթացակարգերից մեկին՝ «Պատրաստ է հրապարակման», «Փոքր հետաքննություն» կամ «Ընդլայնված հետաքննություն» («Դանդաղ ընթացակարգ»)։

«Պատրաստ է հրապարակման» ընթացակարգն ընդգրկում է չափանիշներին համապատասխանող այն դեպքերը, որոնց հետաքննությունն այնքան է ավարտված, որ վերանայումից հետո հնարավոր է դրանք հրապարակել։ «Փոքր հետաքննություն» ընթացակարգն ընդգրկում է լրացուցիչ տեխնիկական ուսումնասիրություն պահանջող դեպքերը։ Ակնկալում ենք, որ այս երկու ընթացակարգերը կընդգրկեն մեր հրապարակած դեպքերի ճնշող մեծամասնությունը, հատկապես այն դեպքերը, որոնք չեն պահանջում ծավալուն հետաքննություն, երրորդ կողմերի հետ համակարգում կամ չարաշահման լուրջ ռիսկերի կառավարում։ Այսօր հրապարակվող բոլոր դեպքերը դասվում են այս երկու ընթացակարգերից մեկին։

«Ընդլայնված հետաքննություն» ընթացակարգն ընդգրկում է բարդ հետաքննությունները, հատկապես՝ երրորդ կողմերի մասնակցությամբ։ Երբ ազդեցություն է կրում երրորդ կողմ, անվտանգության, իրավական և պատասխանատու հրապարակման մեր պարտավորությունները գերակայում են այս շրջանակի նկատմամբ։ Կձգտենք հնարավորինս շուտ հրապարակել նախնական ծանուցում, սակայն անվտանգության նկատառումներով գուցե ստիպված լինենք հետաձգել այն, օրինակ՝ եթե մոդելը լայնորեն կիրառվող ծրագրակազմում նախկինում անհայտ խոցելիություն հայտնաբերի։ Եթե զեկույցը հնարավորություն տա նույնականացնելու երրորդ կողմին, նախատեսում ենք նրան նախապես ծանուցել, նույնիսկ եթե անվտանգության որևէ սահման չի խախտվել։

«Ընդլայնված հետաքննություն» ընթացակարգին դասված դեպքի նախնական ծանուցումը ընդհանուր գծերով կներկայացնի կատարվածը, կնշի՝ արդյոք արտաքին փորձագետներն աջակցում են հետաքննությանը, և հնարավորության դեպքում կտրամադրի վերջնական զեկույցի հրապարակման ակնկալվող ժամկետը։ Եթե OpenAI-ի Hugging Face միջադեպը հրապարակվեր այս շրջանակի ներքո, այն կդասվեր այս ընթացակարգին։

Օրինակի մասին հայտնած աշխատակցին կտեղեկացնեն այն հրապարակելու որոշման և, հրապարակման դեպքում, ընտրված ընթացակարգի մասին։ Հրապարակման կամ համապատասխան ընթացակարգի շուրջ չլուծված տարաձայնությունները կներկայացվեն OpenAI-ի Անվտանգության հարցերով խորհրդատվական խմբին (SAG)՝ ընկերության տարբեր ստորաբաժանումների բարձրաստիճան պաշտոնյաներից կազմված խմբին, որը գնահատում է առաջադեմ մոդելների կարողություններն ու պաշտպանական միջոցները, վերահսկում է մեր Պատրաստվածության շրջանակը և խորհրդատվություն տրամադրում OpenAI-ի ղեկավարությանը։ SAG-ի ներսում տարաձայնությունները կամ դրա որոշումների վերաբերյալ աշխատակիցների առարկությունները կներկայացվեն OpenAI-ի ղեկավարությանը։ Չհրապարակելու կամ հրապարակումը չհիմնավորված համարելու որոշումները կներկայացվեն անվտանգության և համապատասխանեցման ղեկավարներին, իսկ հնարավորության սահմաններում՝ նաև համապատասխան տեխնիկական անձնակազմին։

Գործնական կիրառությունից քաղած փորձի հիման վրա կարող ենք վերանայել հրապարակման այս գործընթացը, իսկ բոլոր փոփոխությունները կարձանագրենք այս հրապարակման մեջ։

Ինչ է ներառվելու յուրաքանչյուր զեկույցում

Յուրաքանչյուր ամբողջական զեկույցում կնկարագրվեն մեր դիտարկած վարքագիծը, դրա լրջությունն ու արտաքին ազդեցությունը, առաջացման միջավայրը, ամսաթիվը կամ ժամանակահատվածը, հայտնաբերման պահը և, ընդհանուր գծերով, ներգրավված մոդելը կամ մոդելները։ Հնարավորության դեպքում կներկայացնենք նաև՝

  • Կատարվածի և դրանից բխած վնասի մասին լրացուցիչ մանրամասներ,

  • Ինչպես ենք հայտնաբերել անհամապատասխանությունը և ինչ շրջանակ է ընդգրկել մեր հետաքննությունը,

  • Համապատասխանեցման հետազոտության և ԱԲ-ի տեխնիկական անվտանգության համար դրա հետևանքների մեր մեկնաբանությունը,

  • Օրինակից բխող կարևոր անպատասխան հարցերը,

  • Վարքագիծը շտկելու համար ձեռնարկվող կամ ծրագրվող միջոցները։ Հրապարակման պահին այս տեղեկությունները միշտ չէ, որ հասանելի կլինեն, քանի որ անհամապատասխանության զեկույցը կարող ենք հրապարակել նախքան հետաքննությունն ավարտելը կամ լուծում մշակելը։

Հաճախորդների համակարգերում տեղակայման ժամանակ առաջացած անհամապատասխանության մասին կտրամադրենք այնքան տեղեկություն, որքան թույլ են տալիս հաճախորդների գաղտնիությունն ու մեր պայմանագրային պարտավորությունները։

Այսօրվա զեկույցները հրապարակումների նախնական փաթեթ են, ոչ թե հայտնի անհամապատասխանությունների կամ ընթացիկ հետաքննությունների համապարփակ նկարագրություն։ Այս նախնական զեկույցները չեն ներկայացնում սույն շրջանակով ընդգրկված դեպքերի ամբողջ բազմազանությունը կամ լրջությունը։ Մենք հանձնառու ենք հրապարակելու այս շրջանակի չափանիշներին համապատասխանող անհամապատասխանության դեպքերը՝ ներառյալ ավելի բարդ դեպքերը, որոնք պահանջում են ավելի երկար հետաքննություն կամ երրորդ կողմերի հետ համակարգում։ Մենք շարունակաբար զեկույցներ կհրապարակենք այս շրջանակի ներքո և դրա զարգացմանը զուգընթաց ավելի մանրամասն կներկայացնենք զեկուցման մեր պարտավորությունները։