Преминаване към основното съдържание
OpenAI

22 септември 2026 г.

Безопасност

Приоритети и принципи за ефективни оценки от трети страни

Зареждане…

Лабораториите за авангарден ИИ носят огромна отговорност за безопасното обучение, оценяване и внедряване на модели. Оценките от трети страни са от решаващо значение за балансирането на тази отговорност, за разширяването на възможностите за принос към безопасността на ИИ, за информирането на обществото и за отчетността на лабораториите спрямо ясни и независимо подкрепени твърдения за безопасност.

Като част от усилията ни да задаваме темпото на авангардното развитие, OpenAI се ангажира да подкрепя независими оценки със задълбочен достъп до обучението, оценяването и внедряването. Този достъп трябва да позволява на оценителите да оспорват допусканията ни, да установяват рискове, които може да сме пропуснали, и да достигат до собствени заключения за ефективността на защитните ни механизми.

Отдавна работим с оценители от трети страни на различни етапи от процеса на разработване и внедряване на моделите. Включихме оценки от трети страни и в практиките по нашата Рамка за готовност, а също така подкрепихме организации и законодателни инициативи, които насърчават по-строг и отговорен процес. В рамките на тези ангажименти предоставяхме задълбочен достъп, включително до информация за техническите ни защитни механизми, видимото логическо мислене и безпрецедентни количества поверителни данни и вътрешен достъп до внедрявания за реакция при инциденти и стрес тестове с червен отбор на мониторите. Представените тук приоритети и принципи са насочени към сътрудничеството ни с независими оценяващи организации от частния сектор и сектора с нестопанска цел при технически оценки на безопасността. Те допълват работата ни с правителствата по изпитването и оценяването, при която различните роли и отговорности може да изискват различни подходи.

Ефективността на тези оценки изисква надеждни механизми за независимост, научна строгост, стабилни практики за сигурност и ясни отговорности. Лабораториите са длъжни да осигуряват възможност за съдържателен контрол, като същевременно защитават чувствителната информация. Лабораториите и независимите оценители споделят отговорността това да бъде направено правилно и трябва да работят според общи международни стандарти за практиките за безопасност и сигурност. По-долу предлагаме четири приоритетни области за по-задълбочена оценка, както и принципи за строга, сигурна и независима работа.

Приоритетни области за оценяване

Оценките от трети страни са най-полезни, когато разглеждат конкретни и значими въпроси: Подкрепят ли доказателствата обосновката и твърденията за безопасност на лабораторията? Проверяват ли оценяванията по подходящ начин рисковете, които трябва да измерят? Действат ли защитните механизми при реалистични условия?

Описаните тук оценки са предназначени да приемат различни форми според разглежданите въпроси за безопасността. Очакваме да подкрепяме паралелно множество оценки с различна продължителност — някои от няколко седмици, а други от няколко месеца. Макар оценките от трети страни да могат да бъдат част и от работата преди внедряване и да подпомагат решенията за внедряване, описаната тук работа обикновено е по-дългосрочна и не е обвързана с конкретно пускане — тя се съсредоточава върху задълбоченото проучване на определени твърдения за безопасност във времето.

В приоритетните области и принципите ни използваме понятията „твърдения за безопасност“ и „обосновки на безопасността“. Под тези понятия разбираме следното:

Твърдение за безопасност: Конкретно твърдение за способностите, поведението или защитните механизми на модел или система, което има отношение към безопасността и може да бъде проверено спрямо доказателства. Твърдението трябва да посочва рисковете и условията, за които се отнася, както и съответните допускания и ограничения.

Обосновка на безопасността: Структуриран и подкрепен с доказателства аргумент, който обяснява защо рисковете на даден модел или система се управляват адекватно при определена дейност, като обучение, оценяване или внедряване. Обосновката на безопасността свързва отделните твърдения за безопасност с подкрепящите ги доказателства и изрично посочва допусканията, несигурностите и оставащите рискове, които биха могли да повлияят на заключенията ѝ.

Предлагаме четири приоритетни области за по-задълбочена оценка, както и принципи за строга, сигурна и независима работа.

  1. Независима оценка на обосновките на безопасността, обхващаща обучението, оценяването и вътрешното и външното внедряване.

    Оценяването на обосновките на безопасността изисква експертен опит в съгласуването, методите за контрол като наблюдение, киберсигурността, биологичната и химическата злоупотреба и стрес тестовете с червен отбор. Обосновките на безопасността се състоят от твърдения, включващи обучението, оценките на способностите и защитните механизми, които могат да бъдат оценявани като цяло или поотделно (вижте приоритети 2 и 3 по-долу). Вероятно ще е необходимо няколко оценители да разгледат различни части от обосновките, като приложат съответния си експертен опит. Взети заедно, оценките им трябва да отговарят на въпроси като:

    1. Достатъчно обосновани ли са доказателствата за обосновките на безопасността при обучение, оценяване и внедряване? Спазени ли са условията от обосновката на безопасността при обучението, оценяването и внедряването?

    2. Обхващат ли обосновките ни за безопасност най-неотложните рискове, установени в хода на оценяването? Подкрепят ли твърденията за безопасност цялостната обосновка на безопасността? Има ли пропуски или области за подобрение?

    3. Използват ли се ефективни методи за установяване и ограничаване на стимулите при обучението, които биха могли да възнаградят измама, хакване на системата за награда, разрушителни действия или заобикаляне на ограничения?

  2. Оценка на критичните защитни механизми при вътрешно и външно внедряване

    Съвкупността ни от защитни механизми непрекъснато се развива в отговор на променящите се способности и среда. Защитните ни механизми обхващат обучението и вътрешното и външното внедряване. Понастоящем те включват защитни механизми на ниво модел, механизми за налагане на правилата и защити за сигурност, както и монитори за несъгласуваност — и обхващат разнообразни рискове, като загуба на контрол и злоупотреба, пораждаща кибернетични, биологични и химически рискове. Техническите партньорства могат още сега да установяват слабости в защитните механизми, като същевременно подобряват методите за оценяване и ускоряват разработването на стандарти. Така се осигурява по-стабилна техническа основа за бъдещи публични политики, които да задават темпото на авангардното развитие — особено при вътрешните внедрявания, където стандартите за безопасност и сигурност все още са в начален етап.

    Независимите оценки трябва да проверяват доколко добре работят тези защитни механизми и къде може да не са достатъчни, например:

    1. При достъп тип „сива кутия“ устойчиви ли са защитните механизми на състезателно тестване (джейлбрейкове) и защитават ли достатъчно от повишаване на способностите във високорискови области (напр. кибернетика и биология)? Обхващат ли състезателното ни тестване и стрес тестовете с червен отбор най-важните рискове?

    2. Как взаимодействат агентите с киберзащити като контрол на достъпа, изолирани среди и системи за откриване и реакция при разрешено тестване в реалистични работни условия? Кои защити предотвратяват, откриват или ограничават вредните действия и къде се провалят?

    3. Имат ли мониторите ни за несъгласуваност критични пропуски, които биха могли да доведат до загуба на контрол или тежка несъгласуваност при вътрешно или външно внедряване? Доколко надеждно е наблюдението на логическото мислене като източник на доказателства за безопасност или съгласуваност с подобряването на способностите на моделите?

    4. Въведено ли е подходящо наблюдение при всички съответни дейности по обучение, оценяване и внедряване по начин, който не позволява лесното му деактивиране?

    5. Приложени ли са защитни механизми, съответстващи на способностите?

  3. Оценка на способностите, обхващаща рисковите категории от Рамката за готовност (химически и биологични рискове, киберсигурност и самоусъвършенстване на ИИ), и оценки на съгласуваността относно рисковете от несъгласуваност

    Нашата Рамка за готовност изисква оценяване на ключовите области на граничен риск. С преминаването на праговете и достигането на максимални резултати при оценяванията е важно те редовно да се обновяват и да се гарантират обхватът и качеството както на оценките на способностите в рисковите области от Рамката за готовност, така и на оценките на съгласуваността, предназначени да проверяват рисковете от тежка несъгласуваност.

    Сред важните въпроси са:

    1. Обхващат ли оценките на рисковете от Рамката за готовност достатъчно добре определението за праг на риск в нея? Правилно ли са определени праговете за тези оценки?

    2. Актуализират ли се оценките, когато моделите трайно постигат най-високите резултати, и измерват ли новите тестове по съдържателен начин по-напреднали способности?

    3. Обхващат ли достатъчно добре оценките ни за съгласуваност рисковете от тежка несъгласуваност и кои важни поведения или условия може да пропускат?

  4. Независимо разследване на критични инциденти с несъгласуваност

    Независимото разследване може да бъде ценно при широк кръг критични инциденти, свързани с безопасността на ИИ. Тук се съсредоточаваме върху несъгласуваността на моделите, включително модели, които действат без разрешение или избягват надзора. Това може да разкрие слабости в методите за съгласуване и защитните механизми дори при липса на умишлена злоупотреба.

    При определени обстоятелства, както при инцидента на OpenAI с Hugging Face, може да е полезно да бъде привлечена независима трета страна за независимо разследване на инцидент с несъгласуваност. От решаващо значение е третите страни, участващи в разследването на инциденти, да разполагат с необходимия експертен опит, включително, когато е приложимо, в киберкриминалистиката, съгласуването и мащабния анализ на логическото мислене, както и с достатъчно персонал и ресурси за своевременно разследване. Реакцията при инциденти може да включва достъп до чувствителни вътрешни данни и данни на трети страни, поради което някои подробности може да са твърде чувствителни за публикуване или предоставяне на достъп. Констатациите от независими разследвания могат също да допринесат за обосновката на безопасността на даден модел, като предоставят доказателства за оценяване на твърденията относно съгласуваността му и ефективността на предприетите мерки за отстраняване на наблюдавана по-рано несъгласуваност.

    При инциденти с несъгласуваност даваме приоритет на независимите оценки на следното:

    1. Какво поведение на модела или какви проблеми с несъгласуваността са възникнали по време на инцидента и кои са основните допринасящи фактори?

    2. Биха ли ограничили ефективно защитните механизми и коригиращите мерки подобни инциденти в бъдеще?

Принципи за ефективни оценки

  • Ясно определен обхват и взаимно съгласувани твърдения за оценяване: Оценките трябва да започват с взаимно съгласуван обхват, последван от ясно определени твърдения за безопасност, регистрирани предварително преди началото на оценяването. Третите страни и лабораториите трябва да уточнят дали това са твърдения, които оценяваната компания иска да представи за оценка, или твърдения, които оценителят от трета страна възнамерява да оцени независимо и спрямо които лабораторията приема да бъде оценена. Някои твърдения могат да останат извън обхвата по редица причини, включително липса на практически достъп на третите страни до данни, недостатъчен експертен опит на оценителя или разумни времеви ограничения при спешна оценка. Лабораториите и оценителите трябва да установят процес за разглеждане на значителни рискове, установени извън първоначалния обхват, включително за преценка дали е необходимо допълнително проучване. Заключенията трябва ясно да посочват какво е и какво не е оценено спрямо взаимно съгласувания обхват.

  • Пропорционален достъп: Когато е възможно и в рамките на правните ограничения и изискванията за сигурност и интелектуална собственост, оценителите трябва да разполагат с достъп, съответстващ на необходимото за оценяване на договорените твърдения. Когато прекият достъп е непрактичен или невъзможен, оценителите могат да работят с определен представител на компанията или да проучат непреки механизми или механизми за достъп, запазващи поверителността, за да защитят основната информация.

  • Прозрачна методология и стандарти: Оценителите трябва да обясняват своите методи, критерии за оценка и несигурности, като използват утвърдени стандарти, когато такива са налични. Когато все още няма стандарти, оценителите трябва ясно да обосноват използваните критерии. Докладите трябва да разграничават преките констатации от тълкуването, да обясняват несигурността и ясно да посочват кои заключения се подкрепят от доказателствата.

  • Експертен опит и независимост: Оценителите трябва да доказват подходящ технически експертен опит и да установяват, разкриват и управляват организационните и личните конфликти на интереси, включително финансови стимули, отношения с разработчици и предишно участие в оценяваната работа. Защитните мерки трябва да гарантират, че търговският натиск и договореностите за възнаграждение не влияят върху констатациите, и могат да включват отвод или подходящи периоди на изключване.

  • Сигурност и поверителност: Оценителите трябва да прилагат практики за информационна сигурност и правно приложими защити на поверителността за своя персонал, съответстващи на чувствителността на системите и информацията, до които имат достъп. Тези защити трябва да обхващат интелектуалната собственост, чувствителната информация и документацията от оценяването. Когато оценителите не могат да изпълнят изискванията за сигурност в собствената си среда или данните са особено чувствителни, може да е подходящ достъп чрез управлявани от компанията устройства или в нейни помещения.

  • Практически приложими констатации и срок за отстраняване: Оценките трябва да установяват конкретни пропуски и да предоставят достатъчно подробности, за да могат лабораториите да ги отстранят. Когато е уместно, лабораториите трябва да разполагат с разумен срок за отстраняване на проблемите преди публикуването. Когато е приложимо, докладите трябва също да обясняват изводите за разработчиците, внедрителите и защитниците на агенти и да дават практически препоръки за прилагане.

  • Отговорни практики за публикуване: Докладите за оценка трябва да се основават на доказателства и да се споделят възможно най-открито, като същевременно се защитава чувствителната и поверителната информация. Когато пълното публично оповестяване е невъзможно, поверителното докладване пред подходящи надзорни органи, като управителни органи или съвети на компании, може да подпомогне отчетността. Трябва да има принципни защити и правила за заличаване на чувствителна информация, както и ясни очаквания за обратната връзка и коригирането на неточности, за да се запази балансът между независимост и поверителност. Оценителите трябва да запазват редакционната си независимост, като същевременно гарантират защитата на поверителността и интелектуалната собственост. Оценителите трябва да приемат ясни правила за заличаване, които позволяват на лабораториите да поискат заличаване на чувствителна информация, а оценителите да отбелязват къде са направени съществени заличавания и как те влияят върху доклада за оценка.

Пътят напред

Ангажирани сме да подкрепяме независимите оценители и да установяваме по-ясни общи международни стандарти — както чрез бъдещи закони, така и чрез частни управленски институции — за ефективни оценки от трети страни. Докато екосистемата за независимо оценяване продължава да се развива, ще подпомагаме растежа ѝ чрез подкрепа и сътрудничество с разнообразна общност от независими оценители със задълбочен експертен опит по въпросите за безопасността на авангардния ИИ. Нито една трета страна не може и не бива самостоятелно да обхваща изчерпателно неотложните въпроси за безопасността на авангардния ИИ. Ще действаме обмислено и целенасочено, за да разширяваме капацитета си и да даваме възможност на развиващата се екосистема от трети страни да постигне съгласуваност относно най-добрите практики и принципи. Обсъждаме с множество трети страни предложения, съответстващи на посочените по-горе приоритетни области.