Перейти до основного вмісту
OpenAI

22 вересня 2026 р.

Безпека

Пріоритети й принципи ефективного стороннього оцінювання

Завантаження…

Лабораторії передового ШІ несуть величезну відповідальність за безпечне навчання, оцінювання й розгортання моделей. Стороннє оцінювання вкрай важливе для належного виконання цієї відповідальності: воно розширює можливості участі в питаннях безпеки ШІ, інформує суспільство й забезпечує підзвітність лабораторій щодо чітких і незалежно підтверджених тверджень про безпеку.

У межах наших зусиль, спрямованих на те, щоб не відставати від розвитку передових технологій, OpenAI прагне підтримувати незалежне оцінювання, надаючи глибокий доступ на всіх етапах навчання, оцінювання й розгортання. Такий доступ має дозволити оцінювачам ставити під сумнів наші припущення, виявляти пропущені нами ризики й робити власні висновки про ефективність наших захисних заходів.

Ми вже давно співпрацюємо зі сторонніми оцінювачами на різних етапах розроблення й розгортання моделей. Ми також інтегрували стороннє оцінювання в практики нашої рамкової системи готовності та підтримували організації й законодавчі ініціативи, що виступають за ретельніший і підзвітніший процес. У межах цієї співпраці ми надавали глибокий доступ, зокрема до інформації про наші технічні захисні заходи, видимого ланцюжка міркувань, а також безпрецедентних обсягів конфіденційних даних і внутрішніх систем розгортання для реагування на інциденти та перевірки моніторів на вразливості й ризики. Викладені тут пріоритети й принципи стосуються нашої співпраці з незалежними оцінювальними організаціями приватного й неприбуткового секторів у сфері технічного оцінювання безпеки. Вони доповнюють нашу співпрацю з урядами у сфері тестування й оцінювання, де відмінні ролі та обов’язки можуть вимагати інших підходів.

Для ефективності такого оцінювання потрібні надійні механізми незалежності, наукова строгість, дієві практики безпеки та чітко визначені обов’язки. Лабораторії зобов’язані забезпечувати змістовну перевірку, водночас захищаючи чутливу інформацію. Лабораторії та незалежні оцінювачі спільно відповідають за належне виконання цієї роботи й мають діяти згідно зі спільними міжнародними стандартами практик безпеки та захисту. Нижче ми пропонуємо чотири пріоритетні напрями для поглибленого оцінювання, а також принципи ретельної, безпечної та незалежної роботи.

Пріоритетні напрями оцінювання

Стороннє оцінювання найкорисніше, коли воно відповідає на конкретні важливі запитання: чи підтверджують докази обґрунтування безпеки й твердження лабораторії про безпеку? Чи належно оцінювання перевіряє ризики, для вимірювання яких воно призначене? Чи працюють захисні заходи в реалістичних умовах?

Описане тут оцінювання має набувати різних форм залежно від досліджуваних питань безпеки. Ми плануємо паралельно підтримувати кілька оцінювань різної тривалості: деякі триватимуть кілька тижнів, а інші — кілька місяців. Хоча стороннє оцінювання також може бути частиною підготовки до розгортання й впливати на рішення про нього, описана тут робота переважно є довгостроковою та не прив’язаною до запуску — вона зосереджена на поглибленому дослідженні конкретних тверджень про безпеку з плином часу.

У наших пріоритетах і принципах ми згадуємо твердження про безпеку та обґрунтування безпеки. Під цими термінами ми маємо на увазі таке:

Твердження про безпеку: конкретне твердження про можливості, поведінку або захисні заходи моделі чи системи, яке стосується її безпеки та може бути перевірене на основі доказів. У твердженні слід зазначити ризики й умови, яких воно стосується, а також відповідні припущення та обмеження.

Обґрунтування безпеки: структурована й підкріплена доказами аргументація того, чому ризики моделі чи системи належно контрольовані для певної діяльності, як-от навчання, оцінювання або розгортання. Обґрунтування безпеки пов’язує окремі твердження про безпеку з доказами на їхню підтримку та чітко визначає припущення, невизначеності й залишкові ризики, які можуть вплинути на висновки.

Ми пропонуємо чотири пріоритетні напрями для поглибленого оцінювання, а також принципи ретельної, безпечної та незалежної роботи.

  1. Незалежне оцінювання обґрунтувань безпеки, що охоплює навчання, оцінювання, внутрішнє й зовнішнє розгортання.

    Для оцінювання обґрунтувань безпеки потрібні знання у сферах узгодження, методів контролю, як-от моніторинг, кібербезпеки, біологічних і хімічних зловживань, а також перевірки на вразливості та ризики. Обґрунтування безпеки складаються з тверджень про навчання, оцінювання можливостей і захисні заходи, які можна оцінювати разом або окремо (див. пріоритети 2 і 3 нижче). Імовірно, різні частини обґрунтувань мають досліджувати кілька оцінювачів, кожен із яких спиратиметься на власну компетентність. Разом їхні оцінювання мають відповідати на такі запитання:

    1. Чи достатньо підтверджені докази на користь обґрунтувань безпеки навчання, оцінювання й розгортання? Чи дотримувалися умов обґрунтування безпеки під час навчання, оцінювання й розгортання?

    2. Чи охоплюють наші обґрунтування безпеки найнагальніші ризики, виявлені під час оцінювання? Чи підтверджують твердження про безпеку загальне обґрунтування безпеки? Чи є прогалини або напрями для вдосконалення?

    3. Чи застосовуються ефективні методи виявлення й послаблення закладених у навчанні стимулів, які можуть заохочувати обман, маніпуляцію системою винагород, руйнівні дії або обхід обмежень?

  2. Оцінювання критично важливих захисних заходів у внутрішньому й зовнішньому розгортанні

    Наш комплекс захисних заходів постійно вдосконалюється відповідно до змін у можливостях і середовищі. Наші захисні заходи охоплюють навчання, внутрішнє й зовнішнє розгортання. Наразі вони включають захисні заходи на рівні моделі, засоби забезпечення дотримання правил і засоби безпеки, а також монітори неузгодженості. Вони охоплюють широкий спектр ризиків, зокрема втрату контролю та зловживання, пов’язані з кібернетичними, біологічними й хімічними ризиками. Технічні партнерства дають змогу вже зараз виявляти недоліки захисних заходів, водночас удосконалювати методи оцінювання й прискорювати розроблення стандартів, створюючи міцніше технічне підґрунтя для майбутньої державної політики, здатної відповідати темпам розвитку передових технологій, — особливо щодо внутрішнього розгортання, де стандарти безпеки й захисту ще лише формуються.

    Незалежне оцінювання має визначати, наскільки ефективно працюють ці захисні заходи й де вони можуть бути недостатніми, зокрема:

    1. Чи стійкі захисні заходи за доступу типу «сіра скринька» до змагального тестування (джейлбрейків) і чи достатньо вони захищають від посилення можливостей у сферах високого ризику, як-от кібернетична й біологічна? Чи охоплюють наші змагальне тестування та перевірка на вразливості й ризики найважливіші ризики?

    2. Як під час дозволеного тестування в реалістичних умовах експлуатації агенти взаємодіють із засобами кіберзахисту, як-от контроль доступу, ізольовані середовища й системи виявлення та реагування? Які засоби захисту запобігають шкідливим діям, виявляють або стримують їх і де вони не спрацьовують?

    3. Чи мають наші монітори неузгодженості критичні прогалини, які можуть призвести до втрати контролю або серйозної неузгодженості за внутрішнього чи зовнішнього розгортання? Наскільки надійним джерелом доказів безпеки або узгодженості є моніторинг ланцюжка міркувань у міру вдосконалення можливостей моделі?

    4. Чи впроваджено належний моніторинг на всіх відповідних етапах навчання, оцінювання й розгортання так, щоб його не можна було легко вимкнути?

    5. Чи відповідають упроваджені захисні заходи рівню можливостей?

  3. Оцінювання можливостей, що охоплює категорії ризиків рамкової системи готовності (хімічні й біологічні ризики, кібербезпека, самовдосконалення ШІ), а також оцінювання узгодженості щодо ризиків неузгодженості

    Наша рамкова система готовності вимагає оцінювати ключові напрями ризиків передових моделей. Коли порогові значення перевищуються, а оцінювання досягають межі своєї інформативності, важливо постійно їх оновлювати й забезпечувати охоплення та якість як оцінювання можливостей у сферах ризиків готовності, так і оцінювання узгодженості, спрямованого на визначення ризиків серйозної неузгодженості.

    Серед відповідних запитань:

    1. Чи належно оцінювання ризиків готовності охоплює визначення порогового значення ризику готовності? Чи правильно встановлено порогові значення для такого оцінювання?

    2. Чи оновлюється оцінювання, коли моделі стабільно досягають найвищих результатів, і чи справді нові тести вимірюють розвиненіші можливості?

    3. Чи належно наше оцінювання узгодженості охоплює ризики серйозної неузгодженості та які важливі типи поведінки або умови воно може не враховувати?

  4. Незалежне розслідування критичних інцидентів неузгодженості

    Незалежне розслідування може бути цінним у разі різноманітних критичних інцидентів, пов’язаних із безпекою ШІ. Тут ми зосереджуємося на неузгодженості моделей, зокрема на діях без дозволу або уникненні нагляду, які можуть виявити недоліки методів узгодження й захисних заходів навіть за відсутності навмисного зловживання.

    За певних обставин, як у випадку інциденту OpenAI з Hugging Face, доцільно залучати незалежну третю сторону для проведення незалежного розслідування інцидентів неузгодженості. Вкрай важливо, щоб залучені до розслідування інцидентів треті сторони мали необхідні компетенції, зокрема, де це доречно, досвід кіберкриміналістики й узгодження, масштабного аналізу ланцюжків міркувань, а також персонал і ресурси для своєчасного проведення розслідування. Реагування на інциденти може передбачати доступ до чутливих внутрішніх даних і даних третіх сторін, тому деякі подробиці можуть бути надто чутливими для публікації або надання доступу. Результати незалежних розслідувань також можуть доповнювати обґрунтування безпеки моделі, надаючи докази для оцінювання тверджень про її узгодженість та ефективність заходів з усунення раніше виявленої неузгодженості.

    Щодо інцидентів неузгодженості ми надаємо пріоритет незалежному оцінюванню таких питань:

    1. Яка поведінка моделі чи які проблеми неузгодженості виникли під час інциденту та які основні чинники цьому сприяли?

    2. Чи дадуть захисні й коригувальні заходи змогу ефективно зменшити ризик подібних інцидентів у майбутньому?

Принципи ефективного оцінювання

  • Чітко окреслені та взаємно узгоджені твердження для оцінювання: оцінювання слід починати з взаємно узгодженого обсягу, а потім чітко визначити й попередньо зареєструвати твердження про безпеку до початку оцінювання. Треті сторони й лабораторії мають уточнити, чи йдеться про твердження, які оцінювана компанія хоче подати на розгляд, чи про твердження, які незалежно перевіряє сторонній оцінювач і щодо яких лабораторія погоджується пройти оцінювання. Деякі твердження можуть не входити до обсягу оцінювання з багатьох причин, зокрема через неможливість надати третім сторонам доступ до даних, брак компетенцій в оцінювача або обґрунтовані часові обмеження за термінового оцінювання. Лабораторії та оцінювачі мають запровадити процес розгляду значних ризиків, виявлених поза початковим обсягом, зокрема визначати, чи потрібне подальше дослідження. У висновках слід чітко зазначати, що було й не було оцінено в межах взаємно узгодженого обсягу.

  • Пропорційний доступ: за можливості оцінювачі повинні мати доступ, достатній для оцінювання узгоджених тверджень, у межах правових обмежень і вимог щодо безпеки та інтелектуальної власності. Якщо прямий доступ недоцільний або неможливий, оцінювачі можуть співпрацювати з уповноваженим представником компанії або використовувати механізми непрямого доступу чи доступу зі збереженням приватності для захисту основної інформації.

  • Прозорі методологія та стандарти: оцінювачі мають пояснювати свої методи, критерії оцінювання й невизначеності та, де можливо, спиратися на усталені стандарти. Якщо стандартів іще немає, оцінювачі мають чітко обґрунтовувати використані критерії. У звітах слід відокремлювати безпосередні результати від їх тлумачення, пояснювати невизначеність і чітко вказувати, які висновки підтверджуються доказами.

  • Компетентність і незалежність: оцінювачі мають підтвердити належну технічну компетентність, а також виявляти, розкривати й усувати організаційні та особисті конфлікти інтересів, зокрема фінансові стимули, зв’язки з розробниками й попередню участь у роботі, яку оцінюють. Захисні механізми мають гарантувати, що комерційний тиск і умови винагороди не впливають на результати; вони можуть передбачати самовідвід або належні періоди відсторонення.

  • Безпека й конфіденційність: оцінювачі мають підтвердити застосування практик інформаційної безпеки та юридично забезпечених засобів захисту конфіденційності персоналу, пропорційних чутливості систем і доступної інформації. Ці засоби захисту мають охоплювати інтелектуальну власність, чутливу інформацію та матеріали оцінювання. Якщо оцінювачі не можуть виконати вимоги безпеки у власному середовищі або дані особливо чутливі, може бути доречним доступ на керованих компанією пристроях чи в її приміщеннях.

  • Практичні результати й час на усунення недоліків: оцінювання має виявляти конкретні прогалини й надавати лабораторіям достатньо відомостей для їх усунення. За потреби лабораторіям слід надати обґрунтований строк для усунення проблем до публікації. У відповідних випадках звіти також мають містити висновки для розробників і операторів агентів та фахівців із захисту, а також практичні рекомендації щодо впровадження.

  • Відповідальні практики публікації: звіти про оцінювання мають ґрунтуватися на доказах і бути максимально відкритими за умови захисту чутливої та конфіденційної інформації. Якщо повне публічне розкриття неможливе, підзвітність можна підтримати конфіденційним звітуванням належним наглядовим органам, як-от органам управління чи радам компаній. Для збереження балансу між незалежністю та конфіденційністю слід запровадити обґрунтовані засоби захисту й політики редагування, а також чіткі правила щодо зворотного зв’язку та виправлення неточностей. Оцінювачі мають зберігати редакційну незалежність, водночас забезпечуючи захист конфіденційності та інтелектуальної власності. Оцінювачі мають запровадити чіткі правила редагування, які дозволять лабораторіям вимагати вилучення чутливої інформації, а оцінювачам — зазначати суттєві вилучення та їхній вплив на звіт.

Подальші кроки

Ми прагнемо підтримувати незалежних оцінювачів і встановлювати чіткіші спільні міжнародні стандарти ефективного стороннього оцінювання — як через майбутні закони, так і через приватні інституції управління. Хоча екосистема незалежного оцінювання ще розвивається, ми сприятимемо її зростанню, підтримуючи різноманітну спільноту незалежних оцінювачів із глибокою компетентністю в питаннях безпеки передових моделей і співпрацюючи з нею. Жодна третя сторона не може й не повинна всебічно охоплювати всі нагальні питання безпеки передових моделей. Ми діятимемо виважено й цілеспрямовано, щоб нарощувати власні спроможності та допомагати зростаючій екосистемі третіх сторін узгоджувати найкращі практики й принципи. Ми обговорюємо з кількома третіми сторонами пропозиції, що відповідають наведеним вище пріоритетним напрямам.