Перейти до основного вмісту
OpenAI

Інцидент із Hugging Face та інший вплив неузгоджених моделей на третіх осіб

У міру того як системи ШІ стають потужнішими й автономнішими, неузгоджена поведінка може призводити до вагомих наслідків у реальному світі, зокрема до інцидентів у сфері кібербезпеки та інших результатів, яких розробники могли не передбачити. Тому розуміння того, як виникає й загострюється така поведінка, як її виявляти та як на неї реагувати, стає дедалі важливішою складовою безпечного створення й розгортання передових систем ШІ.

Спочатку ми розглядали інцидент із Hugging Face переважно як проблему безпеки, оскільки він передбачав компрометацію на рівні платформи. Це досі найсерйозніша діяльність такого типу, яку ми виявили у своїх моделях, і головну роль у ній відіграла високопотужна дослідницька модель, призначена лише для внутрішнього використання. Відтоді ми з’ясували, що це вторгнення було зумовлене тим, що моделі вдавалися до неузгоджених стратегій для виконання складних завдань, як описано в технічному звіті про Hugging Face. Інциденти у сфері кібербезпеки — один із проявів цього ризику. Неузгодженість також може спричиняти іншу несподівану чи тривожну поведінку поза межами традиційних категорій безпеки — наприклад, публікацію матеріалів нашими моделями на сторонніх сайтах. Ми називаємо це «агентським спамом». І нам потрібно розв’язувати обидві проблеми.

Ми продовжили аналіз ширшого спектра діяльності, приділяючи першочергову увагу серйознішим інцидентам і поступово охоплюючи менш небезпечну неузгоджену діяльність, зокрема агентський спам.

На цій сторінці зібрано наші звіти й оновлення щодо інциденту з Hugging Face, пов’язані дослідження та публічні презентації, додаткову виявлену нами діяльність, наші висновки про роль неузгодженості моделей і заходи для посилення наших систем. Ми оновлюватимемо цю сторінку в міру просування розслідувань.


Діяльність, що впливає на третіх осіб

Щоб краще зрозуміти масштаби цієї несподіваної поведінки, ми проводимо широку перевірку діяльності наших моделей в інтернеті під час навчання та оцінювання. У межах перевірки ми поступово виявляємо й повідомляємо третіх осіб, починаючи з випадків, коли:

  • Наші моделі могли обійти засоби контролю безпеки третьої особи або порушити доступність онлайн-сервісу; або

  • Випадки неузгодженості негативно вплинули на сторонні вебсайти чи сервіси.

За результатами проведеної на сьогодні перевірки ми повідомили десятки третіх осіб відповідно до наведених вище критеріїв. Перевірка минулої діяльності триває й потребуватиме значного часу та ресурсів. У міру продовження цієї роботи ми повідомлятимемо додаткових третіх осіб.

Нижче ми публікуємо анонімізовані зведення з описом типів виявленої неузгодженої діяльності. Ми оновлюватимемо ці описи в міру повідомлення додаткових третіх осіб і поглиблення нашого розуміння. Крім того, ми публікуватимемо важливі оновлення про стан перевірки. Зазвичай ми не вказуватимемо імен та інших ідентифікаційних даних, коли це потрібно для захисту постраждалих сторін, хоча поінформовані сторони можуть вирішити публічно оприлюднити надану нами інформацію.

Зведення про виявлену діяльність

Проведений на сьогодні процес перевірки й повідомлення виявив такі категорії діяльності:

  • Обхід контролю доступу: агенти отримують доступ до інформації чи функцій, для яких зазвичай потрібні перевірка особи, спеціальний дозвіл, підписка або обліковий запис. Наприклад, агент використовував іншу вебадресу, змінював дані в запиті або покладався на сеанс входу, який надавав йому ширший доступ, ніж очікувалося.

  • Використання розкритих облікових даних: агенти знаходили оприлюднені дані для входу чи ключі доступу та використовували їх для доступу до сервісу.

  • Ін’єкція запитів або команд: агенти вводили на вебсайті чи в сервісі текст, який сервіс сприймав як інструкцію, а не як звичайні вхідні дані. Унаслідок цього сервіс міг виконати запит до бази даних, код програми або команду на своєму сервері.

  • Доступ до внутрішніх компонентів середовища виконання: агенти читали файли з реалізацією сервісу або взаємодіяли з фоновою системою, призначеною для внутрішнього використання. У цих випадках агент отримував доступ до частин сервісу, що виходили за межі передбаченого для нього доступу.

  • Агентський спам: агенти публікують на сторонніх сайтах інформацію, яка може змінити їхній вміст і потребувати очищення — наприклад, використовують загальнодоступні вікісторінки як спільні дошки повідомлень.


Хронологія подій

Вересень

Серпень

Липень