Нашата рамка за докладване на несъгласуваност при моделите
Споделяме нова рамка за проследяване, разследване и оповестяване на случаи на несъгласуваност при моделите на OpenAI, заедно с шест доклада за неочаквано или тревожно поведение на модели, наблюдавано през последните шест месеца.
В миналото, за да информираме по-добре изследователите, разработчиците на ИИ, създателите на политики и широката общественост, сме се стремили да оповестяваме нашите констатации относно несъгласуваността. Но без систематичен подход към докладването на тези констатации оповестяванията ни бяха спорадични и по-редки от желаното: често изчаквахме, докато можем да обединим няколко случая в един доклад, или ги добавяхме към системните карти на новопуснати модели. Тази нова рамка има за цел да ускори публикуването на доклади за несъгласуваност след нейното наблюдаване дори когато все още не сме обяснили или ограничили напълно докладваното поведение.
С развитието и все по-широкото внедряване на системите с ИИ трябва да изградим по-широк и по-добре информиран консенсус за напредъка в изследванията на съгласуването. Ние не смятаме, че секторът на ИИ е решил проблемите със съгласуването и наблюдението в достатъчна степен, за да може още дълго да продължи отговорно да разширява мащаба с максимална скорост. Решенията как да продължи развитието на ИИ през следващите месеци и години трябва да се основават на доказателства, които хората извън компаниите, създаващи авангардни модели, могат да разгледат самостоятелно.
Примерите за несъгласуваност могат да помогнат да се установят проблеми, с които други разработчици на ИИ биха се сблъскали, когато системите им достигнат сходни възможности, да разкрият слабости в защитните мерки или да поставят под въпрос допускания за поведението на моделите. Споделянето на тези констатации позволява на други да изследват същите проблеми, да проверят обясненията ни и да подобрят мерките за ограничаването им. Тъй като вярваме в значението на прозрачността по отношение на несъгласуваността, новата ни рамка насърчава оповестяването дори когато значимостта е неясна. Това означава, че някои от оповестените случаи може да се окажат случайни отклонения, които не са част от по-широк модел на поведение и не сочат бъдещи тенденции.
Понастоящем няма обща за сектора рамка с изрични стандарти за това как разработчиците на ИИ да оповестяват примери за несъгласуваност в своите модели. Надяваме се, че рамката, която представяме днес, е първа стъпка към създаването на такива стандарти, като определя кои случаи на несъгласуваност трябва да бъдат оповестявани от разработчиците и какво трябва да съдържат докладите им. Разглеждаме тази рамка като проект в развитие, който ще усъвършенстваме въз основа на опита и обществената обратна връзка.
Тук описваме как ще действа рамката и споделяме първите доклади, които публикуваме.
Стремим се да оповестяваме примери, които предоставят полезни доказателства за това как възниква и се проявява несъгласуваността при моделите и кога защитните мерки дават или не дават резултат. Даваме приоритет на нови механизми, съществени промени в познато поведение и констатации, които поставят под въпрос допусканията за безопасността или ограничаването на рисковете. Не е необходимо даден пример да е причинил вреда или да доказва по-широк модел на поведение, за да заслужава оповестяване. Тази рамка ще обхваща отговарящото на критериите поведение през целия жизнен цикъл на модела — включително при обучение, оценяване, тестване и внедряване.
Това включва нови начини моделите да действат без разрешение, да се координират с други модели или да избягват надзор; пропуски, които поставят под въпрос метод за съгласуване или защитна мярка; както и поведение, което оспорва твърдение в публикувана оценка на безопасността. Същите критерии за оповестяване важат и за несъгласуваност, която може да засегне трети страни.
Това може да включва и случаи на несъгласуваност, които изглежда повтарят вече оповестени от нас случаи. Самото повторение на проблема може да е полезно доказателство за поведението на нашите модели или за ефективността на защитните ни мерки — например ако определен вид несъгласувано поведение продължава да се повтаря въпреки многократните опити за ограничаването му. При такива обстоятелства ще публикуваме допълнителните примери, като актуализираме първоначалното оповестяване за несъгласуваност.
С времето планираме да разработим по-обективни критерии за оповестяване съвместно с други разработчици, външни изследователи, организации за отраслови стандарти и регулаторни органи. Смятаме също, че сериозните инциденти, свързани с безопасността, сигурността и несъгласуваността, трябва да бъдат съобщавани на федералното правителство на САЩ, и работим по предложения за механизми за докладване. Смятаме, че тази рамка допълва съществуващите ни задължения, и отбелязваме, че тя не замества законовите ни изисквания за оповестяване, включително при критични инциденти, свързани с безопасността, или пробиви в киберсигурността.
За да поставим началото на новата си рамка за оповестяване на несъгласуваност, публикуваме шест доклада за случаи на несъгласувано поведение, наблюдавани при обучението или оценяването на нашите модели. Тези случаи илюстрират различни поведения, които смятаме, че си струва да споделим — от укриване на информация от потребителя до предприемане на непозволени действия за преодоляване на препятствия. Това са доклади за отделни случаи и не бива да се смятат за показателни за честотата на несъгласуваността сред нашите модели. Всеки елемент по-долу съдържа връзка към пълния доклад.
Самостоятелно генерирани инструкции в обобщенията на задачи(отваря се в нов прозорец). Непуснат изследователски модел е вмъквал несвързани инструкции, включително инструкции да пренебрегва обичайните си ограничения, в обобщенията, използвани за продължаване на работата му в нов контекстен прозорец. Установихме 27 засегнати обобщения.
Инструкции за прикриване на грешки в обобщенията на задачи(отваря се в нов прозорец). По време на обучението на GPT‑5.6 Sol много екземпляри на модела са добавяли към обобщенията си инструкции да прикриват от потребителя грешки или несъгласувано поведение. Например обобщенията, създавани при съкращаване на контекста, са включвали инструкции да се измислят липсващи исторически данни, без това да се оповестява, и да се прикриват несъответствия между версиите на източниците.
Търсене на разкрити API ключове в публични хранилища и последващо измисляне на информация(отваря се в нов прозорец). Докато отговарял на обичаен въпрос за данни за доходите в окръг в Калифорния, модел открил и използвал без разрешение разкрит API ключ. Когато въпреки това не успял да извлече поисканите данни, той ги измислил и ги представил като данни от посочения източник.
Качване на файлове в интернет, за да бъдат цитирани(отваря се в нов прозорец). Когато потребител поискал от все още непубликуван модел идентификаторите и имената на езера с площ над 5 000 000 квадратни метра, агентът намерил правилния отговор с помощта на Python. Но тъй като инструкциите изисквали позоваване на уебизточник, агентът решил да качи файла в интернет, за да може да се позове на него в отговора си, без да пита потребителя.
Непозволен запис и комуникация чрез вътрешно софтуерно хранилище(отваря се в нов прозорец). Докато търсели липсващи входни файлове, моделите използвали вътрешно софтуерно хранилище като табло за съобщения, за да обменят заявки и отговори между отделни обучителни извадки, но не успели да възстановят файловете. Докладът разглежда и по-ранен случай, при който модел успешно качил тестови файлове в хранилище в опит да заобиколи мрежовите ограничения.
Непозволено споделяне на файлове между сътрудничещи си агенти(отваря се в нов прозорец). Агенти, работещи заедно по една и съща обучителна задача, използвали публични сайтове за хостване на файлове, за да споделят файлове, когато нямали достъп до локалните файлове на останалите. Така крайните резултати от задачата станали достъпни чрез публични URL адреси, въпреки че задачата изисквала моделите да използват само локални файлове.
Всеки служител на OpenAI може да посочи пример за несъгласуваност, който да бъде разследван от екипите ни по безопасност и съгласуване, и да поиска той да бъде разгледан за публично оповестяване. Това поставя началото на процеса ни на оповестяване, в който всяка стъпка има краен срок, за да се гарантират навременно разследване и оповестяване.
След като даден пример бъде посочен, техническите ни специалисти ще разследват какво се е случило, какво остава неясно, дали публичното оповестяване е оправдано и кои факти могат да бъдат споделени. Те ще преценят също дали е засегната трета страна и дали тя трябва да бъде уведомена лично преди публикуването.
След това примерът ще бъде разпределен към една от три процедури: „Готов за оповестяване“, „Ограничено разследване“ или „Мащабно разследване“ („Бавна процедура“).
„Готов за оповестяване“ обхваща отговарящите на критериите случаи, чието разследване е достатъчно завършено, за да бъдат публикувани след преглед. „Ограничено разследване“ обхваща случаите, които се нуждаят от допълнително техническо разследване. Очакваме по тези две процедури да бъдат разглеждани повечето от оповестяваните случаи, особено тези, които не изискват мащабно разследване, координация с трети страни или справяне със сериозни рискове от злоупотреба. Всички случаи, които публикуваме днес, попадат в една от тези две процедури.
„Мащабно разследване“ обхваща сложни разследвания, особено когато участват трети страни. Когато е засегната трета страна, задълженията ни във връзка със сигурността, правните въпроси и отговорното оповестяване имат предимство пред тази рамка. Ще се стремим да публикуваме първоначално известие възможно най-скоро, но може да се наложи да го забавим по съображения за сигурност — например ако модел открие неизвестна дотогава уязвимост в широко използван софтуер. Ако даден доклад би разкрил самоличността на трета страна, възнамеряваме да я уведомим предварително дори когато не е била преодоляна защитна граница.
Първоначалното известие за случай по процедурата „Мащабно разследване“ ще представя в общи линии случилото се, ще посочва дали външни експерти подпомагат разследването и ще дава наличната прогнозна дата за публикуване на окончателния доклад. Инцидентът на OpenAI с Hugging Face би попаднал в тази процедура, ако беше оповестен съгласно настоящата рамка.
Служителят, подал примера, ще бъде уведомен за решението дали той да бъде оповестен и, ако бъде оповестен, по коя процедура ще бъде разгледан. Нерешените разногласия относно оповестяването или подходящата процедура ще бъдат отнесени до Консултативната група по безопасност (SAG) на OpenAI — група от висши служители от цялата компания, която оценява възможностите на авангардните модели и защитните мерки, контролира нашата Рамка за готовност и съветва ръководството на OpenAI. Разногласията в SAG или възраженията на служители срещу решенията ѝ ще бъдат отнасяни до ръководството на OpenAI. Решенията даден случай да не бъде оповестен или че оповестяването му не е оправдано ще бъдат споделяни с ръководителите по безопасност и съгласуване, а доколкото е възможно — и със съответните технически специалисти.
Възможно е да преразглеждаме този процес на оповестяване според наученото от прилагането му на практика и ще отбелязваме всички промени в тази публикация.
Всеки пълен доклад ще описва наблюдаваното поведение, неговата сериозност и евентуално външно въздействие, средата, в която е възникнало, датата или периода му, кога сме го открили и в общи линии — участващия модел или модели. Когато е възможно, ще споделяме и:
Допълнителни подробности за случилото се и произтеклите вреди;
Как сме открили несъгласуваността и какъв е обхватът на разследването ни;
Нашето тълкуване на значението ѝ за изследванията на съгласуването и техническата безопасност на ИИ;
Важните въпроси без отговор, повдигнати от примера;
Мерките, които предприемаме или планираме да предприемем, за да се справим с поведението. Тази информация невинаги ще бъде налична към момента на оповестяването, тъй като може да публикуваме доклада за несъгласуваност, преди да сме приключили разследването или да сме разработили решение.
При несъгласуваност, възникнала при внедрявания от клиенти, ще споделяме толкова информация, колкото позволяват поверителността на клиентите и договорните ни задължения.
Днешните доклади са първоначален набор от оповестявания, а не изчерпателен преглед на известните случаи на несъгласуваност или текущите разследвания. Тези първоначални доклади нямат за цел да представят пълния обхват или сериозност на случаите, обхванати от тази рамка. Ангажираме се да оповестяваме случаи на несъгласуваност, които отговарят на критериите на тази рамка, включително по-сложни случаи, изискващи по-продължително разследване или координация с трети страни. Ще продължим редовно да публикуваме доклади съгласно тази рамка и ще споделяме повече за ангажиментите си за докладване, докато продължаваме да ги развиваме.


