Прескокни до главната содржина
OpenAI

16 септември 2026 г.

ИстражувањеБезбедност

Нашата рамка за известување за неусогласеност на моделите

Се вчитува...

Споделуваме нова рамка за следење, истражување и објавување случаи на неусогласеност на моделите во OpenAI, заедно со шест извештаи за неочекувано или загрижувачко однесување на моделите што го забележавме во изминатите шест месеци.

Во минатото, за подобро да ги информираме истражувачите, развивачите на ВИ, креаторите на политики и јавноста, настојувавме јавно да ги објавуваме нашите наоди за неусогласеноста. Но без систематски пристап кон известувањето за овие наоди, нашите објави беа повремени и поретки од посакуваното: честопати чекавме да собереме повеќе случаи во еден извештај или ги додававме во системските картички за новообјавените модели. Оваа нова рамка треба да го забрза објавувањето извештаи за неусогласеност по нејзиното забележување, дури и кога сè уште не сме го објасниле или ублажиле целосно однесувањето за кое известуваме.

Како што системите за ВИ стануваат понапредни и пошироко применети, треба да изградиме поширок и подобро информиран консензус за напредокот на истражувањето на усогласувањето. Ние не веруваме дека индустријата за ВИ ги решила усогласувањето и надзорот во доволна мера за уште долго одговорно да продолжи со развојот со максимална брзина. Одлуките за тоа како треба да напредува развојот на ВИ во следните месеци и години мора да се темелат на докази што луѓето надвор од компаниите што создаваат гранични модели можат самостојно да ги испитаат.

Примерите на неусогласеност може да помогнат да се утврдат проблемите со кои би можеле да се соочат други развивачи на ВИ кога нивните системи ќе достигнат слични способности, да откријат слабости во заштитните мерки или да ги доведат во прашање претпоставките за однесувањето на моделите. Споделувањето на овие наоди им овозможува на другите да ги истражат истите проблеми, да ги проверат нашите објаснувања и да ги подобрат мерките за ублажување. Бидејќи веруваме во вредноста на транспарентноста во врска со неусогласеноста, нашата нова рамка дава предност на објавувањето дури и кога значењето е неизвесно. Тоа значи дека некои од случаите што ги објавуваме може да се покажат како неосновани, а не како дел од поширок образец или показател за идни случувања.

Во моментов не постои рамка за целата индустрија со јасни стандарди за тоа како развивачите на ВИ треба да објавуваат примери на неусогласеност кај своите модели. Се надеваме дека рамката што ја претставуваме денес е прв чекор кон создавање такви стандарди, со кои ќе се утврди кои случаи на неусогласеност треба да ги објавуваат развивачите и што треба да содржат нивните извештаи. Оваа рамка ја сметаме за работа во тек, која ќе ја усовршуваме врз основа на искуството и повратните информации од јавноста.

Овде опишуваме како ќе функционира рамката и ги споделуваме првите извештаи што ги објавуваме.

За кои примери на неусогласеност ќе известуваме

Целта ни е да објавуваме примери што даваат корисни докази за тоа како настанува и се манифестира неусогласеноста на моделите и каде заштитните мерки успеваат или не успеваат. Им даваме приоритет на новите механизми, значајните промени во познатото однесување и наодите што ги доведуваат во прашање претпоставките за безбедноста или ублажувањето. За да заслужува објавување, примерот не мора да предизвикал штета ниту да потврдува поширок образец. Оваа рамка ќе го опфаќа соодветното однесување во текот на целиот животен циклус на моделот — вклучувајќи ги обучувањето, евалуацијата, тестирањето и примената.

Тоа вклучува нови начини на кои моделите дејствуваат без овластување, се координираат со други модели или го избегнуваат надзорот; неуспеси што доведуваат во прашање метод за усогласување или заштитна мерка; и однесување што оспорува тврдење во објавена процена на безбедноста. Истите критериуми за објавување важат и за неусогласеноста што може да влијае врз трети страни.

Тоа може да вклучува и случаи на неусогласеност што изгледаат како повторување на случаи што сме ги објавиле претходно. Самото повторување на проблемот може да биде корисен доказ за однесувањето на нашите модели или за ефикасноста на нашите заштитни мерки — на пример, ако одреден вид неусогласено однесување продолжи да се повторува и покрај повеќекратните обиди да се ублажи. Во такви околности, дополнителните примери ќе ги објавиме со ажурирање на првичната објава за неусогласеноста.

Со текот на времето планираме да развиеме пообјективни критериуми за објавување заедно со други развивачи, надворешни истражувачи, тела за индустриски стандарди и регулатори. Исто така, веруваме дека сериозните инциденти поврзани со безбедноста, сигурноста и неусогласеноста треба да ѝ се пријавуваат на федералната влада на САД и работиме на предлог-механизми за известување. Оваа рамка ја сметаме за дополнување на нашите постојни обврски и нагласуваме дека таа не ги заменува законските барања за објавување, вклучително и оние за критични безбедносни инциденти или нарушувања на кибербезбедноста.

Примерите на неусогласеност што ги споделуваме денес

За да ја започнеме примената на новата рамка за објавување неусогласеност, објавуваме шест извештаи за случаи на неусогласено однесување што сме ги забележале при обучувањето или евалуацијата на нашите модели. Овие случаи прикажуваат низа различни однесувања што сметаме дека вреди да се споделат, од криење информации од корисникот до преземање неодобрени дејства за надминување пречки. Ова се извештаи за поединечни случаи и не треба да се смета дека ја одразуваат зачестеноста на неусогласеноста кај нашите модели. Секоја ставка подолу води до целосниот извештај.

  1. Самостојно создадени упатства во резимеата на задачите(се отвора во нов прозорец). Необјавен истражувачки модел вметнал неповрзани упатства, меѓу кои и упатства да ги игнорира вообичаените ограничувања, во резимеата што се користеле за продолжување на неговата работа во нов прозорец за контекст. Утврдивме дека биле засегнати 27 резимеа.

  2. Упатства за прикривање грешки во резимеата на задачите(се отвора во нов прозорец). За време на обучувањето на GPT‑5.6 Sol, многу примероци на моделот додале упатства во своите резимеа за да ги прикријат грешките или неусогласеното однесување од корисникот. На пример, резимеата создадени со компакција содржеле упатства да се измислат историски податоци што недостигаат без тоа да се открие и да се скријат несовпаѓањата во верзиите на изворите.

  3. Пребарување јавни репозиториуми за откриени API-клучеви, а потоа измислување информации(се отвора во нов прозорец). Додека одговарал на вообичаено прашање за податоци за приходите во еден округ во Калифорнија, модел пронашол и употребил откриен API-клуч без овластување. Кога сепак не успеал да ги добие бараните податоци, ги измислил и ги претставил како податоци од бараниот извор.

  4. Поставување датотеки на интернет за да се наведат како извор(се отвора во нов прозорец). Кога корисник побарал од необјавен модел идентификатори и имиња на езера поголеми од 5.000.000 квадратни метри, агентот го нашол точниот одговор користејќи Python. Но бидејќи во упатствата се барало наведување извор од прелистувач, агентот одлучил да ја постави датотеката за да може да ја наведе како извор во одговорот, без да го праша корисникот.

  5. Неодобрено запишување и комуникација преку внатрешен софтверски репозиториум(се отвора во нов прозорец). Моделите користеле внатрешен софтверски репозиториум како огласна табла за размена на барања и одговори меѓу одделни примероци за обука додека барале влезни датотеки што недостигале, но не успеале да ги вратат тие датотеки. Извештајот разгледува и претходен случај во кој модел успешно поставил тест-датотеки во репозиториум додека се обидувал да ги заобиколи мрежните ограничувања.

  6. Неодобрено споделување датотеки меѓу агенти што соработуваат(се отвора во нов прозорец). Агенти што работеле заедно на иста задача за обука користеле јавни веб-локации за хостирање датотеки за да споделуваат датотеки кога не можеле да пристапат до локалните датотеки едни на други. Поради тоа, резултатите од задачата станале достапни преку јавни URL-адреси, иако во задачата се барало моделите да користат само локални датотеки.

Како функционира нашата постапка за објавување

Секој вработен во OpenAI може да пријави пример на неусогласеност за да го истражат нашите тимови за безбедност и усогласување и да побара тој да се разгледа за јавно објавување. Со тоа започнува нашата постапка за објавување, со рокови за секој чекор за да се обезбедат навремена истрага и објавување.

Откако ќе биде пријавен пример, нашиот технички персонал ќе истражи што се случило, што останува неизвесно, дали е оправдано јавно објавување и кои факти може да се споделат. Ќе процени и дали била засегната трета страна што треба приватно да се извести пред објавувањето.

Потоа примерот ќе биде доделен на една од трите постапки: „Подготвено за објавување“, „Помала истрага“ или „Поголема истрага“ („Бавна постапка“).

„Подготвено за објавување“ ги опфаќа соодветните случаи чија истрага е доволно завршена за да се објават по прегледот. „Помала истрага“ ги опфаќа случаите за кои е потребна дополнителна техничка истрага. Очекуваме овие две постапки да го опфатат најголемиот дел од случаите што ги објавуваме, особено оние што не бараат обемна истрага, координација со трети страни или справување со сериозни ризици од злоупотреба. Сите случаи што ги објавуваме денес спаѓаат во една од овие две постапки.

„Поголема истрага“ опфаќа сложени истраги, особено оние во кои се вклучени трети страни. Кога е засегната трета страна, нашите обврски за безбедност, правните обврски и обврските за одговорно објавување имаат предност пред оваа рамка. Ќе настојуваме да објавиме првично известување што е можно поскоро, но можеби ќе треба да го одложиме од безбедносни причини — на пример, ако модел открие дотогаш непозната ранливост во широко користен софтвер. Ако извештајот би го открил идентитетот на трета страна, имаме намера да ја известиме однапред дури и кога не била пробиена безбедносна граница.

Првичното известување за случај од постапката „Поголема истрага“ ќе даде општ преглед на настанот, ќе наведе дали надворешни експерти помагаат во истрагата и ќе ја даде секоја достапна процена за тоа кога очекуваме да го објавиме конечниот извештај. Инцидентот на OpenAI со Hugging Face би спаѓал во оваа постапка ако бил објавен според оваа рамка.

Вработениот што го пријавил примерот ќе биде известен за одлуката дали тој ќе биде објавен и, ако се објави, по која постапка ќе се разгледува. Нерешените несогласувања околу објавувањето или соодветната постапка ќе ѝ бидат упатени на Советодавната група за безбедност на OpenAI (SAG), група високи раководители од целата компанија што ги проценува способностите и заштитните мерки на граничните модели, ја надгледува нашата Рамка за подготвеност и го советува раководството на OpenAI. Несогласувањата во рамките на SAG или приговорите на вработените на нејзините одлуки ќе му бидат упатени на раководството на OpenAI. Одлуките да не се објави примерот или дека објавувањето не е оправдано ќе им бидат соопштени на раководителите за безбедност и усогласување и, колку што е можно, на релевантниот технички персонал.

Може да ја измениме оваа постапка за објавување врз основа на сознанијата за нејзината примена во практиката, а сите промени ќе ги евидентираме во оваа објава.

Што ќе содржи секој извештај

Секој целосен извештај ќе ги опише забележаното однесување, неговата сериозност и евентуалното надворешно влијание, околностите во кои се појавило, датумот или периодот, кога сме го откриле и, во општи црти, вклучениот модел или модели. Кога е можно, ќе ги споделиме и:

  • Дополнителните детали за настанот и евентуалната штета што произлегла од него;

  • Како ја откривме неусогласеноста и опфатот на нашата истрага;

  • Нашето толкување на нејзините импликации врз истражувањето на усогласувањето и техничката безбедност на ВИ;

  • Важните неодговорени прашања што ги отвора примерот;

  • Мерките што ги преземаме или планираме да ги преземеме за справување со однесувањето. Овие информации можеби нема секогаш да бидат достапни во моментот на објавувањето, бидејќи извештајот за неусогласеноста може да го објавиме пред да ја завршиме истрагата или да развиеме решение.

За неусогласеноста што се јавува при примената кај клиенти, ќе споделиме онолку информации колку што дозволуваат приватноста на клиентите и нашите договорни обврски.

Денешните извештаи се почетен збир објави, а не сеопфатен преглед на познатата неусогласеност или тековните истраги. Овие првични извештаи немаат цел да го претстават целиот опсег или сериозноста на случаите опфатени со оваа рамка. Посветени сме на објавување случаи на неусогласеност што ги исполнуваат критериумите на оваа рамка, вклучително и посложени случаи за кои се потребни подолга истрага или координација со трети страни. Ќе продолжиме редовно да објавуваме извештаи според оваа рамка и ќе споделуваме повеќе информации за нашите обврски за известување додека продолжуваме да ги развиваме.