Прескокни до главната содржина
OpenAI
Се вчитува...

Денес го објавуваме GPT‑6 Astra, најспособниот модел што досега сме го пуштиле во широка употреба. Astra е нашиот прв модел што го достигна критичното ниво на способности за сајбербезбедност според нашата Рамка за подготвеност.

Најважните работи што треба да ги знаете за безбедноста на ова издание се следниве:

  1. GPT‑6 Astra претставува значителен напредок во сајберспособностите и го достигнува нашиот критичен праг. Тоа значи дека, со соодветни алатки и пристап, GPT‑6 Astra може да открива дотогаш непознати безбедносни пропусти и да развива нови начини за нивно искористување во многу добро заштитени системи, без човек да го насочува секој чекор. Затоа значително ги зајакнавме мерките за спречување на штетни сајбердејства од моделот, без оглед дали се последица на злоупотреба или неусогласеност. Презедовме и мерки за да ги обезбедиме нашиот внатрешен развој и примената на Astra и слични модели, вклучувајќи построга изолација, шифрирање на контролните точки, универзално следење на целосните траектории, вклучително и синџирите на мисли (CoT), како и процес на евалуација на усогласеноста што може да ја блокира внатрешната употреба.
  2. GPT‑6 Astra е значително поотпорен од своите претходници. Благодарение на новите техники за безбедносна обука за отпорност, GPT‑6 Astra е значително поотпорен на пробивања од GPT‑5.6 Sol, вклучително и во подолги траектории. Ова го знаеме од офлајн тестовите и од нашата програма за ригорозно внатрешно и надворешно тестирање и отстранување на пробивањата. За корисниците означени како потенцијално високоризични, дополнително го обучивме моделот поконзервативно да ја приспособува границата за одбивање и да опфаќа поширок спектар ризици од двојна употреба. Со регресивно тестирање проверуваме дали Astra е отпорен на пробивањата откриени во претходните периоди на тестирање, а спроведовме и нови циклуси на автоматизирано тестирање на отпорноста со нашите најнови внатрешни напаѓачки системи за да ги потврдиме подобрувањата.
  3. GPT‑6 Astra е подобро усогласен од GPT‑5.6 Sol. Astra претставува значителен исчекор во усогласувањето на моделите и вклучува подобрувања што се протегаат од составот на податоците за претходно обучување до оценувањето при зајакнување на учењето. Објавуваме нов пакет евалуации на усогласеноста(се отвора во нов прозорец) и утврдуваме дека GPT‑6 Astra подобро ги почитува безбедносните и сигурносните граници и останува во рамките на овластениот опсег. Во симулација со повеќе од 54.000 внатрешни задачи на Codex(се отвора во нов прозорец), Astra доби и приближно половина помалку ознаки за потешки облици на неусогласено однесување во споредба со Sol.
  4. Широко воведуваме следење на неусогласеноста. Усогласувањето на моделите го сметаме за главниот механизам за спречување потенцијално неусогласено однесување на нашите модели. Сепак, следењето овозможува широк увид во однесувањето на граничните модели и ги открива можностите за натамошно подобрување на усогласеноста и безбедноста. Дополнително, следењето служи како уште еден слој за заштита од откриеното неусогласено однесување. Поради овие причини, додадовме и следење на неусогласеноста при сите заклучувања со употреба на алатки во надворешната примена на Astra, и покрај значителниот трошок за пресметковни ресурси. Овој систем е сличен на нашата внатрешна поставеност.
  5. Можноста за следење на GPT‑6 Astra е намалена во споредба со GPT‑5.6 Sol. Спроведовме опсежни истражувања на можноста за следење(се отвора во нов прозорец) и можноста за контролирање(се отвора во нов прозорец) на GPT‑6 Astra. Утврдивме дека GPT‑6 Astra е поспособен да го контролира сопствениот CoT од GPT‑5.6 Sol и поретко вклучува инкриминирачки информации во својот CoT. Во противнички услови, кога го поттикнуваме моделот да ги избегне нашите системи за следење, утврдуваме дека моделот може да остане неоткриен кога стратегиски постигнува послаби резултати во евалуациите (стратегиско попречување), а понекогаш може да ги избегне и нашите внатрешни системи за следење кога од него се бара да изврши одредени задачи за саботажа(се отвора во нов прозорец). Не забележавме докази за стеганографско расудување во CoT (на пример, прикривање скриено расудување во обичен и навидум неповрзан текст), што укажува дека ризикот од избегнување можеби главно е ограничен на задачи што бараат помалку расудување.
    • Овие наоди укажуваат дека моделите од класата Astra би можеле да ги избегнат нашите системи за следење на CoT во противнички услови. Засега, овие наоди главно се темелат на противнички евалуации, односно кога му наложуваме на моделот да го избегне следењето, додека нашите севкупни евалуации на усогласеноста покажуваат дека Astra генерално поретко ги прекршува безбедносните и сигурносните ограничувања од GPT‑5.6 Sol.
    • Сепак, сериозно го сфаќаме овој тренд и продолжуваме да ги истражуваме наодите и нивните последици врз можноста за следење додека нашите модели стануваат поспособни. OpenAI работи на зачувување и користење на следењето на синџирот на мисли, а зачувувањето на можноста за следење на CoT е главна цел на истражувачката програма. Сепак, овие резултати ја нагласуваат и важноста од развивање техники за проверка на усогласеноста што не се ограничуваат само на испитување на синџирот на мисли на моделот.
  6. GPT‑6 Astra поодговорно се снаоѓа при прелистување и во работни средини: GPT‑6 Astra е значително поотпорен на вметнување злонамерни промптови од GPT‑5.6 Sol. Дополнително го тестиравме однесувањето на моделот во реалистични средини за прелистување и професионална работа на компјутер и утврдивме дека, во споредба со GPT‑5.6 Sol, моделот значително поретко презема неусогласени и потенцијално деструктивни дејства, како неовластени трансакции, губење податоци, прекумерен пристап или заобиколување на контролите. Исто така, постапува побезбедно при обработка на штетни барања во агентски средини, како што се барања за помош при планирање насилен напад или извршување измама.
  7. GPT‑6 Astra е значително побезбеден во поризични сценарија. GPT‑6 Astra одговара побезбедно од GPT‑5.6 Sol на сложени барања преземени од продукциската употреба и од противничко тестирање на отпорноста спроведено од луѓе. Astra постигнува Парето-подобрување: побезбедно одговара на небезбедни барања, а притоа избегнува непотребно одбивање на безопасните барања. Овие подобрувања ги опфаќаат и сценаријата со тешки последици, каде што ризикот од штета произлегува од поширокиот контекст, а не од изречно барање. Astra подоследно применува и безбедносни граници соодветни на возраста за корисници помлади од 18 години.