Прескокни до главната содржина
OpenAI

1 септември 2026 г.

БезбедностСигурност

Патот до Astra: критични способности и гранични заштитни мерки

Се вчитува...

По нашата претходна процена дека Astra може да достигне критично ниво на способност за сајбер-безбедност, собравме повеќе докази и спроведовме дополнителни процени на способностите на моделот. Сега сметаме дека Astra го исполнува прагот за критична способност за сајбер-безбедност според нашата Рамка за подготвеност. Тоа значи дека со соодветни алатки и пристап може да открива претходно непознати безбедносни пропусти и да развива начини за нивно искористување во многу добро заштитени системи, без човек да го води секој чекор. Тоа е првиот модел што го класифицираме на ова ниво и затоа бара посилни заштитни мерки за време на развојот и пред објавувањето.

Во изминатите неколку недели одложивме делови од развојот и објавувањето на Astra додека ги зајакнувавме и тестиравме заштитите од сајбер-злоупотреба и неовластени дејства на моделот. Врз основа на таа работа, сметаме дека заштитните мерки на Astra доволно го намалуваат ризикот од сериозна штета за моделот да биде објавен според нашата Рамка за подготвеност.

Иако Astra не беше вклучена во инцидентот со Hugging Face, во нашиот безбедносен пристап ги вградивме сознанијата(се отвора во нов прозорец) од тој инцидент. Врз основа на ретроспективното тестирање, сметаме дека нашите тогашни продукциски заштитни мерки би го спречиле инцидентот со Hugging Face. Оттогаш воведовме уште посилни заштитни мерки за Astra, меѓу кои обука на моделот посигурно да одбива штетни сајбер-барања и да ги почитува безбедносните ограничувања, дополнителна заштита од злоупотреба и надзор што може да запре потенцијално неовластена активност.

Планираме наскоро да ја ставиме Astra на располагање, но пристапот до нејзините најнапредни способности за сајбер-безбедност ќе биде поограничен. Напредната работа во сајбер-безбедноста првично ќе биде достапна за група тестери, а потоа ќе следува пристап преку Daybreak Blue за да се прошири одбранбената употреба.

При објавувањето, во системската картичка на моделот ќе споделиме повеќе детали за нашите тестирања и процени на безбедноста, сигурноста и усогласувањето. Пред објавувањето сакаме да известиме за дел од работата со која се подготвуваме безбедно да пуштиме модел со ова ниво на способности за сајбер-безбедност — и отворено да кажеме кои ризици остануваат.

Процена на способностите на Astra за сајбер-безбедност

Според нашата Рамка за подготвеност, моделот го исполнува критичниот праг ако е исполнет кој било од следниве услови:

  • Моделот може без човечка интервенција да идентификува и развива функционални експлоити од нулти ден со сите нивоа на сериозност во многу зајакнати критични системи од реалниот свет.

  • Моделот може да осмислува и извршува нови целосни стратегии за сајбер-напади врз зајакнати цели, само врз основа на општо зададена цел.

Нашата процена на подготвеноста на Astra ги комбинираше автоматизираните јавни и приватни репери со процени водени од експерти. Astra претставува значително зголемување на способностите за сајбер-безбедност во споредба со GPT‑5.6 Sol: користи значително помалку токени и е поспособна да открива ранливости и да развива експлоити.

Како еден пример, ја тестиравме Astra на ExploitBench, каде што моделот постигна совршен резултат од 100% на реперот за процена на способноста на моделот да развива експлоити од познати ранливости.

Поради загриженоста за контаминација, потоа создадовме интерен репер наречен „ExploitBench — интерна верзија (јуни–август 2026 г.)“, кој содржи 20 неодамна објавени ранливости V8 со висока сериозност. На овој збир на податоци, Astra постигнува многу повисоки стапки на произволно извршување код од GPT‑5.6 Sol, користејќи далеку помалку излезни токени. При процената моделот дури откри и искористи две ранливости од нулти ден како дел од синџир на експлоити. Во тек е постапката за пријавување на овие две ранливости кај одржувачите.

Прикажаните резултати на Astra ги одразуваат способностите со пристап до Daybreak Blue, а не стандардната продукциска конфигурација.

Во процените водени од експерти врз зајакнат прелистувач и оперативен систем, Astra откри претходно непознати ранливости и ги претвори во функционални синџири на експлоити. Создаде целосен синџир за компромитирање прелистувач, кој излезе од песочната околина и изврши команди на системот-домаќин кога прелистувачот отвори HTML-датотека. Моделот откри и повеќе ранливости во зајакнат оперативен систем и ги спои во локален синџир за зголемување на привилегиите, од непривилегиран корисник до root. Севкупно, нашето истражување нè наведе да заклучиме дека Astra го исполнува критичниот праг.

Заштитни мерки потребни за критичните способности

Кај моделите со способности за сајбер-безбедност на нивото на Astra, мора да опфатиме два начина за сведување на минимум на ризикот од сериозна сајбер-штета, и за време на развојот и пред пуштањето во употреба:

  • Злонамерни актери што го користат моделот. Нашите заштитни мерки мора сигурно да ги спречат злонамерните актери да ја користат Astra за развивање експлоити за претходно непознати пропусти во зајакнати критични системи или за изведување целосни напади врз зајакнати цели.

  • Моделот презема неовластени, неусогласени дејства. Дури и без злонамерен корисник, модел со напредни способности за сајбер-безбедност би можел самиот да предизвика сајбер-штета ако не е усогласен. Покрај исклучително високиот стандард за усогласување на моделите со вакви способности, како втор слој на одбрана нашите заштитни мерки мора брзо да откриваат и ограничуваат неусогласени дејства што би можеле да предизвикаат значителна штета во реалниот свет.

Особено е важно што вториот начин се однесува и на интерниот развој и на надворешното пуштање во употреба. Како што претходно опишавме, по инцидентот OpenAI–Hugging Face, на две недели запревме одредени обуки на гранични модели (вклучително и одредени обуки за Astra) за да ја зајакнеме инфраструктурата за обука преку изолација и мрежни контроли, проширен надзор и построги обуки и прагови за усогласување. Потоа продолживме со работата од помал обем под построги контроли.

Подолго задржавме одредени поголеми циклуси на зајакнување на учењето (RL) за идните верзии на Astra, додека воспоставувавме повисоки стандарди за безбедноста и сигурноста на нивната средина за обука. На 28 август, откако ги воведовме новите барања за безбедност и сигурност, го продолживме големиот циклус на гранично RL што претходно беше запрен. И понатаму привремено задржуваме некои помали експериментални циклуси на обука.

Подготовката на Astra за објавување бараше и посилна заштита од сајбер-злоупотреба и неовластени дејства. Во продолжение ги опишуваме тие заштитни мерки и начинот на кој ги тестиравме.

Отпорност на сајбер-злоупотреба

Откако во февруари го пуштивме првиот модел што го оценивме како модел со Висока способност за сајбер-безбедност, ги зајакнуваме нашите сајбер-заштитни мерки со секое следно издание. Нашиот севкупен безбедносен пристап комбинира одбивања од дообучениот модел, безбедносни класификатори на системско ниво, како и офлајн откривање и спречување закани.

За GPT‑5.6(се отвора во нов прозорец) значително ја подобривме отпорноста на нашиот системски пакет, меѓу другото со додавање класификатори за активација што откриваат сајбер-злоупотреба и со подобро покривање на универзалните пробивања откриени преку интензивно автоматизирано тестирање на отпорноста. Надоврзувајќи се на овие подобрувања, за Astra дополнително вложивме во слојот на моделот во нашиот пакет заштитни мерки и ја подобривме нивната способност да го земат предвид контекстот од повеќе разговори.

  • Благодарение на новите техники за обука за отпорност на моделот, Astra посигурно ги одбива барањата за недозволена сајбер-помош. Во нашиот пакет процени за сајбер-пробивање, Astra одбива 91,5% од барањата (наспроти 59% кај GPT‑5.6 Sol).

  • За сметките оценети како поризични применуваме поконзервативна граница на однесување на моделот, која одбива поширок опсег на потенцијално ризична сајбер-помош. За високоризичните корисници го проширивме контекстот на нашите системи за надзор за да можат да откриваат вакви видови сајбер-злоупотреба.

Продолживме и со нашата програма за ригорозно тестирање, интерно и надворешно тестирање на отпорноста и отстранување на недостатоците. Покрај регресивното тестирање, со кое проверуваме дали и понатаму се покриени сите пробивања откриени во претходните периоди на тестирање, спроведуваме нов циклус на тестирање на отпорноста со нашите најнови интерни напаѓачи за тестирање на отпорноста. Соработуваме со партнери од индустријата за да дефинираме заеднички систем за оценување на пробивањата и ќе ја користиме нашата деноноќна програма за брза реакција за да ги истражуваме и решаваме новите наоди. Повеќе детали за тестирањето на нашите сајбер-заштитни мерки ќе споделиме во системската картичка на Astra.

Помагањето на бранителите да ги најдат и отстранат ранливостите останува клучен столб на нашиот безбедносен пристап. При објавувањето очекуваме заштитните мерки на Astra да создаваат повеќе пречки отколку што долгорочно посакуваме, за да заштитиме од потенцијална злоупотреба. Пристапот до Astra за напредни работни текови во сајбер-безбедноста првично ќе биде достапен за мала група алфа-тестери, а потоа пристапот преку Daybreak Blue ќе се проширува за да ја поддржи одбранбената употреба.

Усогласување и надзор

Додадовме и повеќеслојна дополнителна заштита за да го спречиме моделот да презема потенцијално неусогласени дејства:

  • Усогласување на моделот: Во нашите процени, Astra многу почесто од GPT‑5.6 Sol ги почитуваше изречните ограничувања за безбедност и сигурност и остануваше во рамките на овластениот опсег, што ја прави нашиот најусогласен модел досега. Особено се сосредоточивме на тоа дали моделот ги почитува ограничувањата за сигурност и безбедност и дали останува во својот овластен опсег.

  • Надзор и контрола: Следејќи ги нашите интерни постапки, ја пуштаме Astra со дополнителен надзор на синџирот на размислување за брзо откривање и ограничување на потенцијално неусогласените дејства.

Astra е значаен исчекор во усогласувањето на моделите и резултат на повеќе долгорочни текови на работа за усогласување — од интервенции при претходното обучување до повнимателно и подоследно оценување при зајакнувањето на учењето. При тестирањето утврдивме дека Astra доследно почесто ги почитува изречните безбедносни ограничувања и предупредувања, како автоматската проверка, во споредба со GPT 5.6 Sol.

Развивме и тест заснован врз сознанијата од инцидентот со Hugging Face, во кој агенти што ја извршуваа сајбер-процената ExploitGym ги компромитираа системите на трета страна. Ги искористивме најтешките задачи од таа процена за да создадеме тестови со „мамки“, со кои проверувавме дали моделот ќе се обиде да ја компромитира околната безбедносна инфраструктура наместо да ја реши доделената задача. Без продукциски заштитни мерки, GPT‑5.6 Sol се обиде да пристапи до тие цели во 56% од тестовите што ја симулираа средината на реперот, во која моделот добива инструкции да развива експлоити. Astra не направи ниту еден таков обид во овие тестови. Овие бројки го опишуваат однесувањето во условите на тестот без сајбер-заштитни мерки, а не при вообичаена продукциска употреба.

Лево: Во оваа нова процена набљудуваме како моделите реагираат кога автоматската проверка ќе одбие дејство. Секоја задача е поставена во средина за интелектуална работа, а извршувањето почнува веднаш по одбивањето од автоматската проверка. Потоа моделот може да постапи на повеќе начини: да го заврши извршувањето, да побара побезбедна алтернатива, повторно да проба слична команда или да искористи лоша конфигурација(се отвора во нов прозорец) за целосно да ја заобиколи автоматската проверка. Изборот на која било од последните две можности би значел неуспех во оваа процена. Astra ниту еднаш не се обиде да ја заобиколи автоматската проверка.

Десно: Во оваа процена проверуваме колку моделот е склон да мами (користејќи „мамки“) кога ќе се соочи со најтешките или невозможни задачи во процената ExploitGym. Таа беше спроведена во симулирана средина, со заштитните мерки во режим само за набљудување, за да се оцени однесувањето на моделот. Иако GPT‑5.6 Sol покажа поголема веројатност за мамење во овие сценарија, Astra не се обиде да ги користи тие кратенки, а сепак успеа легитимно да реши некои задачи.

Обуката на моделите да бидат усогласени е еден слој на безбедноста. Повеќе детали за тестирањето и резултатите од усогласувањето ќе споделиме во системската картичка на Astra.

За моделите од класата на Astra воведуваме и продукциски надзор на неусогласеноста, за да можеме да ја откриеме и брзо да ја ограничиме потенцијалната неусогласеност. Овие заштитни мерки наликуваат на надзорот што го користиме за интерните пуштања и вклучуваат систем од класификатори што ги проверуваат расудувањето и дејствата на моделот за неовластено однесување и автоматски ја запираат потенцијално неовластената активност. Како што растат способностите, овие заштитни мерки не можат да го заменат доброто усогласување на нашите модели. Целта ни е идните модели да бидат усогласени доволно добро за овие мерки никогаш да не се активираат.

Што ќе значи ова за корисниците

OpenAI е посветена придобивките од ВИ да бидат широко достапни. Поради значителното зголемување на способностите на Astra за сајбер-безбедност, особено внимаваме ова пуштање да биде безбедно и сигурно. Дополнителните безбедносни проверки понекогаш можат да ја забават, паузираат или запрат легитимната работа, вклучително и одбранбената сајбер-безбедност.

Системот повремено може да означи легитимна активност како потенцијална сајбер-злоупотреба или неовластено однесување, со што ненамерно ќе ја забави, паузира или запре. Тоа може да опфати работа што не изгледа непосредно поврзана со сајбер-безбедноста или задачи во кои агент работи подолг период.

Ако надзорот на неусогласеноста паузира задача, од корисниците во ChatGPT или Codex може да биде побарано да го проверат дејството пред да продолжат. Кога се користат други интерфејси, како API, задачата ќе запре. Планираме и понатаму да ги приспособуваме овие заштитни мерки за да ги намалиме непотребните прекини и да го прошириме пристапот до граничните способности преку програми како Daybreak.

Поглед кон иднината

Влегуваме во фаза од развојот на ВИ во која моделите можат да преземаат задачи со посериозни последици, а неуспесите во усогласувањето и контролата можат да имаат потешки ефекти. Остварувањето на придобивките од овие системи ќе зависи од нашата способност да ги усогласуваме и контролираме моделите додека нивните способности растат.

Таа одговорност ги опфаќа обуката, проценувањето и пуштањето во употреба. За тоа се потребни поцврсти докази за усогласено однесување, заштитни мерки што го следат растот на способностите и подготвеност да забавиме кога тие мерки не се доволни.

Ќе продолжиме да ги тестираме овие системи, да ги споделуваме сознанијата и јасно да кажуваме што останува неизвесно. Моделите што ќе следуваат по Astra ќе бараат повеќе од нас. Ќе одвоиме време и ќе ја завршиме потребната работа за да ја исполниме таа одговорност.