Преминаване към основното съдържание
OpenAI
Зареждане…

Днес пускаме GPT‑6 Astra — най-способния модел, който някога сме внедрявали за широка употреба. Astra е първият ни модел, достигнал ниво „Критично“ за способности в киберсигурността съгласно нашата Рамка за готовност.

Ето най-важното, което трябва да знаете за безопасността на тази версия:

  1. GPT‑6 Astra бележи значителен напредък в киберспособностите и достига нашия праг за ниво „Критично“. Това означава, че с подходящите инструменти и достъп GPT‑6 Astra може да открива неизвестни досега пропуски в сигурността и да разработва нови начини за използването им в множество добре защитени системи, без човек да ръководи всяка стъпка. Затова значително засилихме защитите срещу извършване на вредни кибердействия от модела, независимо дали са следствие от злоупотреба или несъгласуваност. Предприехме и мерки за защита на вътрешната разработка и внедряването на Astra и сходни модели, включително по-строга изолация, шифроване на контролните точки, всеобхватно наблюдение на пълните траектории, включително веригите на мисълта (CoT), и блокиращ процес за оценка на съгласуваността преди вътрешна употреба.
  2. GPT‑6 Astra е значително по-устойчив от предшествениците си. Благодарение на нови техники за обучение по безопасност и устойчивост GPT‑6 Astra е значително по-устойчив на джейлбрейк атаки от GPT‑5.6 Sol, включително при по-дълги траектории. Това се потвърждава от офлайн тестовете ни и програмата ни за строги вътрешни и външни тестове за джейлбрейк атаки и отстраняване на откритите проблеми. За потребителите, определени като потенциално високорискови, допълнително обучихме модела да коригира границата си за отказ към по-консервативно поведение, обхващащо по-широк кръг рискове от двойна употреба. Използваме регресионни тестове, за да гарантираме устойчивостта на Astra срещу джейлбрейк атаки, открити в предишни периоди на тестване, и проведохме нови кръгове автоматизирани тестове с червен екип с най-новите ни вътрешни системи за red teaming, за да потвърдим подобренията.
  3. GPT‑6 Astra е по-добре съгласуван от GPT‑5.6 Sol. Astra бележи значителен напредък в съгласуването на моделите и включва подобрения, обхващащи целия процес от състава на данните ни за предварително обучение до оценяването при обучение с утвърждение. Представяме нов набор от оценки на съгласуваността(отваря се в нов прозорец), които показват, че GPT‑6 Astra спазва по-надеждно границите за безопасност и сигурност и остава в рамките на разрешения си обхват. В симулация с повече от 54 000 вътрешни задачи на Codex(отваря се в нов прозорец) Astra получи и приблизително наполовина по-малко сигнали за несъгласувано поведение с по-висока тежест в сравнение със Sol.
  4. Въвеждаме широко наблюдение за несъгласуваност. Смятаме съгласуването на моделите за основния механизъм за предотвратяване на потенциално несъгласувано поведение от тяхна страна. Същевременно наблюдението осигурява широка видимост върху поведението на авангардните модели и разкрива възможности за допълнително подобряване на съгласуваността и безопасността. Освен това наблюдението служи като допълнителен защитен слой срещу установено несъгласувано поведение. Поради тези причини добавихме наблюдение за несъгласуваност към всички изводи с използване на инструменти при външното внедряване на Astra, въпреки значителните изчислителни разходи. Тази система следва вътрешната ни конфигурация.
  5. Възможността за наблюдение на GPT‑6 Astra е намаляла спрямо GPT‑5.6 Sol. Проведохме задълбочени проучвания на възможността за наблюдение(отваря се в нов прозорец) и контролируемостта(отваря се в нов прозорец) на GPT‑6 Astra. Установихме, че GPT‑6 Astra може по-успешно да контролира собствената си CoT от GPT‑5.6 Sol и по-рядко включва уличаваща информация в нея. При състезателни условия, когато подтикваме модела да избягва наблюдението ни, той може да остане незабелязан при Умишлено занижаване на представянето в оценки (sandbagging), а понякога може да заобиколи вътрешните ни системи за наблюдение, когато бъде помолен да изпълни определени задачи за саботаж(отваря се в нов прозорец). Не открихме доказателства за стеганографско структурирано анализиране в CoT — например скриване на вътрешно структурирано анализиране в обикновен и привидно несвързан текст. Това показва, че рискът от избягване може до голяма степен да е ограничен до задачи, изискващи по-малко структурирано анализиране.
    • Тези констатации показват, че при състезателни условия моделите от класа Astra биха могли да избягват нашите системи за наблюдение на CoT. Засега тези констатации се основават предимно на състезателни оценки, при които инструктираме модела да избягва наблюдението. Като цяло обаче оценките ни за съгласуваност показват, че Astra е по-малко склонен от GPT‑5.6 Sol да нарушава ограниченията за сигурност и безопасност.
    • Въпреки това приемаме тенденцията сериозно и продължаваме да проучваме тези констатации и последиците им за наблюдаемостта с нарастването на способностите на нашите модели. OpenAI работи за запазване и използване на наблюдението на веригата на мисълта, а запазването на наблюдаемостта на CoT е основна цел на изследователската програма. Тези резултати обаче подчертават и важността на разработването на техники за одит на съгласуваността, които не се ограничават до проверка на веригата на мисълта на модела.
  6. GPT‑6 Astra работи по-отговорно при сърфиране и в служебна среда: GPT‑6 Astra е значително по-устойчив на инжекции в подкани от GPT‑5.6 Sol. Допълнително тествахме поведението на модела в реалистични среди за сърфиране и професионална работа с компютър. Установихме, че в сравнение с GPT‑5.6 Sol вероятността моделът да извърши несъгласувани и потенциално разрушителни действия е значително по-малка — например неразрешени трансакции, загуба на данни, прекомерен достъп или заобикаляне на контроли. Той действа и по-безопасно при обработване на вредни заявки в агентни среди, например искания за съдействие при планиране на насилствено нападение или извършване на измама.
  7. GPT‑6 Astra е значително по-безопасен при сценарии с по-висок риск. GPT‑6 Astra отговаря по-безопасно от GPT‑5.6 Sol на трудни заявки от реална експлоатация и състезателни стрес тестове с червен отбор, провеждани от хора. Astra постига подобрение по Парето, като по-безопасно обработва опасни заявки и избягва ненужни откази при безвредни заявки. Тези подобрения обхващат и сценарии с висока тежест, при които рискът от вреда произтича от по-широкия контекст, а не от изрично искане. Astra прилага по-последователно и съобразени с възрастта граници за безопасност при потребители под 18 години.