Започваме ограничен предварителен преглед на серията GPT‑5.6: Sol, нашият флагмански модел; Terra, балансиран модел за ежедневна работа; и Luna, бърз и достъпен модел. Terra има конкурентна производителност спрямо GPT‑5.5, като е 2 пъти по-евтин, а Luna предлага мощни способности на най-ниската ни цена.
GPT‑5.6 Sol стартира с най-устойчивия ни пакет за безопасност досега. Засилихме защитите за дейности с по-висок риск, чувствителни киберзаявки и многократна злоупотреба и прекарахме няколко седмици в откриване на слабости, стрес тестване на системата и укрепването ѝ срещу реални атаки.
Вярваме в широкия достъп и планираме през следващите седмици да направим GPT‑5.6 Sol, Terra и Luna общодостъпни. Като част от текущото ни взаимодействие с правителството на САЩ представихме предварително плановете си и способностите на моделите преди днешното пускане. По тяхно искане започваме с ограничен предварителен преглед за малка група доверени партньори, чието участие е споделено с правителството, преди по-широко пускане. По време на този предварителен преглед ще продължим да тестваме и да координираме тясно с партньорите, докато работим за по-широка наличност. Не смятаме, че такъв процес за достъп от страна на правителството трябва да се превръща в дългосрочна практика по подразбиране. Той задържа най-добрите инструменти далеч от потребители, разработчици, предприятия, киберзащитници и глобални партньори, които се нуждаят от тях. Предприемаме тази краткосрочна стъпка, защото вярваме, че тя е най-силният път към по-широка наличност през следващите седмици, докато работим с администрацията за разработване на рамката на изпълнителната заповед за киберсигурност и повторяем процес за бъдещи пускания на модели.
GPT‑5.6 Sol е най-мощният ни модел досега. За да дадем предварителен поглед върху производителността на модела, споделяме набор от оценки, които подчертават подобрени агентни способности в програмирането, биологията и киберсигурността, а допълнителни оценки за безопасност и готовност са налични в нашата карта на системата(отваря се в нов прозорец). Ще споделим разширен набор от резултати от оценки, когато направим модела широко достъпен.
С GPT‑5.6 въвеждаме ново усилие за структурирано анализиране „max“, което дава на Sol най-много време за задълбочен анализ. Освен това въвеждаме нов режим „ultra“, който надхвърля способностите на един агент, като използва подагенти за ускоряване на сложна работа.
За работни процеси по програмиране GPT‑5.6 Sol поставя ново най-високо ниво на Terminal‑Bench 2.1, който тества работни процеси в команден ред, изискващи планиране, итерации и координация на инструменти.
GPT‑5.6 Sol показва и широки подобрения в работните процеси в биологията. В GeneBench v1, който оценява дългосрочни анализи в геномиката и количествената биология, той постига по-силни резултати от GPT‑5.5, като използва по-малко токени.
GPT‑5.6 Sol е най-способният ни модел досега за киберсигурност. Той измества границата между производителност и ефективност за дългосрочни задачи по сигурността, включително изследване и експлоатиране на уязвимости. В ExploitBench² GPT‑5.6 Sol е конкурентен на Mythos Preview, като използва само ~1/3 от изходните токени. В ExploitGym(отваря се в нов прозорец)3, бенчмарк, създаден от изследователи от UC Berkeley в сътрудничество с OpenAI и други авангардни лаборатории, моделите GPT‑5.6 Sol, Terra и Luna демонстрират силни подобрения в киберспособностите с увеличаването на структурираното анализиране.
Разработихме GPT‑5.6 Sol, Terra и Luna с най-устойчивите ни защитни механизми досега, с конфигурации, съобразени със способностите на всеки модел. С нарастването на способностите на модела проектираме защитите така, че да издържат все по-добре на реален противников натиск, като същевременно запазват достъпа до легитимна работа като преглед на код, изследване на уязвимости, разработване на пачове, отстраняване на грешки, обучение по сигурност и защитно тестване. Целта ни е да направим забранената офанзивна дейност по-трудна, по-несигурна и по-откриваема, без ненужно да ограничаваме тези полезни приложения. Въз основа на оценката ни на модела и защитните механизми очакваме значителна полза за легитимната защитна работа, като същевременно ограничаваме значително забранената офанзивна употреба.
GPT‑5.6 Sol е значително по-ефективен като помощник при откриването и отстраняването на уязвимости, отколкото като средство за надеждно изпълнение на цялостни кибератаки. Докато тези способности продължават да напредват, наш приоритет е те да достигат до защитниците и да им носят полза, за да могат да използват тези инструменти за намиране на слабости, разработване на пачове и по-широко укрепване на системите.
GPT‑5.6 Sol не преминава прага „Cyber Critical“ („Критична киберсигурност“) според нашата Рамка за готовност. В оценки с Chromium и Firefox той идентифицира грешки и примитиви за експлоатиране – градивните елементи на експлойт – но не създава автономно функционален експлойт по цялата верига при тестваните условия. Въпреки това праговете на бенчмарковете не могат да обхванат всеки начин, по който един модел може да бъде използван или комбиниран с други инструменти. Именно тази несигурност, заедно с по-широкия скок в способностите на модела, е причината да съчетаваме повишените му способности с по-силни защитни механизми и поетапно пускане. Споделяме повече подробности за защитните ни механизми в картата на системата за предварителния преглед на GPT‑5.6(отваря се в нов прозорец).
Нито един отделен защитен механизъм не е достатъчен срещу целенасочена или адаптивна злоупотреба. В целия предварителен преглед на GPT‑5.6 използваме многослойни защитни механизми, като точните конфигурации варират между моделите, и приложихме стрес-тестове върху тях срещу реални атаки. Те включват защити, обучени в модела, проверки в реално време по време на генериране, сигнали на ниво акаунт, диференциран достъп, наблюдение, прилагане на мерки и продължаващо тестване.
GPT‑5.6 е обучен да отказва забранена киберпомощ, включително когато потребителите се опитват да прикрият намеренията си или да направят джейлбрейк на модела. Тези защитни механизми на ниво модел установяват първата граница около това с какво моделът трябва и не трябва да помага.
Класификаторите за злоупотреба в киберсигурността и биологията в реално време осигуряват още един слой, като оценяват изхода, докато се генерира. При случаи с по-висок риск, ако открият потенциално нарушение, генерирането може да бъде поставено на пауза, докато по-голям модел със структурирано анализиране прегледа разговора и неговия контекст. Ако изходът бъде оценен като недопустим, той се задържа, преди да достигне до потребителя.
Маркираната активност може също да задейства преглед на ниво акаунт в релевантни разговори и рискови сигнали, в съответствие с нашите условия и политики относно съхранението и прегледа на съдържание. Погледът отвъд един-единствен разговор помага на системите ни да различават устойчиво злонамерено поведение от легитимна работа по сигурност с двойна употреба, при която сходни технически понятия може да се появяват в много различни контексти.
Заедно тези слоеве правят цялостния подход по-устойчив от който и да било отделен защитен механизъм. Поведението на модела намалява вероятността от вредни отговори, системите в реално време могат да се намесят по време на генериране, прегледът на ниво акаунт може да идентифицира по-широки модели, а диференцираният достъп запазва важната защитна работа, без най-чувствителните способности да стават широко достъпни по подразбиране.
Особено по време на предварителния преглед потребителите може да срещнат защитни механизми, които блокират или отказват някои заявки. Други заявки може да отнемат повече време, защото генерирането се поставя на пауза за допълнителен преглед. Защитните механизми понякога може да се намесват в легитимна работа, особено в области с двойна употреба, където защитната и офанзивната дейност първоначално може да изглеждат сходни.
Това е част от целта на предварителния преглед. Искаме да разберем не само дали защитните механизми ограничават злоупотребата, но и дали легитимните потребители все още могат надеждно и ефективно да вършат нормалната си работа. Обратната връзка по време на предварителния преглед ще ни помогне да намалим ненужните блокирания и забавяния, да подобрим начина, по който защитните механизми тълкуват контекста, и да създадем по-гладко изживяване преди по-широкото пускане.
Работим и с корпоративни клиенти по по-дългосрочни подходи – включително откриване на заплахи с запазване на поверителността, управлявани от клиента контроли за безопасност и достъп, калибриран според риска на клиента, потребителя или натоварването – за да повишаваме безопасността, като същевременно подкрепяме корпоративните изисквания за поверителност.
Защитните механизми трябва да остават ефективни и когато нападателите адаптират тактиките си. Защита, която работи само срещу фиксиран набор от известни атаки, не е достатъчно устойчива за авангарден модел.
Затова влагаме в безопасността повече интелигентност и изчислителни ресурси от всякога, като използваме собствените си модели, за да намираме слабости и по-бързо да подобряваме защитите. Отделихме над 700 000 GPU часа, еквивалентни на A100, за автоматизирано стрес тестване с червен отбор, насочено към откриване на универсални джейлбрейк атаки: атаки, които могат да работят в много подкани или контексти, а не само в една тясна настройка. Фокусът върху тези по-трудни и по-общи атаки ни позволи да тестваме защитите отвъд фиксиран набор от известни откази. Това също ни позволява да изследваме много повече модели на атаки, отколкото би покрило само човешко тестване, да откриваме по-рано моделите на отказ и да съкратим пътя от намирането на слабост до отстраняването ѝ.
Освен автоматизираното стрес тестване с червен отбор работихме с външни тестери, за да проведем обширно експертно човешко стрес тестване с червен отбор, което ще продължи и през периода на предварителен преглед. Човешкото стрес тестване с червен отбор допълва автоматизираната работа, като проверява защитите срещу креативни експерти, които се опитват да злоупотребят с модела по начини, които нашите системи може да не предвидят.
Нито една оценка не може да представи всяка продуктова конфигурация, многостъпкова атака или реален работен процес. Затова поддържаме процес за бърза реакция, с който възпроизвеждаме, оценяваме, приоритизираме и отстраняваме новооткрити джейлбрейк атаки, след което ги добавяме към текущите си оценки, за да можем в бъдеще да тестваме срещу подобни откази.
По време на предварителния преглед моделите GPT‑5.6 първоначално ще бъдат достъпни чрез API и Codex за избрана група доверени партньори и организации. Планираме скоро да ги направим по-широко достъпни за хората, които използват ChatGPT, Codex и API.
В тази нова система за именуване, въведена с GPT‑5.6, числото обозначава поколението на модела, а Sol, Terra и Luna обозначават устойчиви нива на способности, които могат да се развиват със собствен темп. Като семейство те дават на хората и разработчиците по-ясен избор между интелигентност, скорост и цена.
Цената на GPT‑5.6 е за 1 млн. токена в три размера модели: Sol е 5$ вход / 30$ изход; Terra е 2,50$ вход / 15$ изход; а Luna е 1$ вход / 6$ изход. GPT‑5.6 въвежда и по-предсказуемо кеширане на подкани, включително поддръжка на изрични точки за прекъсване на кеша и минимален живот на кеша от 30 минути. За GPT‑5.6 и следващите модели записите в кеша се таксуват по 1,25 пъти некешираната входна тарифа на модела, а четенията от кеша продължават да получават 90% отстъпка за кеширан вход.
През юли пускаме и GPT‑5.6 Sol на Cerebras със скорост до 750 токена в секунда, като предоставяме авангардно ниво на интелект на клиентите с безпрецедентна скорост. Първоначално достъпът ще бъде ограничен до избрани клиенти, докато разширяваме капацитета.
Радваме се, че ще продължим да се учим от този период на предварителен преглед и скоро ще предоставим GPT‑5.6 Sol, Terra и Luna на повече хора.
1. Оценяваме латентността и разхода за API, като разглеждаме поведението на нашите модели в продукционна среда и симулираме офлайн. Тези оценки отчитат подробности за извикванията на инструменти, извадкови токени и входни токени. Резултатите в реални условия може да се различават съществено и зависят от много фактори, които не са обхванати в нашата симулация. Симулираме латентността при високи API скорости, а разхода – при стандартно ценообразуване за API.
2. Всички модели се оценяват чрез API средата на ExploitBench с 5 начални стойности и непрекъснатост на структурираното анализиране.
3. Изпълнихме ExploitGym върху нашия алфа API, който генерира отговори по-бързо от публичния ни API, след което мащабирахме резултатите, за да съответстват на публичния ни API. При мащабиране на латентностите към скоростите, очаквани за публичния ни API, някои прогнозни латентности надхвърлят времевите ограничения от 2 ч. и 6 ч., въпреки че те са били спазени правилно в оценъчното изпълнение. За по-високи скорости при чувствителна към времето работа предлагаме приоритетна обработка в API и бърз режим в Codex.
4. Моделите без отчетени изходни токени, латентност или разход са показани като хоризонтални пунктирани линии.


