Перейти до основного вмісту
OpenAI

26 червня 2026 р.

ПродуктВипуск

Попередній перегляд GPT‑5.6 Sol: модель нового покоління

Завантаження…

Ми починаємо обмежений попередній перегляд серії GPT‑5.6: Sol, нашої флагманської моделі; Terra, збалансованої моделі для повсякденної роботи; і Luna, швидкої та доступної моделі. Terra демонструє конкурентну з GPT‑5.5 продуктивність і водночас коштує вдвічі дешевше, а Luna пропонує потужні можливості за нашою найнижчою ціною.

GPT‑5.6 Sol запускається з нашим найстійкішим на сьогодні стеком безпеки. Ми посилили захист для дій із підвищеним ризиком, чутливих кіберзапитів і повторного зловживання, а також кілька тижнів шукали слабкі місця, проводили стрес-тестування системи й зміцнювали її проти реальних атак.

Ми віримо в широкий доступ і плануємо зробити GPT‑5.6 Sol, Terra й Luna загальнодоступними в найближчі тижні. У межах нашої постійної взаємодії з урядом США ми напередодні сьогоднішнього запуску представили наші плани та можливості моделей. На їхнє прохання ми починаємо з обмеженого попереднього перегляду для невеликої групи довірених партнерів, участь яких було повідомлено уряду, перш ніж перейти до ширшого випуску. Під час цього попереднього перегляду ми продовжимо тестування й тісну координацію з партнерами, рухаючись до ширшої доступності. Ми не вважаємо, що такий процес урядового доступу має стати довгостроковим стандартом. Він позбавляє найкращих інструментів користувачів, розробників, підприємства, кіберзахисників і глобальних партнерів, яким вони потрібні. Ми робимо цей короткостроковий крок, бо вважаємо його найкращим шляхом до ширшої доступності в найближчі тижні, паралельно працюючи з Адміністрацією над розробкою рамок кібербезпекового указу та повторюваного процесу для майбутніх випусків моделей.

Можливості

GPT‑5.6 Sol — наша найсильніша модель на сьогодні. Щоб попередньо показати продуктивність моделі, ми ділимося набором оцінювань, які демонструють покращені агентні можливості в кодуванні, біології та кібербезпеці; додаткові оцінювання безпеки й готовності доступні в нашій картці системи(відкривається у новому вікні). Ми поділимося розширеним набором результатів оцінювання, коли зробимо модель широко доступною.

У GPT‑5.6 ми запроваджуємо новий рівень зусиль міркування `max`, щоб дати Sol найбільше часу на глибоке міркування. Крім того, ми запроваджуємо новий режим `ultra`, який виходить за межі можливостей одного агента, використовуючи субагентів для пришвидшення складної роботи.

Для робочих процесів кодування GPT‑5.6 Sol встановлює новий найкращий рівень на Terminal‑Bench 2.1, який перевіряє робочі процеси командного рядка, що потребують планування, ітерацій і координації інструментів.

GPT‑5.6 Sol також демонструє суттєві покращення в біологічних робочих процесах. На GeneBench v1, який оцінює довгострокові аналізи в геноміці та кількісній біології, вона досягає кращих результатів, ніж GPT‑5.5, використовуючи менше токенів.

GPT‑5.6 Sol — наша найпотужніша на сьогодні модель для кібербезпеки. Вона зміщує межу продуктивності й ефективності для довгострокових задач безпеки, зокрема дослідження вразливостей та експлуатації. На ExploitBench² GPT‑5.6 Sol конкурентна з Mythos Preview, використовуючи лише приблизно 1/3 вихідних токенів. На ExploitGym(відкривається у новому вікні)3, бенчмарку, створеному дослідниками UC Berkeley у співпраці з OpenAI та іншими передовими лабораторіями, моделі GPT‑5.6 Sol, Terra й Luna демонструють значні покращення кіберможливостей зі збільшенням міркування.

Сильніші кіберможливості із сильнішими захисними механізмами

Ми розробили GPT‑5.6 Sol, Terra й Luna з нашими найстійкішими на сьогодні захисними механізмами та конфігураціями, підібраними відповідно до можливостей кожної моделі. У міру того як модель стає потужнішою, ми проєктуємо захисні механізми так, щоб вони дедалі краще витримували реальний змагальний тиск і водночас зберігали доступ до легітимної роботи, як-от перегляд коду, дослідження вразливостей, розробка патчів, налагодження, навчання безпеці та захисне тестування. Наша мета — зробити заборонену наступальну діяльність складнішою, менш певною й помітнішою без зайвого обмеження цих корисних застосувань. На основі нашої оцінки моделі та захисних механізмів ми очікуємо суттєвої користі для легітимної захисної роботи й водночас значного обмеження забороненого наступального використання.

GPT‑5.6 Sol краще допомагає людям знаходити й виправляти вразливості, ніж надійно виконувати повний цикл наступальних атак. Оскільки ці можливості й далі розвиваються, наш пріоритет — забезпечити, щоб вони доходили до захисників і приносили їм користь, допомагаючи знаходити слабкі місця, розробляти патчі та підвищувати загальну стійкість систем.

GPT‑5.6 Sol не перетинає поріг Cyber Critical за нашою Рамковою системою готовності. В оцінюваннях із Chromium і Firefox вона виявляла помилки та примітиви експлуатації — будівельні блоки експлойта, — але за протестованих умов автономно не створила функціональний експлойт повного ланцюга. Утім, пороги бенчмарків не можуть охопити всі способи, у які модель може використовуватися або поєднуватися з іншими інструментами. Саме ця невизначеність, разом із ширшим стрибком можливостей моделі, є причиною, чому ми поєднуємо зростання її можливостей із сильнішими захисними механізмами та поетапним випуском. Більше подробиць про наші захисні механізми ми наводимо в картці системи GPT‑5.6 Preview(відкривається у новому вікні).

Багаторівневий стек захисних механізмів

Жодного окремого захисного механізму недостатньо проти цілеспрямованого або адаптивного зловживання. У межах попереднього перегляду GPT‑5.6 ми використовуємо багаторівневі захисні механізми з конфігураціями, що відрізняються між моделями, і перевіряємо їх на стійкість до реальних атак. Вони охоплюють механізми захисту, інтегровані безпосередньо в модель, перевірки в режимі реального часу під час генерування відповідей, аналіз сигналів на рівні облікового запису, диференційований доступ, моніторинг, заходи реагування та безперервне тестування.

GPT‑5.6 навчено відмовляти в забороненій кібердопомозі, зокрема коли користувачі намагаються приховати свій намір або зламати обмеження моделі (джейлбрейк). Ці захисні механізми на рівні моделі встановлюють першу межу того, з чим модель має і не має допомагати.

Класифікатори кібер- і біологічного зловживання в реальному часі створюють ще один рівень, оцінюючи вміст під час його генерації. У випадках підвищеного ризику, якщо вони виявляють потенційне порушення, генерацію може бути призупинено, поки більша модель міркування перегляне розмову та її контекст. Якщо за результатами перевірки відповідь визнається неприпустимою, її буде заблоковано ще до того, як вона стане доступною користувачеві.

Позначена активність також може запускати перевірку на рівні облікового запису в релевантних розмовах і сигналах ризику відповідно до наших умов і політик щодо зберігання та перевірки контенту. Погляд за межі однієї розмови допомагає нашим системам відрізняти стійку зловмисну поведінку від легітимної роботи з безпеки подвійного призначення, де схожі технічні концепції можуть з’являтися в дуже різних контекстах.

Разом ці рівні роблять загальний підхід стійкішим, ніж будь-який окремий захисний механізм сам по собі. Поведінка моделі знижує ймовірність шкідливих відповідей, системи реального часу можуть втручатися під час генерації, перевірка на рівні облікового запису може виявляти ширші закономірності, а диференційований доступ зберігає важливу захисну роботу, не роблячи найчутливіші можливості широкодоступними за замовчуванням.

Особливо під час попереднього перегляду користувачі можуть стикатися із захисними механізмами, які блокують або відхиляють деякі запити. Інші запити можуть виконуватися довше, бо генерацію призупиняють для додаткової перевірки. Захисні механізми іноді можуть втручатися в легітимну роботу, особливо в сферах подвійного призначення, де захисна й наступальна діяльність спочатку можуть виглядати схоже.

Саме це й покликаний перевірити попередній перегляд. Ми хочемо зрозуміти не лише те, чи обмежують захисні механізми зловживання, а й чи можуть легітимні користувачі й надалі надійно та ефективно виконувати звичайну роботу. Відгуки під час попереднього перегляду допоможуть нам зменшити зайві блокування й затримки, поліпшити те, як захисні механізми інтерпретують контекст, і створити зручне користування перед ширшим випуском.

Ми також працюємо з корпоративними клієнтами над довгостроковими підходами — зокрема над технологіями виявлення загроз зі збереженням конфіденційності, засобами безпеки, якими керує сам клієнт, і моделями доступу, що враховують рівень ризику, пов'язаного з клієнтом, користувачем або робочим навантаженням. Це дає змогу підвищувати рівень безпеки, водночас дотримуючись вимог корпоративних клієнтів щодо конфіденційності.

Підвищення стійкості завдяки автоматизованій перевірці на вразливості та ризики

Захисні механізми також мають залишатися ефективними, коли зловмисники змінюють свою тактику. Захист, який працює лише проти фіксованого набору відомих атак, недостатньо стійкий для передової моделі.

Саме тому ми застосовуємо до безпеки більше інтелектуальних можливостей і обчислень, ніж будь-коли раніше, використовуючи власні моделі, щоб швидше знаходити слабкі місця й удосконалювати захист. Ми присвятили понад 700 000 GPU-годин в еквіваленті A100 автоматизованій перевірці на вразливості та ризики, спрямованій на пошук джейлбрейків: атак, які можуть працювати в багатьох запитах або контекстах, а не лише в одному вузькому сценарії. Зосередження на цих складніших і загальніших атаках дало нам змогу перевірити захисні механізми ширше, ніж на фіксованому наборі відомих відмов. Це також дає змогу дослідити значно більше шаблонів атак, ніж могло б охопити саме лише людське тестування, раніше виявляти типові відмови й скорочувати шлях від знаходження слабкого місця до його усунення.

Окрім автоматизованої перевірки на вразливості та ризики, ми працювали зі сторонніми тестувальниками, щоб провести масштабні перевірки на вразливості та ризики за участі експертів людей, який триватиме й під час попереднього перегляду. Людська перевірка на вразливості та ризики доповнює автоматизовану роботу, перевіряючи захисні механізми на креативних експертах, які намагаються зловживати моделлю способами, що їх наші системи могли не передбачити.

Жодна оцінка не може охопити кожну конфігурацію продукту, багатоетапну атаку чи реальний робочий процес. Тому ми підтримуємо процес швидкого реагування, щоб відтворювати, оцінювати, пріоритезувати й усувати джейлбрейки, а потім додавати їх до наших постійних оцінювань, аби в майбутньому перевірятися на подібні відмови.

Доступність і ціни

Під час попереднього перегляду моделі GPT‑5.6 спочатку будуть доступні через API та Codex для вибраної групи довірених партнерів і організацій. Незабаром ми плануємо зробити їх ширше доступними для людей, які користуються ChatGPT, Codex і API.

У цій новій системі назв, запровадженій із GPT‑5.6, число позначає покоління моделі, а Sol, Terra й Luna — сталі рівні можливостей, які можуть розвиватися у власному темпі. Разом це сімейство дає користувачам і розробникам зрозуміліший вибір між інтелектуальними можливостями, швидкістю та вартістю.

Вартість використання GPT‑5.6 розраховується за 1 млн токенів для трьох моделей: Sol — $5 за вхідні токени та $30 за вихідні; Terra — $2,50 і $15 відповідно; Luna — $1 і $6 відповідно. GPT‑5.6 також запроваджує більш передбачуване кешування запитів, зокрема підтримку явних точок розриву кешу та мінімальний час зберігання кешу 30 хвилин. Для GPT‑5.6 і новіших моделей запис до кешу тарифікується за ставкою, що у 1,25 раза перевищує стандартну вартість обробки вхідних токенів без використання кешу, тоді як для читання з кешу, як і раніше, діє знижка 90% на вхідні токени, що обробляються з використанням кешу.

У липні ми також запускаємо GPT‑5.6 Sol на Cerebras зі швидкістю до 750 токенів на секунду, надаючи клієнтам передовий інтелект із безпрецедентною швидкістю. Спочатку доступ буде обмежено вибраними клієнтами, поки ми нарощуємо потужності.

Ми раді й надалі вчитися під час цього попереднього перегляду та незабаром надати GPT‑5.6 Sol, Terra й Luna більшій кількості людей.


1. Ми оцінюємо затримку та вартість API, аналізуючи виробничу поведінку наших моделей і виконуючи офлайн-симуляції. Ці оцінки враховують деталі викликів інструментів, вибіркові токени та вхідні токени. Реальні результати можуть суттєво відрізнятися й залежать від багатьох чинників, не врахованих у нашій симуляції. Ми моделюємо затримку за високих швидкостей API, а вартість — за звичайними цінами API.

2. Усі моделі оцінюються за допомогою середовища тестування ExploitBench API із п'ятьма початковими значеннями та безперервністю міркувань.

3. Ми запускали ExploitGym на нашому альфа-API, який видає відповіді швидше, ніж наш публічний API, а потім масштабували результати відповідно до публічного API. Під час перерахунку затримок до швидкостей, очікуваних для нашого публічного API, деякі оцінені затримки перевищують часові ліміти 2 год і 6 год, попри те що в оцінювальному запуску їх було коректно дотримано. Для вищої швидкості в чутливих до часу задачах ми пропонуємо пріоритетну обробку⁠ в API та швидкий режим⁠ у Codex.

4. Моделі без указаних вихідних токенів, затримки або вартості показано горизонтальними пунктирними лініями.

Автор

OpenAI