Нове покоління інтелекту
Оновлено 22 вересня 2026 року: Ми розширюємо сімейство GPT‑6, додаючи GPT‑6 Sol і GPT‑6 Luna. Дізнатися більше.
Ми представляємо GPT‑6 Astra — найінтелектуальнішу й найбільш узгоджену модель у світі.
GPT‑6 Astra поєднує роки досліджень і масштабних інвестицій у попереднє навчання, навчання з підкріпленням та узгодження. Astra демонструє передові результати в роботі з комп'ютером, вебперегляді, розробці програмного забезпечення, кібербезпеці, науці та професійних завданнях. Astra досягає практично максимального результату на FrontierMath (рівень 4), набираючи 98%, і вже допомогла розв'язати давні відкриті математичні задачі. Astra також досягає практично максимального результату на ARC-AGI-3 з оцінкою 99,9% і максимального результату на ExploitBench з оцінкою 100%. Вона також встановлює передовий рівень у роботі з комп'ютером і браузером, виконуючи найскладніші професійні завдання з неперевершеною швидкістю, точністю та якістю рішень.
Сьогодні GPT‑6 Astra починає ставати доступною для обмеженого кола організацій, а протягом найближчих днів стане доступною всім користувачам ChatGPT Plus, Pro, Business і Enterprise, а також через OpenAI API, Microsoft Azure і AWS Bedrock.
Astra — наша найбільш узгоджена модель, яка значно краще розуміє наміри користувача й дотримується належної поведінки моделі, тож ви можете делегувати їй завдання з більшою впевненістю в її рішеннях. Щоб перевірити це, ми розробили нове оцінювання з урахуванням інциденту з Hugging Face. Воно визначає, чи не вийде модель, зіткнувшись зі складним або неможливим завданням, за встановлені для неї межі. GPT‑5.6 Sol без захисних механізмів виробничого середовища виходила за межі дозволеної цілі у 48% випадків, тоді як GPT‑6 Astra не зробила цього в жодному випадку.
Найкраща у світі модель для роботи з комп’ютером
GPT‑6 Astra відкриває новий рівень швидкості, точності та безпеки роботи з комп’ютером. Вона може брати на себе рутинні завдання, як-от заповнення онлайн-форм, оновлення записів клієнтів у CRM та впорядкування календаря. Вона може проводити онлайн-дослідження та готувати чернетки стислих викладів у вашій електронній пошті або редакторі документів. Вона може аналізувати наукові дані, створювати графіки й вебсайти та проводити перевірки якості фронтенду, щоб переконатися, що всі функції сайту працюють. Вона може допомагати вам самостійно встановлювати й тестувати програмне забезпечення, а також усувати проблеми, які ви бачите на екрані. Ці вдосконалення також відображаються в результатах наших найсучасніших оцінювань.
Ці вдосконалення також забезпечують значний приріст ефективності в реальних завданнях інтелектуальної роботи. У симуляціях затримки на OSWorld 2.0 Astra демонструє кращі результати роботи з комп'ютером, витрачаючи приблизно на 47% менше часу на завдання, ніж GPT‑5.6 Sol: 72,6% за приблизно 40 хвилин на завдання порівняно з 65,7% за приблизно 75 хвилин.3
Можливості GPT‑6 Astra для роботи з комп’ютером можна побачити в результатах у різних сферах, зокрема в розробці ігор, електротехніці та повсякденній інтелектуальній роботі:
Разом із Astra ми також оновлюємо систему harness Codex, щоб суттєво підвищити швидкість роботи з комп’ютером. У поєднанні з ефективністю Astra це забезпечує у 1,9 раза швидше виконання завдань порівняно з поточним досвідом роботи з GPT‑5.6 Sol на бенчмарку Mind2Web. Завдяки вищій швидкості модель може брати на себе багато повсякденних справ, які забирають чимало часу, і виконувати їх за вас швидше, ніж ви могли б зробити це самі.4
Новий рівень професійної роботи
GPT‑6 Astra поєднує вдосконалені можливості роботи з комп’ютером із цільовим навчанням для професійних робочих середовищ, допомагаючи виконувати складні робочі завдання. Вона поєднує інтелект, необхідний для розв'язання складних завдань, зі здатністю виконувати багатоетапні робочі процеси та створювати професійно оформлені документи, електронні таблиці й презентації.
GPT‑6 Astra — наша найкраща модель для дотримання наявних шаблонів і створення слайдів із продуманим компонуванням, які стисло передають ключові тези в межах структурованої оповіді. Вона створює зрозумілі, добре структуровані документи, презентації, електронні таблиці й аналітичні матеріали, що відповідають вашим шаблонам і узгоджуються з вашим стилем письма та візуальним стилем. Astra також спеціально навчена включати в результати лише релевантний контекст, а не повторювати інформацію, непотрібну для поточного завдання. Усе це дає їй змогу створювати готові до практичного використання матеріали, що відповідають контексту й стандартам вашої компанії.
GPT‑6 Astra також краще оцінює візуальну складову вебсайтів, ігор, застосунків і візуалізацій, які створює. Завдяки Sites(відкривається у новому вікні) у ChatGPT Astra може створювати, розміщувати й поширювати вебсайти, вебзастосунки та ігри безпосередньо за запитом.
Коли інструкції допускають різні тлумачення, GPT‑6 Astra краще за попередні моделі визначає, як правильно діяти. Вона використовує контекст, щоб самостійно заповнювати типові прогалини, і ставить конкретні уточнювальні запитання, якщо відповідь може вплинути на результат. У Codex вона може поставити запитання асинхронно й водночас продовжити роботу, яка не залежить від вашої відповіді. Якщо ви не відповідаєте, вона, де це доречно, продовжує роботу на основі обґрунтованих припущень, але перед рішеннями, що можуть мати суттєві наслідки, чекає на вашу відповідь.
Наведені нижче приклади показують, як Astra допомагає з повсякденними завданнями, у яких відсутність інформації може суттєво вплинути на відповідь.
Astra також краще зберігає контекст у міру розвитку завдання. Попередні моделі іноді сприймали вказівки щодо зміни напряму роботи як нову ціль, втрачаючи з поля зору початковий запит або попередні обмеження. Astra враховує нові вимоги, змінює підхід за запитом і відповідає на додаткові запитання, не втрачаючи з поля зору основне завдання.
Програмування
GPT‑6 Astra — найкраща на сьогодні модель для програмної інженерії.
«GPT‑6 Astra демонструє передові результати на наших внутрішніх бенчмарках із програмування та явний прогрес в оцінюваннях торгової інтуїції порівняно з GPT‑5.6 Sol. Під час автономної розробки коду GPT‑6 Astra спілкується так, що розробникам легше стежити за її роботою, і створює код, який потребує менше доопрацювань, щоб досягти якості, придатної для виробничого середовища.»
«Ми протестували Astra з низьким, середнім і високим рівнями зусиль на одному з наших оцінювань першого покоління, і вона значно випередила GPT 5.6 Sol. Вищий рівень зусиль дає більше ітерацій під час створення з нуля, більше перевірок через тестування в бравзері та більшу схильність до виконання коду замість apply-patch. Розуміння того, як модель витрачає свої зусилля, допомагає нам забезпечити мільйонам розробників швидший і надійніший шлях від ідеї до робочої програми».
З Astra ми впроваджуємо новий спосіб, який дає Codex змогу зберігати й відновлювати контекст, коли ліміт контексту вичерпується. Раніше моделі використовували ущільнення, щоб узагальнювати виконану роботу під час тривалих сеансів, наприклад під час налагодження складних проблем або масштабного рефакторингу. Під час кожного ущільнення можуть втрачатися деталі про те, чому виправлення не спрацювало або як поводиться певний компонент. У Codex Astra може зберігати нотатки між лімітами контексту, не втрачаючи накопичених деталей і не стискаючи їх щоразу в один стислий виклад. Попередні ліміти контексту залишаються доступними для пошуку, тому Astra може знаходити вимоги або результати тестів у попередніх повідомленнях і результатах роботи інструментів, навіть якщо ця інформація не була зафіксована в її нотатках. Цю експериментальну функцію можна ввімкнути у файлі config.toml Codex(відкривається у новому вікні), і протягом найближчих тижнів вона стане стандартною для Astra.
Прискорення наукових відкриттів
Astra може допомагати з практичною роботою, що стоїть за науковими відкриттями. Поєднуючи наукове міркування з можливістю працювати з комп'ютером, вона може безпосередньо працювати у спеціалізованому програмному забезпеченні, щоб перевіряти дані та досліджувати результати, допомагаючи науковцям оцінювати отримані докази й визначати, що досліджувати далі.
Кібербезпека
Як ми зазначали в нашому оновленні щодо безпеки, Astra знаменує значний стрибок у можливостях у сфері кібербезпеки та досягає порогового рівня «Критичний» відповідно до нашої рамкової системи готовності. Її здатність виявляти й розробляти експлойти нульового дня може допомагати захисникам усувати слабкі місця, але водночас вимагає посилення захисних заходів. Щоб зрозуміти, наскільки далеко сягають ці можливості, ми провели внутрішні оцінювання Astra та оцінювання за участю сторонніх експертів.
Спочатку ми протестували модель без захисних механізмів виробничого середовища на ExploitBench і ExploitGym, які оцінюють, чи здатні моделі перетворювати відомі вразливості програмного забезпечення на працездатні експлойти. На ExploitBench Astra досягла максимального результату 100% порівняно з 78,5% у GPT‑5.6 Sol, нашої попередньої передової моделі з можливостями у сфері кібербезпеки. На ExploitGym Astra досягла рівня успішності 42,4% порівняно з 30,3% у GPT‑5.6 Sol, використовуючи при цьому значно менше вихідних токенів.13
З огляду на побоювання, що знайомство з відомими вразливостями програмного забезпечення могло вплинути на результати бенчмарків, ми також оцінили Astra на двох нових бенчмарках. Для одного з них ми створили внутрішнє оцінювання ExploitBench (червень–серпень 2026 року), щоб перевірити розроблення експлойтів із використанням вразливостей, виявлених протягом попередніх трьох місяців.14 На цьому наборі даних Astra досягла значно вищих показників виконання довільного коду, ніж GPT‑5.6 Sol, використовуючи при цьому набагато менше вихідних токенів. Під час оцінювання Astra навіть виявила й використала дві раніше невідомі вразливості нульового дня. Ми повідомляємо про обидві вразливості їхнім розробникам.
Ми також протестували Astra на SRE-Bench15, бенчмарку, який оцінює, чи здатні моделі здійснювати зворотне проєктування бінарних файлів програмного забезпечення, щоб зрозуміти його основну логіку без доступу до вихідного коду. Astra виконала 88,0% завдань з однієї спроби та 99,2% — не більш ніж за чотири спроби, порівняно з 55,9% і 68,7% відповідно для GPT‑5.6 Sol.
Окрім бенчмарків, оцінювання під керівництвом експертів показало, що Astra, у разі запуску без захисних механізмів для продуктивного середовища, здатна використовувати раніше невідомі вразливості для виконання довільного коду в браузерах із посиленим захистом і створювати експлойти для підвищення привілеїв в операційних системах із посиленим захистом.
Як ми зазначали в «Вікні можливостей для захисників», передові можливості у сфері кібербезпеки можуть допомагати захисникам швидше знаходити слабкі місця, але водночас полегшують їх експлуатацію, що робить адаптацію захисників ще нагальнішою. У версії Astra, що запускається сьогодні, фахівці із захисту можуть використовувати її для виконання таких завдань, як перевірка безпеки коду та застосування виправлень.
Водночас Astra відмовлятиметься виконувати складніші завдання з кібербезпеки, як-от створення демонстраційних експлойтів для вразливостей. У межах OpenAI Daybreak протягом найближчих тижнів ми плануємо розширити доступ і запровадити менш суворі захисні обмеження. Це дасть змогу виконувати більше робочих процесів із захисту, зокрема перевіряти вразливості та демонстраційні експлойти, аналізувати шкідливе ПЗ і розробляти засоби виявлення загроз.
Ми також посилили захист від потенційних зловживань у кіберсфері, розвинувши комплекс захисних заходів, створений для GPT‑5.6 Sol. До них належать підвищена стійкість моделі до потенційних джейлбрейків і надання нашим системам моніторингу більшого контексту. Ми продовжили ретельне внутрішнє та зовнішнє тестування, зокрема автоматизовані оцінювання за допомогою наших внутрішніх засобів перевірки на вразливості та ризики. Докладніше про наші засоби кіберзахисту й тестування можна дізнатися в огляді безпеки Astra та картці системи(відкривається у новому вікні).
Відповідальне узгодження та розгортання GPT‑6 Astra
Astra — наша найбільш узгоджена модель. Astra вирізняється обачністю, дотриманням меж завдання та прозорою комунікацією. Ця робота є найновішим результатом нашої багаторічної дослідницької програми, спрямованої на навчання моделей, які залишаються узгодженими з намірами людини від початку до кінця.
У середовищах із підвищеними вимогами до безпеки Astra діє з обережністю, що відповідає рівню ризику. Під час оцінювання завдань із роботи з комп'ютером, спеціально підібраних так, щоб провокувати небажану поведінку, Astra успішніше уникала непередбачених наслідків. Використання додаткових заходів безпеки, увімкнених за замовчуванням, дало ще кращі результати.
Astra спричиняє менше неузгоджених результатів, ніж будь-яка інша протестована передова модель. Для коректного порівняння ми використовували універсальну систему harness для агентів для керування комп'ютером (побудовану на вбудованих інструментах для роботи з комп'ютером, доступних як в OpenAI Responses API(відкривається у новому вікні), так і в Anthropic Messages API(відкривається у новому вікні)) без додаткових засобів захисту, які зазвичай застосовуються для користувачів Codex і ChatGPT Робота (як-от автоматична перевірка та політика підтвердження).
Astra також частіше діє в межах, установлених користувачем і передбачених середовищем. Під час внутрішнього оцінювання Astra жодного разу не намагалася обійти відхилення дії системою Codex Auto-Review. Astra не намагалася цього робити навіть тоді, коли Auto-Review навмисно налаштовували так, щоб її можна було обійти, а без обходу виконати завдання було неможливо. Таке дотримання обмежень середовища узгоджується з результатами нашого оцінювання завдань, які неможливо вирішити, у сфері кібербезпеки, про яке ми згадували на початку цієї публікації, а також з іншими результатами, наведеними в нашій картці системи(відкривається у новому вікні).
Astra також встановлює новий стандарт прозорої комунікації з користувачами. В одному з оцінювань Astra утричі рідше, ніж GPT‑5.6 Sol, неточно повідомляє про свої можливості та доступні їй дії.
У нашому оцінюванні галюцинацій щодо власних можливостей Astra демонструє суттєве покращення порівняно з GPT‑5.6 Sol і рідше робить оманливі твердження про свої можливості.
Наші оцінювання показали, що за письмовими міркуваннями Astra складніше стежити, ніж за міркуваннями GPT‑5.6 Sol. Цей висновок ґрунтується на тестах, у яких модель прямо просили уникати моніторингу. Ми пов'язуємо це з тим, що в простіших завданнях Astra краще контролює, як викладає свої міркування письмово, і може розв'язувати задачі з меншою кількістю письмових кроків. Водночас Astra, схоже, й досі важко приховувати міркування, необхідні для виконання складних завдань, але ми серйозно ставимося до погіршення цього показника. Підвищення можливості моніторингу залишається одним із пріоритетів наших досліджень, а в супровідній картці системи(відкривається у новому вікні) докладно описано наші висновки та поточну роботу.
Навчання узгодженню є основою нашого підходу до розгортання моделей. Як додатковий рівень захисту ми також створюємо системні засоби безпеки, як-от Codex Auto-review(відкривається у новому вікні) і моніторинг міркувань та дій агентів, щоб допомогти виявляти й стримувати небезпечну поведінку. Як описано в нашому оновленні щодо безпеки, для моделей класу Astra ми також запроваджуємо у виробничому середовищі моніторинг неузгодженої поведінки, щоб виявляти її та допомагати стримувати найсерйозніші прояви. Ці захисні механізми подібні до тих, які ми використовуємо для моніторингу внутрішніх розгортань, і включають систему класифікаторів, що перевіряють міркування та дії моделі на ознаки несанкціонованої поведінки й автоматично зупиняють потенційно несанкціоновані дії.
З огляду на значне зростання можливостей Astra у сфері кібербезпеки ми особливо ретельно дбаємо про безпеку цього розгортання. Додаткові перевірки безпеки іноді можуть уповільнювати, призупиняти або зупиняти цілком допустиму роботу, зокрема завдання з кіберзахисту. Якщо завдання буде призупинено в ChatGPT або Codex, перед продовженням вас можуть попросити перевірити дію. В API виконання завдання буде припинено. Іноді ці перевірки можуть переривати цілком правомірну роботу, тому ми продовжуємо вдосконалювати цю систему, щоб зменшити кількість зайвих переривань. Моніторинг неузгодженої поведінки не може замінити узгодження: наша мета полягає в тому, щоб створювати моделі, які надійно діють лише в межах наданих їм повноважень, щоб цим захисним механізмам не доводилося втручатися.
Доступність
Сьогодні GPT‑6 Astra починає ставати доступною для обмеженого кола організацій, а протягом найближчих днів стане доступною всім користувачам ChatGPT Plus, Pro, Business і Enterprise, а також через OpenAI API, Microsoft Azure і AWS Bedrock. Використання Astra входить до обсягів, передбачених наявною підпискою. Користувачі та компанії також зможуть купувати кредити для додаткового використання. Користувачі планів Pro, Business і Enterprise також отримають доступ до GPT‑6 Astra Pro. Адміністратори Enterprise зможуть увімкнути Astra для свого робочого простору. На момент запуску доступ буде вимкнено за замовчуванням.
Astra підтримує нульове збереження даних для клієнтів API, які відповідають установленим вимогам. Крім того, як ми повідомляли минулого місяця, ми тестуємо Private Safety Processing, щоб посилити моніторинг безпеки, зберігаючи конфіденційність клієнтів.
Для розробників GPT‑6 Astra буде доступна в OpenAI API як gpt-6-astra, а також через Microsoft Azure і Amazon Bedrock.
Стандартна ціна в OpenAI API становить 10 дол. США за 1 млн вхідних токенів і 50 дол. США за 1 млн вихідних токенів. Для читання з кешу та запису в кеш діють окремі тарифи. Швидкий режим доступний для GPT‑6 Astra в API та забезпечує до 2 разів вищу швидкість, ніж стандартна обробка, за подвійною стандартною ціною.
Професійний
Професійний | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% | - |
BenchCAD | 95,9% | 83,3% | 84,3% 5 | 67,5% 5 | 82,1% 5 | - |
BrowseComp | 91,5% | 90,4% | - | 87,4% | 90,8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Внутрішні завдання з дизайну | 50,0% | 47,4% | - | 35,8% | - | - |
Внутрішні завдання з аналізу даних | 40,9% | 30,5% | - | 34,7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Програмування
| Програмування | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% | 19,1% | ||||||
| «DeepSWE V11» | «74 | 1%» | «72 | 7%» | «67 | 4%» | «69 | 9%» | «73 | 7%» | «73 | 8%» |
| FrontierCode 1.1 Extended (оцінка) | 64,5% 8 | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% | ||||||
| FrontierCode 1.1 Main (оцінка) | 53,3% 8 | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% | ||||||
| «Внутрішні завдання з міграції баз даних» | «63 | 9%» | «42 | 7%» | «57 | 8%» | «50 | 3%» | «-» | «-» | ||
| «Artificial Analysis Coding Agent Index v1.4» | «67 | 0» | «65 | 1» | «-» | «67 | 2» | «68 | 1» | «61 | 2» |
Академічність
Академічність | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21,4% | 30,0% | - |
FrontierMath, рівень 4 (v2) | 97,6% | 83,0% | 87,8% | 90,2% | 73,2% | - |
GPQA Diamond | 96,0% | 94,6 % | 93,7% | 92,6% | 93,7% | 95,3% |
Humanity's Last Exam (з інструментами) | 57,2% | - | 65,0% | 63,8% | 63,6% | - |
Наука та здоров’я
Узгодженість
Узгодженість | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Внутрішній бенчмарк безпеки роботи з комп'ютером (що нижче, то краще) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Внутрішній бенчмарк безпеки роботи з комп'ютером з AutoReview (що нижче, то краще) | 1,8% | 4,3% | - | - | - | - |
Внутрішній бенчмарк обходу обмежень (що нижче, то краще) | 0,00% | 0,29% | - | - | - | - |
Пастка ExploitGym (що нижче, то краще) | 0,0% | 48,2% | - | - | - | - |
Завдання ExploitGym без можливого рішення | 100,0% | - | - | - | - | - |
Внутрішній бенчмарк щодо галюцинацій (що нижче, то краще) | 4,2% | 12,2% | - | - | - | - |
Розширений контекст
Розширений контекст | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96,3% | 73,8% | - | - | - | - |
Абстрактне мислення
| «Абстрактне міркування» | «GPT‑6 Astra» | «GPT‑5.6 Sol» | «Claude Fable 5.1» | «Claude Fable 5» | «Claude Opus 5» | «Gemini 3.8 Flash» | |||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| «ARC-AGI-3» | «99 | 9% 1» | «7 | 8%» | «-» | «-» | «30 | 2%» | «-» | ||
| «ARC-AGI-2» | «95 | 0%» | «92 | 5%» | «90 | 0%» | «89 | 2%» | «90 | 4%» | «-» |
| «ARC-AGI-1» | «98 | 5%» | «97 | 5%» | «97 | 5%» | «98 | 5%» | «97 | 5%» | «-» |
Результати оцінювання наведено як максимальні значення, досягнуті за будь-якого рівня зусилля. Оцінювання GPT проводили в нашому дослідницькому середовищі або через наш API, тому через відмінності в системних запитах, доступних інструментах тощо результати можуть дещо відрізнятися від результатів у робочій версії ChatGPT.
ПРИМІТКИ
- 1
На ARC-AGI-3 GPT-6 Astra запускали за допомогою нашої системи harness для Responses API, у якій змінено два налаштування, щоб результати краще відповідали роботі в реальних умовах. Ці зміни не спрямовані спеціально на ARC-AGI-3.
- 2
Під GPT-5.6 Sol мається на увазі версія, доступна в нашому API, ChatGPT Codex і ChatGPT Робота. Версія в ChatGPT Чат дещо відрізняється.
- 3
OSWorld V2-Offline — це піднабір оригінального OSWorld V2, який працює без доступу до інтернету. Результати моделей Claude на OSWorld V2-Offline були відтворені авторами в офіційній таблиці лідерів(відкривається у новому вікні). На OSWorld 2.0 для Claude наведено результати зі стандартними офіційними налаштуваннями, а не зі зміненими завданнями та зміненою системою оцінювання із картки системи Fable 5.1.
- 4
- 5
На BenchCAD результати Claude враховують 3 зміни в методиці оцінювання, докладно описані в картці системи Fable 5.1(відкривається у новому вікні).
- 6
Ґуан Ян, Вікторія Еберт, Назіф Тамер, Браян Сіюань Чжен, Луїза Поццобон і Ноа А. Сміт. «LEGATO: масштабний наскрізний узагальнюваний підхід до розпізнавання друкованого нотного запису(відкривається у новому вікні)». arXiv:2506.19065, 2025.
- 7
Марк Р. Г. Ґотем, Морін Редбонд, Бруно Бауер і Пітер Джонас. «Корпус струнних квартетів OpenScore(відкривається у новому вікні)». Матеріали 10-ї Міжнародної конференції з цифрових бібліотек для музикознавства, с. 49–57. ACM, 2023.
- 8
На FrontierCode GPT-6 Astra запускали з повідомленням розробника, подібним до розділу її повідомлення розробника в Codex(відкривається у новому вікні): «Не створюйте зайвих тестових файлів. Створюйте новий тестовий файл лише тоді, коли цього вимагають правила репозиторію або коли жоден наявний файл для цього не підходить. Уникайте не пов'язаного із завданням очищення коду та зайвої складності. Повторно використовуйте відповідні наявні утиліти. Ознайомтеся з відповідними інструкціями репозиторію та перегляньте пов'язаний код, тести, документацію й CI. Дотримуйтеся усталених правил. Мета — чистий код, готовий до злиття». Запит не було оптимізовано спеціально для цього оцінювання.
- 9
Перше стосується того, наскільки близько одне до одного можуть розташовуватися прості числа, незалежно від того, як далеко просуватися числовою прямою. Понад десять років найкращий відомий результат показував, що існує нескінченно багато пар простих чисел, відстань між якими не перевищує 246. Юлія Штадльманн(відкривається у новому вікні) нещодавно покращила цю межу до 240. Astra допомогла встановити ще кращу межу 186, показавши, що нескінченно багато пар простих чисел розташовані на відстані не більш ніж 186. Малі проміжки між простими числами: доведення(відкривається у новому вікні) та супровідні матеріали дослідження(відкривається у новому вікні).
- 10
Друге стосується незвично великих проміжків між простими числами. Astra покращила один із параметрів межі для таких проміжків, який залишався незмінним понад 80 років. Ми публікуємо доведення, скорочений ланцюжок міркувань і матеріали для перевірки обох результатів. Великі проміжки між простими числами: доведення(відкривається у новому вікні) та супровідні матеріали дослідження(відкривається у новому вікні).
- 11
- 12
- 13
- 14
ExploitBench (червень–серпень 2026 року) містить 20 вразливостей V8 високого ступеня серйозності у 13 стабільних випусках Chrome. Бенчмарк перевіряє, чи можуть агенти досягти довільного виконання коду у V8 та офіційних випусках Chrome для Linux, експлуатуючи кожну зазначену вразливість. Деякі з включених вразливостей можуть не давати змоги виконати довільний код за встановлених обмежень оцінювання, тому досягнення 100% успішності може бути неможливим. Примітка: результат GPT-5.6 Sol у 5,5% є наслідком обмеження бенчмарку в 300 ходів, якого не мають реальні клієнти, що використовують Max. Модель за подібних налаштувань досягла результату 11,5% за меншої кількості досягнутих лімітів.
- 15
Джеремі Спенс та ін. «Наступний виклик для агентної кібербезпеки: реалістичний бенчмарк зворотного проєктування без впливу навчальних даних(відкривається у новому вікні)». arXiv:2608.11469v1, 2026.
- 16
Під час тестування моделей сторонніх постачальників ми використовуємо простіше дослідницьке середовище. Codex має складнішу конфігурацію для виробничого середовища, через що початкові показники помилок моделі можуть відрізнятися. Також відрізняються захисні механізми з боку постачальників і реалізації інструментів для роботи з комп'ютером. У Codex користувачі не стикаються зі сценарієм без підтвердження, оскільки він використовується лише для внутрішніх досліджень.
- 17
