Нова генерација интелигенције
Представљамо GPT‑6 Astra, најинтелигентнији и најусклађенији модел на свету.
GPT‑6 Astra обједињује године истраживања и велика улагања у предобуку, подстицајно учење и усклађивање. Astra је на нивоу најсавременијих достигнућа у коришћењу рачунара, прегледању мреже, софтверском инжењерству, сајбер-безбедности, науци и професионалном раду. Astra достиже засићење на FrontierMath нивоу 4 са резултатом од 98%, након што је већ помогла у решавању дугогодишњих отворених проблема у математици. Astra такође достиже засићење на ARC-AGI-3 са резултатом од 99,9% и на ExploitBench-у са резултатом од 100%. Такође помера границе у коришћењу рачунара и прегледача, обављајући најзахтевнији професионални рад ненадмашном брзином, прецизношћу и расуђивањем.
GPT‑6 Astra се од данас постепено уводи за ограничен број организација, а током наредних дана постаће доступан свим корисницима пакета ChatGPT Plus, Pro, Business и Enterprise, као и путем OpenAI API-ја, Microsoft Azure-а и AWS Bedrock-а.
Astra је наш најусклађенији модел, са значајним побољшањима у разумевању намере корисника и понашања модела – можете јој поверити задатке са већим поверењем у њену процену. Као један од начина на који ово тестирамо, развили смо нову евалуацију засновану на сазнањима из инцидента са платформом Hugging Face, која процењује да ли ће модел суочен са тешким или немогућим задатком изаћи изван свог предвиђеног опсега. У поређењу са GPT‑5.6 Sol, који је без заштитних мера у продукционом окружењу у 48% случајева прелазио преко одобреног циља, GPT‑6 Astra је то учинио у 0% случајева.
Најбољи модел на свету за коришћење рачунара
GPT‑6 Astra представља нову границу у брзини, прецизности и безбедности коришћења рачунара. Може да обавља заморне задатке као што су попуњавање онлајн образаца, ажурирање евиденције о клијентима у CRM-у и организовање вашег календара. Може да обавља истраживања на мрежи и саставља сажетке у вашој е-пошти или у уређивачу докумената. Може да анализира научне податке, генерише графиконе, креира веб-сајт и покреће QA провере frontend-а да би се проверило да ли све функције на том сајту раде. Може да вам помогне да самостално инсталирате и тестирате софтвер, као и да решавате проблеме које видите на екрану. Ова побољшања се такође одражавају у нашим најбољим резултатима евалуације до сада.
Ова побољшања такође доводе до значајних повећања ефикасности у стварним задацима интелектуалног рада. У симулацијама кашњења на OSWorld 2.0, Astra постиже боље перформансе при коришћењу рачунара за око 47% мање времена по задатку него GPT‑5.6 Sol, са резултатом од 72,6% за отприлике 40 минута по задатку, у поређењу са 65,7% за отприлике 75 минута.3
Могућности GPT‑6 Astra за коришћење рачунара могу се видети у резултатима у различитим областима, укључујући развој игара, електротехничко инжењерство и свакодневни рад заснован на знању:
Поред Astra, ажурирамо и Codex окружење како бисмо значајно побољшали брзину коришћења рачунара. У комбинацији са ефикасношћу модела Astra, то омогућава 1,9 пута брже довршавање задатака у поређењу са тренутним искуством са GPT‑5.6 Sol на мерилу Mind2Web. Побољшања брзине модела значе да може да преузме многе дуготрајне свакодневне задатке за вас, брже него што бисте ви могли.
Суштински преображај стручног рада
GPT‑6 Astra обједињује напретке у коришћењу рачунара са циљаном обуком за професионална окружења, како би помогао у решавању сложених радних задатака. Комбинује интелигенцију потребну за сложене проблеме са способношћу обављања вишекорачних радних токова и израде углађених докумената, табела и презентација.
GPT‑6 Astra је наш најбољи модел за придржавање постојећих шаблона и креирање добро распоређених слајдова који сажето преносе кључне поенте кроз структурисан наратив. Креира јасне, добро структуриране документе, презентације, табеле и анализе који прате ваше шаблоне и усклађени су са вашим стилом писања и визуелним стилом. Астра је такође обучена да у излазне резултате укључује само контекст који је релевантан, уместо да понавља информације које нису неопходне за тренутни задатак. Све то значи да може да генерише артефакте који су непосредније употребљиви и усклађени са вашим пословним контекстом и стандардима.
GPT‑6 Astra такође уноси боље визуелно расуђивање у веб-сајтове, игре, апликације и рендере које креира. Помоћу Сајтова(отвара се у новом прозору) у услузи ChatGPT, Astra може директно помоћу инструкције да креира, хостује и дели веб-сајтове, веб-апликације и игре.
Када упутства остављају простор за тумачење, GPT‑6 Astra је бољи од претходних модела у доношењу исправне одлуке. Користи контекст да попуни уобичајене празнине и поставља усмерена питања када би одговор могао да промени исход. У Codex-у може асинхроно да поставља питања док наставља рад који не зависи од вашег одговора. Ако не одговорите, наставља на основу разумних претпоставки када је то прикладно, али чека ваш унос када су у питању одлуке са значајним последицама.
Примери у наставку показују како Astra сарађује на свакодневним задацима где недостатак информација може значајно променити одговор.
Astra такође боље одржава оријентацију како се задатак развија. Ранији модели су понекад усмеравајуће поруке третирали као нови циљ, губећи из вида првобитни захтев или ранија ограничења. Astra интегрише нове захтеве, мења смер када се то од ње затражи и одговара на споредна питања, не испуштајући из вида шири задатак.
Кодирање
GPT‑6 Astra је до сада најбољи модел за софтверско инжењерство.
„GPT‑6 Astra пружа врхунске перформансе на нашим интерним бенчмарк испитивањима за програмирање и показује јасан напредак у проценама интуиције за трговање у поређењу са GPT‑5.6 Sol. Када се користи за програмирање од стране агента, GPT‑6 Astra комуницира на начин који програмери лакше прате и ствара кôд који захтева мање итерација да би достигао квалитет спреман за продукцију.
„Тестирали смо Astra на ниском, средњем и високом нивоу напора у једној од наших евалуација прве генерације и показала се знатно бољом од GPT 5.6 Sol. Виши ниво напора омогућава више итерација на новој верзији, више провере путем тестирања у прегледачу и веће ослањање на извршавање кода него на apply-patch. Разумевањем начина на који модел троши свој напор, милионима стваралаца пружамо бржи и поузданији пут од идеје до функционалне апликације.“
Уз Astra представљамо нови начин да Codex сачува и преузме контекст када се прозор контекста попуни. Модели су до сада користили компакцију да би резимирали рад током дугих сесија, на пример при отклањању сложених проблема или спровођењу великих рефакторисања. При свакој компакцији могу да изостану детаљи о томе зашто исправка није успела или како се компонента понаша. У Codex-у, Astra може да чува белешке у више прозора контекста, задржавајући прикупљене детаље без њиховог поновљеног сажимања у један резиме. Ранији прозори контекста остају претраживи, па Astra може да пронађе захтеве или резултате тестирања из претходних порука и излаза алата – чак и ако те информације нису забележене у њеним белешкама. Ову експерименталну функцију можете да омогућите у датотеци config.toml за Codex,(отвара се у новом прозору) а у наредним недељама постаће подразумевана опција за Astra.
Унапређивање научних открића
GPT‑6 Astra представља значајан напредак за научна открића, математику и здравље. Данас представљамо још два резултата о размацима између простих бројева [WITH LINK]. Astra такође поставља нове рекорде у скупу научних евалуација:
Astra може да помогне у практичном раду који стоји иза научних открића. Комбиновањем научног резоновања и коришћења рачунара, може непосредно да ради у специјализованом софтверу како би прегледала податке и истраживала резултате, помажући истраживачима да процене доказе и одлуче шта даље да истражују.
Сајбер безбедност
Astra представља значајан искорак у способностима у сајбер безбедности. Та способност да идентификује и развија експлоите нултог дана може помоћи браниоцима да закрпе рањивости, али такође ствара потребу за снажнијим заштитним мерама. Да бисмо разумели домет ових могућности, користили смо интерне и независне стручне процене.
Најпре смо тестирали Astra на мерилима ExploitBench и ExploitGym, која мере да ли модели могу да остваре извршавање произвољног кода у рањивим базама кода.
С обзиром на могућу забринутост да је изложеност историјским софтверским рањивостима можда утицала на резултате мерила, Astra-у смо такође оценили на два нова мерила. Као један пример, изградили смо интерну евалуацију „ExploitBench (јун–август 2026)” за тестирање развоја експлоата коришћењем рањивости из претходна три месеца. 2 Astra је на овом скупу података постигла знатно високе стопе произвољног извршавања кода него GPT‑5.6 Sol, уз далеко мање излазних токена. Током евалуације, Astra је открила и употребила две претходно непознате технике за излазак из Chrome V8 heap sandbox-а. Пријављујемо обе рањивости њиховим одржаваоцима.
Такође смо тестирали Astra-у на бенчмарку SRE-Bench, који процењује да ли модели могу да примене реверзни инжењеринг на бинарни софтвер како би разумели његову основну логику. Аутори бенчмарка су направили софтвер од нуле и задржали његов изворни кôд приватним. Astra је решила 88,0% задатака у једном покушају и 99,2% у највише четири покушаја, у поређењу са 55,9%, односно 68,7%, за GPT‑5.6 Sol.
Поред benchmark тестова, процене које су водили стручњаци показале су да је Astra могла да користи раније непознате рањивости како би постигла извршавање произвољног кода у ојачаним прегледачима и креирала експлоите за ескалацију привилегија за ојачане оперативне системе. Сагледани заједно, ови резултати навели су нас да закључимо да је Astra достигла критични праг у сајбер безбедности према нашем Оквиру спремности.
Као што смо говорили у Прозору браниоца, граничне сајбер могућности могу помоћи браниоцима да брже пронађу слабости, али такође олакшавају њихово искоришћавање, што повећава хитност прилагођавања бранилаца.
За верзију Astra која се данас објављује, подржавамо важне одбрамбене задатке као што су безбедносни преглед кода, примена закрпа и моделовање претњи. Међутим, Astra ће подразумевано одбити да извршава напредне задатке из области сајбер-безбедности, као што је откривање експлоита. Преко програма OpenAI Daybreak, уводимо мање рестриктиван приступ алфа групи поузданих стручњака за одбрану у сајбер-безбедности у програму OpenAI Daybreak. Ово проширује приступ одбрамбеним токовима рада, укључујући тријажу и валидацију рањивости, анализу малвера, инжењеринг детекције и валидацију закрпа. Планирамо да додатно проширимо приступ путем Daybreak Blue.
Такође смо ојачали заштиту од потенцијалне злоупотребе у сајбер простору, надовезујући се на наш скуп заштитних мера за GPT‑5.6 Sol. То обухвата снажнију обуку за отпорност модела како би се боље одупирали потенцијалним начинима заобилажења безбедносних мера, као и више контекста за наше системе за надзор. Наставили смо са ригорозним интерним и спољним тестирањем, укључујући аутоматизована тестирања са нашим интерним нападачима из црвена команда. Више детаља о нашим заштитним мерама у сајбер-простору и тестирању доступно је у системској картици Astra и на нашем блогу.
Одговорно усклађивање и примена модела GPT‑6 Astra
Astra је наш најусклађенији модел. Astra се истиче пажљивим поступањем, поштовањем граница задатка и транспарентном комуникацијом. Овај рад је најновији производ нашег дугогодишњег истраживачког програма усмереног на обуку модела који остају усклађени са људском намером од почетка до краја.
У осетљивим окружењима, Astra поступа опрезно, сразмерно ризику. У евалуацији задатака коришћења рачунара који су адверсаријално одабрани да изазову нежељено понашање, Astra је била успешнија у избегавању непредвиђених последица. Покретање са додатним безбедносним мерама које се подразумевано нуде резултирало је још бољим перформансама.
Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(отвара се у новом прозору) and Anthropic Messages API(отвара се у новом прозору)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16
Astra ће такође вероватније функционисати у оквиру граница које је поставио корисник и које подразумева њено окружење. У интерној евалуацији Astra ниједном није покушала да заобиђе одбијање аутоматске провере у Codex-у. То је важило чак и када је функција Auto-review намерно била подешена тако да се може заобићи, а задатак иначе није било могуће довршити. Овакво поштовање ограничења окружења у складу је са резултатима наше евалуације немогућих сајбер задатака, коју смо поделили у уводу ове објаве, као и са другим налазима документованим у нашој системској картици(отвара се у новом прозору).
Astra такође показује значајно смањење обмањујућег понашања. Људима који делегирају посао потребно је јасно разумевање могућности модела и искрено извештавање о његовом напретку. Ово мери један аспект искрености; смањење намерног обмањивања остаје шири фокус нашег рада на усклађивању.
У нашој евалуацији халуцинација у вези са способностима, Astra показује значајно побољшање у односу на GPT‑5.6 Sol, при чему износи мање обмањујућих тврдњи о својим способностима.
Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(отвара се у новом прозору) details our findings and ongoing work.
Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(отвара се у новом прозору) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.
Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.
Доступност
GPT‑6 Astra се од данас постепено уводи за предузећа и кориснике нашег Програма поузданог приступа, а широка доступност за особе које су претплаћене на ChatGPT Plus, Pro, Business и Enterprise уследиће током наредних неколико дана. Коришћење услуге Astra укључено је у постојећи лимит коришћења у Pro плановима од 100 УСД и 200 УСД, као и у Business плану од 100 УСД, без додатних ограничења стопе или других ограничења. Особе са претплатом на Plus од 20 УСД и корисници стандардног Business плана могу да приступе GPT‑6 Astra уз нижа ограничења, уз могућност куповине кредита за додатни приступ. Администратори Enterprise-а могу да омогуће Astra за свој радни простор; приступ је подразумевано искључен при покретању.
Корисници планова Pro Lite, Pro, Business и Enterprise могу да користе и GPT‑6 Astra у ћаскању. Astra подржава незадржавање података за клијенте API-ја који испуњавају услове, а као што смо навели прошлог месеца, тестирамо приватну обраду за безбедност како бисмо ојачали праћење безбедности уз очување приватности клијената.
За програмере, GPT‑6 Astra је доступан у API-ју OpenAI као gpt-6-astra, као и у AWS Bedrock-у. Стандардна цена API-ја OpenAI износи 10 УСД по милиону улазних токена и 50 УСД по милиону излазних токена. За читања из кеша и уписе у кеш примењују се засебне цене. Брзи режим је доступан за GPT‑6 Astra у API-ју и пружа до 2,5 пута већу брзину од Стандардне обраде по двострукој Стандардној цени.
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |
Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Coding
| Coding | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (score) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (score) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Academic
Academic | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Humanity's Last Exam (w/ tools) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
Усклађеност
Усклађеност | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Интерно безбедносно бенчмарк испитавање за коришћење рачунара (ниже је боље) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Интерно безбедносни бенчмарк испитивање за коришћење рачунара, са AutoReview (што ниже, то боље) | 1,8% | 4,3% | - | - | - | - |
Интерно бенчмарк испитивање заобилажења (ниже је боље) | 0,00% | 0,29% | - | - | - | - |
Замка у ExploitGym-у (мање је боље) | 0,0% | 48,2% | - | - | - | - |
Немогући ExploitGym | 100,0% | - | - | - | - | - |
Интерно бенчмарк испитивање халуцинација (ниже је боље) | 4,2% | 12,2% | - | - | - | - |
Дуги контекст
Дуги контекст | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8 игала 256K–512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8 игала 512K–1M | 96,3% | 73,8% | - | - | - | - |
Апстрактно резоновање
| Abstract reasoning | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
Резултати процене су максимални при било ком нивоу напора. GPT процене су спроведене у нашем истраживачком окружењу или путем нашег API-ја, што може да доведе до незнатно другачијег излаза у односу на продукциони ChatGPT због разлика у системским инструкцијама, доступним алаткама итд.
FOOTNOTES
- 1
On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.
- 2
GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.
- 3
OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(отвара се у новом прозору). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.
- 4
- 5
On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(отвара се у новом прозору).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(отвара се у новом прозору).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(отвара се у новом прозору).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
On FrontierCode, GPT-6 Astra was run with a developer message similar to a section of its developer message in Codex(отвара се у новом прозору): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.
- 9
The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(отвара се у новом прозору) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(отвара се у новом прозору) and supporting research(отвара се у новом прозору).
- 10
The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(отвара се у новом прозору) and supporting research(отвара се у новом прозору).
- 11
- 12
- 13
- 14
ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(отвара се у новом прозору).” arXiv:2608.11469v1, 2026.
- 16
When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.
- 17
