Nova generacija inteligencije
Ažurirano 22. rujna 2026.: Proširujemo obitelj GPT‑6 modelima GPT‑6 Sol i GPT‑6 Luna. Saznajte više.
Predstavljamo GPT‑6 Astra, najinteligentniji i najusklađeniji model na svijetu.
GPT‑6 Astra objedinjuje godine istraživanja i velika ulaganja u predtreniranje, učenje s potkrepljivanjem i usklađivanje. Astra je najsuvremenija u korištenju računala, pregledavanju weba, softverskom inženjerstvu, kibernetičkoj sigurnosti, znanosti i profesionalnom radu. Astra postiže zasićenje na FrontierMath Tier 4 rezultatom od 98 %, nakon što je već pomogla riješiti dugogodišnje otvorene probleme u matematici. Astra također postiže gotovo maksimalan rezultat od 99,9 % na ARC-AGI-3 i rezultat od 100 % na ExploitBenchu. Također postavlja novu granicu u upotrebi računala i preglednika te uz neusporedivu brzinu, preciznost i prosudbu obavlja najzahtjevniji profesionalni rad.
Model GPT‑6 Astra uvodi se danas za ograničen broj organizacija, a tijekom sljedećih nekoliko dana postat će dostupan svim korisnicima planova ChatGPT Plus, Pro, Business i Enterprise, kao i putem API-ja OpenAI-ja, platforme Microsoft Azure i usluge AWS Bedrock.
Astra je naš najbolje usklađen model, uz znatna poboljšanja u razumijevanju namjere korisnika i ponašanja modela — zadatke sada možete delegirati s većim pouzdanjem u Astrinu prosudbu. Kao jedan od načina na koji to testiramo, izradili smo novu evaluaciju oblikovanu na temelju incidenta povezanog s Hugging Faceom, kojom se procjenjuje hoće li model suočen s teškim ili nemogućim zadatkom prekoračiti svoj predviđeni opseg. U usporedbi s modelom GPT‑5.6 Sol, koji je bez zaštitnih mjera u produkciji prekoračio odobreni cilj u 48 % slučajeva, model GPT‑6 Astra to je učinio u 0 % slučajeva.
Najbolji model na svijetu za upotrebu računala
GPT‑6 Astra označava novu granicu u brzini, preciznosti i sigurnosti rada na računalu. Može se pobrinuti za zamorne zadatke kao što su ispunjavanje internetskih obrazaca, ažuriranje evidencija o klijentima u CRM-u i organiziranje vašeg kalendara. Može provoditi istraživanja na internetu i izrađivati nacrte sažetaka u vašoj e-pošti ili programu za uređivanje dokumenata. Može analizirati znanstvene podatke, generirati grafikone, izraditi web-mjesto i provoditi provjere kvalitete frontenda (QA) kako bi se osiguralo da sve funkcionalnosti na tom web-mjestu rade ispravno. Može vam pomoći da autonomno instalirate i testirate softver te otklonite poteškoće koje vidite na zaslonu. Ta se poboljšanja odražavaju i u našim vrhunskim rezultatima evaluacije.
Ova poboljšanja također rezultiraju značajnim povećanjem učinkovitosti u stvarnim zadacima intelektualnog rada. U simulacijama latencije na OSWorldu 2.0, Astra postiže bolje performanse pri korištenju računala, uz približno 47 % manje vremena po zadatku nego GPT‑5.6 Sol, s rezultatom od 72,6 % uz otprilike 40 minuta po zadatku, u usporedbi s rezultatom od 65,7 % uz otprilike 75 minuta.3
Mogućnosti korištenja računala modela GPT‑6 Astra vidljive su u rezultatima rada u različitim područjima, uključujući razvoj igara, elektrotehniku i svakodnevni rad temeljen na znanju:
Uz Astru ažuriramo i testni sklop Codexa kako bismo znatno poboljšali brzinu rada na računalu. U kombinaciji s učinkovitošću Astre, to na mjerilu Mind2Web omogućuje 1,9 puta brže dovršavanje zadataka u usporedbi s trenutačnim iskustvom s modelom GPT‑5.6 Sol. Poboljšanja brzine modela znače da model može preuzeti mnoge dugotrajne svakodnevne zadatke umjesto vas i obaviti ih brže od vas.4
Velik iskorak u profesionalnom radu
GPT‑6 Astra objedinjuje napredak u radu na računalu s ciljanim osposobljavanjem za profesionalna okruženja kako bi pomogao u rješavanju složenih radnih zadataka. Kombinira inteligenciju potrebnu za složene probleme sa sposobnošću izvršavanja višekoračnih radnih procesa i izrade dotjeranih dokumenata, proračunskih tablica i prezentacija.
GPT‑6 Astra naš je najbolji model za pridržavanje postojećih predložaka i izradu pregledno raspoređenih slajdova koji sažeto prenose ključne točke kroz strukturirani narativ. Stvara jasne, dobro strukturirane dokumente, prezentacije, proračunske tablice i analize koje slijede vaše predloške i odgovaraju vašem pisanom i vizualnom stilu. Astra je također obučena da u izlazne rezultate uključuje samo relevantan kontekst, umjesto da ponavlja informacije koje nisu potrebne za trenutačni zadatak. Sve to znači da može generirati artefakte koji su spremniji za neposrednu upotrebu i odgovaraju vašem poslovnom kontekstu i standardima.
GPT‑6 Astra donosi i bolju vizualnu prosudbu pri izradi web-mjesta, igara, aplikacija i renderiranja. Putem opcije Sites(otvara se u novom prozoru) u ChatGPT‑u, Astra može izravno iz upita izraditi, hostirati i dijeliti web-mjesta, web aplikacije i igre.
Kada upute ostavljaju prostor za tumačenje, GPT‑6 Astra bolje od prethodnih modela donosi ispravne odluke. Služi se kontekstom za popunjavanje uobičajenih praznina i postavlja ciljana pitanja kada bi odgovor mogao promijeniti ishod. U Codexu može asinkrono postavljati pitanja dok nastavlja rad koji ne ovisi o vašem odgovoru. Ako ne odgovorite, nastavit će uz razumne pretpostavke gdje je to prikladno, ali će pričekati vaš unos u vezi s odlukama s važnim posljedicama.
Primjeri u nastavku pokazuju kako Astra surađuje na svakodnevnim zadacima u kojima informacije koje nedostaju mogu značajno promijeniti odgovor.
Astra također bolje ostaje usmjerena kako se zadatak razvija. Raniji modeli ponekad su poruke za usmjeravanje tretirali kao novi cilj, pri čemu su gubili iz vida izvorni zahtjev ili ranija ograničenja. Astra uključuje nove zahtjeve, mijenja smjer kada se to zatraži i odgovara na usputna pitanja bez gubljenja iz vida šireg zadatka.
Kodiranje
GPT‑6 Astra najbolji je model za softversko inženjerstvo dosad.
„GPT‑6 Astra ostvaruje vrhunske rezultate na našim internim mjerilima za kodiranje i pokazuje jasan napredak u evaluacijama intuicije za trgovanje u usporedbi s modelom GPT‑5.6 Sol. Kada se upotrebljava za kodiranje uz pomoć AI agenta, GPT‑6 Astra komunicira na način koji razvojni inženjeri lakše mogu pratiti te proizvodi kôd koji zahtijeva manje iteracija za postizanje produkcijske kvalitete.”
„Testirali smo Astru pri niskoj, srednjoj i visokoj razini napora na jednoj od naših evaluacija prve generacije i znatno je nadmašila GPT 5.6 Sol. Veći napor donosi više iteracija pri izradi nove verzije, više provjera putem testiranja u pregledniku i sklonost izvršavanju kôda u odnosu na apply-patch. Razumijevanje načina na koji model ulaže svoj napor omogućuje nam da milijunima onih koji izrađuju sustave pružimo brži i pouzdaniji put od ideje do funkcionalne aplikacije.
S Astrom uvodimo novi način na koji Codex može očuvati i dohvatiti kontekst kada se kontekstni prozor popuni. Modeli su se dosad koristili funkcijom sažimanja za sažimanje rada tijekom dugih sesija, primjerice pri otklanjanju složenih pogrešaka ili radu na velikim refaktorima. Svako sažimanje može izostaviti pojedinosti o tome zašto ispravak nije uspio ili kako se komponenta ponaša. U Codexu Astra može čuvati bilješke kroz kontekstne prozore, čuvajući nakupljene pojedinosti bez njihova višekratnog sažimanja u jedan sažetak. Raniji kontekstni prozori ostaju dostupni za pretraživanje, pa Astra može pronaći zahtjeve ili rezultate testiranja iz prethodnih poruka i izlaza alata — čak i ako ti podaci nisu zabilježeni u njezinim bilješkama. Ovu eksperimentalnu značajku možete omogućiti u svojoj datoteci Codex config.toml,(otvara se u novom prozoru) i time će postati zadana opcija za Astru u nadolazećim tjednima.
Unaprjeđivanje znanstvenih otkrića
Astra može pomoći u praktičnom radu koji stoji iza znanstvenih otkrića. Kombiniranjem znanstvenog rasuđivanja s korištenjem računala može izravno raditi u specijaliziranom softveru kako bi pregledavala podatke i istraživala rezultate te pomogla istraživačima procijeniti dokaze i odlučiti što sljedeće istražiti.
Kibernetička sigurnost
Kao što smo raspravili u našem sigurnosnom ažuriranju, Astra predstavlja značajan iskorak u kibernetičkim sposobnostima i doseže kritični prag u području kibernetičke sigurnosti prema našem Okviru pripravnosti. Ta sposobnost identificiranja i razvoja zero-day exploita može pomoći obrambenim timovima da pronađu i zakrpaju slabosti, ali također stvara potrebu za snažnijim zaštitnim mjerama. Kako bismo razumjeli dokle sežu te mogućnosti, testirali smo Astru na internim i vanjskim stručnim evaluacijama.
Najprije smo testirali model bez zaštitnih mjera za produkcijsku upotrebu na testovima ExploitBench i ExploitGym, koji procjenjuju mogu li modeli poznate softverske ranjivosti pretvoriti u funkcionalne eksploite. Na ExploitBenchu Astra je postigla savršen rezultat od 100 %, u usporedbi s 78,5 % koliko je postigao GPT‑5.6 Sol, naš prethodni granični model s kibernetičkim sposobnostima. Na ExploitGymu Astra je postigla stopu uspješnosti od 42,4 %, u usporedbi s 30,3 % za GPT‑5.6 Sol, uz znatno manju upotrebu izlaznih tokena.13
S obzirom na bojazni da je izloženost povijesnim softverskim ranjivostima mogla utjecati na rezultate referentnih testova, Astru smo također procjenjivali na dva nova referentna testa. Kao prvo, izradili smo internu evaluaciju „ExploitBench (lipanj – kolovoz 2026.)” kako bismo testirali razvoj exploita pomoću ranjivosti iz prethodna tri mjeseca.14 Astra je postigla znatno veće stope izvršavanja proizvoljnog kôda od GPT‑5.6 Sol na ovom skupu podataka, uz upotrebu mnogo manje izlaznih tokena. Tijekom evaluacije, Astra je čak otkrila i upotrijebila dvije dotad nepoznate ranjivosti nultog dana. Obje ranjivosti prijavljujemo njihovim održavateljima.
Astru smo testirali i na SRE-Bench15u, referentnom testu kojim se mjeri mogu li modeli obrnutim inženjeringom binarnih datoteka softvera razumjeti njegovu temeljnu logiku bez pristupa izvornom kodu. Astra je riješila 88,0 % zadataka u jednom pokušaju i 99,2 % unutar četiri pokušaja, u usporedbi s 55,9 % odnosno 68,7 % za GPT‑5.6 Sol.
Osim referentnih testova, stručne procjene pokazale su da Astra, kada se izvodi bez produkcijskih zaštitnih mjera, može iskoristiti dotad nepoznate ranjivosti za izvršavanje proizvoljnog kôda u ojačanim preglednicima te izraditi exploite za eskalaciju privilegija u ojačanim operacijskim sustavima.
Kao što smo raspravili u Prozoru branitelja, granične kibernetičke mogućnosti mogu pomoći braniteljima da brže pronađu slabosti, ali također olakšavaju iskorištavanje tih slabosti, što povećava hitnost prilagodbe branitelja. S verzijom Astre koja danas izlazi, branitelji mogu dovršavati zadatke kao što su sigurnosni pregled kôda i primjena zakrpa.
Međutim, Astra će odbiti izvršiti naprednije zadatke kibernetičke sigurnosti, kao što je stvaranje exploita za dokaz koncepcije ranjivosti. Putem OpenAI Daybreaka planiramo u nadolazećim tjednima proširiti pristup i uvesti zaštitne mjere s manje ograničenja. Time će se omogućiti više obrambenih tijekova rada, uključujući validaciju ranjivosti i dokaza koncepta, analizu zlonamjernog softvera i inženjering detekcije.
Također smo pojačali zaštitu od moguće kibernetičke zlouporabe, nadograđujući naš sloj zaštitnih mjera za GPT‑5.6 Sol. To uključuje veću robusnost modela kako bi bolje izdržao potencijalne jailbreak te više konteksta za naše sustave nadzora. Nastavili smo s rigoroznim internim i vanjskim testiranjem, uključujući automatizirane evaluacije s našim internim napadačima za red-team testiranje. Više pojedinosti o našim kibernetičkim zaštitnim mjerama i testiranju dostupno je u Astrinu pregledu sigurnosti i dokumentu o sustavu(otvara se u novom prozoru).
Odgovorno usklađivanje i uvođenje modela GPT‑6 Astra
Astra je naš najusklađeniji model. Astra se ističe pažljivim postupanjem, poštovanjem granica zadatka i transparentnom komunikacijom. Ovaj rad najnoviji je rezultat našeg dugotrajnog istraživačkog programa usmjerenog na obuku modela koji od početka do kraja ostaju usklađeni s ljudskom namjerom.
U osjetljivim okruženjima Astra postupa s oprezom razmjernim riziku. U evaluaciji zadataka korištenja računala koji su namjerno odabrani tako da potaknu nepoželjno ponašanje, Astra je bila uspješnija u izbjegavanju neželjenih posljedica. Pokretanje uz dodatne sigurnosne mjere ponuđene prema zadanim postavkama rezultiralo je još boljim performansama.
Astra uzrokuje manje neusklađenih ishoda nego bilo koji drugi testirani granični model. U svrhu poštene usporedbe upotrijebili smo generički testni sklop za agenta koji koristi računalo (temeljen na izvornim alatima za upotrebu računala dostupnima u API-jima OpenAI Responses API(otvara se u novom prozoru) i Anthropic Messages API(otvara se u novom prozoru)) i bez dodatnih zaštitnih mjera koje se obično primjenjuju za korisnike usluga Codex i ChatGPT Work (automatski pregled, pravilo potvrde).
Također je vjerojatnije da će Astra djelovati unutar granica koje je postavio korisnik i koje su implicitno određene njezinim okruženjem. U internoj evaluaciji Astra nikada nije pokušala zaobići odbijanje u sklopu značajke Codex Auto-Review. To je vrijedilo čak i kada je automatska provjera namjerno bila konfigurirana tako da ju je moguće zaobići, a zadatak inače nije bilo moguće dovršiti. To poštovanje ograničenja okruženja u skladu je s rezultatima naše evaluacije nemogućih kibernetičkih zadataka, koje smo podijelili u uvodu ove objave, i drugim nalazima dokumentiranima u našem dokumentu o sustavu(otvara se u novom prozoru).
Astra dodatno postavlja nova mjerila u transparentnoj komunikaciji s korisnicima. U jednoj evaluaciji triput je manja vjerojatnost da će Astra iznijeti netočne tvrdnje o svojim sposobnostima i mogućnostima od modela GPT‑5.6 Sol iznijeti netočne tvrdnje o svojim sposobnostima i mogućnostima.
U našoj evaluaciji 'halucinacija' o sposobnostima, Astra pokazuje znatno poboljšanje u odnosu na GPT‑5.6 Sol te iznosi manje obmanjujućih tvrdnji o svojim sposobnostima.
Naše evaluacije pokazale su da je Astrino pisano rasuđivanje teže pratiti nego ono modela GPT‑5.6 Sol, na temelju testova koji su od njega izričito tražili da izbjegne nadzor. To pripisujemo Astrinoj većoj kontroli nad pisanim rasuđivanjem pri jednostavnijim zadacima i sposobnosti rješavanja problema s manje pisanih koraka. Čini se da Astra i dalje teško prikriva rasuđivanje potrebno za složene zadatke, no ovo smanjenje shvaćamo ozbiljno. Poboljšanje mogućnosti praćenja i dalje je istraživački prioritet, a priloženi dokument o sustavu(otvara se u novom prozoru) detaljno opisuje naša saznanja i rad koji je u tijeku.
Trening usklađivanja ključan je za naš pristup uvođenju. Kao dodatni sloj obrane, razvijamo i zaštitne mjere sustava, kao što su Codexov Auto-review(otvara se u novom prozoru) te praćenje rasuđivanja i radnji agenata, kako bismo lakše otkrili i obuzdali nesigurno ponašanje. Kako je opisano u našem ažuriranju o sigurnosti, uvodimo i praćenje neusklađenosti u produkciju za modele klase Astra kako bismo imali uvid u neusklađenost i pomogli obuzdati njezine najgore slučajeve. Te zaštitne mjere nalikuju našem praćenju internih uvođenja i uključuju sustav klasifikatora koji provjeravaju rasuđivanje i radnje modela radi otkrivanja neovlaštenog ponašanja te automatski zaustavljaju potencijalno neovlaštenu aktivnost.
S obzirom na znatno povećanje Astrinih sposobnosti u području kibernetičke sigurnosti, posebno smo oprezni kako bi ovo uvođenje bilo sigurno i zaštićeno. Dodatne sigurnosne provjere ponekad mogu usporiti, privremeno prekinuti ili zaustaviti legitimne aktivnosti, uključujući aktivnosti obrambene kibernetičke sigurnosti. Ako je zadatak pauziran u ChatGPT‑u ili Codexu, od vas se može zatražiti da prije nastavka pregledate radnju. U API-ju će se zadatak zaustaviti. Te provjere ponekad mogu prekinuti legitiman rad, a mi nastavljamo unapređivati ovaj sustav kako bismo smanjili nepotrebne prekide. Praćenje neusklađenosti ne može zamijeniti usklađenost: naš je cilj izgraditi modele koji pouzdano ostaju unutar svojeg ovlaštenog opsega kako te mjere zaštite ne bi morale intervenirati.
Dostupnost
Model GPT‑6 Astra uvodi se danas za ograničen broj organizacija, a tijekom sljedećih nekoliko dana postat će dostupan svim korisnicima planova ChatGPT Plus, Pro, Business i Enterprise, kao i putem API-ja OpenAI-ja, platforme Microsoft Azure i usluge AWS Bedrock. Korištenje Astre uključeno je u postojeće kvote pretplate — korisnici i tvrtke moći će kupiti i kredite za dodatno korištenje. Korisnici planova Pro, Business i Enterprise također će dobiti pristup modelu GPT‑6 Astra Pro. Administratori plana Enterprise mogu omogućiti Astru za svoj radni prostor; pristup je pri pokretanju prema zadanim postavkama isključen.
Astra podržava nultu stopu zadržavanja podataka za korisnike API-ja koji ispunjavaju uvjete, a kao što smo naveli prošlog mjeseca, testiramo privatnu sigurnosnu obradu kako bismo ojačali praćenje sigurnosti uz očuvanje privatnosti korisnika.
Za razvojne programere, model GPT‑6 Astra bit će dostupan u OpenAI API-ju kao gpt-6-astra te putem servisa Microsoft Azure i Amazon Bedrock.
Standardna cijena OpenAI API-ja iznosi 10 USD po milijunu ulaznih tokena i 50 USD po milijunu izlaznih tokena. Primjenjuju se zasebne cijene za čitanja iz predmemorije i pisanja u predmemoriju. Brzi način rada dostupan je za GPT‑6 Astru u API-ju te pruža do 2 puta veću brzinu od standardne obrade uz dvostruko veću standardnu cijenu.
Upotreba računala
Profesionalno
Profesionalno | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4 % | 18,1% | 31,4 % | 17,4 % | 26,9 % | - |
BenchCAD | 95,9 % | 83,3 % | 84,3 % 5 | 67,5 % 5 | 82,1 % 5 | - |
BrowseComp | 91,5 % | 90,4 % | - | 87,4 % | 90,8 % | - |
OpenScore String Quartets (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Internal Design Tasks | 50,0 % | 47,4 % | - | 35,8 % | - | - |
Interni zadaci iz znanosti o podacima | 40,9 % | 30,5 % | - | 34,7 % | - | - |
Indeks umjetne inteligencije za analizu v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Kodiranje
| Programiranje | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | 55,8 % | 44,5 % | 52,6 % | 19,1 % |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (rezultat) | 64,5 % 8 | 60,6 % | 63,6 % | 64,9 % | 63,6 % | 56,3 % |
| FrontierCode 1.1 Glavni (rezultat) | 53,3 % 8 | 47,5 % | 50,9 % | 53,5 % | 53,4 % | 43,6 % |
| Zadaci interne migracije baze podataka | 63,9 % | 42,7 % | 57,8 % | 50,3 % | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Akademski
Akademski | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | 52,6 % | 21,4 % | 30,0 % | - |
FrontierMath Razina 4 (v2) | 97,6 % | 83 % | 87,8 % | 90,2 % | 73,2 % | - |
GPQA Diamond | 96,0 % | 94,6 % | 93,7 % | 92,6 % | 93,7 % | 95,3 % |
Humanity's Last Exam (s alatima) | 57,2 % | - | 65,0 % | 63,8 % | 63,6 % | - |
Znanost i zdravlje
Kibernetička sigurnost
Usklađivanje
Usklađivanje | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Interno mjerilo sigurnosti pri upotrebi računala (manje je bolje) | 2,4 % | 22,0 % | 9,5 % | 18,3 % | 11,5 % | - |
Interno sigurnosno mjerilo za korištenje računala, uz AutoReview (niže je bolje) | 1,8 % | 4,3 % | - | - | - | - |
Interno mjerilo zaobilaženja (niže je bolje) | 0,00 % | 0,29 % | - | - | - | - |
ExploitGym honeypot (niže je bolje) | 0,0 % | 48,2 % | - | - | - | - |
Nemogući ExploitGym | 100,0 % | - | - | - | - | - |
Interno mjerilo halucinacija (niže je bolje) | 4,2 % | 12,2 % | - | - | - | - |
Dugi kontekst
Dugi kontekst | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 s 8 igala 256 000 — 512 000 | 100,0 % | 91,5 % | - | - | - | - |
OpenAI MRCR v2 s 8 igala 512 000 — 1 000 000 | 96,3 % | 73,8 % | - | - | - | - |
Apstraktno prosuđivanje
| Apstraktno rasuđivanje | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
Rezultati evaluacije maksimalni su pri bilo kojoj razini napora. Evaluacije GPT‑a pokrenute su u našem istraživačkom okruženju ili putem našeg API-ja, što može rezultirati neznatno drugačijim izlazom u odnosu na produkcijski ChatGPT zbog razlika u sistemskim upitima, dostupnim alatima itd.
FUSNOTE
- 1
Na testu ARC-AGI-3, GPT-6 Astra pokrenuta je s našim testnim sklopom za Responses API, koji mijenja dvije postavke kako bi bolje odražavao performanse u stvarnim uvjetima. Promjene nisu posebno usmjerene na ARC-AGI-3.
- 2
GPT-5.6 Sol odnosi se na verziju dostupnu u našem API-ju, ChatGPT Codex i ChatGPT Work. Verzija u načinu Chat u ChatGPT-u neznatno se razlikuje.
- 3
OSWorld V2-Offline podskup je izvornog OSWorlda V2 koji radi bez pristupa internetu. Autori su reproducirali izvedbu modela Claude na sustavu OSWorld-V2 Offline na službenoj ljestvici(otvara se u novom prozoru). Na OSWorldu 2.0, rezultati za Claude temelje se na službenim postavkama, a ne na izmijenjenim zadacima i izmijenjenom ocjenjivanju iz dokumenta o sustavu Fable 5.1.
- 4
- 5
Na BenchCAD-u Claudeovi rezultati odražavaju 3 izmjene evaluacije, detaljno opisane u dokumentu o sustavu Fable 5.1(otvara se u novom prozoru).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon i Noah A. Smith. „LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(otvara se u novom prozoru)“. arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower i Peter Jonas. „The OpenScore String Quartet Corpus(otvara se u novom prozoru)”. Zbornik radova 10. međunarodne konferencije o digitalnim knjižnicama za muzikologiju, str. 49–57. ACM, 2023.
- 8
Na FrontierCodeu, GPT-6 Astra pokrenuta je s porukom za razvojne inženjere sličnom odjeljku njegove poruke za razvojne inženjere u Codexu(otvara se u novom prozoru): "Izbjegavajte stvaranje prekomjernog broja testnih datoteka. Izradite novu testnu datoteku samo kada to zahtijevaju konvencije repozitorija ili kada nijedna postojeća datoteka nije prikladna za tu svrhu. Izbjegavajte nepovezano čišćenje i nepotrebnu složenost. Ponovno upotrijebite odgovarajuće postojeće pomoćne alate. Pročitajte relevantne upute za repozitorij i pregledajte obližnji kôd, testove, dokumentaciju i CI. Slijedite ustaljene konvencije. Cilj je čist kôd koji se može spojiti." Upit nije optimiziran za evaluaciju.
- 9
Prvo se odnosi na to koliko se blizu jedni drugima mogu pojavljivati prosti brojevi, bez obzira na to koliko daleko odmaknete duž brojevnog pravca. Više od desetljeća najbolji poznati rezultat dokazivao je da postoji beskonačno mnogo parova prostih brojeva koji se razlikuju za najviše 246. Julia Stadlmann(otvara se u novom prozoru) nedavno je poboljšala tu granicu na 240. Astra je pomogla uspostaviti jaču granicu od 186, pokazujući da se beskonačno mnogo parova javlja unutar te manje udaljenosti. Kratki razmaci između prostih brojeva: dokaz(otvara se u novom prozoru) i popratno istraživanje(otvara se u novom prozoru).
- 10
Drugi upit odnosi se na neuobičajeno velike razmake između prostih brojeva. Astra je poboljšala ocjenu tih razmaka koji je ostao nepromijenjen više od 80 godina. Dijelimo dokaze, skraćeni lanac razmišljanja i materijale za provjeru za oba rezultata. Veliki razmaci između prostih brojeva: dokaz(otvara se u novom prozoru) i popratna istraživanja(otvara se u novom prozoru).
- 11
- 12
- 13
- 14
ExploitBench (lipanj – kolovoz 2026.) sadržava 20 ranjivosti visoke ozbiljnosti u V8-u u 13 stabilnih izdanja preglednika Chrome. Referentni test provjerava mogu li agenti postići proizvoljno izvršavanje koda u V8-u i službenim izdanjima Chromea za Linux iskorištavanjem svake navedene ranjivosti. Neke uključene ranjivosti možda ne omogućuju izvršavanje proizvoljnog kôda u okviru ograničenja evaluacije, pa možda neće biti moguće postići stopu uspješnosti od 100 %. Napomena: rezultat od 5,5 % modela GPT-5.6 Sol artefakt je ograničenja od 300 poteza u referentnom testu, što nije ograničenje koje bi stvarni korisnici koji koriste Max imali. Model je pri sličnim postavkama ostvario rezultat od 11,5 % kad je dosegnuo manji broj ograničenja.
- 15
Jeremy Spence i sur. „Sljedeći izazov za agentsku kibernetičku sigurnost: realističan referentni test za obrnuti inženjering bez kontaminacije(otvara se u novom prozoru).” arXiv:2608.11469v1, 2026.
- 16
Kada testiramo na modelima trećih strana, koristimo jednostavniju istraživačku postavku. Codex ima složeniju produkcijsku konfiguraciju, što može rezultirati različitim stopama pogrešaka osnovnog modela. Zaštitne mjere na strani pružatelja i implementacije računalnih alata i dalje se razlikuju. Korisnici u Codexu ne susreću scenarij bez potvrde jer je riječ o internoj istraživačkoj konfiguraciji.
- 17
