Nova generacija inteligence
Posodobitev, 22. september 2026: Svojo družino GPT‑6 smo razširili z modeloma GPT‑6 Sol in GPT‑6 Luna. Več o tem.
Predstavljamo GPT‑6 Astra, najinteligentnejši in najbolj usklajen model na svetu.
GPT‑6 Astra združuje leta raziskav in velike naložbe v začetno usposabljanje, okrepljeno učenje in usklajevanje. Astra dosega najsodobnejše rezultate na področjih uporabe računalnika, brskanja po spletu, programskega inženirstva, kibernetske varnosti, znanosti in profesionalnega dela. Astra z rezultatom 98 % dosega skoraj popolno uspešnost na FrontierMath Tier 4, potem ko je že pomagala rešiti dolgoletne odprte probleme v matematiki. Astra tudi dosega zasičenost na ARC-SUI-3 z rezultatom 99,9 % in na ExploitBench z rezultatom 100 %. Postavlja tudi novo prelomno pri uporabi računalnika in brskalnika ter najzahtevnejše profesionalno delo opravlja z neprimerljivo hitrostjo, natančnostjo in presojo.
GPT‑6 Astra se danes uvaja za omejen nabor organizacij, v naslednjih dneh pa bo na voljo vsem uporabnikom paketov ChatGPT Plus, Pro, Business in Enterprise ter prek API-ja OpenAI, Microsoft Azure in AWS Bedrock.
Astra je naš najbolj usklajen model, ki se je bistveno izboljšal pri razumevanju namena uporabnikov in vedenja modela – zato lahko naloge z večjim zaupanjem prepustite presoji Astre. Kot enega od načinov, na katerega to preizkušamo, smo na podlagi incidenta Hugging Face razvili novo vrednotenje, ki preverja, ali bo model, ki se sooči s težko ali nemogočo nalogo, presegel svoj predvideni obseg. V primerjavi z modelom GPT‑5.6 Sol, ki je brez zaščitnih ukrepov v produkcijskem okolju pooblaščeni cilj presegel v 48 % primerov, je GPT‑6 Astra to storil v 0 % primerov.
Najboljši model za uporabo računalnika na svetu
GPT‑6 Astra pomeni novo prelomno na področju hitrosti, natančnosti in varnosti pri uporabi računalnika. Lahko poskrbi za zamudna opravila, kot so izpolnjevanje spletnih obrazcev, posodabljanje evidenc strank v CRM-ju in urejanje vašega koledarja. Lahko opravlja spletne raziskave in pripravi osnutke povzetkov v vaši e-pošti ali urejevalniku dokumentov. Lahko analizira znanstvene podatke, ustvari grafe, izdela spletno mesto in zažene preverjanja kakovosti osprednjega vmesnika (frontend), da zagotovi, da vse funkcije na tem spletnem mestu delujejo. Pomaga vam lahko samostojno nameščati in preizkušati programsko opremo ter odpravljati težave, ki jih vidite na zaslonu. Te izboljšave se odražajo tudi v naših najsodobnejših rezultatih evalvacij.
Te izboljšave prinašajo tudi znatno večjo učinkovitost pri dejanskih nalogah umskega dela. V simulacijah zakasnitve na OSWorld 2.0 Astra dosega boljšo uspešnost pri uporabi računalnika v približno 47 % krajšem času na nalogo kot GPT‑5.6 Sol, z rezultatom 72,6 % pri približno 40 minutah na nalogo, v primerjavi z 65,7 % pri približno 75 minutah.3
Zmogljivosti GPT‑6 Astra za uporabo računalnika so razvidne iz rezultatov na različnih področjih, vključno z razvojem iger, elektrotehniko in vsakodnevnim delom z znanjem:
Poleg Astre posodabljamo tudi ogrodje Codex, da bi znatno izboljšali hitrost uporabe računalnika. V kombinaciji z učinkovitostjo Astre to na primerjalnem merilu Mind2Web pomeni 1,9-krat hitrejše dokončanje nalog v primerjavi s trenutno izkušnjo z GPT‑5.6 Sol. Izboljšave hitrosti modela pomenijo, da lahko namesto vas prevzame številna zamudna vsakodnevna opravila in jih opravi hitreje kot vi.4
Skokovita sprememba v strokovnem delu
GPT‑6 Astra združuje napredek pri uporabi računalnika s ciljno usmerjenim usposabljanjem za profesionalna okolja, da bi pomagal pri reševanju kompleksnih delovnih nalog. Združuje inteligenco, potrebno za reševanje kompleksnih problemov, z zmožnostjo izvajanja večstopenjskih delovnih tokov ter ustvarjanja dodelanih dokumentov, preglednic in predstavitev.
GPT‑6 Astra je naš najboljši model za upoštevanje obstoječih predlog ter ustvarjanje dobro postavljenih diapozitivov, ki s strukturirano pripovedjo jedrnato podajajo ključne točke. Ustvarja jasne, dobro strukturirane dokumente, predstavitve, preglednice in analize, ki sledijo vašim predlogam ter se ujemajo z vašim slogom pisanja in vizualnim slogom. Astra je usposobljena tudi za to, da v izhodne rezultate vključi samo tisti kontekst, ki je pomemben, namesto da bi ponavljala informacije, ki za trenutno nalogo niso potrebne. Vse to pomeni, da lahko ustvari bolj neposredno uporabne artefakte, ki ustrezajo vašemu poslovnemu kontekstu in standardom.
GPT‑6 Astra prinaša tudi boljšo vizualno presojo pri spletnih mestih, igrah, aplikacijah in upodobitvah, ki jih ustvarja. S funkcijo Sites(odpre se v novem oknu) v ChatGPT‑ju lahko Astra neposredno iz poziva ustvarja, gosti in deli spletna mesta, spletne aplikacije in igre.
Kadar navodila dopuščajo različne razlage, GPT‑6 Astra sprejema pravilne odločitve bolje kot prejšnji modeli. Uporablja kontekst, da zapolni običajne vrzeli, in postavlja ciljno usmerjena vprašanja, kadar bi odgovor lahko spremenil izid. V Codexu lahko asinhrono postavlja vprašanja, medtem ko nadaljuje delo, ki ni odvisno od vašega odgovora. Če ne odgovorite, po potrebi nadaljuje s smiselnimi predpostavkami, pri odločitvah z večjimi posledicami pa počaka na vaš odziv.
Spodnji primeri prikazujejo, kako Astra sodeluje pri vsakodnevnih nalogah, kjer lahko manjkajoče informacije bistveno spremenijo odgovor.
Astra je tudi boljša pri ohranjanju usmerjenosti, ko se naloga razvija. Prejšnji modeli so usmerjevalna sporočila včasih obravnavali kot nov cilj ter pri tem izgubili sled prvotni zahtevi ali prejšnjim omejitvam. Astra vključuje nove zahteve, na zahtevo spremeni smer in odgovarja na stranska vprašanja, ne da bi pri tem opustila širšo nalogo.
Programiranje
GPT‑6 Astra je doslej najboljši model za programsko inženirstvo.
»GPT‑6 Astra pri naših internih primerjalnih preizkusih kodiranja zagotavlja najsodobnejšo zmogljivost ter pri vrednotenjih intuicije trgovanja v primerjavi z GPT‑5.6 Sol kaže jasen napredek. Pri uporabi za agentsko kodiranje GPT‑6 Astra komunicira na način, ki mu razvijalci lažje sledijo, in ustvarja kodo, ki za doseganje kakovosti za produkcijsko okolje zahteva manj ponovitev.«
»Astra smo preizkusili pri nizki, srednji in visoki ravni napora na eni od naših evalvacij prve generacije in se je izkazala za bistveno boljšo od GPT 5.6 Sol. Večji napor prinaša več iteracij pri novi gradnji, več preverjanja s preizkušanjem v brskalniku in večjo usmerjenost v izvajanje kode namesto uporabe popravkov. Razumevanje, kako model porablja svoj napor, nam omogoča, da milijonom graditeljev ponudimo hitrejšo in zanesljivejšo pot od zamisli do delujoče aplikacije.«
Z Astro uvajamo nov način, s katerim Codex ohranja in pridobiva kontekst, ko se kontekstno okno zapolni. V preteklosti so modeli uporabljali kompaktiranje za povzemanje dela med dolgimi sejami, na primer pri odpravljanju zapletenih težav ali obsežnih refaktorizacijah. Pri vsakem kompaktiranju se lahko izpustijo podrobnosti o tem, zakaj je popravek spodletel ali kako se komponenta obnaša. V Codexu lahko Astra vodi zapiske prek kontekstnih oken ter tako ohranja zbrane podrobnosti, ne da bi jih vedno znova stiskala v en sam povzetek. Prejšnja kontekstna okna je še vedno mogoče preiskovati, zato lahko Astra najde zahteve ali rezultate preizkusov iz prejšnjih sporočil in izhodov orodij – tudi če te informacije niso bile zajete v njenih zapiskih. To eksperimentalno funkcijo lahko omogočite v svoji datoteki Codex config.toml,(odpre se v novem oknu) in to bo v prihodnjih tednih postalo privzeto za Astro.
Spodbujanje znanstvenih odkritij
Astra lahko pomaga pri praktičnem delu v ozadju znanstvenih odkritij. Z združevanjem znanstvenega sklepanja in uporabe računalnika lahko neposredno deluje v specializirani programski opremi za pregledovanje podatkov in raziskovanje rezultatov ter raziskovalcem pomaga oceniti dokaze in se odločiti, kaj raziskati naprej.
Kibernetska varnost
Kot smo obravnavali v naši varnostni posodobitvi, Astra predstavlja velik preskok v kibernetskih zmogljivostih in dosega kritični prag na področju kibernetske varnosti po našem Okviru pripravljenosti. Zmožnost prepoznavanja in razvoja izkoriščanj ranljivosti ničtega dne lahko obrambnim ekipam pomaga najti in zakrpati ranljivosti, hkrati pa ustvarja potrebo po močnejših zaščitnih ukrepih. Da bi razumeli, kako daleč segajo te zmogljivosti, smo sistem Astra preizkusili z internimi strokovnimi ocenami in ocenami zunanjih strokovnjakov.
Model smo najprej brez produkcijskih zaščitnih ukrepov preizkusili po merilih ExploitBench in ExploitGym, ki ocenjujeta, ali lahko modeli znane ranljivosti programske opreme pretvorijo v delujoče izrabe (»exploit«). Pri preizkusu ExploitBench je Astra dosegla popoln rezultat 100 % v primerjavi z 78,5 % pri GPT‑5.6 Sol, našem prejšnjem prelomnem modelu z zmogljivostmi na področju kibernetske varnosti. Pri preizkusu ExploitGym je Astra dosegla 42,4-odstotno stopnjo uspešnosti v primerjavi s 30,3 % za GPT‑5.6 Sol, pri tem pa uporabila bistveno manj izhodnih žetonov.13
Zaradi pomislekov, da je izpostavljenost preteklim ranljivostim programske opreme morda vplivala na rezultate primerjalnih preizkusov, smo Astro ocenili tudi na dveh novih primerjalnih preizkusih. Kot prvo smo oblikovali interno vrednotenje »ExploitBench (junij–avgust 2026)« za preizkušanje razvoja izkoriščanja ranljivosti iz prejšnjih treh mesecev.14 Astra je dosegla bistveno višje stopnje izvajanja poljubne kode kot GPT‑5.6 Sol pri tem naboru podatkov, pri čemer je uporabila veliko manj izhodnih žetonov. Med vrednotenjem je Astra celo odkrila in uporabila dve prej neznani ranljivosti ničtega dne. Obe ranljivosti razkrivamo njunim vzdrževalcem.
Astra smo preizkusili tudi na SRE-Bench15, merilu, ki meri, ali lahko modeli z obratnim inženirstvom binarnih datotek programske opreme razumejo njeno osnovno logiko brez dostopa do izvorne kode. Astra je v enem poskusu rešila 88,0 % nalog, v štirih poskusih pa 99,2 %, v primerjavi s 55,9 % oziroma 68,7 % pri GPT‑5.6 Sol.
Poleg primerjalnih preizkusov so strokovno vodene ocene pokazale, da je Astra, kadar je delovala brez produkcijskih zaščitnih ukrepov, lahko uporabila prej neznane ranljivosti za izvajanje poljubne kode v utrjenih brskalnikih in ustvarila izkoriščevalske kode za stopnjevanje pravic v utrjenih operacijskih sistemih.
Kot smo obravnavali v Okno priložnosti za branilce, lahko prelomne kibernetske zmogljivosti branilcem pomagajo hitreje odkriti pomanjkljivosti, vendar hkrati olajšajo tudi njihovo izkoriščanje, zaradi česar se morajo branilci nujno prilagoditi. Z različico Astre, ki izide danes, lahko branilci opravljajo naloge, kot sta varnostni pregled kode in nameščanje popravkov.
Vendar bo Astra zavrnila izvajanje naprednejših nalog s področja kibernetske varnosti, kot je ustvarjanje izkoriščevalske kode z dokazom koncepta za ranljivosti. Prek programa OpenAI Daybreak načrtujemo razširitev dostopa in uvedbo manj omejujočih varovalk v prihodnjih tednih. To bo omogočilo več obrambnih delovnih tokov, vključno s potrjevanjem ranljivosti in dokazov koncepta, analizo zlonamerne programske opreme in inženiringom zaznavanja.
Okrepili smo tudi zaščito pred morebitnimi kibernetskimi zlorabami ter nadgradili naš sklop zaščitnih ukrepov za GPT‑5.6 Sol. Ti vključujejo večjo odpornost modela za boljše upiranje morebitnemu prebijanju varnostnih mehanizmov in več konteksta za naše sisteme spremljanja. Nadaljevali smo strogo notranje in zunanje preizkušanje, vključno z avtomatiziranimi vrednotenji z našimi notranjimi napadalci za simulirano iskanje šibkih točk v nadzorovanem okolju. Več podrobnosti o naših kibernetskih zaščitnih ukrepih in preizkušanju je na voljo v pregledu varnosti in sistemskem dokumentu(odpre se v novem oknu) modela Astra.
Odgovorno usklajevanje in uvajanje GPT‑6 Astra
Astra je naš najbolj usklajen model. Astra se odlikuje po skrbnem ravnanju, spoštovanju meja nalog in transparentnem komuniciranju. To delo je najnovejši rezultat našega dolgoletnega raziskovalnega programa, osredotočenega na usposabljanje modelov, ki od začetka do konca ostajajo usklajeni s človeškimi namerami.
V občutljivih okoljih Astra ravna s skrbnostjo, sorazmerno s tveganjem. Pri vrednotenju nalog, povezanih z uporabo računalnika, ki so bile namenoma izbrane tako, da bi izzvale neustrezno vedenje, je bila Astra uspešnejša pri izogibanju nenamernim posledicam. Delovanje z dodatnimi varnostnimi ukrepi, ki so privzeto na voljo, je prineslo še boljšo zmogljivost.
Astra povzroča manj neusklajenih izidov kot kateri koli drug prelomni model. Za pošteno primerjavo smo uporabili generično ogrodje agenta za uporabo računalnika (ki temelji na izvirnih orodjih za uporabo računalnika, ki so na voljo tako v OpenAI Responses API(odpre se v novem oknu) kot v Anthropic Messages API(odpre se v novem oknu)) in brez dodatnih zaščitnih ukrepov, ki se običajno uporabljajo za uporabnike orodij Codex in ChatGPT Work (samodejni pregled, pravilnik o potrditvah).
Astra bo prav tako verjetneje delovala znotraj meja, ki jih določi uporabnik in jih nakazuje njeno okolje. V internem vrednotenju Astra ni nikoli poskusila zaobiti zavrnitve funkcije Codex Auto-Review. To je veljalo tudi takrat, ko je bila funkcija Auto-review namerno nastavljena tako, da jo je bilo mogoče zaobiti, sicer naloge ni bilo mogoče dokončati. To spoštovanje omejitev okolja je skladno z rezultati našega vrednotenja nerešljivih kibernetskih nalog, ki smo jih predstavili v uvodu te objave, in drugimi ugotovitvami, dokumentiranimi v našem sistemskem dokumentu(odpre se v novem oknu).
Astra poleg tega postavlja nove mejnike na področju pregledne komunikacije z uporabniki. V enem vrednotenju je pri Astri trikrat manj verjetno kot pri GPT‑5.6 Sol, da bo podajala netočne predstavitve svojih zmogljivosti in zmožnosti.
Pri našem vrednotenju halucinacij o zmogljivostih Astra v primerjavi z GPT‑5.6 Sol kaže znatno izboljšanje, saj podaja manj zavajajočih trditev o svojih zmogljivostih.
Naša vrednotenja so pokazala, da je Astrino pisno sklepanje težje spremljati kot sklepanje modela GPT‑5.6 Solovega, na podlagi preizkusov, ki so od njega izrecno zahtevali, naj se izogne nadzoru. To pripisujemo Astrinemu večjemu nadzoru nad pisnim sklepanjem pri enostavnejših nalogah in zmožnosti reševanja problemov z manj zapisanimi koraki. Astra ima očitno še vedno težave s prikrivanjem sklepanja, potrebnega za kompleksne naloge, vendar zmanjšanje jemljemo resno. Izboljšanje spremljanja ostaja raziskovalna prednostna naloga, priloženi sistemski dokument(odpre se v novem oknu) pa podrobno opisuje naše ugotovitve in tekoče delo.
Usposabljanje za usklajevanje je osrednji del našega pristopa k uvajanju. Kot dodatno plast zaščite razvijamo tudi sistemske zaščitne ukrepe, kot sta Codex Auto-review(odpre se v novem oknu) in spremljanje sklepanja ter dejanj agentov, da bi pomagali zaznati in zajeziti nevarno vedenje. Kot je opisano v naši varnostni posodobitvi, za modele Astrinega razreda v produkcijo uvajamo tudi spremljanje neusklajenosti, da bi imeli vpogled v neusklajenost in pomagali zajeziti njene najhujše primere. Ti zaščitni ukrepi so podobni spremljanju naših notranjih uvedb in vključujejo sistem klasifikatorjev, ki v sklepanju in dejanjih modela preverjajo nepooblaščeno vedenje ter samodejno ustavijo morebitno nepooblaščeno dejavnost.
Glede na znatno povečanje Astrinih zmogljivosti na področju kibernetske varnosti smo še posebej previdni, da bo ta uvedba varna in zaščitena. Dodatna varnostna preverjanja lahko včasih upočasnijo, začasno prekinejo ali ustavijo legitimno delo, vključno z obrambno kibernetsko varnostjo. Če je naloga v ChatGPT‑ju ali Codexu začasno ustavljena, boste morda morali pred nadaljevanjem pregledati dejanje. V API-ju se bo naloga ustavila. Ta preverjanja lahko včasih prekinejo legitimno delo, zato ta sistem še naprej izboljšujemo, da bi zmanjšali število nepotrebnih prekinitev. Spremljanje neusklajenosti ne more nadomestiti usklajenosti: naš cilj je ustvariti modele, ki zanesljivo ostajajo znotraj svojega pooblaščenega obsega, zato tem zaščitnim ukrepom ni treba posredovati.
Razpoložljivost
GPT‑6 Astra se danes uvaja za omejen nabor organizacij, v prihodnjih dneh pa bo na voljo vsem uporabnikom paketov ChatGPT Plus, Pro, Business in Enterprise ter prek API-ja OpenAI, Microsoft Azure in AWS Bedrock. Uporaba Astre je vključena v obstoječe kvote naročnin; uporabniki in podjetja bodo lahko kupili tudi kreditne točke za dodatno uporabo. Uporabniki paketov Pro, Business in Enterprise bodo dobili tudi dostop do GPT‑6 Astra Pro. Skrbniki za Enterprise lahko Astro omogočijo za svoj delovni prostor; dostop je ob uvedbi privzeto onemogočen.
Astra podpira ničelno hrambo podatkov za upravičene stranke API-ja, in kot smo sporočili prejšnji mesec, preizkušamo zasebno varnostno obdelavo, da bi okrepili varnostno spremljanje, hkrati pa ohranili zasebnost strank.
Za razvijalce bo GPT‑6 Astra na voljo v API-ju OpenAI kot gpt-6-astra ter prek storitev Microsoft Azure in Amazon Bedrock.
Standardne cene API-ja OpenAI znašajo 10 $ na milijon vhodnih žetonov in 50 $ na milijon izhodnih žetonov. Za branja iz predpomnilnika in zapisovanja vanj veljajo ločene tarife. Hitri način je za GPT‑6 Astra na voljo v API-ju in zagotavlja do 2-krat večjo hitrost standardne obdelave po 2-kratni standardni ceni.
Uporaba računalnika
Profesionalno
Profesionalno | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4 % | 18,1 % | 31,4 % | 17,4 % | 26,9 % | - |
BenchCAD | 95,9 % | 83,3 % | 84,3 % 5 | 67,5 % 5 | 82,1 % 5 | - |
BrowseComp | 91,5 % | 90,4 % | - | 87,4 % | 90,8 % | - |
Godalni kvarteti OpenScore (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Interne oblikovalske naloge | 50,0 % | 47,4 % | - | 35,8 % | - | - |
Interna opravila podatkovne znanosti | 40,9 % | 30,5 % | - | 34,7 % | - | - |
Artificial Analysis Inteligenca Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Programiranje
| Programiranje | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | 55,8 % | 44,5 % | 52,6 % | 19,1 % |
| DeepSWE v1.1 | 74,1 % | 72,7 % | 67,4 % | 69,9 % | 73,7 % | 73,8 % |
| FrontierCode 1.1 Extended (rezultat) | 64,5 % 8 | 60,6 % | 63,6 % | 64,9 % | 63,6 % | 56,3 % |
| FrontierCode 1.1 Main (rezultat) | 53,3 % 8 | 47,5 % | 50,9 % | 53,5 % | 53,4 % | 43,6 % |
| Naloge migracije interne zbirke podatkov | 63,9 % | 42,7 % | 57,8 % | 50,3 % | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Akademsko
Akademsko | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | 52,6 % | 21,4 % | 30,0 % | - |
FrontierMath stopnja 4 (v2) | 97,6 % | 83,0% | 87,8 % | 90,2 % | 73,2 % | - |
GPQA Diamond | 96,0 % | 94,6% | 93,7 % | 92,6 % | 93,7 % | 95,3 % |
Zadnji izpit človeštva (z orodji) | 57,2 % | - | 65,0 % | 63,8 % | 63,6 % | - |
Znanost in zdravje
Kibernetska varnost
Usklajenost
Usklajenost | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Interno varnostno merilo za uporabo računalnika (nižja vrednost je boljša) | 2,4 % | 22,0 % | 9,5 % | 18,3 % | 11,5 % | - |
Interno varnostno merilo za uporabo računalnika z AutoReview (nižja vrednost je boljša) | 1,8 % | 4,3 % | - | - | - | - |
Interno primerjalno merilo zaobidenja (nižja vrednost je boljša) | 0,00 % | 0,29 % | - | - | - | - |
Sistemska vaba ExploitGym (nižja vrednost je boljša) | 0,0 % | 48,2 % | - | - | - | - |
Nemogoči ExploitGym | 100,0 % | - | - | - | - | - |
Interno merilo halucinacij (nižja vrednost je boljša) | 4,2 % | 12,2 % | - | - | - | - |
Dolg kontekst
Dolg kontekst | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K–512K | 100,0 % | 91,5 % | - | - | - | - |
OpenAI MRCR v2 8-needle 512K–1M | 96,3 % | 73,8 % | - | - | - | - |
Abstraktno razmišljanje
| Abstraktno sklepanje | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-SUI-3 | 99,9 % 1 | 7,8 % | - | - | 30,2 % | - |
| ARC-SUI-2 | 95,0 % | 92,5 % | 90,0 % | 89,2 % | 90,4 % | - |
| ARC-SUI-1 | 98,5 % | 97,5 % | 97,5 % | 98,5 % | 97,5 % | - |
Ocene vrednotenja so najvišje pri katerem koli naporu. Vrednotenja GPT‑ja so bile izvedene v našem raziskovalnem okolju ali prek našega API-ja, kar lahko zaradi razlik v sistemskih pozivih, razpoložljivih orodjih itd. prinese nekoliko drugačne rezultate kot v produkcijskem ChatGPT‑ju.
SPROTNE OPOMBE
- 1
Na preizkusu ARC-SUI-3 je bil GPT-6 Astra izveden z našim ogrodjem API-ja Responses, ki spremeni dve nastavitvi za boljše ujemanje z zmogljivostjo v resničnem svetu. Spremembe niso posebej usmerjene v ARC-SUI-3.
- 2
GPT-5.6 Sol se nanaša na različico, ki je na voljo v našem API-ju, ChatGPT Codex in ChatGPT Work. Različica v klepetalnem načinu Chat v ChatGPT-ju je nekoliko drugačna.
- 3
OSWorld V2-Offline je podmnožica izvirnega OSWorld V2, ki deluje brez dostopa do interneta. Avtorji so zmogljivost modela Claude v okolju OSWorld-V2 Offline reproducirali na uradni lestvici(odpre se v novem oknu). Pri OSWorld 2.0 rezultati za Claude temeljijo na uradnih nastavitvah in ne na spremenjenih nalogah in spremenjenem ocenjevanju iz sistemskega dokumenta Fable 5.1.
- 4
- 5
Pri BenchCAD Claudovi rezultati odražajo 3 spremembe vrednotenja, podrobno opisane v sistemskem dokumentu Fable 5.1(odpre se v novem oknu).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon in Noah A. Smith. »LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(odpre se v novem oknu).« arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower in Peter Jonas. »Korpus godalnih kvartetov OpenScore(odpre se v novem oknu)«. Zbornik 10. mednarodne konference o digitalnih knjižnicah za muzikologijo, str. 49–57. ACM, 2023.
- 8
V okolju FrontierCode se je GPT-6 Astra izvajal s sporočilom razvijalca, podobnim razdelku njegovega sporočila razvijalca v Codexu(odpre se v novem oknu): »Izogibaj se ustvarjanju prevelikega števila preizkusnih datotek. Novo preizkusno datoteko ustvari le, kadar to zahtevajo konvencije repozitorija ali kadar nobena obstoječa datoteka ni primerna za to. Izogibaj se nepovezanemu čiščenju in nepotrebni zapletenosti. Ponovno uporabi ustrezne obstoječe pripomočke. Preberi ustrezna navodila za repozitorij ter preglej sosednjo kodo, preizkuse, dokumentacijo in CI. Upoštevaj uveljavljene konvencije. Cilj je čista koda, ki jo je mogoče združiti.« Poziv ni bil optimiziran za vrednotenje.
- 9
Prvo se nanaša na to, kako blizu skupaj se lahko pojavijo praštevila, ne glede na to, kako daleč po številski premici greste. Več kot desetletje je najboljši znani rezultat pokazal, da obstaja neskončno mnogo parov praštevil, ki se razlikujejo za največ 246. Julia Stadlmann(odpre se v novem oknu) je nedavno izboljšala to mejo na 240. Astra je pomagala določiti močnejšo mejo 186, kar kaže, da se neskončno mnogo parov pojavlja znotraj te manjše razdalje. Majhne vrzeli med praštevili: dokaz(odpre se v novem oknu) in podporne raziskave(odpre se v novem oknu).
- 10
Druga se nanaša na nenavadno velike razmike med praštevili. Astra je izboljšala člen v omejitvi teh vrzeli, ki je ostala nespremenjena več kot 80 let. Delimo dokaze ter skrajšano verigo sklepanja in gradiva za preverjanje za oba rezultata. Velike vrzeli med praštevili: dokaz(odpre se v novem oknu) in podporne raziskave(odpre se v novem oknu).
- 11
- 12
- 13
- 14
ExploitBench (junij–avgust 2026) vsebuje 20 ranljivosti V8 visoke stopnje resnosti v 13 stabilnih izdajah Chroma. Primerjalni preizkus preverja, ali lahko agenti z izkoriščanjem vsake navedene ranljivosti dosežejo izvajanje poljubne kode v V8 in uradnih izdajah Chroma za Linux. Nekatere vključene ranljivosti morda v okviru omejitev vrednotenja ne omogočajo izvajanja poljubne kode, zato 100-odstotne stopnje uspešnosti morda ni mogoče doseči. Opomba: Rezultat 5,5 % modela GPT-5.6 Sol je posledica omejitve 300 izmenjav v primerjalnem preizkusu, ki za dejanske stranke, ki uporabljajo raven Najvišje, ne bi veljale. Model je pri podobnih nastavitvah dosegel rezultat 11,5 %, ko je naletel na manj omejitev.
- 15
Jeremy Spence in sod. »The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(odpre se v novem oknu).« arXiv:2608.11469v1, 2026.
- 16
Pri preizkušanju modelov tretjih ponudnikov uporabljamo enostavnejšo raziskovalno postavitev. Codex ima kompleksnejšo produkcijsko konfiguracijo, zaradi česar se lahko stopnje napak surovega modela razlikujejo. Zaščitni ukrepi na strani ponudnikov in izvedbe računalniških orodij se še vedno razlikujejo. Uporabniki v Codexu ne izkusijo scenarija brez potrditve, saj gre za notranjo raziskovalno konfiguracijo.
- 17
