En ny generation av intelligens
Uppdatering 22 september 2026: Vi utökar vår GPT‑6‑familj med GPT‑6 Sol och GPT‑6 Luna. Läs mer.
Vi introducerar GPT‑6 Astra, världens mest intelligenta och välanpassade modell.
GPT‑6 Astra samlar flera års forskning och stora satsningar inom förträning, förstärkningsinlärning och anpassning. Astra är toppmodern inom datoranvändning, webbsurfning, programvaruteknik, cybersäkerhet, vetenskap och professionellt arbete. Astra når taket för FrontierMath Tier 4 med ett resultat på 98 %, och har redan hjälpt till att lösa långvariga öppna problem inom matematiken. Astra uppnår också taket på ARC-AGI-3 med ett resultat på 99,9 % och på ExploitBench med ett resultat på 100 %. Den är också banbrytande inom användning av datorer och webbläsare och hanterar det mest krävande professionella arbetet med oöverträffad snabbhet, noggrannhet och omdöme.
GPT‑6 Astra lanseras idag till ett begränsat antal organisationer och blir under de kommande dagarna tillgänglig för alla användare av ChatGPT Plus, Pro, Business och Enterprise, samt via OpenAI API, Microsoft Azure och AWS Bedrock.
Astra är vår modell som är mest i linje med våra avsikter, med betydande förbättringar i förståelsen av användaravsikter och modellbeteende – du kan överlåta uppgifter med större tilltro till Astras omdöme. Som ett sätt att testa detta byggde vi en ny utvärdering, med lärdomar från incidenten med Hugging Face, som bedömer om en modell som ställs inför en svår eller omöjlig uppgift går utöver sitt avsedda område. Jämfört med GPT‑5.6 Sol, som utan skyddsåtgärder i produktion gick utöver det auktoriserade målet i 48 % av fallen, gjorde GPT‑6 Astra detta i 0 % av fallen.
Världens bästa modell för datoranvändning
GPT‑6 Astra öppnar nya dörrar för snabbhet, noggrannhet och säkerhet vid datoranvändning. Den kan ta hand om tidsödande uppgifter som att fylla i onlineformulär, uppdatera kundposter i ett CRM-system och organisera din kalender. Den kan göra research online och skriva utkast till sammanfattningar i din e-post eller i din dokumentredigerare. Den kan analysera vetenskapliga data, generera diagram, skapa en webbplats och köra QA-kontroller för frontend för att säkerställa att alla funktioner på webbplatsen fungerar. Det kan hjälpa dig att på egen hand installera och testa programvara samt felsöka problem som du ser på skärmen. Dessa förbättringar återspeglas också i våra toppmoderna utvärderingsresultat.
Dessa förbättringar leder också till betydande effektivitetsvinster i verkliga kunskapsarbetsuppgifter. I svarstidssimuleringar på OSWorld 2.0 uppnår Astra högre datoranvändningsprestanda på omkring 47 % kortare tid per uppgift än GPT‑5.6 Sol, med ett resultat på 72,6 % vid cirka 40 minuter per uppgift, jämfört med 65,7 % vid cirka 75 minuter.3
GPT‑6 Astras förmåga att använda datorer syns i resultaten inom olika områden, däribland spelutveckling, elektroteknik och vardagligt kunskapsarbete:
Tillsammans med Astra uppdaterar vi även Codex-körmiljön för att avsevärt förbättra hastigheten vid datoranvändning. I kombination med Astras effektivitet innebär detta att uppgifter slutförs 1,9 gånger snabbare jämfört med den nuvarande upplevelsen av GPT‑5.6 Sol i Mind2Web-benchmarktestet. Modellens hastighetsförbättringar innebär att den kan ta sig an många tidskrävande vardagsuppgifter åt dig, snabbare än du själv kan.4
Ett stort kliv framåt för professionellt arbete
GPT‑6 Astra kombinerar framsteg inom datoranvändning med riktad träning för professionella miljöer för att hjälpa till att hantera komplexa arbetsuppgifter. Den kombinerar den intelligens som krävs för komplexa problem med förmågan att genomföra arbetsflöden i flera steg och skapa välpolerade dokument, kalkylblad och presentationer.
GPT‑6 Astra är vår bästa modell för att följa befintliga mallar och skapa väl disponerade bilder som kortfattat förmedlar huvudpunkter genom en strukturerad berättelse. Det skapar tydliga, välstrukturerade dokument, presentationer, kalkylblad och analyser som följer dina mallar och matchar ditt skrivsätt och din visuella stil. Astra har också tränats i att bara ta med den kontext som är relevant i sina utdata, i stället för att upprepa information som är onödig för den aktuella uppgiften. Allt detta innebär att den kan generera mer direkt användbara artefakter som överensstämmer med din verksamhetskontext och dina standarder.
GPT‑6 Astra har också ett starkare visuellt omdöme när den skapar webbplatser, spel, applikationer och renderingar. Med Sites(öppnas i ett nytt fönster) i ChatGPT kan Astra skapa, publicera och dela webbplatser, webbappar och spel direkt från en prompt.
När instruktioner lämnar utrymme för tolkning är GPT‑6 Astra bättre än tidigare modeller på att fatta rätt beslut. Den använder sammanhang för att fylla i vanliga luckor och ställer riktade frågor när svaret kan förändra resultatet. I Codex kan den ställa frågor asynkront samtidigt som den fortsätter att arbeta med sådant som inte är beroende av ditt svar. Om du inte svarar fortsätter den med rimliga antaganden när det är lämpligt, men väntar på dina synpunkter vid beslut med större konsekvenser.
Exemplen nedan visar hur Astra samarbetar kring vardagliga uppgifter där avsaknad av information kan förändra svaret avsevärt.
Astra är också bättre på att hålla sig orienterad allt eftersom en uppgift utvecklas. Tidigare modeller behandlade ibland styrmeddelanden som ett nytt mål och tappade bort den ursprungliga begäran eller tidigare begränsningar. Astra kan ta hänsyn till nya krav, ändra kurs på begäran och besvara sidofrågor utan att tappa bort den övergripande uppgiften.
Kodning
GPT‑6 Astra är den bästa modellen för programvaruutveckling hittills.
“GPT‑6 Astra levererar topprestanda på våra interna benchmarks för kodning och visar ett tydligt steg framåt i utvärderingar av handelsintuition jämfört med GPT‑5.6 Sol. När GPT‑6 Astra används för agentbaserad kodning kommunicerar den på ett sätt som är lättare för utvecklare att följa och producerar kod som kräver färre iterationer för att nå produktionskvalitet.”
“Vi testade Astra med låg, balanserad och hög insats i en av våra utvärderingar av första generationen, och den presterade betydligt bättre än GPT 5.6 Sol. Högre insats ger fler iterationer på en ny version, mer verifiering genom webbläsartestning och ett större fokus på kodkörning i stället för apply-patch. Genom att förstå hur en modell använder sin insats kan vi ge miljontals utvecklare en snabbare och mer tillförlitlig väg från idé till fungerande app.”
Med Astra introducerar vi ett nytt sätt för Codex att bevara och hämta kontext när kontextfönstret blir fullt. Historiskt har modeller använt komprimering för att sammanfatta arbete under långa sessioner, till exempel vid felsökning av komplexa problem eller vid arbete med stora refaktoreringar. Varje komprimering kan utelämna detaljer om varför en korrigering misslyckades eller hur en komponent fungerar. I Codex kan Astra behålla anteckningar mellan kontextfönster och bevara ackumulerade detaljer utan att upprepade gånger komprimera dem till en enda sammanfattning.Tidigare kontextfönster förblir sökbara, så Astra kan hitta krav eller testresultat från tidigare meddelanden och verktygsutdata – även om informationen inte har fångats i dess anteckningar. Du kan aktivera den här experimentella funktionen i din Codex config.toml, och(öppnas i ett nytt fönster) det kommer att bli standard för Astra under de kommande veckorna.
Främjar vetenskapliga upptäckter
Astra kan hjälpa till med det praktiska arbetet bakom vetenskapliga upptäckter. Genom att kombinera vetenskapligt resonemang med datoranvändning kan den arbeta direkt i specialiserad programvara för att granska data och utforska resultat, vilket hjälper forskare att bedöma evidensen och avgöra vad de ska undersöka härnäst.
Cybersäkerhet
Som vi diskuterade i vår säkerhetsuppdatering är Astra ett betydande framsteg inom cyberkapacitet och når den kritiska tröskeln inom cybersäkerhet enligt vårt Preparedness Framework. Dess förmåga att identifiera och utveckla zero-day-exploiter kan hjälpa försvarare att hitta och åtgärda svagheter, men den skapar också ett behov av starkare skyddsåtgärder. För att förstå hur långt dessa förmågor sträcker sig testade vi Astra med interna expertutvärderingar och expertutvärderingar från tredje part.
Vi testade först modellen utan produktionsskydd på ExploitBench och ExploitGym, som utvärderar om modeller kan omvandla kända programvarusårbarheter till fungerande exploiter. På ExploitBench uppnådde Astra ett perfekt resultat på 100 %, jämfört med 78,5 % för GPT‑5.6 Sol, vår tidigare banbrytande modell med cyberkapacitet. På ExploitGym nådde Astra en framgångsgrad på 42,4 %, jämfört med 30,3 % för GPT‑5.6 Sol, samtidigt som den använde avsevärt färre utdata-token.13
Med tanke på farhågor om att exponering för historiska sårbarheter i programvara kan ha påverkat benchmarkresultaten utvärderade vi även Astra på två nya benchmarktester. Bland annat byggde vi en intern utvärdering, ”ExploitBench (juni–augusti 2026)”, för att testa utveckling av exploiter med hjälp av sårbarheter från de föregående tre månaderna.14 Astra uppnådde avsevärt högre frekvenser för exekvering av godtycklig kod än GPT‑5.6 Sol i detta dataset, samtidigt som den använde långt färre utdata-token. Under utvärderingen upptäckte och använde Astra till och med två tidigare okända zero-day-sårbarheter. Vi rapporterar båda sårbarheterna till deras underhållare.
Vi testade också Astra på SRE-Bench15, ett benchmarktest som mäter om modeller kan bakåtkompilera binära programvarufiler för att förstå deras kärnlogik utan tillgång till rå källkod. Astra löste 88,0 % av uppgifterna vid ett enda försök och 99,2 % inom fyra försök, jämfört med 55,9 % respektive 68,7 % för GPT‑5.6 Sol.
Utöver benchmarktester visade expertledda bedömningar att Astra, när det kördes utan de skyddsåtgärder som används i produktion, kunde använda tidigare okända sårbarheter för att åstadkomma exekvering av godtycklig kod i härdade webbläsare och skapa exploiter för privilegieeskalering i härdade operativsystem.
Som vi diskuterade i Försvararnas tidsfönster kan banbrytande cyberfunktioner hjälpa försvarare att hitta svagheter snabbare, men de gör också dessa svagheter lättare att utnyttja, vilket gör det mer angeläget för försvarare att anpassa sig. Med den version av Astra som lanseras idag kan försvarare använda den för att utföra uppgifter såsom säker kodgranskning och patchning.
Men Astra kommer att vägra att utföra mer avancerade cybersäkerhetsuppgifter, till exempel att skapa proof-of-concept-exploiter för sårbarheter. Genom OpenAI Daybreak planerar vi att utöka åtkomsten och lansera mindre restriktiva skyddsåtgärder under de kommande veckorna. Detta möjliggör fler defensiva arbetsflöden, inklusive validering av sårbarheter och proof-of-concept, analys av skadlig kod och teknik för upptäckt.
Vi har också stärkt våra skyddsåtgärder mot potentiellt cybermissbruk genom att bygga vidare på vår säkerhetsstack för GPT‑5.6 Sol.Dessa omfattar ökad modellrobusthet för att bättre stå emot potentiella jailbreak samt mer kontext för våra övervakningssystem.Vi har fortsatt med noggranna interna och externa tester, inklusive automatiserade utvärderingar med våra interna red teaming-angripare.Mer information om våra cyberskyddsåtgärder och tester finns i Astras säkerhetsöversikt och systemkort(öppnas i ett nytt fönster).
Anpassa och implementera GPT‑6 Astra på ett ansvarsfullt sätt
Astra är vår mest välanpassade modell. Astra är mycket bra på att agera omsorgsfullt, respektera uppgiftens ramar och kommunicera transparent. Detta arbete är det senaste resultatet av vårt långvariga forskningsprogram som fokuserar på att träna modeller som förblir i linje med människors avsikter från början till slut.
I känsliga miljöer går Astra varsamt fram, med en försiktighet som står i proportion till den risk som föreligger. I en utvärdering av uppgifter som rör datoranvändning och som valts ut för att vara motståndarinriktade för att provocera fram oönskat beteende lyckades Astra bättre med att undvika oavsiktliga konsekvenser. Att köra med de ytterligare säkerhetsåtgärder som erbjuds som standard resulterade i ännu bättre prestanda.
Astra orsakar färre felinriktade utfall än någon annan banbrytande modell som har testats. För en rättvis jämförelse använde vi en generisk körmiljö för datoranvändande agenter (baserad på de inbyggda verktygen för datoranvändning som finns i både OpenAI Responses API(öppnas i ett nytt fönster) och Anthropic Messages API(öppnas i ett nytt fönster)) och utan de ytterligare skydd som normalt tillämpas för Codex- och ChatGPT Work-användare (automatisk granskning, bekräftelsepolicy).
Astra är också mer benägen att agera inom de gränser som användaren har angett och som antyds av dess miljö. i en intern utvärdering försökte Astra aldrig kringgå ett avslag från Codex Auto-Review. Detta gällde även när automatisk granskning avsiktligt hade konfigurerats så att den gick att kringgå och uppgiften annars var omöjlig att slutföra. Denna respekt för miljöns begränsningar överensstämmer med resultaten från vår utvärdering av omöjliga cyberuppgifter, som vi delade i inledningen av det här inlägget, och andra resultat som dokumenterats i vårt systemkort(öppnas i ett nytt fönster).
Astra sätter dessutom nya rekord inom transparent användarkommunikation. I en utvärdering är Astra tre gånger mindre benägen än GPT‑5.6 Sol att ge felaktiga beskrivningar av sina förmågor och möjligheter.
I vår utvärdering av hallucinationer om förmågor visar Astra en betydande förbättring jämfört med GPT‑5.6 Sol och gör färre vilseledande påståenden om sina förmågor.
Våra utvärderingar visade att Astras skriftliga resonemang var svårare att övervaka än GPT‑5.6 Sols, baserat på tester där den uttryckligen ombads att kringgå övervakning. Vi tillskriver detta Astras större kontroll över skriftliga resonemang vid enklare uppgifter och förmåga att lösa problem med färre skriftliga steg. Astra verkar fortfarande ha svårt att dölja det resonemang som krävs för komplexa uppgifter, men vi tar försämringen på allvar. Att förbättra övervakningsbarheten är fortsatt en forskningsprioritet, och det medföljande systemkortet(öppnas i ett nytt fönster) redogör för våra resultat och vårt pågående arbete.
Anpassningsträning är centralt i vår strategi för driftsättning. Som ett ytterligare skyddslager bygger vi också systemskyddsåtgärder, såsom Codex Auto-review(öppnas i ett nytt fönster) och övervakning av agenters resonemang och handlingar, för att hjälpa till att upptäcka och begränsa osäkert beteende. Som beskrivs i vår säkerhetsuppdatering driftsätter vi också övervakning av felanpassning i produktion för modeller i Astras klass för att få insyn i felanpassning och bidra till att begränsa de allvarligaste fallen. Skyddsåtgärderna liknar vår övervakning av interna driftsättningar och omfattar ett system av klassificerare som granskar modellens resonemang och handlingar efter obehörigt beteende och automatiskt stoppar potentiellt obehörig aktivitet.
Med tanke på den betydande ökningen av Astras cybersäkerhetskapacitet är vi extra noga med att göra den här driftsättningen trygg och säker. Extra säkerhetskontroller kan ibland bromsa, pausa eller stoppa legitimt arbete, inklusive defensivt cybersäkerhetsarbete. Om en uppgift pausas i ChatGPT eller Codex kan du bli ombedd att granska åtgärden innan du fortsätter. I API:et kommer uppgiften att stanna. De här kontrollerna kan ibland avbryta legitimt arbete, och vi fortsätter att vidareutveckla det här systemet för att minska onödiga avbrott. Övervakning av felanpassning kan inte ersätta anpassning: vårt mål är att bygga modeller som på ett tillförlitligt sätt håller sig inom ramen för sina behörigheter, så att dessa skyddsåtgärder inte behöver ingripa.
Tillgänglighet
GPT‑6 Astra lanseras idag till ett begränsat antal organisationer och blir under de kommande dagarna tillgänglig för alla användare av ChatGPT Plus, Pro, Business och Enterprise, samt via OpenAI API, Microsoft Azure och AWS Bedrock. Användning av Astra ingår i de befintliga abonnemangsgränserna – användare och företag kan också köpa krediter för ytterligare användning. Användare med Pro-, Business- och Enterprise-abonnemangen får också åtkomst till GPT‑6 Astra Pro. Enterprise-administratörer kan aktivera Astra för sin arbetsyta, och åtkomsten är som standard inaktiverad vid lanseringen.
Astra stöder noll datalagring för berättigade API-kunder, och som vi berättade förra månaden testar vi Private Safety Processing för att stärka säkerhetsövervakningen samtidigt som kundernas integritet bevaras.
För utvecklare kommer GPT‑6 Astra att finnas tillgänglig i OpenAI API som gpt-6-astra och via Microsoft Azure och Amazon Bedrock.
Standardpriset för OpenAI API är 10 USD per miljon indatatoken och 50 USD per miljon utdatatoken. Separata priser gäller för cacheläsningar och cacheskrivningar. Snabbläge är tillgängligt för GPT‑6 Astra i API:et och ger upp till dubbelt så hög hastighet som med standardbearbetning till dubbla standardpriset.
Professionell
Professionell | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4 % | 18,1 % | 31,4 % | 17,4 % | 26,9 % | - |
BenchCAD | 95,9 % | 83,3 % | 84,3 % 5 | 67,5 % 5 | 82,1 % 5 | - |
BrowseComp | 91,5 % | 90,4% | - | 87,4 % | 90,8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0,19 | - | - | - | - |
Interna designuppgifter | 50,0 % | 47,4 % | - | 35,8 % | - | - |
Interna uppgifter inom datavetenskap | 40,9 % | 30,5 % | - | 34,7 % | - | - |
Artificial Analysis Intelligens Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62.1 | 63,1 | 58,7 |
Kodning
| ”Kodning” | ”GPT‑6 Astra” | ”GPT‑5.6 Sol” | ”Claude Fable 5.1” | ”Claude Fable 5” | ”Claude Opus 5” | ”Gemini 3.8 Flash” | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ”Terminal-Bench 4.0” | ”57 | 9 %” | ”37 | 3 %” | ”55 | 8 %” | ”44 | 5 %” | ”52 | 6 %” | ”19 | 1 %” |
| ”DeepSWE v1.1” | ”74 | 1 %” | ”72 | 7 %” | ”67 | 4 %” | ”69 | 9 %” | ”73 | 7 %” | ”73 | 8 %” |
| ”FrontierCode 1.1 Extended (poäng)” | ”64 | 5 % 8” | ”60 | 6 %” | ”63 | 6 %” | ”64 | 9 %” | ”63 | 6 %” | ”56 | 3 %” |
| ”FrontierCode 1.1 Main (poäng)” | ”53 | 3 % 8” | ”47 | 5 %” | ”50 | 9 %” | ”53 | 5 %” | ”53 | 4 %” | ”43 | 6 %” |
| ”Interna databasmigreringsuppgifter” | ”63 | 9 %” | ”42 | 7 %” | ”57 | 8 %” | ”50 | 3 %” | ”” | ”” | ||
| ”Artificial Analysis Coding Agent Index v1.4” | ”67 | 0” | ”65 | 1” | ”” | ”67 | 2” | ”68 | 1” | ”61 | 2” |
Akademisk
Akademisk | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | 52,6 % | 21,4 % | 30,0 % | - |
FrontierMath Tier 4 (v2) | 97,6 % | 83,0 % | 87,8 % | 90,2 % | 73,2 % | - |
GPQA Diamond | 96,0 % | 94,6 % | 93,7 % | 92,6 % | 93,7 % | 95,3 % |
Humanity's Last Exam (med verktyg) | 57,2 % | - | 65,0 % | 63,8 % | 63,6 % | - |
Vetenskap och hälsa
| ”Vetenskap och hälsa” | ”GPT‑6 Astra” | ”GPT‑5.6 Sol” | ”Claude Fable 5.1” | ”Claude Fable 5” | ”Claude Opus 5” | ”Gemini 3.8 Flash” | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ”GeneBench Pro” | ”37 | 1 %” | ”32 | 3 %” | ”” | ”” | ”” | ”” | ||||
| ”MedChemBench (Internal)” | ”49 | 3 %” | ”47 | 4 %” | ”” | ”” | ”” | ”” | ||||
| ”LifeSciBench” | ”60 | 3 %” | ”59 | 9 %” | ”” | ”” | ”” | ”” | ||||
| ”HealthBench Professional (längdjusterad)” | ”63 | 4 %” | ”60 | 5 %” | ”58 | 1 %” | ”60 | 9 %” | ”56 | 4 %” | ”52 | 1 %” |
Cybersäkerhet
| ”Cybersäkerhet” | ”GPT‑6 Astra” | ”GPT‑5.6 Sol” | ”Claude Fable 5.1” | ”Claude Fable 5” | ”Claude Opus 5” | ”Gemini 3.8 Flash” ”ExploitBench” | ”100 | 0 %” | ”78 | 5 %” | ”” | ”” | ”70 %” | ”” |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ”ExploitGym” | ”42 | 4 % 13” | ”30 | 3 % 13” | ”30 | 4 % 17” | ”28 | 4 %17” | ”22 | 0 %” | ”” | |||
| ”ExploitBench (juni–augusti 2026)” | ”39 | 0 %” | ”5 | 5 %” | ”” | ”” | ”” | ”” | ||||||
| ”SRE-Bench” | ”88 | 0 %” | ”55 | 9 %” | ”” | ”” | ”12 | 5 %” | ”” | |||||
| ”SEC-Bench Pro” | ”85 | 4 %” | ”79 | 1 %” | ”” | ”” | ”” | ”” |
Inriktning
Inriktning | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Internt säkerhetsbenchmark för datoranvändning (lägre är bättre) | 2,4 % | 22,0 % | 9,5 % | 18,3 % | 11,5 % | - |
Internt säkerhetsbenchmark för datoranvändning, med AutoReview (lägre är bättre) | 1,8 % | 4,3 % | - | - | - | - |
Internt benchmark för kringgående (lägre är bättre) | 0,00 % | 0,29 % | - | - | - | - |
ExploitGym honeypot (lägre är bättre) | 0,0 % | 48,2 % | - | - | - | - |
Omöjligt ExploitGym | 100,0 % | - | - | - | - | - |
Internt hallucinationsbenchmark (lägre är bättre) | 4,2 % | 12,2 % | - | - | - | - |
Lång kontext
Lång kontext | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 med 8 nålar, 256K-512K | 100,0 % | 91,5 % | - | - | - | - |
OpenAI MRCR v2 med 8 nålar, 512K-1M | 96,3 % | 73,8 % | - | - | - | - |
Abstrakt resonemang
| ”Abstrakt resonemang” | ”GPT‑6 Astra” | ”GPT‑5.6 Sol” | ”Claude Fable 5.1” | ”Claude Fable 5” | ”Claude Opus 5” | ”Gemini 3.8 Flash” | |||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| ”ARC-AGI-3” | ”99 | 9 % 1” | ”7 | 8 %” | ”-” | ”-” | ”30 | 2 %” | ”-” | ||
| ”ARC-AGI-2” | ”95 | 0 %” | ”92 | 5 %” | ”90 | 0 %” | ”89 | 2 %” | ”90 | 4 %” | ”-” |
| ”ARC-AGI-1” | ”98 | 5 %” | ”97 | 5 %” | ”97 | 5 %” | ”98 | 5 %” | ”97 | 5 %” | ”-” |
Utvärderingspoängen är som högst oavsett ansträngningsnivå. Utvärderingar av GPT kördes i vår forskningsmiljö eller via vårt API, vilket kan ge något annorlunda resultat jämfört med ChatGPT i produktion på grund av skillnader i systemprompter, tillgängliga verktyg osv.
Fotnoter
- 1
På ARC-AGI-3 kördes GPT-6 Astra med vår körmiljö för Responses API, som ändrar två inställningar för att bättre motsvara prestanda i verkliga situationer. Ändringarna är inte specifikt inriktade på ARC-AGI-3.
- 2
GPT-5.6 Sol avser versionen som är tillgänglig i vårt API, ChatGPT Codex och ChatGPT Work. Versionen i ChatGPT Chat skiljer sig något.
- 3
OSWorld V2-Offline är en delmängd av den ursprungliga OSWorld V2 som fungerar utan internetåtkomst. Claude-modellens prestanda på OSWorld-V2 Offline reproducerades av författarna på den officiella topplistan(öppnas i ett nytt fönster). På OSWorld 2.0 baseras poängen för Claude på de officiella inställningarna, inte på de modifierade uppgifterna och den modifierade bedömningen från Fable 5.1-systemkortet.
- 4
- 5
I BenchCAD återspeglar Claudes resultat tre ändringar av utvärderingen, vilka beskrivs i Fable 5.1-systemkortet(öppnas i ett nytt fönster).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon och Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(öppnas i ett nytt fönster).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower och Peter Jonas. “The OpenScore String Quartet Corpus(öppnas i ett nytt fönster).” I Proceedings of the 10th International Conference on Digital Libraries for Musicology, s. 49–57. ACM, 2023.
- 8
På FrontierCode kördes GPT-6 Astra med ett utvecklarmeddelande som liknade ett (öppnas i ett nytt fönster)avsnitt av dess utvecklarmeddelande i Codex: ”Undvik att skapa alltför många testfiler. Skapa en ny testfil endast när det krävs enligt förvarets konventioner eller när ingen befintlig fil är lämplig. Undvik orelaterad uppstädning och onödig komplexitet. Återanvänd lämpliga befintliga verktygsfunktioner. Läs relevanta instruktioner för förvaret och granska närliggande kod, tester, dokumentation och CI. Följ vedertagna konventioner. Målet är ren kod som går att slå samman.” Prompten var inte optimerad för utvärderingen.
- 9
Den första handlar om hur tätt primtal kan förekomma, oavsett hur långt ut på tallinjen man går. I mer än ett decennium fastslog det bäst kända resultatet att oändligt många par av primtal skiljer sig åt med högst 246. Julia Stadlmann(öppnas i ett nytt fönster) förbättrade nyligen den gränsen till 240. Astra bidrog till att fastställa en skarpare gräns på 186, vilket visar att oändligt många par förekommer inom detta mindre avstånd. Korta primtalsgap: Bevis(öppnas i ett nytt fönster) och stödjande forskning(öppnas i ett nytt fönster).
- 10
Det andra rör ovanligt stora luckor mellan primtal. Astra förbättrade en term i en gräns för dessa gap som hade varit oförändrad i mer än 80 år. Vi delar bevisen samt den förkortade tankekedjan och verifieringsmaterialet för båda resultaten. Stora primtalsgap: Bevis(öppnas i ett nytt fönster) och stödjande forskning(öppnas i ett nytt fönster).
- 11
- 12
- 13
- 14
ExploitBench (juni–augusti 2026) innehåller 20 allvarliga V8-sårbarheter i 13 stabila Chrome-versioner. Benchmarken testar huruvida agenter kan uppnå godtycklig kodexekvering i V8 och officiella Chrome-versioner för Linux genom att utnyttja varje angiven sårbarhet. Vissa inkluderade sårbarheter kanske inte tillåter exekvering av godtycklig kod under utvärderingens begränsningar, så en framgångsfrekvens på 100 % kanske inte går att uppnå. Obs! GPT-5.6 Sols resultat på 5,5 % är en artefakt av benchmarkens gräns på 300 turer, en gräns som verkliga kunder som använder max inte skulle ha. Modellen med liknande inställningar uppnådde ett resultat på 11,5 % när den nådde färre begränsningar.
- 15
Jeremy Spence et al. ”The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(öppnas i ett nytt fönster)”. arXiv:2608.11469v1, 2026.
- 16
När vi testar olika tredjepartsmodeller använder vi en enklare forskningskonfiguration. Codex har en mer komplex produktionskonfiguration, vilket kan leda till olika felfrekvenser för råmodellen. Skyddsåtgärder på leverantörssidan och implementeringar av datorverktyg skiljer sig fortfarande åt. Användare upplever inte scenariot utan bekräftelse i Codex, eftersom det är en intern forskningskonfiguration.
- 17
