En ny generasjon intelligens
Oppdatering 22. september 2026: Vi utvider GPT‑6‑familien vår med GPT‑6 Sol og GPT‑6 Luna. Les mer.
Vi introduserer GPT‑6 Astra, verdens mest intelligente og samordnede modell.
GPT‑6 Astra samler årevis med forskning og store satsinger innen førtrening, forsterkende læring og samordning. Astra er toppmoderne innen bruk av datamaskiner, nettlesing, programvareutvikling, cybersikkerhet, vitenskap og profesjonelt arbeid. Astra oppnår en poengsum på 98 % i FrontierMath Nivå 4, etter allerede å ha bidratt til å løse langvarige åpne problemer innen matematikk. Astra metter også ARC-AGI-3 med en poengsum på 99,9 % og ExploitBench med en poengsum på 100 %. Den flytter også banebrytende for bruk av datamaskiner og nettlesere og håndterer det mest krevende profesjonelle arbeidet med enestående hastighet, nøyaktighet og dømmekraft.
GPT‑6 Astra rulles ut i dag til et begrenset antall organisasjoner, og vil i løpet av de kommende dagene bli tilgjengelig for alle ChatGPT Plus-, Pro-, Business- og Enterprise-brukere, samt gjennom OpenAI API, Microsoft Azure og AWS Bedrock.
Astra er vår mest samordnede modell, med betydelige forbedringer i forståelsen av brukerens hensikt og modellens atferd. Det betyr at du kan delegere oppgaver med større tillit til Astras dømmekraft. Som én måte å teste dette på utviklet vi en ny evaluering basert på Hugging Face-hendelsen. Den vurderer om en modell som står overfor en vanskelig eller umulig oppgave, vil gå utover sitt tiltenkte virkeområde. Sammenlignet med GPT‑5.6 Sol, som uten sikkerhetstiltakene i produksjonsmiljøet gikk utover det autoriserte målet i 48 % av tilfellene, gjorde GPT‑6 Astra dette i 0 % av tilfellene.
Verdens beste modell for datamaskinbruk
GPT‑6 Astra markerer en ny banebrytende for hastighet, nøyaktighet og sikkerhet ved bruk av datamaskiner. Den kan ta seg av kjedelige oppgaver som å fylle ut nettskjemaer, oppdatere kundeposter i et CRM-system og organisere kalenderen din. Det kan utføre undersøkelser på nettet og lage utkast til sammendrag i e-posten din eller i dokumentredigeringsprogrammet ditt. Den kan analysere vitenskapelige data, generere plott, opprette et nettsted og kjøre QA-kontroller av frontend for å sikre at alle funksjonene på nettstedet fungerer. Den kan hjelpe deg med å installere og teste programvare på egen hånd og feilsøke problemer du ser på skjermen. Disse forbedringene gjenspeiles også i evalueringsresultatene våre, som er i toppklasse.
Disse forbedringene fører også til betydelige effektivitetsgevinster i reelle oppgaver innen kunnskapsarbeid. I responstidssimuleringer på OSWorld 2.0 oppnår Astra bedre ytelse ved datamaskinbruk på omtrent 47 % kortere tid per oppgave enn GPT‑5.6 Sol, som oppnådde 72,6 % på omtrent 40 minutter per oppgave, sammenlignet med 65,7 % på omtrent 75 minutter.3
GPT‑6 Astras evner til å bruke datamaskiner kan ses i resultater på tvers av områder, inkludert spillutvikling, elektroteknikk og hverdagslig kunnskapsarbeid:
Sammen med Astra oppdaterer vi også Codex-rammeverket for å forbedre hastigheten ved datamaskinbruk betydelig. Kombinert med Astras effektivitet gir dette 1,9× raskere oppgavefullføring sammenlignet med dagens GPT‑5.6 Sol-opplevelse på Mind2Web-referansetesten. Modellens hastighetsforbedringer betyr at den kan ta på seg mange tidkrevende hverdagsoppgaver for deg, raskere enn du kan.4
Et markant skifte i profesjonelt arbeid
GPT‑6 Astra kombinerer fremskritt innen datamaskinbruk med målrettet opplæring for profesjonelle miljøer for å bidra til å håndtere komplekse arbeidsoppgaver. Den kombinerer intelligensen som kreves for komplekse problemer med evnen til å gjennomføre arbeidsflyter med flere trinn og produsere gjennomarbeidede dokumenter, regneark og presentasjoner.
GPT‑6 Astra er vår beste modell for å følge eksisterende maler og produsere velutformede lysbilder som kortfattet formidler hovedpoengene gjennom en strukturert fortelling. Den lager tydelige, velstrukturerte dokumenter, presentasjoner, regneark og analyser som følger malene dine og passer til skrivestilen og den visuelle stilen din. Astra er også trent til spesifikt å hente inn bare den konteksten som er relevant i utdataene, i stedet for å gjenta informasjon som er unødvendig for den aktuelle oppgaven. Alt dette betyr at den kan generere artefakter som er mer umiddelbart brukbare, og som samsvarer med virksomhetskonteksten din og standardene dine.
GPT‑6 Astra har også sterkere visuell vurderingsevne når den bygger nettsteder, spill, applikasjoner og gjengivelser. Med Sites(åpnes i et nytt vindu) i ChatGPT kan Astra lage, drifte og dele nettsteder, nettapper og spill direkte fra en prompt.
Når instruksjoner gir rom for tolkning, er GPT‑6 Astra bedre enn tidligere modeller til å ta den riktige avgjørelsen. Den bruker kontekst til å fylle ut vanlige informasjonsmangler og stiller målrettede spørsmål når svaret kan påvirke utfallet. I Codex kan den stille spørsmål asynkront mens den fortsetter å jobbe med oppgaver som ikke avhenger av svaret ditt. Hvis du ikke svarer, går den videre med rimelige antakelser der det er hensiktsmessig, men venter på dine innspill når det gjelder beslutninger med vesentlige konsekvenser.
Eksemplene nedenfor viser hvordan Astra samarbeider om hverdagslige oppgaver der manglende informasjon kan endre svaret vesentlig.
Astra er også bedre til å holde oversikten etter hvert som en oppgave utvikler seg. Tidligere modeller behandlet noen ganger styringsmeldinger som et nytt mål og mistet oversikten over den opprinnelige forespørselen eller tidligere begrensninger. Astra tar inn nye krav, endrer kurs når den blir bedt om det, og svarer på tilleggsspørsmål uten å miste den overordnede oppgaven av syne.
Koding
GPT‑6 Astra er den beste modellen for programvareutvikling hittil.
«GPT‑6 Astra leverer ytelse i toppklasse på våre interne referansetester for koding og viser et tydelig fremskritt i evalueringer av handelsintuisjon sammenlignet med GPT‑5.6 Sol. Når GPT‑6 Astra brukes til agentisk koding, kommuniserer den på en måte som er enklere for utviklere å følge, og produserer kode som krever færre iterasjoner for å nå produksjonskvalitet.»
«Vi testet Astra med lav, middels og høy innsats på en av våre førstegenerasjons evalueringer, og den kom betydelig foran GPT 5.6 Sol. Høyere innsats gir flere iterasjoner på en ny byggversjon, mer verifisering gjennom testing i nettleseren og en preferanse for kodekjøring fremfor apply-patch. Det er ved å forstå hvordan en modell bruker innsatsen sin at vi gir millioner av utviklere en raskere og mer pålitelig vei fra idé til fungerende app.»
Med Astra introduserer vi en ny måte for Codex å bevare og hente frem kontekst på når kontekstvinduet fylles opp. Historisk sett har modeller brukt komprimering til å oppsummere arbeid i lange økter, for eksempel ved feilsøking av komplekse problemer eller arbeid med store refaktoreringer. Hver komprimering kan utelate detaljer om hvorfor en feilretting mislyktes, eller hvordan en komponent oppfører seg. I Codex kan Astra lagre notater på tvers av kontekstvinduer og bevare oppsamlede detaljer uten gjentatte ganger å komprimere dem til ett enkelt sammendrag. Tidligere kontekstvinduer forblir søkbare, slik at Astra kan finne krav eller testresultater fra tidligere meldinger og verktøyutdata, selv om denne informasjonen ikke ble registrert i notatene. Du kan aktivere denne eksperimentelle funksjonen i Codex config.toml,(åpnes i et nytt vindu) og den blir standard for Astra i løpet av de neste ukene.
Fremmer vitenskapelige oppdagelser
Astra kan hjelpe til med det praktiske arbeidet bak vitenskapelige oppdagelser. Ved å kombinere vitenskapelig resonnering med bruk av datamaskin kan den arbeide direkte i spesialisert programvare for å undersøke data og utforske resultater, og hjelpe forskere med å vurdere evidensen og avgjøre hva de skal undersøke videre.
Cybersikkerhet
Som vi omtalte i sikkerhetsoppdateringen vår, representerer Astra et betydelig fremskritt innen cyberkapasiteter og oppfyller den kritiske terskelen innen cybersikkerhet i henhold til vårt Preparedness Framework. Evnen til å identifisere og utvikle «zero-day»-angrep kan hjelpe sikkerhetsansvarlige med å oppdage og rette opp svakheter, men det skaper også et behov for sterkere sikkerhetstiltak. For å forstå hvor omfattende disse funksjonene er, har vi testet Astra ved hjelp av interne evalueringer og evalueringer utført av eksterne eksperter.
Vi testet først modellen uten produksjonssikringstiltak på ExploitBench og ExploitGym, som evaluerer om modeller kan omdanne kjente programvaresårbarheter til fungerende utnyttelser. På ExploitBench oppnådde Astra en perfekt poengsum på 100 %, sammenlignet med 78,5 % for GPT‑5.6 Sol, vår tidligere banebrytende modell med cyberkapasitet. På ExploitGym oppnådde Astra en suksessrate på 42,4 %, sammenlignet med 30,3 % for GPT‑5.6 Sol, samtidig som den brukte betydelig færre utdatatokener.13
På grunn av bekymringer om at eksponering for historiske programvaresårbarheter kan ha påvirket resultatene fra referansemålingene, evaluerte vi også Astra på to nye referansemålinger. For det første bygde vi en intern «ExploitBench (juni–august 2026)»-evaluering for å teste utvikling av utnyttelser basert på sårbarheter fra de tre foregående månedene.14 Astra oppnådde vesentlig høyere rater for kjøring av vilkårlig kode enn GPT‑5.6 Sol på dette datasettet, samtidig som den bruker langt færre utdata-token. Under evalueringen oppdaget og brukte Astra til og med to tidligere ukjente zero-day-sårbarheter. Vi varsler vedlikeholderne om begge sårbarhetene.
Vi testet også Astra på SRE-Bench15, en referansetest som måler om modeller kan foreta omvendt utvikling på programvarebinærfiler for å forstå kjernelogikken uten tilgang til rå kildekode. Astra løste 88,0 % av oppgavene på ett forsøk og 99,2 % innen fire forsøk, sammenlignet med henholdsvis 55,9 % og 68,7 % for GPT‑5.6 Sol.
Utover referansemålinger fant ekspertledede vurderinger at Astra, når den ble kjørt uten sikkerhetstiltak i produksjon, kunne bruke tidligere ukjente sårbarheter til å oppnå kjøring av vilkårlig kode i forsterkede nettlesere og lage utnyttelser for rettighetseskalering i forsterkede operativsystemer.
Som vi diskuterte i Forsvarernes mulighetsvindu, kan banebrytende cyberkapasiteter hjelpe forsvarere med å finne svakheter raskere, men de gjør også disse svakhetene enklere å utnytte, noe som gjør det mer presserende for forsvarere å tilpasse seg. Med versjonen av Astra som lanseres i dag, kan forsvarere bruke den til å utføre oppgaver som sikker kodegjennomgang og retting.
Astra vil imidlertid nekte å utføre mer avanserte cybersikkerhetsoppgaver, for eksempel å opprette konseptbevisutnyttelser for sårbarheter. Gjennom OpenAI Daybreak planlegger vi å utvide tilgangen og rulle ut mindre restriktive sikkerhetstiltak i løpet av de kommende ukene. Dette vil muliggjøre flere defensive arbeidsflyter, inkludert validering av sårbarheter og konseptbevis, analyse av skadevare og deteksjonsutvikling.
Vi har også styrket beskyttelsen vår mot potensielt cybermisbruk, med utgangspunkt i sikkerhetstiltakene våre for GPT‑5.6 Sol. Dette inkluderer sterkere modellrobusthet for bedre å motstå potensielle jailbreak-forsøk og mer kontekst for overvåkingssystemene våre. Vi har fortsatt med grundig intern og ekstern testing, inkludert automatiserte evalueringer med våre interne angripere innen red teaming. Du finner mer informasjon om våre cybersikkerhetstiltak og tester i Astras sikkerhetsoversikt og systemkort(åpnes i et nytt vindu).
Ansvarlig samordning og utrulling av GPT‑6 Astra
Astra er vår mest innrettede modell. Astra utmerker seg ved å utvise varsomhet, respektere rammene for oppgaven og kommunisere åpent. Dette arbeidet er det nyeste resultatet av vårt langvarige forskningsprogram, som fokuserer på å trene modeller som forblir i tråd med menneskelig intensjon fra start til slutt.
I sensitive miljøer går Astra frem med varsomhet som står i forhold til den tilhørende risikoen. I en evaluering av oppgaver for datamaskinbruk som var fiendtlig valgt ut for å fremprovosere uønsket atferd, lyktes Astra bedre med å unngå utilsiktede konsekvenser. Kjøring med ekstra sikkerhetstiltak som tilbys som standard ga enda bedre ytelse.
Astra fører til færre feilinnrettede utfall enn noen andre banebrytende modeller som ble testet. For en rettferdig sammenligning brukte vi et generisk rammeverk for databrukende agenter (basert på de innebygde verktøyene for datamaskinbruk som er tilgjengelige i både OpenAI Responses API(åpnes i et nytt vindu) og Anthropic Messages API(åpnes i et nytt vindu)) og uten ytterligere beskyttelsestiltak som vanligvis brukes for Codex- og ChatGPT Work-brukere (automatisk gjennomgang, bekreftelsespolicy).
Astra er også mer tilbøyelig til å holde seg innenfor rammene som brukeren har satt, og som omgivelsene tilsier. I en intern evaluering forsøkte Astra aldri å omgå et avslag fra Codex Auto-Review. Dette gjaldt selv når Auto-review bevisst var konfigurert slik at den kunne omgås, og oppgaven ellers var umulig å fullføre. Denne respekten for miljøbegrensningene er i tråd med resultatene fra evalueringen vår av umulige cyberoppgaver, som vi delte i innledningen til dette innlegget, og andre funn dokumentert i systemkortet(åpnes i et nytt vindu).
Astra setter dessuten nye standarder for åpen brukerkommunikasjon. I én evaluering er Astra tre ganger mindre sannsynlig enn GPT‑5.6 Sol til å gi uriktige fremstillinger av sine funksjoner og muligheter.
I vår evaluering av hallusinasjoner om kapabiliteter viser Astra en betydelig forbedring sammenlignet med GPT‑5.6 Sol og fremsetter færre villedende påstander om egne kapabiliteter.
Evalueringene våre viste at Astras skriftlige resonnering var vanskeligere å overvåke enn GPT‑5.6 Sols, basert på tester som eksplisitt ba den om å omgå overvåking. Vi tilskriver dette at Astra har større kontroll over skriftlig resonnering i enklere oppgaver og evne til å løse problemer med færre skriftlige trinn. Astra ser fortsatt ut til å streve med å skjule resonneringen som trengs for komplekse oppgaver, men vi tar nedgangen på alvor. Å forbedre overvåkbarheten er fortsatt en forskningsprioritet, og det tilhørende systemkortet(åpnes i et nytt vindu) beskriver funnene våre og det pågående arbeidet vårt.
Tilpasningstrening står sentralt i tilnærmingen vår til utrulling. Som et ekstra beskyttelseslag utvikler vi også systembaserte sikkerhetstiltak, som Codex Auto-review(åpnes i et nytt vindu) og overvåking av agenters resonnering og handlinger, for å bidra til å oppdage og begrense utrygg atferd. Som beskrevet i sikkerhetsoppdateringen vår tar vi også i bruk overvåking av feilinnretting i produksjon for modeller i Astra-klassen, for å få innsikt i feilinnretting og bidra til å begrense de mest alvorlige tilfellene. Disse sikkerhetstiltakene ligner på overvåkingen vi har for interne implementeringer og innebærer et system med klassifikatorer som kontrollerer modellens resonnement og handlinger for uautorisert atferd og automatisk stopper potensielt uautorisert aktivitet.
Gitt den betydelige økningen i Astras cybersikkerhetskapabiliteter, er vi spesielt nøye med å sørge for at denne utrullingen er trygg og sikker. Ekstra sikkerhetskontroller kan noen ganger forsinke, sette på pause eller stoppe legitimt arbeid, inkludert defensivt cybersikkerhetsarbeid. Hvis en oppgave settes på pause i ChatGPT eller Codex, kan du bli bedt om å gjennomgå handlingen før du fortsetter. I API-et vil oppgaven stoppe. Disse kontrollene kan av og til forstyrre legitimt arbeid, og vi fortsetter å videreutvikle dette systemet for å redusere unødvendige avbrudd. Overvåking av feilinnretting kan ikke erstatte innretting: Målet vårt er å bygge modeller som pålitelig holder seg innenfor sitt autoriserte virkeområde, slik at disse beskyttelsestiltakene ikke trenger å gripe inn.
Tilgjengelighet
GPT‑6 Astra rulles ut i dag til et begrenset antall organisasjoner, og vil i løpet av de kommende dagene bli tilgjengelig for alle ChatGPT Plus-, Pro-, Business- og Enterprise-brukere, samt gjennom OpenAI API, Microsoft Azure og AWS Bedrock. Astra-bruk er inkludert i de eksisterende brukskvotene for abonnementene. Brukere og virksomheter vil også kunne kjøpe kreditter for videre bruk. Brukere med Pro-, Business- og Enterprise-abonnementer får også tilgang til GPT‑6 Astra Pro. Enterprise-administratorer kan aktivere Astra for arbeidsområdet sitt. Tilgang er deaktivert som standard ved lansering.
Astra støtter ingen oppbevaring av data for kvalifiserte API-kunder, og som vi delte forrige måned, tester vi Privat sikkerhetsbehandling for å styrke sikkerhetsovervåkingen samtidig som vi ivaretar kundenes personvern.
For utviklere vil OpenAI GPT‑6 Astra være tilgjengelig i OpenAI API-et som gpt-6-astra og via Microsoft Azure og Amazon Bedrock.
Standardprisen for OpenAI API er 10 USD per million inndatatokener og 50 USD per million utdatatokener. Separate satser gjelder for lesing fra og skriving til hurtigbufferen. Hurtigmodus er tilgjengelig for GPT‑6 Astra i API-et og gir opptil dobbelt så høy hastighet som standardbehandling til 2 ganger standardprisen.
Profesjonellt
Profesjonellt | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4 % | 18,1 % | 31,4 % | 17,4 % | 26,9 % | – |
BenchCAD | 95,9 % | 83,3 % | 84,3 % 5 | 67,5 % 5 | 82,1 % 5 | – |
BrowseComp | 91,5 % | 90,4 % | – | 87,4 % | 90,8 % | – |
OpenScore String Quartets (1 - OMR-NED) | 0,84 | 0,19 | – | – | – | – |
Interne designoppgaver | 50,0 % | 47,4 % | – | 35,8 % | – | – |
Interne datavitenskapsoppgaver | 40,9 % | 30,5 % | – | 34,7 % | – | – |
Artificial Analysis-indeks for kunstig intelligens v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Koding
| Koding | OpenAI GPT‑6 Astra | OpenAI GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (score) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (score) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Interne oppgaver for databasemigrering | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Akademisk
Akademisk | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | 52,6 % | 21,4 % | 30,0 % | – |
FrontierMath-nivå 4 (v2) | 97,6 % | 83,0 % | 87,8 % | 90,2 % | 73,2 % | – |
GPQA Diamond | 96,0 % | 94,6 % | 93,7 % | 92.6 % | 93,7 % | 95,3 % |
Humanity's Last Exam (med verktøy) | 57,2 % | – | 65,0 % | 63,8 % | 63,6 % | – |
Tilpasning
Tilpasning | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Referanseindeks for sikkerhet ved intern datamaskinbruk (lavere er bedre) | 2,4 % | 22,0 % | 9,5 % | 18,3 % | 11,5 % | – |
Intern sikkerhetsreferanse for datamaskinbruk, med AutoReview (lavere er bedre) | 1,8 % | 4,3 % | – | – | – | – |
Intern referansemåling for omgåelse (lavere er bedre) | 0,00 % | 0,29 % | – | – | – | – |
ExploitGym-lokkesystem (lavere er bedre) | 0,0 % | 48,2 % | – | – | – | – |
Umulig ExploitGym | 100,0 % | – | – | – | – | – |
Intern referansemåling for hallusinering (lavere er bedre) | 4,2 % | 12,2 % | – | – | – | – |
Lang kontekst
Lang kontekst | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0 % | 91,5 % | – | – | – | – |
OpenAI MRCR v2 8-nåls 512K-1M | 96,3 % | 73,8 % | – | – | – | – |
Abstrakt resonnering
| Abstract resonnering | OpenAI GPT‑6 Astra | OpenAI GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
Poengsummer for evaluering er maksimale ved ethvert innsatsnivå. GPT‑evalueringer ble kjørt i forskningsmiljøet vårt eller via API-et vårt, noe som kan gi litt annerledes resultater enn produksjonsversjonen av ChatGPT på grunn av forskjeller i systempromptene, tilgjengelige verktøy osv.
FOTNOTER
- 1
På ARC-AGI-3 ble GPT-6 Astra kjørt med vårt Responses API-rammeverk, som endrer to innstillinger for bedre å samsvare med ytelsen i den virkelige verden. Endringene er ikke spesifikt rettet mot ARC-AGI-3.
- 2
GPT-5.6 Sol viser til versjonen som er tilgjengelig i API-et vårt, ChatGPT Codex og ChatGPT Work. Versjonen i ChatGPT Chat er litt annerledes.
- 3
OSWorld V2-Offline er et delsett av den opprinnelige OSWorld V2 som fungerer uten internettilgang. Ytelsen til Claude-modellen på OSWorld-V2 Offline ble reprodusert av forfatterne på den offisielle topplisten(åpnes i et nytt vindu). For OSWorld 2.0 er poengsummene for Claude basert på de offisielle innstillingene, og ikke på de endrede oppgavene og den endrede vurderingen fra Fable 5.1-systemkortet.
- 4
- 5
På BenchCAD gjenspeiler Claudes skårer tre endringer i evalueringen, beskrevet i detalj i Fable 5.1-systemkortet(åpnes i et nytt vindu).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon og Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(åpnes i et nytt vindu).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower og Peter Jonas. «The OpenScore String Quartet Corpus(åpnes i et nytt vindu).» Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
På FrontierCode ble GPT-6 Astra kjørt med en utviklermelding som lignet på en del av utviklermeldingen i Codex(åpnes i et nytt vindu): «Unngå å opprette for mange testfiler. Opprett bare en ny testfil når det kreves av lagerkonvensjoner, eller når ingen eksisterende fil er et passende sted. Unngå urelatert opprydding og unødvendig kompleksitet. Gjenbruk egnede eksisterende verktøy. Les relevante lagerinstruksjoner og undersøk nærliggende kode, tester, dokumentasjon og CI. Følg etablerte konvensjoner. Målet er ren kode som kan flettes.» Prompten ble ikke optimalisert for evalueringen.
- 9
Den første gjelder hvor nær hverandre primtall kan forekomme, uansett hvor langt ut på tallinjen man kommer. I mer enn et tiår fastslo det best kjente resultatet at uendelig mange par av primtall er høyst 246 fra hverandre. Julia Stadlmann(åpnes i et nytt vindu) forbedret nylig denne grensen til 240. Astra bidro til å etablere en strammere grense på 186, noe som viser at uendelig mange par forekommer innenfor denne mindre avstanden. Korte primtallsgap: bevis(åpnes i et nytt vindu) og underbyggende forskning(åpnes i et nytt vindu).
- 10
Det andre gjelder uvanlig store avstander mellom primtall. Astra forbedret et ledd i en skranke for disse gapene som hadde vært uendret i mer enn 80 år. Vi deler bevisene, en forkortet tankerekke og verifiseringsmateriell for begge resultatene. Store primtallsgap: Bevis(åpnes i et nytt vindu) og underbyggende forskning(åpnes i et nytt vindu).
- 11
- 12
- 13
- 14
ExploitBench (juni–august 2026) inneholder 20 V8-sårbarheter med høy alvorlighetsgrad på tvers av 13 stabile Chrome-utgivelser. Referansetesten undersøker om agenter kan oppnå vilkårlig kodekjøring i V8 og offisielle Chrome-versjoner for Linux ved å utnytte hvert av de angitte sikkerhetshullene. Noen inkluderte sårbarheter tillater kanskje ikke vilkårlig kodekjøring innenfor evalueringens begrensninger, så en suksessrate på 100 % er kanskje ikke oppnåelig. Merk: Resultatet på 5,5 % for OpenAI GPT-5.6 Sol skyldes begrensningen på 300 runder i referansetesten. Denne begrensningen gjelder ikke for faktiske kunder som bruker max. Modellen med lignende innstillinger oppnådde en skår på 11,5 % ved å støte på færre begrensninger.
- 15
Jeremy Spence et al. «The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(åpnes i et nytt vindu)». arXiv:2608.11469v1, 2026.
- 16
Når vi tester på tvers av tredjepartsmodeller, bruker vi et enklere forskningsoppsett. Codex har en mer kompleks produksjonskonfigurasjon, noe som kan føre til ulike feilrater i råmodeller. Sikringstiltak på leverandørsiden og implementering av dataverktøy er fortsatt to forskjellige ting. Brukere opplever ikke scenarioet uten bekreftelse i Codex, ettersom det er en intern forskningskonfigurasjon.
- 17
