Een nieuwe generatie intelligentie
Update van 22 september 2026: we breiden onze GPT‑6‑familie uit met GPT‑6 Sol en GPT‑6 Luna. Meer informatie.
We introduceren GPT‑6 Astra, het intelligentste en best afgestemde model ter wereld.
GPT‑6 Astra brengt jarenlang onderzoek en grote investeringen in pre-training, reinforcement learning en alignment samen. Astra is toonaangevend op het gebied van computergebruik, browsen, software-engineering, cybersecurity, wetenschap en professioneel werk. Astra behaalt met 98% vrijwel de maximale score op FrontierMath Tier 4, nadat het al heeft geholpen bij het oplossen van lang onopgeloste wiskundige problemen. Astra behaalt ook met 99,9% vrijwel de maximale score op ARC-AGI-3 en met 100% de maximale score op ExploitBench. Het is bovendien grensverleggend op het gebied van computer- en browsergebruik en voert het meest veeleisende professionele werk uit met ongeëvenaarde snelheid, nauwkeurigheid en oordeelsvermogen.
GPT‑6 Astra wordt vandaag uitgerold naar een beperkte groep organisaties en zal de komende dagen beschikbaar komen voor alle ChatGPT Plus-, Pro-, Business- en Enterprise-gebruikers, evenals via de OpenAI API, Microsoft Azure en AWS Bedrock.
Astra is ons best afgestemde model en begrijpt de intentie van gebruikers en het gedrag van modellen aanzienlijk beter. Daardoor kun je met meer vertrouwen taken aan Astra delegeren. Om dit onder meer te testen, hebben we naar aanleiding van het Hugging Face-incident een nieuwe evaluatie ontwikkeld. Deze beoordeelt of een model dat voor een moeilijke of onmogelijke taak staat, buiten zijn beoogde reikwijdte treedt. Vergeleken met GPT‑5.6 Sol, dat zonder productiebeveiligingen in 48% van de gevallen het toegestane doel overschreed, deed GPT‑6 Astra dit in 0% van de gevallen.
Het beste model ter wereld voor computergebruik
GPT‑6 Astra zet een nieuwe, grensverleggende standaard voor de snelheid, nauwkeurigheid en veiligheid van computergebruik. Het kan vervelende taken uitvoeren, zoals online formulieren invullen, klantrecords in een CRM bijwerken en je agenda organiseren. Het kan online onderzoek doen en samenvattingen opstellen in je e-mail of in je documenteditor. Het kan wetenschappelijke data analyseren, plots genereren, een website maken en frontend-QA-controles uitvoeren om ervoor te zorgen dat alle functies op die site werken. Het kan je helpen zelfstandig software te installeren en te testen, en problemen op te lossen die je op het scherm ziet. Deze verbeteringen komen ook tot uiting in onze toonaangevende evaluatieresultaten.
Deze verbeteringen leiden ook tot aanzienlijke efficiëntiewinst bij echte taken voor kenniswerk. In latentiesimulaties op OSWorld 2.0 levert Astra betere prestaties bij computergebruik en heeft het per taak ongeveer 47% minder tijd nodig dan GPT‑5.6 Sol. Astra scoort 72,6% bij ongeveer 40 minuten per taak, tegenover 65,7% bij ongeveer 75 minuten.3
De mogelijkheden van GPT‑6 Astra voor computergebruik zijn te zien in outputs in uiteenlopende domeinen, waaronder gameontwikkeling, elektrotechniek en dagelijks kenniswerk:
Naast Astra werken we ook de Codex-harness bij om de snelheid van computergebruik aanzienlijk te verbeteren. In combinatie met de efficiëntie van Astra zorgt dit ervoor dat taken op de Mind2Web-benchmark 1,9 keer sneller worden voltooid dan met de huidige GPT‑5.6 Sol-ervaring. Dankzij de snelheidsverbeteringen kan het model veel tijdrovende taken in je dagelijks leven sneller uitvoeren dan je zelf kunt.4
Een sprongsgewijze verandering in professioneel werk
GPT‑6 Astra combineert vooruitgang in computergebruik met gerichte training voor professionele omgevingen om complexe werktaken aan te pakken. Het combineert de intelligentie die nodig is voor complexe problemen met de mogelijkheid om workflows met meerdere stappen uit te voeren en verzorgde documenten, spreadsheets en presentaties op te leveren.
GPT‑6 Astra is ons beste model voor het nauwgezet volgen van bestaande sjablonen en het maken van dia’s die overzichtelijk zijn ingedeeld en de belangrijkste punten beknopt overbrengen met een gestructureerde verhaallijn. Het maakt duidelijke, goed gestructureerde documenten, presentaties, spreadsheets en analyses die je sjablonen volgen en aansluiten bij je schrijf- en visuele stijl. Astra is er ook specifiek op getraind om alleen de context die ertoe doet in de uitvoer op te nemen, in plaats van informatie te herhalen die niet nodig is voor de taak in kwestie. Dit alles betekent dat het artefacten kan opleveren die directer bruikbaar zijn en aansluiten bij je bedrijfscontext en standaarden.
GPT‑6 Astra toont ook een beter visueel beoordelingsvermogen bij het bouwen van websites, games, applicaties en renderingen. Met Sites(opent in een nieuw venster) in ChatGPT kan Astra rechtstreeks vanuit een prompt websites, web-apps en games maken, hosten en delen.
Wanneer instructies ruimte laten voor interpretatie, is GPT‑6 Astra beter dan eerdere modellen in staat om de juiste keuze te maken. Het gebruikt context om routinematige leemtes op te vullen en stelt gerichte vragen wanneer het antwoord de uitkomst kan veranderen. In Codex kan het asynchroon vragen stellen, terwijl het doorgaat met werk dat niet afhankelijk is van je antwoord. Als je niet reageert, gaat het verder met logische aannames waar passend, maar wacht het op je input bij beslissingen met grote gevolgen.
De onderstaande voorbeelden illustreren hoe Astra samenwerkt aan alledaagse taken waarbij ontbrekende informatie het antwoord wezenlijk kan veranderen.
Astra is ook beter in het behouden van overzicht naarmate een taak zich ontwikkelt. Eerdere modellen beschouwden sturingsberichten soms als een nieuw doel, waardoor ze het oorspronkelijke verzoek of eerdere randvoorwaarden uit het oog verloren. Astra neemt nieuwe vereisten mee, wijzigt van koers wanneer daarom wordt gevraagd en beantwoordt zijvragen zonder de bredere taak uit het oog te verliezen.
Programmeren
GPT‑6 Astra is tot nu toe het beste model voor softwareontwikkeling.
"GPT‑6 Astra levert toonaangevende prestaties op onze interne programmeerbenchmarks en laat in evaluaties van handelsintuïtie een duidelijke vooruitgang zien ten opzichte van GPT‑5.6 Sol. Bij agentisch programmeren communiceert GPT‑6 Astra op een manier die voor ontwikkelaars gemakkelijker te volgen is en produceert het code waarvoor minder iteraties nodig zijn om productiekwaliteit te bereiken."
“We hebben Astra getest met een laag, gemiddeld en hoog inspanningsniveau op een van onze evaluaties van de eerste generatie, en het presteerde aanzienlijk beter dan GPT‑5.6 Sol. Een hoger inspanningsniveau levert meer iteraties op een nieuwe build op, meer verificatie via browsertests en een voorkeur voor code-uitvoering boven apply-patch. Door te begrijpen hoe een model zijn inspanning verdeelt, geven we miljoenen bouwers een snellere, betrouwbaardere route van idee naar een werkende app.”
Met Astra introduceren we een nieuwe manier waarop Codex context kan behouden en ophalen wanneer het contextvenster vol raakt. Historisch gezien hebben modellen compaction gebruikt om werk samen te vatten tijdens lange sessies, zoals bij het debuggen van complexe problemen of het aanpakken van grote refactors. Bij elke compaction kunnen details verloren gaan over waarom een oplossing mislukte of hoe een component zich gedraagt. In Codex kan Astra notities bijhouden in meerdere contextvensters, waarbij verzamelde details behouden blijven zonder ze herhaaldelijk in één samenvatting te comprimeren. Eerdere contextvensters blijven doorzoekbaar, zodat Astra vereisten of testresultaten uit eerdere berichten en tooluitvoer kan vinden, zelfs als die informatie niet in de notities is vastgelegd. Je kunt deze experimentele functie inschakelen in je Codex config.toml,(opent in een nieuw venster) en dit wordt de komende weken de standaard voor Astra.
Wetenschappelijke ontdekkingen bevorderen
Astra kan helpen bij het praktische werk achter wetenschappelijke ontdekkingen. Door wetenschappelijke redenering te combineren met computergebruik, kan het rechtstreeks in gespecialiseerde software werken om gegevens te inspecteren en resultaten te verkennen, waardoor onderzoekers het bewijs kunnen beoordelen en kunnen beslissen wat ze vervolgens willen onderzoeken.
Cyberbeveiliging
Zoals we hebben besproken in onze veiligheidsupdate, betekent Astra een aanzienlijke sprong voorwaarts in cybercapaciteiten en voldoet het aan de kritieke drempelwaarde op het gebied van cyberbeveiliging binnen ons Preparedness Framework. Het vermogen ervan om zero-day-exploits te identificeren en te ontwikkelen kan verdedigers helpen kwetsbaarheden op te sporen en te verhelpen, maar maakt ook sterkere beveiligingsmaatregelen noodzakelijk. Om te begrijpen hoe ver deze mogelijkheden reiken, hebben we Astra getest met interne evaluaties en evaluaties door externe experts.
We hebben het model eerst zonder veiligheidsmaatregelen voor productie getest op ExploitBench en ExploitGym, die evalueren of modellen bekende softwarekwetsbaarheden kunnen omzetten in werkende exploits. Op ExploitBench behaalde Astra een perfecte score van 100%, vergeleken met 78,5% voor GPT‑5.6 Sol, ons vorige grensverleggende model met cybercapaciteiten. Op ExploitGym behaalde Astra een succespercentage van 42,4%, vergeleken met 30,3% voor GPT‑5.6 Sol, terwijl het aanzienlijk minder outputtokens gebruikte.13
Gezien de zorgen dat blootstelling aan historische softwarekwetsbaarheden de benchmarkresultaten mogelijk heeft beïnvloed, hebben we Astra ook geëvalueerd op twee nieuwe benchmarks. Om te beginnen hebben we een interne evaluatie, "ExploitBench (juni–augustus 2026)", ontwikkeld om de ontwikkeling van exploits te testen met kwetsbaarheden uit de voorafgaande drie maanden.14 Astra behaalde aanzienlijk hogere percentages succesvolle willekeurige code-uitvoering dan GPT‑5.6 Sol op deze dataset, terwijl het veel minder outputtokens gebruikte. Tijdens de evaluatie ontdekte en gebruikte Astra zelfs twee niet eerder bekende zero-day-kwetsbaarheden. We maken beide kwetsbaarheden bekend aan hun beheerders.
We hebben Astra ook getest op SRE-Bench15, een benchmark die meet of modellen softwarebinaries kunnen reverse-engineeren om de kernlogica ervan te begrijpen zonder toegang tot de ruwe broncode. Astra loste 88,0% van de taken in één poging op en 99,2% binnen vier pogingen, vergeleken met respectievelijk 55,9% en 68,7% voor GPT‑5.6 Sol.
Naast benchmarks bleek uit beoordelingen onder leiding van experts dat Astra, wanneer het zonder beveiligingsmaatregelen voor productie werd uitgevoerd, voorheen onbekende kwetsbaarheden kon gebruiken om willekeurige code uit te voeren in goed beveiligde browsers en privilege-escalatie-exploits te maken voor goed beveiligde besturingssystemen.
Zoals we hebben besproken in The Defender's Window, kunnen grensverleggende cybercapaciteiten verdedigers helpen sneller kwetsbaarheden te vinden. Tegelijkertijd maken ze die kwetsbaarheden gemakkelijker te misbruiken, waardoor verdedigers zich sneller moeten aanpassen. Met de versie van Astra die vandaag wordt gelanceerd, kunnen verdedigers deze gebruiken om taken uit te voeren, zoals beveiligingsgerichte codebeoordeling en patching.
Astra zal echter weigeren meer geavanceerde cyberbeveiligingstaken uit te voeren, zoals het maken van proof-of-concept-exploits voor kwetsbaarheden. Via OpenAI Daybreak zijn we van plan de toegang uit te breiden en de komende weken minder restrictieve veiligheidsmaatregelen uit te rollen. Dit maakt meer defensieve workflows mogelijk, waaronder validatie van kwetsbaarheden en proof-of-concepts, malware-analyse en detectie-engineering.
We hebben ook onze beschermingsmaatregelen tegen mogelijk cybermisbruik versterkt, voortbouwend op het pakket beveiligingsmaatregelen voor GPT‑5.6 Sol. Deze omvatten een betere robuustheid van het model tegen mogelijke jailbreaks en meer context voor onze monitoringsystemen. We hebben grondige interne en externe tests voortgezet, waaronder geautomatiseerde evaluaties met onze interne aanvallers voor red teaming. Meer details over onze cyberbeveiligingsmaatregelen en tests vind je in het Astra-veiligheidsoverzicht en de systeemkaart(opent in een nieuw venster).
GPT‑6 Astra verantwoord afstemmen en implementeren
Astra is ons best afgestemde model. Astra blinkt uit in zorgvuldig handelen, het respecteren van taakgrenzen en transparant communiceren. Dit werk is het nieuwste resultaat van ons langlopende onderzoeksprogramma, dat gericht is op het trainen van modellen die van begin tot eind afgestemd blijven op menselijke intentie.
In gevoelige omgevingen gaat Astra te werk met een mate van zorgvuldigheid die in verhouding staat tot het risico. In een evaluatie van taken voor computergebruik die opzettelijk waren geselecteerd om ongewenst gedrag uit te lokken, slaagde Astra er beter in onbedoelde gevolgen te vermijden. Het gebruik van aanvullende beveiligingsmaatregelen die standaard worden aangeboden, leverde nog betere prestaties op.
Astra veroorzaakt minder verkeerd afgestemde uitkomsten dan elk ander getest grensverleggend model. Voor een eerlijke vergelijking gebruikten we een generieke harness voor computergebruik door agents gebaseerd op de ingebouwde tools voor computergebruik in zowel de OpenAI Responses API(opent in een nieuw venster) als de Anthropic Messages API(opent in een nieuw venster). Daarbij gebruikten we niet de aanvullende beschermingsmaatregelen die normaal beschikbaar zijn voor gebruikers van Codex en ChatGPT Work, zoals Auto-Review en het bevestigingsbeleid.
Astra blijft bovendien vaker binnen de grenzen die de gebruiker stelt en die uit de omgeving voortvloeien. In een interne evaluatie heeft Astra nooit geprobeerd een afwijzing door Codex Auto-Review te omzeilen. Dit bleef zelfs gelden wanneer Auto-Review bewust zo was geconfigureerd dat deze kon worden omzeild en de taak anders onmogelijk te voltooien was. Dit respect voor de beperkingen van de omgeving strookt met de resultaten van onze evaluatie van onmogelijke cybertaken, die we in de inleiding van dit bericht deelden, en met andere bevindingen die zijn gedocumenteerd in onze systeemkaart(opent in een nieuw venster).
Astra zet daarnaast nieuwe maatstaven op het gebied van transparante gebruikerscommunicatie. In één evaluatie doet Astra drie keer minder vaak dan GPT‑5.6 Sol onjuiste uitspraken over de eigen mogelijkheden en gebruiksmogelijkheden.
In onze evaluatie van capability-hallucinatie laat Astra een aanzienlijke verbetering zien ten opzichte van GPT‑5.6 Sol, en doet het minder misleidende beweringen over de eigen mogelijkheden.
Uit onze evaluaties bleek dat Astra’s geschreven redenering moeilijker te monitoren was dan die van GPT‑5.6 Sol, op basis van tests waarin Astra expliciet werd gevraagd de monitoring te omzeilen. We schrijven dit toe aan Astra’s betere beheersing van schriftelijke redenering bij eenvoudigere taken en aan het vermogen om problemen met minder uitgeschreven stappen op te lossen. Astra lijkt nog steeds moeite te hebben om de redenering te verbergen die nodig is voor complexe taken, maar we nemen de afname serieus. Het verbeteren van de monitorbaarheid blijft een onderzoeksprioriteit, en de bijbehorende systeemkaart(opent in een nieuw venster) bevat details over onze bevindingen en lopende werkzaamheden.
Alignmenttraining vormt de kern van onze aanpak voor de uitrol. Als extra verdedigingslaag bouwen we ook systeemwaarborgen zoals Codex Auto-review(opent in een nieuw venster) en monitoren we de redenering en acties van agents om onveilig gedrag te helpen detecteren en in te perken. Zoals beschreven in onze veiligheidsupdate, implementeren we in productie ook monitoring van gebrekkige afstemming voor modellen van de Astra-klasse, om inzicht te krijgen in gebrekkige afstemming en de ernstigste gevallen ervan te helpen indammen. Deze veiligheidsmaatregelen lijken op onze monitoring voor interne implementaties en omvatten een systeem van classificatoren dat de redenering en acties van het model controleert op ongeoorloofd gedrag en mogelijk ongeoorloofde activiteit automatisch stopt.
Gezien de aanzienlijke toename van Astra's cyberbeveiligingscapaciteiten gaan we extra zorgvuldig te werk om deze uitrol veilig en goed beveiligd te laten verlopen. Extra veiligheidscontroles kunnen legitieme werkzaamheden soms vertragen, pauzeren of stopzetten, waaronder defensief cyberbeveiligingswerk. Als een taak wordt gepauzeerd in ChatGPT of Codex, kun je worden gevraagd de actie te controleren voordat je doorgaat. In de API stopt de taak. Deze controles kunnen soms legitiem werk onderbreken, en we blijven dit systeem verder verbeteren om onnodige onderbrekingen te verminderen. Monitoring van gebrekkige afstemming kan afstemming niet vervangen: ons doel is modellen te bouwen die betrouwbaar binnen hun geautoriseerde reikwijdte blijven, zodat deze beschermingsmaatregelen niet hoeven in te grijpen.
Beschikbaarheid
GPT‑6 Astra wordt vandaag uitgerold naar een beperkte groep organisaties en zal de komende dagen beschikbaar komen voor alle ChatGPT Plus-, Pro-, Business- en Enterprise-gebruikers, evenals via de OpenAI API, Microsoft Azure en AWS Bedrock. Astra-gebruik is inbegrepen in de bestaande gebruikslimieten van het abonnement. Gebruikers en bedrijven kunnen ook credits aanschaffen voor extra gebruik. Gebruikers met Pro, Business en Enterprise krijgen ook toegang tot GPT‑6 Astra Pro. Enterprise-beheerders kunnen Astra inschakelen voor hun werkruimte; toegang is bij de lancering standaard uitgeschakeld.
Astra ondersteunt Zero Data Retention voor API-klanten die hiervoor in aanmerking komen. Zoals we vorige maand deelden, testen we Private Safety Processing om het veiligheidstoezicht te versterken en tegelijkertijd de privacy van klanten te beschermen.
Voor ontwikkelaars is GPT‑6 Astra in de OpenAI-API beschikbaar als gpt-6-astra en via Microsoft Azure en Amazon Bedrock.
De Standard-prijzen voor de OpenAI API bedragen 10 dollar per miljoen invoertokens en 50 dollar per miljoen uitvoertokens. Voor cachelees- en cacheschrijfbewerkingen gelden afzonderlijke tarieven. Fast-modus is beschikbaar voor GPT‑6 Astra in de API en biedt tot 2 keer de snelheid van Standard-verwerking tegen 2 keer de prijs van Standard.
Professioneel
Professioneel | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% | - |
BenchCAD | 95,9% | 83,3% | 84,3% 5 | 67,5% 5 | 82,1% 5 | - |
BrowseComp | 91,5% | 90,4% | - | 87,4% | 90,8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Interne ontwerptaken | 50,0% | 47,4% | - | 35,8% | - | - |
Interne datawetenschapstaken | 40,9% | 30,5% | - | 34,7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Programmeren
| Coderen | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 Extended (score) | 64,5% 8 | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 Main (score) | 53,3% 8 | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Interne databasemigratietaken | 63,9% | 42,7% | 57,8% | 50,3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Academisch
Academisch | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21,4% | 30,0% | - |
FrontierMath Tier 4 (v2) | 97,6% | 83.0% | 87,8% | 90,2% | 73,2% | - |
GPQA Diamond | 96,0% | 94,6% | 93,7% | 92,6% | 93,7% | 95,3% |
Humanity's Last Exam (met tools) | 57,2% | - | 65,0% | 63,8% | 63,6% | - |
Wetenschap en gezondheid
Afstemming
Afstemming | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Veiligheidsbenchmark voor intern computergebruik (lager is beter) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Interne veiligheidsbenchmark voor computergebruik, met Auto-Review (lager is beter) | 1,8% | 4,3% | - | - | - | - |
Interne omzeilingsbenchmark (lager is beter) | 0,00% | 0,29% | - | - | - | - |
ExploitGym-honeypot (lager is beter) | 0,0% | 48,2% | - | - | - | - |
Onmogelijke ExploitGym | 100,0% | - | - | - | - | - |
Interne hallucinatiebenchmark (lager is beter) | 4,2% | 12,2% | - | - | - | - |
Lange context
Lange context | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96,3% | 73,8% | - | - | - | - |
Abstract redeneren
| Abstracte redenering | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9% 1 | 7,8% | - | - | 30,2% | - |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% | - |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% | - |
De evaluatiescore is de hoogste score die bij een van de inspanningsniveaus is behaald. GPT‑evaluaties zijn uitgevoerd in onze onderzoeksomgeving of via onze API. Door verschillen in onder meer systeemprompts en beschikbare hulpmiddelen kan de output enigszins afwijken van die van de productieversie van ChatGPT.
Voetnoten
- 1
Op ARC-AGI-3 werd GPT-6 Astra uitgevoerd met onze Responses API-harness, die twee instellingen wijzigt om beter aan te sluiten bij prestaties in de praktijk. De wijzigingen zijn niet specifiek gericht op ARC-AGI-3.
- 2
GPT-5.6 Sol verwijst naar de versie die beschikbaar is in onze API, ChatGPT Codex en ChatGPT Work. De versie in ChatGPT Chat wijkt enigszins af.
- 3
OSWorld V2-Offline is een subset van de oorspronkelijke OSWorld V2 die zonder internettoegang werkt. De prestaties van het Claude-model op OSWorld-V2 Offline zijn door de auteurs gereproduceerd op de officiële ranglijst(opent in een nieuw venster). Op OSWorld 2.0 zijn de scores voor Claude gebaseerd op de officiële instellingen en niet op de aangepaste taken en beoordelingsmethode uit de Fable 5.1-systeemkaart.
- 4
- 5
Op BenchCAD weerspiegelen de scores van Claude drie wijzigingen in de evaluatie, zoals beschreven in de Fable 5.1-systeemkaart(opent in een nieuw venster).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon en Noah A. Smith. "LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(opent in een nieuw venster)." arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower en Peter Jonas. "The OpenScore String Quartet Corpus.(opent in een nieuw venster)" Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
Op FrontierCode werd GPT-6 Astra uitgevoerd met een developer message die vergelijkbaar was met een gedeelte van de developer message in Codex(opent in een nieuw venster): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." De prompt was niet geoptimaliseerd voor de evaluatie.
- 9
Het eerste gaat over hoe dicht priemgetallen bij elkaar kunnen liggen, hoe ver je ook op de getallenlijn gaat. Ruim tien jaar lang was het beste bekende resultaat dat er oneindig veel paren priemgetallen bestaan die hoogstens 246 van elkaar verschillen. Julia Stadlmann(opent in een nieuw venster) heeft die grens onlangs verbeterd tot 240. Astra hielp een scherpere grens van 186 vast te stellen, waarmee werd aangetoond dat oneindig veel paren binnen deze kleinere afstand voorkomen. Korte priemgetalhiaten: bewijs(opent in een nieuw venster) en ondersteunend onderzoek(opent in een nieuw venster).
- 10
Het tweede betreft ongewoon grote afstanden tussen priemgetallen. Astra verbeterde een term in een bovengrens voor deze afstanden, die al meer dan 80 jaar ongewijzigd was gebleven. We delen voor beide resultaten de bewijzen, een verkorte weergave van de redeneerstappen en het verificatiemateriaal. Grote priemgetalhiaten: bewijs(opent in een nieuw venster) en ondersteunend onderzoek(opent in een nieuw venster).
- 11
- 12
- 13
- 14
ExploitBench (juni-augustus 2026) bevat 20 zeer ernstige V8-kwetsbaarheden verspreid over 13 stabiele Chrome-releases. De benchmark test of agents willekeurige code kunnen uitvoeren in V8 en officiële Chrome-releases voor Linux door elke gespecificeerde kwetsbaarheid te misbruiken. Sommige opgenomen kwetsbaarheden staan binnen de beperkingen van de evaluatie mogelijk geen uitvoering van willekeurige code toe, waardoor een slagingspercentage van 100% mogelijk niet haalbaar is. Opmerking: de score van 5,5% van GPT-5.6 Sol is een artefact van de limiet van 300 beurten in de benchmark, een limiet waar echte klanten die Max gebruiken niet mee te maken zouden hebben. Het model behaalde bij vergelijkbare instellingen een score van 11,5% wanneer het tegen minder limieten aanliep.
- 15
Jeremy Spence et al. "The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark.(opent in een nieuw venster)" arXiv:2608.11469v1, 2026.
- 16
Wanneer we testen met modellen van derden, gebruiken we een eenvoudigere onderzoeksopzet. Codex heeft een complexere productieconfiguratie, wat kan leiden tot andere foutpercentages van het basismodel. Beveiligingsmaatregelen aan de kant van de provider en implementaties van computertools verschillen nog steeds. Gebruikers ervaren het scenario zonder bevestiging niet in Codex, omdat het een interne onderzoeksconfiguratie is.
- 17
