OpenAI

GPT-6 Astra: A new generation of intelligence

Az intelligencia új generációja

Frissítés 2026. szeptember 22-én: GPT‑6 termékcsaládunkat a GPT‑6 Sol és a GPT‑6 Luna modellekkel bővítjük. További információk.

Bemutatjuk a GPT‑6 Astrát, a világ legintelligensebb és leginkább összehangolt modelljét.

A GPT‑6 Astra az előtanítás, a megerősítéses tanulás és az összehangolás terén végzett többéves kutatást és jelentős vállalásokat egyesíti. Az Astra a számítógép-használat, a böngészés, a szoftverfejlesztés, a kiberbiztonság, a tudomány és a professzionális munka terén a legkorszerűbb. Az Astra 98%-os pontszámmal telíti a FrontierMath 4. szintjét, miután már korábban is segített régóta fennálló nyitott problémák megoldásában⁠ a matematika területén. Az Astra emellett 99,9%-os eredménnyel telíti az ARC-AGI-3-at, az ExploitBenchet pedig 100%-os eredménnyel. Emellett új élvonalbeli mércét állít fel a számítógép- és böngészőhasználat terén, páratlan gyorsasággal, pontossággal és ítélőképességgel kezeli a legigényesebb professzionális munkát is. 

A GPT‑6 Astra bevezetése ma kezdődik, egyelőre szervezetek szűk körében, a következő napokban pedig valamennyi ChatGPT Plus-, Pro-, Business- és Enterprise-felhasználó számára elérhetővé válik, valamint az OpenAI API-n, a Microsoft Azure-on és az AWS Bedrockon keresztül is használható lesz.

„Az ARC-AGI-3 teszten Astra a pályák 96%-án felülmúlta az emberi cselekvési hatékonyságra vonatkozó viszonyítási alapunkat, így a tesztben gyakorlatilag elérte az emberi szintet. Ez nemcsak a valaha tesztelt legjobb modellünk, hanem jelentős ugrást is jelent az élvonalbeli modellek teljesítményében – nemcsak az új környezetekben való navigálás és problémamegoldás terén, hanem abban is, hogy milyen hatékonyan tanulja meg mindezt.”
Greg Kamradt, ARC Prize Foundation

Az Astra a legjobban összehangolt modellünk, amely jelentősen fejlődött a felhasználói szándék és a modell viselkedésének megértésében – így nagyobb bizalommal delegálhatsz a számára feladatokat, az Astra ítélőképességében bízva. Ennek tesztelésére többek között a Hugging Face-incidens tanulságai alapján új értékelést dolgoztunk ki, amely azt vizsgálja, hogy egy nehéz vagy lehetetlen feladattal szembesülő modell túllép-e a számára kijelölt hatókörön. Míg az éles védelmi intézkedések nélkül működő GPT‑5.6 Sol az esetek 48%-ában túllépte az engedélyezett célértéket, a GPT‑6 Astra az esetek 0%-ában tette ezt.

A világ legjobb számítógép-használati modellje

A GPT‑6 Astra új élvonalat jelent a számítógép-használat sebességében, pontosságában és biztonságában. Olyan unalmas feladatokat is elvégezhet, mint az online űrlapok kitöltése, az ügyféladatok frissítése a CRM-ben és a naptár rendszerezése. Képes online kutatást végezni, és összefoglalókat megfogalmazni a levelezőprogramodban vagy a dokumentumszerkesztődben. Képes tudományos adatokat elemezni, grafikonokat generálni, webhelyet létrehozni, valamint frontend QA-ellenőrzéseket futtatni annak biztosítására, hogy az adott webhely összes funkciója működjön. Önállóan segíthet szoftverek telepítésében és tesztelésében, valamint a képernyőn látható problémák elhárításában. Ezek a fejlesztések a legkorszerűbb értékelési eredményeinkben is megmutatkoznak.

Ezek a fejlesztések a valós tudásalapú munkafeladatok terén is jelentős hatékonyságnövekedést eredményeznek. Az OSWorld 2.0 késleltetési szimulációiban az Astra feladatonként mintegy 47%-kal rövidebb idő alatt magasabb számítógép-használati teljesítményt ér el, mint a GPT‑5.6 Sol, amely 72,6%-ot ért el feladatonként nagyjából 40 perc alatt, szemben a hozzávetőleg 75 perc alatt elért 65,7%-kal.3

A GPT‑6 Astra számítógép-használati képességei különböző területeken – többek között a játékfejlesztésben, az elektrotechnikában és a mindennapi tudásalapú munkában – is megmutatkoznak:

Az Astra mellett a Codex végrehajtási környezetet is frissítjük, hogy jelentősen javítsuk a számítógép-használat sebességét. Az Astra hatékonyságával együtt ez a Mind2Web benchmarkon a jelenlegi GPT‑5.6 Sol használati élményéhez képest 1,9-szer gyorsabb feladatelvégzést jelent. A modell sebességbeli fejlesztései azt jelentik, hogy számos időigényes hétköznapi feladatot nálad gyorsabban tud elvégezni.4

„A GPT‑6 Astrát a bevezetés napján integráljuk Devin végrehajtási környezetébe, ahol a belső tesztelési benchmarkunkon csúcsteljesítményt nyújt. Kiváló számítógép-használati, írási és kódbázis-megértési képességei már az első használattól kezdve javították a tesztelést: a videók érezhetően könnyebben követhetők, a jelentések pedig világosabbak és tömörebbek”
Silas Alberti, kutatásért felelős vezető alelnök, Cognition

Ugrásszerű változás a szakmai munkában

A GPT‑6 Astra a számítógép-használat terén elért fejlesztéseket a professzionális környezetekre szabott képzéssel ötvözi, hogy segítsen megbirkózni az összetett munkafeladatokkal. Az összetett problémákhoz szükséges intelligenciát ötvözi a többlépéses munkafolyamatok végrehajtásának, valamint a kifinomult dokumentumok, táblázatok és prezentációk készítésének képességével.

A GPT‑6 Astra a legjobb modellünk a meglévő sablonok követésére és a jól elrendezett diák létrehozására, amelyek tömören és strukturált narratívával közvetítik a kulcsfontosságú pontokat. Világos, jól strukturált dokumentumokat, prezentációkat, táblázatokat és elemzéseket készít, amelyek követik a sablonjaidat, és illeszkednek az írásbeli és vizuális stílusodhoz. Az Astrát kifejezetten arra is betanították, hogy csak a releváns kontextust emelje be a kimenetekbe, ahelyett hogy az aktuális feladathoz szükségtelen információkat ismételne meg. Mindez azt jelenti, hogy közvetlenebbül felhasználható eredménytermékeket tud előállítani, amelyek illeszkednek az üzleti környezetedhez és szabványaidhoz.

A GPT‑6 Astra fejlettebb vizuális ítélőképességet is biztosít az általa létrehozott webhelyekhez, játékokhoz, alkalmazásokhoz és renderelésekhez. A ChatGPT Webhelyek⁠(új ablakban nyílik meg) funkciójával az Astra közvetlenül egy utasításból hozhat létre, hosztolhat és oszthat meg webhelyeket, webalkalmazásokat és játékokat.

„Az Astra jelentős előnyt biztosít számunkra mind a képességek, mind a hatékonyság terén. Sikeresen végrehajtja a legösszetettebb kreatív munkafolyamatainkat, miközben akár 20%-kal kevesebb tokent használ, mint más általunk tesztelt modellek. Ami pedig a legfontosabb: ügyfeleink számára ez jobb minőségű kimenetet jelent.”
Alex Mashrabov, a Higgsfield AI vezérigazgatója és társalapítója

Amikor az utasítások értelmezési lehetőségeket hagynak, a GPT‑6 Astra jobban teljesít a korábbi modelleknél a helyes döntés meghozatalában. A kontextus alapján pótolja a rutinszerű hiányosságokat, és célzott kérdéseket tesz fel, ha a válasz megváltoztathatja a végeredményt. A Codexben aszinkron módon tehet fel kérdéseket, miközben tovább dolgozik azokon a feladatokon, amelyek nem függnek a válaszodtól. Ha nem válaszolsz, ahol indokolt, észszerű feltételezésekkel halad tovább, de a jelentős következményekkel járó döntéseknél megvárja a visszajelzésedet.

Az alábbi példák azt mutatják be, hogyan működik együtt az Astra a mindennapi feladatok során, ahol a hiányzó információk lényegesen megváltoztathatják a választ.

Az Astra emellett jobban összpontosít a célra, ahogy a feladat alakul. A korábbi modellek olykor új célként kezelték az irányító üzeneteket, és szem elől tévesztették az eredeti kérést vagy a korábbi megkötéseket. Az Astra beépíti az új követelményeket, kérésre irányt vált, és megválaszolja a mellékkérdéseket anélkül, hogy szem elől tévesztené a tágabb feladatot.

„Az Astra jelentős minőségi javulást jelent a GPT‑5.6 Solhoz képest az összetett jogi feladatok terén. Kezdeti tesztelésünk során az Astra azzal tűnt ki, hogy úgy közelítette meg a jogi munkát, ahogyan egy körültekintő ügyvéd tenné: megkülönbözteti a dokumentumokat a hivatalos nyilvántartásoktól, felszínre hozza az alá nem támasztott feltételezéseket, és a hiányosságokat konkrét szövegezési álláspontokká alakítja.”
Niko Grupen, az alkalmazott kutatások vezetője, Harvey

Kódolás

A GPT‑6 Astra az eddigi legjobb modell a szoftverfejlesztési feladatokhoz.

1 / 2
„A GPT‑6 Astra a legjobb eredményt nyújtja a belső kódolási méréseinken, és a kereskedési érzékre vonatkozó értékeléseken egyértelmű előrelépést mutat a GPT‑5.6 Solhoz képest. Ügynökalapú programozásra használva a GPT‑6 Astra a fejlesztők számára könnyebben követhető módon kommunikál, és olyan kódot készít, amelynek kevesebb iterációra van szüksége ahhoz, hogy éles környezetben használható minőséget érjen el.”
John Crepezzi, AI-asszisztensek, Jane Street

Az Astrával új módszert vezetünk be arra, hogy a Codex megőrizze és visszakeresse a kontextust, amikor a kontextusablak megtelik. A modellek korábban kontextusmegőrzést használtak a munka összefoglalására hosszú munkamenetek során, például összetett problémák hibakeresésekor vagy nagy átalakítások elvégzésekor. Minden tömörítés kihagyhat részleteket arról, hogy miért hiúsult meg egy javítás, vagy hogyan viselkedik egy komponens. A Codexben az Astra több kontextuális ablakban is tárolhat jegyzeteket, megőrizve a felhalmozott részleteket anélkül, hogy azokat ismételten egyetlen összefoglalóba tömörítené. A korábbi kontextuális ablakok továbbra is kereshetők, így az Astra a korábbi üzenetekből és eszközkimenetekből származó követelményeket vagy teszteredményeket is megtalálhatja – még akkor is, ha ezek az információk nem szerepeltek a jegyzetekben. Ezt a kísérleti funkciót a Codex config.toml⁠(új ablakban nyílik meg) fájljában engedélyezheted, és a következő hetekben ez lesz az Astra alapértelmezett beállítása.

A tudományos felfedezés előmozdítása

„A történet röviden: egy korszak vége, egy másik kezdete.”
Greg Burnham, EpochAI

A GPT‑6 Astra jelentős előrelépést jelent a tudományos felfedezések, a matematika és az egészségügy terén. Ma két további eredményt osztunk meg a prímszámok közötti hézagokról.9 és 10

Az Astra emellett új rekordokat állít fel több matematikai és természettudományos értékelésben is.

Az Astra segíthet a tudományos felfedezések mögött álló gyakorlati munkában. A tudományos érvelést a számítógép-használattal ötvözve közvetlenül dolgozhat speciális szoftverekben az adatok vizsgálata és az eredmények feltárása érdekében, segítve a kutatókat a bizonyítékok értékelésében és annak eldöntésében, mit vizsgáljanak meg legközelebb.

Kiberbiztonság

Ahogyan azt a biztonsági frissítésünkben⁠ is tárgyaltuk, az Astra jelentős előrelépést jelent a kiberbiztonsági képességek terén, és a kritikus küszöböt is eléri a kiberbiztonságban a Felkészültségi keretrendszerünk szerint. A nulladik napi támadások azonosításának és fejlesztésének képessége segíthet a védőknek a gyengeségek megkeresésében és befoltozásában, de egyben erősebb védelmi intézkedések iránti igényt is teremt. Hogy megértsük, meddig terjednek ezek a képességek, belső és harmadik féltől származó szakértői értékeléseken teszteltük az Astrát.

Először az ExploitBench és az ExploitGym szoftvereken teszteltük a modellt éles biztonsági rés nélkül, amelyek azt vizsgálják, hogy a modellek képesek-e az ismert szoftveres sebezhetőségeket működő támadásokká alakítani. Az ExploitBench teszten az Astra tökéletes, 100%-os eredményt ért el, szemben a korábbi élvonalbeli, kiberképességekkel rendelkező modellünk, a GPT‑5.6 Sol 78,5%-os eredményével. Az ExploitGym platformon az Astra 42,4%-os sikerességi arányt ért el, szemben a GPT‑5.6 Sol 30,3%-os eredményével, miközben lényegesen kevesebb kimeneti tokent használt fel.13

Tekintettel azokra azokra az aggályokra, hogy a korábbi szoftversérülékenységeknek való kitettség befolyásolhatta a benchmarkeredményeket, az Astrát két új benchmark alapján is kiértékeltük. Egyrészt létrehoztunk egy belső „ExploitBench (2026. június–augusztus)” értékelést, hogy az előző három hónap sebezhetőségeit felhasználva teszteljük a kihasználások fejlesztését.14 Az Astra lényegesen magasabb tetszőleges kódvégrehajtási arányt ért el, mint a GPT‑5.6 Sol ezen az adathalmazon, sokkal kevesebb kimeneti token használatával. Az értékelés során az Astra még két korábban ismeretlen nulladik napi sérülékenységet is felfedezett és kihasznált. Mindkét sebezhetőséget jelentjük a karbantartóknak.

Az Astrát az SRE-Bench mérőrendszeren is teszteltük15, amely azt vizsgálja, hogy a modellek képesek-e a szoftverek bináris adatainak visszafejtésére, azaz azok alapvető működési logikájának feltárására a nyers forráskód ismerete nélkül. Az Astra a feladatok 88,0%-át egyetlen próbálkozással, 99,2%-át pedig négy próbálkozáson belül oldotta meg, szemben a GPT‑5.6 Sol 55,9%-os, illetve 68,7%-os eredményeivel.

A benchmarkokon túl a szakértők által vezetett értékelések megállapították, hogy az Astra éles környezetben alkalmazott védelmi mechanizmusok nélkül futtatva korábban ismeretlen sebezhetőségeket tudott felhasználni tetszőleges kód végrehajtására megerősített böngészőkben, valamint jogosultságszint-emelési kihasználásokat tudott létrehozni megerősített operációs rendszerekhez.

Ahogyan azt A védők ablaka című anyagban is tárgyaltuk, az élvonalbeli kiberbiztonsági képességek segíthetnek a védőknek gyorsabban feltárni a gyenge pontokat, ugyanakkor megkönnyítik e gyenge pontok kihasználását is, ami még sürgetőbbé teszi, hogy a védők alkalmazkodjanak. Az Astra ma megjelenő verziójával a védelmi szakemberek olyan feladatokat végezhetnek el, mint a biztonsági kódellenőrzés és a javítások alkalmazása.

Az Astra azonban megtagadja a fejlettebb kiberbiztonsági feladatok elvégzését, például a sebezhetőségek kipróbálására szolgáló koncepcióbizonyítási megoldások létrehozását. Az OpenAI Daybreak⁠ keretében a következő hetekben tervezzük a hozzáférés bővítését és a kevésbé korlátozó biztonsági intézkedések bevezetését. Ez további védelmi munkafolyamatokat tesz lehetővé, például a sérülékenységek és a koncepciót igazoló kódok ellenőrzését, a kártékony programok elemzését, valamint az észlelési szabályok fejlesztését.

Megerősítettük a potenciális kibervisszaélésekkel szembeni védelmeinket is, építve a GPT‑5.6 Sol-ra vonatkozó védelmi rendszerünkre. Ezek közé tartozik a modell fokozott ellenálló képessége, hogy jobban ellenálljon a lehetséges jailbreakeknek, valamint több kontextus a megfigyelőrendszereink számára. Folytattuk a szigorú belső és külső tesztelést, beleértve a belső támadásszimulációt végző támadóinkkal végzett automatizált értékeléseket is. Kiberbiztonsági védelmi intézkedéseinkről és tesztelésünkről további részletek az Astra biztonsági áttekintésében⁠ és rendszerkártyájában⁠(új ablakban nyílik meg) érhetők el.

A GPT‑6 Astra felelősségteljes összehangolása és bevezetése

Az Astra a legjobban összehangolt modellünk. Az Astra kiemelkedően jól teljesít abban, hogy körültekintően jár el, tiszteletben tartja a feladat kereteit, és átláthatóan kommunikál. Ez a munka hosszú távú kutatási programunk legújabb eredménye, amely olyan modellek betanítására összpontosít, amelyek az elejétől a végéig összhangban maradnak az emberi szándékkal.

Érzékeny környezetben az Astra a kockázattal arányos gondossággal jár el. A helytelen viselkedés kiváltására ellenségesen kiválasztott számítógép-használati feladatok értékelése során az Astra sikeresebbnek bizonyult a nem kívánt következmények elkerülésében. Az alapértelmezés szerint felkínált kiegészítő biztonsági intézkedésekkel való futtatás még jobb teljesítményt eredményezett.

Az Astra kevesebb hibás eredményt okoz, mint bármely más tesztelt határmodell. A tisztességes összehasonlítás érdekében általános célú, számítógépet kezelő ügynöki keretrendszert használtunk (amely a beépített számítógép-kezelő eszközökre épül, és mind az OpenAI Responses API⁠(új ablakban nyílik meg), mind az Anthropic Messages API⁠(új ablakban nyílik meg) kínálja), azon kiegészítő védelmi megoldások nélkül, amelyeket a Codex és a ChatGPT Work felhasználóinál rendszerint alkalmazunk (automatikus felülvizsgálat, megerősítési szabályzat).

Az Astra emellett nagyobb valószínűséggel működik a felhasználó által meghatározott és a környezete által sugallt határokon belül. Egy belső értékelésben az Astra egyszer sem próbálta megkerülni a Codex automatikus felülvizsgálatának elutasító döntését. Ez még akkor is igaz volt, amikor az automatikus felülvizsgálatot szándékosan úgy állították be, hogy megkerülhető legyen, és a feladatot másképp lehetetlen volt elvégezni. A környezeti korlátozások ilyen tiszteletben tartása összhangban van a bejegyzés bevezetőjében megosztott, megoldhatatlan kiberbiztonsági feladatokat vizsgáló értékelésünk eredményeivel, valamint a rendszerkártyánkban⁠(új ablakban nyílik meg) dokumentált egyéb megállapításokkal.

Az Astra emellett új mércét állít az átlátható felhasználói kommunikáció terén. Egy értékelésben az Astra esetében háromszor kisebb a valószínűség, mint a GPT‑5.6 esetében Sol pontatlan állításokat tegyen a képességeiről és lehetőségeiről.

A képességekkel kapcsolatos hallucinációkat vizsgáló értékelésünkben az Astra jelentős javulást mutat a GPT‑5.6 Solhoz képest, és kevesebb félrevezető állítást tesz a saját képességeiről.

Értékeléseink szerint Astra írásban megjelenő érvelését nehezebb monitorozni, mint a GPT‑5.6 Solét, olyan tesztek alapján, amelyekben kifejezetten arra kérték, hogy kerülje ki a monitorozást. Ezt annak tulajdonítjuk, hogy Astra egyszerűbb feladatoknál nagyobb kontrollt gyakorol az írásban megjelenő érvelése felett, és kevesebb leírt lépéssel képes problémákat megoldani. Az Astra továbbra is nehezen tudja elrejteni az összetett feladatokhoz szükséges érvelést, de komolyan vesszük ezt a visszaesést. A monitorozhatóság javítása továbbra is kutatási prioritás, a mellékelt rendszerkártya⁠(új ablakban nyílik meg) pedig részletezi megállapításainkat és folyamatban lévő munkánkat.

Az összehangolási képzés központi eleme a bevezetési megközelítésünknek. A védelem további rétegeként rendszerszintű biztonsági intézkedéseket is kidolgozunk, például a Codex automatikus felülvizsgálatát⁠(új ablakban nyílik meg), valamint az ügynökök érvelésének és műveleteinek monitorozását, hogy segítsünk észlelni és megfékezni a nem biztonságos viselkedést. Ahogy a biztonsági frissítésünkben⁠ leírtuk, az Astra kategóriájába tartozó modelleknél éles környezetben is bevezetjük az összehangolatlanság felügyeletét, hogy rálátásunk legyen az összehangolatlanságra, és segítsünk megfékezni annak legsúlyosabb eseteit. Ezek a védelmi intézkedések a belső bevezetések felügyeletéhez hasonlítanak: osztályozók rendszere vizsgálja, hogy a modell érvelése és műveletei mutatnak-e jogosulatlan viselkedést, és automatikusan leállítja a potenciálisan jogosulatlan tevékenységet.

Tekintettel az Astra kiberbiztonsági képességeinek jelentős növekedésére, különösen körültekintően járunk el annak érdekében, hogy ez a bevezetés biztonságos és védett legyen. A további biztonsági ellenőrzések időnként lelassíthatják, szüneteltethetik vagy leállíthatják a jogszerű tevékenységeket, beleértve a védekező kiberbiztonsági tevékenységeket is. Ha egy feladat szünetel a ChatGPT‑ben vagy a Codexben, a folytatás előtt a rendszer kérheti a művelet felülvizsgálatát. Az API-ban a feladat leáll. Ezek az ellenőrzések időnként megszakíthatják a legitim munkavégzést, és tovább finomítjuk ezt a rendszert, hogy csökkentsük a szükségtelen megszakítások számát. Az összehangolatlan felügyelet nem helyettesítheti az összehangolást: célunk olyan modellek fejlesztése, amelyek megbízhatóan az engedélyezett hatókörükön belül maradnak, így ezeknek a védelmi intézkedéseknek nem kell beavatkozniuk.

Elérhetőség

A GPT‑6 Astra bevezetése ma kezdődik, egyelőre szervezetek szűk körében, a következő napokban pedig valamennyi ChatGPT Plus-, Pro-, Business- és Enterprise-felhasználó számára elérhetővé válik, valamint az OpenAI API-n, a Microsoft Azure-on és az AWS Bedrockon keresztül is használható lesz. Az Astra használata a meglévő előfizetési keretek részét képezi, a felhasználók és a vállalkozások pedig további használathoz krediteket is vásárolhatnak. A Pro-, Business- és Enterprise-csomagok felhasználói a GPT‑6 Astra Pro modellhez is hozzáférést kapnak. Az Enterprise rendszergazdái engedélyezhetik az Astrát a munkaterületükön; a hozzáférés induláskor alapértelmezés szerint ki van kapcsolva.

Az Astra támogatja a jogosult API-ügyfelek zéró adatmegőrzését, és ahogy azt a múlt hónapban megosztottuk, teszteljük a privát biztonsági feldolgozást, hogy az ügyfelek adatainak védelme mellett erősítsük a biztonsági felügyeletet.

A fejlesztők számára a GPT‑6 Astra az OpenAI API-ban gpt-6-astranéven, valamint a Microsoft Azure-on és az Amazon Bedrockon keresztül lesz elérhető.

Az OpenAI API Standard díjszabása 10 USD egymillió bemeneti tokenenként és 50 USD egymillió kimeneti tokenenként. Külön díjszabás vonatkozik a gyorsítótár-olvasási és -írási műveleteire. A Gyors mód a GPT‑6 Astra esetében az API-ban érhető el, és a Standard feldolgozás sebességének akár 2-szeresét nyújtja a Standard árának kétszereséért.

Számítógép-használat

Számítógép-használat

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Az ágensek utolsó vizsgája

59,3%

53,6%

-

48,7%

55,5%

-

OSWorld 2.0 (v2026.08.08, offline részhalmaz, részleges pontszám)

72,6%

65,7%

-

-

70,2%3

-

ScreenSpot-Pro (eszközök nélkül)

92,7%

76,9%

-

87,3%17

-

-

Professzionális

Professzionális

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4%

18,1%

31,4%

17,4%

26,9%

-

BenchCAD

95,9%

83,3%

84,3% 5

67,5% 5

82,1% 5

-

BrowseComp

91,5%

90,4%

-

87,4%

90,8%

-

OpenScore String Quartets (1 - OMR-NED)

0,84

0,19

-

-

-

-

Tervezési feladatok (belső)

50,0%

47,4%

-

35,8%

-

-

Belső adattudományi feladatok

40,9%

30,5%

-

34,7%

-

-

Artificial Analysis mesterséges intelligencia-index v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Kódolás

KódolásGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (pontszám)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (pontszám)53.3% 847.5%50.9%53.5%53.4%43.6%
Belső adatbázis-migrációs feladatok63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Tudományos

Tudományos

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6%

22,4%

52,6%

21,4%

30,0%

-

FrontierMath 4. szint (v2)

97,6%

83.0%

87,8%

90,2%

73,2%

-

GPQA Diamond

96,0%

94,6%

93,7%

92,6%

93,7%

95,3%

Humanity's Last Exam (eszközökkel)

57,2%

-

65,0%

63,8%

63,6%

-

Tudomány és egészség

Tudomány és ChatGPT EgészségGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (belső)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (hosszra korrigált)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

Kiberbiztonság

KiberbiztonságGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (2026. június–augusztus)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

Igazítás

Igazítás

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Belső számítógép-használati biztonsági referenciaérték (minél alacsonyabb, annál jobb)

2,4%

22,0%

9,5%

18,3%

11,5%

-

Belső számítógép-használati biztonsági referenciaérték, automatikus felülvizsgálattal (minél alacsonyabb, annál jobb)

1,8%

4,3%

-

-

-

-

Belső megkerülési referenciaérték (minél alacsonyabb, annál jobb)

0,00%

0,29%

-

-

-

-

ExploitGym honeypot (minél alacsonyabb, annál jobb)

0,0%

48,2%

-

-

-

-

Impossible ExploitGym

100,0%

-

-

-

-

-

Belső hallucinációs referenciaérték (minél alacsonyabb, annál jobb)

4,2%

12,2%

-

-

-

-

Hosszú kontextus

Hosszú kontextus

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96,3%

73,8%

-

-

-

-

Absztrakt indoklás

Absztrakt érvelésGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

Az értékelési pontszámok bármilyen erőfeszítés mellett maximálisak. A GPT‑kiértékeléseket kutatási környezetünkben vagy az API-nkon keresztül futtattunk, ami a rendszerutasítások, a rendelkezésre álló eszközök stb. eltérései miatt bizonyos esetekben kissé eltérő kimenetet eredményezhet a ChatGPT éles verziójához képest.

LÁBJEGYZETEK

  1. 1

    Az ARC-AGI-3 szerveren a GPT-6 Astra a responses API hardverünkkel⁠ futott, amely két beállítást módosít a valós teljesítménynek való jobb megfelelés érdekében. A módosítások nem kifejezetten az ARC-AGI-3-at célozzák.

  2. 2

    A GPT-5.6 Sol az API-nkban, a ChatGPT Codexben és a ChatGPT Workben elérhető változatot jelöli. A ChatGPT Chatben elérhető változat némileg eltérő.⁠

  3. 3

    Az OSWorld V2-Offline az eredeti OSWorld V2 egy részhalmaza, amely internet-hozzáférés nélkül működik. A Claude modell OSWorld-V2 Offline-on nyújtott teljesítményét a szerzők a hivatalos ranglistán⁠(új ablakban nyílik meg) reprodukálták. Az OSWorld 2.0-n a Claude pontszámai a hivatalos beállításokon alapulnak, nem pedig a Fable 5.1 rendszerkártyájában szereplő módosított feladatokon és módosított értékelésen.

  4. 4

    A modellidők a megfelelő demonstrációs futtatásokhoz jelentett eltelt idők. A megjelenített klipek szerkesztett részletek.

  5. 5

    A BenchCAD esetében Claude pontszámai az értékelés három módosítását tükrözik, amelyeket a Fable 5.1 rendszerkártya⁠(új ablakban nyílik meg) részletez.

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon és Noah A. Smith. „LEGATO: Nagyléptékű, végponttól végpontig általánosítható megközelítés a betűkészletes OMR-hez⁠(új ablakban nyílik meg).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower és Peter Jonas. „The OpenScore String Quartet Corpus⁠(új ablakban nyílik meg).” A 10. nemzetközi konferencia a zenetudományi digitális könyvtárakról konferenciakötete, 49–57. oldal ACM, 2023.

  8. 8

    A FrontierCode-on a GPT-6 Astra egy olyan fejlesztői üzenettel futott, amely hasonló volt a Codex-ben található fejlesztői üzenet egy részéhez⁠(új ablakban nyílik meg): "Kerülje a túlzott tesztfájlok létrehozását. Csak akkor hozzon létre új tesztfájlt, ha azt az adattár konvenciói megkövetelik, vagy ha nincs megfelelő meglévő fájl erre a célra. Kerülje a témához nem kapcsolódó kódtisztítást és a szükségtelen bonyolultságot. Használja újra a megfelelő meglévő segédprogramokat. Olvassa el a releváns adattári utasításokat, és vizsgálja meg a közeli kódot, teszteket, dokumentációt és CI-t. Tartsa be az elfogadott konvenciókat. A cél a tiszta, összefésülhető kód." Az utasítás nem lett optimalizálva az értékeléshez.

  9. 9

    Az első azt vizsgálja, hogy milyen közel fordulhatnak elő egymáshoz prímszámok, akármilyen távolra haladunk is a számegyenesen. Több mint egy évtizeden át a legjobb ismert eredmény az volt, hogy végtelen sok olyan prímszámpár létezik, amelyek különbsége legfeljebb 246. Julia Stadlmann⁠(új ablakban nyílik meg) nemrég 240-re javította ezt a korlátot. Az Astra segített egy erősebb, 186-os határ megállapításában, ami azt mutatja, hogy végtelen sok pár fordul elő ezen a kisebb távolságon belül. Rövid prímhézagok: Bizonyítás⁠(új ablakban nyílik meg) és alátámasztó kutatás⁠(új ablakban nyílik meg).

  10. 10

    A második a prímszámok közötti szokatlanul nagy hézagokra vonatkozik. Astra javított az e hézagokra vonatkozó korlát egyik olyan tagján, amely több mint 80 éven át változatlan volt. Megosztjuk mindkét eredmény bizonyításait, rövidített gondolatmenetét és ellenőrző anyagait. Nagy prímhézagok: Bizonyítás⁠(új ablakban nyílik meg) és alátámasztó kutatások⁠(új ablakban nyílik meg).

  11. 11

    Az összes Claude modellt egymástól függetlenül értékeltük a HealthBench Professional előírt eljárását követve, GPT‑5.4 értékelés segítségével, valamint hosszúság alapján korrigált, nem csonkolt pontszámokat használva. A Fable 5.1 esetében az Opus 5-öt használtuk tartalék megoldásként szolgáltatói elutasítások esetén.

  12. 12

    A Claude Fable 5 és 5.1 nem szerepel a LifeSciBench Gold v1, a GeneBench Pro v13 és a MedChemBench mérésekben, mert ezekben az értékelésekben a kérdések többségére megtagadják a választ.

  13. 13

    Az ExploitGymen az Astrát és a Solt a 6 órás időkorlát nélkül teszteltük, hogy jobban felmérhessük teljes kiberképességeiket. Elég gyorsak ahhoz, hogy ennek csekély hatása legyen.

  14. 14

    Az ExploitBench (2026. június–augusztus) 20 erős súlyosságú V8-sebezhetőséget tartalmaz összesen 13 stabil Chrome-kiadásban. A teljesítményteszt azt teszteli, hogy az ágensek képesek-e tetszőleges kódfuttatást elérni a V8-ban és a hivatalos, Linuxra készült Chrome-kiadásokban az egyes megadott sérülékenységek kihasználásával. Előfordulhat, hogy a bevont sérülékenységek némelyike az értékelés korlátai között nem teszi lehetővé a tetszőleges kódfuttatást, ezért előfordulhat, hogy a 100%-os sikerességi arány nem érhető el. Megjegyzés: a GPT-5.6 Sol 5,5%-os pontszáma a benchmark 300 fordulós korlátjának mellékhatása, amely a Max használó valódi ügyfelekre nem vonatkozna. A modell hasonló beállítások mellett 11,5%-os pontszámot ért el, amikor kevesebb korlátozásba ütközött.

  15. 15
  16. Amikor harmadik féltől származó modelleken tesztelünk, egyszerűbb kutatási beállítást használunk. A Codex összetettebb éles konfigurációval rendelkezik, ami eltérő nyers modellhibaarányokat eredményezhet. A szolgáltatói oldali védelmi intézkedések és a számítógépes eszközök implementációja továbbra is eltérő. A felhasználók nem tapasztalják a megerősítés nélküli forgatókönyvet a Codexben, mivel ez egy belső kutatási konfiguráció.[[lábjegyzet:16]]

  17. A ScreenSpot-Pro és az ExploitGym esetében a jelentett Fable-pontszámok a Mythosból származnak, amely a kevesebb biztonsági résszel rendelkező Fable.[[lábjegyzet:17]]