Ugrás a fő tartalomra
OpenAI

GPT-6.1Sol

Near-Astra intelligence for a fifth of the price

Bemutatjuk a GPT‑6.1 Sol modellt, a GPT‑6 Sol továbbfejlesztett változatát, amely kiemelkedően teljesít az ügynökalapú programozásban, valamint a számítógép-használatban és a szakmai munkában. Az összetett feladatoknál közelebb hozza a Sol teljesítményét a GPT‑6 Astráéhoz, az Astra normál bemeneti és kimeneti tokenárainak ötödéért. Így a fejlesztők ugyanakkora költségkeretből több lehetőséget kapnak nagy tudású ügynökök létrehozására és futtatására.

A GPT‑6.1 Sol az Astráét megközelítő teljesítményt nyújt a Sol árain, így a teljesítményéhez képest a ma elérhető legköltséghatékonyabb modell. A gyorsítótárazott bemenet ára mindössze 0,10 USD egymillió tokenenként, ami 95%-os kedvezmény a normál bemeneti árhoz képest. Ez megfizethetőbbé teszi azokat az ügynökalapú feladatokat, amelyeknél az ismételt kérések során újra fel kell használni a kontextust.

Összességében továbbra is a GPT‑6 Astra a legtöbbre képes élvonalbeli modellünk. A GPT‑6.1 Sol új egyensúlyt teremt a képességek és a költségek között: a felhasználók gyakrabban végezhetnek vele fontos munkákat, API-ügyfeleink pedig nagy léptékben fejleszthetnek és futtathatnak alkalmazásokat.

Három modellkártya: GPT-6 Astra, a legintelligensebb modellünk a legjobb eredményekhez; bemenet: 10 USD, kimenet: 50 USD, gyorsítótárazott bemenet: 1 USD. GPT-6.1 Sol, az Astráét megközelítő intelligencia ötödáron; bemenet: 2 USD, kimenet: 10 USD, gyorsítótárazott bemenet: 0,10 USD. GPT-6 Luna, gyors és hatékony mindennapi munkavégzés nagy léptékben; bemenet: 0,10 USD, kimenet: 0,50 USD, gyorsítótárazott bemenet: 0,01 USD.

Sokféle feladatban többre képes Sol

A GPT‑6.1 Sol jelentős előrelépést hoz a GPT‑6 Solhoz képest az összetett szakmai munkákban, a kódírástól és a hibakereséstől kezdve a dokumentumok értelmezésén át a többlépéses üzleti munkafolyamatok végrehajtásáig. E tesztek közül többön is megközelíti a GPT‑6 Astra teljesítményét, lényegesen alacsonyabb költséggel.

Programozás

A valós kódbázisokon végzett összetett szoftverfejlesztési feladatokat értékelő DeepSWE v1.1 teszten a GPT‑6.1 Sol nagyjából ötödakkora költséggel éri el a GPT‑6 Astra teljesítményét, miközben kisebb érvelési ráfordítással és alacsonyabb költséggel 6,4 százalékponttal múlja felül a GPT‑6 Sol legjobb eredményét.

A DeepSWE 1.1⁠⁠(új ablakban nyílik meg) tesztben az MI-ágensek eredeti, hosszan tartó munkát igénylő szoftverfejlesztési feladatokat oldanak meg.

Szakmai munka

A GDP.pdf azt méri, hogy a modellek milyen pontosan válaszolnak szakmai kérdésekre összetett, táblázatokat, grafikonokat, ábrákat és apró betűs részleteket tartalmazó PDF-dokumentumok alapján. Ezen a teszten a GPT‑6.1 Sol a vizsgált érvelési beállítások mellett jobb eredményt ér el, mint a tartalékmegoldásokat használó Opus 5.5, kevesebb mint feleakkora feladatonkénti költséggel. Emellett a GPT‑6 Astra csúcsteljesítményét is megközelíti, nagyjából ötödakkora feladatonkénti költséggel.

A GDP.pdf⁠(új ablakban nyílik meg) tesztben a modelleknek a pénzügy, az egészségügy, a jog és hét másik szakterület munkafolyamataiból származó összetett PDF-dokumentumokkal kapcsolatos, valós felhasználói kérésekre kell válaszolniuk.

Az AutomationBench azt méri, hogy az ügynökök helyesen hajtják-e végre a többlépéses üzleti munkafolyamatokat. Ezen a teszten a GPT‑6.1 Sol közepes érvelési ráfordítás mellett 2,2 százalékponttal jobb eredményt ér el az Opus 5.5-nél, nagyjából harmadakkora költséggel. Ez az eredmény a GPT‑6 Sol azonos beállítás melletti eredményét is felülmúlja 4,8 százalékponttal.

In AutomationBench 1.0.6⁠⁠(új ablakban nyílik meg), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Számítógép-használat

A GPT‑6.1 Sol jelentős előrelépést hoz a számítógépes alkalmazások kezelését igénylő feladatokban is. Az OSWorld 2.0 offline feladatsorán, amely összetett számítógépes munkafolyamatokon értékeli az ügynököket, a GPT‑6.1 Sol maximális érvelési ráfordítás mellett hét százalékponttal múlja felül a GPT‑6 Sol eredményét, kevesebb mint feleakkora költséggel. Maximális érvelési ráfordítás mellett mindössze 2,1 százalékponttal marad el az Astra eredményétől, nagyjából hetedakkora feladatonkénti költséggel.

In OSWorld 2.0⁠⁠(új ablakban nyílik meg), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Tudományos kutatás

A tudományos munkafolyamatokat, köztük az adatelemzést, a szimulációt és a tételbizonyítást értékelő Terminal-Bench Science 0.1 teszten a GPT‑6.1 Sol maximális érvelési ráfordítás mellett több mint kétszeresét éri el a GPT‑6 Sol pontszámának, kevesebb mint feleakkora feladatonkénti költséggel. Maximális ráfordítás mellett a GPT‑6.1 Sol feladatonként átlagosan 5,47 USD-be kerül, szemben az Opus 5.5 23,21 USD-s és az Astra 23,80 USD-s költségével. Így jelentős tudományos képességeket kínál mindkét modellnél több mint 75%-kal alacsonyabb költséggel.

A tesztelt modellek közül továbbra is a GPT‑6 Astra éri el a legjobb eredményt, 68,1%-ot, és a legnehezebb tudományos kutatási feladatokhoz ezt érdemes használni.

A Terminal-Bench Science 0.1⁠(új ablakban nyílik meg) tesztben az ágensek kód és termináleszközök segítségével végeznek tudományos kutatási munkafolyamatokat, többek között adatokat elemeznek, szimulációkat futtatnak és modelleket illesztenek.

Tényszerűség

A GPT‑6.1 Sol a nehéz promptokra adott válaszok tényszerűségében is előrelépést hoz. Extra erős érvelési ráfordítás mellett a ténybeli hibáinak aránya 4,1%, szemben a GPT‑6 Sol 4,5%-ával. Ezzel közelebb kerül az Astra azonos beállítás mellett elért 4,0%-ához, miközben a feladatonkénti költsége körülbelül 83%-kal alacsonyabb az Astráénál.

Ez a teszt a legalább egy ténybeli hibát tartalmazó válaszok arányát méri olyan, azonosító adatoktól megtisztított beszélgetéseken, amelyekben a felhasználók egy korábbi modell hibáját jelezték. Ezek a szándékosan nehéz promptok nem reprezentálják a szokásos használatot.

A tényszerűséget olyan, azonosító adatoktól megtisztított ChatGPT‑beszélgetéseken értékeljük, amelyekben a felhasználók egy korábbi modell ténybeli hibáját jelezték. Ezek a hibát előidéző beszélgetések nem reprezentálják a szokásos használatot, amelyben ritkábban fordulnak elő ténybeli hibák.

A GPT‑6.1 Sol biztonságos bevezetése

Az emberi elvárásokhoz való igazodást vizsgáló tesztjeinken a GPT‑6.1 Sol jelentősen javult a GPT‑6 Solhoz képest, és közelebb került a GPT‑6 Astrához.

A GPT‑6.1 Sol nyíltabban jelzi a korlátait, és megbízhatóbban tartja tiszteletben a felhasználói szándékot és a biztonsági korlátokat. A nehéz teszteken a GPT‑6 Solnál ritkábban hibázik a nem működő keresőeszközök jelzésében, a kifejezett korlátozások betartásában és az ügynökalapú feladatok során a nem engedélyezett eredmények elkerülésében. Nem figyeltünk meg kísérletet az automatizált biztonsági ellenőrző rendszer megkerülésére, ahogyan a GPT‑6 Astra és a GPT‑6 Sol esetében sem.

Az alábbi tesztek szándékosan nehéz helyzeteket vizsgálnak, és nem a szokásos használat során előforduló hibák arányát mérik.

Árak és elérhetőség

A GPT‑6.1 Sol mától minden Plus-, Pro-, Business-, Enterprise- és Edu-felhasználó számára elérhető a ChatGPT Work és a Codex felületén. Ezek a modellek a Chat módban még nem érhetők el. A fejlesztők az OpenAI API-n keresztül is elérhetik gpt-6.1-sol néven. Normál API-árai: egymillió bemeneti tokenenként 2 USD, egymillió gyorsítótárazott bemeneti tokenenként 0,10 USD, egymillió kimeneti tokenenként pedig 10 USD.

Ezzel együtt bevezetjük a GPT‑6 Astra Ultrafast modellt, a világ leggyorsabb élvonalbeli modelljét, amely akár 8-szor gyorsabb a GPT‑6 Astránál, valamint a GPT‑6.1 Sol Ultrafast modellt is. Ezek az API-ban, valamint a ChatGPT Work és a Codex felületén is elérhetők az új, legmagasabb használati keretet biztosító, havi 500 USD-s Pro csomagunk felhasználói számára. A GPT‑6.1 Sol Ultrafast révén a fejlesztők az Astráét megközelítő intelligenciát kaphatnak akár 8-szoros sebességgel, nagyjából a GPT‑6 Astra korábbi API-költségéért.

Szerző

OpenAI

A GPT tesztelését kutatási környezetünkben vagy az API-nkon keresztül végeztük. Ezek a rendszerpromptok, az elérhető eszközök, az érvelési ráfordítás és egyéb tényezők eltérései miatt kissé más válaszokat adhatnak, mint az éles ChatGPT. A versenytársak modelljeinek teszteredményei nyilvánosan elérhető jelentésekből származnak.