Bemutatkozik a GPT‑6 Sol és Luna
Még több mód az élvonalbeli intelligencia használatára a mindennapi munkában.
A hónap elején bemutattuk a GPT‑6 Astrát, a világ legintelligensebb és leginkább összehangolt modelljét. Bár a legnagyobb igényű és legfontosabb projektekhez továbbra is az Astra teljes tudására van szükség, a munka léptéke, üteme és költségkerete eltérő lehet.
Ezért a GPT‑6 világát a GPT‑6 Sollal és a GPT‑6 Lunával bővítjük. A GPT‑6 Astra az intelligencia új generációját hozta el – ezek a modellek a költséghatékonyság határait kitolva szélesebb körben teszik elérhetővé ennek előnyeit. A GPT‑6 Sol és Luna képzéséhez a GPT‑6 Astráéhoz hasonló módszereket használtunk, így az Astra professzionális munkában, tényszerűségben, kódolásban, számítógép-használatban és összehangoltságban elért élvonalbeli teljesítménye mögötti fejlesztések gyorsabb, kedvezőbb árú modellekben is megjelennek.
A GPT‑6 modellek a költség–intelligencia görbe egészén vezetnek: minden szinten kivételes képességeket kínálnak, az infrastruktúra pedig ezeket nagy léptékben is hatékonyan biztosítja. A gyorsítótárazás és a következtetés fejlesztéseinek köszönhetően alacsonyabb költséggel szolgálhatjuk ki ezeket a modelleket. A megtakarítást közvetlenül továbbadjuk a felhasználóknak és ügyfeleknek: a Sol és a Luna API-árait 50%-kal csökkentjük a GPT‑5.6 promóciós áraihoz képest. E fejlesztések együtt több hétköznapi feladatnál és alkalmazásban teszik praktikussá a fejlett MI nagy léptékű használatát.
Modell | Bemenet | Kimenet | Árcsökkentés |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50%-kal olcsóbb |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50%-kal olcsóbb |
Az árak 1 millió tokenre vonatkoznak.
A GPT‑6 Astra továbbra is minden szempontból a legjobb modellünk. Akkor válassza, ha a legjobb eredményeket és kompromisszumok nélküli élményt szeretne.
A GPT‑6 Sol és Luna intelligensebb és költséghatékonyabb változatát kínálja a már ismert és használt modelleknek, különösen az összetett munkák elvégzéséhez leghasznosabb képességek terén.
A GPT‑6 Sol nehéz munkafeladatokat is képes megoldani, miközben a magasabb használati korlátok és az alacsonyabb költség több teret ad az iterációnak. A hasonló árú versenytárs modelleknél nagyobb intelligenciát és jobb eredményeket kínál.
Az alkalmazásokon átívelő üzleti munkafolyamatokat vizsgáló AutomationBench teszten a GPT‑6 Sol extra erős ráfordítással az Opus 5 feladatonkénti költségének mindössze 9%-áért múlja felül a maximális ráfordítású Claude Opus 5-öt. Erős ráfordítás mellett a GPT‑6 Luna 5,4 százalékponttal teljesít jobban elődjénél, feladatonként 58%-kal alacsonyabb költséggel.
Az AutomationBench 1.0.6(új ablakban nyílik meg) teszten az MI-ügynököket teljes körű munkafolyamatokon vizsgálják 47 eszközzel, az értékesítés, a marketing, az üzemeltetés, az ügyféltámogatás, a pénzügy és a HR területén. A Claude Fable 5.1 adatpontja a ténylegesnél alacsonyabb költséget mutat, mert nem tartalmazza a feladatok mintegy 40%-ánál használt Opus 5 tartalékmodell költségét.
A GPT‑6 Sol jóval alacsonyabb költséggel a Claude Fable 5.1-et is felülmúlja, sőt az alacsony ráfordítású GPT‑6 Astránál is jobb.
Modell (és ráfordítás) | Pontszám | Feladatonkénti költség |
|---|---|---|
GPT‑6 Sol (extra erős) | 33,2% | $0,27 |
GPT‑6 Astra (alacsony) | 30,3% | a GPT‑6 Sol 3,9-szerese |
Claude Opus 5 (max) | 26,9% | a GPT‑6 Sol 11,1-szerese |
Claude Fable 5.1 Opus 5 tartalékmodellel (max) | 31,4% | a GPT‑6 Sol >8,9-szerese (a tartalékmodell költségét nem közölték) |
Az ügynököket összetett professzionális munkafolyamatokon értékelő Agents’ Last Exam teszten a maximális ráfordítású GPT‑6 Sol 56,4%-ot ér el. Ez meghaladja a Claude Opus 5 legjobb eredményét a vizsgálatban, miközben feladatonként 60%-kal kevesebbe kerül.
Az Agents’ Last Exam V1(új ablakban nyílik meg) teszten az MI-ügynököket hosszú időtávú, gazdaságilag értékes feladatokon értékelik 55 alágazatban, lefedve a számítógépen végzett professzionális munka legtöbb fontos területét.
Egy válasz hasznosságához elengedhetetlenek a helyes tények, ezért tovább dolgozunk a tényszerű megbízhatóság javításán. A felhasználók által modellhibásként megjelölt, anonimizált valós beszélgetésekre épülő belső tényszerűségi értékelésünkön a GPT‑6 Sol körülbelül feleannyi hibát vét, mint elődje. Megbízhatósága jóval alacsonyabb költség mellett közelít az Astráéhoz. A GPT‑6 Luna is jelentősen javult: nagyobb ráfordítási szinteken a GPT‑5.6 Sol teljesítményét nyújtja annak körülbelül századrészéért.
Itt olyan anonimizált ChatGPT‑beszélgetéseken értékeljük a tényszerűséget, amelyeknél a felhasználók egy korábbi modell tárgyi hibáját jelezték. Ezek a hibákat előidéző beszélgetések nem tükrözik a tipikus használatot, amelyben ritkábbak a tárgyi hibák. A pontszámokat nem korrigáltuk a hossz alapján, ugyanakkor a válaszok részletességét vizsgáló tesztjeink szinte semmilyen összefüggést nem mutattak a válaszhosszal.
Idén a kódoló ügynökök minden eddiginél összetettebb, nagyobb léptékű és hosszabb feladatok megoldásába kezdtek. Az OpenAI-nál a belső használat exponenciálisan nőtt. API-árakon számolva a napi tokenhasználat a kutatók mediánjánál meghaladta a 600 dollárt, a 90. percentilisbe tartozó kutatóknál pedig a 7000 dollárt (A kutatás felgyorsítása: betekintés az OpenAI működésébe). Ahogy a kódoló ügynökök egyre hosszabb és nagyobb igényű feladatokat vállalnak, a tartós használat költsége egyre fontosabbá válik. A GPT‑6 Sol és Luna erős kódolási teljesítményt párosít alacsonyabb API-árakkal. Így a fejlesztők többet iterálhatnak, a csapatok pedig bátrabban bízhatnak ambiciózusabb feladatokat a Codexre.
Azt vizsgáló FrontierCode teszten, hogy a kódoló ügynökök valós kódbázisokba beolvasztható módosításokat készítenek-e, a GPT‑6 Sol jelentősen felülmúlja a GPT‑5.6 Solt, és jóval alacsonyabb költséggel éri el az extra erős Claude Fable 5.1 szintjét.
A FrontierCode 1.1 Main(új ablakban nyílik meg) teszten az MI-ügynökök kódot írnak, amelyet nemcsak a helyesség, hanem a „beolvaszthatóság” alapján is értékelnek: például a tesztek minősége, a feladat kereteinek betartása, a kódstílus és a kódbázis szabványainak követése szerint.
A valós kódbázisok összetett szoftverfejlesztési feladatait vizsgáló DeepSWE v1.1 teszten a maximális ráfordítású GPT‑6 Sol 68,8%-ot ér el. Ez mindössze 1,1 százalékponttal marad el a Claude Fable 5 értékelésbeli legjobb, extra erős ráfordítással elért 69,9%-os eredményétől, miközben feladatonként körülbelül 80%-kal kevesebbe kerül.
A maximális ráfordítású GPT‑6 Luna 66,6%-ot ér el, ami összemérhető a közepes ráfordítású Claude Opus 5 és Fable 5 eredményével. Ezekben az összehasonlításokban a Luna feladatonként 93%-kal olcsóbb az Opus 5-nél és 96%-kal a Fable 5-nél.
A DeepSWE 1.1(új ablakban nyílik meg) teszten az MI-ügynökök eredeti, hosszú időtávú szoftverfejlesztési feladatokat oldanak meg.
Bár a GPT‑6 Astra továbbra is a világ legjobb számítógép-használati modellje, a GPT‑6 Sol és Luna elődeiknél költséghatékonyabb teljesítményt kínálnak. Az OSWorld 2.0 offline teszten az extra erős ráfordítású GPT‑6 Sol a közepes ráfordítású Claude Opus 5-höz hasonló eredményt ér el – 60,5%-ot a 60,3%-kal szemben –, feladatonként körülbelül 80%-kal alacsonyabb költséggel. A GPT‑6 Luna (max) felülmúlja a GPT‑5.6 Solt (közepes), annak tizedakkora költségéért.
Az OSWorld 2.0(új ablakban nyílik meg) teszten az MI-ügynökök hétköznapi és professzionális feladatokat egyaránt lefedő, hosszú időtávú számítógép-használati munkafolyamatokat próbálnak végrehajtani. A v2026.08.08-as kiadás offline készletén elért részpontszámot közöljük.
A GPT‑6 Astra továbbfejlesztett kommunikációs stílusát a Sol és Luna modellekbe is átültettük. Úgy véljük, ez különösen a műszaki és kódolási beszélgetésekben lesz érezhető. Világosabb megfogalmazásra, kevesebb szakzsargonra és szokatlan fordulatra, kevesebb csekély értékű részletre, valamint összességében kissé rövidebb, mégis tartalmas válaszokra számíthat.
Bár a stílus szubjektív, itt a GPT‑6 Sol válaszát részesítjük előnyben. Nem von le túl gyorsan következtetéseket, kevesebb időt tölt a kérdező számára valószínűleg nyilvánvaló részletek ismétlésével (például hogy a webhely négy oldalból áll), kevésbé homályosan fogalmaz (például „bento-hatás”, „átalakítás… e rendszer köré”), nyíltabban közli, mit ellenőrzött és mit nem, és nem oszt meg feleslegesen olyan megvalósítási részleteket, mint a képeszközének adott utasítás.
Az alacsonyabb tokenárak mellett abban is segítünk a GPT‑6‑ra építő fejlesztőknek, hogy többet takarítsanak meg az alkalmazásaik által újrahasznált kontextuson. Továbbfejlesztettük a GPT‑6 prompt-gyorsítótárazását, hogy alapértelmezés szerint magasabb legyen a gyorsítótár-találati arány. Így az ügynökök több kontextust használhatnak újra, gyorsabban válaszolhatnak, és 90%-os kedvezményt kaphatnak a gyorsítótárazott bemeneti tokenek olvasására.
A fejlesztők emellett többféleképpen mérhetik és optimalizálhatják a gyorsítótárazás teljesítményét:
Felügyelet és diagnosztika. A Prompt Caching Dashboard(új ablakban nyílik meg) megmutatja, mennyi bemenet kerül a gyorsítótárba, és ez hogyan változik az idő múlásával. A diagnosztikai eszköz(új ablakban nyílik meg) segít feltárni a kihagyott gyorsítótárazási lehetőségeket és a szükséges javításokat.
Az érvelési ráfordítás és az eszközök elérhetőségének módosítása a gyorsítótár megszakítása nélkül. Növelje az érvelési ráfordítást(új ablakban nyílik meg) a nehezebb feladatokhoz, vagy csökkentse az egyszerűbb további kérdésekhez, és az ügynök igényeinek változásával engedélyezze vagy tiltsa le az eszközöket(új ablakban nyílik meg). Mostantól mindkét vezérlő megőrzi a korábbi kontextust a gyorsítótárbeli újrafelhasználáshoz.
A gyorsítótárazandó előtagok optimalizálása. Az explicit töréspontokkal a fejlesztők választhatják ki, hol érjenek véget a gyorsítótárazott utasításelőtagok. Így a fejlesztők jobban szabályozhatják a gyorsítótár újrafelhasználását, és javíthatják a teljesítményt.
A GitHub beszámolója szerint az elmúlt hónapokban ezek a fejlesztések több milliárd, OpenAI-modelleknek küldött kérésben több mint 50%-kal csökkentették az új feldolgozást igénylő utasítástokenek arányát, így a Copilot gyorsabban válaszol.
A GPT‑6 Sol és Luna az Astrával – eddigi leginkább összehangolt modellünkkel – bevezetett összehangolási munkára épül. Összehangoltsági értékeléseinkben a Sol és a Luna is javulást mutat GPT‑5.6-os megfelelőjéhez képest, többek között ritkábban tesznek félrevezető állításokat kódolási munkájukról.
Az alábbi értékelések szándékosan nehéz helyzeteket vizsgálnak, és nem a tipikus használat hibaarányát mérik. A teljes eredményeket a rendszerkártyán(új ablakban nyílik meg) találja.
A GPT‑6 Sol és a GPT‑6 Luna mától elérhető a ChatGPT Work és a Codex szolgáltatásban minden Plus-, Pro-, Business-, Enterprise- és Edu-felhasználónak. A Free- és Go-felhasználók az asztali alkalmazásban férhetnek hozzá a GPT‑6 Lunához. Ezek a modellek a Chatben még nem érhetők el. Az OpenAI API-ban gpt-6-sol és gpt-6-luna néven érhetők el.
A szolgáltatás stabilitásának megőrzése érdekében a nap folyamán fokozatosan vezetjük be ezeket a modelleket a ChatGPT‑ben. Ha még nem látja az új modelleket a ChatGPT Work vagy a Codex szolgáltatásban, próbálja újra később.
A GPT értékeléseit kutatási környezetünkben vagy API-nkon keresztül végeztük. A rendszerutasítások, az elérhető eszközök és más eltérések miatt ezek kimenete kissé eltérhet az éles ChatGPT‑étől. A versenytárs modellek értékeléseit nyilvánosan hozzáférhető jelentésekből vettük át. Amikor a Claude Fable 5.1 eredményei nem álltak rendelkezésre, a Claude Fable 5 pontszámait közöltük.


