Ugrás a fő tartalomra
OpenAI

Bemutatkozik a GPT‑6 Sol és Luna

Még több mód az élvonalbeli intelligencia használatára a mindennapi munkában.

Betöltés…

A hónap elején bemutattuk a GPT‑6 Astrát, a világ legintelligensebb és leginkább összehangolt modelljét. Bár a legnagyobb igényű és legfontosabb projektekhez továbbra is az Astra teljes tudására van szükség, a munka léptéke, üteme és költségkerete eltérő lehet.

Ezért a GPT‑6 világát a GPT‑6 Sollal és a GPT‑6 Lunával bővítjük. A GPT‑6 Astra az intelligencia új generációját hozta el – ezek a modellek a költséghatékonyság határait kitolva szélesebb körben teszik elérhetővé ennek előnyeit. A GPT‑6 Sol és Luna képzéséhez a GPT‑6 Astráéhoz hasonló módszereket használtunk, így az Astra professzionális munkában, tényszerűségben, kódolásban, számítógép-használatban és összehangoltságban elért élvonalbeli teljesítménye mögötti fejlesztések gyorsabb, kedvezőbb árú modellekben is megjelennek.

A GPT‑6 modellek a költség–intelligencia görbe egészén vezetnek: minden szinten kivételes képességeket kínálnak, az infrastruktúra pedig ezeket nagy léptékben is hatékonyan biztosítja. A gyorsítótárazás és a következtetés fejlesztéseinek köszönhetően alacsonyabb költséggel szolgálhatjuk ki ezeket a modelleket. A megtakarítást közvetlenül továbbadjuk a felhasználóknak és ügyfeleknek: a Sol és a Luna API-árait 50%-kal csökkentjük a GPT‑5.6 promóciós áraihoz képest. E fejlesztések együtt több hétköznapi feladatnál és alkalmazásban teszik praktikussá a fejlett MI nagy léptékű használatát.

A GPT‑6 API-árazása

Modell

Bemenet

Kimenet

Árcsökkentés

GPT‑6 Sol
a GPT‑5.6 Solhoz képest

$4 → $2

$20 → $10

50%-kal olcsóbb

GPT‑6 Luna
a GPT‑5.6 Lunához képest

$0.20 → $0.10

$1.20 → $0.50

50%-kal olcsóbb

Az árak 1 millió tokenre vonatkoznak.

A GPT‑6 Astra továbbra is minden szempontból a legjobb modellünk. Akkor válassza, ha a legjobb eredményeket és kompromisszumok nélküli élményt szeretne.

Előrelépés a teljes modellcsaládban

A GPT‑6 Sol és Luna intelligensebb és költséghatékonyabb változatát kínálja a már ismert és használt modelleknek, különösen az összetett munkák elvégzéséhez leghasznosabb képességek terén.

Professzionális munka

A GPT‑6 Sol nehéz munkafeladatokat is képes megoldani, miközben a magasabb használati korlátok és az alacsonyabb költség több teret ad az iterációnak. A hasonló árú versenytárs modelleknél nagyobb intelligenciát és jobb eredményeket kínál.

Az alkalmazásokon átívelő üzleti munkafolyamatokat vizsgáló AutomationBench teszten a GPT‑6 Sol extra erős ráfordítással az Opus 5 feladatonkénti költségének mindössze 9%-áért múlja felül a maximális ráfordítású Claude Opus 5-öt. Erős ráfordítás mellett a GPT‑6 Luna 5,4 százalékponttal teljesít jobban elődjénél, feladatonként 58%-kal alacsonyabb költséggel.

Az AutomationBench 1.0.6⁠(új ablakban nyílik meg) teszten az MI-ügynököket teljes körű munkafolyamatokon vizsgálják 47 eszközzel, az értékesítés, a marketing, az üzemeltetés, az ügyféltámogatás, a pénzügy és a HR területén. A Claude Fable 5.1 adatpontja a ténylegesnél alacsonyabb költséget mutat, mert nem tartalmazza a feladatok mintegy 40%-ánál használt Opus 5 tartalékmodell költségét.

A GPT‑6 Sol jóval alacsonyabb költséggel a Claude Fable 5.1-et is felülmúlja, sőt az alacsony ráfordítású GPT‑6 Astránál is jobb.

Modell (és ráfordítás)

Pontszám

Feladatonkénti költség

GPT‑6 Sol (extra erős)

33,2%

$0,27

GPT‑6 Astra (alacsony)

30,3%

a GPT‑6 Sol 3,9-szerese

Claude Opus 5 (max)

26,9%

a GPT‑6 Sol 11,1-szerese

Claude Fable 5.1 Opus 5 tartalékmodellel (max)

31,4%

a GPT‑6 Sol >8,9-szerese

(a tartalékmodell költségét nem közölték)

Az ügynököket összetett professzionális munkafolyamatokon értékelő Agents’ Last Exam teszten a maximális ráfordítású GPT‑6 Sol 56,4%-ot ér el. Ez meghaladja a Claude Opus 5 legjobb eredményét a vizsgálatban, miközben feladatonként 60%-kal kevesebbe kerül.

Az Agents’ Last Exam V1⁠(új ablakban nyílik meg) teszten az MI-ügynököket hosszú időtávú, gazdaságilag értékes feladatokon értékelik 55 alágazatban, lefedve a számítógépen végzett professzionális munka legtöbb fontos területét.

Tényszerűség

Egy válasz hasznosságához elengedhetetlenek a helyes tények, ezért tovább dolgozunk a tényszerű megbízhatóság javításán. A felhasználók által modellhibásként megjelölt, anonimizált valós beszélgetésekre épülő belső tényszerűségi értékelésünkön a GPT‑6 Sol körülbelül feleannyi hibát vét, mint elődje. Megbízhatósága jóval alacsonyabb költség mellett közelít az Astráéhoz. A GPT‑6 Luna is jelentősen javult: nagyobb ráfordítási szinteken a GPT‑5.6 Sol teljesítményét nyújtja annak körülbelül századrészéért.

Itt olyan anonimizált ChatGPT‑beszélgetéseken értékeljük a tényszerűséget, amelyeknél a felhasználók egy korábbi modell tárgyi hibáját jelezték. Ezek a hibákat előidéző beszélgetések nem tükrözik a tipikus használatot, amelyben ritkábbak a tárgyi hibák. A pontszámokat nem korrigáltuk a hossz alapján, ugyanakkor a válaszok részletességét vizsgáló tesztjeink szinte semmilyen összefüggést nem mutattak a válaszhosszal.

Kódolás

Idén a kódoló ügynökök minden eddiginél összetettebb, nagyobb léptékű és hosszabb feladatok megoldásába kezdtek. Az OpenAI-nál a belső használat exponenciálisan nőtt. API-árakon számolva a napi tokenhasználat a kutatók mediánjánál meghaladta a 600 dollárt, a 90. percentilisbe tartozó kutatóknál pedig a 7000 dollárt (A kutatás felgyorsítása: betekintés az OpenAI működésébe⁠). Ahogy a kódoló ügynökök egyre hosszabb és nagyobb igényű feladatokat vállalnak, a tartós használat költsége egyre fontosabbá válik. A GPT‑6 Sol és Luna erős kódolási teljesítményt párosít alacsonyabb API-árakkal. Így a fejlesztők többet iterálhatnak, a csapatok pedig bátrabban bízhatnak ambiciózusabb feladatokat a Codexre.

Azt vizsgáló FrontierCode teszten, hogy a kódoló ügynökök valós kódbázisokba beolvasztható módosításokat készítenek-e, a GPT‑6 Sol jelentősen felülmúlja a GPT‑5.6 Solt, és jóval alacsonyabb költséggel éri el az extra erős Claude Fable 5.1 szintjét.

A FrontierCode 1.1 Main⁠(új ablakban nyílik meg) teszten az MI-ügynökök kódot írnak, amelyet nemcsak a helyesség, hanem a „beolvaszthatóság” alapján is értékelnek: például a tesztek minősége, a feladat kereteinek betartása, a kódstílus és a kódbázis szabványainak követése szerint.

A valós kódbázisok összetett szoftverfejlesztési feladatait vizsgáló DeepSWE v1.1 teszten a maximális ráfordítású GPT‑6 Sol 68,8%-ot ér el. Ez mindössze 1,1 százalékponttal marad el a Claude Fable 5 értékelésbeli legjobb, extra erős ráfordítással elért 69,9%-os eredményétől, miközben feladatonként körülbelül 80%-kal kevesebbe kerül.

A maximális ráfordítású GPT‑6 Luna 66,6%-ot ér el, ami összemérhető a közepes ráfordítású Claude Opus 5 és Fable 5 eredményével. Ezekben az összehasonlításokban a Luna feladatonként 93%-kal olcsóbb az Opus 5-nél és 96%-kal a Fable 5-nél.

A DeepSWE 1.1⁠(új ablakban nyílik meg) teszten az MI-ügynökök eredeti, hosszú időtávú szoftverfejlesztési feladatokat oldanak meg.

Számítógép-használat

Bár a GPT‑6 Astra továbbra is a világ legjobb számítógép-használati modellje, a GPT‑6 Sol és Luna elődeiknél költséghatékonyabb teljesítményt kínálnak. Az OSWorld 2.0 offline teszten az extra erős ráfordítású GPT‑6 Sol a közepes ráfordítású Claude Opus 5-höz hasonló eredményt ér el – 60,5%-ot a 60,3%-kal szemben –, feladatonként körülbelül 80%-kal alacsonyabb költséggel. A GPT‑6 Luna (max) felülmúlja a GPT‑5.6 Solt (közepes), annak tizedakkora költségéért.

Az OSWorld 2.0⁠(új ablakban nyílik meg) teszten az MI-ügynökök hétköznapi és professzionális feladatokat egyaránt lefedő, hosszú időtávú számítógép-használati munkafolyamatokat próbálnak végrehajtani. A v2026.08.08-as kiadás offline készletén elért részpontszámot közöljük.

Együttműködési stílus

A GPT‑6 Astra továbbfejlesztett kommunikációs stílusát a Sol és Luna modellekbe is átültettük. Úgy véljük, ez különösen a műszaki és kódolási beszélgetésekben lesz érezhető. Világosabb megfogalmazásra, kevesebb szakzsargonra és szokatlan fordulatra, kevesebb csekély értékű részletre, valamint összességében kissé rövidebb, mégis tartalmas válaszokra számíthat.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Bár a stílus szubjektív, itt a GPT‑6 Sol válaszát részesítjük előnyben. Nem von le túl gyorsan következtetéseket, kevesebb időt tölt a kérdező számára valószínűleg nyilvánvaló részletek ismétlésével (például hogy a webhely négy oldalból áll), kevésbé homályosan fogalmaz (például „bento-hatás”, „átalakítás… e rendszer köré”), nyíltabban közli, mit ellenőrzött és mit nem, és nem oszt meg feleslegesen olyan megvalósítási részleteket, mint a képeszközének adott utasítás.

A gyorsítótárazás fejlesztése ügynökökhöz és hosszú beszélgetésekhez

Az alacsonyabb tokenárak mellett abban is segítünk a GPT‑6‑ra építő fejlesztőknek, hogy többet takarítsanak meg az alkalmazásaik által újrahasznált kontextuson. Továbbfejlesztettük a GPT‑6 prompt-gyorsítótárazását, hogy alapértelmezés szerint magasabb legyen a gyorsítótár-találati arány. Így az ügynökök több kontextust használhatnak újra, gyorsabban válaszolhatnak, és 90%-os kedvezményt kaphatnak a gyorsítótárazott bemeneti tokenek olvasására.

A fejlesztők emellett többféleképpen mérhetik és optimalizálhatják a gyorsítótárazás teljesítményét:

A GitHub beszámolója szerint az elmúlt hónapokban ezek a fejlesztések több milliárd, OpenAI-modelleknek küldött kérésben több mint 50%-kal csökkentették az új feldolgozást igénylő utasítástokenek arányát, így a Copilot gyorsabban válaszol.

Az összehangoltság további javítása

A GPT‑6 Sol és Luna az Astrával – eddigi leginkább összehangolt modellünkkel – bevezetett összehangolási munkára épül. Összehangoltsági értékeléseinkben a Sol és a Luna is javulást mutat GPT‑5.6-os megfelelőjéhez képest, többek között ritkábban tesznek félrevezető állításokat kódolási munkájukról.

Az alábbi értékelések szándékosan nehéz helyzeteket vizsgálnak, és nem a tipikus használat hibaarányát mérik. A teljes eredményeket a rendszerkártyán⁠(új ablakban nyílik meg) találja.

Elérhetőség

A GPT‑6 Sol és a GPT‑6 Luna mától elérhető a ChatGPT Work és a Codex szolgáltatásban minden Plus-, Pro-, Business-, Enterprise- és Edu-felhasználónak. A Free- és Go-felhasználók az asztali alkalmazásban férhetnek hozzá a GPT‑6 Lunához. Ezek a modellek a Chatben még nem érhetők el. Az OpenAI API-ban gpt-6-sol és gpt-6-luna néven érhetők el.

A szolgáltatás stabilitásának megőrzése érdekében a nap folyamán fokozatosan vezetjük be ezeket a modelleket a ChatGPT‑ben. Ha még nem látja az új modelleket a ChatGPT Work vagy a Codex szolgáltatásban, próbálja újra később.


A GPT értékeléseit kutatási környezetünkben vagy API-nkon keresztül végeztük. A rendszerutasítások, az elérhető eszközök és más eltérések miatt ezek kimenete kissé eltérhet az éles ChatGPT‑étől. A versenytárs modellek értékeléseit nyilvánosan hozzáférhető jelentésekből vettük át. Amikor a Claude Fable 5.1 eredményei nem álltak rendelkezésre, a Claude Fable 5 pontszámait közöltük.

Szerző

OpenAI