Við kynnum GPT‑6 Sol og Luna
Fleiri leiðir til að nýta háþróaða greind í daglegum störfum.
Fyrr í þessum mánuði kynntum við GPT‑6 Astra, greindasta og best samstillta líkan heims. Þótt kröfuhörðustu og mikilvægustu verkefnin krefjist enn allrar getu Astra er umfang, vinnuhraði og fjárhagsrammi verkefna mismunandi.
Þess vegna stækkum við GPT‑6‑líkanaheiminn með GPT‑6 Sol og GPT‑6 Luna. GPT‑6 Astra markaði upphaf nýrrar kynslóðar greindar. Þessi líkön dreifa ávinningi hennar með því að færa mörk kostnaðarhagkvæmni. Við þjálfuðum GPT‑6 Sol og Luna með svipuðum aðferðum og GPT‑6 Astra og færðum þannig framfarirnar að baki framúrskarandi frammistöðu Astra í faglegri vinnu, staðreyndanákvæmni, forritun, tölvunotkun og samstillingu yfir í hraðari og ódýrari líkön.
GPT‑6-líkönin skara fram úr á öllum kostnaðar- og greindarstigum og sameina einstaka getu á hverju stigi við innviði sem skila henni á skilvirkan hátt í stórum stíl. Endurbætur á skyndiminni og ályktunum gera okkur kleift að bjóða þessi líkön með lægri kostnaði. Við skila sparnaðinum beint til notenda og viðskiptavina með því að lækka API-verð Sol og Luna um 50% miðað við kynningarverð GPT‑5.6. Saman gera þessar umbætur háþróaða gervigreind hagkvæma fyrir fleiri hversdagsleg verkefni og notkun í stórum stíl.
Líkan | Inntak | Úttak | Verðlækkun |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% ódýrara |
GPT‑6 Luna | $0,20 → $0,10 | $1,20 → $0,50 | 50% ódýrara |
Verð miðast við eina milljón tóka.
GPT‑6 Astra er áfram besta líkanið okkar á öllum sviðum. Veldu það þegar þú vilt bestu niðurstöðurnar án málamiðlana.
GPT‑6 Sol og Luna bæta greind og kostnaðarhagkvæmni þeirra líkana sem þú þekkir og notar nú þegar, einkum í þeirri getu sem nýtist best við flókin verkefni.
GPT‑6 Sol getur tekist á við erfið verkefni en gefur þér jafnframt meira svigrúm til endurtekninga með hærri notkunarmörkum og lægri kostnaði. Það býður meiri greind og betri niðurstöður en líkön samkeppnisaðila á svipuðu verði.
Í AutomationBench, prófi á viðskiptaferlum milli forrita, stendur GPT‑6 Sol með mjög mikilli úrvinnslu sig betur en Claude Opus 5 með hámarksúrvinnslu og kostar aðeins 9% af kostnaði Opus 5 á hvert verkefni. Með mikilli úrvinnslu bætir GPT‑6 Luna árangur forvera síns um 5,4 prósentustig en kostar 58% minna á hvert verkefni.
Í AutomationBench 1.0.6(opnast í nýjum glugga) eru gervigreindarfulltrúar prófaðir í heildstæðum verkferlum með 47 verkfærum á sviði sölu, markaðsmála, rekstrar, þjónustu, fjármála og mannauðsmála. Gagnapunkturinn fyrir Claude Fable 5.1 vanmetur raunverulegan kostnað þess þar sem kostnaði vegna Opus 5 sem varalíkans er sleppt, en það var notað í um 40% verkefna.
GPT‑6 Sol skákar einnig Claude Fable 5.1 með mun lægri kostnaði og stendur jafnvel betur en GPT‑6 Astra með lítilli úrvinnslu.
Líkan (og úrvinnsla) | Einkunn | Kostnaður á hvert verkefni |
|---|---|---|
GPT‑6 Sol (mjög hátt) | 33,2% | $0,27 |
GPT‑6 Astra (lágt) | 30,3% | 3.9x GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9% | 11.1x GPT‑6 Sol |
Claude Fable 5.1 með Opus 5 til vara (Max) | 31,4% | >8.9x GPT‑6 Sol (kostnaður varalíkans ekki gefinn upp) |
Í Agents’ Last Exam, sem metur fulltrúa í flóknum faglegum verkferlum, fær GPT‑6 Sol með hámarksúrvinnslu 56,4%, yfir hæstu einkunn Claude Opus 5 í matinu, en kostar 60% minna á hvert verkefni.
Í Agents’ Last Exam V1(opnast í nýjum glugga) eru gervigreindarfulltrúar metnir í langvinnum og efnahagslega verðmætum verkefnum úr 55 undirgreinum sem ná yfir flest helstu svið faglegrar tölvuvinnu.
Gagnsemi svars ræðst af því að staðreyndir séu réttar og við höldum áfram að bæta áreiðanleika þeirra. Í innra mati okkar á staðreyndanákvæmni, sem byggist á ópersónugreinanlegum raunverulegum samtölum þar sem notendur merktu við mistök líkana okkar, gerir GPT‑6 Sol um helmingi færri mistök en forveri þess og nálgast áreiðanleika Astra með mun lægri kostnaði. GPT‑6 Luna batnar einnig verulega. Við meiri úrvinnslu jafnar það GPT‑5.6 Sol en kostar um hundraðasta hluta þess.
Hér metum við staðreyndanákvæmni út frá ópersónugreinanlegum ChatGPT‑samtölum þar sem notendur höfðu merkt við staðreyndavillu í svari frá eldra líkani. Þessi samtöl, sem kölluðu fram villur, eru ekki dæmigerð fyrir venjulega notkun, þar sem staðreyndavillur eru sjaldgæfari. Niðurstöðurnar eru ekki leiðréttar með tilliti til lengdar svara. Prófanir okkar á mismunandi svarlengd sýndu þó nánast engin tengsl milli svarlengdar og niðurstaðna.
Á þessu ári hafa forritunarfulltrúar tekið að sér flóknari, umfangsmeiri og lengri verkefni en nokkru sinni fyrr. Innri notkun okkar hjá OpenAI hefur vaxið veldislega. Miðað við API-verð hefur dagleg tókanotkun farið yfir 600 Bandaríkjadali hjá miðgildisrannsakandanum og 7.000 dali hjá rannsakendum á 90. hundraðshluta (Hraðari rannsóknir: Sýn inn í OpenAI). Eftir því sem forritunarfulltrúar taka að sér lengri og kröfuharðari verkefni skiptir kostnaður við viðvarandi notkun meira máli. GPT‑6 Sol og Luna sameina öfluga forritunargetu og lægra API-verð. Það gefur forriturum meira svigrúm til endurtekninga og teymum sjálfstraust til að fela Codex metnaðarfyllri verkefni.
Í FrontierCode, sem metur hvort forritunarfulltrúar geri breytingar sem eru tilbúnar til að sameinast raunverulegum kóðasöfnum, stendur GPT‑6 Sol sig mun betur en GPT‑5.6 Sol og jafnar Claude Fable 5.1 með mjög mikilli úrvinnslu en mun lægri kostnaði.
Í FrontierCode 1.1 Main(opnast í nýjum glugga) skrifa gervigreindarfulltrúar kóða sem er ekki aðeins metinn eftir réttmæti heldur einnig „sameinanleika“, svo sem gæðum prófana, hóflegu umfangi, kóðastíl og samræmi við staðla kóðasafnsins.
Í DeepSWE v1.1, sem prófar frammistöðu í flóknum hugbúnaðarverkfræðiverkefnum í raunverulegum kóðasöfnum, fær GPT‑6 Sol með hámarksúrvinnslu 68,8%. Það er innan 1,1 prósentustigs frá hæstu einkunn Claude Fable 5 í matinu, 69,9% með mjög mikilli úrvinnslu, en kostar um 80% minna á hvert verkefni.
GPT‑6 Luna fær 66,6% með hámarksúrvinnslu, sambærilegt við Claude Opus 5 og Fable 5 með miðlungsúrvinnslu. Í þessum samanburði kostar Luna 93% minna á hvert verkefni en Opus 5 og 96% minna en Fable 5.
Í DeepSWE 1.1(opnast í nýjum glugga) leysa gervigreindarfulltrúar frumleg hugbúnaðarverkfræðiverkefni sem taka langan tíma.
Þótt GPT‑6 Astra sé áfram besta líkan heims fyrir tölvunotkun skila GPT‑6 Sol og Luna betri kostnaðarhagkvæmni en forverar þeirra. Í ótengdu OSWorld 2.0 fær GPT‑6 Sol með mjög mikilli úrvinnslu svipaða einkunn og Claude Opus 5 með miðlungsúrvinnslu, 60,5% á móti 60,3%, en kostar um 80% minna á hvert verkefni. GPT‑6 Luna (Max) stendur sig betur en GPT‑5.6 Sol (Miðlungs) en kostar aðeins tíunda hluta þess.
Í OSWorld 2.0(opnast í nýjum glugga) reyna gervigreindarfulltrúar að ljúka langvinnum tölvuverkferlum sem ná yfir hversdagsleg og fagleg verkefni. Við birtum hlutaeinkunn úr ótengda gagnasafninu í útgáfu v2026.08.08.
Við höfum einnig fært bættan samskiptastíl GPT‑6 Astra yfir í Sol og Luna og teljum að það verði sérstaklega áberandi í tæknilegum samtölum og samtölum um forritun. Búast má við skýrara máli, minna fagmáli, færri undarlegum orðasamböndum, færri lítilsverðum smáatriðum og almennt örlítið styttri svörum án þess að innihald tapist.
Þótt stíll sé huglægt atriði kjósum við svar GPT‑6 Sol hér. Það dregur ekki jafn fljótt ályktanir, eyðir minni tíma í að endurtaka atriði sem spyrjandanum kunna að vera augljós, svo sem að vefsvæðið hafi fjórar síður, notar minna af óljósu orðalagi, svo sem „bento-yfirbragð“ og „að endurmóta … í kringum það kerfi“, greinir skýrar frá því hvað það kannaði og kannaði ekki og deilir ekki að óþörfu útfærsluatriðum á borð við kvaðninguna fyrir myndverkfærið.
Samhliða lægra verði á tókum hjálpum við forriturum sem byggja á GPT‑6 að spara meira í endurnýttu samhengi forrita sinna. Við höfum bætt kvaðningarskyndiminni GPT‑6 þannig að það skili sjálfgefið hærra skyndiminnishlutfalli. Það hjálpar fulltrúum að endurnýta meira samhengi, svara hraðar og fá 90% afslátt af lestri inntakstóka úr skyndiminni.
Forritarar hafa einnig fleiri leiðir til að mæla og fínstilla afköst skyndiminnisins:
Vakta og greina. Stjórnborð kvaðningarskyndiminnis(opnast í nýjum glugga) sýnir hversu mikið inntak er vistað í skyndiminni og hvernig það breytist með tímanum. Greiningarverkfærið(opnast í nýjum glugga) skýrir vannýtt tækifæri til skyndivistunar og hvað þarf að laga.
Stilltu rökúrvinnslu og framboð verkfæra án þess að rjúfa skyndiminnið. Auktu rökúrvinnslu(opnast í nýjum glugga) fyrir erfiðari verkefni eða minnkaðu hana fyrir einfaldari framhaldsspurningar og virkjaðu eða slökktu á verkfærum(opnast í nýjum glugga) eftir því sem þarfir fulltrúans breytast. Báðar stýringarnar varðveita nú eldra samhengi svo hægt sé að endurnýta skyndiminnið.
Fínstilltu hvaða forskeyti eru vistuð í skyndiminni. Skýr skil gera forriturum kleift að velja hvar forskeyti kvaðninga í skyndiminni enda. Þetta veitir forriturum meiri stjórn á endurnýtingu skyndiminnis og getur bætt afköst.
GitHub greinir frá því að á undanförnum mánuðum hafi þessar umbætur minnkað hlutfall kvaðningartóka sem þarf að vinna frá grunni um meira en 50% í milljörðum beiðna til líkana OpenAI og þannig hjálpað Copilot að svara hraðar.
GPT‑6 Sol og Luna byggja á samstillingarvinnunni sem hófst með Astra, best samstillta líkani okkar til þessa. Í samstillingarmati okkar sýna bæði Sol og Luna framfarir frá samsvarandi GPT‑5.6-líkönum, meðal annars lægra hlutfall villandi fullyrðinga um forritunarvinnu sína.
Mötin hér að neðan prófa vísvitandi krefjandi aðstæður og mæla ekki bilanatíðni við dæmigerða notkun. Sjáðu kerfiskortið(opnast í nýjum glugga) fyrir allar niðurstöðurnar.
GPT‑6 Sol og GPT‑6 Luna eru í boði í ChatGPT Work og Codex frá og með deginum í dag fyrir alla notendur Plus, Pro, Business, Enterprise og Edu. Notendur Free og Go geta nálgast GPT‑6 Luna í skjáborðsforritinu. Þessi líkön eru ekki enn í boði í Chat. Í API OpenAI eru þau tiltæk sem gpt-6-sol og gpt-6-luna.
Til að tryggja stöðuga þjónustu fyrir alla hyggjumst við innleiða líkönin smám saman í ChatGPT yfir daginn. Ef nýju líkönin birtast ekki í ChatGPT Work eða Codex skaltu reyna aftur síðar.
GPT var metið í rannsóknarumhverfi okkar eða í gegnum API okkar. Vegna mismunar á kerfiskvaðningum, tiltækum verkfærum og öðru getur úttakið verið örlítið frábrugðið því sem ChatGPT skilar í framleiðslu. Mat á líkönum samkeppnisaðila var fengið úr opinberum skýrslum. Einkunnir Claude Fable 5 voru notaðar þegar einkunnir Claude Fable 5.1 voru ekki tiltækar.


