Nintroduċu GPT‑6 Sol u Luna
Aktar modi kif iġġib intelliġenza avvanzata fix-xogħol li tagħmel kuljum.
Aktar kmieni dan ix-xahar, introduċejna GPT‑6 Astra, l-aktar mudell intelliġenti u allinjat fid-dinja. Filwaqt li l-aktar proġetti impenjattivi u importanti għadhom jeħtieġu l-kapaċitajiet sħaħ ta’ Astra, ix-xogħol isir fuq skali, b’ritmi u b’baġits differenti.
Għalhekk qed inwessgħu l-firxa ta’ GPT‑6 b’GPT‑6 Sol u GPT‑6 Luna. GPT‑6 Astra introduċa ġenerazzjoni ġdida ta’ intelliġenza—dawn il-mudelli jgħinu biex il-benefiċċji tagħha jitqassmu billi javvanzaw il-limiti tal-effiċjenza fl-ispejjeż. Ħarriġna lil GPT‑6 Sol u Luna b’metodi simili għal dawk ta’ GPT‑6 Astra, u ġibna l-avvanzi wara l-prestazzjoni avvanzata ta’ Astra fix-xogħol professjonali, il-preċiżjoni fattwali, il-kodifikazzjoni, l-użu tal-kompjuter u l-allinjament f’mudelli aktar veloċi u affordabbli.
Il-mudelli GPT‑6 jinsabu fuq quddiem nett tul il-kurva tal-ispiża u l-intelliġenza, billi jgħaqqdu kapaċitajiet eċċezzjonali f’kull livell ma’ infrastruttura li twassalhom b’mod effiċjenti fuq skala kbira. It-titjib fil-caching u fl-inferenza jippermettilna noffru dawn il-mudelli bi spiża aktar baxxa, u qed ngħaddu dan l-iffrankar direttament lill-utenti u lill-klijenti billi nnaqqsu l-prezzijiet tal-API għal Sol u Luna b’50% meta mqabbla mal-prezzijiet promozzjonali tagħhom għal GPT‑5.6. Flimkien, dan it-titjib jagħmel l-IA avvanzata prattika għal aktar kompiti u applikazzjonijiet ta’ kuljum fuq skala kbira.
Mudell | Input | Output | Tnaqqis fil-prezz |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% orħos |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% orħos |
Il-prezzijiet huma għal kull miljun token.
GPT‑6 Astra jibqa’ l-aqwa mudell tagħna f’kull aspett. Agħżlu meta trid l-aħjar riżultati u esperjenza mingħajr kompromessi.
GPT‑6 Sol u Luna jġibu titjib fl-intelliġenza u fl-effiċjenza tal-ispejjeż lill-mudelli li diġà taf u tuża, fil-kapaċitajiet l-aktar utli biex jitwettaq xogħol kumpless.
GPT‑6 Sol jista’ jwettaq kompiti diffiċli tax-xogħol filwaqt li jagħtik aktar spazju biex tirrepeti l-proċess, b’limiti ogħla tal-użu u spiża aktar baxxa, u joffri aktar intelliġenza u riżultati aħjar minn mudelli kompetituri bi prezz simili.
F’AutomationBench, test tal-flussi tax-xogħol tan-negozju bejn diversi apps, GPT‑6 Sol bi sforz xhigh jaqbeż lil Claude Opus 5 bi sforz Max, bi 9% biss tal-ispiża ta’ Opus 5 għal kull kompitu. Bi sforz Għoli, GPT‑6 Luna jtejjeb ir-riżultat tal-predeċessur tiegħu b’5.4 punti perċentwali, bi spiża 58% aktar baxxa għal kull kompitu.
F’AutomationBench 1.0.6(jinfetaħ f’tieqa ġdida), l-aġenti tal-IA jiġu ttestjati fuq flussi tax-xogħol kompluti bl-użu ta’ 47 għodda fil-bejgħ, il-kummerċjalizzazzjoni, l-operazzjonijiet, l-appoġġ, il-finanzi u r-riżorsi umani. Il-punt tad-dejta għal Claude Fable 5.1 jissottovaluta l-ispiża reali tiegħu, għax ma jinkludix l-ispiża tar-riżervi ta’ Opus 5, li ntużaw f’madwar 40% tal-kompiti.
GPT‑6 Sol jaqbeż ukoll lil Claude Fable 5.1 bi spiża ferm aktar baxxa, u saħansitra jegħleb lil GPT‑6 Astra bi sforz baxx.
Mudell (u sforz) | Punteġġ | Spiża għal kull kompitu |
|---|---|---|
GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
GPT‑6 Astra (baxx) | 30.3% | 3.9x GPT‑6 Sol |
Claude Opus 5 (Max) | 26.9% | 11.1x GPT‑6 Sol |
Claude Fable 5.1 b’riżerva ta’ Opus 5 (Max) | 31.4% | >8.9x GPT‑6 Sol (l-ispiża tar-riżerva mhix irrappurtata) |
F’Agents’ Last Exam, li jevalwa l-aġenti fuq flussi tax-xogħol professjonali kumplessi, GPT‑6 Sol bi sforz Max jikseb 56.4%, ogħla mill-aqwa punteġġ ta’ Claude Opus 5 fl-evalwazzjoni, bi spiża 60% aktar baxxa għal kull kompitu.
F’Agents’ Last Exam V1(jinfetaħ f’tieqa ġdida), l-aġenti tal-IA jiġu evalwati fuq kompiti fit-tul u ta’ valur ekonomiku f’55 sottoindustrija, li jkopru l-biċċa l-kbira tal-oqsma ewlenin tax-xogħol professjonali mwettaq fuq kompjuter.
L-utilità ta’ tweġiba tiddependi mill-korrettezza tal-fatti, u qed inkomplu ntejbu l-affidabbiltà fattwali. Fl-evalwazzjoni interna tagħna tal-preċiżjoni fattwali, ibbażata fuq konverżazzjonijiet reali anonimizzati fejn l-utenti indikaw żbalji tal-mudelli tagħna, GPT‑6 Sol jagħmel madwar nofs l-iżbalji tal-predeċessur tiegħu u joqrob lejn l-affidabbiltà ta’ Astra bi spiża ferm aktar baxxa. GPT‑6 Luna jitjieb ukoll b’mod sostanzjali; f’livelli ogħla ta’ sforz, jilħaq il-prestazzjoni ta’ GPT‑5.6 Sol b’madwar wieħed minn mija tal-ispiża tiegħu.
Hawnhekk nevalwaw il-preċiżjoni fattwali f’konverżazzjonijiet anonimizzati ta’ ChatGPT fejn l-utenti kienu indikaw żball fattwali minn mudell preċedenti. Dawn il-konverżazzjonijiet li jipprovokaw l-iżbalji ma jirrappreżentawx l-użu tipiku, fejn l-iżbalji fattwali huma aktar rari. Il-punteġġi mhumiex ikkontrollati skont it-tul; madankollu, it-testijiet tagħna ta’ livelli differenti ta’ dettall kważi ma wrew l-ebda dipendenza fuq it-tul tat-tweġiba.
Din is-sena, l-aġenti tal-kodifikazzjoni bdew iwettqu kompiti b’aktar kumplessità, firxa u tul minn qatt qabel. F’OpenAI, l-użu intern tagħna kiber b’mod esponenzjali. Meta vvalutat skont il-prezzijiet tal-API, il-medjana tal-użu ta’ kuljum tat-tokens qabżet is-$600 għal kull riċerkatur, u s-$7,000 għar-riċerkaturi fid-90 perċentil (Aċċellerazzjoni tar-riċerka: Ħarsa minn ġewwa lejn OpenAI). Hekk kif l-aġenti tal-kodifikazzjoni jwettqu kompiti itwal u aktar impenjattivi, l-ispiża tal-użu kontinwu ssir aktar importanti. GPT‑6 Sol u Luna jgħaqqdu prestazzjoni tajba fil-kodifikazzjoni ma’ prezzijiet tal-API aktar baxxi, u jagħtu lill-iżviluppaturi aktar spazju biex jirrepetu l-proċess u lit-timijiet il-kunfidenza biex ikunu aktar ambizzjużi dwar dak li jitolbu lil Codex iwettaq.
F’FrontierCode, li jevalwa jekk l-aġenti tal-kodifikazzjoni jipproduċux bidliet lesti biex jiġu integrati f’bażijiet tal-kodiċi reali, GPT‑6 Sol jitjieb b’mod sostanzjali fuq GPT‑5.6 Sol u jirnexxilu jilħaq lil Claude Fable 5.1 xhigh bi spiża ferm aktar baxxa.
F’FrontierCode 1.1 Main(jinfetaħ f’tieqa ġdida), l-aġenti tal-IA jiktbu kodiċi li jiġi evalwat mhux biss għall-korrettezza iżda wkoll għall-“possibbiltà ta’ integrazzjoni”: pereżempju, il-kwalità tat-testijiet, id-dixxiplina fl-ambitu, l-istil tal-kodiċi u l-konformità mal-istandards tal-bażi tal-kodiċi.
F’DeepSWE v1.1, li jittestja l-prestazzjoni f’kompiti kumplessi tal-inġinerija tas-softwer f’bażijiet tal-kodiċi reali, GPT‑6 Sol bi sforz Max jikseb 68.8%, sa 1.1 punti perċentwali mill-aqwa punteġġ ta’ Claude Fable 5 fl-evalwazzjoni—69.9% bi sforz xhigh—bi spiża madwar 80% aktar baxxa għal kull kompitu.
GPT‑6 Luna bi sforz Max jikseb 66.6%, riżultat komparabbli ma’ Claude Opus 5 u Fable 5 bi sforz Medium. F’dawn il-paraguni, Luna jiswa 93% inqas għal kull kompitu minn Opus 5 u 96% inqas minn Fable 5.
F’DeepSWE 1.1(jinfetaħ f’tieqa ġdida), l-aġenti tal-IA jsolvu kompiti oriġinali u fit-tul tal-inġinerija tas-softwer.
Filwaqt li GPT‑6 Astra jibqa’ l-aqwa mudell fid-dinja għall-użu tal-kompjuter, GPT‑6 Sol u Luna joffru prestazzjoni aktar effiċjenti fl-ispejjeż mill-predeċessuri tagħhom. F’OSWorld 2.0 offline, GPT‑6 Sol bi sforz xhigh jikseb punteġġ simili għal Claude Opus 5 bi sforz Medium—60.5% kontra 60.3%—bi spiża madwar 80% aktar baxxa għal kull kompitu. GPT‑6 Luna (Max) jirnexxilu jaqbeż lil GPT‑5.6 Sol (Medium) b’wieħed minn għaxra tal-ispiża tiegħu.
F’OSWorld 2.0(jinfetaħ f’tieqa ġdida), l-aġenti tal-IA jippruvaw iwettqu flussi tax-xogħol fit-tul fuq kompjuter, li jkopru kompiti ta’ kuljum u professjonali. Aħna nirrapportaw il-premju parzjali fuq is-sett offline mir-rilaxx v2026.08.08.
Ġibna wkoll l-istil imtejjeb ta’ komunikazzjoni ta’ GPT‑6 Astra f’Sol u Luna, u naħsbu li dan se jinħass b’mod partikolari fil-konverżazzjonijiet tekniċi u dwar il-kodifikazzjoni. Stenna aktar ċarezza, inqas lingwaġġ tekniku, inqas frażijiet strambi, inqas dettalji ta’ ftit valur u, b’mod ġenerali, tweġibiet kemxejn iqsar mingħajr telf ta’ sustanza.
Għalkemm l-istil huwa suġġettiv, hawnhekk nippreferu t-tweġiba ta’ GPT‑6 Sol. Ma taqbiżx għall-konklużjonijiet daqshekk malajr, tqatta’ inqas ħin tirrepeti dettalji li jistgħu jkunu ovvji għal min għamel il-mistoqsija (eż. li s-sit web għandu erba’ paġni), tuża lingwaġġ inqas vag (eż. “stil bento”, “nibdlu l-għamla... madwar dik is-sistema”), hija aktar ċara dwar dak li ċċekkjat u ma ċċekkjatx, u ma taqsamx bla bżonn dettalji tal-implimentazzjoni bħall-prompt tal-għodda tal-immaġnijiet tagħha.
Flimkien ma’ prezzijiet aktar baxxi tat-tokens, qed ngħinu lill-iżviluppaturi li jibnu fuq GPT‑6 jiffrankaw aktar fuq il-kuntest li jerġgħu jużaw l-applikazzjonijiet tagħhom. Tejjibna l-caching tal-prompt għal GPT‑6 biex awtomatikament jagħti rati ogħla ta’ suċċess tal-cache, u b’hekk ngħinu lill-aġenti jerġgħu jużaw aktar kuntest, iwieġbu aktar malajr u jibbenefikaw minn skontijiet ta’ 90% fuq il-qari ta’ tokens tal-input mill-cache.
L-iżviluppaturi għandhom ukoll aktar modi kif ikejlu u jottimizzaw il-prestazzjoni tal-caching tagħhom:
Immonitorja u ddijanjostika. Id-Dashboard tal-Caching tal-Prompt(jinfetaħ f’tieqa ġdida) juri kemm mill-input jinħażen fil-cache u kif dan jinbidel maż-żmien. L-għodda dijanjostika(jinfetaħ f’tieqa ġdida) tgħin tispjega l-opportunitajiet mitlufa għall-caching u x’għandu jiġi rranġat.
Aġġusta l-isforz tar-raġunament u d-disponibbiltà tal-għodod mingħajr ma tħassar il-cache. Żid l-isforz tar-raġunament(jinfetaħ f’tieqa ġdida) għal kompiti aktar diffiċli jew naqqsu għal mistoqsijiet ta’ segwitu aktar sempliċi, u attiva jew iddiżattiva l-għodod(jinfetaħ f’tieqa ġdida) skont kif jinbidlu l-ħtiġijiet tal-aġent tiegħek. Iż-żewġ kontrolli issa jippreservaw il-kuntest preċedenti biex jerġa’ jintuża mill-cache.
Ottimizza liema prefissi jinħażnu fil-cache. Il-punti ta’ waqfien espliċiti jippermettu lill-iżviluppaturi jagħżlu fejn jintemmu l-prefissi tal-prompt maħżuna fil-cache. Dan jagħti lill-iżviluppaturi aktar kontroll fuq l-użu mill-ġdid tal-cache u jista’ jtejjeb il-prestazzjoni.
GitHub jirrapporta li, matul dawn l-aħħar xhur, dan it-titjib naqqas b’aktar minn 50% il-proporzjon ta’ tokens tal-prompt li jeħtieġu pproċessar mill-ġdid, fuq biljuni ta’ talbiet lill-mudelli ta’ OpenAI, u għen lil Copilot iwieġeb aktar malajr.
GPT‑6 Sol u Luna jibnu fuq il-ħidma ta’ allinjament introdotta ma’ Astra, l-aktar mudell allinjat tagħna sal-lum. Fl-evalwazzjonijiet tal-allinjament tagħna, kemm Sol kif ukoll Luna juru titjib fuq il-kontropartijiet tagħhom GPT‑5.6, inklużi rati aktar baxxi ta’ dikjarazzjonijiet qarrieqa dwar ix-xogħol ta’ kodifikazzjoni tagħhom.
L-evalwazzjonijiet ta’ hawn taħt jittestjaw apposta sitwazzjonijiet diffiċli u ma jkejlux ir-rati ta’ falliment fl-użu tipiku. Ara l-kard tas-sistema(jinfetaħ f’tieqa ġdida) għar-riżultati sħaħ.
GPT‑6 Sol u GPT‑6 Luna huma disponibbli mil-lum fi ChatGPT Work u Codex għall-utenti kollha ta’ Plus, Pro, Business, Enterprise u Edu. L-utenti ta’ Free u Go jistgħu jaċċessaw GPT‑6 Luna fl-app tad-desktop. Dawn il-mudelli għadhom mhumiex disponibbli fiċ-Chat. Fl-API ta’ OpenAI, huma disponibbli bħala gpt-6-sol u gpt-6-luna.
Biex inżommu s-servizz stabbli għal kulħadd, qed nippjanaw li nniedu dawn il-mudelli gradwalment fi ChatGPT matul il-ġurnata. Jekk ma tarax il-mudelli l-ġodda fi ChatGPT Work jew Codex, erġa’ pprova aktar tard.
L-evalwazzjonijiet ta’ GPT saru fl-ambjent tar-riċerka tagħna jew permezz tal-API tagħna, li jistgħu jagħtu output kemxejn differenti minn ChatGPT fil-produzzjoni minħabba differenzi fil-prompts tas-sistema, fl-għodod disponibbli, eċċ. L-evalwazzjonijiet tal-mudelli kompetituri ttieħdu minn rapporti disponibbli għall-pubbliku. Il-punteġġi ta’ Claude Fable 5 ġew irrappurtati meta dawk ta’ Claude Fable 5.1 ma kinux disponibbli.


