GPT-6.1Sol
Intelliġenza qrib dik ta’ Astra bi prezz ħames darbiet inqas, għal prestazzjoni avvanzata u sostnuta
Qed nintroduċu GPT‑6.1 Sol, verżjoni mtejba ta’ GPT‑6 Sol bi prestazzjoni eċċezzjonalment b’saħħitha fl-ikkowdjar b'aġenzija, kif ukoll fl-użu tal-kompjuter u fix-xogħol professjonali. Dan iqarreb lil Sol lejn GPT‑6 Astra f’kompiti impenjattivi, bi prezzijiet tat-tokens tal-input u tal-output ħames darbiet inqas mill-prezzijiet standard ta’ Astra, u jagħti lill-iżviluppaturi aktar lok biex jibnu u jħaddmu aġenti kapaċi bl-istess baġit.
GPT‑6.1 Sol joffri prestazzjoni qrib dik ta’ Astra bil-prezzijiet ta’ Sol, u b’hekk huwa l-mudell li joffri l-aħjar valur għall-prestazzjoni tiegħu fost dawk disponibbli llum. L-input fil-cache jiswa biss $0.10 għal kull miljun token—skont ta’ 95% fuq il-prezz standard tal-input—u għalhekk huwa aktar affordabbli għal xogħol imwettaq minn aġenti li jeħtieġ jerġa’ juża l-kuntest f’talbiet ripetuti.
GPT‑6 Astra jibqa’ l-aktar mudell avvanzat u kapaċi tagħna b’mod ġenerali. GPT‑6.1 Sol joffri bilanċ ġdid bejn il-kapaċità u l-ispiża għal xogħol importanti li l-utenti jridu jagħmlu aktar spiss, u għall-klijenti tal-API li jibnu u jħaddmu applikazzjonijiet fuq skala kbira.

GPT‑6.1 Sol joffri titjib sostanzjali fuq GPT‑6 Sol f’xogħol professjonali kumpless, mill-kitba tal-kodiċi u t-tneħħija tal-iżbalji minnu sal-fehim tad-dokumenti u t-twettiq ta’ proċessi tax-xogħol tan-negozju b’diversi passi. F’diversi minn dawn l-evalwazzjonijiet, joqrob lejn il-prestazzjoni ta’ GPT‑6 Astra bi spiża ferm aktar baxxa.
F’DeepSWE v1.1, li jevalwa kompiti kumplessi tal-inġinerija tas-software f’bażijiet reali tal-kodiċi, GPT‑6.1 Sol jilħaq l-istess prestazzjoni ta’ GPT‑6 Astra bi spiża madwar ħames darbiet inqas, filwaqt li jaqbeż l-aħjar punteġġ ta’ GPT‑6 Sol b’6.4 punti perċentwali bi sforz ta’ raġunament u spiża aktar baxxi.
Fil-benchmark DeepSWE 1.1(jinfetaħ f’tieqa ġdida), l-aġenti tal-IA jwettqu kompiti oriġinali fl-inġinerija tas-software li jirrikjedu xogħol fuq medda twila ta’ żmien.
F’GDP.pdf, li jkejjel kemm il-mudelli jwieġbu b’mod preċiż mistoqsijiet professjonali bl-użu ta’ dokumenti PDF kumplessi, inklużi tabelli, ċarts, dijagrammi u dettalji b’tipa żgħira, GPT‑6.1 Sol jikseb punteġġ ogħla minn Opus 5.5 b’alternattivi ta’ riżerva b’inqas minn nofs l-ispiża għal kull kompitu fis-settings kollha ta’ raġunament ittestjati. Joqrob ukoll lejn il-prestazzjoni mill-aktar avvanzata ta’ GPT‑6 Astra bi spiża għal kull kompitu madwar ħames darbiet inqas.
Fil-benchmark GDP.pdf(jinfetaħ f’tieqa ġdida), il-mudelli jridu jwieġbu għal talbiet minn sitwazzjonijiet reali dwar dokumenti PDF kumplessi meħuda minn flussi tax-xogħol professjonali fil-finanzi, fil-kura tas-saħħa, fil-qasam legali u f’seba’ oqsma professjonali oħra.
F’AutomationBench, li jkejjel jekk l-aġenti jlestux sew proċessi tax-xogħol tan-negozju b’diversi passi, GPT‑6.1 Sol jikseb punteġġ 2.2 punti perċentwali ogħla minn Opus 5.5 bi sforz ta’ raġunament medju, bi spiża madwar tliet darbiet inqas. Dan il-punteġġ huwa wkoll 4.8 punti perċentwali ogħla minn dak ta’ GPT‑6 Sol bl-istess setting.
In AutomationBench 1.0.6(jinfetaħ f’tieqa ġdida), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol jagħmel ukoll progress sostanzjali f’kompiti li jeħtieġu interazzjoni ma’ applikazzjonijiet tal-kompjuter. Fis-sett offline ta’ OSWorld 2.0, li jevalwa l-aġenti fuq proċessi tax-xogħol impenjattivi bl-użu tal-kompjuter, GPT‑6.1 Sol jaqbeż lil GPT‑6 Sol b’seba’ punti perċentwali bi sforz ta’ raġunament massimu, b’inqas minn nofs l-ispiża. Jersaq sa 2.1 punti perċentwali mill-punteġġ ta’ Astra bi sforz ta’ raġunament massimu, bi spiża għal kull kompitu madwar seba’ darbiet inqas.
In OSWorld 2.0(jinfetaħ f’tieqa ġdida), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
F’Terminal-Bench Science 0.1, li jevalwa proċessi tax-xogħol xjentifiċi inklużi l-analiżi tad-data, is-simulazzjoni u l-provi tat-teoremi, GPT‑6.1 Sol jikseb aktar mid-doppju tal-punteġġ ta’ GPT‑6 Sol bi sforz ta’ raġunament massimu, b’inqas minn nofs l-ispiża għal kull kompitu. Bi sforz massimu, GPT‑6.1 Sol jiswa medja ta’ $5.47 għal kull kompitu, meta mqabbel ma’ $23.21 għal Opus 5.5 u $23.80 għal Astra, u joffri kapaċità xjentifika sostanzjali bi spiża aktar minn 75% inqas minn kull wieħed miż-żewġ mudelli.
GPT‑6 Astra xorta jikseb l-ogħla punteġġ fost il-mudelli ttestjati, 68.1%, u għandu jintuża għall-aktar kompiti diffiċli ta’ riċerka xjentifika.
Fil-benchmark Terminal-Bench Science 0.1(jinfetaħ f’tieqa ġdida), l-aġenti jwettqu flussi tax-xogħol ta’ riċerka xjentifika bl-użu ta’ kodiċi u għodod tat-terminal, fosthom l-analiżi tad-data, it-tħaddim ta’ simulazzjonijiet u l-aġġustament tal-mudelli.
GPT‑6.1 Sol itejjeb ukoll il-preċiżjoni fattwali fuq prompts diffiċli. Bi sforz ta’ raġunament għoli ħafna, ir-rata ta’ żbalji fattwali tiegħu hija 4.1%, inqas mill-4.5% ta’ GPT‑6 Sol u eqreb lejn l-4.0% ta’ Astra bl-istess setting, filwaqt li jiswa madwar 83% inqas għal kull kompitu minn Astra.
Din l-evalwazzjoni tkejjel il-proporzjon ta’ tweġibiet li fihom mill-inqas żball fattwali wieħed f’konverżazzjonijiet li tneħħewlhom id-dettalji identifikattivi u li fihom l-utenti rrappurtaw żball ta’ mudell preċedenti. Dawn il-prompts, magħżula apposta għax diffiċli, ma jirrappreżentawx l-użu tipiku.
Nevalwaw il-korrettezza fattwali fuq konverżazzjonijiet ta’ ChatGPT li tneħħewlhom id-dettalji identifikattivi u li fihom l-utenti kienu rrappurtaw żball fattwali minn mudell preċedenti. Dawn il-konverżazzjonijiet li jwasslu għal żbalji ma jirrappreżentawx l-użu tipiku, fejn l-iżbalji fattwali huma aktar rari.
GPT‑6.1 Sol juri titjib sostanzjali fuq GPT‑6 Sol fl-evalwazzjonijiet tagħna tal-allinjament, u b’hekk joqrob lejn GPT‑6 Astra.
GPT‑6.1 Sol huwa aktar trasparenti dwar il-limitazzjonijiet tiegħu u aktar affidabbli fir-rispett tal-intenzjoni tal-utent u tal-limiti ta’ sikurezza. F’evalwazzjonijiet diffiċli, juri rati ta’ falliment aktar baxxi minn GPT‑6 Sol fit-trasparenza dwar għodod tat-tiftix li ma jaħdmux, fir-rispett ta’ restrizzjonijiet espliċiti u fl-evitar ta’ riżultati mhux awtorizzati waqt kompiti mwettqa minn aġenti. Ma osservajna l-ebda tentattiv biex jiġi evitat reviżur awtomatizzat tas-sikurezza, l-istess bħal GPT‑6 Astra u GPT‑6 Sol.
L-evalwazzjonijiet hawn taħt jittestjaw apposta sitwazzjonijiet diffiċli u ma jkejlux ir-rati ta’ falliment fl-użu tipiku.
GPT‑6.1 Sol huwa disponibbli mil-lum għall-utenti kollha ta’ Plus, Pro, Business, Enterprise u Edu f’ChatGPT Work u Codex. Dawn il-mudelli għadhom mhumiex disponibbli f’Chat. L-iżviluppaturi jistgħu jaċċessawh ukoll permezz tal-API ta’ OpenAI bħala gpt-6.1-sol. Il-prezzijiet standard tiegħu fl-API huma $2 għal kull miljun token tal-input, $0.10 għal kull miljun token tal-input fil-cache u $10 għal kull miljun token tal-output.
Fl-istess ħin, qed inniedu GPT‑6 Astra Ultrafast, l-aktar mudell avvanzat veloċi fid-dinja, sa 8 darbiet aktar veloċi minn GPT‑6 Astra, kif ukoll GPT‑6.1 Sol Ultrafast. Dawn huma disponibbli fl-API kif ukoll f’ChatGPT Work u Codex għall-utenti tal-livell il-ġdid tagħna ta’ Pro bl-ogħla limiti ta’ użu, għal $500 fix-xahar. B’GPT‑6.1 Sol Ultrafast, l-iżviluppaturi jistgħu jiksbu intelliġenza qrib dik ta’ Astra b’veloċità sa 8 darbiet akbar, għal madwar l-istess nefqa fl-API bħal dik ta’ GPT‑6 Astra qabel.
Awtur
L-evalwazzjonijiet ta’ GPT saru fl-ambjent tar-riċerka tagħna jew permezz tal-API tagħna, li jistgħu jagħtu riżultati kemxejn differenti minn dawk ta’ ChatGPT disponibbli għall-utenti minħabba differenzi fil-prompts tas-sistema, l-għodod disponibbli, il-livelli ta’ sforz, eċċ. L-evalwazzjonijiet tal-mudelli tal-kompetituri ttieħdu minn rapporti disponibbli pubblikament.

