GPT-6.1Sol
Akili inayokaribia Astra kwa bei ya moja ya tano, ikidumisha utendaji wa mpaka
Tunatambulisha GPT‑6.1 Sol, toleo lililoboreshwa la GPT‑6 Sol lenye utendaji mzuri sana katika usimbaji wa kiwakala, pamoja na matumizi ya kompyuta na kazi za kitaalamu. Inaisogeza Sol karibu na GPT‑6 Astra katika kazi ngumu, kwa moja ya tano ya bei za kawaida za tokeni za ingizo na tokeo za Astra. Hii inawapa wasanidi nafasi zaidi ya kuunda na kuendesha mawakala wenye uwezo bila kuongeza bajeti.
GPT‑6.1 Sol hutoa utendaji unaokaribia Astra kwa bei za Sol, na hivyo kuwa muundo unaotoa thamani bora zaidi kwa gharama kulingana na utendaji wake leo. Ingizo lililohifadhiwa kwenye akiba hugharimu $0.10 tu kwa tokeni milioni moja—punguzo la 95% kwa bei ya kawaida ya ingizo. Hii hupunguza gharama za kazi za kiwakala zinazohitaji kutumia tena muktadha katika maombi yanayorudiwa.
GPT‑6 Astra bado ndio muundo wetu wa mpaka wenye uwezo mkubwa zaidi kwa ujumla. GPT‑6.1 Sol hutoa uwiano mpya wa uwezo na gharama kwa kazi muhimu ambazo watumiaji wanataka kufanya mara nyingi zaidi, na kwa wateja wa API wanaounda na kuendesha programu kwa kiwango kikubwa.

GPT‑6.1 Sol imeboreshwa kwa kiasi kikubwa ikilinganishwa na GPT‑6 Sol katika kazi changamano za kitaalamu, kuanzia kuandika msimbo na kuondoa hitilafu hadi kuelewa hati na kutekeleza taratibu za biashara zenye hatua nyingi. Katika tathmini kadhaa kati ya hizi, inakaribia utendaji wa GPT‑6 Astra kwa gharama ya chini sana.
Katika DeepSWE v1.1, inayotathmini kazi changamano za uhandisi wa programu kwenye hazina halisi za msimbo, GPT‑6.1 Sol inalingana na GPT‑6 Astra kwa takriban moja ya tano ya gharama. Pia inazidi alama bora zaidi ya GPT‑6 Sol kwa pointi 6.4 za asilimia kwa juhudi chache za uwazaji na gharama ndogo.
Katika DeepSWE 1.1(fungua katika dirisha jipya), mawakala wa AI hutatua kazi mpya za uhandisi wa programu zinazohitaji utekelezaji wa muda mrefu.
Katika GDP.pdf, inayopima usahihi wa miundo katika kujibu maswali ya kitaalamu kwa kutumia hati changamano za PDF zenye majedwali, chati, michoro na maelezo ya maandishi madogo, GPT‑6.1 Sol inapata alama ya juu kuliko Opus 5.5 yenye mbinu mbadala. Gharama yake kwa kila kazi ni chini ya nusu katika mipangilio yote ya uwazaji iliyojaribiwa. Pia inakaribia utendaji wa hali ya juu zaidi wa GPT‑6 Astra kwa takriban moja ya tano ya gharama kwa kila kazi.
Katika GDP.pdf(fungua katika dirisha jipya), modeli lazima zijibu maombi yanayoakisi hali halisi kuhusu PDF changamano zinazotokana na michakato ya kazi katika fedha, huduma za afya, sheria na nyanja nyingine saba za kitaaluma.
Katika AutomationBench, inayopima kama mawakala hukamilisha kwa usahihi taratibu za biashara zenye hatua nyingi, GPT‑6.1 Sol inaizidi Opus 5.5 kwa pointi 2.2 za asilimia kwa juhudi za uwazaji za kiwango cha Wastani, kwa takriban theluthi moja ya gharama. Alama hiyo pia inazidi ile ya GPT‑6 Sol kwa pointi 4.8 za asilimia katika mpangilio huo huo.
In AutomationBench 1.0.6(fungua katika dirisha jipya), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol pia imepiga hatua kubwa katika kazi zinazohitaji kutumia programu za kompyuta. Katika seti ya nje ya mtandao ya OSWorld 2.0, inayotathmini mawakala kwenye taratibu ngumu za matumizi ya kompyuta, GPT‑6.1 Sol inaizidi GPT‑6 Sol kwa pointi saba za asilimia kwa juhudi za uwazaji za kiwango cha juu kabisa, kwa chini ya nusu ya gharama. Inakaribia alama ya Astra kwa tofauti ya pointi 2.1 za asilimia kwa juhudi za uwazaji za kiwango cha juu kabisa, kwa takriban moja ya saba ya gharama kwa kila kazi.
In OSWorld 2.0(fungua katika dirisha jipya), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Katika Terminal-Bench Science 0.1, inayotathmini taratibu za kisayansi zikiwemo uchanganuzi wa data, uigaji na uthibitishaji wa nadharia, GPT‑6.1 Sol inapata zaidi ya mara mbili ya alama ya GPT‑6 Sol kwa juhudi za uwazaji za kiwango cha juu kabisa, kwa chini ya nusu ya gharama kwa kila kazi. Kwa juhudi za kiwango cha juu kabisa, GPT‑6.1 Sol hugharimu wastani wa $5.47 kwa kila kazi, ikilinganishwa na $23.21 kwa Opus 5.5 na $23.80 kwa Astra. Hutoa uwezo mkubwa wa kisayansi kwa gharama iliyo chini kwa zaidi ya 75% kuliko kila mmoja wa miundo hiyo.
GPT‑6 Astra bado inapata alama ya juu zaidi kati ya miundo iliyojaribiwa, ikiwa na 68.1%, na inapaswa kutumiwa kwa kazi ngumu zaidi za utafiti wa kisayansi.
Katika Terminal-Bench Science 0.1(fungua katika dirisha jipya), mawakala hukamilisha michakato ya utafiti wa kisayansi kwa kutumia msimbo na zana za terminal, ikiwemo kuchanganua data, kuendesha uigaji na kukadiria vigezo vya modeli kulingana na data.
GPT‑6.1 Sol pia inaboresha usahihi wa ukweli inapojibu maagizo magumu. Kwa juhudi za uwazaji za kiwango cha juu sana, kiwango chake cha makosa ya ukweli ni 4.1%, chini ya 4.5% ya GPT‑6 Sol na karibu zaidi na 4.0% ya Astra katika mpangilio huo huo, huku gharama kwa kila kazi ikiwa takriban 83% chini ya ile ya Astra.
Tathmini hii hupima sehemu ya majibu yenye angalau kosa moja la ukweli katika mazungumzo yaliyoondolewa taarifa za utambulisho, ambapo watumiaji waliripoti kosa la muundo wa awali. Maagizo haya yaliyofanywa kuwa magumu kimakusudi hayawakilishi matumizi ya kawaida.
Tunatathmini usahihi wa ukweli kwa kutumia mazungumzo ya ChatGPT yaliyoondolewa taarifa za utambulisho, ambapo watumiaji walikuwa wameripoti kosa la ukweli kutoka kwa muundo wa awali. Mazungumzo haya yanayochochea makosa hayawakilishi matumizi ya kawaida, ambapo makosa ya ukweli hutokea mara chache zaidi.
GPT‑6.1 Sol inaonyesha maboresho makubwa dhidi ya GPT‑6 Sol katika tathmini zetu za kuendana na matarajio, na kuikaribisha zaidi kwa GPT‑6 Astra.
GPT‑6.1 Sol ina uwazi zaidi kuhusu mipaka ya uwezo wake na inategemewa zaidi katika kuheshimu nia ya mtumiaji na masharti ya usalama. Katika tathmini ngumu, ina viwango vya chini vya kushindwa kuliko GPT‑6 Sol kuhusu uwazi wa hitilafu za zana za utafutaji, kuheshimu vizuizi vilivyowekwa wazi na kuepuka matokeo yasiyoidhinishwa wakati wa kazi za kiwakala. Hatukuona majaribio yoyote ya kukwepa mkaguzi wa usalama wa kiotomatiki, sawa na GPT‑6 Astra na GPT‑6 Sol.
Tathmini zilizo hapa chini hujaribu hali ngumu kimakusudi na hazipimi viwango vya kushindwa katika matumizi ya kawaida.
Kuanzia leo, GPT‑6.1 Sol inapatikana kwa watumiaji wote wa Plus, Pro, Business, Enterprise na Edu katika ChatGPT Work na Codex. Miundo hii bado haipatikani katika Chat. Wasanidi pia wanaweza kuifikia kupitia API ya OpenAI kama gpt-6.1-sol. Bei zake za kawaida za API ni $2 kwa tokeni milioni moja za ingizo, $0.10 kwa tokeni milioni moja za ingizo lililohifadhiwa kwenye akiba na $10 kwa tokeni milioni moja za tokeo.
Pamoja na hayo, tunazindua GPT‑6 Astra Ultrafast, muundo wa mpaka wenye kasi zaidi duniani, hadi mara 8 ya kasi ya GPT‑6 Astra, pamoja na GPT‑6.1 Sol Ultrafast. Hii inapatikana katika API pamoja na ChatGPT Work na Codex kwa watumiaji wa daraja letu jipya la Pro lenye kiwango cha juu zaidi cha matumizi, kwa $500 kwa mwezi. Kwa GPT‑6.1 Sol Ultrafast, wasanidi wanaweza kupata akili inayokaribia Astra kwa kasi ya hadi mara 8, wakitumia takriban kiasi kilekile walichotumia awali kwa API ya GPT‑6 Astra.
Mwandishi
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

