GPT-6.1Sol
Inteligjencë pranë nivelit të Astra me një të pestën e çmimit, për performancë të qëndrueshme avangardë
Po prezantojmë GPT‑6.1 Sol, një përmirësim të GPT‑6 Sol me performancë jashtëzakonisht të lartë në kodimin agjentik, si edhe në përdorimin e kompjuterit dhe punën profesionale. Ai e afron Sol me GPT‑6 Astra në detyra të vështira, me një të pestën e çmimeve standarde të Astra për token hyrës dhe dalës, duke u dhënë zhvilluesve më shumë hapësirë për të ndërtuar dhe vënë në punë agjentë të aftë brenda të njëjtit buxhet.
GPT‑6.1 Sol sjell performancë pranë nivelit të Astra me çmimet e Sol, duke u bërë modeli me raportin më të mirë kosto-performancë që ofrohet sot. Hyrja e ruajtur në cache kushton vetëm 0,10 $ për një milion token—95% më pak se çmimi standard i hyrjes—duke e bërë më të përballueshëm për ngarkesa pune agjentike që kërkojnë ripërdorimin e kontekstit në kërkesa të përsëritura.
GPT‑6 Astra mbetet modeli ynë avangardë më i aftë në tërësi. GPT‑6.1 Sol ofron një ekuilibër të ri mes aftësisë dhe kostos për punët e rëndësishme që përdoruesit duan të bëjnë më shpesh dhe për klientët e API-së që ndërtojnë dhe vënë në punë aplikacione në shkallë të gjerë.

GPT‑6.1 Sol sjell përmirësime të ndjeshme ndaj GPT‑6 Sol në punë profesionale komplekse, nga shkrimi i kodit dhe ndreqja e gabimeve në të, deri te kuptimi i dokumenteve dhe kryerja e proceseve të biznesit me shumë hapa. Në disa prej këtyre vlerësimeve, ai i afrohet performancës së GPT‑6 Astra me kosto dukshëm më të ulët.
Në DeepSWE v1.1, që vlerëson detyra komplekse të inxhinierisë softuerike në baza reale kodi, GPT‑6.1 Sol barazon GPT‑6 Astra me rreth një të pestën e kostos, ndërsa tejkalon rezultatin më të mirë të GPT‑6 Sol me 6,4 pikë përqindjeje, me më pak përpjekje arsyetimi dhe kosto më të ulët.
Në DeepSWE 1.1(hapet në një dritare të re), agjentët e IA-së zgjidhin detyra origjinale dhe afatgjata të inxhinierisë së softuerit.
Në GDP.pdf, që mat sa saktë u përgjigjen modelet pyetjeve profesionale duke përdorur dokumente komplekse PDF, përfshirë tabela, grafikë, diagrame dhe hollësi me shkrim të imët, GPT‑6.1 Sol shënon rezultat më të lartë se Opus 5.5 me alternativa rezervë, me më pak se gjysmën e kostos për detyrë në të gjitha nivelet e arsyetimit të testuara. Ai gjithashtu i afrohet performancës më të avancuar të GPT‑6 Astra me rreth një të pestën e kostos për detyrë.
Në GDP.pdf(hapet në një dritare të re), modelet duhet t’u përgjigjen kërkesave nga praktika reale për dokumente komplekse PDF, të marra nga proceset e punës në financë, shëndetësi, drejtësi dhe shtatë fusha të tjera profesionale.
Në AutomationBench, që mat nëse agjentët kryejnë saktë procese biznesi me shumë hapa, GPT‑6.1 Sol shënon 2,2 pikë përqindjeje më shumë se Opus 5.5 me përpjekje mesatare arsyetimi, me rreth një të tretën e kostos. Ky rezultat është gjithashtu 4,8 pikë përqindjeje më i lartë se ai i GPT‑6 Sol në të njëjtin nivel.
In AutomationBench 1.0.6(hapet në një dritare të re), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol bën gjithashtu përparim të ndjeshëm në detyra që kërkojnë ndërveprim me aplikacione kompjuterike. Në grupin e testeve pa lidhje interneti të OSWorld 2.0, që vlerëson agjentët në procese të vështira pune me kompjuter, GPT‑6.1 Sol tejkalon GPT‑6 Sol me shtatë pikë përqindjeje në nivelin maksimal të përpjekjes së arsyetimit, me më pak se gjysmën e kostos. Në nivelin maksimal të përpjekjes së arsyetimit, ai arrin vetëm 2,1 pikë përqindjeje larg rezultatit të Astra, me rreth një të shtatën e kostos për detyrë.
In OSWorld 2.0(hapet në një dritare të re), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Në Terminal-Bench Science 0.1, që vlerëson procese pune shkencore, përfshirë analizën e të dhënave, simulimin dhe vërtetimin e teoremave, GPT‑6.1 Sol arrin më shumë se dyfishin e rezultatit të GPT‑6 Sol në nivelin maksimal të përpjekjes së arsyetimit, me më pak se gjysmën e kostos për detyrë. Me përpjekje maksimale, GPT‑6.1 Sol kushton mesatarisht 5,47 $ për detyrë, krahasuar me 23,21 $ për Opus 5.5 dhe 23,80 $ për Astra, duke ofruar aftësi të konsiderueshme shkencore me kosto mbi 75% më të ulët se secili prej këtyre modeleve.
GPT‑6 Astra ende arrin rezultatin më të lartë mes modeleve të testuara, me 68,1%, dhe duhet përdorur për detyrat më të vështira të kërkimit shkencor.
Në Terminal-Bench Science 0.1(hapet në një dritare të re), agjentët kryejnë procese kërkimore shkencore duke përdorur kod dhe mjete të terminalit, përfshirë analizën e të dhënave, ekzekutimin e simulimeve dhe përshtatjen e modeleve.
GPT‑6.1 Sol përmirëson gjithashtu saktësinë faktike në kërkesa të vështira. Me përpjekje shumë të lartë arsyetimi, shkalla e gabimeve faktike të tij është 4,1%, në ulje nga 4,5% e GPT‑6 Sol dhe më pranë nivelit 4,0% të Astra me të njëjtin cilësim, ndërsa kushton afërsisht 83% më pak për detyrë se Astra.
Ky vlerësim mat përqindjen e përgjigjeve që përmbajnë të paktën një gabim faktik në biseda me të dhënat identifikuese të hequra, ku përdoruesit kishin raportuar gabimin e një modeli të mëparshëm. Këto kërkesa, të zgjedhura qëllimisht për vështirësinë e tyre, nuk përfaqësojnë përdorimin tipik.
Saktësinë faktike e vlerësojmë në biseda të ChatGPT me të dhënat identifikuese të hequra, ku përdoruesit kishin raportuar një gabim faktik të një modeli të mëparshëm. Këto biseda që nxisin gabime nuk përfaqësojnë përdorimin tipik, ku gabimet faktike janë më të rralla.
GPT‑6.1 Sol tregon përmirësime të ndjeshme ndaj GPT‑6 Sol në vlerësimet tona të përputhjes me synimet dhe kufizimet, duke iu afruar GPT‑6 Astra.
GPT‑6.1 Sol është më transparent për kufizimet e veta dhe më i besueshëm në respektimin e synimit të përdoruesit dhe kufizimeve të sigurisë. Në vlerësime të vështira, ai tregon shkallë më të ulëta dështimi se GPT‑6 Sol për transparencën rreth mjeteve të kërkimit që nuk funksionojnë, respektimin e kufizimeve të shprehura qartë dhe shmangien e rezultateve të paautorizuara gjatë detyrave agjentike. Nuk vërejtëm asnjë përpjekje për të anashkaluar një kontrollues të automatizuar të sigurisë, njësoj si me GPT‑6 Astra dhe GPT‑6 Sol.
Vlerësimet më poshtë testojnë qëllimisht situata të vështira dhe nuk matin shkallët e dështimit në përdorim tipik.
GPT‑6.1 Sol është i disponueshëm nga sot për të gjithë përdoruesit e Plus, Pro, Business, Enterprise dhe Edu në ChatGPT Punë dhe Codex. Këto modele nuk janë ende të disponueshme në Bisedë. Zhvilluesit mund ta përdorin edhe përmes API-së së OpenAI si gpt-6.1-sol. Çmimet e tij standarde në API janë 2 $ për një milion token hyrës, 0,10 $ për një milion token hyrës të ruajtur në cache dhe 10 $ për një milion token dalës.
Krahas tij, po lançojmë GPT‑6 Astra Ultrafast, modelin avangardë më të shpejtë në botë, deri në 8 herë më të shpejtë se GPT‑6 Astra, si dhe GPT‑6.1 Sol Ultrafast. Këto janë të disponueshme në API, si edhe në ChatGPT Punë dhe Codex për përdoruesit e nivelit tonë të ri Pro me kufijtë më të lartë të përdorimit, për 500 $/muaj. Me GPT‑6.1 Sol Ultrafast, zhvilluesit mund të marrin inteligjencë pranë nivelit të Astra me shpejtësi deri në 8×, duke shpenzuar në API afërsisht sa shpenzonin më parë për GPT‑6 Astra.
Autori
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

