GPT-6.1Sol
Greind sem nálgast Astra á fimmtungi verðsins, með viðvarandi háþróaðri getu
Við kynnum GPT‑6.1 Sol, uppfærslu á GPT‑6 Sol sem sýnir einstaklega sterka frammistöðu í fulltrúakóðun, tölvunotkun og faglegri vinnu. Uppfærslan færir Sol nær GPT‑6 Astra í krefjandi verkefnum, á fimmtungi hefðbundins verðs Astra fyrir inntaks- og úttakstóka. Þannig fá forritarar meira svigrúm til að smíða og keyra öfluga fulltrúa innan sömu fjárhagsáætlunar.
GPT‑6.1 Sol býður upp á frammistöðu sem nálgast Astra á verði Sol og er því hagkvæmasta líkanið sem völ er á í dag miðað við getu. Skyndiminnt inntak kostar aðeins $0,10 á hverja milljón tóka — 95% lægra en hefðbundið inntaksverð. Það lækkar kostnað við verkefni fulltrúa sem þurfa að endurnýta samhengi í endurteknum beiðnum.
GPT‑6 Astra er áfram öflugasta háþróaða líkanið okkar á heildina litið. GPT‑6.1 Sol býður upp á nýtt jafnvægi milli getu og kostnaðar, bæði fyrir mikilvæg verkefni sem notendur vilja sinna oftar og fyrir viðskiptavini API sem smíða og keyra forrit í miklu umfangi.

GPT‑6.1 Sol er veruleg framför frá GPT‑6 Sol í flókinni faglegri vinnu, allt frá því að skrifa og aflúsa kóða til þess að skilja skjöl og framkvæma margþrepa verkferla í fyrirtækjum. Í nokkrum þessara prófa nálgast það frammistöðu GPT‑6 Astra með töluvert lægri kostnaði.
Í DeepSWE v1.1, sem metur flókin hugbúnaðarverkfræðiverkefni í raunverulegum kóðasöfnum, nær GPT‑6.1 Sol sama árangri og GPT‑6 Astra á um fimmtungi kostnaðarins. Jafnframt fer það 6,4 prósentustigum yfir bestu niðurstöðu GPT‑6 Sol með minna átaki við vinnslu raka og lægri kostnaði.
Í DeepSWE 1.1(opnast í nýjum glugga) leysa gervigreindarfulltrúar ný hugbúnaðarverkfræðiverkefni sem krefjast langrar vinnulotu.
Í GDP.pdf er mælt hversu nákvæmlega líkön svara faglegum spurningum út frá flóknum PDF-skjölum, meðal annars með töflum, gröfum, skýringarmyndum og smáu letri. Þar nær GPT‑6.1 Sol betri árangri en Opus 5.5 með varaleiðum á innan við helmingi kostnaðar á verkefni við allar prófaðar stillingar fyrir vinnslu raka. Það nálgast einnig framúrskarandi árangur GPT‑6 Astra á um fimmtungi kostnaðar á verkefni.
Í GDP.pdf(opnast í nýjum glugga) verða líkön að svara raunverulegum fyrirspurnum um flókin PDF-skjöl úr verkferlum á sviði fjármála, heilbrigðisþjónustu, lögfræði og sjö öðrum fagsviðum.
Í AutomationBench, sem mælir hvort fulltrúar ljúki margþrepa verkferlum í fyrirtækjum á réttan hátt, nær GPT‑6.1 Sol 2,2 prósentustigum betri árangri en Opus 5.5 með stillingunni Miðlungs fyrir vinnslu raka, á um þriðjungi kostnaðarins. Sá árangur er einnig 4,8 prósentustigum betri en hjá GPT‑6 Sol við sömu stillingu.
In AutomationBench 1.0.6(opnast í nýjum glugga), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol sýnir einnig verulegar framfarir í verkefnum sem krefjast samskipta við tölvuforrit. Í ótengda prófunarsafninu í OSWorld 2.0, sem metur fulltrúa í krefjandi verkferlum við tölvunotkun, nær GPT‑6.1 Sol sjö prósentustigum betri árangri en GPT‑6 Sol þegar átak við vinnslu raka er í hámarki, á innan við helmingi kostnaðarins. Það er aðeins 2,1 prósentustigi frá árangri Astra þegar átak við vinnslu raka er í hámarki, á um sjöunda hluta kostnaðar á verkefni.
In OSWorld 2.0(opnast í nýjum glugga), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Í Terminal-Bench Science 0.1, sem metur vísindalega verkferla, meðal annars gagnagreiningu, hermun og sönnun setninga, nær GPT‑6.1 Sol meira en tvöföldum árangri GPT‑6 Sol þegar átak við vinnslu raka er í hámarki, á innan við helmingi kostnaðar á verkefni. Við hámarksátak kostar GPT‑6.1 Sol að meðaltali $5,47 á verkefni, samanborið við $23,21 fyrir Opus 5.5 og $23,80 fyrir Astra. Það býður því upp á mikla getu í vísindum með yfir 75% lægri kostnaði en hvort hinna líkananna.
GPT‑6 Astra nær enn hæsta árangri prófaðra líkana, 68,1%, og ætti að nota við erfiðustu vísindarannsóknarverkefnin.
Í Terminal-Bench Science 0.1(opnast í nýjum glugga) ljúka gervigreindarfulltrúar verkferlum við vísindarannsóknir með kóða og skipanalínuverkfærum, meðal annars með því að greina gögn, keyra hermanir og aðlaga líkön að gögnum.
GPT‑6.1 Sol skilar einnig nákvæmari staðreyndum við erfiðar kvaðningar. Þegar átak við vinnslu raka er mjög hátt er tíðni staðreyndavillna 4,1%, samanborið við 4,5% hjá GPT‑6 Sol. Hún nálgast því 4,0% hjá Astra við sömu stillingu, en kostnaður á verkefni er um 83% lægri en hjá Astra.
Þetta mat mælir hlutfall svara sem innihalda að minnsta kosti eina staðreyndavillu í samtölum þar sem notendur höfðu bent á villu frá eldra líkani og persónuauðkenni hafa verið fjarlægð. Þessar kvaðningar eru viljandi erfiðar og endurspegla ekki dæmigerða notkun.
Við metum staðreyndanákvæmni út frá samtölum í ChatGPT þar sem notendur höfðu bent á staðreyndavillu frá eldra líkani og persónuauðkenni hafa verið fjarlægð. Þessi samtöl, sem kalla fram villur, endurspegla ekki dæmigerða notkun þar sem staðreyndavillur eru sjaldgæfari.
GPT‑6.1 Sol sýnir verulegar framfarir frá GPT‑6 Sol í mati okkar á samræmi við mannleg markmið og gildi og færist þar nær GPT‑6 Astra.
GPT‑6.1 Sol er skýrara um eigin takmarkanir og áreiðanlegra þegar kemur að því að virða ásetning notenda og öryggistakmarkanir. Í krefjandi prófum gerir það færri mistök en GPT‑6 Sol þegar kemur að því að upplýsa um óvirk leitarverkfæri, virða skýrar takmarkanir og forðast óheimilar niðurstöður í verkefnum fulltrúa. Við sáum engar tilraunir til að sniðganga sjálfvirkt öryggiseftirlit, rétt eins og hjá GPT‑6 Astra og GPT‑6 Sol.
Prófin hér fyrir neðan kanna vísvitandi krefjandi aðstæður og mæla ekki tíðni mistaka í dæmigerðri notkun.
GPT‑6.1 Sol er frá og með deginum í dag í boði fyrir alla Plus-, Pro-, Business-, Enterprise- og Edu-notendur í ChatGPT Vinna og Codex. Þessi líkön eru ekki enn í boði í Spjall. Forritarar geta einnig nálgast það í gegnum API OpenAI sem gpt-6.1-sol. Hefðbundið API-verð þess er $2 á hverja milljón inntakstóka, $0,10 á hverja milljón skyndiminntra inntakstóka og $10 á hverja milljón úttakstóka.
Samhliða kynnum við GPT‑6 Astra Ultrafast, hraðasta háþróaða líkan heims, sem er allt að 8 sinnum hraðara en GPT‑6 Astra, ásamt GPT‑6.1 Sol Ultrafast. Þessi líkön eru í boði í API, sem og í ChatGPT Vinna og Codex fyrir notendur á nýju Pro-áskriftarleiðinni okkar með hæstu notkunarmörkunum, á $500 á mánuði. Með GPT‑6.1 Sol Ultrafast geta forritarar fengið greind sem nálgast Astra á allt að áttföldum hraða, fyrir um það bil sama API-kostnað og áður með GPT‑6 Astra.
Höfundur
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

