GPT-6.1Sol
Talinong halos kapantay ng Astra sa ikalimang bahagi ng presyo, para sa tuloy-tuloy na frontier na pagganap
Ipinapakilala namin ang GPT‑6.1 Sol, isang pag-upgrade sa GPT‑6 Sol na may napakahusay na pagganap sa agentic coding, pati sa paggamit ng computer at propesyonal na gawain. Inilalapit nito ang Sol sa GPT‑6 Astra sa mahihirap na gawain, sa ikalimang bahagi ng karaniwang presyo ng input at output token ng Astra. Mas marami nang magagawa ang mga developer sa pagbuo at pagpapatakbo ng mahuhusay na agent sa parehong badyet.
Hatid ng GPT‑6.1 Sol ang pagganap na halos kapantay ng Astra sa presyo ng Sol, kaya ito ang pinakasulit na modelo ngayon para sa antas ng pagganap nito. $0.10 lang kada milyong token ang naka-cache na input—95% na diskwento sa karaniwang presyo ng input. Mas abot-kaya ito para sa mga gawaing gumagamit ng agent na kailangang gumamit muli ng konteksto sa paulit-ulit na request.
Ang GPT‑6 Astra pa rin ang aming pinakamahusay na frontier na modelo sa kabuuan. Nag-aalok ang GPT‑6.1 Sol ng bagong balanse ng kakayahan at gastos para sa mahahalagang gawaing gustong gawin nang mas madalas ng mga user, at para sa mga customer ng API na bumubuo at nagpapatakbo ng mga application sa malawakang saklaw.

Malaki ang inilamang ng GPT‑6.1 Sol sa GPT‑6 Sol sa masalimuot na propesyonal na gawain, mula sa pagsulat at pag-debug ng code hanggang sa pag-unawa sa mga dokumento at pagsasagawa ng mga workflow sa negosyo na may maraming hakbang. Sa ilan sa mga pagsusuring ito, lumalapit ito sa pagganap ng GPT‑6 Astra sa mas mababang gastos.
Sa DeepSWE v1.1, na sumusuri sa masalimuot na software-engineering task sa mga totoong codebase, tinatapatan ng GPT‑6.1 Sol ang GPT‑6 Astra sa humigit-kumulang ikalimang bahagi ng gastos. Nalalampasan din nito nang 6.4 na percentage point ang pinakamataas na score ng GPT‑6 Sol sa mas mababang antas ng pagsisikap sa pangangatwiran at gastos.
Sa DeepSWE 1.1(magbubukas sa bagong window), nilulutas ng mga AI agent ang mga orihinal na gawain sa software engineering na nangangailangan ng pangmatagalang pagpaplano at pagpapatupad.
Sa GDP.pdf, na sumusukat kung gaano katumpak sumagot ang mga modelo sa mga propesyonal na tanong gamit ang masalimuot na PDF na may mga talahanayan, chart, diagram, at detalyeng nasa maliliit na letra, mas mataas ang score ng GPT‑6.1 Sol kaysa sa Opus 5.5 na may mga fallback, sa wala pang kalahati ng gastos bawat gawain sa lahat ng sinubok na setting ng pangangatwiran. Lumalapit din ito sa nangungunang pagganap ng GPT‑6 Astra sa humigit-kumulang ikalimang bahagi ng gastos bawat gawain.
Sa GDP.pdf(magbubukas sa bagong window), kailangang sagutin ng mga modelo ang mga prompt mula sa aktuwal na trabaho tungkol sa mga kumplikadong PDF na ginagamit sa mga propesyonal na proseso sa pananalapi, pangangalagang pangkalusugan, batas, at pitong iba pang propesyonal na larangan.
Sa AutomationBench, na sumusukat kung tama ang pagkumpleto ng mga agent sa mga workflow sa negosyo na may maraming hakbang, mas mataas nang 2.2 na percentage point ang score ng GPT‑6.1 Sol kaysa sa Opus 5.5 sa Medium na antas ng pagsisikap sa pangangatwiran, sa humigit-kumulang ikatlong bahagi ng gastos. Mas mataas din nang 4.8 na percentage point ang score na iyon kaysa sa GPT‑6 Sol sa parehong setting.
In AutomationBench 1.0.6(magbubukas sa bagong window), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
Malaki rin ang pag-unlad ng GPT‑6.1 Sol sa mga gawaing nangangailangan ng pakikipag-ugnayan sa mga application sa computer. Sa offline na set ng OSWorld 2.0, na sumusuri sa mga agent sa mahihirap na workflow sa paggamit ng computer, mas mataas nang pitong percentage point ang score ng GPT‑6.1 Sol kaysa sa GPT‑6 Sol sa pinakamataas na antas ng pagsisikap sa pangangatwiran, sa wala pang kalahati ng gastos. 2.1 percentage point na lang ang agwat nito sa score ng Astra sa pinakamataas na antas ng pagsisikap sa pangangatwiran, sa humigit-kumulang ikapitong bahagi ng gastos bawat gawain.
In OSWorld 2.0(magbubukas sa bagong window), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Sa Terminal-Bench Science 0.1, na sumusuri sa mga siyentipikong workflow gaya ng pagsusuri ng data, simulation, at pagpapatunay ng theorem, mahigit doble ang score ng GPT‑6.1 Sol kumpara sa GPT‑6 Sol sa pinakamataas na antas ng pagsisikap sa pangangatwiran, sa wala pang kalahati ng gastos bawat gawain. Sa pinakamataas na antas ng pagsisikap, $5.47 ang average na gastos bawat gawain sa GPT‑6.1 Sol, kumpara sa $23.21 sa Opus 5.5 at $23.80 sa Astra. Hatid nito ang mahusay na kakayahang siyentipiko sa gastos na mahigit 75% na mas mababa kaysa sa alinman sa dalawang modelo.
GPT‑6 Astra pa rin ang may pinakamataas na score sa mga sinubok na modelo, sa 68.1%, at ito ang dapat gamitin sa pinakamahihirap na gawaing siyentipiko sa pananaliksik.
Sa Terminal-Bench Science 0.1(magbubukas sa bagong window), kinukumpleto ng mga agent ang mga proseso ng siyentipikong pananaliksik gamit ang code at mga tool sa terminal, kabilang ang pagsusuri ng datos, pagpapatakbo ng mga simulation, at pag-aangkop ng mga modelo sa datos.
Mas tumpak din ang impormasyong ibinibigay ng GPT‑6.1 Sol sa mahihirap na prompt. Sa napakataas na antas ng pagsisikap sa pangangatwiran, 4.1% ang porsyento ng maling impormasyon nito, mas mababa kaysa sa 4.5% ng GPT‑6 Sol at mas malapit sa 4.0% ng Astra sa parehong setting, habang humigit-kumulang 83% na mas mababa ang gastos bawat gawain kaysa sa Astra.
Sinusukat ng pagsusuring ito ang bahagdan ng mga sagot na may kahit isang maling impormasyon sa mga pag-uusap na inalisan ng impormasyong makakapagpakilala sa user, kung saan iniulat ng mga user ang pagkakamali ng naunang modelo. Ang mga prompt na ito na sadyang mahihirap ay hindi kumakatawan sa karaniwang paggamit.
Sinusuri namin ang katumpakan ng impormasyon gamit ang mga pag-uusap sa ChatGPT na inalisan ng impormasyong makakapagpakilala sa user, kung saan iniulat ng mga user ang maling impormasyon mula sa naunang modelo. Ang mga pag-uusap na ito na nagdudulot ng pagkakamali ay hindi kumakatawan sa karaniwang paggamit, kung saan mas bihira ang maling impormasyon.
Malaki ang inilamang ng GPT‑6.1 Sol sa GPT‑6 Sol sa aming mga pagsusuri ng pagkakaayon sa inaasahang asal, kaya mas malapit na ito sa GPT‑6 Astra.
Mas tapat ang GPT‑6.1 Sol tungkol sa mga limitasyon nito at mas maaasahan sa paggalang sa layunin ng user at mga limitasyon para sa kaligtasan. Sa mahihirap na pagsusuri, mas mababa ang porsyento ng pagkabigo nito kaysa sa GPT‑6 Sol sa pagsasabi na sira ang mga tool sa paghahanap, paggalang sa tahasang mga paghihigpit, at pag-iwas sa mga resultang walang pahintulot habang gumagawa ang mga agent. Wala kaming naobserbahang pagtatangkang lampasan ang awtomatikong tagasuri ng kaligtasan, gaya ng sa GPT‑6 Astra at GPT‑6 Sol.
Sadyang sinusubok ng mga pagsusuri sa ibaba ang mahihirap na sitwasyon at hindi sinusukat ang porsyento ng pagkabigo sa karaniwang paggamit.
Simula ngayon, magagamit na ang GPT‑6.1 Sol ng lahat ng user ng Plus, Pro, Business, Enterprise, at Edu sa ChatGPT Work at Codex. Hindi pa magagamit ang mga modelong ito sa Chat. Maaari rin itong ma-access ng mga developer sa OpenAI API bilang gpt-6.1-sol. Ang karaniwang presyo nito sa API ay $2 kada milyong input token, $0.10 kada milyong naka-cache na input token, at $10 kada milyong output token.
Kasabay nito, inilulunsad namin ang GPT‑6 Astra Ultrafast, ang pinakamabilis na frontier na modelo sa mundo na hanggang 8x ang bilis kumpara sa GPT‑6 Astra, pati ang GPT‑6.1 Sol Ultrafast. Magagamit ang mga ito sa API, pati sa ChatGPT Work at Codex ng mga user sa bago naming Pro tier na may pinakamataas na limitasyon sa paggamit, sa halagang $500/buwan. Sa GPT‑6.1 Sol Ultrafast, makakakuha ang mga developer ng talinong halos kapantay ng Astra sa hanggang 8× na bilis, sa halos kaparehong gastos sa API ng dating GPT‑6 Astra.
May-akda
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

