Үндсэн агуулга руу алгасах
OpenAI

GPT-6.1Sol

Near-Astra intelligence for a fifth of the price

Агент шинжтэй кодчилол, компьютер ашиглалт болон мэргэжлийн ажилд онцгой өндөр гүйцэтгэлтэй, GPT‑6 Sol-ийн сайжруулсан хувилбар болох GPT‑6.1 Sol-ийг танилцуулж байна. Энэ хувилбар нь хүнд даалгавар дээр Sol-ийн гүйцэтгэлийг GPT‑6 Astra-д ойртуулж, Astra-гийн оролт, гаралтын токены ердийн үнийн тавны нэгээр үйлчилнэ. Ингэснээр хөгжүүлэгчид ижил төсвөөр чадварлаг агент бүтээж, ажиллуулах илүү өргөн боломжтой болно.

GPT‑6.1 Sol нь Sol-ийн үнээр Astra-тай ойролцоо гүйцэтгэлийг санал болгож буй тул өнөөдөр гүйцэтгэлтэйгээ харьцуулахад хамгийн хэмнэлттэй загвар болж байна. Кэшэлсэн оролтын нэг сая токен ердөө $0.10 буюу оролтын ердийн үнээс 95% хямд. Энэ нь давтагдсан хүсэлтүүдэд контекстийг дахин ашиглах шаардлагатай агентын ажлуудын зардлыг бууруулна.

GPT‑6 Astra нь ерөнхий чадвараараа манай хил хязгаар түвшний загваруудыг тэргүүлсэн хэвээр байна. GPT‑6.1 Sol нь чухал ажлаа илүү ойр ойрхон хийхийг хүсдэг хэрэглэгчид болон өргөн хүрээнд аппликэйшн бүтээж, ажиллуулдаг API хэрэглэгчдэд чадвар, зардлын шинэ тэнцвэрийг санал болгож байна.

Гурван загварын карт: GPT-6 Astra — хамгийн сайн үр дүнд зориулсан, бидний хамгийн өндөр оюуны чадамжтай загвар; оролт $10, гаралт $50, кэшэлсэн оролт $1. GPT-6.1 Sol — үнийн тавны нэгээр Astra-тай ойролцоо оюуны чадамж; оролт $2, гаралт $10, кэшэлсэн оролт $0.10. GPT-6 Luna — өдөр тутмын их хэмжээний ажлыг хурдан, үр ашигтай гүйцэтгэнэ; оролт $0.10, гаралт $0.50, кэшэлсэн оролт $0.01.

Төрөл бүрийн даалгаварт илүү чадварлаг Sol

Код бичиж, алдааг нь засахаас эхлээд баримт бичгийг ойлгож, бизнесийн олон алхамт ажлын урсгалыг гүйцэтгэх хүртэлх мэргэжлийн нарийн төвөгтэй ажилд GPT‑6.1 Sol нь GPT‑6 Sol-оос мэдэгдэхүйц сайжирсан. Эдгээр үнэлгээний хэд хэдэд нь GPT‑6 Astra-гийн гүйцэтгэлд хавьгүй бага зардлаар ойртож байна.

Кодчилол

Бодит кодын сан дахь программ хангамжийн инженерчлэлийн нарийн төвөгтэй даалгаврыг үнэлдэг DeepSWE v1.1 дээр GPT‑6.1 Sol нь GPT‑6 Astra-тай ойролцоогоор тавны нэг зардлаар дүйцсэн. Мөн сэтгэн бодох ачаалал, зардал багатай атлаа GPT‑6 Sol-ийн хамгийн өндөр оноог 6.4 нэгж хувиар давсан.

DeepSWE 1.1⁠⁠(шинэ цонхонд нээгдэнэ) үнэлгээнд хиймэл оюуны агентууд программ хангамжийн инженерчлэлийн шинээр зохиосон, олон үе шат дамжин гүйцэтгэх даалгавруудыг шийдвэрлэдэг.

Мэргэжлийн ажил

Хүснэгт, график, диаграмм, жижиг үсгээр бичсэн нарийн мэдээлэл агуулсан төвөгтэй PDF баримтад тулгуурлан мэргэжлийн асуултад хэр зөв хариулдгийг GDP.pdf үнэлгээ хэмждэг. Сэтгэн бодох ачааллын туршсан тохиргоонуудад GPT‑6.1 Sol нь нөөц хувилбарт шилжих боломжтой Opus 5.5-аас өндөр оноо авч, нэг даалгаврын зардал нь талаас ч бага байв. Мөн нэг даалгаврын зардал нь ойролцоогоор тавны нэг байхад GPT‑6 Astra-гийн тэргүүлэх гүйцэтгэлд ойртож байна.

GDP.pdf⁠(шинэ цонхонд нээгдэнэ) үнэлгээнд загварууд санхүү, эрүүл мэнд, хууль зүй болон мэргэжлийн бусад долоон салбарын ажлын явцад ашигладаг нарийн төвөгтэй PDF баримт бичгийн талаарх бодит даалгавруудад хариулах ёстой.

Агентууд бизнесийн олон алхамт ажлын урсгалыг зөв гүйцэтгэж байгаа эсэхийг хэмждэг AutomationBench дээр GPT‑6.1 Sol нь сэтгэн бодох ачааллын дунд түвшинд Opus 5.5-аас 2.2 нэгж хувиар өндөр оноо авч, зардал нь ойролцоогоор гуравны нэг байв. Энэ оноо нь мөн ижил тохиргоотой GPT‑6 Sol-ийнхоос 4.8 нэгж хувиар өндөр байна.

In AutomationBench 1.0.6⁠⁠(шинэ цонхонд нээгдэнэ), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Компьютер ашиглалт

GPT‑6.1 Sol нь компьютерын аппликэйшнтэй харьцаж ажиллах шаардлагатай даалгавруудад ч мэдэгдэхүйц ахиц гаргасан. Компьютер ашиглах нарийн төвөгтэй ажлын урсгалаар агентуудыг үнэлдэг OSWorld 2.0-ийн офлайн багц дээр GPT‑6.1 Sol нь сэтгэн бодох ачааллын дээд түвшинд GPT‑6 Sol-оос долоон нэгж хувиар илүү оноо авсан бөгөөд зардал нь талаас ч бага байв. Сэтгэн бодох ачааллын дээд түвшинд Astra-гийн оноонд 2.1 нэгж хувийн зөрүүтэй ойртсон бөгөөд нэг даалгаврын зардал нь ойролцоогоор долооны нэг байв.

In OSWorld 2.0⁠⁠(шинэ цонхонд нээгдэнэ), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Шинжлэх ухааны судалгаа

Өгөгдлийн шинжилгээ, симуляци, теорем батлах зэрэг шинжлэх ухааны ажлын урсгалыг үнэлдэг Terminal-Bench Science 0.1 дээр GPT‑6.1 Sol нь сэтгэн бодох ачааллын дээд түвшинд GPT‑6 Sol-ийн оноог хоёр дахинаас илүү давсан бөгөөд нэг даалгаврын зардал нь талаас ч бага байв. Сэтгэн бодох ачааллын дээд түвшинд GPT‑6.1 Sol-ийн нэг даалгаврын дундаж зардал $5.47 байхад Opus 5.5-ийнх $23.21, Astra-гийнх $23.80 байна. Ингэснээр эдгээр хоёр загвараас тус бүр 75%-иас илүү бага зардлаар шинжлэх ухааны өндөр чадварыг санал болгож байна.

GPT‑6 Astra нь 68.1%-ийн оноогоор туршсан загваруудыг тэргүүлсэн хэвээр бөгөөд шинжлэх ухааны судалгааны хамгийн хүнд даалгаварт энэ загварыг ашиглах нь зүйтэй.

Terminal-Bench Science 0.1⁠(шинэ цонхонд нээгдэнэ) үнэлгээнд агентууд код болон терминалын хэрэгслүүд ашиглан өгөгдөлд дүн шинжилгээ хийх, симуляц ажиллуулах, загварыг өгөгдөлд тааруулах зэрэг шинжлэх ухааны судалгааны ажлуудыг гүйцэтгэдэг.

Баримтын үнэн зөв байдал

GPT‑6.1 Sol нь хүнд асуулт, зааварт хариулахдаа ч баримтын үнэн зөв байдлыг сайжруулсан. Сэтгэн бодох ачааллын маш өндөр түвшинд баримтын алдааны хувь нь 4.1% болж, GPT‑6 Sol-ийн 4.5%-иас буурч, ижил тохиргоотой Astra-гийн 4.0%-д ойртсон. Харин нэг даалгаврын зардал нь Astra-гийнхаас ойролцоогоор 83% бага байна.

Энэ үнэлгээнд хэрэглэгчид өмнөх загварын алдааг тэмдэглэсэн, хувийн мэдээллийг нь арилгасан харилцан яриаг ашиглан дор хаяж нэг баримтын алдаа агуулсан хариултын хувийг хэмждэг. Зориуд сонгосон эдгээр хүнд асуулт, заавар нь ердийн хэрэглээг төлөөлөхгүй.

Бид өмнөх загварын баримтын алдааг хэрэглэгчид тэмдэглэсэн ChatGPT харилцан яриануудын хувийн мэдээллийг арилгаж, тэдгээрээр баримтын үнэн зөв байдлыг үнэлдэг. Алдаа гаргахад хүргэдэг эдгээр харилцан яриа нь баримтын алдаа илүү ховор гардаг ердийн хэрэглээг төлөөлөхгүй.

GPT‑6.1 Sol-ийг аюулгүй нэвтрүүлэх нь

Зорилго, шаардлагад нийцэж буй эсэхийг шалгах манай үнэлгээнүүдэд GPT‑6.1 Sol нь GPT‑6 Sol-оос мэдэгдэхүйц сайжирч, GPT‑6 Astra-д ойртсон.

GPT‑6.1 Sol нь өөрийн хязгаарлагдмал чадварыг илүү ил тод мэдэгдэж, хэрэглэгчийн зорилго болон аюулгүй байдлын хязгаарлалтыг илүү найдвартай дагаж мөрддөг. Хүнд нөхцөлтэй үнэлгээнүүдэд хайлтын хэрэгсэл ажиллахгүй байгааг ил тод мэдэгдэх, шууд заасан хязгаарлалтыг дагах, агентын даалгаврын явцад зөвшөөрөлгүй үр дүн гаргахаас зайлсхийх тал дээр GPT‑6 Sol-оос бага алдаа гаргасан. GPT‑6 Astra болон GPT‑6 Sol-ийн нэгэн адил аюулгүй байдлын автомат хяналтыг тойрох оролдлого ажиглагдаагүй.

Доорх үнэлгээнүүд нь зориуд хүнд нөхцөлийг шалгадаг бөгөөд ердийн хэрэглээнд гардаг алдааны хувийг хэмжихгүй.

Үнэ ба ашиглах боломж

Өнөөдрөөс эхлэн Plus, Pro, Business, Enterprise болон Edu-ийн бүх хэрэглэгч GPT‑6.1 Sol-ийг ChatGPT Ажил болон Codex-д ашиглах боломжтой. Эдгээр загварыг Чатад хараахан ашиглах боломжгүй. Хөгжүүлэгчид мөн OpenAI API-аар gpt-6.1-sol нэрээр ашиглаж болно. API-ийн ердийн үнэ нь нэг сая оролтын токенд $2, нэг сая кэшэлсэн оролтын токенд $0.10, нэг сая гаралтын токенд $10 байна.

Үүний зэрэгцээ GPT‑6 Astra-гаас 8 дахин хүртэл хурдан, дэлхийн хамгийн хурдан хил хязгаар түвшний загвар болох GPT‑6 Astra Ultrafast болон GPT‑6.1 Sol Ultrafast-ийг гаргаж байна. Эдгээрийг API-аар ашиглах боломжтой. Мөн сарын $500-ын төлбөртэй, хамгийн өндөр хэрэглээний хязгаартай манай шинэ Pro багцын хэрэглэгчид ChatGPT Ажил болон Codex-д ашиглаж болно. GPT‑6.1 Sol Ultrafast-ийн тусламжтай хөгжүүлэгчид өмнө нь GPT‑6 Astra-гийн API-д зарцуулдаг байсан ойролцоо зардлаар Astra-тай ойролцоо оюуны чадамжийг 8 дахин хүртэл өндөр хурдтай ашиглах боломжтой.

Зохиогч

OpenAI

GPT-ийн үнэлгээг судалгааны орчинд эсвэл манай API-аар хийсэн. Системийн заавар, ашиглах боломжтой хэрэгслүүд, сэтгэн бодох ачаалал зэрэг нь ялгаатай тул үр дүн нь хэрэглэгчдэд хүрч буй ChatGPT-ийнхээс бага зэрэг зөрж болно. Өрсөлдөгчдийн загварын үнэлгээг нийтэд нээлттэй тайлангаас авсан.