Үндсэн агуулга руу алгасах
OpenAI

GPT‑6 Sol болон Luna-г танилцуулж байна

Хил хязгаарын оюун ухааныг өдөр тутмын ажилдаа нэвтрүүлэх илүү олон арга.

Ачаалж байна…

Энэ сарын эхээр бид дэлхийн хамгийн ухаалаг, зорилгод хамгийн сайн нийцсэн загвар болох GPT‑6 Astra-г танилцуулсан. Хамгийн өндөр шаардлагатай, чухал төслүүдэд Astra-гийн бүрэн хүчин чадал хэрэгтэй хэвээр ч ажлын цар хүрээ, хэмнэл, төсөв харилцан адилгүй байдаг.

Тиймээс бид GPT‑6 ертөнцийг GPT‑6 Sol болон GPT‑6 Luna-аар өргөжүүлж байна. GPT‑6 Astra оюун ухааны шинэ үеийг эхлүүлсэн бол эдгээр загвар зардлын үр ашгийн хил хязгаарыг урагшлуулж, тэрхүү оюун ухааны үр өгөөжийг илүү өргөн хүрээнд түгээнэ. Бид GPT‑6 Sol болон Luna-г GPT‑6 Astra-тай төстэй аргаар сургаж, мэргэжлийн ажил, баримтын үнэн зөв байдал, кодчилол, компьютер ашиглалт, зорилготой нийцэх чадвараараа Astra-г тэргүүлэх түвшинд хүргэсэн дэвшлүүдийг илүү хурдан, хямд загваруудад нэвтрүүлсэн.

GPT‑6 загварууд зардал–оюун ухааны харьцааны бүх түвшинд онцгой чадварыг өргөн хүрээнд үр ашигтай хүргэх дэд бүтэцтэй хослуулан тэргүүлж байна. Кэшлэлт болон дүгнэлт гаргалтын сайжруулалт эдгээр загварыг бага зардлаар хүргэх боломж олгосон бөгөөд бид Sol, Luna-гийн API үнийг GPT‑5.6-н урамшуулалт үнээс 50%-иар бууруулж, хэмнэлтийг хэрэглэгчдэд шууд хүртээж байна. Эдгээр сайжруулалт нийлээд дэвшилтэт AI-г өдөр тутмын илүү олон ажил, өргөн хүрээний хэрэглээнд бодитоор ашиглах боломжтой болгож байна.

GPT‑6 API-н үнэ

Загвар

Оролт

Гаралт

Үнийн бууралт

GPT‑6 Sol
ба GPT‑5.6 Sol

$4 → $2

$20 → $10

50% хямд

GPT‑6 Luna
ба GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

50% хямд

Үнэ нь 1 сая токен тутамд.

GPT‑6 Astra бүх үзүүлэлтээр манай шилдэг загвар хэвээр байна. Хамгийн сайн үр дүн, ямар ч буултгүй туршлага хүсвэл үүнийг сонгоорой.

Загварын бүлэг бүхэлдээ ахисан нь

GPT‑6 Sol болон Luna нь нарийн төвөгтэй ажлыг гүйцэтгэхэд хамгийн хэрэгтэй чадваруудын хүрээнд таны хэдийн мэддэг, ашигладаг загваруудын оюун ухаан болон зардлын үр ашгийг сайжруулна.

Мэргэжлийн ажил

GPT‑6 Sol нь хүнд ажлуудыг гүйцэтгэхийн зэрэгцээ ашиглалтын өндөр хязгаар, бага зардлын ачаар дахин сайжруулах илүү их боломж олгож, ижил үнэтэй өрсөлдөгч загваруудаас илүү ухаалаг, сайн үр дүн үзүүлнэ.

Аппууд дамнасан бизнесийн ажлын урсгалыг шалгадаг AutomationBench дээр xhigh хүчин чармайлттай GPT‑6 Sol нь max хүчин чармайлттай Claude Opus 5-аас илүү үр дүнг нэг ажилд ногдох Opus 5-ын зардлын ердөө 9%-аар үзүүлэв. Өндөр хүчин чармайлтаар GPT‑6 Luna өмнөх загвараасаа 5.4 нэгж хувиар илүү үр дүн үзүүлэхдээ нэг ажлын зардлыг 58%-иар бууруулсан.

AutomationBench 1.0.6⁠(шинэ цонхонд нээгдэнэ)-д AI агентуудыг борлуулалт, маркетинг, үйл ажиллагаа, тусламж үйлчилгээ, санхүү, хүний нөөцийн 47 хэрэгслийг ашигласан эхнээс нь дуусталх ажлын урсгалаар шалгадаг. Claude Fable 5.1-ийн өгөгдлийн цэгт ажлын ~40%-д ашигласан Opus 5 нөөц хувилбарын зардлыг оруулаагүй тул бодит зардлыг дутуу харуулсан.

GPT‑6 Sol мөн Claude Fable 5.1-ээс хавьгүй бага зардлаар илүү үр дүн үзүүлж, бага хүчин чармайлттай GPT‑6 Astra-г ч давсан.

Загвар (ба хүчин чармайлт)

Оноо

Нэг ажлын зардал

GPT‑6 Sol (xhigh)

33.2%

$0.27

GPT‑6 Astra (бага)

30.3%

GPT‑6 Sol-оос 3.9 дахин

Claude Opus 5 (Max)

26.9%

GPT‑6 Sol-оос 11.1 дахин

Opus 5 нөөц хувилбартай Claude Fable 5.1 (Max)

31.4%

GPT‑6 Sol-оос >8.9 дахин

(нөөц хувилбарын зардлыг мэдээлээгүй)

Нарийн төвөгтэй мэргэжлийн ажлын урсгал дахь агентуудыг үнэлдэг Agents’ Last Exam-д max хүчин чармайлттай GPT‑6 Sol 56.4% авч, үнэлгээн дэх Claude Opus 5-ын хамгийн өндөр оноог нэг ажлын 60%-иар бага зардлаар давлаа.

Agents’ Last Exam V1⁠(шинэ цонхонд нээгдэнэ)-д AI агентуудыг компьютер дээр гүйцэтгэдэг мэргэжлийн ажлын ихэнх гол салбарыг хамарсан, 55 дэд салбар дахь урт хугацааны, эдийн засгийн үнэ цэнтэй ажлуудаар үнэлдэг.

Баримтын үнэн зөв байдал

Хариултын ашиг тус баримт зөв эсэхээс хамаардаг тул бид баримтын найдвартай байдлыг үргэлжлүүлэн сайжруулж байна. Хэрэглэгчид манай загваруудын алдааг тэмдэглэсэн, хувийн мэдээллийг нь арилгасан бодит ярианд тулгуурласан дотоод үнэлгээгээр GPT‑6 Sol өмнөх загварынхаа тал орчимтой тэнцэх алдаа гаргаж, хавьгүй бага зардлаар Astra-гийн найдвартай байдалд дөхөж байна. GPT‑6 Luna ч мэдэгдэхүйц сайжирсан; өндөр хүчин чармайлтын түвшинд GPT‑5.6 Sol-той ижил үр дүнг зардлынх нь зууны нэг орчмоор үзүүлнэ.

Энд хэрэглэгчид өмнөх загварын баримтын алдааг тэмдэглэсэн, хувийн мэдээллийг нь арилгасан ChatGPT яриан дээр баримтын үнэн зөв байдлыг үнэлэв. Алдаа гаргахад хүргэдэг эдгээр яриа нь баримтын алдаа хавьгүй ховор тохиолддог ердийн хэрэглээг төлөөлөхгүй. Оноог хариултын уртаар тохируулаагүй ч дэлгэрэнгүй байдлын туршилтаар хариултын уртаас бараг хамааралгүй байв.

Кодчилол

Энэ жил кодчиллын агентууд урьд өмнөхөөс илүү нарийн төвөгтэй, өргөн хүрээтэй, удаан үргэлжлэх ажлуудыг гүйцэтгэж эхэлсэн. OpenAI дахь дотоод хэрэглээ маань асар хурдацтай өссөн. API үнээр тооцвол токены өдөр тутмын хэрэглээ медиан судлаачийн хувьд $600, 90-р перцентил дэх судлаачдын хувьд $7,000-ыг давсан (Судалгааг хурдасгах нь: OpenAI доторх дүр зураг⁠). Кодчиллын агентууд илүү урт, өндөр шаардлагатай ажил гүйцэтгэхийн хэрээр тасралтгүй ашиглалтын зардал улам чухал болно. GPT‑6 Sol болон Luna нь кодчиллын өндөр гүйцэтгэлийг API-н бага үнэтэй хослуулснаар хөгжүүлэгчдэд дахин сайжруулах илүү их боломж, багуудад Codex-оор илүү том зорилго бүхий ажил гүйцэтгүүлэх итгэл өгнө.

Кодчиллын агентууд бодит кодын санд шууд нэгтгэхэд бэлэн өөрчлөлт гаргаж буй эсэхийг үнэлдэг FrontierCode дээр GPT‑6 Sol нь GPT‑5.6 Sol-оос мэдэгдэхүйц сайжирч, Claude Fable 5.1 xhigh-ийн үр дүнтэй хавьгүй бага зардлаар эн зэрэгцсэн.

FrontierCode 1.1 Main⁠(шинэ цонхонд нээгдэнэ)-д AI агентууд код бичих бөгөөд үүнийг зөв эсэхээс гадна тестийн чанар, хамрах хүрээний сахилга бат, кодын хэв маяг, кодын сангийн стандартыг мөрдсөн байдал зэрэг "нэгтгэх боломж"-оор үнэлдэг.

Бодит кодын сан дахь програм хангамжийн инженерчлэлийн нарийн төвөгтэй ажлын гүйцэтгэлийг шалгадаг DeepSWE v1.1 дээр max хүчин чармайлттай GPT‑6 Sol 68.8% авч, үнэлгээн дэх Claude Fable 5-ын хамгийн өндөр оноо болох xhigh хүчин чармайлтын 69.9%-аас ердөө 1.1 нэгж хувийн зөрүүтэй үр дүнг нэг ажлын ойролцоогоор 80%-иар бага зардлаар үзүүлэв.

Max хүчин чармайлттай GPT‑6 Luna 66.6% авч, medium хүчин чармайлттай Claude Opus 5 болон Fable 5-тай дүйцэх үр дүн үзүүлэв. Эдгээр харьцуулалтаар Luna-гийн нэг ажлын зардал Opus 5-аас 93%, Fable 5-аас 96%-иар бага байна.

DeepSWE 1.1⁠(шинэ цонхонд нээгдэнэ)-д AI агентууд програм хангамжийн инженерчлэлийн анхны, урт хугацааны ажлуудыг шийддэг.

Компьютер ашиглалт

GPT‑6 Astra компьютер ашиглалтаар дэлхийн шилдэг загвар хэвээр байгаа ч GPT‑6 Sol болон Luna өмнөх загваруудаасаа илүү зардлын үр ашигтай гүйцэтгэлтэй. OSWorld 2.0 offline дээр xhigh хүчин чармайлттай GPT‑6 Sol нь medium хүчин чармайлттай Claude Opus 5-тай ойролцоо буюу 60.5%, 60.3%-ийн оноо авч, нэг ажлын зардлыг ойролцоогоор 80%-иар бууруулсан. GPT‑6 Luna (max) нь GPT‑5.6 Sol (medium)-оос арав дахин бага зардлаар илүү үр дүн үзүүлнэ.

OSWorld 2.0⁠(шинэ цонхонд нээгдэнэ)-д AI агентууд өдөр тутмын болон мэргэжлийн ажлыг хамарсан компьютер ашиглалтын урт хугацааны ажлын урсгалыг гүйцэтгэхийг оролддог. Бид v2026.08.08 хувилбарын офлайн багц дахь хэсэгчилсэн шагналын үзүүлэлтийг тайлагнасан.

Хамтран ажиллах хэв маяг

Бид GPT‑6 Astra-гийн сайжруулсан харилцааны хэв маягийг Sol болон Luna-д мөн нэвтрүүлсэн бөгөөд энэ нь техникийн болон кодчиллын ярианд онцгой мэдэгдэхүйц байна гэж үзэж байна. Утга агуулгыг алдагдуулахгүйгээр илүү ойлгомжтой, мэргэжлийн үг хэллэг болон этгээд хэлц багатай, ач холбогдолгүй нарийн ширийн зүйл цөөн, ерөнхийдөө арай товч хариултуудыг хүлээгээрэй.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Хэв маяг нь субъектив боловч энд бид GPT‑6 Sol-ын хариултыг илүүд үзсэн. Энэ нь яаран дүгнэлт хийхгүй, асуусан хүнд ойлгомжтой байж болох зүйлсийг (жишээлбэл, вэбсайт дөрвөн хуудастайг) давтан тайлбарлахад бага хугацаа зарцуулж, "бенто төрх", "тэр системд нийцүүлэн дахин хэлбэржүүлэх" гэх мэт бүдэг үг хэллэгийг цөөн хэрэглэсэн. Мөн юу шалгасан, шалгаагүйгээ илүү ил тод хэлж, зургийн хэрэгслийн команд зэрэг хэрэгжүүлэлтийн шаардлагагүй нарийн ширийн зүйлийг хуваалцаагүй.

Агент болон урт ярианы кэшлэлтийг сайжруулах нь

Токены үнийг бууруулахын зэрэгцээ GPT‑6 дээр бүтээгдэхүүн бүтээж буй хөгжүүлэгчдэд аппынхаа дахин ашигладаг контекстийн зардлыг илүү хэмнэхэд тусалж байна. Бид GPT‑6‑н промптын кэшлэлтийг сайжруулж, анхдагч тохиргоогоор кэш онох хувийг нэмэгдүүлсэн. Ингэснээр агентууд илүү их контекстийг дахин ашиглаж, хурдан хариулан, кэшлэгдсэн оролтын токены уншилтад 90%-ийн хөнгөлөлт эдэлнэ.

Хөгжүүлэгчид кэшлэлтийн гүйцэтгэлээ хэмжиж, оновчлох илүү олон аргатай боллоо:

GitHub-ын мэдээлснээр сүүлийн хэдэн сард эдгээр сайжруулалт OpenAI загваруудад илгээсэн олон тэрбум хүсэлтийн хүрээнд шинээр боловсруулах шаардлагатай өгөгдлийн токены хувийг 50%-иас илүү бууруулж, Copilot-ыг хурдан хариулахад тусалжээ.

Зорилготой нийцэх чадварыг үргэлжлүүлэн сайжруулах нь

GPT‑6 Sol болон Luna нь өнөөг хүртэлх зорилготой хамгийн сайн нийцсэн загвар болох Astra-тай эхлүүлсэн нийцүүлэлтийн ажилд тулгуурласан. Бидний нийцүүлэлтийн үнэлгээгээр Sol болон Luna хоёулаа GPT‑5.6 дахь харгалзах загваруудаасаа сайжирсан бөгөөд үүнд кодчиллын ажлынхаа талаар төөрөгдүүлсэн мэдэгдэл хийх хувь буурсан нь багтана.

Доорх үнэлгээнүүд хүнд нөхцөлийг зориуд шалгадаг бөгөөд ердийн хэрэглээн дэх алдааны хувийг хэмжихгүй. Бүрэн үр дүнг системийн картаас⁠(шинэ цонхонд нээгдэнэ) үзнэ үү.

Хүртээмж

GPT‑6 Sol болон GPT‑6 Luna өнөөдрөөс эхлэн Plus, Pro, Business, Enterprise, Edu-н бүх хэрэглэгчид ChatGPT Work болон Codex-д ашиглах боломжтой боллоо. Free болон Go хэрэглэгчид десктоп апп дээр GPT‑6 Luna-г ашиглах боломжтой. Эдгээр загвар Чатад хараахан ашиглах боломжгүй. OpenAI API-д эдгээрийг gpt-6-sol болон gpt-6-luna нэрээр ашиглах боломжтой.

Үйлчилгээг хүн бүрд тогтвортой байлгахын тулд эдгээр загварыг өнөөдрийн турш ChatGPT‑д үе шаттай нэвтрүүлэхээр төлөвлөж байна. Хэрэв шинэ загварууд ChatGPT Work эсвэл Codex-д харагдахгүй байвал дараа дахин оролдоно уу.


GPT‑н үнэлгээг манай судалгааны орчинд эсвэл API-аар хийсэн бөгөөд системийн команд, ашиглах боломжтой хэрэгслүүд зэрэг ялгаанаас шалтгаалан үйлдвэрлэлийн ChatGPT‑ээс арай өөр гаралт өгч болно. Өрсөлдөгч загваруудын үнэлгээг олон нийтэд нээлттэй тайлангаас авсан. Claude Fable 5.1-ийн оноо байхгүй үед Claude Fable 5-ын оноог ашигласан.

Зохиогч

OpenAI