ขอแนะนำ GPT‑6 Sol และ Luna
เปิดโอกาสให้คุณนำความสามารถระดับแนวหน้ามาใช้กับงานประจำวันได้หลากหลายยิ่งขึ้น
เมื่อต้นเดือนนี้ เราได้เปิดตัว GPT‑6 Astra โมเดลที่ชาญฉลาดและสอดคล้องกับเจตนาของมนุษย์มากที่สุดในโลก แม้โปรเจกต์ที่สำคัญและท้าทายที่สุดยังคงต้องอาศัยความสามารถเชิงลึกอย่างเต็มที่ของ Astra แต่งานแต่ละประเภทก็มีขนาด จังหวะการทำงาน และงบประมาณที่แตกต่างกัน
ด้วยเหตุนี้ เราจึงขยายกลุ่มโมเดล GPT‑6 ด้วย GPT‑6 Sol และ GPT‑6 Luna GPT‑6 Astra ได้เปิดศักราชใหม่ของความสามารถอันชาญฉลาด และโมเดลทั้งสองนี้ช่วยขยายประโยชน์จากความสามารถดังกล่าวให้เข้าถึงผู้คนได้มากขึ้น ด้วยการผลักดันขีดจำกัดด้านความคุ้มค่าของต้นทุน เราฝึก GPT‑6 Sol และ Luna ด้วยแนวทางที่คล้ายกับ GPT‑6 Astra เพื่อนำความก้าวหน้าที่ทำให้ Astra มีประสิทธิภาพระดับแนวหน้าในด้านงานระดับมืออาชีพ ความถูกต้องของข้อเท็จจริง การเขียนโค้ด การใช้งานคอมพิวเตอร์ และการทำงานที่สอดคล้องกับเจตนาของมนุษย์ มาสู่โมเดลที่เร็วขึ้นและประหยัดยิ่งขึ้น
โมเดล GPT‑6 เป็นผู้นำในทุกระดับของความสมดุลระหว่างต้นทุนและความสามารถอันชาญฉลาด โดยผสานขีดความสามารถที่โดดเด่นในแต่ละระดับเข้ากับโครงสร้างพื้นฐานที่รองรับการใช้งานได้อย่างมีประสิทธิภาพในวงกว้าง การปรับปรุงระบบแคชและการอนุมานช่วยให้เราให้บริการโมเดลเหล่านี้ได้ด้วยต้นทุนที่ต่ำลง และเราส่งต่อการประหยัดต้นทุนนี้ให้ผู้ใช้และลูกค้าโดยตรง ด้วยการลดราคา API ของ Sol และ Luna ลง 50% เมื่อเทียบกับราคาโปรโมชันของ GPT‑5.6 เมื่อรวมความก้าวหน้าเหล่านี้เข้าด้วยกัน AI ขั้นสูงจึงนำมาใช้กับงานในชีวิตประจำวันและแอปพลิเคชันต่างๆ ในวงกว้างได้จริงมากขึ้น
โมเดล | อินพุต | เอาต์พุต | ราคาที่ลดลง |
GPT‑6 Sol | 4 ดอลลาร์ → 2 ดอลลาร์ | 20 ดอลลาร์ → 10 ดอลลาร์ | ถูกลง 50% |
GPT‑6 Luna | 0.20 ดอลลาร์ → 0.10 ดอลลาร์ | 1.20 ดอลลาร์ → 0.50 ดอลลาร์ | ถูกลง 50% |
ราคาที่แสดงเป็นราคาต่อ 1 ล้านโทเค็น
GPT‑6 Astra ยังคงเป็นโมเดลที่ดีที่สุดของเราในทุกด้าน เหมาะสำหรับงานที่คุณต้องการผลลัพธ์ที่ดีที่สุดโดยไม่ต้องลดทอนคุณภาพหรือประสบการณ์การใช้งาน
GPT‑6 Sol และ Luna ยกระดับโมเดลที่คุณคุ้นเคยและใช้งานอยู่แล้วให้ชาญฉลาดและคุ้มค่ายิ่งขึ้น พร้อมพัฒนาความสามารถที่สำคัญต่อการทำงานซับซ้อนให้สำเร็จ
GPT‑6 Sol รับมือกับงานยากๆ ได้ พร้อมเปิดโอกาสให้คุณลองและปรับแก้งานได้มากขึ้นด้วยลิมิตการใช้งานที่สูงขึ้นและต้นทุนที่ต่ำลง อีกทั้งยังให้ความสามารถที่ชาญฉลาดกว่าและผลลัพธ์ที่ดีกว่าโมเดลคู่แข่งในระดับราคาใกล้เคียงกัน
ในการทดสอบ AutomationBench ซึ่งวัดความสามารถในการทำเวิร์กโฟลว์ทางธุรกิจบนแอปต่าง ๆ GPT‑6 Sol ที่ใช้ระดับการให้เหตุผล xhigh ทำผลงานได้ดีกว่า Claude Opus 5 ที่ระดับ max โดยมีต้นทุนต่อภารกิจเพียง 9% ของ Opus 5 ส่วน GPT‑6 Luna ที่ระดับ high ทำคะแนนได้ดีกว่ารุ่นก่อนหน้า 5.4 จุดเปอร์เซ็นต์ ขณะที่มีต้นทุนต่อภารกิจต่ำลง 58%
ใน AutomationBench 1.0.6(เปิดในหน้าต่างใหม่) เราทดสอบเอเจนต์ AI ด้วยเวิร์กโฟลว์ที่ต้องทำตั้งแต่ต้นจนจบ โดยใช้เครื่องมือทั้งหมด 47 รายการในงานด้านการขาย การตลาด การดำเนินงาน การสนับสนุน การเงิน และทรัพยากรบุคคล ทั้งนี้ ตัวเลขต้นทุนของ Claude Fable 5.1 ต่ำกว่าต้นทุนที่เกิดขึ้นจริง เพราะไม่ได้รวมค่าใช้จ่ายจากการใช้ Opus 5 เป็นโมเดลสำรอง ซึ่งเกิดขึ้นในประมาณ 40% ของภารกิจ
GPT‑6 Sol ยังทำผลงานเหนือ Claude Fable 5.1 ด้วยต้นทุนที่ต่ำกว่ามาก และเหนือกว่าแม้กระทั่ง GPT‑6 Astra ที่ใช้ระดับการคิดต่ำ
โมเดล (และระดับการให้เหตุผล) | คะแนน | ต้นทุนต่องาน |
|---|---|---|
GPT‑6 Sol (xhigh) | 33.2% | 0.27 ดอลลาร์ |
GPT‑6 Astra (low) | 30.3% | 3.9 เท่าของ GPT‑6 Sol |
Claude Opus 5 (max) | 26.9% | 11.1 เท่าของ GPT‑6 Sol |
Claude Fable 5.1 โดยมี Opus 5 เป็นโมเดลสำรอง (max) | 31.4% | >8.9 เท่าของ GPT‑6 Sol (ไม่มีการรายงานต้นทุนของโมเดลสำรอง) |
ในการทดสอบ Agents’ Last Exam ซึ่งประเมินความสามารถของเอเจนต์ในการทำเวิร์กโฟลว์ระดับมืออาชีพที่ซับซ้อน GPT‑6 Sol ที่ระดับการให้เหตุผล max ทำคะแนนได้ 56.4% สูงกว่าคะแนนสูงสุดของ Claude Opus 5 ในการทดสอบนี้ ขณะที่มีต้นทุนต่อภารกิจต่ำกว่า 60%
ใน Agents’ Last Exam V1(เปิดในหน้าต่างใหม่) เราประเมินเอเจนต์ AI ด้วยงานที่มีมูลค่าทางเศรษฐกิจและต้องดำเนินการต่อเนื่องหลายขั้นตอน ครอบคลุม 55 อุตสาหกรรมย่อย และงานระดับมืออาชีพส่วนใหญ่ในสาขาหลักที่ทำผ่านคอมพิวเตอร์
คำตอบจะมีประโยชน์ได้ก็ต่อเมื่อข้อมูลถูกต้อง เราจึงเดินหน้าพัฒนาความถูกต้องและความน่าเชื่อถือของข้อมูลที่โมเดลให้มาอย่างต่อเนื่อง ในการประเมินความถูกต้องของข้อเท็จจริงภายในของเรา ซึ่งใช้บทสนทนาจากการใช้งานจริงที่ลบข้อมูลระบุตัวตนแล้ว และเป็นบทสนทนาที่ผู้ใช้แจ้งว่าโมเดลของเราให้ข้อมูลผิด GPT‑6 Sol มีข้อผิดพลาดเพียงประมาณครึ่งหนึ่งของรุ่นก่อนหน้า ทำให้มีความน่าเชื่อถือใกล้เคียงกับ Astra แต่มีต้นทุนต่ำกว่ามาก ส่วน GPT‑6 Luna ก็พัฒนาขึ้นอย่างมากเช่นกัน โดยเมื่อใช้ระดับการให้เหตุผลที่สูงขึ้น จะทำผลงานได้เทียบเท่า GPT‑5.6 Sol แต่มีต้นทุนเพียงประมาณหนึ่งในร้อย
ในการประเมินนี้ เราวัดความถูกต้องของข้อเท็จจริงจากบทสนทนาใน ChatGPT ที่ลบข้อมูลระบุตัวตนแล้ว โดยเลือกบทสนทนาที่ผู้ใช้เคยแจ้งว่าโมเดลก่อนหน้าให้ข้อมูลข้อเท็จจริงผิด บทสนทนาเหล่านี้มีแนวโน้มทำให้โมเดลตอบผิดมากกว่าปกติ จึงไม่ได้สะท้อนการใช้งานทั่วไป ซึ่งพบข้อผิดพลาดด้านข้อเท็จจริงน้อยกว่า การคำนวณคะแนนไม่ได้ปรับตามความยาวของคำตอบ อย่างไรก็ตาม จากการทดสอบคำตอบในระดับความยาวที่หลากหลาย เราพบว่าความยาวของคำตอบแทบไม่มีผลต่อคะแนน
ในปีนี้ เอเจนต์สำหรับการเขียนโค้ดเริ่มรับมือกับงานที่ซับซ้อน ครอบคลุม และใช้เวลานานกว่าที่เคย การใช้งานภายใน OpenAI เองก็เพิ่มขึ้นแบบทวีคูณ หากคำนวณมูลค่าการใช้โทเค็นรายวันตามราคา API นักวิจัยที่มีการใช้งานระดับค่ามัธยฐานใช้โทเค็นคิดเป็นมูลค่ามากกว่า 600 ดอลลาร์ต่อวัน ส่วนกลุ่มนักวิจัยที่มีการใช้งานสูงสุดในเปอร์เซ็นไทล์ที่ 90 ใช้มากกว่า 7,000 ดอลลาร์ต่อวัน (Research acceleration: The view inside OpenAI) เมื่อเอเจนต์สำหรับการเขียนโค้ดเริ่มทำงานที่ยาวนานและท้าทายมากขึ้น ต้นทุนในการใช้งานอย่างต่อเนื่องจึงยิ่งมีความสำคัญ GPT‑6 Sol และ Luna มอบทั้งความสามารถด้านการเขียนโค้ดที่โดดเด่นและราคา API ที่ต่ำลง ทำให้นักพัฒนามีโอกาสทดลองและปรับแก้งานได้มากขึ้น ขณะเดียวกัน ทีมต่างๆ ก็สามารถมอบหมายงานที่ท้าทายยิ่งขึ้นให้ Codex ได้อย่างมั่นใจ
ในการทดสอบ FrontierCode ซึ่งประเมินว่าเอเจนต์สำหรับการเขียนโค้ดสามารถแก้ไขโค้ดให้พร้อมนำไปรวมเข้ากับโค้ดเบสจริงได้หรือไม่ GPT‑6 Sol ทำผลงานได้ดีขึ้นอย่างมากเมื่อเทียบกับ GPT‑5.6 Sol และทำได้ในระดับเดียวกับ Claude Fable 5.1 xhigh แต่มีต้นทุนต่ำกว่ามาก
ในการทดสอบ FrontierCode 1.1 Main(เปิดในหน้าต่างใหม่) เอเจนต์ AI จะเขียนโค้ดและได้รับการประเมินไม่เพียงแค่ความถูกต้อง แต่ยังรวมถึงความพร้อมในการนำโค้ดไปรวมเข้ากับโค้ดเบส เช่น คุณภาพของการทดสอบ การแก้ไขเฉพาะส่วนที่จำเป็น รูปแบบการเขียนโค้ด และการปฏิบัติตามมาตรฐานของโค้ดเบส
ในการทดสอบ DeepSWE v1.1 ซึ่งวัดประสิทธิภาพในการทำงานวิศวกรรมซอฟต์แวร์ที่ซับซ้อนบนโค้ดเบสจริง GPT‑6 Sol ที่ระดับการให้เหตุผล max โมเดลทำคะแนนได้ 68.8% โดยตามหลังคะแนนสูงสุดของ Claude Fable 5 ในการทดสอบนี้เพียง 1.1 จุดเปอร์เซ็นต์ โดย Claude Fable 5 ทำคะแนนได้ 69.9% ที่ระดับ xhigh ขณะที่ GPT‑6 Sol มีต้นทุนต่อภารกิจต่ำกว่าประมาณ 80%
GPT‑6 Luna ที่ระดับการให้เหตุผล max ทำคะแนนได้ 66.6% ซึ่งอยู่ในระดับใกล้เคียงกับ Claude Opus 5 และ Fable 5 ที่ระดับ medium เมื่อเปรียบเทียบกันแล้ว Luna มีต้นทุนต่อภารกิจต่ำกว่า Opus 5 ถึง 93% และต่ำกว่า Fable 5 ถึง 96%
ในการทดสอบ DeepSWE 1.1(เปิดในหน้าต่างใหม่) เอเจนต์ AI จะได้รับโจทย์วิศวกรรมซอฟต์แวร์ที่สร้างขึ้นใหม่ ซึ่งมีความซับซ้อนและต้องดำเนินการต่อเนื่องหลายขั้นตอน
แม้ GPT‑6 Astra จะยังคงเป็นโมเดลที่ดีที่สุดในโลกด้านการใช้งานคอมพิวเตอร์ แต่ GPT‑6 Sol และ Luna ให้ประสิทธิภาพที่คุ้มค่ากว่ารุ่นก่อนหน้า ในการทดสอบ OSWorld 2.0 offline GPT‑6 Sol ที่ระดับการให้เหตุผล xhigh ทำคะแนนได้ 60.5% ใกล้เคียงกับ Claude Opus 5 ที่ระดับ medium ซึ่งทำได้ 60.3% แต่ GPT‑6 Sol มีต้นทุนต่อภารกิจต่ำกว่าประมาณ 80% ส่วน GPT‑6 Luna ที่ระดับ max ทำคะแนนได้สูงกว่า GPT‑5.6 Sol ที่ระดับ medium โดยมีต้นทุนเพียงหนึ่งในสิบ
ในการทดสอบ OSWorld 2.0(เปิดในหน้าต่างใหม่) เอเจนต์ AI ต้องทำงานบนคอมพิวเตอร์ที่ประกอบด้วยหลายขั้นตอนต่อเนื่อง ครอบคลุมตั้งแต่งานทั่วไปในชีวิตประจำวันไปจนถึงงานระดับมืออาชีพ ผลที่รายงานเป็นคะแนนที่คำนวณตามส่วนของงานที่ทำสำเร็จ โดยใช้ชุดทดสอบแบบออฟไลน์จากเวอร์ชัน v2026.08.08
เรายังนำรูปแบบการสื่อสารที่พัฒนาขึ้นของ GPT‑6 Astra มาใช้กับ Sol และ Luna ด้วย ซึ่งน่าจะเห็นผลได้ชัดเป็นพิเศษในการสนทนาเรื่องเทคนิคและการเขียนโค้ด คำตอบจะชัดเจนขึ้น ใช้ศัพท์เฉพาะน้อยลง ใช้ถ้อยคำที่ฟังไม่เป็นธรรมชาติน้อยลง ลดรายละเอียดที่ไม่ค่อยมีประโยชน์ และโดยรวมกระชับขึ้นเล็กน้อยโดยยังคงเนื้อหาสำคัญไว้อย่างครบถ้วน
แม้สไตล์จะเป็นเรื่องของความชอบส่วนบุคคล แต่ในตัวอย่างนี้เราชอบคำตอบของ GPT‑6 Sol มากกว่า เพราะไม่รีบด่วนสรุป และไม่เสียเวลาไปกับการย้ำข้อมูลที่ผู้ถามน่าจะทราบอยู่แล้ว (เช่น เว็บไซต์นี้มีสี่หน้า) อีกทั้งยังใช้ภาษาที่กำกวมน้อยกว่า (เช่น “จัดวางเนื้อหาเป็นส่วนๆ” หรือ “ปรับโครงสร้าง...ตามระบบนั้น”) และอธิบายอย่างชัดเจนว่าตรวจสอบอะไรไปแล้วและมีอะไรที่ยังไม่ได้ตรวจสอบ โดยไม่ใส่รายละเอียดเบื้องหลังที่ไม่จำเป็น เช่น พรอมต์สำหรับเครื่องมือสร้างรูปภาพ
นอกจากราคาโทเค็นที่ลดลงแล้ว เรายังช่วยให้นักพัฒนาที่สร้างแอปด้วย GPT‑6 ประหยัดค่าใช้จ่ายได้มากขึ้นเมื่อนำบริบทเดิมกลับมาใช้ซ้ำ เราปรับปรุงการแคชพรอมต์ของ GPT‑6 ให้ค้นพบข้อมูลที่แคชไว้และนำกลับมาใช้ได้บ่อยขึ้นโดยอัตโนมัติ ช่วยให้เอเจนต์นำบริบทเดิมกลับมาใช้ได้มากขึ้น ตอบสนองได้เร็วขึ้น และประหยัดค่าใช้จ่าย 90% เมื่ออ่านโทเค็นอินพุตจากแคช
นักพัฒนายังมีวิธีวัดและเพิ่มประสิทธิภาพการแคชมากขึ้นด้วย ดังนี้
ตรวจสอบและวิเคราะห์ปัญหา Prompt Caching Dashboard(เปิดในหน้าต่างใหม่) แสดงปริมาณอินพุตที่ระบบแคชไว้และการเปลี่ยนแปลงเมื่อเวลาผ่านไป ส่วนเครื่องมือวิเคราะห์ปัญหา(เปิดในหน้าต่างใหม่)ช่วยให้เข้าใจว่าเหตุใดข้อมูลบางส่วนที่ควรแคชได้จึงไม่ถูกแคช พร้อมชี้ให้เห็นว่าควรแก้ไขตรงไหน
ปรับระดับการให้เหตุผลและเครื่องมือที่ใช้งานได้โดยไม่กระทบการใช้แคช เพิ่มระดับการให้เหตุผล(เปิดในหน้าต่างใหม่)สำหรับงานที่ยากขึ้น หรือลดระดับลงสำหรับคำถามต่อเนื่องที่ง่ายกว่า รวมถึงเปิดหรือปิดใช้เครื่องมือ(เปิดในหน้าต่างใหม่)ตามความต้องการของเอเจนต์ที่เปลี่ยนไป ตอนนี้ไม่ว่าจะปรับส่วนใด บริบทก่อนหน้าก็ยังสามารถนำจากแคชกลับมาใช้ซ้ำได้
ปรับให้ระบบเลือกแคชส่วนต้นของพรอมต์ได้อย่างเหมาะสม นักพัฒนาสามารถกำหนดจุดสิ้นสุดของส่วนต้นของพรอมต์ที่ต้องการแคชได้อย่างชัดเจน จึงควบคุมการนำข้อมูลจากแคชกลับมาใช้ซ้ำได้มากขึ้นและช่วยเพิ่มประสิทธิภาพการทำงาน
GitHub รายงานว่า ในช่วงหลายเดือนที่ผ่านมา การปรับปรุงเหล่านี้ช่วยลดสัดส่วนโทเค็นในพรอมต์ที่ต้องประมวลผลใหม่ตั้งแต่ต้นลงมากกว่า 50% จากคำขอหลายพันล้านรายการที่ส่งไปยังโมเดลของ OpenAI ส่งผลให้ Copilot ตอบสนองได้เร็วขึ้น
GPT‑6 Sol และ Luna ต่อยอดแนวทางด้านการทำงานที่สอดคล้องกับเจตนาของมนุษย์ซึ่งเราเริ่มใช้กับ Astra โมเดลที่มีความสอดคล้องมากที่สุดของเราจนถึงปัจจุบัน จากการประเมินด้านนี้ ทั้ง Sol และ Luna พัฒนาขึ้นเมื่อเทียบกับโมเดล GPT‑5.6 รุ่นที่เทียบเคียงกัน รวมถึงลดการกล่าวอ้างที่อาจทำให้เข้าใจผิดเกี่ยวกับงานเขียนโค้ดที่โมเดลทำ
การประเมินต่อไปนี้จงใจทดสอบสถานการณ์ที่ท้าทาย และไม่ได้วัดอัตราความล้มเหลวในการใช้งานทั่วไป ดูผลลัพธ์ฉบับเต็มได้ในการ์ดระบบ(เปิดในหน้าต่างใหม่)
ตั้งแต่วันนี้เป็นต้นไป GPT‑6 Sol และ GPT‑6 Luna พร้อมใช้งานใน ChatGPT Work และ Codex สำหรับผู้ใช้ Plus, Pro, Business, Enterprise และ Edu ทุกคน ผู้ใช้ Free และ Go สามารถเข้าถึง GPT‑6 Luna ได้ในแอปเดสก์ท็อป โมเดลเหล่านี้ยังไม่พร้อมใช้งานใน Chat ใน OpenAI API โมเดลเหล่านี้พร้อมใช้งานในชื่อ gpt-6-sol และ gpt-6-luna
เพื่อให้บริการมีเสถียรภาพสำหรับทุกคน เราวางแผนทยอยเปิดตัวโมเดลเหล่านี้ใน ChatGPT ตลอดทั้งวัน หากยังไม่เห็นโมเดลใหม่ใน ChatGPT Work หรือ Codex โปรดลองอีกครั้งในภายหลัง
เราประเมิน GPT ในสภาพแวดล้อมสำหรับการวิจัยของเราหรือผ่าน API ซึ่งผลลัพธ์ที่ได้อาจแตกต่างจาก ChatGPT ที่เปิดให้ใช้งานจริงเล็กน้อย เนื่องจากใช้พรอมต์ระบบ เครื่องมือ และองค์ประกอบอื่นๆ ที่แตกต่างกัน ส่วนผลการประเมินโมเดลของคู่แข่งอ้างอิงจากรายงานที่เผยแพร่ต่อสาธารณะ ในกรณีที่ไม่มีคะแนนของ Claude Fable 5.1 เราจะใช้คะแนนของ Claude Fable 5 แทน


