OpenAI

GPT-6 Astra: A new generation of intelligence

ขีดความสามารถอัจฉริยะยุคใหม่

อัปเดตเมื่อวันที่ 22 กันยายน 2569: เรากำลังเพิ่ม GPT‑6 Sol และ GPT‑6 Luna เข้ามาในตระกูล GPT‑6 ดูข้อมูลเพิ่มเติม

เราขอเปิดตัว GPT‑6 Astra โมเดลที่ฉลาดที่สุดในโลกและได้รับการปรับให้ทำงานสอดคล้องกับเจตนาของผู้ใช้มากที่สุด

GPT‑6 Astra เป็นผลจากการผสานงานวิจัยที่สั่งสมมาหลายปีเข้ากับการลงทุนครั้งสำคัญในด้านการฝึกล่วงหน้า การเรียนรู้แบบเสริมกำลัง และการปรับโมเดลให้สอดคล้องกับเป้าหมาย Astra มีความสามารถล้ำสมัยที่สุดในด้านการใช้งานคอมพิวเตอร์ การท่องเว็บ วิศวกรรมซอฟต์แวร์ ความมั่นคงปลอดภัยทางไซเบอร์ วิทยาศาสตร์ และงานระดับมืออาชีพ Astra ทำคะแนนจนแตะเพดานของ FrontierMath Tier 4 ด้วยคะแนน 98% โดยก่อนหน้านี้ได้ช่วย แก้ปัญหาเปิดที่ค้างคามานาน⁠ ในสาขาคณิตศาสตร์มาแล้ว Astra ยังทำคะแนนบน ARC-AGI-3 ได้ 99.9% และทำคะแนนบน ExploitBench ได้เต็ม 100% นอกจากนี้ ยังยกระดับขีดความสามารถด้านการใช้คอมพิวเตอร์และเบราว์เซอร์ไปอีกขั้น โดยรับมือกับงานระดับมืออาชีพที่ซับซ้อนที่สุดได้ด้วยความรวดเร็ว ความแม่นยำ และวิจารณญาณที่เหนือชั้น 

GPT‑6 Astra เริ่มทยอยเปิดให้ใช้งานแล้ววันนี้สำหรับองค์กรจำนวนจำกัด และจะเปิดให้ผู้ใช้ ChatGPT Plus, Pro, Business และ Enterprise ทุกคนใช้งานได้ภายในไม่กี่วันข้างหน้า รวมถึงผ่าน OpenAI API, Microsoft Azure และ AWS Bedrock

“ในการทดสอบ ARC-AGI-3 Astra แก้โจทย์โดยใช้ขั้นตอนได้อย่างมีประสิทธิภาพกว่ามนุษย์ใน 96% ของด่าน ส่งผลให้มีประสิทธิภาพใกล้เคียงมนุษย์ในเกณฑ์มาตรฐานนี้ นี่ไม่เพียงเป็นโมเดลที่ดีที่สุดเท่าที่เราเคยทดสอบมา แต่ยังสะท้อนถึงความก้าวหน้าครั้งสำคัญของโมเดลระดับแนวหน้า ทั้งในด้านการรับมือและแก้โจทย์ในสภาพแวดล้อมที่ไม่เคยพบมาก่อน รวมถึงความรวดเร็วและมีประสิทธิภาพในการเรียนรู้วิธีแก้โจทย์เหล่านั้น”
Greg Kamradt จาก ARC Prize Foundation

Astra เป็นโมเดลที่สอดคล้องกับเจตนาของผู้ใช้มากที่สุดของเรา โดยพัฒนาขึ้นอย่างมากทั้งด้านการทำความเข้าใจเจตนาของผู้ใช้และพฤติกรรมของโมเดล ทำให้คุณมอบหมายงานได้อย่างมั่นใจในวิจารณญาณของ Astra มากขึ้น วิธีหนึ่งที่เราใช้ทดสอบเรื่องนี้คือการสร้างการประเมินใหม่โดยอิงจากเหตุการณ์ Hugging Face เพื่อดูว่าเมื่อโมเดลต้องเผชิญกับงานที่ยากหรือเป็นไปไม่ได้ โมเดลจะทำเกินขอบเขตที่กำหนดไว้หรือไม่ เมื่อไม่มีมาตรการป้องกันสำหรับการใช้งานจริง GPT‑5.6 Sol ดำเนินการนอกเหนือจากเป้าหมายที่ได้รับอนุญาตใน 48% ของกรณี ส่วน GPT‑6 Astra ไม่พบกรณีเช่นนี้เลย (0%)

โมเดลการใช้คอมพิวเตอร์ที่ดีที่สุดในโลก

GPT‑6 Astra เปิดพรมแดนใหม่ด้านความเร็ว ความแม่นยำ และความปลอดภัยในการใช้งานคอมพิวเตอร์ โมเดลสามารถจัดการงานที่น่าเบื่อและใช้เวลามากได้ เช่น กรอกแบบฟอร์มออนไลน์ อัปเดตข้อมูลลูกค้าในระบบ CRM และจัดระเบียบปฏิทินของคุณ โมเดลสามารถค้นหาข้อมูลทางออนไลน์ แล้วร่างบทสรุปไว้ในอีเมลหรือโปรแกรมแก้ไขเอกสารของคุณได้ โมเดลสามารถวิเคราะห์ข้อมูลทางวิทยาศาสตร์ สร้างกราฟ สร้างเว็บไซต์ และตรวจสอบ QA ของฟรอนต์เอนด์เพื่อให้แน่ใจว่าฟีเจอร์ทั้งหมดบนเว็บไซต์ทำงานได้อย่างถูกต้อง โมเดลสามารถติดตั้งและทดสอบซอฟต์แวร์ให้คุณได้ด้วยตนเอง พร้อมช่วยวิเคราะห์และแก้ไขปัญหาที่คุณเห็นบนหน้าจอ การพัฒนาเหล่านี้ยังสะท้อนให้เห็นในผลการประเมินระดับแนวหน้าของเราด้วย

การปรับปรุงเหล่านี้ยังส่งผลให้งานจริงที่ต้องอาศัยความรู้มีประสิทธิภาพเพิ่มขึ้นอย่างมาก ในการจำลองเวลาแฝงบน OSWorld 2.0 Astra มีประสิทธิภาพในการใช้งานคอมพิวเตอร์สูงกว่า GPT‑5.6 โดยใช้เวลาต่องานน้อยลงประมาณ 47% Sol ทำคะแนนได้ 72.6% โดยใช้เวลาประมาณ 40 นาทีต่องาน เทียบกับ 65.7% โดยใช้เวลาประมาณ 75 นาทีต่องาน3

ความสามารถด้านการใช้งานคอมพิวเตอร์ของ GPT‑6 Astra แสดงให้เห็นผ่านผลลัพธ์ในหลากหลายสาขา รวมถึงการพัฒนาเกม วิศวกรรมไฟฟ้า และงานด้านความรู้ในชีวิตประจำวัน:

นอกจาก Astra แล้ว เรายังปรับปรุงระบบ Codex เพื่อให้การใช้งานคอมพิวเตอร์ทำได้รวดเร็วยิ่งขึ้นอย่างมาก เมื่อรวมกับประสิทธิภาพของ Astra แล้ว จะทำให้งานเสร็จเร็วขึ้น 1.9 เท่าเมื่อเทียบกับประสบการณ์การใช้งาน GPT‑5.6 Sol ในปัจจุบันบนเกณฑ์มาตรฐาน Mind2Web ความเร็วที่เพิ่มขึ้นของโมเดลช่วยให้โมเดลรับช่วงงานในชีวิตประจำวันที่ใช้เวลามากหลายอย่างไปจัดการแทนคุณได้เร็วกว่าที่คุณจะทำเอง4

“เราเริ่มนำ GPT‑6 Astra มาใช้กับระบบของ Devin ตั้งแต่วันเปิดตัว และโมเดลก็ทำผลงานได้ในระดับแนวหน้าจากการทดสอบเกณฑ์มาตรฐานภายในของเรา ความสามารถอันยอดเยี่ยมด้านการใช้คอมพิวเตอร์ การเขียน และการทำความเข้าใจโค้ดเบสช่วยให้การทดสอบดีขึ้นได้ทันที วิดีโอติดตามเนื้อหาได้ง่ายขึ้นอย่างเห็นได้ชัด และรายงานก็อ่านง่ายและกระชับกว่าเดิม
Silas Alberti รองประธานอาวุโสฝ่ายวิจัยด้านการรู้คิด

การเปลี่ยนแปลงแบบก้าวกระโดดในงานวิชาชีพ

GPT‑6 Astra ได้รับการพัฒนาให้ใช้คอมพิวเตอร์ได้เก่งขึ้น พร้อมผ่านการฝึกที่ออกแบบมาโดยเฉพาะสำหรับการทำงานระดับมืออาชีพ จึงช่วยจัดการงานที่ซับซ้อนได้อย่างมีประสิทธิภาพ Astra ไม่เพียงรับมือกับปัญหาที่ซับซ้อนได้ แต่ยังทำงานที่มีหลายขั้นตอนต่อเนื่องกันจนเสร็จ และสร้างเอกสาร สเปรดชีต รวมถึงงานนำเสนอที่มีคุณภาพพร้อมใช้งาน

GPT‑6 Astra เป็นโมเดลที่ดีที่สุดของเราในการทำตามเทมเพลตที่มีอยู่ และสร้างสไลด์ที่จัดวางองค์ประกอบได้ดี ถ่ายทอดประเด็นสำคัญอย่างกระชับ พร้อมลำดับเนื้อหาที่เป็นระบบ ระบบจะสร้างเอกสาร งานนำเสนอ สเปรดชีต และบทวิเคราะห์ที่ชัดเจนและมีโครงสร้างดี โดยเป็นไปตามเทมเพลตของคุณและสอดคล้องกับสไตล์การเขียนและรูปแบบภาพของคุณ Astra ยังได้รับการฝึกให้เลือกเฉพาะบริบทที่สำคัญต่อผลลัพธ์ แทนที่จะนำข้อมูลที่ไม่จำเป็นต่องานตรงหน้ามากล่าวซ้ำ ทั้งหมดนี้ทำให้โมเดลสามารถสร้างผลงานที่พร้อมนำไปใช้ได้ทันทีมากขึ้น และสอดคล้องกับบริบทและมาตรฐานของธุรกิจคุณ

GPT‑6 Astra ยังมีความสามารถในการตัดสินด้านภาพที่ดีขึ้นสำหรับเว็บไซต์ เกม แอปพลิเคชัน และภาพเรนเดอร์ที่โมเดลสร้างขึ้น Sites⁠(เปิดในหน้าต่างใหม่) ใน ChatGPT ช่วยให้ Astra สร้าง โฮสต์ และแชร์เว็บไซต์ เว็บแอป และเกมได้โดยตรงจากพรอมต์

“Astra ทำให้เรามีข้อได้เปรียบอย่างมากทั้งด้านความสามารถและประสิทธิภาพ โมเดลนี้ดำเนินเวิร์กโฟลว์ด้านการสร้างสรรค์ที่ซับซ้อนที่สุดของเราได้สำเร็จ โดยใช้โทเค็นน้อยกว่าโมเดลอื่นที่เราทดสอบถึง 20% สิ่งสำคัญที่สุดคือ สำหรับลูกค้าของเรา นั่นหมายถึงผลลัพธ์ที่มีคุณภาพสูงขึ้น”
Alex Mashrabov, CEO และผู้ร่วมก่อตั้งของ Higgsfield AI

เมื่อคำสั่งมีความคลุมเครือและสามารถตีความได้หลายทาง GPT‑6 Astra สามารถตัดสินใจเลือกแนวทางที่ถูกต้องได้ดีกว่าโมเดลรุ่นก่อน โมเดลใช้ข้อมูลจากบริบทเพื่อจัดการกับรายละเอียดทั่วไปที่ขาดหายไป และจะถามเฉพาะคำถามที่จำเป็นเมื่อคำตอบอาจมีผลต่อผลลัพธ์ ใน Codex โมเดลสามารถถามคำถามโดยไม่ต้องรอคำตอบ พร้อมเดินหน้าทำส่วนที่ไม่ต้องรอคำตอบจากคุณได้ หากคุณไม่ตอบ โมเดลจะดำเนินงานต่อโดยตั้งสมมติฐานที่สมเหตุสมผลในกรณีที่เหมาะสม แต่จะรอคำตอบจากคุณเมื่อต้องตัดสินใจในเรื่องสำคัญ

ตัวอย่างด้านล่างแสดงให้เห็นว่า Astra ทำงานร่วมกับคุณในงานทั่วไปอย่างไร เมื่อข้อมูลที่ขาดหายไปอาจทำให้คำตอบเปลี่ยนไปอย่างมาก

Astra ยังติดตามบริบทและสถานะของงานได้ดียิ่งขึ้น แม้รายละเอียดหรือเป้าหมายจะเปลี่ยนไประหว่างทาง โมเดลรุ่นก่อนบางครั้งมองข้อความที่ใช้ปรับทิศทางเป็นเป้าหมายใหม่ จนหลุดจากคำขอเดิมหรือข้อจำกัดก่อนหน้า Astra ปรับการทำงานตามข้อกำหนดใหม่หรือเปลี่ยนแนวทางตามที่ผู้ใช้ขอได้ และแม้จะแวะตอบคำถามอื่นระหว่างทาง ก็ยังติดตามงานหลักต่อได้โดยไม่หลุดประเด็น

“Astra ยกระดับคุณภาพจาก GPT‑5.6 Sol อย่างชัดเจนในการทำงานด้านกฎหมายที่ซับซ้อนหลากหลายประเภท จากการทดสอบเบื้องต้นของเรา Astra โดดเด่นด้วยแนวทางการทำงานด้านกฎหมายที่คล้ายกับทนายความผู้มีวิจารณญาณ โดยแยกแยะได้ว่าข้อมูลใดมาจากเอกสารและข้อมูลใดเป็นข้อเท็จจริงที่มีหลักฐานยืนยัน ชี้ให้เห็นข้อสันนิษฐานที่ไม่มีหลักฐานรองรับ และนำประเด็นที่ข้อมูลยังขาดหายมาแปลงเป็นแนวทางที่ชัดเจนในการร่างเอกสาร
Niko Grupen หัวหน้าฝ่ายวิจัยประยุกต์จาก Harvey

การเขียนโค้ด

GPT‑6 Astra เป็นโมเดลที่ดีที่สุดสำหรับวิศวกรรมซอฟต์แวร์จนถึงปัจจุบัน

1 จาก 2
“GPT‑6 Astra ทำผลงานได้ในระดับแนวหน้าจากเกณฑ์การประเมินด้านการเขียนโค้ดภายในของเรา และเมื่อเทียบกับ GPT‑5.6 Sol ก็พัฒนาขึ้นอย่างชัดเจนในการประเมินความเข้าใจและวิจารณญาณด้านการเทรด เมื่อนำ GPT‑6 Astra มาใช้เป็นเอเจนต์ช่วยเขียนโค้ด นักพัฒนาจะติดตามและเข้าใจการสื่อสารของโมเดลได้ง่ายขึ้น อีกทั้งยังใช้เวลาแก้ไขและปรับโค้ดซ้ำน้อยลงกว่าจะได้คุณภาพพร้อมใช้งานจริง”
John Crepezzi ฝ่ายผู้ช่วย AI จาก Jane Street

Astra มาพร้อมวิธีใหม่ที่ช่วยให้ Codex สามารถเก็บและเรียกคืนบริบทเมื่อหน้าต่างบริบทเต็ม ในอดีต โมเดลใช้การย่อบริบทเพื่อสรุปงานระหว่างเซสชันที่ยาวนาน เช่น เมื่อแก้ไขปัญหาที่ซับซ้อนหรือปรับโครงสร้างโค้ดขนาดใหญ่ การย่อบริบทแต่ละครั้งอาจละรายละเอียดเกี่ยวกับสาเหตุที่การแก้ไขไม่สำเร็จหรือวิธีที่คอมโพเนนต์ทำงาน ใน Codex นั้น Astra สามารถเก็บบันทึกข้ามหน้าต่างบริบทได้ โดยรักษารายละเอียดที่สะสมไว้โดยไม่ต้องบีบอัดซ้ำๆ ให้เป็นสรุปเดียว Astra ยังคงค้นหาข้อมูลในหน้าต่างบริบทก่อนหน้าได้ จึงสามารถย้อนกลับไปค้นหาข้อกำหนดหรือผลการทดสอบจากข้อความและผลลัพธ์ของเครื่องมือก่อนหน้านี้ แม้ว่าข้อมูลนั้นจะไม่ได้บันทึกไว้ในโน้ตของ Astra ก็ตาม คุณสามารถเปิดใช้ฟีเจอร์ทดลองนี้ได้ใน config.toml ของ Codex⁠(เปิดในหน้าต่างใหม่) และจะกลายเป็นค่าเริ่มต้นสำหรับ Astra ในอีกไม่กี่สัปดาห์ข้างหน้า

ยกระดับการค้นพบทางวิทยาศาสตร์

“เรื่องราวนี้คือจุดจบของยุคหนึ่ง และจุดเริ่มต้นของยุคใหม่”
Greg Burnham, EpochAI

GPT‑6 Astra ถือเป็นความก้าวหน้าครั้งสำคัญสำหรับการค้นพบทางวิทยาศาสตร์ คณิตศาสตร์ และสุขภาพ วันนี้ เราจะเผยแพร่ผลลัพธ์เพิ่มเติมอีกสองรายการเกี่ยวกับระยะห่างระหว่างจำนวนเฉพาะ9และ10

Astra ยังสร้างสถิติใหม่ในการประเมินด้านคณิตศาสตร์และวิทยาศาสตร์หลายรายการ

Astra สามารถช่วยในงานเชิงปฏิบัติที่อยู่เบื้องหลังการค้นพบทางวิทยาศาสตร์ได้ Astra นำการให้เหตุผลทางวิทยาศาสตร์มาใช้ควบคู่กับความสามารถในการใช้คอมพิวเตอร์ จึงทำงานผ่านซอฟต์แวร์เฉพาะทางเพื่อตรวจสอบข้อมูลและวิเคราะห์ผลลัพธ์ได้โดยตรง ช่วยให้นักวิจัยพิจารณาหลักฐานและตัดสินใจได้ว่าควรศึกษาเรื่องใดต่อ

ความปลอดภัยทางไซเบอร์

ตามที่เราได้อธิบายไว้ในข้อมูลอัปเดตด้านความปลอดภัย⁠ ความสามารถด้านไซเบอร์ของ Astra ก้าวหน้าขึ้นอย่างมาก จนถึงเกณฑ์ระดับวิกฤตด้านความมั่นคงปลอดภัยทางไซเบอร์ตามกรอบการเตรียมความพร้อมของเรา ความสามารถในการค้นหาและพัฒนาวิธีเจาะช่องโหว่แบบ zero-day ช่วยให้ฝ่ายป้องกันค้นหาและแก้ไขช่องโหว่ด้วยแพตช์ได้ แต่ขณะเดียวกันก็ทำให้จำเป็นต้องมีมาตรการป้องกันที่เข้มแข็งยิ่งขึ้น เพื่อให้เห็นขอบเขตความสามารถของ Astra ชัดเจนยิ่งขึ้น เราจึงนำโมเดลไปทดสอบโดยผู้เชี่ยวชาญทั้งภายในและจากหน่วยงานภายนอก

เราเริ่มจากการทดสอบโมเดลโดยไม่มีมาตรการป้องกันสำหรับการใช้งานจริง ด้วย ExploitBench และ ExploitGym เพื่อดูว่าโมเดลสามารถนำช่องโหว่ซอฟต์แวร์ที่ทราบอยู่แล้วไปสร้างวิธีใช้ประโยชน์จากช่องโหว่ที่ใช้ได้จริงหรือไม่ ในการประเมิน ExploitBench นั้น Astra ทำคะแนนได้เต็ม 100% เทียบกับ 78.5% สำหรับ GPT‑5.6 Sol ซึ่งเป็นโมเดลด้านไซเบอร์ระดับแนวหน้ารุ่นก่อนหน้าของเรา ในการทดสอบ ExploitGym Astra มีอัตราความสำเร็จ 42.4% เทียบกับ 30.3% ของ GPT‑5.6 Sol โดยใช้โทเค็นเอาต์พุตน้อยกว่าอย่างมีนัยสำคัญ13

เนื่องจากมีข้อกังวลว่าการที่โมเดลเคยเห็นข้อมูลเกี่ยวกับช่องโหว่ของซอฟต์แวร์ในอดีตอาจส่งผลต่อผลลัพธ์ของการวัดประสิทธิภาพ เราจึงประเมิน Astra เพิ่มเติมบนชุดทดสอบมาตรฐานใหม่สองชุด หนึ่งในนั้นคือการประเมินภายใน “ExploitBench (มิถุนายน–สิงหาคม พ.ศ. 2569)” ที่เราสร้างขึ้นเพื่อทดสอบการพัฒนาวิธีใช้ประโยชน์จากช่องโหว่ โดยใช้ช่องโหว่ที่พบในช่วงสามเดือนก่อนหน้า14 Astra มีอัตราความสำเร็จในการทำให้ระบบรันโค้ดที่กำหนดขึ้นเองบนชุดข้อมูลนี้สูงกว่า GPT‑5.6 Sol อย่างมาก ขณะเดียวกันก็ใช้โทเค็นเอาต์พุตน้อยกว่ามาก ในระหว่างการประเมิน Astra ยังได้ค้นพบและใช้ช่องโหว่แบบซีโร่เดย์สองรายการที่ไม่เคยเป็นที่รู้จักมาก่อน เรากำลังแจ้งช่องโหว่ทั้งสองรายการให้ผู้ดูแลโครงการทราบ

เรายังทดสอบ Astra ด้วย SRE-Bench15 ซึ่งเป็นเกณฑ์มาตรฐานที่วัดว่าโมเดลสามารถทำวิศวกรรมย้อนกลับไบนารีของซอฟต์แวร์เพื่อทำความเข้าใจตรรกะหลักของซอฟต์แวร์ได้หรือไม่ โดยไม่ต้องเข้าถึงซอร์สโค้ดดิบ Astra แก้โจทย์ได้ 88.0% ในการลองครั้งเดียว และ 99.2% ภายใน 4 ครั้ง เทียบกับ 55.9% และ 68.7% ของ GPT‑5.6 Sol ตามลำดับ

นอกเหนือจากการวัดผลตามเกณฑ์มาตรฐานแล้ว การประเมินที่ดำเนินการโดยผู้เชี่ยวชาญพบว่า เมื่อใช้งาน Astra โดยไม่มีมาตรการป้องกันสำหรับระบบที่ใช้งานจริง โมเดลสามารถใช้ประโยชน์จากช่องโหว่ที่ไม่เคยมีใครทราบมาก่อนเพื่อทำให้เบราว์เซอร์ที่เสริมความปลอดภัยสามารถรันโค้ดที่กำหนดขึ้นเองได้ และสร้างวิธีใช้ประโยชน์จากช่องโหว่เพื่อยกระดับสิทธิ์ในระบบปฏิบัติการที่เสริมความปลอดภัย

ดังที่เราได้กล่าวถึงใน The Defender’s Window ขีดความสามารถด้านไซเบอร์ระดับแนวหน้าสามารถช่วยให้ผู้ป้องกันค้นหาจุดอ่อนได้เร็วขึ้น แต่ก็ทำให้จุดอ่อนเหล่านั้นถูกนำไปใช้โจมตีได้ง่ายขึ้นเช่นกัน ซึ่งยิ่งเพิ่มความเร่งด่วนให้ผู้ป้องกันต้องปรับตัว Astra เวอร์ชันที่เปิดตัวในวันนี้ช่วยให้ผู้ป้องกันระบบสามารถทำงานต่างๆ เช่น ตรวจสอบโค้ดด้านความปลอดภัยและแก้ไขช่องโหว่ได้

อย่างไรก็ตาม Astra จะปฏิเสธคำขอด้านความมั่นคงปลอดภัยทางไซเบอร์ที่มีความซับซ้อนสูงกว่า เช่น การสร้างตัวอย่างเพื่อพิสูจน์ว่าสามารถใช้ประโยชน์จากช่องโหว่ได้จริง เราวางแผนที่จะขยายการเข้าถึงผ่าน OpenAI Daybreak⁠ และทยอยใช้มาตรการป้องกันที่มีข้อจำกัดน้อยลงในอีกไม่กี่สัปดาห์ข้างหน้า การดำเนินการนี้จะรองรับเวิร์กโฟลว์เชิงป้องกันได้มากขึ้น รวมถึงการตรวจสอบความถูกต้องของช่องโหว่และตัวอย่างพิสูจน์แนวคิด การวิเคราะห์มัลแวร์ และการพัฒนาระบบตรวจจับภัยคุกคาม

เรายังยกระดับการป้องกันการนำไปใช้ในทางที่ผิดด้านไซเบอร์ โดยพัฒนาต่อยอดจากชุดมาตรการป้องกันของ GPT‑5.6 Sol มาตรการเหล่านี้รวมถึงการเพิ่มความทนทานของโมเดลให้รับมือกับความพยายามเจลเบรกได้ดียิ่งขึ้น และการเพิ่มข้อมูลบริบทให้กับระบบตรวจสอบของเรา เรายังคงดำเนินการทดสอบอย่างเข้มงวดทั้งภายในและภายนอก รวมถึงการประเมินแบบอัตโนมัติโดยใช้ ระบบจำลองผู้โจมตีสำหรับการทดสอบแบบ Red Team ภายในของเรา ดูรายละเอียดเพิ่มเติมเกี่ยวกับมาตรการป้องกันทางไซเบอร์และการทดสอบของเราได้ในภาพรวมด้านความปลอดภัย⁠ ของ Astra และการ์ดระบบ⁠(เปิดในหน้าต่างใหม่)..

การปรับให้สอดคล้องและการนำ GPT‑6 Astra ไปใช้งานอย่างรับผิดชอบ

Astra เป็นโมเดลที่สอดคล้องกับแนวทางของเรามากที่สุด Astra ทำงานได้อย่างรอบคอบ ไม่ออกนอกขอบเขตที่กำหนด และสื่อสารกับผู้ใช้อย่างชัดเจนตรงไปตรงมา งานนี้เป็นผลลัพธ์ล่าสุดจากโครงการวิจัยที่ดำเนินมาอย่างยาวนานของเรา ซึ่งมุ่งเน้นการเทรนโมเดลให้คงความสอดคล้องกับเจตนาของมนุษย์ตั้งแต่ต้นจนจบ

ในสภาพแวดล้อมที่ละเอียดอ่อน Astra จะดำเนินการด้วยความระมัดระวังในระดับที่สอดคล้องกับความเสี่ยงนั้น ในการประเมินด้านการใช้คอมพิวเตอร์ เราจงใจเลือกงานที่ออกแบบมาเพื่อชักจูงให้โมเดลทำสิ่งที่ไม่ควรทำ และพบว่า Astra หลีกเลี่ยงผลกระทบที่ไม่ได้ตั้งใจได้ดีกว่า การรันโดยใช้มาตรการรักษาความปลอดภัยเพิ่มเติมที่มีให้ตามค่าเริ่มต้น ให้ประสิทธิภาพที่ดียิ่งขึ้นไปอีก

Astra ก่อให้เกิดผลลัพธ์ที่ไม่สอดคล้องกับเจตนาน้อยกว่าโมเดลระดับแนวหน้าอื่นๆ ที่ทดสอบทั้งหมด เราใช้ระบบทดสอบเอเจนต์สำหรับการใช้คอมพิวเตอร์แบบทั่วไปเพื่อให้การเปรียบเทียบเป็นธรรม (โดยอาศัยเครื่องมือการใช้คอมพิวเตอร์ที่มีอยู่ในทั้ง OpenAI Responses API⁠(เปิดในหน้าต่างใหม่) และ Anthropic Messages API⁠(เปิดในหน้าต่างใหม่)) และไม่นำมาตรการป้องกันเพิ่มเติมที่ปกติใช้กับ Codex และ ChatGPT Work มาใช้ (เช่น การตรวจสอบอัตโนมัติและนโยบายการยืนยัน)

Astra ยังมีแนวโน้มทำงานโดยไม่ออกนอกขอบเขตที่ผู้ใช้กำหนด รวมถึงขอบเขตที่เข้าใจได้จากสภาพแวดล้อม ผลการประเมินภายในพบว่า เมื่อ Codex Auto-Review ไม่อนุมัติ Astra ไม่เคยพยายามหาทางเลี่ยงระบบเพื่อดำเนินการต่อ แม้จะจงใจตั้งค่า Auto-Review ให้มีช่องทางหลบเลี่ยง และงานนั้นจะทำไม่สำเร็จหากไม่ใช้ช่องทางดังกล่าว Astra ก็ยังไม่พยายามหลีกเลี่ยงระบบ การที่ Astra ปฏิบัติตามข้อจำกัดของสภาพแวดล้อมเช่นนี้ สอดคล้องกับผลการประเมินงานด้านไซเบอร์ที่เป็นไปไม่ได้ของเรา ซึ่งเราได้แชร์ไว้ในบทนำของโพสต์นี้ และข้อค้นพบอื่นๆ ที่บันทึกไว้ในการ์ดระบบ⁠(เปิดในหน้าต่างใหม่)ของเรา

นอกจากนี้ Astra ยังยกระดับมาตรฐานด้านการสื่อสารกับผู้ใช้อย่างชัดเจนและตรงไปตรงมา ในการประเมินหนึ่ง Astra มีโอกาสน้อยกว่า GPT‑5.6 ถึงสามเท่า Sol ที่จะให้ข้อมูลที่ไม่ตรงกับความเป็นจริงเกี่ยวกับความสามารถและสิ่งที่โมเดลรองรับ

ผลการประเมินการหลอนเกี่ยวกับความสามารถของโมเดลแสดงให้เห็นว่า Astra ปรับปรุงขึ้นอย่างมากจาก GPT‑5.6 Sol โดยกล่าวอ้างเกี่ยวกับความสามารถของตัวเองในลักษณะที่ทำให้เข้าใจผิดน้อยลง

การประเมินของเราพบว่า การให้เหตุผลที่เขียนออกมาของ Astra ติดตามได้ยากกว่าของ GPT‑5.6 ของ Sol โดยอิงจากการทดสอบที่ขอให้มันหลบเลี่ยงการเฝ้าติดตามอย่างชัดเจน เราเชื่อว่าสาเหตุเกิดจาก Astra ควบคุมการให้เหตุผลที่เขียนออกมาในงานที่ง่ายกว่าได้ดีกว่า และสามารถแก้ปัญหาได้ด้วยขั้นตอนที่เขียนออกมาน้อยกว่า Astra ยังคงดูเหมือนมีปัญหาในการปกปิดการให้เหตุผลที่จำเป็นสำหรับงานที่ซับซ้อน แต่เราให้ความสำคัญกับการลดลงนี้อย่างจริงจัง การปรับปรุงความสามารถในการตรวจสอบยังคงเป็นสิ่งสำคัญในการวิจัย และการ์ดระบบ⁠(เปิดในหน้าต่างใหม่)ที่แนบมาจะให้รายละเอียดเกี่ยวกับสิ่งที่เราค้นพบและงานที่ดำเนินอยู่

การฝึกให้สอดคล้องเป็นหัวใจสำคัญของแนวทางของเราในการนำไปใช้งานจริง ในฐานะมาตรการป้องกันอีกชั้นหนึ่ง เรายังสร้างมาตรการป้องกันในระดับระบบ เช่น Codex Auto-review⁠(เปิดในหน้าต่างใหม่) และการติดตามการให้เหตุผลและการดำเนินการของเอเจนต์ เพื่อช่วยตรวจจับและควบคุมพฤติกรรมที่ไม่ปลอดภัย ตามที่อธิบายไว้ในข้อมูลอัปเดตด้านความปลอดภัย⁠ เรายังนำระบบเฝ้าระวังความไม่สอดคล้องกับแนวทางมาใช้ในระบบจริงสำหรับโมเดลระดับ Astra เพื่อให้มองเห็นความไม่สอดคล้อง และช่วยควบคุมกรณีที่ร้ายแรงที่สุด มาตรการป้องกันเหล่านี้คล้ายกับการเฝ้าระวังสำหรับการใช้งานภายในของเรา โดยใช้ระบบตัวจำแนกเพื่อตรวจสอบการให้เหตุผลและการกระทำของโมเดลว่ามีพฤติกรรมที่ไม่ได้รับอนุญาตหรือไม่ และหยุดกิจกรรมที่อาจไม่ได้รับอนุญาตโดยอัตโนมัติ

เนื่องจากความสามารถด้านความปลอดภัยทางไซเบอร์ของ Astra เพิ่มขึ้นอย่างมีนัยสำคัญ เราจึงใช้ความระมัดระวังเป็นพิเศษเพื่อให้การปรับใช้งานนี้ปลอดภัยและมีการรักษาความปลอดภัยที่รัดกุม การตรวจสอบความปลอดภัยเพิ่มเติมอาจทำให้งานที่ชอบด้วยกฎหมายดำเนินช้าลง หยุดชั่วคราว หรือหยุดลงได้ในบางครั้ง รวมถึงงานด้านความมั่นคงปลอดภัยไซเบอร์เชิงป้องกันด้วย หากงานใน ChatGPT หรือ Codex ถูกหยุดไว้ชั่วคราว คุณอาจต้องตรวจสอบการดำเนินการนั้นก่อนจึงจะดำเนินงานต่อได้ หากใช้งานผ่าน API งานจะหยุดลง บางครั้งการตรวจสอบเหล่านี้อาจทำให้งานที่ไม่ได้มีปัญหาต้องหยุดชะงัก และเรายังคงพัฒนาระบบอย่างต่อเนื่องเพื่อลดการขัดจังหวะโดยไม่จำเป็น การเฝ้าติดตามไม่ใช่สิ่งที่ใช้แทนการปรับโมเดลให้สอดคล้องกับเจตนาได้ เป้าหมายของเราคือสร้างโมเดลที่รักษาขอบเขตการทำงานตามที่ได้รับอนุญาตได้อย่างสม่ำเสมอ เพื่อให้มาตรการป้องกันเหล่านี้ไม่จำเป็นต้องเข้ามาแทรกแซง

ความพร้อมในการใช้งาน

GPT‑6 Astra เริ่มทยอยเปิดให้ใช้งานแล้ววันนี้สำหรับองค์กรจำนวนจำกัด และจะเปิดให้ผู้ใช้ ChatGPT Plus, Pro, Business และ Enterprise ทุกคนใช้งานได้ภายในไม่กี่วันข้างหน้า รวมถึงผ่าน OpenAI API, Microsoft Azure และ AWS Bedrock ผู้ใช้สามารถใช้งาน Astra ได้ภายในปริมาณการใช้งานที่รวมอยู่ในแพ็กเกจสมาชิกปัจจุบัน และทั้งผู้ใช้ทั่วไปและธุรกิจสามารถซื้อเครดิตเพื่อเพิ่มปริมาณการใช้งานได้ ผู้ใช้ที่ใช้แพ็กเกจ Pro, Business และ Enterprise จะสามารถเข้าถึง GPT‑6 Astra Pro ได้เช่นกัน ผู้ดูแลระบบ Enterprise สามารถเปิดใช้งาน Astra สำหรับเวิร์กสเปซของตนได้ การเข้าถึงจะถูกปิดไว้โดยค่าเริ่มต้นเมื่อเปิดตัว

Astra รองรับการไม่เก็บรักษาข้อมูล (Zero Data Retention) สำหรับลูกค้า API ที่มีสิทธิ์ และอย่างที่เราได้แจ้งไปเมื่อเดือนที่แล้ว ขณะนี้เรากำลังทดสอบ Private Safety Processing เพื่อยกระดับการตรวจสอบด้านความปลอดภัย พร้อมรักษาความเป็นส่วนตัวของลูกค้า

นักพัฒนาจะสามารถใช้งาน GPT‑6 Astra บน OpenAI API ภายใต้ชื่อ gpt-6-astra รวมถึงผ่าน Microsoft Azure และ Amazon Bedrock

โดยราคาของ OpenAI API แบบ Standard อยู่ที่ 10 ดอลลาร์สหรัฐต่อ 1 ล้านโทเค็นอินพุต และ 50 ดอลลาร์สหรัฐต่อ 1 ล้านโทเค็นเอาต์พุต ส่วนการอ่านและเขียนแคชจะคิดในอัตราแยกต่างหาก GPT‑6 Astra ใน API มีโหมด Fast ที่ประมวลผลได้เร็วสูงสุด 2 เท่าของการประมวลผลแบบ Standard ในราคา 2 เท่าของราคา Standard

การใช้คอมพิวเตอร์

การใช้คอมพิวเตอร์

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents’ Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, ชุดออฟไลน์, คะแนนบางส่วน)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (ไม่มีเครื่องมือ)

92.7%

76.9%

-

87.3%17

-

-

มืออาชีพ

มืออาชีพ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

งานด้านการออกแบบภายในองค์กร

50.0%

47.4%

-

35.8%

-

-

งานด้านวิทยาศาสตร์ข้อมูลภายใน

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis ระดับการคิด Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

การเขียนโค้ด

การเขียนโค้ดGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (คะแนน)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (คะแนน)53.3% 847.5%50.9%53.5%53.4%43.6%
งานย้ายฐานข้อมูลภายใน63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

งานวิชาการ

งานวิชาการ

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath ระดับ 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (พร้อมเครื่องมือ)

57.2%

-

65.0%

63.8%

63.6%

-

วิทยาศาสตร์และสุขภาพ

วิทยาศาสตร์และ ChatGPT HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (ภายใน)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (ปรับตามความยาว)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

ความปลอดภัยทางไซเบอร์

ความมั่นคงปลอดภัยทางไซเบอร์GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (มิถุนายน–สิงหาคม 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

การกำหนดการทำงานให้เหมาะสมและสอดคล้องกับเจตนาของมนุษย์:

การกำหนดการทำงานให้เหมาะสมและสอดคล้องกับเจตนาของมนุษย์:

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

เกณฑ์มาตรฐานความปลอดภัยในการใช้คอมพิวเตอร์ภายใน (ยิ่งต่ำยิ่งดี)

2.4%

22.0%

9.5%

18.3%

11.5%

-

เกณฑ์มาตรฐานความปลอดภัยในการใช้งานคอมพิวเตอร์ภายใน พร้อม AutoReview (ยิ่งต่ำยิ่งดี)

1.8%

4.3%

-

-

-

-

เกณฑ์มาตรฐานภายในสำหรับการหลีกเลี่ยงมาตรการป้องกัน (ยิ่งต่ำยิ่งดี)

0.00%

0.29%

-

-

-

-

ExploitGym Honeypot (ยิ่งต่ำยิ่งดี)

0.0%

48.2%

-

-

-

-

Impossible ExploitGym

100.0%

-

-

-

-

-

เกณฑ์มาตรฐานภายในสำหรับวัดการให้ข้อมูลที่ไม่เป็นจริง (ยิ่งต่ำยิ่งดี)

4.2%

12.2%

-

-

-

-

บริบทยาว

บริบทยาว

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

การให้เหตุผลเชิงนามธรรม

การให้เหตุผลเชิงนามธรรมGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

คะแนนการประเมินเป็นค่าสูงสุดในทุกระดับความพยายาม การประเมิน GPT ดำเนินการในสภาพแวดล้อมการวิจัยของเราหรือผ่าน API ของเรา ซึ่งอาจให้ผลลัพธ์ที่แตกต่างจาก ChatGPT เวอร์ชันใช้งานจริงเล็กน้อย เนื่องจากความแตกต่างของพรอมต์ระบบ เครื่องมือที่พร้อมใช้งาน เป็นต้น

เชิงอรรถ

  1. 1

    ในการทดสอบ ARC-AGI-3 เราประเมิน GPT-6 Astra ด้วยระบบทดสอบที่ใช้ Responses API ของเรา⁠ โดยปรับการตั้งค่า 2 รายการเพื่อให้ผลที่ได้สะท้อนประสิทธิภาพในการใช้งานจริงมากขึ้น การเปลี่ยนแปลงนี้ไม่ได้มุ่งเป้าไปที่ ARC-AGI-3 โดยเฉพาะ

  2. 2

    GPT-5.6 Sol ในที่นี้หมายถึงเวอร์ชันที่เปิดให้ใช้งานผ่าน API, ChatGPT Codex และ ChatGPT Work ของเรา เวอร์ชันใน ChatGPT Chat แตกต่างออกไปเล็กน้อย⁠

  3. 3

    OSWorld V2-Offline เป็นชุดย่อยของ OSWorld V2 ต้นฉบับที่ทำงานได้โดยไม่ต้องเชื่อมต่ออินเทอร์เน็ต ผู้เขียนได้ทดสอบประสิทธิภาพของโมเดล Claude บน OSWorld-V2 Offline ซ้ำ และได้ผลตามที่แสดงไว้ในตารางคะแนนอย่างเป็นทางการ⁠(เปิดในหน้าต่างใหม่)สำหรับ OSWorld 2.0 คะแนนของ Claude ใช้การตั้งค่าอย่างเป็นทางการ ไม่ใช่งานที่ได้รับการปรับเปลี่ยนและการให้คะแนนที่ได้รับการปรับเปลี่ยนจากการ์ดระบบ Fable 5.1.

  4. 4

    เวลาของโมเดลหมายถึงระยะเวลาที่รายงานไว้ตั้งแต่เริ่มจนจบการรันตัวอย่างแต่ละครั้ง คลิปที่แสดงเป็นส่วนที่ตัดมาและผ่านการตัดต่อแล้ว

  5. 5

    ใน BenchCAD คะแนนของ Claude สะท้อนการปรับเปลี่ยน 3 รายการในชุดการประเมิน ตามรายละเอียดในการ์ดระบบ Fable 5.1⁠(เปิดในหน้าต่างใหม่).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon และ Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(เปิดในหน้าต่างใหม่).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower และ Peter Jonas “The OpenScore String Quartet Corpus⁠(เปิดในหน้าต่างใหม่).” รายงานการประชุมวิชาการนานาชาติครั้งที่ 10 เรื่องห้องสมุดดิจิทัลสำหรับดนตรีวิทยา, หน้า 49–57 ACM, 2023.

  8. 8

    ใน FrontierCode มีการรัน GPT-6 Astra ด้วยข้อความสำหรับนักพัฒนา ที่คล้ายกับส่วนหนึ่งของข้อความสำหรับนักพัฒนาใน Codex⁠(เปิดในหน้าต่างใหม่): "หลีกเลี่ยงการสร้างไฟล์ทดสอบมากเกินไป สร้างไฟล์ทดสอบใหม่เฉพาะเมื่อข้อกำหนดของ Repository กำหนดไว้ หรือเมื่อไม่มีไฟล์ที่มีอยู่ซึ่งเหมาะจะใช้เป็นที่เก็บ หลีกเลี่ยงการปรับแก้ส่วนที่ไม่เกี่ยวข้องและความซับซ้อนที่ไม่จำเป็น นำยูทิลิตีที่มีอยู่และเหมาะสมกลับมาใช้ซ้ำ อ่านคำแนะนำของ Repository ที่เกี่ยวข้อง และตรวจสอบโค้ด การทดสอบ เอกสารประกอบ และ CI ที่อยู่ใกล้เคียง ปฏิบัติตามแบบแผนที่กำหนดไว้ เป้าหมายคือการสร้างโค้ดที่สะอาด เรียบร้อย และพร้อมรวมเข้ากับโค้ดหลัก" เราไม่ได้ปรับแต่งพรอมต์เพื่อให้ทำคะแนนในการประเมินนี้ได้ดีขึ้น

  9. 9

    ผลลัพธ์แรกศึกษาช่วงห่างระหว่างจำนวนเฉพาะ โดยพิจารณาว่าจำนวนเฉพาะยังสามารถอยู่ใกล้กันได้มากเพียงใด เมื่อไล่ไปยังจำนวนที่มีค่ามากขึ้นเรื่อยๆ เป็นเวลากว่าสิบปีที่ผลลัพธ์ที่ดีที่สุดเท่าที่ทราบระบุว่า มีคู่จำนวนเฉพาะจำนวนไม่สิ้นสุดซึ่งมีระยะห่างระหว่างกันไม่เกิน 246 ล่าสุด Julia Stadlmann⁠(เปิดในหน้าต่างใหม่) สามารถลดขอบเขตดังกล่าวจาก 246 ลงมาเหลือ 240 Astra ช่วยให้สามารถลดขอบเขตดังกล่าวลงเหลือ 186 และพิสูจน์ว่ามีคู่จำนวนเฉพาะอยู่ไม่สิ้นสุดที่มีระยะห่างระหว่างกันไม่เกิน 186 ช่องว่างสั้นระหว่างจำนวนเฉพาะ: บทพิสูจน์⁠(เปิดในหน้าต่างใหม่)และงานวิจัยสนับสนุน⁠(เปิดในหน้าต่างใหม่)

  10. 10

    ผลลัพธ์ที่สองว่าด้วยช่วงห่างระหว่างจำนวนเฉพาะที่กว้างผิดปกติ Astra ช่วยปรับปรุงพจน์หนึ่งในสูตรที่ใช้กำหนดขอบเขตของช่วงห่างเหล่านี้ ซึ่งไม่มีใครปรับปรุงให้ดีขึ้นมานานกว่า 80 ปี เรานำบทพิสูจน์ การให้เหตุผลแบบเป็นลำดับขั้นที่ย่อไว้ และเอกสารสำหรับตรวจสอบความถูกต้องของผลลัพธ์ทั้งสองมาเผยแพร่ด้วย ช่องว่างขนาดใหญ่ระหว่างจำนวนเฉพาะ: บทพิสูจน์⁠(เปิดในหน้าต่างใหม่)และงานวิจัยสนับสนุน⁠(เปิดในหน้าต่างใหม่)

  11. 11

    เราได้ประเมินโมเดล Claude ทั้งหมดอย่างอิสระตามขั้นตอน HealthBench Professional ที่กำหนดไว้ โดยใช้ GPT‑5.4 คะแนนที่ปรับตามการให้เกรดและความยาวแล้ว โดยไม่มีการตัดค่า สำหรับ Fable 5.1 เราใช้ Opus 5 เป็นตัวสำรองสำหรับกรณีที่ผู้ให้บริการปฏิเสธคำขอ

  12. 12

    Claude Fable 5 และ 5.1 ไม่ได้ถูกรวมอยู่ในการประเมิน LifeSciBench Gold v1, GeneBench Pro v13 และ MedChemBench เนื่องจากปฏิเสธที่จะตอบคำถามส่วนใหญ่ในการประเมินเหล่านี้

  13. 13

    บน ExploitGym เราได้ทดสอบ Astra และ Sol โดยไม่มีขีดจำกัดเวลา 6 ชั่วโมง เพื่อประเมินขีดความสามารถด้านไซเบอร์อย่างเต็มรูปแบบของทั้งสองได้ดียิ่งขึ้น ทั้ง 2 โมเดลทำงานได้รวดเร็วมากจนการจำกัดเวลามีผลกระทบเพียงเล็กน้อย

  14. 14

    ExploitBench (มิถุนายน-สิงหาคม 2569) มีช่องโหว่ V8 ที่มีความรุนแรงสูง 20 รายการ ครอบคลุม Chrome เวอร์ชันเสถียร 13 รุ่น เกณฑ์มาตรฐานนี้ทดสอบว่าเอเจนต์สามารถเรียกใช้โค้ดโดยพลการใน V8 และ Chrome เวอร์ชันทางการสำหรับ Linux ได้หรือไม่ โดยใช้ประโยชน์จากช่องโหว่แต่ละรายการที่ระบุ ช่องโหว่บางรายการที่รวมอยู่ในการประเมินอาจไม่เปิดโอกาสให้เรียกใช้โค้ดใดๆ ได้ตามต้องการภายใต้ข้อจำกัดของการประเมิน ดังนั้นอัตราความสำเร็จจึงอาจไม่สามารถสูงถึง 100% ได้ หมายเหตุ: การที่ GPT-5.6 Sol ได้คะแนน 5.5% เป็นผลมาจากการกำหนดเพดานไว้ที่ 300 เทิร์น ในเกณฑ์มาตรฐาน ซึ่งในการใช้งานจริง ลูกค้าที่ใช้ระดับ Max จะไม่มีข้อจำกัดดังกล่าว โมเดลที่การตั้งค่าคล้ายกันทำคะแนนได้ 11.5% เมื่อเจอกับข้อจำกัดน้อยกว่า

  15. 15
  16. 16

    เมื่อต้องทดสอบเปรียบเทียบกับโมเดลจากผู้ให้บริการรายอื่น เราจะใช้การตั้งค่าสำหรับงานวิจัยที่เรียบง่ายกว่า ส่วน Codex ที่ให้บริการจริงมีการตั้งค่าที่ซับซ้อนกว่า จึงอาจทำให้อัตราความผิดพลาดของตัวโมเดลโดยตรงแตกต่างกัน นอกจากนี้ มาตรการป้องกันของผู้ให้บริการแต่ละรายและวิธีการทำงานของเครื่องมือสำหรับใช้คอมพิวเตอร์ก็ยังแตกต่างกัน สำหรับ Codex ผู้ใช้จะไม่พบการทำงานแบบไม่ต้องขอการยืนยัน เนื่องจากการตั้งค่านี้ใช้เฉพาะในการวิจัยภายในเท่านั้น

  17. 17

    สำหรับ ScreenSpot-Pro และ ExploitGym คะแนน Fable ที่เรารายงานมาจาก Mythos ซึ่งก็คือ Fable ที่มีมาตรการป้องกันน้อยกว่า