Asana ลดต้นทุนโมเดล 76 เท่าด้วย GPT‑6.1 Sol
Asana ใช้ GPT‑6 Astra ใน Codex ทดสอบเอเจนต์เบราว์เซอร์จนต้นทุนถูกลง 76 เท่าและเร็วขึ้น 5 เท่า เพื่อให้ลูกค้าได้ใช้โมเดลที่เก่งขึ้น

76 เท่า
ต้นทุนโมเดลโดยประมาณลดลงด้วยเวิร์กโฟลว์ GPT-6.1 Sol ที่ปรับปรุงแล้ว
5 เท่า
ทำงานผ่านเบราว์เซอร์ได้เร็วขึ้นด้วยขั้นตอนการทำงานที่ปรับปรุงแล้วบน GPT-6.1 Sol
0.47 ดอลลาร์สหรัฐ
ต้นทุนโมเดลโดยประมาณเฉลี่ยเมื่อใช้เวิร์กโฟลว์ GPT-6.1 Sol ที่ปรับปรุงแล้ว
Asana ใช้ GPT‑6 Astra ใน Codex ดำเนินการทดลองเพื่อปรับเวิร์กโฟลว์ของเอเจนต์เบราว์เซอร์บน GPT‑6.1 Sol ให้มีต้นทุนถูกลง 76 เท่าและทำงานเร็วขึ้น 5 เท่า
Asana ช่วยให้ลูกค้าทำงานข้ามแอปพลิเคชันธุรกิจได้โดยอัตโนมัติผ่าน StackAI(เปิดในหน้าต่างใหม่) ซึ่งเป็นแพลตฟอร์มที่บริษัทเข้าซื้อกิจการ(เปิดในหน้าต่างใหม่) โดยลูกค้าสามารถสร้างขั้นตอนการทำงานเพื่อเข้าถึงเว็บไซต์ กรอกแบบฟอร์ม และรวบรวมข้อมูลได้โดยไม่ต้องเขียนโค้ด เนื่องจาก Asana รองรับการใช้งานในปริมาณมาก ความไม่มีประสิทธิภาพเพียงเล็กน้อยในแต่ละขั้นตอนจึงอาจสะสมจนส่งผลกระทบต่อการทำงานโดยรวมได้
Frank Hidalgo, PhD ประธานเจ้าหน้าที่ฝ่ายเทคโนโลยีของ StackAI ในเครือ Asana ต้องการพัฒนาเอเจนต์ที่ทำงานผ่านเบราว์เซอร์ให้ทำงานได้รวดเร็วยิ่งขึ้นและมีต้นทุนการใช้งานต่ำลง เขาจึงให้ GPT‑6 Astra ใน Codex วิเคราะห์การทำงานของเอเจนต์ ทดลองปรับปรุงประสิทธิภาพ และเปรียบเทียบผลลัพธ์ จากงานที่เขาประเมินว่าหากลงมือทำเองจะต้องใช้เวลาหนึ่งถึงสองเดือน กลับเสร็จสิ้นได้ภายในเวลาประมาณหนึ่งสัปดาห์
การศึกษาของ Asana รันการทดสอบ 144 ครั้ง(เปิดในหน้าต่างใหม่) ทดสอบ GPT‑6.1 Sol และโมเดลระดับแนวหน้าอีกสามรุ่น ซึ่งในที่นี้เรียกว่าโมเดล A, B และ C ผลการศึกษาพบว่า หลังจากปรับปรุงขั้นตอนการทำงานด้วย GPT‑6.1 Sol แล้ว ต้นทุนการใช้โมเดลโดยประมาณลดลงเหลือเฉลี่ย 0.47 ดอลลาร์ต่อครั้ง และใช้เวลาทำงานครั้งละประมาณ 4 นาที ซึ่งมีต้นทุนต่ำกว่าระบบเดิมที่ใช้งานจริงด้วยโมเดล B ถึง 76 เท่า และทำงานได้เร็วขึ้น 5 เท่า
“นี่คือสิ่งที่เกิดขึ้นเมื่อมนุษย์และเอเจนต์ทำงานเป็นทีมเดียวกัน วิศวกรมีหน้าที่กำหนดทิศทาง GPT-6 Astra ลงมือทดลองตามแนวทางนั้น จากนั้นทีมงานใช้ Command เพื่อนำผลลัพธ์ไปปรับใช้กับระบบจริง นี่คือตัวอย่างที่แสดงให้เห็นว่า Asana ช่วยให้มนุษย์และเอเจนต์ร่วมมือกันทำงานได้จริง”
Hidalgo ต้องการเร่งกระบวนการทำงาน จึงใช้ GPT‑6 Astra ผ่าน Codex ช่วยสำรวจโค้ดและทำความเข้าใจวิธีที่เอเจนต์สร้างคำขอเพื่อส่งไปยังโมเดลแต่ละครั้ง GPT‑6 Astra พบว่าแม้เอเจนต์จะแคชคำสั่งหลักและคำจำกัดความของเครื่องมือไว้แล้ว แต่กลับไม่ได้แคชข้อความจากหน้าเว็บและภาพหน้าจอที่เก็บรวบรวมเพิ่มขึ้นระหว่างการทำงาน ส่งผลให้ทุกครั้งที่ส่งคำขอไปยังโมเดล เอเจนต์ต้องส่งข้อมูลเหล่านี้ทั้งหมดซ้ำอีกครั้งโดยเสียค่าใช้จ่ายในอัตราเต็ม
นอกจากนี้ เอเจนต์ยังลบภาพหน้าจอเก่าและตัดข้อความบางส่วนออกแทบทุกขั้นตอน ทำให้ประวัติการทำงานเปลี่ยนแปลงอยู่ตลอดเวลา ดังนั้น แม้จะแคชข้อมูลประวัติเหล่านี้ไว้ ก็ไม่ได้ช่วยเพิ่มประสิทธิภาพมากนัก อีกทั้งการลบข้อมูลดังกล่าวอาจทำให้เอเจนต์สูญเสียรายละเอียดสำคัญจนต้องกลับไปเปิดหน้าเว็บที่เคยอ่านแล้วซ้ำอีกครั้ง
Hidalgo ทบทวนแนวทางแก้ไขที่ GPT‑6 Astra เสนอ และเลือกมาทดสอบสามข้อ:
ขยายการแคชให้ครอบคลุมประวัติการท่องเว็บของเอเจนต์
เพิ่มปริมาณข้อความที่เก็บไว้ได้
ลบภาพหน้าจอเป็นชุดแทนการลบทุกขั้นตอน
ในขั้นแรก GPT‑6 Astra ทดสอบระบบอย่างรวดเร็วเพื่อระบุปัจจัยที่มีผลต่อการทำงาน จากนั้นจึงปรับโครงสร้างโค้ดใหม่ เนื่องจากโค้ดเดิมไม่รองรับการทดลองแบบควบคุมตัวแปร การปรับปรุงครั้งนี้ทำให้สามารถใช้ฟรอนต์เอนด์และแบ็กเอนด์ร่วมกันเพื่อทดสอบขั้นตอนการทำงานหลายชุดได้พร้อมกัน โดยกำหนดค่าของแต่ละชุดแยกจากกันได้
Astra ดำเนินการทดสอบทั้งหมดโดยทดสอบการจำกัดขนาดประวัติการทำงานไว้ที่ 120,000 และ 480,000 ตัวอักษร ร่วมกับวิธีจัดการแคชและภาพหน้าจอ 6 รูปแบบ โดยทดสอบแต่ละรูปแบบกับโมเดลทั้ง 4 รุ่น รุ่นละ 3 ครั้ง (ดูตารางด้านล่าง) ผลปรากฏว่าวิธีที่ให้ผลดีที่สุดคือการเก็บภาพหน้าจอสะสมไว้ได้สูงสุด 20 ภาพ ก่อนลบภาพเก่าทั้งหมดออกและเหลือไว้เฉพาะภาพล่าสุด วิธีนี้ช่วยให้ข้อมูลประวัติส่วนก่อนหน้ายังคงเดิมได้นานขึ้น เพราะไม่ต้องลบภาพหน้าจอบ่อยครั้ง เมื่อนำมาใช้ร่วมกับการเพิ่มขนาดประวัติการทำงาน จึงได้ขั้นตอนการทำงานที่มีประสิทธิภาพสูงสุด ในการทดสอบแต่ละรูปแบบ ระบบต้องทำงานเดียวกัน นั่นคือรวบรวมข้อมูล 6 รายการของหนังสือแต่ละเล่มจากทั้งหมด 32 เล่มในแค็ตตาล็อกตัวอย่างที่เปิดให้บุคคลทั่วไปเข้าถึงได้ ซึ่งเป็นงานลักษณะเดียวกับที่ลูกค้าบางรายของ Asana ใช้ StackAI ดำเนินการ
โมเดล | คำอธิบาย | ราคา |
|---|---|---|
โมเดล A | โมเดลขนาดเล็กกว่าและราคาถูกกว่าจากแล็บวิจัย AI ระดับแนวหน้าอีกแห่ง เปิดตัวในฤดูใบไม้ร่วงปี 2568 | ราคาครึ่งหนึ่งของ GPT‑6.1 Sol |
โมเดล B | โมเดลที่ใช้ในระบบจริงแต่เดิม มาจากแล็บเดียวกับโมเดล A เปิดตัวในฤดูร้อนปี 2569 | ราคาเท่ากับ GPT‑6.1 Sol |
โมเดล C | โมเดล B เวอร์ชันอัปเดต เปิดตัวในฤดูใบไม้ร่วงปี 2569 | ราคาเท่ากับ GPT‑6.1 Sol |
GPT‑6.1 Sol | โมเดลของ OpenAI |
GPT‑6 Astra ดำเนินการทดสอบขั้นตอนการทำงานต่าง ๆ พร้อมตรวจสอบคำขอที่ส่งไปยังโมเดล บันทึกการใช้งาน และผลลัพธ์ที่ได้ โดยมีการใช้โมเดลในเซสชันแยกต่างหากเพื่อตรวจทานงานอีกครั้ง ทีมงานบันทึกคำขอ ข้อมูลการทำงานโดยละเอียด และผลลัพธ์ของทุกเซสชันไว้ใน Command(เปิดในหน้าต่างใหม่) ซึ่งเป็นแพลตฟอร์มสำหรับการพัฒนาและส่งมอบซอฟต์แวร์ของ Asana เพื่อให้สามารถย้อนกลับมาตรวจสอบการศึกษาทั้งหมดได้ในภายหลัง จากนั้นทีมงานนำผลการศึกษาที่บันทึกไว้ใน Command มาสร้างเป็นรายการงานที่ต้องดำเนินการ ก่อนจัดทำ Pull Request เพื่อนำการปรับปรุงต่างๆ ไปใช้กับระบบจริง
“ถ้าทำเอง งานนี้คงใช้เวลาหนึ่งถึงสองเดือน พอใช้ GPT-6 Astra ใน Codex ก็ใช้เวลาประมาณหนึ่งอาทิตย์ ผมตั้ง /goal ก่อนเข้านอน แล้วมาตรวจผลลัพธ์ในตอนเช้า”
หลังจากปรับปรุงประสิทธิภาพโมเดล B มีต้นทุนการใช้โมเดลโดยประมาณลดลงถึง 29 เท่า จากเดิมอย่างน้อย 36.21 ดอลลาร์ เหลือเพียง 1.24 ดอลลาร์ต่อครั้ง ทั้งนี้ การทดสอบบางครั้งก่อนปรับปรุงไม่สามารถทำงานจนเสร็จได้ เนื่องจากระบบทำงานครบจำนวนขั้นตอนสูงสุดที่กำหนดไว้เสียก่อน ขณะที่ GPT‑6.1 Sol ซึ่งใช้ขั้นตอนการทำงานที่ปรับปรุงแล้ว มีต้นทุนต่ำกว่าโมเดล B อีก 2.6 เท่า โดยอยู่ที่เพียง 0.47 ดอลลาร์ต่อครั้ง และการทดสอบทุกครั้งหลังปรับปรุงสามารถทำงานได้สำเร็จพร้อมให้คำตอบที่ถูกต้อง
ค่าเฉลี่ยจากการรัน 3 ครั้ง ≥: ค่าฐานรวมการรันที่ถึงขีดจำกัดไว้ด้วย ค่าเฉลี่ยที่แสดงจึงเป็นค่าขั้นต่ำของค่าเฉลี่ยที่แท้จริง
อัตราส่วนเปรียบเทียบสองค่าทางด้านขวาใช้โมเดล B ที่ปรับปรุงแล้วเป็นเกณฑ์ โมเดล B รันในระยะที่ 1 ส่วนโมเดล C และ Sol 6.1 รันในระยะที่ 2 ของการศึกษาเดียวกัน (เส้นประ)
เมื่อพิจารณาเฉพาะ GPT‑6.1 Sol ซึ่งเพิ่มขนาดประวัติการทำงานแล้ว พบว่าวิธีจัดการแคชและภาพหน้าจอแบบใหม่ช่วยลดต้นทุนได้ถึง 4 เท่า จาก 1.97 ดอลลาร์ เหลือเพียง 0.47 ดอลลาร์ต่อครั้ง โดยการเรียกใช้โมเดลแต่ละครั้งมีต้นทุนต่ำลงประมาณ 3 เท่า เนื่องจากข้อมูลนำเข้า 89% มาจากแคช ซึ่งมีค่าใช้จ่ายเพียง 5% ของการประมวลผลข้อมูลที่ไม่ได้แคชไว้ นอกจากนี้ ระบบยังทำงานได้เร็วขึ้นด้วย จากเดิมที่ใช้โมเดล B และต้องใช้เวลาอย่างน้อย 22.5 นาทีต่อครั้ง เหลือเพียงประมาณ 4 นาทีเมื่อใช้ GPT‑6.1 Sol กับขั้นตอนการทำงานที่ปรับปรุงแล้ว
แสดงค่าเฉลี่ยจากการทดสอบ 3 ครั้ง โดยใช้เส้นแสดงส่วนเบี่ยงเบนมาตรฐาน ส่วนสัญลักษณ์ ≥ หมายความว่ามีการทดสอบอย่างน้อยหนึ่งครั้งที่ถึงขีดจำกัดหรือทำงานไม่เสร็จ ดังนั้น ค่าเฉลี่ยที่แท้จริงจึงอาจสูงกว่าค่าที่แสดง แต่จะไม่ต่ำกว่าค่านี้
กราฟแท่งใช้โทนสีน้ำเงิน โดยให้เปรียบเทียบผลของการแคชกับแท่งกราฟที่กำหนดขนาดประวัติไว้ที่ 480k
จุดแสดงผลการทดสอบแต่ละครั้งและเส้นแสดงส่วนเบี่ยงเบนมาตรฐาน เป็นค่าประมาณที่สร้างขึ้นใหม่โดยอ้างอิงจากภาพต้นฉบับ เนื่องจากไม่มีข้อมูลผลการทดสอบแต่ละครั้งและค่าส่วนเบี่ยงเบนมาตรฐานที่แท้จริง
แสดงค่าเฉลี่ยจากการทดสอบ 3 ครั้ง โดยใช้เส้นแสดงส่วนเบี่ยงเบนมาตรฐาน ส่วนสัญลักษณ์ ≥ หมายความว่ามีการทดสอบอย่างน้อยหนึ่งครั้งที่ถึงขีดจำกัดหรือทำงานไม่เสร็จ ดังนั้น ค่าเฉลี่ยที่แท้จริงจึงอาจสูงกว่าค่าที่แสดง แต่จะไม่ต่ำกว่าค่านี้
กราฟแท่งใช้โทนสีน้ำเงิน โดยให้เปรียบเทียบผลของการแคชกับแท่งกราฟที่กำหนดขนาดประวัติไว้ที่ 480k
จุดแสดงผลการทดสอบแต่ละครั้งและเส้นแสดงส่วนเบี่ยงเบนมาตรฐาน เป็นค่าประมาณที่สร้างขึ้นใหม่โดยอ้างอิงจากภาพต้นฉบับ เนื่องจากไม่มีข้อมูลผลการทดสอบแต่ละครั้งและค่าส่วนเบี่ยงเบนมาตรฐานที่แท้จริง
การตรวจสอบครั้งนี้ยังพบว่า วิธีจัดการประวัติการทำงานส่งผลโดยตรงต่อความสามารถของเอเจนต์ในการทำงานจนได้คำตอบ เมื่อเพิ่มพื้นที่ให้ GPT‑6.1 Sol เก็บประวัติการเข้าชมเว็บไซต์ได้มากขึ้น จำนวนการทดสอบที่เอเจนต์สามารถให้คำตอบได้ก็เพิ่มขึ้นจากเพียง 3 ครั้งใน 18 ครั้งเมื่อจำกัดขนาดประวัติไว้ต่ำ เป็น 18 ครั้งจาก 18 ครั้งเมื่อเพิ่มขนาดประวัติ โดยทุกครั้งให้คำตอบที่ถูกต้อง สำหรับ Hidalgo ประโยชน์ทางธุรกิจที่สำคัญคือการช่วยให้ลูกค้าเข้าถึงโมเดลที่ทำงานได้รวดเร็วและมีความสามารถสูงขึ้น โดยยังควบคุมต้นทุนการดำเนินงานให้อยู่ในระดับที่เหมาะสมและรองรับการใช้งานได้อย่างยั่งยืน
“แต่ก่อนต้นทุนเป็นข้อจำกัดว่าเราจะให้ลูกค้าใช้โมเดลใดได้บ้างกับงานเหล่านี้ เมื่อทำให้เอเจนต์มีประสิทธิภาพมากขึ้น เราก็ให้ลูกค้าใช้โมเดลที่ดีขึ้นและเร็วขึ้นได้ พร้อมกับลดต้นทุนการดำเนินงานของเรา”
ปัจจุบัน Asana ได้นำการปรับปรุงระบบนำทางเว็บไซต์มาใช้งานจริงใน StackAI แล้ว พร้อมเดินหน้าพัฒนาเครื่องมือเพื่อให้สามารถทำการทดลองแบบเดียวกันซ้ำได้สะดวกยิ่งขึ้น ในอนาคต ทีมงานตั้งใจจะผนวกการทดสอบลักษณะนี้เข้ากับกระบวนการประเมินผลของแพลตฟอร์ม เพื่อช่วยให้ลูกค้าและทีมงานภายในเปรียบเทียบทั้งค่าใช้จ่าย เวลาที่ใช้ทำงาน และความถูกต้องครบถ้วนของคำตอบประกอบการกำหนดค่าเอเจนต์
“ตอนนี้ความเร็วในการส่งมอบซอฟต์แวร์ไม่ใช่อุปสรรคอีกต่อไป แต่สิ่งที่เป็นข้อจำกัดคือเวลาและความใส่ใจที่คนเรามีให้กับงาน เรากำลังเข้าใกล้ยุคที่วิศวกรทุกคนจะทำหน้าที่เหมือนผู้จัดการผลิตภัณฑ์ที่คอยบริหารทีมเอเจนต์จำนวนมาก”
ปัจจุบัน Asana ใช้ GPT‑6 Astra ผ่าน Codex เพื่อทดสอบฟีเจอร์ต่างๆ ก่อนเปิดให้ใช้งานจริง โดยให้ Astra เข้าไปใช้งานแพลตฟอร์ม ทดลองป้อนข้อมูลหลายรูปแบบ ก่อนรายงานข้อบกพร่องที่พบให้เจ้าหน้าที่ตรวจสอบคุณภาพพิจารณา Hidalgo เชื่อว่าแนวทางนี้จะเป็นรากฐานของกระบวนการพัฒนาซอฟต์แวร์ยุคใหม่ ที่สามารถใช้เอเจนต์บนคลาวด์หลายเซสชันทดสอบฟีเจอร์ต่างๆ ไปพร้อมกันได้
อ่านการศึกษาฉบับเต็มได้ที่บล็อกของ Asana(เปิดในหน้าต่างใหม่) และ StackAI(เปิดในหน้าต่างใหม่)


