ร่วมกับ Ironclad พัฒนา AI ให้ใช้คอมพิวเตอร์ได้ดียิ่งขึ้น
ความร่วมมือวิจัยด้านการจัดทำสัญญาช่วยเราฝึกและประเมินเอเจนต์ AI ในงานวิชาชีพที่ซับซ้อนได้อย่างไร
ตอนเปิดตัว GPT‑6 Astra เราได้แสดงให้เห็นว่าโมเดลของเราใช้คอมพิวเตอร์ทำงานวิชาชีพได้ดีขึ้นเพียงใด ตั้งแต่จัดเตรียมเอกสารไปจนถึงทดสอบเว็บไซต์ เป้าหมายต่อไปคือพัฒนาเอเจนต์ให้ใช้ซอฟต์แวร์เฉพาะทางแก้ปัญหาธุรกิจที่ซับซ้อนได้เก่งขึ้นและมีประสิทธิภาพมากขึ้น เรากำลังศึกษาวิธีฝึกโมเดลให้เข้าใจกฎเกณฑ์การทำงานของบริษัท ทำงานที่มีหลายขั้นตอน และตรวจสอบว่าผลงานตรงตามข้อกำหนดที่ได้รับตั้งแต่แรกหรือไม่
เราร่วมมือโดยตรงกับบริษัทซอฟต์แวร์จำนวนจำกัดที่เข้าใจขั้นตอนการทำงานเหล่านี้ดีที่สุด เพื่อให้งานวิจัยก้าวหน้าเร็วขึ้น เราช่วยกันคัดเลือกงานที่ท้าทายและมีคุณค่าสูง แล้วนำมาเป็นโจทย์วิจัยสำหรับฝึกและประเมินโมเดล เพื่อพัฒนาให้โมเดลทำงานได้เก่งขึ้นและเป็นประโยชน์ต่อการใช้งานจริงในธุรกิจมากขึ้น
พันธมิตรรายแรกของเราคือ Ironclad ผู้นำด้านการใช้ AI จัดการงานสัญญา เราทำงานอย่างใกล้ชิดกับทีม Ironclad เพื่อพัฒนาภารกิจที่เอเจนต์ต้องตั้งค่าการจัดทำสัญญา ขั้นตอนการอนุมัติ และข้อกำหนดทางกฎหมายที่ใช้ซ้ำได้ ผลที่ได้แสดงให้เห็นว่าเอเจนต์ทำงานตามกระบวนการที่ซับซ้อนเหล่านี้ได้ดีขึ้น ความเชี่ยวชาญของ Ironclad ช่วยให้เรากำหนดเกณฑ์ความสำเร็จได้ชัดเจน และนำความต้องการที่แท้จริงของลูกค้ามาใช้พัฒนาโมเดลระดับแนวหน้าโดยตรง เราขอบคุณ Ironclad สำหรับความร่วมมือ และยินดีที่จะได้แบ่งปันผลงานที่เกิดจากความร่วมมือนี้
GPT‑6 Astra คือโมเดลระดับแนวหน้ารุ่นแรกของเราที่ผ่านการฝึกด้วยภารกิจบน Ironclad ผลการประเมินในการวิจัยพบว่า โมเดลนี้ได้คะแนนเฉลี่ยสูงกว่า GPT‑5.6 Sol 32% และใช้เวลาโดยประมาณในการทำภารกิจแต่ละครั้งน้อยกว่า 48%1
ลองนึกถึงทีมปฏิบัติการด้านกฎหมายที่กำลังวางขั้นตอนจัดซื้อซอฟต์แวร์ หากยอดซื้อเกินวงเงินที่กำหนด อาจต้องให้ฝ่ายการเงินอนุมัติ คำขอบางประเภทอาจต้องให้ฝ่ายความมั่นคงปลอดภัยตรวจสอบ ส่วนข้อสัญญาที่ต่างจากมาตรฐานอาจต้องให้ฝ่ายกฎหมายพิจารณา ผู้วางระบบต้องนำเงื่อนไขเหล่านี้ไปจัดทำแบบฟอร์มรับคำขอ แม่แบบเอกสาร กฎสำหรับอนุมัติ และบันทึกสัญญาฉบับสุดท้าย
เอเจนต์ AI ที่ทำงานนี้ต้องคำนึงถึงข้อกำหนดเหล่านั้นตลอดการใช้งานซอฟต์แวร์ เช่น ต้องตั้งค่าให้คำขอที่มียอดใช้จ่ายเกินเกณฑ์ส่งไปให้ฝ่ายการเงินอนุมัติ พร้อมตรวจสอบว่าคำขอที่เกินเกณฑ์และต่ำกว่าเกณฑ์ดำเนินไปตามขั้นตอนที่ถูกต้อง ความถูกต้องในแต่ละขั้นตอนเป็นเพียงส่วนหนึ่งเท่านั้น กระบวนการที่สร้างเสร็จต้องทำงานได้ในทุกกรณีที่ตั้งใจให้รองรับด้วย
พนักงาน Ironclad และบุคลากรของ OpenAI ที่ใช้ Ironclad ช่วยนักวิจัยของเราคัดเลือกงาน 11 งาน ครอบคลุมด้านกฎหมาย การค้า และการจัดซื้อ ตัวอย่างเช่น การตั้งค่าระบบเพื่อจัดทำสัญญาไม่เปิดเผยข้อมูล การสร้างขั้นตอนอนุมัติการจัดซื้อ และการปรับข้อสัญญาที่ใช้ซ้ำได้ให้สอดคล้องกับเขตอำนาจศาลที่ผู้ยื่นคำขอเลือก เราประเมินว่าผู้ใช้ที่มีประสบการณ์จะใช้เวลาทำงานเหล่านี้เฉลี่ยงานละประมาณ 30 ถึง 40 นาที
เราใช้เกณฑ์ 8 ถึง 50 ข้อในการประเมินแต่ละงาน โดยปรับจำนวนตามความซับซ้อนของงาน จึงเห็นได้ว่าโมเดลทำส่วนไหนถูกต้องและยังบกพร่องตรงไหน Ironclad ยังจัดเตรียมระบบซอฟต์แวร์ของตนให้โมเดลเข้าไปฝึกทำงานเหล่านี้ด้วย นักวิจัยของเราสร้างงานจำลองสำหรับฝึกโมเดล2 โดยอิงกระบวนการที่สะท้อนการทำงานจริง แล้วใช้การเรียนรู้แบบเสริมกำลังให้โมเดลพัฒนาจากการฝึกและข้อเสนอแนะ เมื่อมีทั้งงานที่คัดเลือกร่วมกับผู้ที่เข้าใจงานอย่างลึกซึ้ง เกณฑ์ประเมินที่ละเอียด และระบบให้ฝึก เราจึงมั่นใจได้ว่ากำลังพัฒนาโมเดลให้ทำงานจริงที่สำคัญที่สุดต่อลูกค้าได้ดีขึ้น
เราเปรียบเทียบ Astra กับ GPT‑5.6 Sol โดยใช้ระดับการให้เหตุผล Max สำหรับ Astra และ High สำหรับ Sol เพราะเป็นการตั้งค่าที่แต่ละโมเดลทำคะแนนได้สูงสุด เมื่อประเมินจากงาน 11 งานที่ใช้ในการวิจัย Astra ได้คะแนนเฉลี่ย 55.0% เทียบกับ 41.6% ของ GPT‑5.6 Sol ส่วนเวลาเฉลี่ยโดยประมาณที่ใช้ทำงานหนึ่งครั้งอยู่ที่ 19.2 นาทีสำหรับ Astra ลดลงจาก 37.0 นาทีของ Sol3 นอกจากนี้ โมเดลภายในที่ใช้ในการพัฒนา Astra ยังทำคะแนนได้ถึง 63.7% ในงานชุดเดียวกัน เรามุ่งนำความก้าวหน้านี้ไปต่อยอดในโมเดลรุ่นอนาคต
ตัวชี้วัด | GPT‑5.6 Sol | GPT‑6 Astra |
คะแนนเฉลี่ยตามเกณฑ์การประเมิน | 41.6% | 55.0% |
เวลาเฉลี่ยโดยประมาณต่อการลองทำหนึ่งครั้ง | 37.0 นาที | 19.2 นาที |
ผลการจำลองแสดงว่า Astra ทำได้ตรงตามข้อกำหนดของงานมากขึ้นและใช้เวลาน้อยลงในการทำแต่ละครั้ง คลิปด้านล่างทั้งสองคลิปแสดงให้เห็นว่าแต่ละโมเดลทำโจทย์วิจัยเดียวกันอย่างไร คลิปแรกคือ Astra ซึ่งทำได้ตามเกณฑ์ประมาณ 94% ในเวลาที่ประเมินไว้ราว 20 นาที ส่วนคลิปที่สองคือ GPT‑5.6 Sol ซึ่งทำได้ประมาณ 85% ในเวลาที่ประเมินไว้ราว 32 นาที
GPT‑6 Astra ทำภารกิจสำเร็จตามเกณฑ์ประมาณ 94% ในเวลาประมาณ 20 นาที
GPT‑5.6 Sol ทำได้ตามเกณฑ์ของภารกิจประมาณ 85% โดยใช้เวลาประมาณ 32 นาที
บทบาทของ Ironclad ในงานนี้สะท้อนถึงความท้าทายที่ลูกค้าคุ้นเคยดี นั่นคือ ระบบจัดการสัญญาต้องรับมือกับสถานการณ์ที่ไม่เป็นไปตามกรณีปกติได้ แต่ในขณะเดียวกันก็ต้องไม่ละเลยกฎสำคัญที่ธุรกิจจำเป็นต้องยึดถือ หากเอเจนต์หลงลืมหรือพลาดกฎข้อใดข้อหนึ่งระหว่างทำงาน บริษัทซอฟต์แวร์ก็ย่อมไม่สามารถไว้วางใจให้เอเจนต์รับผิดชอบงานนั้นได้เต็มที่ ประเด็นนี้จึงตอกย้ำว่า แม้เอเจนต์จะทำงานด้านสัญญาที่ซับซ้อนได้เก่งขึ้น การกำกับดูแลโดยมนุษย์ก็ยังมีความสำคัญ และแพลตฟอร์มด้านสัญญาที่รองรับการทำงานอย่างครบวงจรก็ยังจำเป็น ความร่วมมือกับนักวิจัยของเรายังเปิดโอกาสให้ Ironclad นำปัญหาเหล่านี้เข้าสู่กระบวนการพัฒนาโมเดลพื้นฐาน เพื่อที่เราจะได้ร่วมกันศึกษาและหาวิธีปรับปรุงต่อไป
เมื่อโมเดลมีความสามารถมากขึ้น Ironclad ก็มีโอกาสนำโมเดลเหล่านี้ไปใช้กับผลิตภัณฑ์ของตนได้มากขึ้น สำหรับทีมกฎหมายและทีมธุรกิจ นั่นอาจหมายถึงการให้ AI เข้ามาช่วยรับภาระงานสัญญาที่ซับซ้อนมากขึ้น โดยยังคงมีกลไกควบคุมที่ทีมเหล่านี้ต้องใช้ในการทำงาน
เรากำลังเปิดรับบริษัทซอฟต์แวร์จำนวนจำกัดให้มาร่วมงานกับทีมวิจัยและวิศวกรรมของเราโดยตรง เพื่อแก้โจทย์งานวิชาชีพสำคัญที่เอเจนต์ในปัจจุบันยังทำได้ไม่เสถียร หากทีมของคุณมีงานลักษณะนี้ เราอยากให้ยกตัวอย่างที่ชัดเจนว่าเอเจนต์ต้องทำอะไร พร้อมหลักฐานที่แสดงว่าติดปัญหาตรงไหน และเกณฑ์ที่คุณใช้ตัดสินว่าทำงานสำเร็จ นอกจากนี้ บริษัทที่ร่วมวิจัยควรมีผู้เชี่ยวชาญที่รู้จักงานนั้นเป็นอย่างดี พร้อมสภาพแวดล้อมการทดสอบที่ปลอดภัยและข้อมูลที่นำมาใช้วิจัยได้อย่างปลอดภัย เราจะใช้สิ่งเหล่านี้เป็นจุดเริ่มต้นในการค้นหาสาเหตุที่เอเจนต์ทำงานไม่สำเร็จและวัดว่าโมเดลพัฒนาขึ้นหรือไม่
หากทีมของคุณมีความพร้อมตามที่กล่าวมา กรุณาสมัครเพื่อหารือโอกาสร่วมวิจัยกับเรา
ผู้เขียน
เชิงอรรถ
- 1
- 2
- 3


