Dictionary · Agent · 119 / 291

Long-horizon task

งานที่ agent ต้องทำต่อเนื่องหลายร้อยรอบเป็นชั่วโมงกว่าจะจบ เป็นกำแพงที่โมเดลแนวหน้าปี 2026 ยังผ่านได้ไม่ถึง 20%

Long-horizon task คืองานที่ agent ต้องทำต่อเนื่องเป็นเวลานาน ผ่านการตัดสินใจหลายร้อยรอบ กว่าจะได้ผลลัพธ์ที่ถือว่าเสร็จ คำว่า horizon ในที่นี้หมายถึงระยะที่ต้องมองไปข้างหน้าก่อนจะรู้ว่าทำถูกหรือผิด งานที่ horizon สั้นคือถามแล้วตอบจบในรอบเดียว ส่วนงานที่ horizon ยาวคือสิ่งที่ต้องวางแผน ลงมือ เจอปัญหา แก้ แล้ววนกลับไปทำต่ออีกหลายสิบรอบ เช่น ทำการทดลองวิจัยซ้ำจากเปเปอร์ให้ได้ผลเหมือนเดิม หรือแก้บั๊กที่ต้องไล่หลายไฟล์กว่าจะเจอต้นเหตุ คำนี้กลายเป็นศัพท์หลักของวงการ agent ในปี 2026 เพราะมันคือเส้นแบ่งที่ชัดที่สุดระหว่างสิ่งที่ AI ทำได้ดีแล้วกับสิ่งที่ยังทำไม่ได้

ชุดวัดที่ทำให้คำนี้มีตัวเลขรองรับคือ Long-Horizon-Terminal-Bench ซึ่งส่งขึ้น arXiv เมื่อ 9 กรกฎาคม 2026 ผู้เขียนวิจารณ์ว่าชุดวัดเดิมเน้นโจทย์ที่จบภายในไม่กี่นาทีและตรวจแค่ผลลัพธ์สุดท้าย จึงมองไม่เห็นความคืบหน้าระหว่างทาง เขาจึงสร้างโจทย์ยาก 46 ข้อใน 9 หมวด ครอบคลุมตั้งแต่การทำการทดลองซ้ำ งาน software engineering การวิเคราะห์ข้อมูลหลายรูปแบบ เกมแบบโต้ตอบ ไปจนถึงการคำนวณเชิงวิทยาศาสตร์ แล้วแตกแต่ละข้อเป็นงานย่อยที่ให้คะแนนบางส่วนได้ เพื่อวัดว่า agent ไปได้ไกลแค่ไหนแม้จะยังไม่จบ ความหนักของโจทย์วัดเป็นตัวเลขได้ว่าโดยเฉลี่ยกินราว 9.9 ล้านโทเคนต่อข้อ ใช้ราว 231 รอบการทำงาน และใช้เวลารันจริงราว 85 นาทีต่อครั้ง ซึ่งหนักกว่าชุดวัดรุ่นก่อนหน้าประมาณสิบเท่า

ผลลัพธ์คือส่วนที่คนทำงานควรจำ จากการทดสอบโมเดลระดับแนวหน้า 15 ตัวภายใต้ agent ตัวเดียวกัน โมเดลที่เก่งที่สุดผ่านได้เพียง 15.2% ที่เกณฑ์คะแนน 0.95 และ 10.9% ที่เกณฑ์เต็ม 1.0 ส่วนค่าเฉลี่ยของทั้ง 15 ตัวอยู่ที่ 4.3% และ 1.7% ตามลำดับ จุดอ่อนหลักที่ผู้เขียนระบุคือการวางแผนระยะยาว การจัดการบริบทที่ยาวขึ้นเรื่อยๆ (ดู context-window) และการไล่แก้บั๊กเป็นรอบๆ ความหมายในทางปฏิบัติคือยิ่งงานยาว โอกาสสำเร็จยิ่งตกเร็ว เพราะความผิดพลาดเล็กๆ ในรอบต้นๆ จะสะสมและพาไปผิดทางทั้งสาย องค์กรที่วางแผนให้ agent ทำงานอัตโนมัติจึงควรออกแบบให้มีจุดที่คนเข้ามาตรวจเป็นระยะ (ดู human-in-the-loop) แทนที่จะปล่อยยาวแล้วมาดูตอนจบ และควรแตกงานใหญ่เป็นชิ้นสั้นๆ ที่ตรวจผลได้ทีละชิ้น ข้อควรระวังคือตัวเลขทั้งหมดนี้เป็นผลที่ผู้เขียนเปเปอร์รายงานเอง ยังรอการตรวจสอบซ้ำจากทีมอื่น และวัดเฉพาะงานบน terminal จึงไม่ควรเหมารวมว่าเป็นความสามารถของ agent ในงานทุกประเภท

ตัวอย่างจากบทสนทนาจริง

ผู้จัดการโครงการ: "เราอยากให้ agent รับงานปิดงบเดือนทั้งกระบวนการเลยครับ ตั้งแต่ดึงข้อมูลจากสามระบบ กระทบยอด แล้วออกรายงาน คิดว่าปล่อยให้มันทำเองทั้งชุดได้ไหม"

ที่ปรึกษา: "อันนี้เข้าข่าย long-horizon task ครับ คือต้องทำหลายสิบรอบกว่าจะจบ มีเปเปอร์ปี 2026 วัดงานแนวนี้แล้วพบว่าโมเดลที่เก่งสุดผ่านได้แค่ราวสิบห้าเปอร์เซ็นต์ ปัญหาไม่ใช่ว่ามันทำแต่ละขั้นไม่เป็น แต่พอสายยาวขึ้น ความผิดพลาดรอบต้นๆ จะพาผิดทั้งสาย ผมแนะนำให้แตกเป็นสี่ช่วง แล้วให้คนกดยืนยันตอนจบแต่ละช่วง โดยเฉพาะช่วงกระทบยอดที่ตัวเลขต้องตรงเป๊ะครับ"

ระวังสับสนกับ

  • context-window : context window คือปริมาณข้อความที่โมเดลรับไหวในครั้งเดียว ซึ่งเป็นข้อจำกัดด้านขนาด ส่วน long-horizon task เป็นข้อจำกัดด้านความยาวของงาน งานที่ยาวมักกิน context จนเต็มด้วย แต่ถึงจะขยาย context window ให้ใหญ่ขึ้น ปัญหาการวางแผนระยะยาวก็ยังไม่หายไป
  • agent : agent คือระบบที่รับเป้าหมายแล้วลงมือทำหลายขั้นเอง ส่วน long-horizon task คือประเภทของงานที่เอาไปวัดว่า agent นั้นเก่งจริงแค่ไหน พูดอีกแบบคือคำหนึ่งเป็นตัวผู้ทำ อีกคำเป็นตัวโจทย์
  • evals : evals คือวิธีวัดความสามารถของโมเดลโดยรวม ส่วน long-horizon task เป็นหมวดโจทย์เฉพาะภายใน evals ที่ออกแบบมาเพื่อจับจุดอ่อนที่ชุดวัดสั้นๆ มองไม่เห็น

ดูคำนี้ใน Knowledge Atlas →

Sources (2)

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Failure attributionMemory system