Attention budget
งบความสนใจที่จำกัดของ AI: ยิ่งป้อนข้อมูลเข้าไปมากเท่าไหร่ ความแม่นในการโฟกัสแต่ละจุดยิ่งลดลง จึงต้องคัดใส่เฉพาะข้อมูลที่จำเป็นจริงๆ
Attention budget คือแนวคิดที่มองว่า "ความสนใจ" ของ model AI เป็นทรัพยากรที่มีจำกัด เหมือนงบประมาณก้อนหนึ่ง: ทุกครั้งที่เราป้อนข้อความ เอกสาร หรือประวัติการคุยเพิ่มเข้าไปใน context ทุก token ที่เพิ่มขึ้นจะดึงงบก้อนนี้ไปใช้ทีละนิด บทความเรื่อง context engineering ของ Anthropic เปรียบว่า model ก็เหมือนคนที่มี working memory จำกัด: ยิ่งต้องถืออะไรไว้ในหัวพร้อมกันมาก ยิ่งโฟกัสแต่ละเรื่องได้น้อยลง ดังนั้นความเชื่อที่ว่า "ใส่ข้อมูลให้ AI เยอะไว้ก่อน ยังไงก็ดี" จึงไม่จริงเสมอไป · บางครั้งกลับทำให้มันจับประเด็นสำคัญได้แย่ลงด้วยซ้ำ
เหตุผลอยู่ที่สถาปัตยกรรม transformer เอง: กลไก attention ให้ทุก token "มอง" token อื่นได้ทั้งหมด เกิดเป็นความสัมพันธ์แบบ n² คู่สำหรับ n token เมื่อ context ยาวขึ้น ความสามารถในการเก็บความสัมพันธ์เหล่านี้จึงถูกเกลี่ยจนบางลง อีกทั้งข้อมูลที่ใช้ training ส่วนใหญ่เป็น sequence สั้น model จึงมีประสบการณ์กับข้อความยาวมากๆ น้อยกว่า ผลที่ตามมาคืออาการ attention-degradation หรือที่งานวิจัยของ Chroma เรียกว่า context rot: จากการทดสอบ model 18 ตัว (รวม Claude 4, GPT-4.1, Gemini 2.5, Qwen3) พบว่าแม้แต่งานง่ายๆ ความแม่นก็ลดลงเรื่อยๆ เมื่อ input ยาวขึ้น และใน benchmark แบบถามตอบจากประวัติการคุย prompt ที่คัดมาเฉพาะส่วนเกี่ยวข้อง (ราว 300 token) ทำคะแนนดีกว่า prompt เต็มก้อน (ราว 113,000 token) อย่างชัดเจนในทุกตระกูล model
คนทำงานยุค AI ควรรู้จักคำนี้เพราะมันเปลี่ยนวิธีใช้เครื่องมือโดยตรง: เป้าหมายไม่ใช่ยัดข้อมูลให้มากที่สุด แต่คือหา "ชุด token ที่เล็กที่สุดแต่ signal สูงสุด" สำหรับงานนั้น ระบบ agent สมัยใหม่จึงมีเทคนิคประหยัดงบหลายแบบ เช่น compaction (สรุปบทสนทนายาวๆ แล้วเริ่ม context ใหม่) การจดโน้ตไว้นอก context การแตกงานให้ subagent ไปทำแล้วส่งกลับมาเฉพาะข้อสรุป และการดึงข้อมูลแบบ just-in-time คือหยิบมาเมื่อต้องใช้จริงแทนการโหลดทุกอย่างรอไว้ล่วงหน้า
ตัวอย่างจากบทสนทนาจริง
ฝ่ายบัญชี: ผมจะให้ AI ช่วยวิเคราะห์ค่าใช้จ่าย เลยวางรายงานย้อนหลัง 3 ปีลงไปในแชตทีเดียวเลย ยิ่งให้ข้อมูลเยอะมันยิ่งตอบแม่นใช่ไหมครับ
ทีม AI: ไม่เสมอครับ model มี attention budget จำกัด ทุก token ที่ใส่เพิ่มจะกินงบความสนใจไปเรื่อยๆ ถ้าคำถามของพี่ใช้แค่ข้อมูลไตรมาสล่าสุด แต่แนบไปทั้ง 3 ปี ความแม่นจะยิ่งตกเพราะของที่ไม่เกี่ยวไปแย่งโฟกัส คัดมาเฉพาะช่วงที่จะวิเคราะห์จริงๆ จะได้คำตอบที่ดีกว่าครับ
ระวังสับสนกับ
- context-window : อันนี้คือ "ความจุสูงสุด" เชิงปริมาณว่าใส่ได้กี่ token ส่วน attention budget คือคุณภาพความสนใจที่ร่อยหรอลงระหว่างทาง · window ขนาด 1 ล้าน token ไม่ได้แปลว่า model จะโฟกัสได้ทั่วถึงทั้ง 1 ล้าน
- attention-degradation (context rot) : สองคำนี้คู่กันคนละมุม · attention budget คือตัวทรัพยากรที่มีจำกัด ส่วน attention degradation คืออาการประสิทธิภาพตกที่เกิดขึ้นจริงเมื่อเราใช้งบเกินตัว
Sources (2)
- https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents fetched 2026-07-31
- https://www.trychroma.com/research/context-rot fetched 2026-07-31
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย