Dictionary · กลไกโมเดล · 51 / 291

Model provider request

คำขอหนึ่งครั้งที่แอปหรือ agent ส่งไปยัง API ของผู้ให้บริการโมเดล เช่น Anthropic เพื่อให้โมเดลประมวลผลบทสนทนาแล้วส่งคำตอบกลับมาหนึ่งชุด

Model provider request คือการยิงคำขอ (request) หนึ่งครั้งจากแอปพลิเคชัน เครื่องมือ AI หรือ agent ไปยัง API ของ model-provider : ผู้ให้บริการโมเดลอย่าง Anthropic เพื่อให้ model ประมวลผลแล้วตอบกลับมาหนึ่งชุด ตัวอย่างที่เป็นรูปธรรมคือ Messages API ของ Anthropic ซึ่งคำขอหนึ่งครั้งต้องระบุอย่างน้อยสามอย่าง: ชื่อโมเดลที่จะใช้ (model) ประวัติบทสนทนา (messages) และเพดานจำนวน token ที่อนุญาตให้ตอบ (max_tokens) แถมยังแนบของเสริมได้ เช่น system-prompt และรายการ tool ที่โมเดลเรียกใช้ได้ พร้อมยืนยันตัวตนด้วย API key ใน header

จุดที่คนมักไม่รู้คือ API แบบนี้เป็น stateless : ฝั่งผู้ให้บริการไม่ได้จำบทสนทนาเดิมไว้เลย เอกสารของ Anthropic ระบุว่าทุกคำขอต้องส่ง turn ก่อนหน้าทั้งหมดแนบไปใน messages ใหม่ทุกครั้ง แล้วโมเดลจึง generate ข้อความถัดไปของบทสนทนา คำตอบที่ได้กลับมาจะมีข้อมูลกำกับด้วยว่าคำขอนี้ใช้ input-tokens และ output-tokens ไปเท่าไหร่ (ฐานของการคิดค่าใช้จ่าย) และหยุดตอบเพราะอะไรผ่านค่า stop_reason เช่น ตอบจบเอง (end_turn) ชนเพดาน (max_tokens) หรือขอเรียกเครื่องมือ (tool_use)

ทำไมคนทำงานยุค AI ต้องรู้จักหน่วยนี้: เพราะสิ่งที่เราเห็นเป็น "การถามหนึ่งครั้ง" บนหน้าจอ เบื้องหลังมักไม่ใช่ request เดียว เมื่อโมเดลตอบกลับมาด้วย stop_reason แบบ tool_use ระบบต้องรันเครื่องมือแล้วยิง request ใหม่พร้อม tool-result กลับไปให้โมเดลอ่านต่อ วนแบบนี้จนกว่างานจะจบ หนึ่งคำถามจึงกลายเป็น request หลายสิบครั้งได้ การเข้าใจหน่วยนี้ช่วยให้อ่านบิลค่า API ออก เข้าใจว่าทำไมงานบางอย่างช้า (latency คือเวลาระหว่างส่ง prompt จนได้คำตอบกลับ) และเข้าใจว่าทำไม input เดิมเป๊ะอาจได้คำตอบต่างกันในแต่ละ request : Anthropic ระบุเองว่าแม้ตั้ง temperature เป็น 0 ผลลัพธ์ก็ไม่ deterministic เต็มร้อย (non-determinism)

ตัวอย่างจากบทสนทนาจริง

ฝ่ายบัญชี: "พี่ครับ เดือนนี้ทีมใช้ AI ตอบลูกค้าแค่วันละไม่กี่สิบคำถาม แต่ dashboard ของ Anthropic ขึ้นว่ามีเป็นพันกว่า request แบบนี้โดนคิดเงินเกินหรือเปล่า"

ทีม AI: "ไม่เกินครับ หนึ่งคำถามของลูกค้าไม่เท่ากับหนึ่ง model provider request เวลา agent ต้องเปิดดูข้อมูลออเดอร์หรือเช็กสต๊อก มันจะยิง request ใหม่พร้อมประวัติแชททั้งก้อนกลับไปให้โมเดลทุกรอบที่เรียกเครื่องมือเสร็จ คำถามเดียวเลยกลายเป็นหลาย request ได้ ตัวเลขที่ต้องดูจริงๆ คือ input กับ output tokens ในแต่ละ request ครับ"

ระวังสับสนกับ

  • turn : หนึ่ง turn คือหนึ่งรอบโต้ตอบในสายตาผู้ใช้ (ถามหนึ่งที ได้คำตอบหนึ่งที) แต่เบื้องหลังหนึ่ง turn อาจประกอบด้วย model provider request หลายครั้ง โดยเฉพาะเมื่อ agent เรียก tool ระหว่างทาง
  • permission-request : อันนั้นคือจังหวะที่ agent หยุดถามขออนุญาต "คน" ก่อนลงมือทำอะไรบางอย่าง ส่วน model provider request คือการขอให้ "โมเดล" ประมวลผล คนละทิศทางกันเลย

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Model providerNext-token prediction