Cache tokens
Token ขาเข้าที่ระบบเคยอ่านแล้วเก็บผลไว้ใน cache ทำให้รอบถัดไปไม่ต้องประมวลผลซ้ำ ค่าใช้จ่ายถูกลงมากและโมเดลเริ่มตอบเร็วขึ้น
Cache tokens คือ token ฝั่งขาเข้าที่โมเดลเคยอ่านและประมวลผลไปแล้วในคำขอก่อนหน้า โดยผู้ให้บริการ (model-provider) เก็บผลการประมวลผลนั้นไว้ในหน่วยความจำชั่วคราวที่เรียกว่า cache เมื่อคำขอครั้งถัดไปขึ้นต้นด้วยข้อความชุดเดิมเป๊ะ ระบบจะดึงส่วนนั้นจาก cache แทนที่จะอ่านใหม่ตั้งแต่ต้น เทคนิคนี้เรียกว่า prompt caching เหตุที่มันจำเป็นคือโมเดล AI ทำงานแบบ stateless : ไม่จำอะไรข้ามคำขอเลย ทุก turn ของการสนทนา แอปต้องส่ง system-prompt นิยามเครื่องมือ และประวัติแชททั้งหมดกลับไปใหม่ ส่วนต้นของ prompt จึงซ้ำเดิมแทบทุกครั้ง cache ช่วยให้ไม่ต้องจ่ายเต็มราคาซ้ำๆ กับของที่เหมือนเดิม
ในทางบัญชี cache tokens แยกเป็นสองขา: "cache write" คือรอบแรกที่ระบบเขียนข้อมูลลง cache และ "cache read" คือรอบถัดๆ ไปที่อ่านกลับมาใช้ ฝั่ง Claude API รายงานสองค่านี้ใน usage เป็น cache_creation_input_tokens และ cache_read_input_tokens : การเขียนคิดแพงกว่า input-tokens ปกติ 1.25 เท่า (cache อายุ 5 นาที) หรือ 2 เท่า (อายุ 1 ชั่วโมง) แต่การอ่านจ่ายเพียงราว 10% ของราคาปกติ ส่วนฝั่ง OpenAI ระบบ cache ให้อัตโนมัติเมื่อ prompt ยาวถึงเกณฑ์ (อย่างน้อยราว 1,024 token) และรายงานส่วนที่อ่านจาก cache เป็น cached_tokens ในราคาลด เงื่อนไขร่วมของทุกเจ้าคือต้องเป็น exact prefix match: ข้อความส่วนต้นต้องเหมือนเดิมทุกตัวอักษร ถ้ามีอะไรเปลี่ยนกลางทาง เช่น แทรก timestamp ใหม่ทุกครั้ง cache ตั้งแต่จุดนั้นลงไปจะใช้ไม่ได้ทันที
คนทำงานยุค AI ควรรู้จักคำนี้เพราะมันคือตัวแปรใหญ่ที่สุดตัวหนึ่งของ "ค่า AI" ในองค์กร งานที่ใช้ agent คุยต่อเนื่องหลายสิบ turn ถ้าไม่มี caching ประวัติทั้งหมดจะถูกคิดเงินเต็มราคาใหม่ทุกรอบจนบิลบานปลายเร็วมาก นอกจากถูกลงแล้วยังเร็วขึ้นด้วย เพราะโมเดลเริ่มพ่นคำตอบแรกได้ไวขึ้นเมื่อไม่ต้องอ่านของเดิมซ้ำ และเอกสารของทั้ง Anthropic และ OpenAI ยืนยันตรงกันว่า caching ไม่มีผลต่อการสร้างคำตอบ: โมเดลสร้างคำตอบแบบเดียวกับตอนไม่ใช้ cache แค่ถูกลงและเร็วขึ้น
ตัวอย่างจากบทสนทนาจริง
น้องฝ่ายการเงิน: "พี่คะ บิล API เดือนนี้มีบรรทัด cache read ตั้ง 40 ล้าน token แต่ input ปกติไม่ถึงล้านเอง แบบนี้เราโดนคิดเงินซ้ำซ้อนหรือเปล่า"
พี่ทีม AI: "ตรงกันข้ามเลยครับ บรรทัดนั้นคือส่วนที่เราประหยัด cache tokens 40 ล้านนั้นคือ system prompt กับประวัติแชทที่ถูกส่งซ้ำทุก turn แต่ระบบอ่านจาก cache จ่ายแค่ราว 10% ของราคา input ปกติ ถ้าวันไหน caching ใช้ไม่ได้ขึ้นมา บิลเดือนนั้นแหละถึงจะน่าตกใจจริง"
ระวังสับสนกับ
- prefix-cache : คือกลไกและพื้นที่จัดเก็บฝั่งระบบ ส่วน cache tokens คือหน่วยนับที่ปรากฏในบิลว่ามี token ถูกเขียนลงหรืออ่านออกจาก cache นั้นเท่าไหร่ พูดง่ายๆ prefix cache คือ "ตู้เก็บ" ส่วน cache tokens คือ "ยอดที่วิ่งผ่านตู้"
- input-tokens : cache tokens ไม่ใช่ token ชนิดใหม่ มันคือ input tokens ส่วนหนึ่งที่ถูกคิดเงินในเรตพิเศษ ยอดขาเข้าจริงทั้งหมดคือ input ปกติ + cache write + cache read รวมกัน
Sources (2)
- https://platform.claude.com/docs/en/build-with-claude/prompt-caching fetched 2026-07-31
- https://developers.openai.com/api/docs/guides/prompt-caching fetched 2026-07-31
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย