DeepSeek V4 Flash (0731): agentic score ใกล้ frontier เฉพาะบาง benchmark ที่ราคา $0.14/$0.28 ใต้ MIT License และประกาศขึ้นราคา 2 เท่าในชั่วโมงเร่งด่วน
DeepSeek ปล่อยโมเดลรุ่นอัปเดต DeepSeek-V4-Flash-0731 เมื่อ 31 ก.ค. 2026 บน Hugging Face โดยระบุใน model card ว่า "This repository and the model weights are licensed under the MIT License" (Hugging Face)
ประเด็นของข่าวนี้ไม่ใช่ตัวโมเดลอย่างเดียว แต่คือ ส่วนต่างระหว่างคะแนนกับราคา และ ประกาศเรื่องราคาที่ซ่อนอยู่ในเชิงอรรถของหน้าราคา ซึ่งสำคัญกว่าตัวคะแนนสำหรับคนที่ต้องวางแผนต้นทุน
ขนาดโมเดล: ตัวเลขที่ต้องระวังสามชุด
เรื่องนี้มีตัวเลขลอยอยู่สามชุดและสองชุดผิด ต้องแยกให้ออก
- ตัวเลขที่ถูก: 284B parameters (13B activated) ตามที่ model card ของ DeepSeek เขียนเอง (Hugging Face · base card)
- "304B params" ที่เห็นบนหน้า Hugging Face ไม่ใช่คำพูดของ DeepSeek แต่เป็น metadata ที่ HF คำนวณเองจากการนับ tensor ทุกก้อนใน repo (167GB, BF16) ซึ่งรวม speculative decoding module (DSpark) ที่แนบมาด้วย ไม่ใช่ขนาดของ base model · model card เขียนว่าโมเดลนี้ "has the same model structure as DeepSeek-V4-Flash-DSpark, i.e. it comes with a speculative decoding module attached"
- "283B-A13B" ที่ Blognone รายงานคลาดเคลื่อน (Blognone) ตัวเลขจริงคือ 284B
context window อยู่ที่ 1 ล้าน token และ model card ระบุว่ารองรับ reasoning_effort สามระดับคือ low, high, max โดยแนะนำความยาว output สูงสุด 384K token สำหรับสองระดับบน
คะแนน: ใกล้ frontier เฉพาะบาง benchmark ไม่ใช่ทั้งกระดาน
ตัวเลขทั้งหมดในหัวข้อนี้เป็น vendor-reported คือ DeepSeek วัดเองและเลือก baseline เอง ยังไม่มี independent replication
| benchmark | V4 Flash 0731 | Claude Opus 4.8 |
|---|---|---|
| Terminal Bench 2.1 | 82.7 | 85.0 |
| DSBench-Hard | 59.6 | 71.7 |
| NL2Repo | 54.2 | 69.7 |
DeepSWE ขึ้นจาก 12.8 (V4 Pro Preview) เป็น 54.4 ซึ่งเป็นการกระโดดที่ใหญ่ที่สุดในตาราง
จุดที่ต้องระวังที่สุดของข่าวนี้: ถ้าหยิบเฉพาะ Terminal Bench (ห่าง 2.3 คะแนน) มาเล่า จะได้ภาพว่าโมเดลเปิดตัวนี้ไล่ทัน frontier แล้ว แต่ในตารางเดียวกัน DSBench-Hard ห่าง 12.1 และ NL2Repo ห่าง 15.5 · มันใกล้ frontier เฉพาะงานบางประเภท ไม่ใช่ทั้งกระดาน
⚠ Blognone รายงานว่าโมเดลนี้อยู่ระดับ "Claude Sonnet 5 (max)" ซึ่งเป็น framing ของ Blognone เอง ไม่ใช่ของ DeepSeek · ในตารางของ DeepSeek ไม่มี Claude Sonnet 5 อยู่เลย baseline ฝั่ง Claude มีตัวเดียวคือ Opus 4.8 · ห้ามอ้างต่อว่า DeepSeek หรือ Artificial Analysis เป็นคนพูดประโยคนี้
ฝั่งอันดับอิสระ Simon Willison เขียนถึงโมเดลนี้เมื่อ 31 ก.ค. ว่าอาจเป็น "the best value-per-intelligence model out there" และอ้าง Artificial Analysis ว่ามันอยู่เหนือ MiniMax M3 ซึ่งเป็นโมเดล 428B (Simon Willison) · บน AA Intelligence Index: V4 Flash 0731 = 50 vs MiniMax-M3 = 44
ราคา: ตัวเลขวันนี้ กับตัวเลขที่กำลังจะมา
ราคา API ต่อ 1 ล้าน token ณ 1 ส.ค. 2026 (DeepSeek pricing):
| รายการ | ราคา |
|---|---|
| input · cache miss | $0.14 |
| input · cache hit | $0.0028 |
| output | $0.28 |
หมายเหตุความถูกต้อง: บล็อกของ Simon Willison เขียน output เป็น $0.27 ซึ่งคลาดเคลื่อน ตัวเลขบนหน้าราคาทางการคือ $0.28 และตรงกับที่ Blognone และ Artificial Analysis รายงาน
และนี่คือส่วนที่สำคัญที่สุดของหน้านี้ เชิงอรรถบนหน้าราคาเดียวกันระบุว่า:
"The DeepSeek API service will soon adopt a peak/off-peak pricing policy. During peak hours, prices will be 2x the regular prices, applicable to all billing items. The effective date will be subject to the official announcement."
ชั่วโมงเร่งด่วนที่ระบุคือ 09:00-12:00 และ 14:00-18:00 ตามเวลาปักกิ่ง (UTC+8) ซึ่งคาบเกี่ยวกับเวลาทำงานของไทยเกือบทั้งหมด (ไทยช้ากว่าปักกิ่ง 1 ชั่วโมง)
⚠ สองข้อที่ห้ามพูดผิด:
- ยังไม่มีวันเริ่มบังคับ ต้นฉบับเขียนว่า "subject to the official announcement" · ห้ามพูดว่าเริ่มต้นเดือนสิงหาคม · เชิงอรรถที่พูดถึง "early August 2026" เป็นคนละเชิงอรรถ และพูดถึงการเพิ่มการรองรับโมเดล
deepseek-v4-proบน Responses API ไม่เกี่ยวกับราคา - ต้นฉบับเขียนว่า "all billing items" คือทุกรายการเรียกเก็บ (cache hit / cache miss / output) · ไม่มีประโยคไหนเขียนว่า "all models" ตรงๆ
ทำไมเรื่องนี้สำคัญกับคนทำงานไทยที่ใช้ AI
แกนแรกและใช้ได้ทันทีที่สุด: ราคาที่คุณเห็นตอนเลือกเครื่องมือ ไม่ใช่ราคาที่คุณจะจ่าย · โมเดลนี้ไม่ได้ขึ้นราคาป้าย แต่ประกาศว่าจะเก็บ 2 เท่าในช่วงเวลาที่คนใช้งานมากที่สุด ซึ่งตรงกับเวลาทำงานปกติ · องค์กรที่คำนวณต้นทุนจากราคาป้ายคูณปริมาณ จะได้ตัวเลขที่ต่ำกว่าความจริงถ้างานส่วนใหญ่วิ่งในเวลาทำการ
แกนที่สอง: MIT License เปลี่ยนคำถามจาก "ถูกไหม" เป็น "ถูกจากใคร" · เมื่อ weights อยู่ใต้ MIT ผู้ให้บริการรายอื่นเอาไปเสิร์ฟได้ · แปลว่าราคา peak/off-peak ของ DeepSeek เองไม่ใช่เพดานของโมเดลนี้ และการผูกระบบไว้กับผู้ให้บริการรายเดียวมีทางออกมากกว่ากรณีโมเดลปิด
แกนที่สามและเป็นเรื่องการอ่านตัวเลขให้เป็น: การหยิบ benchmark ที่คะแนนใกล้กันมาเล่า แล้วละเว้นอันที่ห่างกัน คือวิธีที่คำเคลมทั้งวงการถูกสร้างขึ้น · เรื่องนี้ต่อกับหลักการที่คลังรับมาเมื่อ 31 ก.ค. โดยตรง (arXiv 2607.26191 · การเฉลี่ยคะแนนคือการซ่อนจุดที่อ่อนที่สุด) · ที่นี่ไม่ใช่การเฉลี่ย แต่เป็นการเลือกหยิบ ซึ่งเป็นอาการเดียวกัน
แกนที่สี่: ห่วงโซ่การรายงานผิดเกิดขึ้นภายในวันเดียว · ขนาดโมเดลมีตัวเลขผิดสองชุดลอยอยู่ (283B จากสำนักข่าว · 304B จาก metadata อัตโนมัติของแพลตฟอร์ม) และคำเคลมเรื่อง "ระดับ Sonnet 5" ถูกเติมเข้ามาโดยที่ไม่มีในต้นฉบับ · ทั้งสามอย่างนี้ไม่มีใครโกหก แต่มันเกิดจากการอ่านคนละที่แล้วเล่าต่อ
สิ่งที่ยังไม่รู้
- วันเริ่มบังคับของราคา peak/off-peak ยังไม่ประกาศ
- ยังไม่มี independent replication ของ Terminal Bench 2.1 = 82.7 หรือคะแนนอื่นในตาราง
- ขนาดของ DSpark module เอง DeepSeek ไม่ได้ระบุ · การเอา 304 ลบ 284 เป็นการอนุมานจาก metadata ห้ามใช้เป็นตัวเลขอ้างอิง
ตัวเลขราคาและสถานะ peak/off-peak ในหน้านี้เป็นข้อมูล ณ 1 ส.ค. 2026 · ต้อง re-check เมื่อ DeepSeek ประกาศวันเริ่มบังคับ
kimi-k3 · 1m-context-era · gpt-5-6-family · inkling-thinking-machines
Sources (5)
- https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 fetched 2026-08-01
- https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash fetched 2026-08-01
- https://api-docs.deepseek.com/quick_start/pricing fetched 2026-08-01
- https://simonwillison.net/2026/Jul/31/deepseek-v4-flash-0731/ fetched 2026-08-01
- https://www.blognone.com/node/151271 fetched 2026-08-01
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย