Qwen3.8-Max เปิดขายจริงพร้อมตัวเลขชุดแรก และตัวเลขนั้นหักล้างคำเคลมตอนเปิดตัวของ Alibaba เอง
Alibaba เปิด Qwen3.8-Max ให้ใช้งานทั่วไปเมื่อ 3 ส.ค. หลังอยู่ในสถานะ preview มาตั้งแต่ 19 ก.ค. ตัวโมเดลมีพารามิเตอร์รวม 2.4 ล้านล้านตัวแบบ MoE โดยใช้งานจริง 95 พันล้านตัวต่อหนึ่งคำถาม คิดเป็นราว 4% ของพูลทั้งหมด ราคาอยู่ที่ 2 ดอลลาร์ต่อล้านโทเคนขาเข้าและ 6 ดอลลาร์ขาออก ส่วนการอ่านจากแคชอยู่ที่ 0.25 ดอลลาร์ ตอนเปิดตัว preview เดือนที่แล้ว Alibaba พูดถึงสมรรถนะด้วยคำเดียวว่าเป็นรองแค่ Claude Fable 5 โดยไม่มีตัวเลขประกอบ วันนี้ตัวเลขออกมาครบแล้ว
สิ่งที่ตารางบอกคือคำเคลมนั้นไม่ตรง บน SWE-bench Pro ซึ่งวัดงานแก้โค้ดจริง Qwen ได้ 67.7 แพ้ทั้ง Claude Opus 4.8 ที่ 69.2 และ Claude Fable 5 ที่ 80.0 บน FrontierSWE ได้ 73.5 แพ้ Fable 5 ที่ 88.8 อยู่ 15.3 จุด ส่วน GPQA Diamond ที่ได้ 92.6 นั้นเสมอ Fable 5 พอดีและแพ้ GPT-5.6 Sol ที่ 94.1 จุดที่ชนะจริงมีจุดเดียวคือ Terminal-Bench 2.1 ที่ได้ 86.6 เหนือทั้ง Opus 4.8 และ Fable 5 ซึ่งได้ 84.6 เท่ากันพอดี แต่ก็ยังแพ้ GPT-5.6 Sol โหมด max ที่ 88.8
ฝั่งการวัดอิสระซึ่งเป็นคำถามที่คลังตั้งค้างไว้ตั้งแต่เดือนที่แล้ว ตอนนี้มีคำตอบแล้ว บนกระดาน Code Arena หมวด WebDev ของ arena.ai เมื่อ 4 ส.ค. Qwen3.8-Max อยู่อันดับสี่ที่ 1,668 คะแนน ตามหลัง Claude Opus 5 โหมด Max ที่ 1,705 Kimi K3 โหมด Max ที่ 1,676 และ Claude Opus 5 โหมด High ที่ 1,669 คือแพ้อันดับสามอยู่แค่คะแนนเดียว ข้อควรระวังคือคะแนนแบบนี้ขยับจริงและขยับเร็ว เมื่อ 28 ก.ค. กระดานเดียวกันเคยรายงาน Opus 5 โหมด Max ที่ 1,725 และ Kimi K3 ที่ 1,682 ตกลงมาภายในสัปดาห์เดียว ตัวเลขกระดานจึงต้องติดวันที่กำกับเสมอ
เรื่อง weights ยังเป็นคำสัญญาเหมือนเดิม Alibaba ระบุว่าจะปล่อยสัปดาห์หน้าและจะปล่อยรุ่นเล็ก Qwen3.8-27B ด้วย ซึ่งถ้าเกิดขึ้นจริงจะเป็นครั้งแรกที่ Alibaba เปิด weights ของรุ่นระดับ Max แต่ ณ วันนี้ยังโหลดไม่ได้ และยังไม่มีแหล่งไหนระบุ license เลยแม้แต่เจ้าเดียว จึงห้ามเดาว่าเป็น Apache 2.0 ตามรุ่นก่อน
▲ ทำไมต้องรู้ · บทเรียนที่ใช้ได้ทันทีไม่ใช่เรื่องว่าโมเดลตัวไหนเก่งกว่า แต่เป็นเรื่องวิธีอ่านข่าวโมเดล เพราะข่าวนี้มีสื่อสองเจ้ารายงานตัวเลขจากตารางใบเดียวกันแล้วให้ภาพตรงข้ามกัน เจ้าที่เทียบกับ Claude Opus 4.8 ได้ข้อสรุปว่า Qwen ชนะสองในสามรายการ ส่วนเจ้าที่เทียบกับ Claude Fable 5 ได้ข้อสรุปว่าแพ้ขาด และทั้งคู่ไม่มีใครเขียนเลขผิดเลยสักตัว ต่างกันแค่หยิบคนละคอลัมน์ เวลาเห็นพาดหัวว่าโมเดลใหม่ชนะรุ่นท็อป คำถามแรกที่ต้องถามคือชนะเทียบกับตัวไหนและตัวนั้นเป็นรุ่นบนสุดของค่ายนั้นจริงหรือเปล่า สำหรับคนที่ต้องเลือกโมเดลไปใช้งานจริง ราคา 2 ต่อ 6 ดอลลาร์ถือว่าถูกกว่ารุ่นท็อปของฝั่งอเมริกาอยู่มาก และถ้า weights ออกจริงสัปดาห์หน้าก็จะเป็นตัวเลือกที่รันเองในองค์กรได้ แต่ตอนนี้ยังเรียกว่าโมเดลเปิดไม่ได้เพราะยังโหลดไม่ได้จริง
Alibaba Qwen · the-decoder · MarkTechPost · Blognone · Artificial Analysis · qwen-3-8