โมเดลเปิดขนาด 27 พันล้านพารามิเตอร์ทำคะแนนบนดัชนีของผู้วัดอิสระ ได้เท่ากับโมเดลปิดที่ใหญ่กว่าหลายสิบเท่า (ต่อเนื่องจาก 2026-08-15)
Artificial Analysis เผยแพร่ผลการวัด Qwen3.8 รุ่น 27B บนดัชนีรวมของตัวเองเมื่อวันที่ 17 ส.ค. ได้คะแนน 52 ซึ่งเป็นอันดับหนึ่งในกลุ่มโมเดลเปิดขนาด 4 ถึง 40 พันล้านพารามิเตอร์ทั้งหมด 135 ตัว โดยค่ากลางของกลุ่มนี้อยู่ที่ 9 เท่านั้น
สิ่งที่ทำให้ตัวเลขนี้มีน้ำหนักคือของที่มันไปเทียบติด Simon Willison สรุปไว้ว่า "That's the same score as GPT-5.6 Luna (max), and just one point behind GLM-5.2 (max) and DeepSeek V4 Pro 0813 (max)" และเขาชี้เองว่าตัวเทียบสองตัวนั้นมีขนาด 753 พันล้านและ 1.6 ล้านล้านพารามิเตอร์ตามลำดับ
รายละเอียดที่กระทบค่าใช้จ่ายโดยตรงและมักถูกมองข้ามคือความยาวคำตอบ หน้าผลวัดระบุว่าโมเดลนี้ผลิตโทเคนออกมา 160 ล้านโทเคนตลอดการทดสอบ เทียบกับค่ากลางของกลุ่มที่ 43 ล้านโทเคน คือพูดยาวกว่าเกือบสี่เท่า ซึ่งไปกันได้กับที่ผู้ทดลองใช้รายงานเมื่อวานว่าค่าเริ่มต้นของระดับการคิดถูกตั้งไว้สูงสุด
ข้อควรระวังคือดัชนีนี้เป็นคะแนนรวมจากชุดทดสอบหลายชุดของผู้วัดรายเดียว ไม่ใช่ค่าเฉลี่ยของอุตสาหกรรม และหน้าผลวัดไม่ได้ระบุวันที่ทำการวัด ระบุเพียงว่าโมเดลเปิดตัวเมื่อ 14 ส.ค.
▲ ทำไมต้องรู้ · ทีมที่อยากรันโมเดลบนเครื่องตัวเองเพื่อไม่ให้ข้อมูลออกนอกองค์กร มักติดที่คำถามว่าของที่รันไหวจะเก่งพอไหม ตัวเลขชุดนี้เป็นหลักฐานจากผู้วัดนอกค่ายชิ้นแรกที่บอกว่าช่องว่างแคบลงมากแล้ว แต่ตัวเลขความยาวคำตอบก็เตือนว่าโมเดลที่คะแนนเท่ากันอาจกินเวลาและค่าประมวลผลต่างกันหลายเท่า ให้วัดสองอย่างนี้คู่กันเสมอ