GLM-5.3 นำจริงบนการหาช่องโหว่ แต่แพ้ขาดตอนต้องเปลี่ยนช่องโหว่ให้เป็นเครื่องมือโจมตี (ต่อเนื่องจาก 2026-08-15)
ตามตัวเลขที่ Z.ai เผยแพร่เอง บนชุดทดสอบ CyberGym ซึ่งวัดการค้นหาและยืนยันช่องโหว่ GLM-5.3 ทำได้ 84.5% นำ Mythos 5 ที่ 83.8% และ GPT-5.6 Sol ที่ 83.6% แต่บนชุด ExploitBench ซึ่งวัดขั้นถัดไปคือการเปลี่ยนช่องโหว่ที่เจอให้กลายเป็นเครื่องมือโจมตีที่ทำงานได้จริง GLM-5.3 ทำได้ 54.4% ซึ่งเป็นตัวเลขเดียวในกลุ่มนี้ที่ปรากฏในเอกสารทางการของบริษัท ส่วนตัวเลขของคู่แข่งบนชุดเดียวกันที่ระบุว่า Mythos 5 ทำได้ราว 78% และตัวเลขบนชุด ExploitGym ที่จับเวลา ซึ่งระบุว่า GLM-5.3 ทำได้ 105 งานในสองชั่วโมง เทียบกับ Mythos 5 ที่ 181 งาน ปรากฏเฉพาะในรายงานของสื่อที่อ่านหน้าประกาศของบริษัท ไม่ปรากฏในเอกสารที่เราเปิดอ่านได้โดยตรง
ตัวเลขที่ผู้ผลิตยกมาเป็นจุดขายอีกตัวต้องอ่านให้ตรงกว่าที่ข่าวส่วนใหญ่เขียน เพราะการอ้างว่าพบช่องโหว่ 2,436 รายการจากโครงการโอเพนซอร์ส 269 โครงการนั้น เป็นผลสะสมของโมเดลหลายตัวของบริษัทนับตั้งแต่รุ่น GLM-5.2 และทำร่วมกับทีมความปลอดภัยภายนอกหลายทีม ไม่ใช่ผลงานที่ GLM-5.3 ทำได้ตัวเดียว ในจำนวนนั้น 1,097 รายการถูกจัดเป็นระดับสูงถึงวิกฤต โดยบัญชีที่แสดงระบุว่าเปิดเผยพร้อมรหัส CVE แล้ว 53 รายการ ส่วนอีก 2,383 รายการยังอยู่ในช่วงปิดข้อมูล
สถานะการใช้งานยังไม่ขยับจากเมื่อวานเลยแม้แต่จุดเดียว เอกสารของ Z.ai ยังเขียนว่า "The GLM-5.3 API is coming soon" ชื่อรุ่นนี้ยังไม่ปรากฏในหน้าราคาซึ่งมีรุ่นอื่นครบทุกตัว และคลังโมเดลของบริษัทเองยังไม่มีน้ำหนักของรุ่นนี้ ช่องทางเดียวที่ใช้ได้จริงคือแพ็กเกจรายเดือนสำหรับงานเขียนโค้ด
ข้อควรระวังคือคะแนนทั้งหมดข้างต้นเป็นการวัดของผู้ผลิตเองบนชุดตั้งค่าของผู้ผลิตเอง ระยะห่างบน CyberGym ที่นำอยู่นั้นไม่ถึงหนึ่งจุด ซึ่งเป็นระยะที่ยังไม่มีผู้วัดอิสระรายใดยืนยัน และเมื่อยังไม่ปล่อยน้ำหนักก็ยังไม่มีใครทำซ้ำได้ อีกจุดที่ต้องระวังเป็นพิเศษคือเปเปอร์ต้นฉบับของ CyberGym รายงานว่าชุดที่ทำได้ดีที่สุดอยู่ที่ราว 20% เท่านั้น การที่ตัวเลขนี้สูงกว่าราวสี่เท่าแปลว่าเป็นการวัดคนละการตั้งค่าหรือคนละส่วนย่อยของชุดทดสอบ จึงเอาไปเทียบกับตัวเลขที่ผู้อื่นรายงานบนชื่อชุดเดียวกันไม่ได้
▲ ทำไมต้องรู้ · เวลาอ่านข่าวว่าโมเดลไหนเก่งเรื่องความมั่นคงไซเบอร์ คำถามที่ต้องถามคือเก่งที่ขั้นไหนของงาน เพราะการหาช่องโหว่เจอกับการทำให้ช่องโหว่นั้นใช้โจมตีได้จริงเป็นคนละความสามารถ และตัวเลขที่ผู้ผลิตหยิบขึ้นมาโชว์มักเป็นขั้นที่ตัวเองนำ หลักเดียวกันใช้ได้กับทุกข่าวที่บอกว่าโมเดลใหม่นำคู่แข่ง คือดูว่าชุดทดสอบนั้นวัดขั้นตอนไหนของงานที่เราจะเอาไปใช้จริง
เอกสาร Z.ai · หน้าราคาของ Z.ai · คลังโมเดลของบริษัท · Unite.AI