GLM-5.3 (Z.ai): โมเดลที่เก่งขึ้นโดยไม่ฝึกฐานใหม่ และบทเรียนว่าทำไมต้องอ่านเอกสารผู้ผลิตแทนข่าว
GLM-5.3: เก่งขึ้นโดยไม่ฝึกฐานใหม่ และเคสที่เอกสารผู้ผลิตหักล้างข่าวสี่เจ้า
เกิดอะไรขึ้น
Z.ai ประกาศ GLM-5.3 เมื่อวันที่ 14 ส.ค. 2026 โดยวางตำแหน่งเป็นโมเดลสำหรับงานเขียนโค้ดและงานที่ต้องทำต่อเนื่องยาว จุดที่ทำให้การออกรุ่นครั้งนี้ต่างจากปกติคือบริษัทไม่ได้ฝึกโมเดลฐานใหม่เลย เอกสารของบริษัทเขียนไว้เองว่า "GLM-5.3 uses the same base model as GLM-5.2, all improvements come from post-training" (docs.z.ai)
ประโยคนี้สำคัญเพราะมันเป็นคำพูดของผู้ผลิตเอง ไม่ใช่การตีความของนักข่าว ที่ผ่านมาเวลาโมเดลเก่งขึ้นคนมักสันนิษฐานว่ามาจากการฝึกใหม่ด้วยข้อมูลมากขึ้นและเครื่องแรงขึ้น กรณีนี้บอกว่าการปรับในช่วงหลังการฝึกอย่างเดียวก็ขยับคะแนนบางด้านได้มาก
ข้อควรระวังที่ต้องพูดคู่กันเสมอคือเมื่อน้ำหนักโมเดลยังไม่ถูกปล่อย ไม่มีใครนอก Z.ai ตรวจสอบได้ว่าฐานไม่ถูกแตะจริงหรือไม่ สิ่งที่ยืนยันได้คือบริษัทอ้างเช่นนั้น ไม่ใช่ว่ามันเป็นความจริงที่พิสูจน์แล้ว
ตัวเลขที่ผู้ผลิตรายงาน และกับดักเลขรุ่นของชุดทดสอบ
| ชุดทดสอบ | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 |
| DeepSWE v1.1 | 46.2 | 66.9 |
| CyberGym | 77.2% | 84.5% |
| ExploitBench | 24.4% | 54.4% |
เอกสารของ Z.ai ยืนยันฝั่ง GLM-5.3 ครบทั้งสี่ตัว และยืนยันคู่ 24.4 ถึง 54.4 ของ ExploitBench ทั้งสองปลาย ส่วนค่าตั้งต้นอีกสามตัวคือ 4.6, 46.2 และ 77.2 อ่านได้จากสื่อสี่เจ้าที่รายงานตรงกันโดยไม่มีความคลาดเคลื่อน แต่ยังไม่พบบนหน้าของผู้ผลิตโดยตรง
กับดักที่ต้องกันไว้ก่อนคนอื่นคือเลข 4.6 ที่ดูต่ำจนน่าสงสัยว่าพิมพ์ผิด มันไม่ใช่การพิมพ์ผิด แต่ต้องอ่านคู่กับเลขรุ่นของชุดทดสอบเสมอ เพราะคลังโค้ดทางการของบริษัทรายงานว่า GLM-5.2 ทำได้ 81.0 บน Terminal-Bench รุ่น 2.1 (GitHub) ซึ่งเป็นคนละชุดกับรุ่น 3.0 และง่ายกว่ามาก ใครที่จำเลข 81.0 ได้แล้วมาเจอเลข 4.6 ลอยๆ จะสรุปทันทีว่าตัวเลขนี้ผิด ทั้งที่ทั้งคู่ถูกทั้งคู่ เพียงแต่วัดคนละชุด
ข้อควรระวังที่ครอบทั้งตารางคือทุกตัวเลขเป็นการวัดของผู้ผลิตเอง และเมื่อน้ำหนักยังไม่ปล่อยก็ยังไม่มีใครทำซ้ำได้ เวลาอ้างต้องเขียนว่า Z.ai รายงานว่าเท่าไร ไม่ใช่เขียนว่าโมเดลทำได้เท่าไร
เรื่องที่ข่าวเขียนผิดตรงกันสี่เจ้า คือมันยังเรียกผ่าน API ไม่ได้
นี่คือจุดที่มีค่าที่สุดของหน้านี้สำหรับคนที่จะเอาไปใช้จริง สื่อสี่เจ้ารายงานตรงกันว่า GLM-5.3 เปิดให้เรียกผ่าน API แล้ว แต่เอกสารของผู้ผลิตเองบอกตรงข้าม และหลักฐานมีสามชั้นที่สอดคล้องกัน
ชั้นแรกคือหน้าเอกสารของรุ่นนี้เขียนว่า "The GLM-5.3 API is coming soon" ขณะที่บอกในย่อหน้าเดียวกันว่าเปิดให้ผู้ใช้แพ็กเกจรายเดือนสำหรับงานเขียนโค้ดใช้ได้แล้ว ชั้นที่สองคือหน้าอ้างอิง API ที่ระบุรายชื่อชื่อโมเดลที่เรียกได้จริง ไล่ตั้งแต่ glm-5.2, glm-5.1, glm-5-turbo, glm-5, glm-4.7 ลงไป โดยไม่มี glm-5.3 อยู่ในรายการ (api-reference) ชั้นที่สามคือหน้าราคาที่แสดง GLM-5.2 ไว้ที่ 1.4 และ 4.4 ดอลลาร์ต่อล้านโทเคน แต่ไม่มี GLM-5.3 อยู่เลย (pricing)
สิ่งที่ใช้ได้จริงตอนนี้จึงมีสองช่องทางคือแพ็กเกจรายเดือนสำหรับงานเขียนโค้ด และเครื่องมือของบริษัทเอง ส่วนน้ำหนักโมเดลยังไม่ปล่อย ซึ่งยืนยันได้จากหน้าคลังโมเดลทางการที่มี GLM-5, GLM-5.2, GLM-5.2-FP8 และ GLM-5.1 อยู่ครบแต่ไม่มี GLM-5.3 (Hugging Face) บริษัทระบุว่าจะปล่อยราวสองสัปดาห์หลังเปิดตัวเมื่อผ่านการประเมินความปลอดภัยแล้ว โดยคำนี้ปรากฏในรายงานของสื่อในรูปคำพูดของบริษัท แต่ยังหาประโยคต้นฉบับบนหน้าของผู้ผลิตไม่พบ จึงควรเขียนว่าบริษัทระบุ ไม่ใช่ยกเป็นคำพูดในเครื่องหมายคำพูด
ต้นตอของความสับสนนี้อธิบายได้ตรงไปตรงมา หน้าประกาศของ Z.ai ที่ z.ai/blog/glm-5.3 คืนค่า 200 พร้อมเนื้อหาว่างเปล่าเพราะประกอบด้วย JavaScript ทั้งหมด และ z.ai/blog คืน 404 สื่อจึงเขียนจากข้อมูลที่ได้มาทางอื่นแล้วเติมกรอบการเปิดตัวตามที่คุ้นเคยเข้าไป ทางที่อ่านได้จริงคือ docs.z.ai ซึ่งไม่ค่อยมีใครไปดู
ขนาดโมเดลที่ตัวเลขไม่ตรงกันสามค่า
ตัวเลขจำนวนพารามิเตอร์ของตระกูลนี้มีสามค่าลอยอยู่ และควรระวังไม่หยิบค่าใดค่าหนึ่งมาเขียนเป็นข้อเท็จจริงที่นิ่งแล้ว คลังโค้ดทางการของบริษัทเขียนว่า 744B-A40B คือรวม 744,000 ล้านและทำงานจริง 40,000 ล้านต่อโทเคน ส่วนหน้าโมเดล GLM-5.2 บน Hugging Face แสดง 753,000 ล้านซึ่งเป็นการนับจากไฟล์น้ำหนักโดยตรง ขณะที่สื่อหลายเจ้าเขียน 743,000 ล้านโดยอ้างว่ามาจากประกาศของ Z.ai
ค่าที่นับจากไฟล์มักสูงกว่าตัวเลขพาดหัวของผู้ผลิตเล็กน้อยตามธรรมชาติ 744 กับ 753 จึงอยู่ร่วมกันได้ ส่วน 743 กับ 744 เป็นความคลาดเคลื่อนของการคัดลอกต่อกันมา วิธีเขียนที่ปลอดภัยคือใช้ตัวเลขจากคลังโค้ดของบริษัทและระบุว่าเป็นค่าโดยประมาณ หรือไม่ต้องใส่ตัวเลขเลยก็ได้ เพราะประเด็นของข่าวนี้อยู่ที่การไม่ฝึกฐานใหม่ ไม่ใช่ขนาดที่แน่นอน
ความสามารถด้านความมั่นคงไซเบอร์ คำเคลมกับเสียงแย้ง
Z.ai วางกรอบเรื่องนี้ว่าความสามารถด้านการหาช่องโหว่โผล่ขึ้นมาเกินคาดระหว่างขยายการฝึก โดยระบุว่าโมเดลเริ่มให้เหตุผลข้ามหลายขั้นตอนของการเจาะระบบและวางแผนเป็นลำดับต่อเนื่อง แทนที่จะหาบั๊กทีละจุดแยกกัน และเติบโตเร็วกว่าที่บริษัทคาดไว้ รายงานของสื่อระบุว่าบริษัทเติมข้อมูลด้านการค้นหาช่องโหว่เข้าไปในการปรับหลังฝึกโดยคาดว่าจะได้ผลดีขึ้นเล็กน้อย แต่กลับได้มากกว่านั้น
เสียงแย้งในกระทู้ Hacker News เป็นแหล่งปฐมภูมิและควรอ่านคู่กันเสมอ ผู้ใช้รายหนึ่งชี้ว่าบริษัทไล่สแกนซอฟต์แวร์โอเพนซอร์สและซอฟต์แวร์ยอดนิยมเป็นจำนวนมากอยู่แล้วและเปิดเผยช่องโหว่ที่พบ อีกรายเสริมว่า "Most of these are issues introduced a long time ago, almost all before 2006" (Hacker News) ข้อโต้แย้งคือสิ่งที่เกิดขึ้นอาจเป็นการสแกนที่ครอบคลุมกว่าเดิม ไม่ใช่ความสามารถใหม่ที่ยากขึ้น
หน้านี้ไม่ตัดสินว่าฝ่ายไหนถูก สิ่งที่บันทึกไว้คือทั้งคำเคลมของผู้ผลิตและข้อโต้แย้งมีอยู่จริงทั้งคู่ และคำว่าความสามารถโผล่ขึ้นเองเป็นถ้อยคำที่ต้องติดป้ายว่าใครพูด เพราะยังไม่มีการวัดจากภายนอกมายืนยัน
เรื่องที่คนเข้าใจผิดบ่อย
ข่าวภาษาไทยของ Blognone รายงานว่า "ผลการทดสอบ CyberGym ทำคะแนนค้นพบช่องโหว่ได้มากกว่าสองเท่าเมื่อเทียบกับ GLM-5.2" และเขียนว่าโมเดลทำคะแนนดีกว่ารุ่นก่อน 50% (Blognone) เมื่อดูตารางจะเห็นว่า CyberGym ขยับจาก 77.2% เป็น 84.5% ซึ่งไม่ใช่การเพิ่มเป็นสองเท่า
แต่การสรุปว่าสื่อเขียนผิดนั้นไม่เป็นธรรม เพราะการเพิ่มเป็นสองเท่ามีอยู่จริงและอยู่ที่ ExploitBench ซึ่งขยับจาก 24.4% เป็น 54.4% คือราว 2.2 เท่า สิ่งที่เกิดขึ้นคือประโยคของ Z.ai เองพูดสองเรื่องติดกันในประโยคเดียว คือทำคะแนนสูงสุดบน CyberGym สำหรับการค้นหาช่องโหว่ และเพิ่มขึ้นกว่าสองเท่าบนชุดทดสอบด้านการเจาะระบบ พอย่อลงเหลือประโยคเดียวสองเรื่องจึงถูกรวมเข้าหากัน
บทเรียนที่หยิบไปใช้ได้คือเวลาผู้ผลิตเขียนความสำเร็จสองอย่างไว้ในประโยคเดียว การย่อมักทำให้ตัวเลขไปเกาะกับชุดทดสอบผิดตัว วิธีกันคือเมื่อเห็นคำว่าเพิ่มเป็นสองเท่า ให้ถามกลับว่าเป็นสองเท่าของอะไร แล้วไล่กลับไปหาตารางเสมอ
ราคา
ยังไม่มีการประกาศราคาต่อโทเคนสำหรับ GLM-5.3 เลย หน้าราคาของบริษัทแสดงตั้งแต่ GLM-5.2 ลงไปถึง GLM-4-32B โดยไม่มีรุ่นนี้ และชื่อรุ่นนี้ยังไม่เป็นชื่อที่เรียกผ่าน API ได้
ตัวเลขที่ต้องระวังเป็นพิเศษคือมีสื่อเจ้าหนึ่งเผยแพร่ราคา 1.40 และ 4.40 ดอลลาร์ต่อล้านโทเคนพร้อมราคาแคช 0.26 ดอลลาร์สำหรับ GLM-5.3 ซึ่งเป็นตัวเลขเดียวกันเป๊ะกับราคาที่ประกาศไว้ของ GLM-5.2 บนหน้าราคาทางการ แทบแน่นอนว่าเป็นการยกราคารุ่นก่อนมาใส่ ไม่ใช่ราคาที่มีแหล่งที่มา ห้ามนำตัวเลขชุดนี้มาใช้
ส่วนราคาแบบสมัครสมาชิกรายเดือนมีอยู่จริงแต่ตัวเลขที่รายงานขัดกันเองระหว่างสองแหล่ง จึงยังไม่ควรอ้างเป็นตัวเลขใดตัวเลขหนึ่ง
Sources (9)
- https://docs.z.ai/guides/llm/glm-5.3 fetched 2026-08-15
- https://docs.z.ai/guides/overview/pricing fetched 2026-08-15
- https://docs.z.ai/api-reference/llm/chat-completion fetched 2026-08-15
- https://github.com/zai-org/GLM-5 fetched 2026-08-15
- https://huggingface.co/zai-org fetched 2026-08-15
- https://huggingface.co/zai-org/GLM-5.2 fetched 2026-08-15
- https://news.ycombinator.com/item?id=49294997 fetched 2026-08-15
- https://www.blognone.com/node/151370 fetched 2026-08-15
- https://www.marktechpost.com/2026/08/14/z-ai-ships-glm-5-3-without-retraining-the-base-model-better-at-complex-coding-and-long-horizon-tasks/ fetched 2026-08-15
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย