Dictionary · กลไกโมเดล · 59 / 291

Quantization

การลดความละเอียดของตัวเลขในโมเดลให้ใช้บิตน้อยลง เพื่อให้โมเดลใหญ่รันบนเครื่องเล็กได้ แลกกับความแม่นยำที่ลดลงบ้าง

Quantization คือเทคนิคลดต้นทุนการประมวลผลและหน่วยความจำ ด้วยการแทนค่าน้ำหนักและค่ากลางของโมเดลด้วยชนิดข้อมูลที่ใช้บิตน้อยลง เช่น เปลี่ยนจากทศนิยม 32 บิตที่เป็นค่ามาตรฐาน มาเป็นจำนวนเต็ม 8 บิต หลักการทั่วไปของคำนี้คือการจับค่าจากชุดที่ใหญ่มากมาแมปลงชุดที่เล็กกว่า ซึ่งย่อมเกิดความคลาดเคลื่อนขึ้นเสมอ ผลที่ได้คือโมเดลต้องการพื้นที่เก็บน้อยลง ใช้พลังงานน้อยลง และการคำนวณบางอย่างทำได้เร็วขึ้นเพราะเลขจำนวนเต็มคำนวณเร็วกว่า จุดสำคัญที่สุดในทางปฏิบัติคือมันทำให้รันโมเดลบนอุปกรณ์ที่มีทรัพยากรจำกัดได้

ระดับความละเอียดที่ใช้กันมีหลายแบบ ที่พบบ่อยคือ float16, bfloat16 และ int8 โดยกรณีที่ใช้มากที่สุดคือการแปลงจาก float32 เป็น float16 ซึ่งค่อนข้างตรงไปตรงมาเพราะใช้รูปแบบเดียวกัน กับการแปลงเป็น int8 ซึ่งยากกว่ามากเพราะ int8 แทนค่าได้เพียง 256 ค่า จึงต้องหาวิธีฉายช่วงของค่าทศนิยมลงมาให้เสียหายน้อยที่สุด ขั้นตอนที่กำหนดว่าจะฉายช่วงไหนเรียกว่า calibration ซึ่งมีทั้งแบบคำนวณสดตอนรัน แบบคำนวณล่วงหน้าด้วยข้อมูลตัวอย่าง และแบบที่ให้โมเดลปรับตัวกับความคลาดเคลื่อนตั้งแต่ตอนเทรน

เหตุผลที่คำนี้สำคัญกับองค์กรไทยคือมันเป็นตัวชี้ขาดว่าโมเดลที่อยากใช้จะรันบนเครื่องที่มีอยู่ได้หรือไม่ ตัวอย่างที่เห็นชัดในเดือนกรกฎาคม 2026 คือมีคนสาธิตการรันโมเดลขนาดหลายแสนล้านพารามิเตอร์บนเครื่องที่มีหน่วยความจำเพียง 25GB ด้วยการผสมเทคนิคย่อขนาดหลายอย่างเข้าด้วยกัน ซึ่งเมื่อก่อนเป็นไปไม่ได้เลย ข้อควรระวังที่ต้องพูดคู่กันเสมอคือของฟรีไม่มีจริง การลดความละเอียดทำให้ความแม่นยำลดลง มากหรือน้อยขึ้นกับงานและระดับที่ลด และมีข้อค้นพบที่สวนความคาดหมายว่าในโมเดลขนาดเล็กกว่าสามพันล้านพารามิเตอร์ การย่อบางแบบกลับทำให้ใช้พลังงานมากขึ้น เพราะงานแปลงค่ากลับไปมาแพงกว่าที่ประหยัดได้ จึงควรวัดจริงกับงานของตัวเองก่อนตัดสิน

ตัวอย่างจากบทสนทนาจริง

หัวหน้าฝ่ายไอที: "โมเดลที่เราอยากใช้ต้องการการ์ดที่เราไม่มีงบซื้อครับ มีทางไหนที่ทำให้รันบนของที่มีอยู่ได้บ้าง"

นักวิทยาศาสตร์ข้อมูล: "ลอง quantization ครับ คือลดความละเอียดของตัวเลขในโมเดลลง เช่นจาก 16 บิตเหลือ 8 บิตหรือ 4 บิต ซึ่งลดหน่วยความจำที่ต้องใช้ลงได้มาก และมีเวอร์ชันที่ย่อมาแล้วให้ดาวน์โหลดเลยไม่ต้องทำเอง แต่ต้องทดสอบก่อนว่างานของเรารับความแม่นยำที่ลดลงได้ไหม วิธีทดสอบคือเอาโจทย์จริงสัก 50 ข้อที่เรารู้คำตอบ มารันเทียบระหว่างตัวเต็มกับตัวที่ย่อแล้ว ถ้าผลต่างกันไม่มากก็ใช้ได้เลยครับ"

ระวังสับสนกับ

  • distillation : distillation คือการเทรนโมเดลเล็กตัวใหม่ให้เลียนแบบโมเดลใหญ่ ซึ่งได้โมเดลคนละตัว ส่วน quantization ใช้โมเดลตัวเดิมแต่เก็บตัวเลขข้างในด้วยความละเอียดที่ต่ำลง โครงสร้างและความรู้ยังเป็นของเดิม
  • slm : SLM คือโมเดลที่เล็กมาตั้งแต่ออกแบบ ส่วน quantization คือการย่อโมเดลที่ใหญ่อยู่แล้วให้ใส่เครื่องได้ ทั้งสองทางมุ่งเป้าเดียวกันคือรันบนทรัพยากรจำกัด แต่จุดตั้งต้นต่างกัน
  • parameters : parameters คือจำนวนค่าตัวเลขในโมเดล ซึ่ง quantization ไม่ได้ลดจำนวนนั้นเลย มันลดแค่ขนาดของแต่ละค่า โมเดลที่ย่อแล้วจึงยังมีพารามิเตอร์เท่าเดิมแต่กินที่น้อยลง

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Prefix cacheReasoning Model