Knowledge Distillation
เทคนิคถ่ายทอดความรู้จากโมเดล AI ตัวใหญ่ (ครู) ไปยังโมเดลตัวเล็ก (นักเรียน) ให้เก่งใกล้เคียงกันแต่เบากว่าและถูกกว่า จนใช้บนมือถือหรืออุปกรณ์เล็กได้
Knowledge Distillation (เรียกสั้นๆ ว่า distillation หรือ "การกลั่นความรู้") คือเทคนิคใน machine-learning สำหรับถ่ายทอดความรู้จาก model ขนาดใหญ่ไปสู่โมเดลขนาดเล็ก โดยใช้กรอบคิดแบบครูกับนักเรียน: โมเดลครู (teacher) คือ neural-network ตัวใหญ่ที่เก่งอยู่แล้ว ส่วนโมเดลนักเรียน (student) คือโมเดลตัวเล็กที่ผ่านการ training ให้เลียนแบบพฤติกรรมของครู จุดสำคัญคือนักเรียนไม่ได้เรียนจากเฉลยถูกผิดแบบแข็งๆ (hard labels) เพียงอย่างเดียว แต่เรียนจาก soft targets: การกระจายความน่าจะเป็นของคำตอบทั้งหมดที่ครูให้ ซึ่งถูกปรับให้ "นุ่ม" ขึ้นด้วยค่า temperature ในชั้น softmax เพราะการที่ครูตอบว่าตัวเลือกหนึ่งน่าจะใช่มากและอีกตัวเลือกก็พอเป็นไปได้ มีข้อมูลว่าครูมองปัญหาอย่างไรซ่อนอยู่มากกว่าการบอกแค่คำตอบสุดท้าย ตัวนักเรียนจึงเทรนด้วย loss ที่เทียบคำตอบของตัวเองกับ output ของครูที่ temperature สูง แล้วค่อยผสมกับ loss แบบปกติ
แนวคิดนี้มีรากจากงาน model compression ของ Buciluǎ, Caruana และ Niculescu-Mizil ปี 2006 ที่เทรนโมเดลเล็กจากข้อมูลที่ ensemble ของโมเดลใหญ่ช่วยติดป้ายให้ ก่อนที่ Geoffrey Hinton, Oriol Vinyals และ Jeff Dean จะสรุปเป็นเทคนิค distillation อย่างเป็นทางการในเปเปอร์ "Distilling the Knowledge in a Neural Network" (เผยแพร่ปี 2015 จากงาน NIPS 2014 Deep Learning Workshop) โจทย์ของพวกเขาคือ ensemble หลายโมเดลนั้นแม่นก็จริงแต่อุ้ยอ้ายและกินทรัพยากรเกินกว่าจะนำไปใช้งานจริงในวงกว้าง จึงกลั่นความรู้ทั้งหมดลงโมเดลเดียวที่เล็กกว่า และพิสูจน์ผลทั้งบนชุดข้อมูล MNIST และ acoustic model ในระบบเชิงพาณิชย์ (ในประวัติศาสตร์ยังมีงานของ Jürgen Schmidhuber ปี 1991 ที่ทำสิ่งคล้ายกันกับ recurrent network มาก่อนด้วย)
ทำไมคนทำงานยุค AI ต้องรู้จักคำนี้: เพราะโมเดลใหญ่ฉลาดแต่ค่า inference แพงและช้า distillation คือเหตุผลเบื้องหลังที่เราได้โมเดลเล็กซึ่งเก่งใกล้เคียงตัวใหญ่ในต้นทุนที่ต่ำลง จนนำไปรันบนมือถือหรืออุปกรณ์ปลายทางได้ เทคนิคนี้ถูกใช้จริงในหลายสาย ตั้งแต่ object detection, speech recognition, งาน nlp ไปจนถึง graph neural network ดังนั้นเวลาเห็นข่าว llm ตัวเล็กที่เคลมว่า distill มาจากโมเดลเรือธง หรือเห็น vendor เสนอโมเดลรุ่นประหยัด การเข้าใจคำนี้จะช่วยให้ตั้งคำถามได้ตรงจุดว่ามันเรียนมาจากครูตัวไหน และเก่งครอบคลุมแค่ขอบเขตที่ครูถ่ายทอดให้หรือเปล่า
ตัวอย่างจากบทสนทนาจริง
ถาม: เห็นข่าวว่าโมเดลเล็กหลายตัว distill มาจากโมเดลใหญ่ สรุปคือเขาเอาโค้ดของโมเดลใหญ่มาตัดให้สั้นลง หรือลบข้อมูลบางส่วนออกใช่ไหมครับ
ตอบ: ไม่ใช่ครับ Knowledge Distillation คือการเทรนโมเดลเล็กขึ้นมาใหม่อีกตัวหนึ่ง โดยให้มันหัดเลียนแบบคำตอบพร้อมระดับความมั่นใจของโมเดลใหญ่ เหมือนนักเรียนที่นั่งดูวิธีคิดของครูจนซึมซับมาเป็นของตัวเอง ผลลัพธ์เป็นโมเดลคนละตัวกับครูเลย แต่เบากว่า ถูกกว่า และเก่งใกล้เคียงครูในงานที่ถูกฝึกมา
ระวังสับสนกับ
- fine-tuning : คือการเอาโมเดลตัวเดิมมาเทรนต่อด้วยข้อมูลใหม่ให้เก่งงานเฉพาะทาง ส่วน distillation คือการสร้างโมเดลเล็กอีกตัวแล้วเทรนให้เลียนแบบโมเดลใหญ่ · ผลลัพธ์เป็นโมเดลคนละตัวกับต้นแบบ
- quantization : ลดขนาดโมเดลเหมือนกัน แต่ทำโดยลดความละเอียดของตัวเลข parameters ในโมเดลตัวเดิม ไม่มีการเทรนโมเดลใหม่ ส่วน distillation ได้โมเดลใหม่ที่โครงสร้างเล็กกว่าตั้งแต่ต้น
Sources (2)
- https://en.wikipedia.org/wiki/Knowledge_distillation fetched 2026-08-01
- https://arxiv.org/abs/1503.02531 fetched 2026-08-01
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย