Dictionary · โมเดลและผู้เล่นหลัก · 201 / 291

SLM (Small language model)

โมเดลภาษาขนาดเล็กที่รันบนเครื่องตัวเองหรือบนมือถือได้ องค์กรนิยมเอามาเทรนเพิ่มด้วยข้อมูลภายในเพื่อไม่ต้องส่งข้อมูลออก

SLM ย่อมาจาก small language model หมายถึงโมเดลภาษาที่มีจำนวน parameters น้อยกว่าโมเดลระดับแนวหน้ามาก ตัวเลขที่ใช้แบ่งไม่มีเส้นตายตัว แหล่งอ้างอิงหนึ่งให้ช่วงกว้างตั้งแต่หนึ่งล้านถึงหนึ่งหมื่นล้านพารามิเตอร์ ส่วนที่พบบ่อยในทางปฏิบัติคือช่วงหนึ่งพันล้านถึงราวสิบสี่พันล้าน คำว่าเล็กในที่นี้จึงเป็นการเทียบกับโมเดลรุ่นใหญ่ ไม่ได้แปลว่าเล็กในเชิงสัมบูรณ์ ข้อได้เปรียบของ SLM คือรันบนเครื่องที่ทรัพยากรจำกัดได้โดยไม่ต้องต่อคลาวด์ ตอบเร็ว ใช้ไฟและค่าประมวลผลน้อยกว่ามาก และทำงานแบบออฟไลน์ได้ซึ่งดีต่อความเป็นส่วนตัว ข้อเสียคือรับมืองานนอกขอบเขตที่เทรนมาได้จำกัด พลาดง่ายกว่าในโจทย์ที่ซับซ้อนหรือกำกวม และมีความสามารถในการให้เหตุผลตามบริบทน้อยกว่า ในทางปฏิบัติองค์กรจึงไม่ได้เลือกอย่างใดอย่างหนึ่ง แต่วาง model-routing ให้งานง่ายอย่างสรุปหรือจัดหมวดวิ่งไปโมเดลเล็ก แล้วเหลือโมเดลใหญ่ไว้เฉพาะงานที่ซับซ้อนจริงๆ

สำหรับองค์กรไทย SLM เป็นทางเลือกยอดนิยมเมื่อไม่อยากส่งข้อมูลออกนอกบริษัท โดยเฉพาะโรงพยาบาล สำนักกฎหมาย และสถาบันการเงิน วิธีที่ใช้กันคือเอาโมเดลเล็กที่เปิดให้ดาวน์โหลด (ดู open-weights) มาเทรนเพิ่มด้วยข้อมูลเฉพาะทางของตัวเอง ซึ่งเรียกว่า domain adaptation หรือ fine-tuning เดือนสิงหาคม 2026 มีงานวิจัยที่ทดสอบสมมติฐานที่คนมักเชื่อกันในเรื่องนี้ ชื่อ "Trustworthiness Costs of Domain Adaptation in Small Language Models" ผู้เขียนไล่ทดสอบโมเดลสามตัวคือ TinyLlama 1B, Gemma-2 2B และ Llama 3.2 1B ข้ามสามสาขาคือการแพทย์ กฎหมาย และการเงิน ด้วยวิธีเทรนสี่แบบและเงื่อนไขข้อมูลสองแบบ รวมเป็น 216 การตั้งค่า ทำซ้ำสามรอบ

ผลที่สำคัญที่สุดคือวิธีที่ออกแบบมาเพื่อรักษาความปลอดภัยของโมเดลระหว่างเทรนเพิ่มทั้งสามแบบ ไม่มีตัวไหนลดความเสี่ยงที่โมเดลจะถูกหลอกให้ทำสิ่งอันตรายได้เลย แบบหนึ่งให้ผลกลางๆ คือขยับน้อยกว่า 0.001 ส่วนอีกสองแบบทำให้แย่ลงจริง คือเพิ่มอัตราการถูกหลอกสำเร็จเฉลี่ย 0.171 และ 0.155 ในโมเดลที่ผู้ผลิตปรับความปลอดภัยมาแล้ว และในบางการตั้งค่าเพิ่มเกิน 0.45 สิ่งที่ต้องรู้ก่อนเริ่มคือความปลอดภัยของโมเดลไม่ได้ติดมากับตัวโมเดลอย่างถาวร มันเปลี่ยนได้ตอนเทรนเพิ่ม และวิธีที่ตั้งใจออกแบบมาเพื่อรักษามันไว้ก็ยังไม่ได้ผลตามที่โฆษณา ข้อปฏิบัติที่ตามมาตรงๆ คือถ้าจะเทรนเพิ่ม ต้องทดสอบความปลอดภัยใหม่หลังเทรนทุกครั้ง ไม่ใช่เชื่อผลที่ผู้ผลิตประกาศไว้ตอนปล่อยโมเดล เพราะโมเดลที่คุณกำลังใช้ไม่ใช่ตัวเดียวกับที่เขาทดสอบแล้ว ข้อควรระวังคืองานนี้เป็น preprint ของผู้เขียนคนเดียวที่ยังไม่ผ่าน peer review ทดสอบเฉพาะโมเดลขนาดหนึ่งถึงสองพันล้านพารามิเตอร์ จึงห้ามเอาไปอธิบายพฤติกรรมของโมเดลใหญ่ และตัวเลขที่แย่ลงรายงานเฉพาะในโมเดลสองตัวที่ผู้ผลิตปรับความปลอดภัยมาแล้ว ไม่ใช่ทั้งสามตัว

ตัวอย่างจากบทสนทนาจริง

ผู้อำนวยการฝ่ายสารสนเทศโรงพยาบาล: "เราจะเอาโมเดลเล็กมาเทรนด้วยเวชระเบียนของเราเองครับ ข้อมูลจะได้ไม่ออกนอกโรงพยาบาล ทีมบอกว่าใช้วิธีที่รักษาความปลอดภัยของโมเดลไว้ด้วยแล้ว น่าจะเรียบร้อยใช่ไหม"

ที่ปรึกษาความปลอดภัย: "ส่วนที่ข้อมูลไม่ออกนอกถูกต้องแล้วครับ แต่ส่วนความปลอดภัยขอให้ทดสอบใหม่เองหลังเทรนเสร็จ มีงานปี 2026 ที่ทดสอบ 216 การตั้งค่าบนสามสาขารวมการแพทย์ด้วย แล้วพบว่าวิธีที่ออกแบบมารักษาความปลอดภัยไม่มีตัวไหนช่วยเลย และสองในสามแบบทำให้แย่ลงจริง หลักที่ต้องยึดคือโมเดลหลังเทรนไม่ใช่ตัวเดียวกับที่ผู้ผลิตทดสอบไว้แล้ว ผมขอให้ตั้งชุดทดสอบของเราเองก่อนขึ้นใช้จริงครับ"

ระวังสับสนกับ

  • llm : LLM คือโมเดลภาษาขนาดใหญ่ซึ่งเป็นคำกว้างที่ครอบทุกขนาด ส่วน SLM ใช้เรียกกลุ่มที่เล็กพอจะรันบนเครื่องตัวเองได้ เส้นแบ่งไม่ตายตัวและขยับตามยุค โมเดลที่ถือว่าใหญ่เมื่อสองปีก่อนวันนี้ถูกเรียกว่า SLM ได้
  • distillation : distillation คือเทคนิคย่อความรู้จากโมเดลใหญ่มาใส่โมเดลเล็ก ซึ่งเป็นวิธีหนึ่งที่ใช้สร้าง SLM ส่วน SLM คือตัวผลลัพธ์ ไม่ใช่ตัววิธี
  • fine-tuning : fine-tuning คือการเทรนโมเดลเพิ่มด้วยข้อมูลเฉพาะทาง ซึ่งใช้ได้กับโมเดลทุกขนาด แต่เป็นสิ่งที่คนทำกับ SLM บ่อยเป็นพิเศษเพราะต้นทุนต่ำพอจะทำเองได้ในองค์กร

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

RunwaySora