Dictionary · พื้นฐาน AI · 31 / 291

Zero-shot Learning

ความสามารถของโมเดล AI ในการทำงานหรือจำแนกสิ่งที่ไม่เคยถูกสอนมาก่อนเลย โดยอาศัยความรู้เดิมกับคำอธิบายงาน ไม่ต้องมีตัวอย่างให้ดูแม้แต่ชิ้นเดียว

Zero-shot Learning (ZSL) คือความสามารถของ model ในสาย machine-learning ที่จำแนกหรือทำงานกับสิ่งที่ "ไม่เคยเห็นมาก่อนเลย" ตอน training ได้ถูกต้อง ตัวอย่างคลาสสิกคือเรื่องม้าลาย: คนที่ไม่เคยเห็นม้าลาย แต่รู้จักม้าและถูกบอกว่า "ม้าลายคือม้าที่มีลายทาง" พอเจอตัวจริงก็ชี้ถูกทันที โมเดลก็ทำแบบเดียวกัน คือไม่ได้เดาจากตัวอย่างของสิ่งนั้นตรงๆ (เพราะไม่มีให้เลย) แต่อาศัย "ข้อมูลช่วย" (auxiliary information) เช่น คำอธิบายคุณสมบัติของหมวดหมู่ ข้อความบรรยาย หรือ embedding ที่เชื่อมโยงสิ่งใหม่เข้ากับความรู้เดิมที่โมเดลมีอยู่แล้ว

แนวคิดนี้เกิดก่อนยุค ChatGPT นานพอสมควร: งานวิจัยแรกๆ ปรากฏราวปี 2008 ในวงการ NLP (ตอนนั้นเรียกว่า dataless classification) ส่วนคำว่า zero-shot learning ถูกตั้งขึ้นในเปเปอร์ปี 2009 โดยทีมของ Palatucci, Hinton, Pomerleau และ Mitchell ซึ่งต่อยอดจากแนวคิด one-shot learning ที่มีมาก่อนหน้า ในทางเทคนิคถือเป็นกรณีสุดขั้วของการปรับตัวข้ามโดเมน เพราะโมเดลต้อง generalize ไปยังหมวดหมู่ที่ไม่มีตัวอย่างสอนแม้แต่ชิ้นเดียว และถูกใช้ในงานหลากหลายตั้งแต่การจำแนกรูปภาพ object detection ไปจนถึง computational biology

เหตุผลที่คนทำงานยุค AI ต้องรู้จักคำนี้: llm อย่าง gpt-3 พิสูจน์ว่าโมเดลภาษาขนาดใหญ่ทำงานแบบ zero-shot ได้ผ่านข้อความล้วนๆ คือสั่งงานใน prompt โดยไม่ต้องปรับ parameters ของโมเดลหรือทำ fine-tuning ใดๆ และงานวิจัยชิ้นเดียวกันชี้ว่ายิ่งขยายขนาดโมเดล ความสามารถทำงานแบบไม่ต้อง fine-tuning ยิ่งดีขึ้น นี่คือสิ่งที่เกิดขึ้นทุกครั้งที่คุณพิมพ์สั่ง chatgpt หรือ Claude ให้สรุปรายงาน จัดหมวดอีเมล หรือร่างประกาศภายใน แล้วมันทำได้เลยทั้งที่ไม่เคยถูกสอนงานของบริษัทคุณโดยตรง: นั่นแหละคือ zero-shot ในชีวิตประจำวัน

ตัวอย่างจากบทสนทนาจริง

ฝ่ายบุคคล: อยากให้ AI ช่วยคัดกรองใบสมัครงานว่าตรงเกณฑ์ไหม แต่ฝ่ายไอทีบอกต้องรวบรวมใบสมัครเก่าเป็นพันใบไปเทรนโมเดลก่อน โปรเจกต์เลยค้างมาสามเดือนแล้ว

วิทยากร: ไม่ต้องรอขนาดนั้นครับ งานแบบนี้เริ่มแบบ zero-shot ได้เลย: เขียน prompt อธิบายเกณฑ์ที่ต้องการให้ชัด แล้วให้ LLM อ่านใบสมัครทีละใบโดยไม่ต้องมีตัวอย่างสอนสักใบ เพราะโมเดลเรียนรู้ภาษาและบริบทมามหาศาลแล้วตอน training ถ้าผลยังไม่ตรงใจค่อยแนบตัวอย่างดีๆ 2-3 ใบให้ดูแนวเป็น few-shot-learning ส่วนใหญ่แค่นี้ก็เพียงพอโดยไม่ต้องเทรนอะไรใหม่เลย

ระวังสับสนกับ

  • few-shot-learning : ต่างกันที่จำนวนตัวอย่างใน prompt · zero-shot คือไม่ให้ตัวอย่างเลย สั่งด้วยคำอธิบายล้วนๆ ส่วน few-shot คือแถมตัวอย่างไม่กี่ชิ้นให้โมเดลดูแนวก่อนลงมือทำ
  • fine-tuning : fine-tuning คือการเอา dataset ใหม่ไปปรับ parameters ของตัวโมเดลจริงๆ ซึ่งมีต้นทุนและใช้เวลา ส่วน zero-shot ไม่แตะตัวโมเดลเลย ทุกอย่างจบที่การเขียนคำสั่งใน prompt

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Unsupervised learningAI