Dictionary · พื้นฐาน AI · 9 / 291

Emergent Abilities

ความสามารถของ AI ที่ไม่มีในโมเดลเล็ก แต่โผล่ขึ้นมาแบบก้าวกระโดดเมื่อโมเดลใหญ่ถึงจุดหนึ่ง โดยทำนายล่วงหน้าจากผลงานของโมเดลเล็กไม่ได้

Emergent Abilities (ความสามารถที่ผุดขึ้นเอง) คือความสามารถของโมเดลภาษาขนาดใหญ่ (llm) ที่ "ไม่ปรากฏในโมเดลขนาดเล็ก แต่ปรากฏในโมเดลขนาดใหญ่" ตามนิยามในงานวิจัยปี 2022 ของ Jason Wei และทีม (ตีพิมพ์ในวารสาร TMLR) หัวใจของนิยามนี้อยู่ที่คำว่า "ทำนายล่วงหน้าไม่ได้": ถ้าดูเฉพาะผลงานของ model ขนาดเล็กแล้วลากเส้นต่อ จะคาดว่าโมเดลใหญ่ก็ทำงานนั้นไม่ได้เหมือนกัน แต่ความจริงคือพอขนาดโมเดลผ่านจุดหนึ่ง ความสามารถกลับกระโดดขึ้นมาเหมือนมีคนกดเปิดสวิตช์ ทั้งที่ไม่มีใครสอนงานนั้นให้ตรงๆ

ทีมวิจัย Google ศึกษาปรากฏการณ์นี้โดยพล็อตคะแนนบน benchmark ต่างๆ เทียบกับปริมาณการคำนวณที่ใช้ training (วัดเป็น FLOPs) และแบ่ง emergent abilities ออกเป็นสองกลุ่ม กลุ่มแรกคืองานที่สั่งผ่าน prompt ตรงๆ เช่น เลขคณิตหลายขั้นตอนและข้อสอบระดับมหาวิทยาลัย ที่คะแนนแบนราบระดับ "เดามั่ว" มาตลอด จนถึงราว 10^22 FLOPs แล้วพุ่งขึ้น ส่วนงานตีความความหมายของคำตามบริบทโผล่ขึ้นหลัง 10^24 FLOPs กลุ่มที่สองคือเทคนิคการ prompt ที่เพิ่งได้ผลเมื่อโมเดลใหญ่พอ เช่น chain-of-thought ที่ไม่ช่วยโมเดลเล็กเลย แต่ช่วยให้โมเดลระดับ 10^24 FLOPs ทำโจทย์เลข GSM8K ได้ถึง 57% โมเดลที่ใช้ศึกษาได้แก่ LaMDA, GPT-3, Gopher, Chinchilla และ PaLM

คนทำงานยุค AI ควรรู้จักคำนี้เพราะมันอธิบายว่าทำไมโมเดลรุ่นใหม่จึงทำงานที่รุ่นก่อน "ทำไม่ได้เลย" ได้ทันที ไม่ใช่ค่อยๆ เก่งขึ้นทีละนิด ดังนั้นการสรุปว่า "AI ทำงานนี้ไม่ได้" จากการทดลองกับโมเดลตัวเดียวจึงเสี่ยงพลาดมาก อย่างไรก็ตามเรื่องนี้ยังมีข้อถกเถียง: งานปี 2023 ของ Schaeffer, Miranda และ Koyejo ชื่อ "Are Emergent Abilities of Large Language Models a Mirage?" แย้งว่าการกระโดดที่เห็นอาจเป็นภาพลวงจากวิธีวัดคะแนน กล่าวคือ metric แบบไม่ต่อเนื่อง (ต้องตอบถูกทั้งหมดจึงได้คะแนน) ทำให้กราฟดูกระโดด แต่ถ้าเปลี่ยนไปวัดแบบต่อเนื่อง กราฟเดียวกันจะเรียบและทำนายได้ ประเด็นนี้ยังเป็นคำถามเปิดในวงวิชาการ

ตัวอย่างจากบทสนทนาจริง

ฝ่ายบัญชี: ผมลองให้แชตบอตตัวเล็กที่บริษัทติดตั้งไว้ช่วยคำนวณภาษีแบบหลายขั้นตอน มันตอบมั่วทุกครั้งเลย สรุปได้เลยไหมครับว่า AI ยังทำเลขแบบนี้ไม่ได้

ทีม AI: ยังสรุปแบบนั้นไม่ได้ครับ การคำนวณหลายขั้นตอนเป็นตัวอย่างคลาสสิกของ emergent ability: โมเดลเล็กทำแทบไม่ได้เลยจริง แต่พอโมเดลใหญ่ถึงระดับหนึ่ง ความสามารถนี้จะโผล่ขึ้นมาแบบก้าวกระโดด ลองงานเดิมกับโมเดลที่ใหญ่กว่าก่อน แล้วค่อยตัดสินครับ

ระวังสับสนกับ

  • scaling-laws : scaling laws พูดถึงแนวโน้มที่เรียบและทำนายได้ ว่ายิ่งเพิ่มขนาดโมเดล ข้อมูล และการคำนวณ ค่าความผิดพลาดโดยรวมจะลดลงอย่างสม่ำเสมอ ส่วน emergent abilities คือกรณีของงานเฉพาะทางที่คะแนนไม่ได้ไต่ตามเส้นนั้น แต่กระโดดขึ้นที่จุดหนึ่งโดยไม่มีสัญญาณเตือนล่วงหน้า
  • agi : การที่ความสามารถใหม่โผล่ขึ้นมาเองไม่ได้แปลว่าโมเดล "ตื่นรู้" หรือกำลังจะกลายเป็น AGI · emergent abilities เป็นเรื่องคะแนนบนงานที่วัดผลได้ ไม่ใช่เรื่องจิตสำนึกของเครื่อง

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Deep LearningFew-shot Learning