Dictionary · พื้นฐาน AI · 22 / 291

Reinforcement learning

การเรียนรู้แบบลองผิดลองถูกจากรางวัลที่ได้ ไม่ต้องมีเฉลยล่วงหน้า เป็นรากฐานของการฝึกโมเดลให้ทำงานหลายขั้นและของ RLHF

Reinforcement learning หรือการเรียนรู้แบบเสริมกำลัง คือวิธีที่ระบบเรียนรู้จากการลองทำแล้วดูผล นิยามที่ใช้กันคือระบบที่ทำหน้าที่เป็นตัวแสดงหรือ agent ต้องเลือกลงมือทำในสภาพแวดล้อมที่เปลี่ยนแปลงได้ เพื่อให้ได้สัญญาณรางวัลรวมสูงที่สุด องค์ประกอบหลักมีสี่อย่าง คือตัวแสดงที่เป็นผู้ตัดสินใจ สภาพแวดล้อมที่มันทำงานอยู่ การกระทำที่เลือกได้ และรางวัลที่ได้กลับมาเป็นผลตอบรับ เมื่อทำซ้ำหลายรอบ ระบบจะค่อยๆ เรียนรู้นโยบายที่ดีที่สุด คือกลยุทธ์ในการเลือกการกระทำที่ให้ผลดีที่สุดในระยะยาว

ความต่างจากวิธีเรียนรู้อีกสองแบบอยู่ที่ข้อมูลตั้งต้น supervised learning ต้องมีคู่ของคำถามกับคำตอบที่ถูกต้องให้เรียนตาม unsupervised learning หาโครงสร้างจากข้อมูลที่ไม่มีป้ายกำกับ ส่วน reinforcement learning ไม่มีชุดข้อมูลที่เตรียมไว้ล่วงหน้าเลย ระบบสร้างประสบการณ์ของตัวเองจากการโต้ตอบกับสภาพแวดล้อม แล้วเรียนรู้จากรางวัลหรือบทลงโทษที่ได้ ความท้าทายสำคัญคือการชั่งน้ำหนักระหว่างการลองสิ่งใหม่เพื่อหาข้อมูลเพิ่ม กับการใช้สิ่งที่รู้แล้วให้เกิดประโยชน์สูงสุด

เหตุผลที่คำนี้กลับมาสำคัญในยุคโมเดลภาษามีสองข้อ ข้อแรกคือมันเป็นกลไกเบื้องหลัง rlhf ซึ่งเป็นขั้นตอนที่เปลี่ยนโมเดลภาษาดิบให้กลายเป็นผู้ช่วยที่คุยกับคนรู้เรื่อง ข้อสองคือมันเป็นวิธีหลักที่ใช้ฝึกโมเดลให้ทำงานหลายขั้นแบบ agent ได้ เพราะงานประเภทนี้ไม่มีเฉลยเดียวที่ถูกต้อง มีแต่ผลลัพธ์ปลายทางที่ดีหรือไม่ดี ซึ่งตรงกับรูปแบบของ reinforcement learning พอดี ตัวอย่างการใช้งานนอกวงการโมเดลภาษาที่เห็นภาพชัดคือระบบขับขี่อัตโนมัติ ซึ่งเรียนรู้นโยบายการตัดสินใจจากการโต้ตอบทั้งในสถานการณ์จำลองและในโลกจริง

ตัวอย่างจากบทสนทนาจริง

ผู้จัดการ: "ทีมบอกว่าจะใช้ reinforcement learning ปรับระบบจัดคิวงานในโรงงานครับ ต่างจากที่เราเคยทำยังไง"

นักวิทยาศาสตร์ข้อมูล: "ที่เราเคยทำคือให้ระบบเรียนจากข้อมูลย้อนหลังว่าหัวหน้าเคยจัดคิวแบบไหน ซึ่งเก่งได้แค่เท่าที่คนเคยทำครับ ส่วน reinforcement learning ไม่ต้องมีเฉลย แต่เราต้องนิยามให้ชัดว่าอะไรคือรางวัล เช่น งานเสร็จเร็วขึ้นได้คะแนนบวก เครื่องว่างได้คะแนนลบ แล้วปล่อยให้มันลองในระบบจำลอง จุดที่ต้องระวังที่สุดคือการตั้งรางวัล เพราะถ้าตั้งผิด มันจะหาช่องทำคะแนนโดยไม่ได้แก้ปัญหาจริง เช่น จัดงานง่ายไปก่อนเพื่อให้ตัวเลขสวย ผมขอออกแบบรางวัลร่วมกับหัวหน้าฝ่ายผลิตก่อนครับ"

ระวังสับสนกับ

  • rlhf : RLHF คือการเอา reinforcement learning มาใช้โดยให้รางวัลมาจากความชอบของคนที่แปลงเป็นโมเดลให้คะแนน ส่วน reinforcement learning เป็นวิธีการทั่วไปที่รางวัลมาจากอะไรก็ได้ที่วัดได้ เช่น คะแนนในเกมหรือเวลาที่ประหยัดได้
  • Supervised learning : supervised learning เรียนจากตัวอย่างที่มีเฉลยกำกับ จึงเก่งได้แค่เท่าที่เฉลยสอน ส่วน reinforcement learning ไม่มีเฉลย จึงมีโอกาสค้นพบวิธีที่คนไม่เคยคิด แต่ก็เสี่ยงที่จะหาช่องโกงเกณฑ์รางวัลด้วย
  • agent : agent ในความหมายของเครื่องมือ AI ปัจจุบันคือระบบที่รับเป้าหมายแล้วทำงานหลายขั้น ส่วนคำว่า agent ในทฤษฎี reinforcement learning หมายถึงตัวแสดงที่เรียนรู้จากรางวัล เป็นคำเดียวกันที่มาจากรากเดียวกัน แต่ใช้ในบริบทต่างกัน

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Prompt EngineeringScaling Laws