Reinforcement learning
การเรียนรู้แบบลองผิดลองถูกจากรางวัลที่ได้ ไม่ต้องมีเฉลยล่วงหน้า เป็นรากฐานของการฝึกโมเดลให้ทำงานหลายขั้นและของ RLHF
Reinforcement learning หรือการเรียนรู้แบบเสริมกำลัง คือวิธีที่ระบบเรียนรู้จากการลองทำแล้วดูผล นิยามที่ใช้กันคือระบบที่ทำหน้าที่เป็นตัวแสดงหรือ agent ต้องเลือกลงมือทำในสภาพแวดล้อมที่เปลี่ยนแปลงได้ เพื่อให้ได้สัญญาณรางวัลรวมสูงที่สุด องค์ประกอบหลักมีสี่อย่าง คือตัวแสดงที่เป็นผู้ตัดสินใจ สภาพแวดล้อมที่มันทำงานอยู่ การกระทำที่เลือกได้ และรางวัลที่ได้กลับมาเป็นผลตอบรับ เมื่อทำซ้ำหลายรอบ ระบบจะค่อยๆ เรียนรู้นโยบายที่ดีที่สุด คือกลยุทธ์ในการเลือกการกระทำที่ให้ผลดีที่สุดในระยะยาว
ความต่างจากวิธีเรียนรู้อีกสองแบบอยู่ที่ข้อมูลตั้งต้น supervised learning ต้องมีคู่ของคำถามกับคำตอบที่ถูกต้องให้เรียนตาม unsupervised learning หาโครงสร้างจากข้อมูลที่ไม่มีป้ายกำกับ ส่วน reinforcement learning ไม่มีชุดข้อมูลที่เตรียมไว้ล่วงหน้าเลย ระบบสร้างประสบการณ์ของตัวเองจากการโต้ตอบกับสภาพแวดล้อม แล้วเรียนรู้จากรางวัลหรือบทลงโทษที่ได้ ความท้าทายสำคัญคือการชั่งน้ำหนักระหว่างการลองสิ่งใหม่เพื่อหาข้อมูลเพิ่ม กับการใช้สิ่งที่รู้แล้วให้เกิดประโยชน์สูงสุด
เหตุผลที่คำนี้กลับมาสำคัญในยุคโมเดลภาษามีสองข้อ ข้อแรกคือมันเป็นกลไกเบื้องหลัง rlhf ซึ่งเป็นขั้นตอนที่เปลี่ยนโมเดลภาษาดิบให้กลายเป็นผู้ช่วยที่คุยกับคนรู้เรื่อง ข้อสองคือมันเป็นวิธีหลักที่ใช้ฝึกโมเดลให้ทำงานหลายขั้นแบบ agent ได้ เพราะงานประเภทนี้ไม่มีเฉลยเดียวที่ถูกต้อง มีแต่ผลลัพธ์ปลายทางที่ดีหรือไม่ดี ซึ่งตรงกับรูปแบบของ reinforcement learning พอดี ตัวอย่างการใช้งานนอกวงการโมเดลภาษาที่เห็นภาพชัดคือระบบขับขี่อัตโนมัติ ซึ่งเรียนรู้นโยบายการตัดสินใจจากการโต้ตอบทั้งในสถานการณ์จำลองและในโลกจริง
ตัวอย่างจากบทสนทนาจริง
ผู้จัดการ: "ทีมบอกว่าจะใช้ reinforcement learning ปรับระบบจัดคิวงานในโรงงานครับ ต่างจากที่เราเคยทำยังไง"
นักวิทยาศาสตร์ข้อมูล: "ที่เราเคยทำคือให้ระบบเรียนจากข้อมูลย้อนหลังว่าหัวหน้าเคยจัดคิวแบบไหน ซึ่งเก่งได้แค่เท่าที่คนเคยทำครับ ส่วน reinforcement learning ไม่ต้องมีเฉลย แต่เราต้องนิยามให้ชัดว่าอะไรคือรางวัล เช่น งานเสร็จเร็วขึ้นได้คะแนนบวก เครื่องว่างได้คะแนนลบ แล้วปล่อยให้มันลองในระบบจำลอง จุดที่ต้องระวังที่สุดคือการตั้งรางวัล เพราะถ้าตั้งผิด มันจะหาช่องทำคะแนนโดยไม่ได้แก้ปัญหาจริง เช่น จัดงานง่ายไปก่อนเพื่อให้ตัวเลขสวย ผมขอออกแบบรางวัลร่วมกับหัวหน้าฝ่ายผลิตก่อนครับ"
ระวังสับสนกับ
- rlhf : RLHF คือการเอา reinforcement learning มาใช้โดยให้รางวัลมาจากความชอบของคนที่แปลงเป็นโมเดลให้คะแนน ส่วน reinforcement learning เป็นวิธีการทั่วไปที่รางวัลมาจากอะไรก็ได้ที่วัดได้ เช่น คะแนนในเกมหรือเวลาที่ประหยัดได้
- Supervised learning : supervised learning เรียนจากตัวอย่างที่มีเฉลยกำกับ จึงเก่งได้แค่เท่าที่เฉลยสอน ส่วน reinforcement learning ไม่มีเฉลย จึงมีโอกาสค้นพบวิธีที่คนไม่เคยคิด แต่ก็เสี่ยงที่จะหาช่องโกงเกณฑ์รางวัลด้วย
- agent : agent ในความหมายของเครื่องมือ AI ปัจจุบันคือระบบที่รับเป้าหมายแล้วทำงานหลายขั้น ส่วนคำว่า agent ในทฤษฎี reinforcement learning หมายถึงตัวแสดงที่เรียนรู้จากรางวัล เป็นคำเดียวกันที่มาจากรากเดียวกัน แต่ใช้ในบริบทต่างกัน
Sources (2)
- https://en.wikipedia.org/wiki/Reinforcement_learning fetched 2026-08-06
- https://aws.amazon.com/what-is/reinforcement-learning/ fetched 2026-08-06
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย