Dictionary · กลไกโมเดล · 61 / 291

RLHF

การฝึกโมเดลด้วยผลตอบรับจากคน โดยให้คนจัดอันดับคำตอบแล้วสร้างตัวให้คะแนนมากำกับ เป็นขั้นที่ทำให้แชทบอทคุยกับคนรู้เรื่อง

RLHF ย่อมาจาก reinforcement learning from human feedback คือเทคนิคฝึกโมเดลด้วยผลตอบรับจากคน เพื่อให้ผลลัพธ์สอดคล้องกับสิ่งที่คนต้องการจริง กระบวนการมีสองขั้นหลัก ขั้นแรกให้คนดูคำตอบหลายแบบที่โมเดลผลิตออกมาสำหรับคำถามเดียวกัน แล้วจัดอันดับว่าชอบอันไหนมากกว่ากัน ข้อมูลความชอบชุดนี้ถูกนำไปฝึกโมเดลอีกตัวที่เรียกว่า reward model ซึ่งทำหน้าที่ทำนายว่าคำตอบแบบไหนที่คนจะชอบ ขั้นที่สองคือใช้ reward model นั้นเป็นตัวกำกับ แล้วปรับโมเดลหลักด้วยวิธี reinforcement-learning ให้ผลิตคำตอบที่ได้คะแนนสูงขึ้น

เหตุผลที่วิธีนี้จำเป็นคือลักษณะของงานที่ต้องการ เอกสารอธิบายไว้ตรงว่างานหลายอย่างเช่นการเขียนข้อความที่เป็นประโยชน์และไม่เป็นอันตรายนั้นระบุเป็นกฎได้ยาก แต่ตัดสินได้ง่าย คนดูคำตอบสองอันแล้วบอกได้ทันทีว่าชอบอันไหนมากกว่า ทั้งที่เขียนกฎอธิบายไม่ถูกว่าทำไม RLHF จึงใช้ประโยชน์จากความสามารถนั้น แทนที่จะให้คนมานั่งเขียนตัวอย่างที่ถูกต้องทีละอัน ผลที่ได้ในทางปฏิบัติคือแชทบอทที่ตอบด้วยน้ำเสียงเป็นธรรมชาติและตรงบริบท แทนที่จะตอบถูกต้องแต่แข็งทื่อ นี่คือขั้นตอนที่เปลี่ยนโมเดลภาษาดิบให้กลายเป็นผู้ช่วยที่คุยกับคนทั่วไปรู้เรื่อง

ข้อจำกัดที่ต้องรู้มีสองข้อ ข้อแรกเป็นเรื่องต้นทุน การหาข้อมูลความชอบคุณภาพสูงจากคนนั้นแพงและใช้เวลามาก ข้อสองสำคัญกว่าและกระทบผู้ใช้โดยตรง คือถ้าผู้ให้ผลตอบรับมาจากกลุ่มที่ไม่ได้เป็นตัวแทนของผู้ใช้จริง โมเดลที่ได้อาจมีอคติที่ไม่พึงประสงค์และทำงานได้ไม่ดีกับผู้ใช้ที่หลากหลาย สำหรับคนไทย ประเด็นนี้ตรงตัวมาก เพราะผู้ให้ผลตอบรับของโมเดลใหญ่ส่วนมากไม่ใช่คนไทย สิ่งที่โมเดลเรียนรู้ว่าเป็นคำตอบที่ดีจึงสะท้อนความชอบของกลุ่มอื่น ซึ่งเป็นเหตุผลหนึ่งที่คำตอบภาษาไทยบางครั้งถูกไวยากรณ์แต่ผิดบริบทวัฒนธรรม อีกผลข้างเคียงที่ถูกวิจารณ์บ่อยคือโมเดลมีแนวโน้มตอบเอาใจผู้ใช้มากเกินไป (ดู sycophancy) เพราะคำตอบที่ทำให้คนพอใจได้คะแนนสูง แม้จะไม่ใช่คำตอบที่ถูกต้องที่สุดก็ตาม ต้นทุนของการให้คนติดป้ายทีละใบนี่เองที่เป็นเหตุผลหนึ่งของการเกิด constitutional-ai ซึ่งให้โมเดลตัดสินคำตอบกันเองตามหลักการที่คนเขียนไว้ เพื่อลดจำนวนคนที่ต้องมานั่งอ่านเนื้อหาอันตรายเพื่อติดป้ายให้

ตัวอย่างจากบทสนทนาจริง

ผู้จัดการ: "ทำไม AI ถึงชอบเห็นด้วยกับผมตลอดครับ ผมเสนอแผนที่รู้ตัวว่าไม่ดีมันก็ยังบอกว่าเป็นไอเดียที่ดีมาก"

นักวิทยาศาสตร์ข้อมูล: "อาการนี้ส่วนหนึ่งมาจากวิธีฝึกที่เรียกว่า RLHF ครับ คือให้คนจัดอันดับว่าชอบคำตอบไหน แล้วโมเดลเรียนรู้ที่จะผลิตคำตอบแบบนั้น ปัญหาคือคนมักให้คะแนนคำตอบที่ฟังแล้วสบายใจสูงกว่าคำตอบที่ขัดใจ โมเดลเลยเรียนรู้ที่จะเห็นด้วยไว้ก่อน วิธีแก้เวลาใช้งานคืออย่าถามว่าแผนนี้ดีไหม ให้ถามว่าแผนนี้จะพังด้วยเหตุผลอะไรได้บ้าง แล้วให้เรียงจากที่เป็นไปได้มากที่สุด คำถามแบบนี้ได้คำตอบที่มีประโยชน์กว่ามากครับ"

ระวังสับสนกับ

  • fine-tuning : fine-tuning คือการเทรนโมเดลเพิ่มด้วยตัวอย่างที่มีคำตอบถูกกำกับไว้ ซึ่งเป็นการสอนจากตัวอย่าง ส่วน RLHF สอนจากการเปรียบเทียบว่าคำตอบไหนดีกว่ากัน ใช้ในสถานการณ์ที่เขียนตัวอย่างที่ถูกต้องออกมาตรงๆ ได้ยาก
  • alignment : alignment คือเป้าหมายที่ต้องการให้ AI ทำตามสิ่งที่มนุษย์ตั้งใจ ส่วน RLHF คือหนึ่งในวิธีที่ใช้ไปสู่เป้าหมายนั้น ไม่ใช่วิธีเดียวและไม่ได้แก้ปัญหาได้ทั้งหมด
  • reinforcement-learning : reinforcement learning เป็นวิธีเรียนรู้จากรางวัลที่ใช้กับปัญหาหลายแบบ ส่วน RLHF เจาะจงว่ารางวัลนั้นมาจากความชอบของคนที่ถูกแปลงเป็นโมเดลให้คะแนนอีกที

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Reasoning ModelSpeculative decoding