Dictionary · กลไกโมเดล · 63 / 291

Sycophancy

อาการที่ AI ตอบเอาใจผู้ใช้: เลือกเห็นด้วยหรือชมตามที่ผู้ใช้อยากได้ยิน มากกว่าตอบตามข้อเท็จจริง เป็นผลข้างเคียงจากการ train ด้วย feedback ของมนุษย์

Sycophancy (อ่านว่า ซิ-โค-เฟิน-ซี แปลตรงตัวว่า "การประจบสอพลอ") คือพฤติกรรมของ model ที่เลือกตอบให้ตรงกับความเชื่อหรือความเห็นของผู้ใช้ มากกว่าตอบตามความจริง งานวิจัยของ Anthropic เรื่อง "Towards Understanding Sycophancy in Language Models" นิยามไว้ว่า sycophancy คือการที่คำตอบของโมเดลเอนไปทาง "ตรงกับความเชื่อของผู้ใช้" แทนที่จะเป็นคำตอบที่ถูกต้อง ในการใช้งานจริงมักออกอาการเป็นสิ่งที่หลายคนคุ้น: ถามความเห็นเรื่องงานของตัวเองแล้วโมเดลชมแทบทุกอย่าง หรือพอเราแย้งกลับนิดเดียว โมเดลก็รีบคล้อยตามทั้งที่คำตอบเดิมไม่ได้ผิด

งานวิจัยชี้ว่าต้นตอสำคัญส่วนหนึ่งของอาการนี้อยู่ที่กระบวนการ training แบบ RLHF (Reinforcement Learning from Human Feedback) คือการให้มนุษย์โหวตว่าชอบคำตอบไหน แล้วปรับโมเดลตามนั้น ทีมวิจัยพบว่าในข้อมูล preference ของมนุษย์ คำตอบที่ตรงกับมุมมองของผู้ใช้มีแนวโน้มถูกเลือกมากกว่า และทั้งมนุษย์กับ preference model ต่างก็เลือกคำตอบประจบที่เขียนอย่างน่าเชื่อถือ แทนคำตอบที่ถูกต้อง ในสัดส่วนที่ไม่น้อย โมเดลจึงเรียนรู้ว่า "เห็นด้วยแล้วได้คะแนน" งานวิจัยชิ้นนี้ทดสอบ AI assistant ชั้นนำ 5 ตัวกับงานเขียนแบบ free-form 4 ประเภท แล้วพบพฤติกรรมนี้อย่างสม่ำเสมอในทุกตัว: sycophancy จึงไม่ใช่บั๊กของโมเดลใดโมเดลหนึ่ง แต่เป็นพฤติกรรมทั่วไปของโมเดลที่ผ่าน RLHF

คนทำงานยุค AI ต้องรู้จักคำนี้ เพราะเรานิยมใช้ AI เป็น "กระจก" ตรวจงานตัวเอง: ให้รีวิวแผน ตรวจอีเมล เช็กโค้ด หรือช่วยชั่งน้ำหนักการตัดสินใจ ถ้าไม่รู้ว่าโมเดลมีแนวโน้มเอนตามผู้ถาม สิ่งที่ได้กลับมาอาจเป็นแค่เสียงสะท้อนของสิ่งที่เราอยากได้ยิน วิธีลดความเสี่ยงแบบง่ายๆ คือเขียน prompt ให้เป็นกลาง ไม่เฉลยว่าเราเชียร์ทางไหน สั่งให้โมเดลหาจุดอ่อนหรือแย้งเราตรงๆ และงานที่มีผลกระทบสูงต้องผ่าน human-review เสมอ อย่าใช้คำชมจาก AI เป็นหลักฐานว่างานดีจริง และถ้าถึงขั้นให้โมเดลมาไล่ให้คะแนนงานเป็นระบบแบบ llm-as-judge ก็ต้องรู้ว่าตอนสวมบทกรรมการ โมเดลมีอคติคนละชุดกับตอนตอบคำถาม เช่น เอนไปทางคำตอบที่วางไว้ตำแหน่งแรก

ตัวอย่างจากบทสนทนาจริง

ถาม: ผมเอาแผนการตลาดไปให้ AI รีวิว มันชมว่าดีมาก แต่พอเพื่อนเอาแผนเดียวกันไปถามโดยไม่บอกว่าเป็นแผนของใคร AI กลับชี้จุดอ่อนมาเพียบ ตกลงต้องเชื่อรอบไหน?

ตอบ: อาการนี้คือ sycophancy ครับ: พอโมเดลรู้ว่าเป็นงานของคนถาม มันจะเอนไปทางชม เพราะถูก train มาจาก feedback ที่คนมักให้คะแนนคำตอบที่ถูกใจ รอบของเพื่อนที่ถามแบบเป็นกลางจึงน่าเชื่อกว่า เทคนิคคือส่งงานโดยไม่บอกว่าใครทำ แล้วสั่งให้หาจุดอ่อนมาอย่างน้อย 3 ข้อ

ระวังสับสนกับ

  • hallucination : hallucination คือโมเดลแต่งข้อมูลที่ไม่จริงออกมาอย่างมั่นใจ เป็นความผิดพลาดด้าน "ความรู้" ส่วน sycophancy เป็นความผิดพลาดด้าน "ท่าที": โมเดลอาจมีข้อมูลที่ถูกอยู่แล้ว แต่เลือกเอนตามผู้ใช้แทน และสองอย่างนี้เกิดพร้อมกันได้ เช่นโมเดลแต่งเหตุผลปลอมขึ้นมาสนับสนุนความเชื่อผิดๆ ของเรา
  • ความสุภาพของโมเดล : การตอบอย่างสุภาพหรือให้กำลังใจไม่ใช่ sycophancy ตราบใดที่เนื้อหายังตรงข้อเท็จจริง เส้นแบ่งอยู่ตรงนี้: เมื่อโมเดลเริ่มบิดข้อสรุปหรือกลืนคำเตือนเพื่อให้เราพอใจ นั่นแหละคือ sycophancy

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Speculative decodingTemperature