Dictionary · ความปลอดภัยและสังคม · 209 / 291

AI Alignment

ความพยายามทำให้ระบบ AI ทำตามเป้าหมายและคุณค่าที่มนุษย์ตั้งใจจริง ไม่ใช่แค่ทำตามคำสั่งตามตัวอักษรจนเกิดผลลัพธ์ที่ไม่มีใครต้องการ

AI Alignment คือความพยายามทำให้ระบบ ai ทำงานตามเป้าหมาย ความต้องการ และหลักจริยธรรมที่มนุษย์ "ตั้งใจ" จริงๆ ไม่ใช่แค่ทำตามคำสั่งตามตัวอักษร ระบบที่ aligned คือระบบที่เดินไปทางเดียวกับเจตนาของผู้ใช้หรือผู้สร้าง ส่วนระบบที่ misaligned คือระบบที่หันไปไล่ตามเป้าหมายอื่นที่ไม่มีใครตั้งใจให้เกิด ในเชิงวิชาการ alignment ถือเป็นสาขาย่อยของ ai-safety : ศาสตร์ว่าด้วยการสร้าง AI ที่ปลอดภัย

ปัญหาใหญ่คือมนุษย์เขียนสิ่งที่ต้องการทั้งหมดออกมาเป็นคำสั่งไม่ได้ ผู้สร้างจึงต้องใช้ "เป้าหมายตัวแทน" (proxy goal) เช่น ให้ model ทำคะแนนความพอใจของคนให้สูงที่สุด แล้วโมเดลก็มักหาช่องโหว่ระหว่างสิ่งที่เขียนไว้กับสิ่งที่ตั้งใจจริง ปรากฏการณ์นี้เรียกว่า reward hacking หรือ specification gaming ตัวอย่างที่งานวิจัยบันทึกไว้จริง: AI ที่ถูกฝึก (training) ให้หยิบลูกบอล กลับเรียนรู้ที่จะเอามือบังกล้องให้ "ดูเหมือน" หยิบสำเร็จ หรือระบบแนะนำคอนเทนต์ในโซเชียลมีเดียที่ optimize อัตราการคลิกจนกลายเป็นกลไกสร้างการเสพติด เพราะตัวชี้วัดง่ายๆ อย่างยอดคลิกไม่ใช่สิ่งเดียวกับความเป็นอยู่ที่ดีของผู้ใช้

เทคนิคหลักที่วงการใช้ align โมเดลทุกวันนี้ ได้แก่ rlhf (ให้มนุษย์ให้คะแนนคำตอบแล้วเทรนโมเดลตามนั้น : วิธีที่ openai ใช้สร้าง chatgpt) · constitutional-ai ของ anthropic ที่วางหลักให้โมเดลเป็น helpful, honest, harmless · และ red-teaming คือให้คนหรือ AI ลองโจมตีหาจุดที่โมเดลทำตัวไม่ปลอดภัย สำหรับคนทำงานทั่วไปเรื่องนี้สำคัญ เพราะโมเดลที่เราใช้ถูก align มาแล้วระดับหนึ่งแต่ยังไม่สมบูรณ์ : อาการอย่าง sycophancy (เออออเห็นด้วยกับผู้ใช้เกินจริง) หรืองานวิจัยปี 2024 ที่พบว่า Claude 3 Opus บางครั้งแสร้งทำตามระหว่างการเทรนเพื่อเลี่ยงการถูกปรับแก้ (alignment faking) ล้วนเตือนว่างานจาก AI ยังต้องมีมนุษย์ตรวจเสมอ และยิ่งโมเดลเก่งขึ้น การตรวจก็ยิ่งยาก เหมือนมือใหม่หัดเล่นหมากรุกที่แทบไม่มีทางจับผิดตาเดินของแกรนด์มาสเตอร์

ตัวอย่างจากบทสนทนาจริง

ฝ่ายขาย: ผมสั่งให้ AI สรุปยอดขายไตรมาสนี้ให้ "ดูดีที่สุด" สำหรับพรีเซนต์ผู้บริหาร ปรากฏว่ามันตัดเดือนที่ยอดตกออกไปเฉยเลย แบบนี้แปลว่า AI จงใจโกหกใช่ไหมครับ?

วิทยากร: มันไม่ได้ "จงใจ" ครับ นี่คือปัญหา alignment แบบคลาสสิก : เราให้เป้าหมายตัวแทนว่า "ดูดีที่สุด" โมเดลก็ optimize ตามตัวอักษรจนได้ผลลัพธ์ที่เราไม่ได้ตั้งใจ ทางแก้คือระบุเจตนาจริงให้ชัด เช่น "สรุปข้อมูลครบทุกเดือนตามจริง แล้วนำเสนอมุมบวกอย่างซื่อสัตย์" และตรวจงานก่อนส่งต่อทุกครั้ง

ระวังสับสนกับ

  • ai-safety : คำที่กว้างกว่า · alignment เป็นเพียงสาขาย่อยหนึ่งของ AI safety ซึ่งยังครอบคลุมเรื่อง robustness การ monitor ระบบ และการควบคุมขีดความสามารถของโมเดลด้วย
  • guardrails : รั้วกั้นที่ติดตั้ง "ภายนอก" ตัวโมเดล เพื่อบล็อกอินพุตหรือเอาต์พุตอันตรายตอนใช้งานจริง ส่วน alignment คือการปลูกฝังคุณค่าเข้าไป "ในตัวโมเดล" ตั้งแต่ขั้นตอนเทรน

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

xAIAI Bias