Dictionary · ความปลอดภัยและสังคม · 231 / 291

Jailbreak

การหลอกหรือกดดันให้ AI ข้ามกติกาความปลอดภัยที่ผู้สร้างตั้งไว้ จนยอมตอบหรือทำสิ่งที่ปกติจะปฏิเสธ เช่น สร้างเนื้อหาอันตรายหรือหลุดจากบทบาทที่กำหนด

Jailbreak ในโลก ai คือความพยายาม "แหกคุก" ให้ llm อย่าง chatgpt หรือ Claude ยอมข้ามกติกาความปลอดภัย (guardrails) ที่ผู้พัฒนาฝึกและตั้งค่าไว้ จนโมเดลยอมตอบคำถามหรือทำสิ่งที่ปกติจะปฏิเสธ เช่น สร้างเนื้อหาอันตราย เนื้อหาผิดนโยบาย หรือหลุดจากบทบาทที่ระบบกำหนดไว้ ตามกรอบของ OWASP การ jailbreak ไม่ใช่แค่เบี่ยงพฤติกรรมโมเดลเล็กน้อย แต่คือกรณีที่ผู้โจมตีทำให้โมเดล "ทิ้ง safety protocol ทั้งหมด"

เทคนิคที่พบบ่อยตามเอกสารของ Microsoft ได้แก่ การสั่งให้โมเดลลืมหรือเพิกเฉยต่อกติกาเดิมใน system-prompt · การให้สวมบทบาท (role-play) เป็นตัวละครใหม่ที่อ้างว่า "ไม่มีข้อจำกัด" · การแนบบทสนทนาปลอมเพื่อหลอกว่าโมเดลเคยตกลงจะตอบไว้แล้ว · และการใช้การเข้ารหัสข้อความ (encoding) เพื่อเลี่ยงตัวกรอง งานวิจัยของ anthropic ยังพบเทคนิคชื่อ many-shot jailbreaking: ยัดบทสนทนาปลอมที่ผู้ช่วย AI ยอมตอบคำถามอันตรายจำนวนมาก (ทดสอบถึง 256 ชุด) ลงใน prompt เดียว โดยอาศัย context-window ที่ขยายจากราว 4,000 token ในต้นปี 2023 เป็นระดับเกินหนึ่งล้าน token ผลคือยิ่งใส่ตัวอย่างมาก อัตราการหลุดยิ่งสูงขึ้นตาม power law และโมเดลขนาดใหญ่กลับเสี่ยงกว่าเพราะเก่งเรื่องการเรียนรู้จากบริบทในตัว prompt เอง

คนทำงานยุค AI ควรรู้จักคำนี้ทั้งสองมุม มุมองค์กร: ถ้าบริษัทเปิด chatbot ให้ลูกค้าหรือพนักงานใช้ ต้องยอมรับว่า guardrails ถูกเจาะได้เสมอ จึงควรมีชั้นป้องกันเพิ่ม เช่น การกรอง input และ output การจำกัดสิทธิ์ของระบบ และการทดสอบเชิงโจมตีก่อนปล่อยใช้จริง ซึ่งงานวิจัยของ Anthropic พบว่าการคัดกรอง prompt ก่อนส่งเข้าโมเดลช่วยลดอัตราสำเร็จของการโจมตีแบบหนึ่งจาก 61% เหลือ 2% ได้ มุมผู้ใช้: สูตร jailbreak ที่แชร์ต่อกันมาไม่ใช่ทางลัด เพราะการใช้กับระบบขององค์กรมักผิดนโยบายการใช้งาน และคำตอบจากโมเดลที่ถูกปลดกติกาแล้วยิ่งเชื่อถือไม่ได้

ตัวอย่างจากบทสนทนาจริง

ฝ่ายการตลาด: "เห็นในกลุ่ม LINE แชร์ prompt ยาวมาก บอกว่าถ้าวางแล้วสั่งให้ AI สวมบทเป็นผู้ช่วยไร้ขีดจำกัด มันจะยอมตอบทุกอย่างเลย แบบนี้คือการปลดล็อกฟีเจอร์ลับใช่ไหม เอามาใช้กับ chatbot ของบริษัทได้หรือเปล่า"

ทีม AI: "นั่นไม่ใช่ฟีเจอร์ลับครับ นั่นคือ jailbreak: การหลอกให้โมเดลข้าม guardrails ที่ผู้พัฒนาตั้งไว้ ใช้กับระบบของบริษัทถือว่าผิดนโยบาย แล้วคำตอบที่ได้จากโมเดลที่หลุดกติกาแล้วก็เชื่อถือไม่ได้ด้วย ถ้าอยากให้มันทำอะไรได้มากขึ้น แจ้งทีมมาดีกว่า เราปรับ system prompt ให้ตรงงานได้แบบถูกทาง"

ระวังสับสนกับ

  • prompt-injection : คำนี้กว้างกว่า หมายถึง input ใดๆ ที่เปลี่ยนพฤติกรรมโมเดลไปจากที่ผู้พัฒนาตั้งใจ รวมถึงคำสั่งที่คนอื่นแอบฝังไว้ในเอกสารหรือหน้าเว็บที่ AI ไปอ่าน (indirect injection) ส่วน jailbreak ตามนิยามของ OWASP คือ subset ของ prompt injection ที่มุ่งให้โมเดลทิ้งกติกาความปลอดภัยทั้งหมด
  • red-teaming : ใช้เทคนิคเจาะแบบเดียวกับ jailbreak แต่ทำโดยทีมทดสอบที่ได้รับอนุญาต เพื่อหาช่องโหว่แล้วอุดก่อนถูกโจมตีจริง เจตนาคือป้องกัน ไม่ใช่ฝ่าฝืน

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

GuardrailsMemory injection