Dictionary · ความปลอดภัยและสังคม · 222 / 291

Data poisoning

การจงใจปนข้อมูลร้ายเข้าไปในชุดเทรน เพื่อให้โมเดลที่ได้ทำงานผิดพลาดหรือมีประตูหลังที่เปิดด้วยคำสั่งลับ

Data poisoning คือการจงใจปนข้อมูลที่ออกแบบมาเพื่อสร้างความผิดพลาดเข้าไปในชุดข้อมูลที่ใช้เทรนโมเดล เนื่องจากอัลกอริทึมการเรียนรู้ถูกกำหนดรูปร่างโดยข้อมูลที่มันเห็น การวางยาที่ข้อมูลจึงเท่ากับการเขียนโปรแกรมโมเดลใหม่ด้วยเจตนาร้าย โดยที่ไม่ต้องเข้าถึงโค้ดหรือระบบของเป้าหมายเลย

รูปแบบการโจมตีหลักมีสองแบบ แบบแรกคือ backdoor attack ซึ่งสอนพฤติกรรมอันตรายที่จะทำงานเมื่อเจอสิ่งกระตุ้นเฉพาะ เช่น ลวดลายเล็กๆ ในภาพหรือวลีบางคำในข้อความ โมเดลจะทำงานปกติทุกอย่างจนกว่าจะเจอสิ่งกระตุ้นนั้น ทำให้การทดสอบตามปกติจับไม่ได้ แบบที่สองคือ label flipping ซึ่งแก้ป้ายกำกับในชุดเทรนให้ผิด เพื่อให้โมเดลจำแนกผิดหลังจากถูกเทรนใหม่ เหตุผลที่ข้อมูลจากอินเทอร์เน็ตเปราะบางเป็นพิเศษคือมันเปิดให้ใครก็เขียนได้ ข้อมูลที่ผู้ใช้สร้างขึ้นจึงเสี่ยงสูง โดยเฉพาะกับโมเดลแนะนำเนื้อหาและโมเดลภาษา เพราะบัญชีปลอมที่มีอยู่ดาษดื่นเปิดโอกาสให้วางยาได้มาก แพลตฟอร์มโซเชียลรายงานว่าลบบัญชีปลอมปีละหลายพันล้านบัญชี ซึ่งสะท้อนว่าข้อมูลที่ถูกวางยาไหลเข้าไปในชุดเทรนที่เก็บจากเว็บได้ง่ายเพียงใด

สำหรับองค์กรที่เอาข้อมูลของตัวเองมาเทรนโมเดลเพิ่ม ความเสี่ยงนี้ใกล้ตัวกว่าที่คิด เพราะช่องทางที่ข้อมูลไหลเข้าระบบมักเปิดกว้าง เช่น แบบฟอร์มที่ลูกค้ากรอกเอง บันทึกแชตจากช่องทางบริการ หรือเอกสารที่คู่ค้าส่งเข้ามา หลักปฏิบัติที่ทำได้คือแยกให้ชัดว่าข้อมูลชุดไหนมาจากแหล่งที่ควบคุมได้และชุดไหนมาจากภายนอก กำหนดให้ข้อมูลจากภายนอกต้องผ่านการตรวจก่อนเข้าชุดเทรน และเก็บบันทึกว่าข้อมูลแต่ละชุดมาจากไหนเพื่อให้ย้อนกลับได้เมื่อพบปัญหา ข้อควรระวังคือ data poisoning ต่างจากอาการเสื่อมที่เกิดเองอย่าง model-collapse ตรงที่อันนี้มีคนตั้งใจทำ จึงถูกออกแบบมาให้หลบการตรวจ การทดสอบด้วยชุดข้อสอบปกติจึงมักจับไม่เจอ

ตัวอย่างจากบทสนทนาจริง

ฝ่ายผลิตภัณฑ์: "เราจะเอาข้อความรีวิวจากลูกค้าทั้งหมดมาเทรนโมเดลจัดหมวดหมู่ความคิดเห็นครับ ข้อมูลเยอะและฟรีด้วย"

นักวิทยาศาสตร์ข้อมูล: "ต้องระวังหน่อยครับ รีวิวเป็นข้อมูลที่ใครก็เขียนได้ ซึ่งเป็นช่องทางคลาสสิกของ data poisoning ถ้ามีคนตั้งใจโพสต์รีวิวรูปแบบหนึ่งซ้ำๆ เพื่อให้โมเดลเรียนผิด เราจะไม่รู้เลยจนกว่าจะเอาไปใช้จริง สิ่งที่ผมขอคือกรองบัญชีที่น่าสงสัยออกก่อน สุ่มตรวจด้วยคนสักหนึ่งเปอร์เซ็นต์ และเก็บไว้ด้วยว่าข้อมูลแต่ละก้อนมาจากช่วงเวลาไหน ถ้าวันหนึ่งโมเดลเพี้ยน เราจะย้อนหาได้ว่าเริ่มจากข้อมูลชุดไหนครับ"

ระวังสับสนกับ

  • model-collapse : model collapse คือความเสื่อมที่เกิดเองจากการเทรนวนด้วยผลงานของ AI ไม่มีใครโจมตี ส่วน data poisoning มีผู้โจมตีที่ตั้งใจและออกแบบให้หลบการตรวจ วิธีรับมือจึงต่างกันคนละแบบ
  • prompt-injection : prompt injection เกิดตอนใช้งานและมีผลเฉพาะรอบนั้นหรือจนกว่าจะล้างความจำ ส่วน data poisoning ฝังอยู่ในตัวโมเดลอย่างถาวรหลังเทรนเสร็จ แก้ได้ทางเดียวคือเทรนใหม่ด้วยข้อมูลที่สะอาด
  • ai-supply-chain : AI supply chain เป็นภาพรวมของความเสี่ยงจากทุกสิ่งที่เราหยิบมาใช้ต่อ ทั้งโมเดล ข้อมูล และโค้ด ส่วน data poisoning เป็นวิธีโจมตีหนึ่งวิธีที่เกิดขึ้นในห่วงโซ่นั้น เจาะจงที่ชั้นข้อมูล

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Copyright and AIData Privacy