Dictionary · ความปลอดภัยและสังคม · 232 / 291

Memory injection

การแอบวางข้อมูลพิษไว้ในหน่วยความจำระยะยาวของ agent เพื่อให้มันดึงขึ้นมาใช้ในภายหลังแล้วเบี่ยงออกจากเจตนาเดิมของผู้ใช้

Memory injection หรือที่บางแห่งเรียกว่า memory poisoning คือการโจมตี agent ที่มีหน่วยความจำระยะยาว โดยผู้โจมตีแอบวางข้อมูลที่เป็นพิษเอาไว้ล่วงหน้าในสิ่งที่ agent จะจำ พอถึงรอบงานถัดไป agent ดึงความจำก้อนนั้นขึ้นมาใช้ พฤติกรรมของมันก็เบี่ยงออกจากเจตนาเดิมของผู้ใช้จนงานล้มเหลว เปเปอร์ที่เสนอวิธีป้องกันเรื่องนี้อธิบายกลไกไว้ว่า "Memory-augmented LLM-based agents are vulnerable to memory injection attacks: Agents may retrieve poisoned memory from attackers, which diverts their behavior from initial user intent and finally causes task failure."

สิ่งที่ทำให้การโจมตีแบบนี้ต่างจาก prompt-injection แบบปกติคือเรื่องความคงทน prompt injection ธรรมดาเกิดขึ้นและจบลงภายใน session เดียว แต่ memory injection อยู่ข้ามรอบการทำงาน ข้ามการรีสตาร์ท และอาจอยู่ข้ามการติดตั้งใหม่ด้วยถ้าไม่ได้ล้างคลังความจำ จุดที่เปราะบางคือช่องทางที่ agent ใช้จำ ทั้งประวัติการสนทนา คลัง embedding ที่ใช้ค้นข้อมูล และบันทึกย่อที่มันเขียนทิ้งไว้เอง ล้วนรับข้อมูลเข้ามาได้โดยไม่มีการยืนยันตัวตนหรือตรวจความถูกต้องเป็นค่าเริ่มต้น งานสำรวจภูมิทัศน์ความปลอดภัยของระบบหลาย agent ที่ประเมินกรอบมาตรฐาน 16 ชุดพบว่าหมวดที่ถูกครอบคลุมน้อยที่สุดคือความไม่แน่นอนของพฤติกรรมและการรั่วไหลของข้อมูล ซึ่งเป็นสองด้านที่หน่วยความจำร่วมเข้าไปเกี่ยวข้องโดยตรง

เดือนสิงหาคม 2026 มีงานฝั่งวิธีแก้ออกมาเป็นครั้งแรกหลังจากที่ผ่านมามีแต่งานชี้ช่องโหว่ เปเปอร์เสนอวิธีชื่อ MIND ซึ่งทำงานโดยดูความสัมพันธ์ระหว่างเจตนาที่ผู้ใช้ตั้งไว้ตอนแรกกับพฤติกรรมที่ agent กำลังทำอยู่ แล้วให้ตัวตรวจขนาดเบาชี้ว่าความจำก้อนไหนน่าจะเป็นพิษ โดยไม่ต้องเรียกโมเดลใหญ่มาตรวจซ้ำ ผลที่รายงานคือ "on ReAct-StrategyQA, MIND reduces mean ASR-r and ASR-a by 55.4% and 55.3%, respectively, while matching the undefended agent in average accuracy and latency." คือลดอัตราการโจมตีสำเร็จลงราวครึ่งหนึ่งโดยความแม่นและความเร็วไม่เปลี่ยน หลักการที่เอาไปใช้ได้กว้างกว่าตัวงานคือกลไกที่ได้ผลในที่นี้เป็นการเทียบว่าสิ่งที่กำลังทำยังตรงกับสิ่งที่ถูกสั่งตอนแรกหรือเปล่า ซึ่งเป็นหลักเดียวกับการควบคุมงานคน สำหรับทีมที่กำลังจะเปิดให้ agent จำข้อมูลข้ามครั้ง ประโยคที่ควรจำไว้คือทุกอย่างที่ agent จำได้ คือทุกอย่างที่คนอื่นเขียนใส่หัวมันได้ ข้อควรระวังคือตัวเลขเป็นของที่เปเปอร์รายงานเอง ยังไม่มีการทดลองซ้ำจากทีมอื่น และยังไม่มีรายงานว่ามีใครนำไปใช้ในระบบจริง

ตัวอย่างจากบทสนทนาจริง

หัวหน้าทีมผลิตภัณฑ์: "เราอยากให้ผู้ช่วย AI ของเราจำสิ่งที่ลูกค้าเคยบอกไว้ข้ามครั้งได้ครับ จะได้ไม่ต้องถามซ้ำ มีอะไรต้องระวังเป็นพิเศษไหม"

ฝ่ายความปลอดภัย: "มีครับ พอเปิดให้จำข้ามครั้ง เราเปิดช่องใหม่ที่เรียกว่า memory injection ด้วย คือถ้ามีคนพิมพ์ข้อความที่ออกแบบมาเป็นพิเศษเข้าไปแล้วระบบจำไว้ รอบหน้าที่มันดึงความจำก้อนนั้นมาใช้ พฤติกรรมอาจเปลี่ยนไปเลยโดยที่ไม่มีใครสั่ง ต่างจาก prompt injection ธรรมดาตรงที่อันนั้นจบใน session เดียว แต่อันนี้อยู่ยาว สิ่งที่ผมขอคือแยกให้ชัดว่าอะไรคือความจำที่ระบบเขียนเอง อะไรคือข้อความดิบจากผู้ใช้ และมีวิธีล้างความจำรายบัญชีได้เวลาเจอปัญหาครับ"

ระวังสับสนกับ

  • prompt-injection : prompt injection คือการฝังคำสั่งในข้อมูลที่โมเดลอ่านในรอบนั้น ผลจบเมื่อรอบนั้นจบ ส่วน memory injection ฝังไว้ในสิ่งที่ระบบจำ จึงมีผลข้ามรอบและอาจไม่มีใครสังเกตจนกว่าจะถูกดึงขึ้นมาใช้
  • ai-worm : AI worm คือ prompt injection ที่ทำสำเนาตัวเองลงในผลลัพธ์แล้วแพร่ต่อไปยังคนอื่น ส่วน memory injection ไม่ได้แพร่ออกไปหาคนอื่น แต่ฝังตัวอยู่ในระบบเดิมและรอเวลาถูกเรียกใช้
  • memory-system : memory system คือกลไกที่ทำให้ AI จำข้อมูลข้ามการสนทนาได้ ซึ่งเป็นความสามารถที่เราต้องการ ส่วน memory injection คือความเสี่ยงที่มาพร้อมกับความสามารถนั้น พูดอีกแบบคือยิ่งระบบจำได้เยอะ พื้นที่ที่ถูกโจมตีก็ยิ่งกว้าง

ดูคำนี้ใน Knowledge Atlas →

Sources (2)

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

JailbreakMisinformation