Catastrophic forgetting
อาการที่โมเดลลืมความสามารถเดิมเมื่อถูกฝึกงานใหม่ต่อ เป็นเหตุผลที่การ fine-tune ด้วยข้อมูลบริษัทอาจทำให้งานทั่วไปที่เคยทำได้ดีแย่ลงโดยไม่มีใครสังเกต
Catastrophic forgetting คืออาการที่โมเดลลืมสิ่งที่เคยทำได้ดี หลังจากถูกฝึกต่อด้วยงานใหม่ คำนี้เก่ากว่ายุคของโมเดลภาษาขนาดใหญ่มาก ต้นทางคือบทความปี 1989 ของ Michael McCloskey และ Neal J. Cohen ชื่อ Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem ตีพิมพ์ในชุด Psychology of Learning and Motivation เล่ม 24 หน้า 109 ถึง 165 บทคัดย่อของงานชิ้นนั้นสรุปไว้ว่าการเรียนรู้ใหม่อาจรบกวนการเรียนรู้เก่าอย่างรุนแรงเมื่อ network ถูกฝึกแบบเรียงลำดับทีละงาน และการวิเคราะห์สาเหตุชี้ว่าจะเกิดการรบกวนอย่างน้อยบางส่วนขึ้นทุกครั้งที่การเรียนรู้ใหม่ไปเปลี่ยนค่า weight ที่ใช้แทนความรู้เก่า โดยประโยคเดียวกันนี้กำกับต่อไว้ด้วยว่าผลจากการจำลองแสดงได้เพียงว่าการรบกวนรุนแรงถึงขั้น catastrophic ใน network บางแบบเท่านั้น (McCloskey & Cohen 1989, Johns Hopkins) พูดแบบคนทำงานคือความรู้ของโมเดลไม่ได้แยกเก็บเป็นลิ้นชักคนละใบ แต่ปนกันอยู่ในตัวเลข parameters ชุดเดียว การขยับตัวเลขเพื่อให้เก่งเรื่องใหม่จึงมีโอกาสไปลบร่องรอยของเรื่องเก่าติดไปด้วย
งานยุคหลังพยายามทั้งวัดและแก้อาการนี้ เปเปอร์ชื่อ Overcoming catastrophic forgetting in neural networks ของ James Kirkpatrick และคณะ ส่งขึ้น arXiv เมื่อ 2 ธันวาคม 2016 และแก้ไขครั้งล่าสุด 25 มกราคม 2017 เสนอวิธีชะลอการเรียนรู้เฉพาะบน weight ที่สำคัญกับงานเก่า แล้วทดสอบกับงานจำแนกตัวเลขเขียนมือชุด MNIST ที่ป้อนเรียงกันเป็นงานๆ และกับการเรียนเล่นเกม Atari 2600 หลายเกมต่อกัน (arXiv 1612.00796) ฝั่งของโมเดลภาษาสมัยนี้มีรายงานของ Yun Luo และคณะ ที่ทดลอง fine-tuning ต่อเนื่องกับ BLOOMZ ขนาด 1.1b ถึง 7.1b, mT0, LLAMA 7b และ ALPACA 7b โดยบทคัดย่อสรุปว่าพบ catastrophic forgetting โดยทั่วไปในโมเดลช่วง 1b ถึง 7b parameters และความรุนแรงของการลืมเพิ่มขึ้นเมื่อขนาดโมเดลใหญ่ขึ้นในช่วงดังกล่าว ซึ่งผู้เขียนเสนอว่าอาจเป็นเพราะโมเดลใหญ่เริ่มต้นจากคะแนนที่สูงกว่ามาก รายงานเดียวกันยังระบุว่าการทำ instruction tuning แบบทั่วไปช่วยบรรเทาอาการลืมในการปรับรอบถัดไปได้ งานชิ้นนี้ขึ้น arXiv ครั้งแรก 17 สิงหาคม 2023 แก้ไขล่าสุด 5 มกราคม 2025 และต่อมาได้ตีพิมพ์ในวารสาร IEEE Transactions on Audio, Speech and Language Processing เล่ม 33 หน้า 3776 ถึง 3786 ปี 2025 (arXiv 2308.08747 · DOI 10.1109/TASLPRO.2025.3606231)
คนทำงานมักเจอคำนี้ตอนทีมคิดจะเอาข้อมูลของบริษัทไปปรับโมเดลให้ตอบตามสไตล์ของเรา แล้วผลออกมาว่าโมเดลเก่งเรื่องที่สอนจริง แต่งานอื่นที่เคยทำได้กลับแย่ลงพร้อมกัน เอกสาร Microsoft Foundry fine-tuning considerations หัวข้อ Challenges and limitations of fine-tuning เตือนว่าการปรับโมเดลต้องใช้ข้อมูลที่มีคุณภาพ มีปริมาณมากพอ และเป็นตัวแทนของ domain กับ task ปลายทางจริง ถ้าข้อมูลคุณภาพต่ำหรือไม่เป็นตัวแทน จะนำไปสู่ over-fitting, under-fitting หรือ bias ในโมเดลที่ปรับแล้ว ซึ่งบั่นทอนทั้งความสามารถในการ generalize และความทนทานของมัน หน้าเดียวกันยังเตือนว่าอาจต้องปรับซ้ำทุกครั้งที่ข้อมูลอัปเดตหรือเมื่อมี base model รุ่นใหม่ออกมา (Microsoft Learn) ด้าน openai เขียนไว้ในคู่มือ supervised fine-tuning ว่าให้ตั้ง evals ให้ได้ก่อนค่อยลงทุนปรับโมเดล เพราะต้องมีวิธีที่เชื่อถือได้ในการตัดสินว่ารุ่นที่ปรับแล้วทำงานดีกว่ารุ่นฐานจริงหรือไม่ (OpenAI docs) ความเสียหายยังไม่ได้จำกัดอยู่แค่เรื่องความแม่นยำ เปเปอร์ของ Xiangyu Qi และคณะ ที่ขึ้น arXiv เมื่อ 5 ตุลาคม 2023 และตีพิมพ์ในงานประชุมวิชาการ ICLR 2024 รายงานว่าการปรับโมเดลด้วย dataset ที่ไม่มีเจตนาร้ายและใช้กันอยู่ทั่วไป ก็ทำให้ safety alignment ของโมเดลเสื่อมลงโดยไม่ตั้งใจได้เช่นกัน แม้จะเสื่อมในระดับที่น้อยกว่ากรณีที่มีคนจงใจป้อนตัวอย่างไม่ดี (arXiv 2310.03693) ทางลดความเสี่ยงที่นิยมใช้คือแตะ weight เดิมให้น้อยที่สุด เช่น lora ซึ่งเอกสาร PEFT ของ hugging-face อธิบายว่า weight ตั้งต้นที่ผ่านการ pretrain มาแล้วจะถูก freeze ไว้ไม่ปรับเพิ่ม แล้วเรียนรู้ผ่าน matrix ขนาดเล็กที่แยกออกมาต่างหาก ทำให้มี adapter หลายตัวสำหรับหลายงานวางซ้อนบน base เดียวกันได้ (Hugging Face PEFT) อีกอย่างที่ควรทำคู่กันคือเก็บคำถามที่โมเดลรุ่นปัจจุบันตอบถูกไว้เป็นชุด regression-testing แล้ววัดซ้ำทุกครั้งหลังปรับ เพราะความสามารถที่หายไปจะไม่ส่งเสียงบอกเราเอง
ตัวอย่างจากบทสนทนาจริง
หัวหน้าฝ่ายบริการลูกค้า: เราเก็บบทสนทนากับลูกค้าไว้เป็นหมื่นคู่ อยากเอาไปปรับโมเดลให้ตอบด้วยสำนวนของทีมเราเป๊ะๆ ทำเลยได้ไหมคะ
ทีมข้อมูล: ทำได้ครับ แต่ขอตั้งชุดวัดผลก่อนลงมือ เพราะมีอาการชื่อ catastrophic forgetting ที่โมเดลจะเก่งขึ้นในเรื่องที่เราสอน แล้วงานอื่นที่เคยทำได้ดีอย่างการสรุปเอกสารยาวหรือการตอบภาษาอังกฤษกลับแย่ลงไปพร้อมกัน ถ้าเราวัดแค่ว่าตอบด้วยสำนวนทีมได้หรือยัง เราจะไม่มีทางเห็นของที่หายไป ผมขอเก็บคำถามที่รุ่นที่ใช้อยู่ตอนนี้ตอบถูกไว้เป็นชุดอ้างอิง แล้ววัดซ้ำหลังปรับเสร็จ ถ้าคะแนนชุดนั้นตก เราจะรู้ทันทีว่าเราแลกอะไรไปกับสำนวนที่ได้มา
ระวังสับสนกับ
- overfitting : overfitting คือโมเดลจดจำรายละเอียดของข้อมูลที่ใช้ฝึกมากเกินไปจนทำนายข้อมูลใหม่ของงานเดิมพลาด ส่วน catastrophic forgetting พูดถึงความสามารถ "เรื่องอื่น" ที่เคยมีแล้วหายไป สองอาการนี้มักโผล่พร้อมกันตอนปรับโมเดล แต่วัดคนละที่ ตัวหนึ่งวัดจากชุดทดสอบของงานใหม่ อีกตัววัดจากงานเก่าที่ไม่ได้อยู่ในข้อมูลฝึกรอบนี้เลย
- model-drift : model drift คือโลกภายนอกเปลี่ยนไปจนคำตอบเดิมใช้ไม่ได้ ทั้งที่ไม่มีใครไปแตะตัวโมเดลเลยสักครั้ง ส่วน catastrophic forgetting เกิดจากการที่เราลงมือฝึกโมเดลเองแล้วความสามารถเดิมหายไป ต่างกันตรงที่ต้นเหตุอยู่นอกมือหรืออยู่ในมือเรา
- knowledge-cutoff : knowledge cutoff คือเส้นวันที่ข้อมูลที่ใช้ฝึกจบลง ของที่เกิดหลังเส้นนั้นโมเดลไม่เคยเห็นมาตั้งแต่ต้น ส่วน catastrophic forgetting คือของที่โมเดลเคยเห็นและเคยตอบได้จริง แล้วหายไปหลังถูกฝึกเพิ่ม
Sources (9)
- https://pure.johnshopkins.edu/en/publications/catastrophic-interference-in-connectionist-networks-the-sequentia-4/ fetched 2026-08-15
- https://arxiv.org/abs/1612.00796 fetched 2026-08-15
- https://arxiv.org/abs/2308.08747 fetched 2026-08-15
- https://doi.org/10.1109/TASLPRO.2025.3606231 fetched 2026-08-16
- https://arxiv.org/abs/2310.03693 fetched 2026-08-15
- https://proceedings.iclr.cc/paper_files/paper/2024/hash/83b7da3ed13f06c13ce82235c8eedf35-Abstract-Conference.html fetched 2026-08-16
- https://learn.microsoft.com/en-us/azure/ai-foundry/openai/concepts/fine-tuning-considerations fetched 2026-08-15
- https://developers.openai.com/api/docs/guides/supervised-fine-tuning fetched 2026-08-15
- https://huggingface.co/docs/peft/main/en/conceptual_guides/lora fetched 2026-08-15
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย