Dictionary · กลไกโมเดล · 59 / 321

Post-training

ขั้นตอนที่ทำต่อจาก pre-training เพื่อสอนโมเดลให้ทำตามคำสั่งและมีนิสัยตามที่ผู้ให้บริการกำหนด เป็นเหตุผลสำคัญที่โมเดลต่างเจ้าตอบคำถามเดียวกันคนละแบบ

Post-training คือชุดขั้นตอนที่ผู้พัฒนาทำกับโมเดลหลังจบการ training รอบใหญ่ที่เรียกว่า pre-training เปเปอร์ Tulu 3 ของ Allen Institute for AI เปิดบทคัดย่อไว้ว่า post-training ของโมเดลภาษาถูกใช้เพื่อขัดเกลาพฤติกรรมและปลดล็อกทักษะใหม่ในโมเดลรุ่นหลังจำนวนมาก เหตุผลที่ต้องมีขั้นนี้คือโมเดลที่ผ่าน pre-training อย่างเดียวเป็นเครื่องทายคำถัดไปล้วนๆ มันยังไม่รู้ว่าเจอคำถามแล้วควรตอบ ไม่รู้ว่าถูกขอให้ทำเรื่องอันตรายแล้วควรปฏิเสธ และไม่รู้ว่าควรพูดด้วยน้ำเสียงแบบไหน ทั้งหมดนี้ถูกสอนกันในช่วง post-training

น้ำหนักของขั้นนี้มากกว่าที่หลายคนคิด เปเปอร์ InstructGPT ของ OpenAI ที่เผยแพร่ในปี 2022 รายงานว่าในการประเมินโดยคนบนชุด prompt ที่ทีมใช้เอง คำตอบจากโมเดล InstructGPT ขนาด 1.3 พันล้าน parameters ถูกเลือกว่าดีกว่าคำตอบจาก GPT-3 ขนาด 175 พันล้าน parameters ทั้งที่มี parameters น้อยกว่าราวร้อยเท่า และเปเปอร์เดียวกันรายงานว่าโมเดลชุดนี้ดีขึ้นเรื่องความตรงต่อความจริงพร้อมกับผลิตข้อความเป็นพิษน้อยลง โดยเปเปอร์กำกับไว้เองว่า InstructGPT ยังทำผิดพลาดแบบง่ายๆ อยู่ จุดที่ต้องระวังคือสูตรของแต่ละเจ้าไม่ได้เหมือนกัน ต้องดูเอกสารเป็นรายเจ้าไป model-card ของ Llama 3.1 ฝั่ง Meta ระบุว่าเวอร์ชันที่ปรับแล้วใช้ supervised fine-tuning (SFT) และ reinforcement learning with human feedback (RLHF) เพื่อให้สอดคล้องกับความชอบของมนุษย์ในด้านความเป็นประโยชน์และความปลอดภัย โดยข้อมูลที่ใช้ fine-tune รวมชุดข้อมูลคำสั่งที่เปิดสาธารณะ บวกกับตัวอย่างที่สร้างแบบ synthetic มากกว่า 25 ล้านตัวอย่าง ส่วนเปเปอร์ Constitutional AI ของ anthropic อธิบายวิธี constitutional-ai ว่าแบ่งเป็นสองเฟส เฟส supervised คือสุ่มคำตอบจากโมเดลตั้งต้น ให้มันวิจารณ์และแก้คำตอบของตัวเอง แล้วเอาคำตอบที่แก้แล้วไป fine-tune โมเดลเดิม ส่วนเฟส RL คือสุ่มคำตอบจากโมเดลที่ fine-tune แล้ว ใช้โมเดลอีกตัวตัดสินว่าคำตอบไหนดีกว่า แล้วฝึก preference model จากชุดความชอบที่ AI เป็นคนตัดสิน เปเปอร์ระบุว่าในฝั่งความไม่เป็นอันตราย การกำกับดูแลจากมนุษย์มีทางเดียวคือรายการกฎหรือหลักการที่คนเขียนไว้ ส่วนฝั่งความเป็นประโยชน์เปเปอร์บอกว่ายังใช้ป้ายกำกับที่คนให้อยู่ ขณะที่ technical report ของ gemma 3 ฝั่ง Google DeepMind เขียนว่าโมเดลชุดนี้ฝึกด้วย distillation และสูตร post-training แบบใหม่ของทีมช่วยยกความสามารถด้านคณิตศาสตร์ การสนทนา การทำตามคำสั่ง และงานหลายภาษาขึ้นอย่างมีนัยสำคัญ

คนทำงานเจอผลของ post-training ทุกวันโดยไม่รู้ตัว เวลาย้ายงานเดิมจากโมเดลหนึ่งไปอีกโมเดลแล้วพบว่าความรู้พื้นฐานพอกัน แต่ความยาวคำตอบ น้ำเสียง และความยอมทำตามคำสั่งยากๆ ต่างกันชัดเจน คุณสมบัติกลุ่มนี้เป็นผลของงานช่วงหลัง pre-training เป็นหลัก แม้เอกสารของผู้ให้บริการแต่ละเจ้าจะเรียกชื่อขั้นนี้ต่างกันและลงรายละเอียดไม่เท่ากัน ข้อควรระวังข้อแรกคือเอกสารของผู้ให้บริการบอกพฤติกรรมที่ตั้งใจไว้ ไม่ใช่คำรับประกันว่าโมเดลทำได้ครบ Model Spec ของ OpenAI ฉบับวันที่ 18 ธันวาคม 2025 เขียนว่าทีมงานกำลังฝึกโมเดลให้สอดคล้องกับหลักการในเอกสารนี้ แต่ระบุไว้ด้วยว่าโมเดลที่ให้บริการอยู่ยังสะท้อนเอกสารได้ไม่ครบ และทีมงานปรับปรุงระบบอย่างต่อเนื่องเพื่อให้เข้าใกล้แนวทางเหล่านี้มากขึ้น ข้อควรระวังข้อที่สองคือรายละเอียดสูตรมักไม่ได้อยู่ในที่เดียว หน้า model card ของ Gemma 3 บน ai.google.dev บอกจำนวน token ที่ใช้ pre-train แยกตามขนาด เช่น รุ่น 27B ใช้ 14 ล้านล้าน token ส่วนวิธีสร้างเวอร์ชัน instruction-tuned หน้านั้นไม่ได้อธิบายไว้ มีเพียงลิงก์ Gemma 3 Technical Report วางไว้ในรายการเอกสารอ้างอิงด้านบนของหน้า ยิ่งกว่านั้น เปเปอร์ Tulu 3 ที่เผยแพร่เดือนพฤศจิกายน 2024 เปิดเรื่องด้วยการชี้ว่าสูตร post-training แบบเปิดยังตามหลังสูตรของฝั่งที่ไม่เปิดเผย และระบุว่าข้อมูลกับสูตรของขั้นนี้เป็นชิ้นส่วนที่สำคัญที่สุดและโปร่งใสน้อยที่สุดไปพร้อมกัน แต่ต้องอ่านต่อด้วยว่าเปเปอร์เดียวกันเสนอตัวเองเป็นคำตอบของช่องว่างนั้น โดยเปิดทั้งข้อมูล โค้ด และสูตรออกมา แล้วรายงานว่า Tulu 3 ซึ่งต่อยอดจากโมเดลฐาน Llama 3.1 ทำผลได้เหนือรุ่น instruct ของ Llama 3.1, Qwen 2.5, Mistral รวมถึงโมเดลปิดอย่าง GPT-4o-mini และ Claude 3.5-Haiku ทั้งหมดนี้ทำให้ผลในทางปฏิบัติคือเทียบสูตรข้ามเจ้าจากเอกสารสาธารณะได้ไม่ครบ และต้องทดสอบกับงานจริงของเราเองก่อนตัดสินใจ

ตัวอย่างจากบทสนทนาจริง

หัวหน้าฝ่ายการตลาด: "งงมากค่ะ เราย้ายจากโมเดลเดิมไปอีกเจ้าที่เขาว่าเก่งกว่า ผลคือมันตอบยาวขึ้นสามเท่า แถมชอบเติมคำเตือนท้ายคำตอบทุกครั้ง ทั้งที่ prompt เดิมเป๊ะๆ นี่คือโมเดลมันโง่ลงหรือเปล่าคะ"

ทีมข้อมูล: "ไม่ใช่เรื่องความเก่งครับ ความรู้ของสองตัวนี้มาจากการอ่านข้อมูลปริมาณมหาศาลคล้ายกัน แต่นิสัยมาจากคนละสูตรในช่วงที่เรียกว่า post-training คือช่วงที่เจ้าของโมเดลสอนว่าควรตอบยาวแค่ไหน ควรเตือนตอนไหน ควรปฏิเสธเรื่องอะไร แต่ละเจ้าสอนไม่เหมือนกันและไม่ได้เปิดสูตรทั้งหมด สิ่งที่เราทำได้คือเขียนกติกาความยาวและรูปแบบลงไปใน prompt ให้ชัด แล้วรันชุดทดสอบเดิมเทียบกันสักสิบเคสก่อนตัดสินว่าจะย้ายจริงไหมครับ"

ระวังสับสนกับ

  • fine-tuning : fine-tuning คือเทคนิคฝึกต่อจากโมเดลที่ฝึกมาแล้ว ซึ่งองค์กรทั่วไปทำเองได้กับงานของตัวเอง ส่วน post-training คือชื่อเรียกช่วงงานทั้งช่วงที่ทำต่อจาก pre-training ก่อนปล่อยโมเดลออกมา ซึ่งส่วนใหญ่เจ้าของโมเดลเป็นคนทำ แต่ทีมภายนอกก็ทำได้เมื่อมีน้ำหนักของโมเดลฐานเปิดให้ใช้ อย่างที่ทีม Tulu 3 ทำกับโมเดลฐาน Llama 3.1 และช่วงนี้มักมีหลายเทคนิคซ้อนกันอยู่ข้างใน โดย fine-tuning เป็นหนึ่งในนั้น
  • rlhf : RLHF เป็นเทคนิคหนึ่งที่ถูกใช้ในช่วง post-training ไม่ใช่คำที่ใช้แทนกันได้ model card ของ Llama 3.1 ระบุชื่อ RLHF ไว้ตรงตัว ขณะที่เปเปอร์ Constitutional AI ของ Anthropic อธิบายเฟสที่สองว่าใช้โมเดลตัดสินความชอบด้านความไม่เป็นอันตรายแทนคน ส่วนด้านความเป็นประโยชน์ยังใช้ป้ายกำกับจากคน
  • alignment : alignment คือเป้าหมายว่าอยากให้ AI ทำตามสิ่งที่คนตั้งใจไว้ ส่วน post-training คือช่วงงานจริงที่ใช้ไล่ตามเป้าหมายนั้น การที่โมเดลผ่าน post-training มาแล้วจึงยังไม่ได้แปลว่ามันทำตามเอกสารได้ครบทุกข้อ

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

ParametersPrefix cache