Puro-2B กับต้นทุนการฝึกโมเดลที่ลงมาระดับหลักพันดอลลาร์
Puro-2B กับต้นทุนการฝึกโมเดลที่ลงมาระดับหลักพันดอลลาร์
รายงานชื่อ Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 ขึ้น arXiv เมื่อ 27 ส.ค. 2026 เสนอสูตรการฝึกโมเดลตั้งแต่ศูนย์ที่ออกแบบมาเพื่อลดกำแพงค่าใช้จ่ายโดยเฉพาะ (arXiv 2608.27370)
ทีมฝึกโมเดลชุดหนึ่งด้วยข้อมูลสูงสุด 1.4 ล้านล้านโทเคน ใช้ความละเอียดตัวเลขแบบ FP8 บนการ์ดจอ RTX 5090 ซึ่งเป็นการ์ดสำหรับผู้บริโภคทั่วไป โมเดลในชุดต่างกันที่งบโทเคนและสูตรย่อยที่เลือกใช้ (arXiv 2608.27370)
ตัวเลขหลัก
รายงานยกตัวเลขของงานอื่นมาเทียบว่า การฝึก Llama-3.2-3B มีค่าใช้จ่ายเกิน 1.5 ล้านดอลลาร์ และการทำซ้ำ SmolLM3-3B ต้องใช้เกิน 700,000 ดอลลาร์ ตัวเลขสองตัวนี้เป็นการประเมินของผู้เขียนเอง ภายใต้วิธีคิดต้นทุนของพวกเขา ไม่ใช่ตัวเลขที่มีใครไปตรวจสอบมา (arXiv 2608.27370)
โมเดลตัวดีที่สุดของทีมใช้ต้นทุนต่ำกว่า 6,900 ดอลลาร์ และรายงานระบุว่ามันเข้าใกล้ผลของ Qwen2.5-1.5B ภายใต้เกณฑ์การประเมินที่ทีมกำหนดเอง ซึ่งวลีสุดท้ายนี้เป็นคำของผู้เขียน ไม่ใช่ผลจากกระดานวัดอิสระ (arXiv 2608.27370)
ทีมยังปรับเส้นความสัมพันธ์ระหว่างต้นทุนกับคะแนนเฉลี่ยจากโมเดลทั้งชุด เรียกว่า Puro Cost Scaling Law แล้วระบุว่าเส้นที่ปรับได้บอกว่าราว 4,400 ดอลลาร์ ซึ่งน้อยกว่า 5,090 เพียงพอจะไปถึงผลของ Qwen2-1.5B คำว่าเส้นที่ปรับได้บอกว่าเป็นคำสำคัญ เพราะเป็นค่าที่ได้จากการลากเส้น ไม่ใช่ค่าที่วัดจากการฝึกจริง (arXiv 2608.27370)
คะแนนเฉลี่ยจากการ์ดโมเดลของผู้เขียนเองอยู่ที่ Qwen2-1.5B 55.14 Puro-2B 57.81 และ Qwen2.5-1.5B 60.73 แปลว่าคำว่าเข้าใกล้ในที่นี้คือยังตามอยู่ราวสามจุด และช่องว่างกว้างที่สุดในหมวดคณิตศาสตร์กับการเขียนโค้ด (การ์ดโมเดล Puro-2B-Base)
คำว่าต้นทุนในรายงานนี้แปลว่าอะไร
จุดนี้คือส่วนที่อ่านผิดแล้วเสียหายที่สุด รายงานนิยามต้นทุนการทำซ้ำว่าหมายถึงต้นทุนการประมวลผล ของการรันสูตรการฝึกสองเฟสที่สรุปแล้วอีกหนึ่งครั้ง โดยเริ่มนับหลังจากข้อมูลถูกจัดเตรียมเป็นชุดเรียบร้อยแล้ว (arXiv 2608.27370)
เพราะ RTX 5090 ไม่มีตลาดให้เช่าอย่างเปิดเผยเนื่องจากเงื่อนไขการใช้งานของ NVIDIA ทีมจึงประเมินราคาต่อชั่วโมงเอง ด้วยการเฉลี่ยค่าเครื่องและค่าไฟออกเป็นห้าปี ค่าเครื่องกับค่าไฟจึงอยู่ในตัวเลขแล้ว ไม่ได้ถูกตัดออก แต่ตัวเลขที่ได้ผูกกับสมมติฐานอายุการใช้งานห้าปีและราคาไฟในตลาดที่ทีมใช้ (arXiv 2608.27370)
สิ่งที่ไม่รวมอยู่ในตัวเลขคือการจัดหาและเตรียมข้อมูล การทดลองกับโมเดลตัวแทน การศึกษาเรื่องการขยายขนาด และการทดลองตัดส่วนประกอบ การรันที่ล้มเหลว การปรับหลังฝึก การประเมินผล การเฉลี่ยจุดบันทึก และค่าแรงคน รวมถึงทรัพยากรที่ไม่ใช่ตัวเร่งการคำนวณ เช่น ซีพียู พื้นที่เก็บข้อมูล และเครือข่าย ผู้เขียนสรุปเองว่าให้อ่านตัวเลขนี้เป็นต้นทุนส่วนเพิ่มแบบแคบของการทำซ้ำการฝึกรอบสุดท้าย ไม่ใช่ต้นทุนรวมของการพัฒนาโมเดลทั้งตัว (arXiv 2608.27370)
เรื่องที่คนเข้าใจผิดบ่อย
ชื่อรายงานเล่นกับเลขรุ่นของการ์ดจอ ทำให้คนอ่านผ่านๆ จำไปว่าฝึกโมเดลสองพันล้านพารามิเตอร์ได้ในราคา 5,090 ดอลลาร์ ความจริงคือโมเดลที่ฝึกจริงและใช้เป็นตัวหลักมีต้นทุนราว 6,900 ดอลลาร์ ซึ่งสูงกว่าเลขในชื่อ ส่วนตัวเลขที่ต่ำกว่า 5,090 เป็นค่าที่ได้จากการลากเส้น ไม่ใช่จากการฝึกจริง
คำว่าการ์ดจอผู้บริโภคก็ไม่ได้แปลว่าเครื่องเดียวที่บ้าน การฝึกเฟสสองใช้การ์ด RTX 5090 จำนวน 96 ใบพร้อมกัน ความถูกของสูตรนี้อยู่ที่ต้นทุนต่อการรันหนึ่งรอบ ไม่ได้อยู่ที่ว่าคนคนเดียวทำตามได้
และเป้าที่เอาไปเทียบคือโมเดลขนาดเล็กจากรุ่นก่อนหน้า Qwen2 ออกเมื่อกลางปี 2024 และ Qwen2.5 ออกเมื่อปลายปีเดียวกัน การอ่านผลนี้ว่าฝึกโมเดลระดับแนวหน้าได้ในราคาหลักพันจึงไม่ตรงกับสิ่งที่รายงานอ้าง
ทำไมเรื่องนี้สำคัญกับคนทำงาน
คำถามที่องค์กรถามกันมาตลอดคือจะเช่าโมเดลของใคร เพราะการฝึกเองถูกมองว่าเป็นเรื่องของบริษัทที่มีทุนระดับพันล้าน ตัวเลขระดับนี้ไม่ได้ทำให้การฝึกโมเดลแนวหน้าเป็นไปได้สำหรับองค์กรทั่วไป แต่มันเปลี่ยนคำถามสำหรับงานเฉพาะทาง บางประเภท โดยเฉพาะงานภาษาไทยเฉพาะโดเมนที่ข้อมูลออกนอกองค์กรไม่ได้ และที่โมเดลขนาดเล็กก็เพียงพอ
ก่อนเอาไปเสนอในที่ประชุม สิ่งที่ต้องตกลงกันให้ตรงคือนิยามของคำว่าต้นทุน เพราะตัวเลขในรายงานนับเฉพาะ การรันรอบสุดท้าย ขณะที่งบประมาณจริงขององค์กรจะโดนส่วนที่รายงานตัดออกเป็นหลัก คือการเตรียมข้อมูล การทดลองที่ล้มเหลว และเวลาคน
สิ่งที่ยังไม่มีหลักฐาน
รายงานนี้เป็น preprint ที่ยังไม่ผ่านการตรวจของผู้ทรงคุณวุฒิ และเพิ่งเผยแพร่ได้ไม่กี่วัน จึงยังไม่มีการตรวจสอบจากภายนอกให้อ้างอิง การที่ยังไม่มีใครออกมาแย้งไม่ได้แปลว่าถูกต้อง
เส้นความสัมพันธ์ระหว่างต้นทุนกับผลลัพธ์ที่ทีมเสนอยังไม่มีค่าที่บอกความแม่นของการปรับเส้น และไม่ได้ระบุช่วงที่ใช้ทำนายได้อย่างปลอดภัย ผู้เขียนเสนอมันในฐานะเครื่องมือช่วยออกแบบเมื่อจะย่อขนาดลง ไม่ใช่ตัวทำนายที่ผ่านการตรวจสอบแล้ว
ตัวเลข 4,400 ดอลลาร์ยังมีความคลุมเครือในเอกสารของผู้เขียนเอง เพราะบทคัดย่อเรียกมันว่าค่าที่ได้จากการปรับเส้น ขณะที่การ์ดโมเดลเขียนราวกับเป็นค่าที่วัดได้จริง ให้ยึดตามบทคัดย่อไว้ก่อนจนกว่าจะมีใครยืนยัน
คำถามที่ยังไม่มีคำตอบ
สูตรนี้ย้ายไปฝึกโมเดลที่เน้นภาษาไทยแล้วยังได้ผลตามสัดส่วนเดิมหรือไม่ ยังไม่มีใครลอง และเรื่องนี้สำคัญเพราะภาษาที่ไม่ได้ใช้อักษรละตินมีต้นทุนโทเคนที่แพงกว่าอยู่แล้ว ดู benchmark-harness-fragility-2026 สำหรับเหตุผลว่าทำไมตัวเลขจากเกณฑ์วัดของผู้เขียนเองจึงต้องอ่านอย่างระวัง
Sources (2)
- https://arxiv.org/abs/2608.27370 fetched 2026-08-30
- https://huggingface.co/thu-pacman/Puro-2B-Base fetched 2026-08-30
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย