Ornith-1.5 โมเดลเปิดที่อ้างคะแนนเทียบชั้นค่ายปิด แต่ตัวเลขต้องอ่านพร้อม harness
Ornith-1.5 โมเดลเปิดที่อ้างคะแนนเทียบชั้นค่ายปิด แต่ตัวเลขต้องอ่านพร้อม harness
โมเดลตระกูล Ornith-1.5 เผยแพร่ต่อสาธารณะเมื่อวันที่ 19 ส.ค. 2569 ออกมาสามขนาดคือ 397 พันล้าน พารามิเตอร์แบบผู้เชี่ยวชาญผสม 35 พันล้านแบบผู้เชี่ยวชาญผสม และ 9 พันล้านแบบหนาแน่น หน้าประกาศระบุผู้พัฒนาไว้เพียงว่า Ornith Team ส่วนสื่อเทคโนโลยีระบุว่าเป็นทีมวิจัยชื่อ DeepReinforce ซึ่งเป็นทีมเดียวกับที่ปล่อย Ornith-1.0 เมื่อเดือน มิ.ย. 2569 (ornith.ai · TestingCatalog)
หน้าต้นทางอธิบายวิธีฝึกว่าเป็นวงจรที่โมเดลตั้งโจทย์ใหม่ให้ตัวเอง สร้างโครงงานสำหรับโจทย์นั้น แล้วผลิตคำตอบ เพื่อเอาไปเป็นข้อมูลฝึกด้วยการเรียนรู้แบบเสริมกำลังต่อ ถ้อยคำที่ใช้คือ "a closed self-improvement loop in which stronger policies enable the generation of harder and more informative tasks" (ornith.ai)
สัญญาอนุญาตที่ประกาศไว้ในข้อมูลกำกับ แต่ยังไม่มีตัวสัญญาแนบ
ข้อมูลกำกับโมเดลบนคลังโมเดลของทั้งรุ่น 397B และรุ่น 9B ระบุสัญญาอนุญาตเป็น MIT ยืนยันได้จากช่องทาง
ที่เครื่องอ่านได้โดยตรง ซึ่งคืนค่า license:mit ในรายการป้ายกำกับ และ cardData.license เป็น mit
(Hugging Face API)
ข้อควรระวังที่ต้องเขียนไว้ให้ตรงคือทั้งสองคลังยังไม่มีไฟล์สัญญาอนุญาตแนบมาจริง ลิงก์ที่การ์ดของรุ่น 9B ชี้ไปยังไฟล์สัญญาตอบรหัส 404 และรายการไฟล์ในคลังไม่มีไฟล์ชื่อ LICENSE แบบใดเลย สถานะที่ถูกต้อง ณ วันที่ 20 ส.ค. 2569 จึงเป็น "ประกาศ MIT ไว้ในข้อมูลกำกับ" ไม่ใช่ "แนบสัญญา MIT มาแล้ว" ซึ่งเป็นความต่าง ที่ฝ่ายกฎหมายขององค์กรสนใจ
คะแนนที่ต้องอ่านพร้อมชื่อชุดเครื่องมือรัน
การ์ดของโมเดลรายงานคะแนนไว้สองคอลัมน์ตามชุดเครื่องมือที่ใช้รันงาน ซึ่งเป็นรายละเอียดที่ถูกตัดทิ้งบ่อยที่สุด เวลาข่าวหยิบตัวเลขไปพาดหัว รุ่น 397B ได้ 86.1 บนชุดทดสอบงานผ่านหน้าจอบรรทัดคำสั่งภายใต้ชุดเครื่องมือ Terminus-2 และ 85.2 ภายใต้ชุดเครื่องมือ Claude Code เทียบกับรุ่นท็อปของค่ายปิดที่ 85.0 (model card 397B)
บนชุดทดสอบงานแก้บั๊กจากคลังโค้ดจริง รุ่น 397B ได้ 56.0 ซึ่งต่ำกว่าคู่เทียบเดิมที่ 59.0 คือแซงบนกระดานหนึ่ง และยังตามอยู่บนอีกกระดานหนึ่ง การเล่าเฉพาะกระดานแรกจึงเป็นการเล่าครึ่งเดียว
รุ่น 9B รายงานคะแนนบนชุดทดสอบเดียวกันไว้ที่ 46.2 ภายใต้ Terminus-2 และ 47 ภายใต้ Claude Code ส่วนคะแนนงานแก้บั๊กอยู่ที่ 70.6 (model card 9B)
ความไม่ตรงกันที่ยืนยันได้จริงมีจุดเดียว คือสื่อเทคโนโลยีรายงานคะแนนของรุ่น 397B ไว้ที่ 85.1 ซึ่งไม่ตรงกับ ค่าใดในการ์ดเลยทั้ง 86.1 และ 85.2 ถ้ายึด 85.1 ผลจะกลายเป็นเสมอกับคู่เทียบแทนที่จะแซง ส่วนตัวเลข 47.0 ของรุ่น 9B ที่สื่อเจ้าเดียวกันรายงาน ไม่ใช่ความขัดแย้ง เพราะเป็นค่าที่การ์ดระบุไว้เองภายใต้อีกชุดเครื่องมือหนึ่ง (TestingCatalog)
ตรวจเมื่อวันที่ 20 ส.ค. 2569 แล้วยังไม่มีผู้วัดอิสระเผยแพร่คะแนนของ Ornith-1.5 คะแนนทุกตัวที่หมุนเวียนอยู่ ในข่าวจึงเป็นคะแนนที่ผู้ผลิตวัดเองทั้งหมด (Artificial Analysis)
ไม่ใช่โมเดลที่ฝึกใหม่จากศูนย์
ข้อมูลกำกับของรุ่น 397B ระบุชนิดโมเดลไว้ว่า qwen3_5_moe และรุ่น 9B ระบุว่า qwen3_5 ซึ่งบ่งชี้ว่าใช้
สถาปัตยกรรมสาย Qwen3.5 หน้าประกาศของผู้พัฒนาไม่ได้ระบุเช็คพอยต์ตั้งต้นไว้เลย
ผู้ใช้บนกระดานนักพัฒนาหลายคนระบุว่าเป็นการฝึกต่อยอดจากโมเดลฐานของ Qwen แต่ยังบอกไม่ตรงกันว่าเป็น รุ่น 3.5 หรือ 3.6 ข้อสรุปที่ยืนยันได้จึงมีเพียงว่าโมเดลนี้ไม่ได้ฝึกใหม่จากศูนย์ ส่วนเช็คพอยต์ตั้งต้นที่แน่ชัด ยังยืนยันไม่ได้ (Hacker News)
ความต่างนี้มีน้ำหนักเพราะพาดหัวแบบ "โมเดลเปิดตัวใหม่แซงค่ายปิด" ชวนให้เข้าใจว่ามีผู้เล่นใหม่ที่ฝึกโมเดลระดับนี้ ขึ้นมาได้เอง ทั้งที่สิ่งที่เกิดขึ้นคือการต่อยอดจากโมเดลเปิดที่มีอยู่แล้ว ซึ่งเป็นคนละเรื่องกันทั้งในแง่ต้นทุนและ ในแง่ว่าใครเป็นเจ้าของความสามารถตั้งต้น
ข้อจำกัดที่จับต้องได้
ความยาวบริบทที่ระบุในไฟล์ตั้งค่าของรุ่น 397B คือ 262,144 โทเคน โดยค่าที่ตั้งมาให้ไม่ได้เปิดการขยายบริบท แบบ YaRN ไว้ ถ้าต้องการบริบทยาวกว่านั้นต้องเปิดเอง
รุ่น 397B ยังใหญ่เกินกว่าจะรันบนการ์ดจอสองใบได้แม้บีบขนาดหนักแล้ว ซึ่งแปลว่าองค์กรทั่วไปที่อยากรันเองเพื่อ คุมข้อมูล จะใช้ได้จริงเฉพาะรุ่นเล็กกว่า
เรื่องที่คนเข้าใจผิดบ่อย
หนึ่ง หลายคนอ่านว่าโมเดลนี้แซงรุ่นท็อปของค่ายปิดแล้วทั้งกระดาน ความจริงคือแซงบนชุดทดสอบหนึ่ง และยังแพ้บนชุดทดสอบงานแก้บั๊ก
สอง คะแนนที่ยกมาเทียบกันต้องมาจากชุดเครื่องมือรันเดียวกัน การ์ดของโมเดลนี้เองมีสองคอลัมน์ที่ต่างกันราวหนึ่งจุด ซึ่งมากพอจะเปลี่ยนข้อสรุปจากแซงเป็นเสมอ
สาม คำว่าเปิดซอร์สกับคำว่ามีสัญญาอนุญาตแนบมาแล้วเป็นคนละสถานะ ณ วันที่เขียน โมเดลนี้อยู่ในสถานะแรก
สิ่งที่คนทำงานไทยหยิบไปใช้ได้
เวลาเห็นข่าวว่าโมเดลเปิดแซงโมเดลปิดแล้ว วิธีตรวจที่ใช้เวลาไม่กี่นาทีคือเปิดการ์ดของโมเดลบนคลังโมเดลเอง แล้วดูสามอย่าง คือคะแนนนี้วัดด้วยชุดเครื่องมือไหน กระดานที่มันแซงคืองานแบบไหน และมีกระดานไหนที่มันยังแพ้
สำหรับองค์กรที่จะเอาโมเดลเปิดมาใช้จริง คำถามของฝ่ายกฎหมายไม่ใช่ว่าเขียนว่า MIT หรือไม่ แต่คือมีไฟล์สัญญา อยู่ในคลังให้ตรวจสอบได้หรือยัง เคสนี้เป็นตัวอย่างที่ทั้งสองอย่างยังไม่ตรงกัน
คำถามที่ยังไม่มีคำตอบ
เช็คพอยต์ตั้งต้นที่ใช้ฝึกต่อคือรุ่นไหนกันแน่ และการฝึกต่อนั้นอยู่ใต้เงื่อนไขของสัญญาอนุญาตของโมเดลฐานหรือไม่
ผู้วัดอิสระจะให้คะแนนโมเดลนี้เท่าไร และจะตรงกับคะแนนที่ผู้ผลิตรายงานหรือไม่
ไฟล์สัญญาอนุญาตจะถูกเพิ่มเข้าคลังเมื่อไร
Sources (7)
- https://ornith.ai/ornith_1_5.html fetched 2026-08-20
- https://huggingface.co/ornith-ai/Ornith-1.5-397B fetched 2026-08-20
- https://huggingface.co/api/models/ornith-ai/Ornith-1.5-397B fetched 2026-08-20
- https://huggingface.co/ornith-ai/Ornith-1.5-9B fetched 2026-08-20
- https://www.testingcatalog.com/ornith-1-5-open-models-launch-in-397b-35b-and-9-b-sizes/ fetched 2026-08-20
- https://news.ycombinator.com/item?id=49362401 fetched 2026-08-20
- https://artificialanalysis.ai/ fetched 2026-08-20
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย