Cognition ปล่อยโมเดลเขียนโค้ดตัวใหม่ที่อ้างว่าได้คะแนนใกล้รุ่นท็อปในราคาหนึ่งในสี่
Cognition ประกาศเมื่อ 10 ก.ย. เปิดตัว SWE-2 ซึ่งเป็นโมเดลสำหรับงานวิศวกรรมซอฟต์แวร์ที่ฝึกด้วย reinforcement learning ต่อยอดจากโมเดลฐาน Kimi K3 ขนาด 2.8 ล้านล้านพารามิเตอร์ บริษัทระบุว่ารุ่นนี้เข้าใกล้ GPT-6 Astra ในระยะไม่กี่จุดที่ค่าใช้จ่ายหนึ่งในสี่ และถูกกว่าตัวเทียบ 64 เปอร์เซ็นต์
ตารางคะแนนที่บริษัทให้มาคือ FrontierCode 1.1 Main ได้ 50.0 เทียบกับ GPT-6 Astra ที่ 53.3 และ Claude Fable 5.1 ที่ 50.9 ส่วน DeepSWE 1.1 ได้ 73.0 เทียบกับ Astra ที่ 74.1 และ Terminal-Bench 2.1 ได้ 92.8 ซึ่งสูงสุดในตาราง อีกตัวเลขที่บริษัทเน้นคือรุ่นกลางของ SWE-2 ใช้จำนวนรอบน้อยลง 58 เปอร์เซ็นต์และค่าใช้จ่ายน้อยลง 81 เปอร์เซ็นต์เมื่อเทียบกับ SWE-1.7 ของตัวเอง
ตัวเลขที่หัวข้อข่าวไม่ได้พูดถึงอยู่ในแถวสุดท้ายของตารางเดียวกัน คือ Terminal-Bench 4 ซึ่ง SWE-2 ได้ 27.3 ขณะที่ Claude Fable 5.1 ได้ 55.8 และ GPT-6 Astra ได้ 57.9 คือห่างกันราวสองเท่าในชุดทดสอบที่ยากที่สุดของตาราง
ข้อควรระวังคือคะแนนทุกตัวมาจากบริษัทผู้ออกโมเดลเอง ยังไม่มีผู้วัดอิสระ และหน้าประกาศไม่ระบุราคาต่อโทเคน ไม่ระบุขนาดหน้าต่างบริบท และไม่ระบุเงื่อนไขการวัด คำว่าถูกกว่าหนึ่งในสี่จึงยังตรวจสอบไม่ได้จากตัวเลขที่เปิดเผย โมเดลเปิดให้ใช้ผ่าน Devin ทั้งรุ่นเดสก์ท็อป บรรทัดคำสั่ง เว็บ และ Fusion
▲ ทำไมต้องรู้ · เวลาเห็นตารางเทียบคะแนนของผู้ขาย สิ่งที่ควรทำก่อนคือหาแถวที่ตัวเองแพ้แล้วดูว่าห่างแค่ไหน เพราะชุดทดสอบแต่ละตัววัดงานคนละแบบ ทีมที่ใช้ผู้ช่วยเขียนโค้ดกับงานสั้นและชัดอาจได้ประโยชน์จากราคาที่ถูกลงจริง ส่วนทีมที่ใช้กับงานยาวหลายขั้นตอนควรทดสอบกับงานของตัวเองก่อนย้าย