Inception Labs ปล่อยโมเดลที่สร้างคำตอบทีเดียวทั้งก้อนแทนการไล่ทีละคำ ทำได้พันโทเคนต่อวินาที
Inception Labs ประกาศเมื่อ 8 ก.ย. ว่าเปิดให้ใช้ Mercury 2.5 ทั่วไป ซึ่งเป็นโมเดลภาษาตระกูล diffusion ตามคำอธิบายในเอกสารข่าวของบริษัท โดยรุ่นพรีวิวขึ้นให้ลองบน OpenRouter มาตั้งแต่ 31 ส.ค. แล้ว วันที่ 8 ก.ย. จึงไม่ใช่การเปิดตัวครั้งแรก โมเดลกลุ่มนี้ไม่ได้ทำนายคำถัดไปทีละคำแบบโมเดลทั่วไป แต่เริ่มจากร่างหยาบทั้งก้อนแล้วขัดหลายคำให้ชัดขึ้นพร้อมกัน บริษัทระบุว่าเท่าที่ตัวเองทราบ นี่คือโมเดล diffusion ที่ใหญ่ที่สุดเท่าที่เคยฝึกมา
ตัวเลขที่ให้ไว้คือความเร็ว 1,107 โทเคนต่อวินาทีบนการ์ด NVIDIA ที่หาซื้อได้ทั่วไป ซึ่งไม่ระบุรุ่นการ์ดหรือเงื่อนไขการวัดใดๆ ส่วนคุณภาพระบุว่าความฉลาดเพิ่มขึ้น 40 เปอร์เซ็นต์จาก Mercury 2 และเทียบได้กับกลุ่มโมเดลราคาประหยัดของค่ายใหญ่อย่าง GPT-5.6 Luna ระดับ Low, Gemini 3.5 Flash-Lite และ Claude Haiku 4.5 หน้าต่างบริบทอยู่ที่ 260,000 โทเคน
ราคาป้ายอยู่ที่ 0.20 ดอลลาร์ต่อล้านโทเคนขาเข้าและ 0.75 ดอลลาร์ต่อล้านโทเคนขาออก โดยช่วงเปิดตัวลด 80 เปอร์เซ็นต์เหลือ 0.04 และ 0.15 ดอลลาร์ ใช้ได้ผ่าน API ของตัวเอง Baseten และ OpenRouter
ข้อควรระวังที่สำคัญคือหน้าประกาศไม่มีตารางคะแนนหรือชื่อชุดทดสอบใดๆ เลย ตัวเลขความฉลาดที่เพิ่มขึ้น 40 เปอร์เซ็นต์จึงเป็นคำอ้างที่ไม่ได้บอกวิธีวัด ไม่ใช่ผลจากชุดทดสอบ และบริษัทเขียนเองว่างานจริงของลูกค้าให้สัญญาณที่ชัดกว่าชุดทดสอบเพียงอย่างเดียว จุดที่สับสนได้คือเอกสารสองชิ้นของบริษัทเองให้ตัวเลขคนละหน่วย หน้าบล็อกเขียนว่าเพิ่มขึ้น 40 เปอร์เซ็นต์ ส่วนเอกสารข่าวเขียนว่าเพิ่มขึ้น 10 จุด ของที่ยังเป็นแค่การพรีวิวคือ Mercury Voice ที่อ้างว่าเริ่มตอบภายในไม่ถึง 170 มิลลิวินาที
▲ ทำไมต้องรู้ · งานที่คนรอหน้าจออยู่จริง เช่น ผู้ช่วยตอบลูกค้าสด การเติมข้อความระหว่างพิมพ์ หรือการแปลทันที ความเร็วมีค่ามากกว่าคะแนนสอบอีกหนึ่งจุด ถ้าโมเดลกลุ่มนี้ทำได้จริงตามที่อ้าง ตัวเลือกสำหรับงานที่ต้องตอบเร็วจะไม่ได้เหลือแค่การจ่ายแพงขึ้นเพื่อซื้อความเร็วอีกต่อไป