โมเดลเปิดตัวใหม่ของ Google เขียนข้อความทีละบล็อกสองร้อยห้าสิบหกคำพร้อมกัน แทนการไล่ทีละคำแบบที่โมเดลทั่วไปทำ
รายงานทางเทคนิคของ DiffusionGemma อธิบายว่ามันใช้วิธีที่เรียกว่า discrete diffusion คือแทนที่จะถอดรหัสออกมาทีละโทเคนตามลำดับ มันจะค่อยๆ ขัดเกลาบล็อกขนาด 256 โทเคนไปพร้อมกันทั้งบล็อก แล้ววนซ้ำจนได้ผลลัพธ์
ตัวโมเดลไม่ได้ฝึกขึ้นใหม่ทั้งตัว แต่เป็นการฝึกต่อยอดจาก Gemma 4 ด้วยงบโทเคนไม่ถึงหนึ่งในสิบของรอบเดิม ได้ออกมาเป็นสถาปัตยกรรมแบบผู้เชี่ยวชาญผสมที่มีพารามิเตอร์ทำงานจริง 3.8 พันล้านจากทั้งหมด 25.2 พันล้าน
ตัวเลขที่ทำให้คนสนใจคือความเร็ว รายงานระบุว่าโดยเฉลี่ยได้ราว 20 โทเคนต่อการคำนวณหนึ่งรอบ และออกผลได้ราว 1,500 โทเคนต่อวินาทีบนการ์ดจอ H100 หนึ่งใบ ซึ่งเร็วกว่าโมเดลแบบไล่ทีละคำแม้จะใช้เทคนิคเดาล่วงหน้าช่วยแล้ว
ข้อควรระวังคือความเร็วนี้วัดบนการ์ดจอระดับศูนย์ข้อมูลราคาหลายแสนบาท ไม่ใช่บนเครื่องทั่วไป และหน้าประกาศเรียกตัวเองว่าโมเดลทดลอง ยังไม่มีผู้วัดอิสระเผยแพร่ผลเทียบคุณภาพกับโมเดลแบบเดิมที่ขนาดใกล้กัน
▲ ทำไมต้องรู้ · งานที่ต้องรอ AI พิมพ์คำตอบยาวๆ ให้ดูอยู่ทุกวัน เช่น สรุปเอกสารหรือร่างอีเมล ความหน่วงส่วนใหญ่มาจากการที่โมเดลต้องไล่เขียนทีละคำ ถ้าวิธีเขียนทีละบล็อกนี้ไปได้จริง ประสบการณ์การใช้งานจะเปลี่ยนจากรอดูตัวหนังสือไหลเป็นได้คำตอบมาทั้งก้อน สิ่งที่ควรทำตอนนี้คือรู้ว่ามีทางเลือกแบบนี้อยู่ ยังไม่ต้องเปลี่ยนอะไร