Dictionary · กลไกโมเดล · 37 / 291

Diffusion model

เทคนิคสร้างภาพและวิดีโอของ AI ที่เริ่มจากสัญญาณรบกวน แล้วค่อยๆ ขัดเกลาทีละขั้นจนได้ผลลัพธ์ตามคำสั่ง ต่างจากการทายคำถัดไปทีละคำของโมเดลภาษาสาย transformer

Diffusion model คือกลุ่มเทคนิคของ generative-ai ที่ใช้สร้างภาพและวิดีโอ โดยเริ่มต้นจากข้อมูลที่เป็นสัญญาณรบกวนล้วนๆ คล้ายจอทีวีที่ไม่มีสัญญาณ แล้วให้ neural-network ค่อยๆ ขัดเกลาลบสัญญาณรบกวนออกทีละขั้นจนกลายเป็นภาพหรือคลิปที่ตรงกับคำบรรยายที่ผู้ใช้ป้อนเข้าไป วิธีนี้ต่างจาก transformer สายภาษาที่สร้างผลลัพธ์แบบทายคำถัดไปทีละคำเรียงกัน (ดู next-token-prediction) เพราะ diffusion model ไม่ได้สร้างผลลัพธ์ทีละชิ้นเรียงลำดับ แต่ปรับทั้งภาพหรือทั้งคลิปพร้อมกันในแต่ละรอบจนคมชัดขึ้นเรื่อยๆ

กลไกเบื้องหลังแบ่งเป็นสองจังหวะ จังหวะแรกเรียกว่า forward process คือค่อยๆ เติมสัญญาณรบกวนแบบ Gaussian ใส่ข้อมูลจริงทีละรอบจนข้อมูลนั้นแทบไม่เหลือร่องรอยเดิม กลายเป็นสัญญาณรบกวนล้วนๆ ส่วนจังหวะที่สองเรียกว่า reverse process คือฝึก neural network ให้เรียนรู้ย้อนกระบวนการนั้นกลับ นั่นคือค่อยๆ ทำนายและลบสัญญาณรบกวนออกทีละขั้นจนได้ข้อมูลใหม่ที่มีลักษณะทางสถิติใกล้เคียงกับข้อมูลที่ใช้เทรน งานวิจัยที่ทำให้เทคนิคนี้ใช้งานได้จริงในระดับคุณภาพสูงคือ Denoising Diffusion Probabilistic Models (DDPM) ปี 2020 โดย Jonathan Ho, Ajay Jain และ Pieter Abbeel จาก UC Berkeley ซึ่งรายงานว่าบนชุดข้อมูล CIFAR-10 แบบ unconditional ทำได้ Inception score 9.46 และ FID score 3.17 ซึ่งเป็นสถิติที่ดีที่สุดในตอนนั้น ส่วนการทดสอบอีกชุดหนึ่งบนภาพ LSUN ขนาด 256x256 รายงานว่าได้คุณภาพภาพใกล้เคียงกับ ProgressiveGAN ซึ่งเป็นเทคนิคคู่แข่งที่ใช้กันมาก่อนหน้า

คนทำงานจะเจอคำนี้เวลาใช้เครื่องมือสร้างภาพและวิดีโอด้วย AI เพราะ diffusion model คือกลไกแกนกลางที่อยู่เบื้องหลัง stable-diffusion ซึ่งมีสถาปัตยกรรมพื้นฐานเป็น latent diffusion model จากงานวิจัยของกลุ่ม CompVis มหาวิทยาลัย LMU Munich เช่นเดียวกับ sora ของ OpenAI ที่รายงานเทคนิคของ OpenAI เองเมื่อเดือนกุมภาพันธ์ 2024 อธิบาย Sora รุ่นแรกว่าเป็น diffusion transformer คือ denoising latent diffusion model ที่ใช้ transformer เป็นตัวลบสัญญาณรบกวน และ veo ของ Google DeepMind ที่ model card ของ Veo 3 จาก Google DeepMind เองระบุว่าใช้ latent diffusion โดยรันกระบวนการ diffusion กับ latent ของวิดีโอและเสียงไปพร้อมกัน ส่วน midjourney ซึ่งเป็นอีกเครื่องมือดังในกลุ่มสร้างภาพจากข้อความนั้น บริษัทไม่ได้เผยแพร่รายงานเทคนิคอย่างเป็นทางการแบบเดียวกับ Stable Diffusion หรือ Veo จึงไม่ควรฟันธงว่าใช้สถาปัตยกรรมเหมือนกันเป๊ะ ข้อควรระวังอีกอย่างคือการสร้างผลลัพธ์หนึ่งชิ้นด้วย diffusion model ต้องรันขั้นตอนขัดเกลาซ้ำหลายรอบกว่าจะได้ผลลัพธ์สุดท้าย ต่างจากการสร้างครั้งเดียวจบ แม้เทคนิคใหม่ๆ ในปัจจุบันจะช่วยลดจำนวนรอบลงได้มาก แต่หลักการพื้นฐานยังคงเป็นการทำซ้ำหลายครั้งอยู่ดี ซึ่งเป็นต้นทุนแฝงด้านเวลาและพลังประมวลผลที่มักถูกมองข้าม

ตัวอย่างจากบทสนทนาจริง

ฝ่ายจัดซื้อ: "เห็นในสไลด์ vendor เขียนว่าเครื่องมือสร้างภาพของเขาใช้ diffusion model เหมือน Stable Diffusion เลย แบบนี้แปลว่าคุณภาพเหมือนกันเป๊ะใช่ไหมคะ"

ทีม AI: "ไม่เป๊ะครับ diffusion model เป็นชื่อของกลุ่มเทคนิค ไม่ใช่ชื่อผลิตภัณฑ์ตัวเดียว เหมือนบอกว่ารถสองคันใช้เครื่องยนต์สันดาปภายในเหมือนกัน แต่ยี่ห้อ ขนาด และการปรับแต่งต่างกันได้มาก ต้องลองดูภาพตัวอย่างจริงกับเงื่อนไขการใช้งานของแต่ละเจ้า มากกว่าจะเชื่อแค่ชื่อเทคนิคที่ vendor อ้างมาครับ"

ระวังสับสนกับ

  • diffusion-language-model : diffusion model ที่คนพูดถึงกันทั่วไปใช้สร้างภาพและวิดีโอ ส่วน diffusion language model เอากลไกลบสัญญาณรบกวนแบบเดียวกันไปใช้สร้างข้อความแทน ซึ่งยังเป็นแนวทางเฉพาะกลุ่มที่เพิ่งเริ่มเทียบชั้นโมเดลภาษากระแสหลักได้ ไม่ใช่วิธีมาตรฐานของ llm ทั่วไปที่ใช้กันอยู่ทุกวันนี้
  • transformer : transformer คือสถาปัตยกรรม neural network ที่ใช้กลไก attention เป็นแกน ส่วน diffusion model คือวิธีสร้างผลลัพธ์ด้วยการค่อยๆ ลบสัญญาณรบกวน สองคำนี้อยู่คนละชั้นกันและไม่ได้ขัดกันเอง โมเดลภาษาส่วนใหญ่เอา transformer ไปใช้แบบ autoregressive คือทายผลลัพธ์ทีละหน่วยเรียงลำดับ ขณะที่ระบบอย่าง Sora เอา transformer ไปทำหน้าที่ลบสัญญาณรบกวนใน diffusion จนเรียกกันว่า diffusion transformer ซึ่งเป็นจุดที่ทำให้หลายคนสับสน
  • stable-diffusion : diffusion model คือชื่อของกลุ่มเทคนิค ส่วน Stable Diffusion คือชื่อผลิตภัณฑ์ตัวหนึ่งที่สร้างขึ้นด้วยเทคนิคนี้ เหมือนสับสนระหว่างคำว่าเครื่องยนต์เบนซินกับชื่อรถยี่ห้อหนึ่งที่ใช้เครื่องยนต์แบบนั้น

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Diffusion language modelEffort