Dictionary · โมเดลและผู้เล่นหลัก · 203 / 291

Stable Diffusion

โมเดล AI สร้างภาพจากข้อความที่เปิด weights ให้ดาวน์โหลดไปรันบนเครื่องตัวเองได้ เปิดตัวปี 2022 จุดกระแสภาพ AI ที่ใครก็เข้าถึงและดัดแปลงได้

Stable Diffusion คือ model AI สร้างภาพจากข้อความ (text-to-image) ที่เปิดตัวเมื่อสิงหาคม 2022 พัฒนาจากงานวิจัยของกลุ่ม CompVis แห่งมหาวิทยาลัย LMU Munich ในเยอรมนี ร่วมกับบริษัท Runway และ Stability AI โดยมี LAION องค์กรไม่แสวงกำไรจากเยอรมนีเป็นผู้รวบรวม dataset สำหรับ training : ชุดข้อมูล LAION-5B ที่มีคู่ภาพกับข้อความราว 5 พันล้านคู่ซึ่งเก็บมาจากเว็บ จุดที่ทำให้มันเป็นหมุดหมายของ generative-ai ฝั่งภาพคือการเปิดทั้งโค้ดและ weights ให้สาธารณะ (open-weights) ต่างจากโมเดลยุคเดียวกันอย่าง DALL-E และ midjourney ที่ใช้ได้ผ่านบริการ cloud เท่านั้น

วิธีทำงานของมันคือสถาปัตยกรรมที่เรียกว่า latent diffusion model : เป็น diffusion-model ที่ไม่ได้ทำงานบน pixel ตรงๆ แต่ทำงานใน latent space ที่ถูกบีบให้เล็กลงก่อน ประกอบด้วยสามชิ้นส่วนหลัก คือ VAE ที่บีบอัดภาพลงพื้นที่ latent · U-Net ที่ทำหน้าที่ลบ noise ออกทีละขั้น · และ text encoder (ใช้โมเดล CLIP) ที่แปลง prompt ของเราเป็นตัวเลขเพื่อกำกับทิศทางการลบ noise ภาพที่ได้จึงเกิดจากการเริ่มต้นด้วย noise ล้วนๆ แล้วค่อยๆ เกลาทีละรอบจนกลายเป็นภาพตามคำสั่ง การทำงานใน latent space ทำให้โมเดลเบาพอจะรันบน gpu ระดับผู้ใช้ทั่วไป : เวอร์ชันที่ optimize แล้วใช้ VRAM เพียงราว 2.4 GB

เหตุผลที่คนทำงานยุค AI ควรรู้จักคำนี้ : Stable Diffusion คือโมเดลที่พิสูจน์ว่า "ภาพ AI ที่รันเองได้ในเครื่องตัวเอง" เป็นไปได้จริง องค์กรจึงเอาไปใช้แบบข้อมูลไม่ต้องออกนอกบริษัท และทำ fine-tuning ให้ได้สไตล์เฉพาะของแบรนด์ได้ มีเวอร์ชันพัฒนาต่อเนื่อง : 1.5 (ตุลาคม 2022) · SDXL 1.0 (กรกฎาคม 2023 ขนาด 3.5 พันล้าน parameters สร้างภาพ 1024x1024 ได้โดยตรง) · 3.0 (2024) และ 3.5 (ตุลาคม 2024) ซึ่งใช้ Stability AI Community License ที่ธุรกิจรายได้เกิน 1 ล้านดอลลาร์ต่อปีต้องซื้อ Enterprise License เพิ่ม ปัจจุบัน Stability AI ต่อยอดจากภาพไปถึงโมเดลเสียง (Stable Audio) วิดีโอ และ 3D ด้วย แต่ความเปิดกว้างนี้ก็มาพร้อมข้อถกเถียงเรื่อง ai-copyright : กลุ่มศิลปินยื่นฟ้องว่าโมเดลถูก train จากภาพหลายพันล้านภาพที่เก็บจากเว็บโดยไม่ได้รับความยินยอม และ Getty Images ฟ้อง Stability AI ในสหราชอาณาจักร ซึ่งผลเมื่อพฤศจิกายน 2025 คือ Getty แพ้คดีเป็นส่วนใหญ่

ตัวอย่างจากบทสนทนาจริง

ฝ่ายการตลาด: "เห็นทีมดีไซน์ตั้งงบซื้อการ์ดจอแรงๆ มาทำภาพ AI แล้วงง ทำไมไม่สมัคร Midjourney เหมือนทีมอื่น จ่ายรายเดือนก็จบแล้วไม่ใช่เหรอ"

ทีมดีไซน์: "คนละเงื่อนไขกันครับ Midjourney ต้องส่ง prompt ขึ้น cloud ของเขาอย่างเดียว แต่แคมเปญนี้มีภาพสินค้าที่ยังไม่เปิดตัว เราเลยใช้ Stable Diffusion รันในเครื่องของบริษัทเอง ภาพไม่หลุดออกไปไหน แถมเอาไป fine-tune ให้ออกภาพตามแนวแบรนด์เราได้ด้วย การ์ดจอคือจ่ายครั้งเดียว แลกกับที่ไม่ต้องจ่าย subscription รายเดือน"

ระวังสับสนกับ

  • diffusion-model : ชื่อของเทคนิค ไม่ใช่ชื่อผลิตภัณฑ์ · Stable Diffusion เป็นโมเดลตัวหนึ่งที่สร้างด้วยเทคนิค diffusion และมีโมเดลอีกหลายตัวที่ใช้เทคนิคเดียวกัน
  • midjourney : บริการสร้างภาพแบบปิดที่ใช้ผ่าน cloud เท่านั้น ไม่เปิด weights ให้ดาวน์โหลด · ขณะที่ Stable Diffusion เปิด weights ให้เอาไปรันบนเครื่องตัวเองและดัดแปลงต่อได้

ดูคำนี้ใน Knowledge Atlas →

Sources (2)

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

SoraSuno