Veo
โมเดล AI สร้างวิดีโอของ Google DeepMind ที่เปลี่ยนข้อความหรือภาพนิ่งให้เป็นคลิปวิดีโอพร้อมเสียงพูดและเสียงประกอบในตัว ใช้งานผ่านแอป Gemini ได้
Veo คือตระกูลmodelสร้างวิดีโอ (video generation model) ของ google-deepmind วิธีใช้คือพิมพ์ prompt บรรยายฉากที่อยากได้เป็นข้อความ หรือใส่ภาพนิ่งเป็นจุดตั้งต้น (image-to-video) แล้วโมเดลจะสร้างคลิปวิดีโอออกมาให้ จุดที่ทำให้ Veo ดังเป็นพลุแตกคือ Veo 3 (พฤษภาคม 2025) ที่สร้าง "เสียง" ได้เองในตัว ทั้งเสียงพูดของตัวละคร sound effect และเสียงบรรยากาศ จากเดิมที่วิดีโอ AI ยุคก่อนหน้าส่วนใหญ่เป็นภาพเงียบ ต้องไปหาเสียงมาใส่ทีหลัง
ไทม์ไลน์คร่าวๆ: Veo รุ่นแรกเปิดตัวที่งาน Google I/O เดือนพฤษภาคม 2024 · Veo 2 ตามมาธันวาคม 2024 พร้อมความละเอียดระดับ 4K และความเข้าใจฟิสิกส์ที่ดีขึ้น · Veo 3 พฤษภาคม 2025 เพิ่มเสียงในตัว · และ Veo 3.1 (ตุลาคม 2025) คือเวอร์ชันล่าสุด ความสามารถปัจจุบันคือสร้างคลิปยาวราว 8 วินาทีต่อครั้งที่ 1080p ถึง 4K คุมมุมกล้องได้ คุมตัวละครให้หน้าตาเดิมข้ามฉากด้วยภาพอ้างอิง ต่อฉากให้ยาวขึ้น รวมถึงแทรกหรือลบวัตถุในฉากได้ ช่องทางใช้งานมีทั้งแอป gemini สำหรับคนทั่วไป เครื่องมือทำหนังชื่อ Flow, Google AI Studio และ Gemini API สำหรับนักพัฒนา โดยวิดีโอทุกคลิปถูกฝังลายน้ำดิจิทัล SynthID (watermarking) ไว้ให้ตรวจสอบย้อนหลังได้ว่าสร้างด้วย AI
คนทำงานยุค AI ควรรู้จัก Veo เพราะมันเปลี่ยนต้นทุนของ "วิดีโอ" ไปคนละโลก: งานที่เคยต้องมีกองถ่าย ตอนนี้ฝ่ายการตลาดหรือฝ่าย training ทำ draft ได้จากโต๊ะทำงานในไม่กี่นาที แต่เหรียญอีกด้านก็ชัดเจน คือความเสี่ยงเรื่อง deepfake และ misinformation รวมถึงกระแส ai-slop ที่คลิปคุณภาพต่ำถล่มโซเชียล ช่วงกลางปี 2025 มีรายงานว่าคลิปเหยียดเชื้อชาติที่สร้างด้วย Veo 3 หลุดไประบาดบน TikTok ซึ่งสะท้อนว่า guardrails ยังตามการใช้งานจริงไม่ทัน ฝั่งคู่แข่งโดยตรงคือ sora ของ openai และเครื่องมือสายโปรดักชันอย่าง runway
ตัวอย่างจากบทสนทนาจริง
ฝ่ายการตลาด: "อยากได้วิดีโอโปรโมทงานสัมมนายาว 2 นาที สั่ง Veo รอบเดียวจบเลยได้ไหมคะ"
ทีม AI: "Veo สร้างเป็นคลิปสั้นราว 8 วินาทีต่อรอบครับ ถ้าอยากได้ 2 นาทีต้องวางเป็น storyboard แล้วสั่งทีละฉาก จากนั้นไปเรียงต่อกันในเครื่องมืออย่าง Flow ซึ่งช่วยคุมให้พรีเซนเตอร์หน้าตาเดิมทุกฉากด้วยภาพอ้างอิงได้ อีกอย่างคือคลิปที่ได้จะมีลายน้ำ SynthID ฝังอยู่ ควรแจ้งในงานด้วยว่าเป็นวิดีโอที่สร้างด้วย AI"
ระวังสับสนกับ
- sora : โมเดลสร้างวิดีโอเหมือนกันแต่คนละค่าย · Sora เป็นของ OpenAI ส่วน Veo เป็นของ Google DeepMind คนมักเรียกสลับกันเพราะเปิดตัวไล่เลี่ยกันและทำงานคล้ายกัน
- gemini / Flow : Gemini คือโมเดลแชตและเป็น "หน้าร้าน" ที่เราสั่ง Veo ผ่านได้ ส่วน Flow คือเครื่องมือตัดต่อทำหนังที่มี Veo ทำงานอยู่ข้างใน · ทั้งสองอย่างไม่ใช่ตัวโมเดลวิดีโอเอง ตัวที่สร้างวิดีโอจริงๆ คือ Veo
- synthesia : เป็นวิดีโอ AI เหมือนกันแต่คนละแนว Veo สร้างฉากใหม่จากข้อความหรือภาพนิ่ง ส่วน Synthesia เน้นคนพูดหน้ากล้องแบบทำซ้ำได้สำหรับงานสื่อสารองค์กร
Sources (2)
- https://deepmind.google/models/veo/ fetched 2026-08-01
- https://en.wikipedia.org/wiki/Veo_(text-to-video_model) fetched 2026-08-01
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย