Dictionary · พื้นฐาน AI · 5 / 291

Computer vision

สาขาที่ทำให้คอมพิวเตอร์ดึงความหมายออกจากภาพและวิดีโอได้ ใช้ตั้งแต่ตรวจของเสียในโรงงานไปจนถึงอ่านตัวหนังสือจากเอกสาร

Computer vision คือสาขาที่ทำให้คอมพิวเตอร์ดึงข้อมูลที่มีความหมายออกจากภาพนิ่ง วิดีโอ และข้อมูลภาพอื่นได้ นิยามที่ใช้กันคือวิธีการสำหรับรับ ประมวลผล วิเคราะห์ และทำความเข้าใจภาพดิจิทัล เพื่อผลิตข้อมูลเชิงตัวเลขหรือเชิงสัญลักษณ์ออกมา พูดง่ายๆ คือแปลงสิ่งที่กล้องเห็นให้กลายเป็นข้อมูลที่โปรแกรมอื่นเอาไปใช้ต่อได้

งานหลักที่ทำกันแบ่งได้สามกลุ่ม กลุ่มแรกคือการจำแนกประเภท คือบอกว่าในภาพมีอะไรอยู่ เช่น แยกชนิดสินค้าหรือแยกประเภทยานพาหนะ กลุ่มที่สองคือการตรวจจับวัตถุ คือระบุตำแหน่งของสิ่งที่สนใจในภาพด้วย ซึ่งจำเป็นสำหรับงานอย่างการหาสิ่งกีดขวางในระบบขับขี่อัตโนมัติหรือการชี้จุดผิดปกติในภาพทางการแพทย์ กลุ่มที่สามคือการอ่านตัวอักษรจากภาพหรือ ocr ซึ่งแปลงข้อความที่พิมพ์หรือเขียนด้วยมือให้กลายเป็นข้อความดิจิทัลที่แก้ไขได้

การใช้งานจริงในภาคธุรกิจมีตัวอย่างชัดเจนหลายด้าน ด้านการแพทย์ใช้วิเคราะห์ภาพถ่ายทางการแพทย์เพื่อช่วยตรวจหาความผิดปกติ ด้านการผลิตใช้ควบคุมคุณภาพด้วยการหาตำหนิบนสายการผลิตอัตโนมัติ ด้านการเกษตรใช้ติดตามโรคพืชและคาดการณ์ผลผลิตจากภาพถ่ายดาวเทียม ด้านความปลอดภัยใช้แจ้งเตือนการเข้าถึงพื้นที่ที่ไม่ได้รับอนุญาตและตรวจว่าพนักงานสวมอุปกรณ์นิรภัยครบหรือไม่ สำหรับองค์กรไทยโดยเฉพาะภาคการผลิตและเกษตร นี่มักเป็นจุดที่ AI ให้ผลตอบแทนชัดเจนที่สุดและวัดง่ายที่สุด เพราะเปรียบเทียบกับอัตราการตรวจพบของคนได้ตรงๆ ปัจจุบันความสามารถนี้ถูกรวมเข้าไปในโมเดลแบบ multimodal ด้วย ทำให้ถามเป็นภาษาคนเกี่ยวกับรูปได้เลยโดยไม่ต้องสร้างระบบเฉพาะทาง แม้ความแม่นยำในงานเฉพาะทางจริงจังมักยังสู้ระบบที่สร้างมาเพื่องานนั้นโดยเฉพาะไม่ได้

ตัวอย่างจากบทสนทนาจริง

ผู้จัดการโรงงาน: "เราจ้างคนตรวจตำหนิบนสายพานสามกะครับ อยากรู้ว่าเอา AI มาช่วยได้ไหมและจะเริ่มยังไง"

วิศวกร: "งานนี้เป็น computer vision แบบตรงตัวเลยครับ และเป็นหนึ่งในงานที่วัดผลง่ายที่สุด สิ่งที่ต้องเตรียมคือภาพตัวอย่างของทั้งของดีและของเสีย ยิ่งของเสียหลากหลายแบบยิ่งดี ผมแนะนำให้เริ่มจากตำหนิประเภทเดียวที่พบบ่อยที่สุดก่อน แล้ววัดเทียบกับคนตรวจว่าจับได้กี่เปอร์เซ็นต์และแจ้งผิดกี่เปอร์เซ็นต์ ถ้าตัวเลขดีค่อยขยายไปประเภทอื่น อย่าเริ่มด้วยการหวังให้มันจับได้ทุกแบบตั้งแต่แรกครับ"

ระวังสับสนกับ

  • multimodal : multimodal หมายถึงโมเดลที่รับข้อมูลได้หลายรูปแบบรวมถึงภาพ ซึ่งเป็นความสามารถทั่วไปของโมเดลใหญ่ยุคนี้ ส่วน computer vision เป็นสาขาเฉพาะที่มีเทคนิคและระบบที่สร้างมาเพื่องานภาพโดยเฉพาะ ซึ่งมักแม่นกว่าในงานเฉพาะทาง
  • text-to-image : text-to-image คือการสร้างภาพขึ้นมาใหม่จากคำบรรยาย ซึ่งเป็นทิศทางออก ส่วน computer vision คือการเข้าใจภาพที่มีอยู่แล้ว ซึ่งเป็นทิศทางเข้า
  • embodied-ai : embodied AI คือ AI ที่มีร่างกายและลงมือในโลกจริง ซึ่งต้องใช้ computer vision เป็นประสาทรับรู้ แต่ยังต้องมีการวางแผนและการสั่งการเคลื่อนไหวเพิ่มด้วย

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

ChatbotCross-Lingual Consistency Gap