Computer vision
สาขาที่ทำให้คอมพิวเตอร์ดึงความหมายออกจากภาพและวิดีโอได้ ใช้ตั้งแต่ตรวจของเสียในโรงงานไปจนถึงอ่านตัวหนังสือจากเอกสาร
Computer vision คือสาขาที่ทำให้คอมพิวเตอร์ดึงข้อมูลที่มีความหมายออกจากภาพนิ่ง วิดีโอ และข้อมูลภาพอื่นได้ นิยามที่ใช้กันคือวิธีการสำหรับรับ ประมวลผล วิเคราะห์ และทำความเข้าใจภาพดิจิทัล เพื่อผลิตข้อมูลเชิงตัวเลขหรือเชิงสัญลักษณ์ออกมา พูดง่ายๆ คือแปลงสิ่งที่กล้องเห็นให้กลายเป็นข้อมูลที่โปรแกรมอื่นเอาไปใช้ต่อได้
งานหลักที่ทำกันแบ่งได้สามกลุ่ม กลุ่มแรกคือการจำแนกประเภท คือบอกว่าในภาพมีอะไรอยู่ เช่น แยกชนิดสินค้าหรือแยกประเภทยานพาหนะ กลุ่มที่สองคือการตรวจจับวัตถุ คือระบุตำแหน่งของสิ่งที่สนใจในภาพด้วย ซึ่งจำเป็นสำหรับงานอย่างการหาสิ่งกีดขวางในระบบขับขี่อัตโนมัติหรือการชี้จุดผิดปกติในภาพทางการแพทย์ กลุ่มที่สามคือการอ่านตัวอักษรจากภาพหรือ ocr ซึ่งแปลงข้อความที่พิมพ์หรือเขียนด้วยมือให้กลายเป็นข้อความดิจิทัลที่แก้ไขได้
การใช้งานจริงในภาคธุรกิจมีตัวอย่างชัดเจนหลายด้าน ด้านการแพทย์ใช้วิเคราะห์ภาพถ่ายทางการแพทย์เพื่อช่วยตรวจหาความผิดปกติ ด้านการผลิตใช้ควบคุมคุณภาพด้วยการหาตำหนิบนสายการผลิตอัตโนมัติ ด้านการเกษตรใช้ติดตามโรคพืชและคาดการณ์ผลผลิตจากภาพถ่ายดาวเทียม ด้านความปลอดภัยใช้แจ้งเตือนการเข้าถึงพื้นที่ที่ไม่ได้รับอนุญาตและตรวจว่าพนักงานสวมอุปกรณ์นิรภัยครบหรือไม่ สำหรับองค์กรไทยโดยเฉพาะภาคการผลิตและเกษตร นี่มักเป็นจุดที่ AI ให้ผลตอบแทนชัดเจนที่สุดและวัดง่ายที่สุด เพราะเปรียบเทียบกับอัตราการตรวจพบของคนได้ตรงๆ ปัจจุบันความสามารถนี้ถูกรวมเข้าไปในโมเดลแบบ multimodal ด้วย ทำให้ถามเป็นภาษาคนเกี่ยวกับรูปได้เลยโดยไม่ต้องสร้างระบบเฉพาะทาง แม้ความแม่นยำในงานเฉพาะทางจริงจังมักยังสู้ระบบที่สร้างมาเพื่องานนั้นโดยเฉพาะไม่ได้
ตัวอย่างจากบทสนทนาจริง
ผู้จัดการโรงงาน: "เราจ้างคนตรวจตำหนิบนสายพานสามกะครับ อยากรู้ว่าเอา AI มาช่วยได้ไหมและจะเริ่มยังไง"
วิศวกร: "งานนี้เป็น computer vision แบบตรงตัวเลยครับ และเป็นหนึ่งในงานที่วัดผลง่ายที่สุด สิ่งที่ต้องเตรียมคือภาพตัวอย่างของทั้งของดีและของเสีย ยิ่งของเสียหลากหลายแบบยิ่งดี ผมแนะนำให้เริ่มจากตำหนิประเภทเดียวที่พบบ่อยที่สุดก่อน แล้ววัดเทียบกับคนตรวจว่าจับได้กี่เปอร์เซ็นต์และแจ้งผิดกี่เปอร์เซ็นต์ ถ้าตัวเลขดีค่อยขยายไปประเภทอื่น อย่าเริ่มด้วยการหวังให้มันจับได้ทุกแบบตั้งแต่แรกครับ"
ระวังสับสนกับ
- multimodal : multimodal หมายถึงโมเดลที่รับข้อมูลได้หลายรูปแบบรวมถึงภาพ ซึ่งเป็นความสามารถทั่วไปของโมเดลใหญ่ยุคนี้ ส่วน computer vision เป็นสาขาเฉพาะที่มีเทคนิคและระบบที่สร้างมาเพื่องานภาพโดยเฉพาะ ซึ่งมักแม่นกว่าในงานเฉพาะทาง
- text-to-image : text-to-image คือการสร้างภาพขึ้นมาใหม่จากคำบรรยาย ซึ่งเป็นทิศทางออก ส่วน computer vision คือการเข้าใจภาพที่มีอยู่แล้ว ซึ่งเป็นทิศทางเข้า
- embodied-ai : embodied AI คือ AI ที่มีร่างกายและลงมือในโลกจริง ซึ่งต้องใช้ computer vision เป็นประสาทรับรู้ แต่ยังต้องมีการวางแผนและการสั่งการเคลื่อนไหวเพิ่มด้วย
Sources (2)
- https://en.wikipedia.org/wiki/Computer_vision fetched 2026-08-06
- https://aws.amazon.com/what-is/computer-vision/ fetched 2026-08-06
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย