Dictionary · โมเดลและผู้เล่นหลัก · 228 / 321

Upscaling

การขยายภาพหรือวิดีโอให้มีจำนวน pixel มากกว่าต้นฉบับ วิธีดั้งเดิมคำนวณจาก pixel รอบข้าง ส่วนรุ่น generative ให้ model เดารายละเอียดที่หายไปมาเติมเอง

Upscaling คือการขยายภาพหรือวิดีโอให้มีจำนวน pixel มากกว่าไฟล์ต้นฉบับ เอกสาร Fundamentals of Resizing Imagery ของ SWGDE ซึ่งเป็นกลุ่มทำงานด้านหลักฐานดิจิทัล อธิบายพื้นฐานไว้ว่าทางเดียวที่จะขยายภาพได้คือเติม pixel เข้าไป และ pixel ที่เติมเข้าไปนั้นสร้างขึ้นแบบสุ่มไม่ได้ วิธีดั้งเดิมจึงใช้ interpolation คือคำนวณค่าของ pixel ใหม่จาก pixel ที่อยู่รอบข้าง เช่น nearest neighbor ที่คัดลอกค่าของ pixel ข้างเคียงมาใส่ตรงๆ, bilinear ที่ใช้ข้อมูลจาก pixel ข้างเคียง 4 ตัว และ bicubic ที่ใช้ 16 ตัว เอกสารฉบับเดียวกันสรุปว่าภาพที่ได้จะไม่มีข้อมูลที่ไม่ได้มาจากต้นฉบับ ส่วนสิ่งที่คนเรียกกันว่า AI upscaling เปลี่ยนวิธีคิดตรงจุดนี้ เพราะรุ่นที่เป็น generative ใช้ model ตระกูลเดียวกับที่วาดภาพจากข้อความอย่าง text-to-image และ diffusion-model มาเดาว่ารายละเอียดที่หายไปน่าจะหน้าตาแบบไหน แล้ววาดเติมลงไปจริงๆ

บริการที่ใช้งานจริงวางตัวเลือกไว้คนละจุดบนเส้นระหว่างรักษาต้นฉบับกับแต่งเติม หน้าเอกสารของ amazon-bedrock ระบุว่า Stable Image Conservative Upscale เพิ่มความละเอียดโดยรักษารายละเอียดและสไตล์ของภาพต้นฉบับไว้ ขณะที่ Stable Image Creative Upscale เขียนไว้ตรงๆ ว่าขยายภาพพร้อมเติมรายละเอียดเชิงสร้างสรรค์และยกระดับคุณภาพของภาพที่มองเห็น ทั้งสองตัวมาจาก Stability AI ซึ่งหน้าแนะนำผลิตภัณฑ์ของบริษัทวางเครื่องมือ upscale ไว้สามแบบคือ Creative, Conservative และ Fast อยู่หน้าเดียวกับ model สร้างภาพตระกูล stable-diffusion ฝั่ง Google เอกสาร vertex-ai ของ Imagen ระบุว่า model ชื่อ imagen-4.0-upscale-preview รับตัวคูณได้สามค่าคือ x2, x3 และ x4 โดยความละเอียดของภาพผลลัพธ์หลังคูณแล้วต้องไม่เกิน 17 megapixel ส่วนคู่มือของ Topaz Gigapixel อธิบาย model ชื่อ Redefine ว่าเป็น generative model ที่ออกแบบมาเพื่อเติมรายละเอียดใหม่และประกอบโครงสร้างขึ้นใหม่เมื่อข้อมูลในภาพต้นฉบับขาดหายหรือเสียหาย โดยแนะนำให้ประมวลผลบน cloud เมื่อใช้ Redefine กับภาพที่ใหญ่กว่า 1 megapixel ขณะที่ model ชื่อ Recover ในคู่มือเดียวกันระบุว่าออกแบบมาให้ใช้กับภาพขนาดไม่เกิน 1 megapixel

คนทำงานเจอคำนี้ตอนต้องเอาภาพเก่า ภาพจากกล้องวงจรปิด หรือภาพที่ลูกค้าส่งมาแบบเล็กจิ๋ว ไปใช้กับงานที่ต้องการความละเอียดสูงอย่างป้ายหรือสิ่งพิมพ์ ข้อควรระวังคือรายละเอียดที่โผล่ขึ้นมาใหม่เป็นการคาดเดาของ model ไม่ใช่ของที่ซ่อนอยู่ในต้นฉบับแล้วถูกดึงออกมา เอกสารของ SWGDE เขียนไว้ว่าความเข้าใจผิดที่พบบ่อยคือคิดว่าการขยายภาพจะเพิ่มรายละเอียด ทั้งที่การขยายวัตถุอาจช่วยให้เรามองเห็นรายละเอียดที่มีอยู่ได้ชัดขึ้นก็จริง แต่ตัวกระบวนการขยายไม่ได้เพิ่มรายละเอียดที่ไม่มีอยู่ในบันทึกต้นฉบับ และยังเตือนว่าผู้ปฏิบัติงานควรระมัดระวังเมื่อใช้วิธี interpolation แบบใหม่ เพราะเป็นเรื่องยากที่จะระบุว่าภาพผ่านกระบวนการอะไรมาบ้างและทำซ้ำขั้นตอนเดิมให้แม่นยำ เอกสารฉบับเดียวกันยกกรณีในศาลสหรัฐเมื่อปี 2021 ที่ฝ่ายหนึ่งพยายามฉายภาพโดยใช้ฟีเจอร์ pinch-to-zoom บน iPad แล้วอีกฝ่ายคัดค้านว่ายังไม่ได้อธิบายวิธีที่ใช้ให้คณะลูกขุนฟัง ศาลรับคำคัดค้าน และภาพนั้นจะรับฟังได้ก็ต่อเมื่ออธิบายวิธี interpolation ที่ใช้ได้ ในทางปฏิบัติแปลว่างานโฆษณาหรือภาพประกอบใช้ได้สบาย แต่ถ้าภาพจะถูกใช้เป็นหลักฐานหรือใช้ชี้ตัวคน ให้เก็บไฟล์ต้นฉบับไว้ด้วยและระบุให้ชัดว่าไฟล์ไหนผ่านเครื่องมืออะไรมา ซึ่งเป็นเหตุผลที่แนวทาง content-provenance เข้ามามีบทบาท และถ้าเอาภาพที่ขยายแล้วไปเข้า ocr เพื่ออ่านป้ายทะเบียนหรือเลขในเอกสาร ตัวอักษรที่อ่านได้อาจมาจากรายละเอียดที่ model เติมเข้ามา ไม่ใช่จากสิ่งที่กล้องบันทึกไว้

ตัวอย่างจากบทสนทนาจริง

หัวหน้าฝ่ายอาคาร: กล้องวงจรปิดหน้าลิฟต์จับภาพคนที่หยิบของไปได้ แต่หน้าเบลอจนดูไม่ออก น้องในทีมบอกว่ามี AI ขยายภาพให้ชัดขึ้นได้ ถ้าขยายแล้วแนบเข้าเรื่องร้องเรียนเลยได้ไหมครับ

ฝ่าย IT: ขยายได้ครับ แต่ความชัดที่เพิ่มขึ้นไม่ได้แปลว่าเราได้ข้อมูลใหม่จากกล้อง เครื่องมือพวกนี้เดาว่าใบหน้าตรงนั้นน่าจะมีรายละเอียดแบบไหนแล้ววาดเติมลงไป ถ้าเอาไปใช้ตัดสินว่าเป็นใคร เท่ากับเราตัดสินจากสิ่งที่ model แต่งขึ้น

หัวหน้าฝ่ายอาคาร: งั้นควรทำยังไงดีครับ

ฝ่าย IT: แนบไฟล์ต้นฉบับไปด้วยครับ แล้วเขียนกำกับว่าอีกไฟล์ผ่านการขยายด้วยเครื่องมืออะไร รุ่นไหน คนที่มาอ่านทีหลังจะได้แยกออกว่าอันไหนคือสิ่งที่กล้องบันทึกจริง

ระวังสับสนกับ

  • inpainting : inpainting คือการเลือกบางส่วนของภาพแล้วให้ model วาดของใหม่ทับลงไปตรงนั้น ส่วน upscaling ตั้งใจรักษาองค์ประกอบเดิมไว้แล้วเพิ่มจำนวน pixel ทั้งภาพ จุดร่วมของทั้งสองงานคือสิ่งที่เห็นในผลลัพธ์บางส่วนไม่ได้มาจากต้นฉบับ
  • deepfake : deepfake ตั้งใจทำให้คนเชื่อว่าคนจริงพูดหรือทำสิ่งที่เขาไม่ได้ทำ ส่วน upscaling ไม่ได้ตั้งใจหลอกใคร แต่ผลลัพธ์มีจุดร่วมกันคือใบหน้าที่คมขึ้นหลังขยายเป็นสิ่งที่ model เติมเข้ามา จึงไม่ควรใช้ภาพนั้นชี้ตัวบุคคล
  • hallucination : hallucination เป็นคำที่ใช้กับ model ภาษาที่ตอบข้อมูลซึ่งไม่มีอยู่จริงออกมาอย่างมั่นใจ ส่วนรายละเอียดที่ upscaling เติมผิดไปจากของจริงเป็นอาการทำนองเดียวกัน ต่างกันที่ครั้งนี้ออกมาเป็นภาพ ไม่ใช่ข้อความ

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

SunoVeo