Dictionary · พื้นฐาน AI · 7 / 291

Dataset

ชุดข้อมูลที่รวบรวมไว้เป็นระเบียบสำหรับเอาไปวิเคราะห์หรือเทรนโมเดล คุณภาพของมันกำหนดเพดานของสิ่งที่โมเดลจะทำได้

Dataset หรือชุดข้อมูล คือกลุ่มข้อมูลที่รวบรวมไว้อย่างเป็นระเบียบเพื่อเอาไปใช้งานต่อ รูปแบบที่พบบ่อยที่สุดคือตาราง ซึ่งแต่ละคอลัมน์แทนตัวแปรหนึ่งตัว เช่น ส่วนสูงหรือน้ำหนัก และแต่ละแถวแทนหนึ่งรายการหรือหนึ่งหน่วยที่เก็บข้อมูล อภิธานศัพท์ด้าน machine learning นิยามไว้กระชับกว่านั้นว่าเป็นการรวบรวมข้อมูลดิบซึ่งโดยทั่วไปจัดอยู่ในรูปสเปรดชีตหรือไฟล์ CSV แต่ในทางปฏิบัติ dataset ไม่จำเป็นต้องเป็นตารางเสมอไป อาจเป็นกองรูปภาพ ไฟล์เสียง หรือเอกสารข้อความจำนวนมากก็ได้

ในบริบทของการสร้าง AI ชุดข้อมูลถูกแบ่งใช้งานเป็นส่วนๆ ส่วนที่ใช้สอนโมเดลเรียกว่าชุดเทรน ส่วนที่กันไว้ทดสอบว่าโมเดลทำงานได้จริงกับข้อมูลที่ไม่เคยเห็นเรียกว่าชุดทดสอบ การแยกสองส่วนนี้ให้ขาดจากกันเป็นเรื่องสำคัญมาก เพราะถ้าข้อมูลที่ใช้ทดสอบรั่วไปอยู่ในชุดเทรน คะแนนที่ได้จะสูงเกินจริงและไม่ได้บอกอะไรเลยว่าโมเดลใช้งานได้จริงหรือไม่ ปัญหานี้เป็นสาเหตุหลักอย่างหนึ่งที่ทำให้คะแนน benchmark ของโมเดลต่างๆ ต้องอ่านด้วยความระมัดระวัง

สำหรับองค์กรไทยที่กำลังคิดจะเอาข้อมูลของตัวเองไปทำอะไรกับ AI สิ่งที่ควรเข้าใจก่อนคือคุณภาพของชุดข้อมูลเป็นตัวกำหนดเพดานของผลลัพธ์ ไม่ว่าจะใช้โมเดลดีแค่ไหน ถ้าข้อมูลที่ป้อนเข้าไปไม่สม่ำเสมอ ติดป้ายคำตอบผิดจนใช้เป็น ground-truth ไม่ได้ หรือไม่ครอบคลุมกรณีที่เจอจริง ผลที่ได้ก็จะสะท้อนความบกพร่องนั้นออกมา ประเด็นที่ต้องคิดคู่กันเสมอคือเรื่องกฎหมาย ถ้าชุดข้อมูลมีข้อมูลส่วนบุคคลอยู่ การเอาไปใช้เทรนหรือส่งให้บริการภายนอกประมวลผลต้องมีฐานทางกฎหมายรองรับตามกติกาของ pdpa และเมื่อสัดส่วนเนื้อหาที่ AI เขียนบนอินเทอร์เน็ตเพิ่มขึ้น การรู้ว่าข้อมูลในชุดของเรามาจากคนหรือจากเครื่องก็กลายเป็นคำถามที่ต้องตอบได้ด้วย

ตัวอย่างจากบทสนทนาจริง

ผู้จัดการ: "เรามีข้อมูลลูกค้าสะสมสิบปี น่าจะเอามาเทรน AI ให้ทำนายว่าใครจะเลิกใช้บริการได้เลยใช่ไหมครับ"

นักวิทยาศาสตร์ข้อมูล: "ต้องดูสภาพข้อมูลก่อนครับ สิบปีฟังดูเยอะแต่คำถามคือช่วงไหนที่วิธีเก็บข้อมูลยังเหมือนกัน ถ้าเราเปลี่ยนระบบเมื่อสี่ปีก่อน ข้อมูลก่อนหน้านั้นอาจใช้ร่วมกันไม่ได้ อีกข้อคือเราต้องมีตัวอย่างของคนที่เลิกใช้จริงมากพอ ไม่ใช่แค่คนที่ยังอยู่ และต้องแยกชุดทดสอบออกมาให้ขาด ห้ามเอาไปปนกับชุดเทรน ไม่งั้นตัวเลขจะสวยแต่ใช้จริงไม่ได้ ขอเวลาสำรวจข้อมูลก่อนสองสัปดาห์แล้วผมจะบอกได้ว่าทำได้แค่ไหนครับ"

ระวังสับสนกับ

  • training : training คือกระบวนการที่โมเดลเรียนรู้จากข้อมูล ส่วน dataset คือตัวข้อมูลที่ใช้ในกระบวนการนั้น อันหนึ่งเป็นกิจกรรม อีกอันเป็นวัตถุดิบ
  • synthetic-data : synthetic data คือข้อมูลที่สร้างขึ้นมาเองแทนการเก็บจากของจริง ซึ่งเป็นชนิดหนึ่งของ dataset ที่มีข้อดีด้านความเป็นส่วนตัวแต่มีความเสี่ยงเรื่องคุณภาพถ้าใช้มากเกินไป
  • benchmark : benchmark คือชุดข้อสอบมาตรฐานที่ใช้เทียบความสามารถระหว่างโมเดล ซึ่งก็เป็น dataset ชนิดหนึ่ง แต่มีจุดประสงค์เฉพาะคือใช้วัดผล ไม่ใช่ใช้สอน

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Cross-Lingual Consistency GapDeep Learning