Dictionary · ความรู้และแหล่งอ้างอิง · 158 / 291

Vector database

ฐานข้อมูลที่เก็บข้อมูลในรูปเวกเตอร์แล้วค้นด้วยความหมายใกล้เคียง ไม่ใช่ค้นด้วยคำที่ตรงกันเป๊ะ เป็นชิ้นส่วนหลักของระบบ RAG

Vector database คือฐานข้อมูลเฉพาะทางที่เก็บข้อมูลในรูปของ embedding ซึ่งเป็นชุดตัวเลขที่เก็บความหมายของข้อมูลไว้ในมิติหลายร้อยถึงหลายพันมิติ ความต่างจากฐานข้อมูลแบบเดิมอยู่ที่วิธีค้น ฐานข้อมูลทั่วไปค้นด้วยการจับคู่ที่ตรงกันเป๊ะ เช่น หารายการที่รหัสสินค้าตรงกับที่ระบุ ส่วน vector database ค้นด้วยความใกล้เคียงเชิงความหมาย โดยหาข้อมูลที่เวกเตอร์อยู่ใกล้กับเวกเตอร์ของคำถามมากที่สุด

กลไกที่ทำให้เป็นไปได้คืออัลกอริทึมค้นเพื่อนบ้านใกล้ที่สุดแบบประมาณ ซึ่งมีหลายเทคนิคเช่น HNSW และการแบ่งกลุ่มด้วยดัชนีย้อนกลับ เหตุผลที่ต้องใช้วิธีประมาณแทนการค้นแบบตรงเป๊ะคือการเทียบเวกเตอร์ทุกตัวในคลังที่มีเป็นล้านรายการช้าเกินกว่าจะใช้จริง ผลของวิธีนี้คือถามด้วยคำที่ไม่ตรงกับเอกสารเลยแต่ยังหาเจอได้ เช่น ถามว่านโยบายลาพักร้อนเป็นอย่างไร แล้วระบบหาเอกสารที่ใช้คำว่าวันหยุดประจำปีเจอ ซึ่งการค้นด้วยคำตรงตัวทำไม่ได้

บทบาทที่ทำให้คำนี้สำคัญคือมันเป็นชิ้นส่วนหลักของ rag ขั้นตอนคือแปลงเอกสารขององค์กรเป็นเวกเตอร์แล้วเก็บลงฐานข้อมูล เมื่อผู้ใช้ถามคำถาม ระบบแปลงคำถามเป็นเวกเตอร์ ค้นหาเอกสารที่เกี่ยวข้องที่สุด แล้วป้อนเข้าไปในบริบทของโมเดลให้ตอบ วิธีนี้ทำให้ AI ตอบจากเอกสารจริงขององค์กรได้โดยไม่ต้องเทรนโมเดลใหม่ ข้อควรระวังที่มักถูกมองข้ามคือการค้นด้วยความหมายไม่ได้ชนะการค้นด้วยคำตรงตัวเสมอไป มีงานวิจัยในปี 2026 ที่พบว่าวิธีค้นแบบดั้งเดิมยังเอาชนะได้ในบางเงื่อนไขโดยเฉพาะเมื่อคลังข้อมูลใหญ่มาก ระบบที่ทำงานได้ดีจริงในองค์กรจึงมักผสมสองวิธีเข้าด้วยกัน ไม่ใช่เลือกอย่างใดอย่างหนึ่ง

ตัวอย่างจากบทสนทนาจริง

หัวหน้าฝ่ายบุคคล: "เราอยากให้พนักงานถาม AI เรื่องระเบียบบริษัทได้ค่ะ เอกสารเรามีสามร้อยกว่าไฟล์ ต้องทำยังไง"

นักพัฒนา: "รูปแบบที่ใช้กันคือแปลงเอกสารทั้งหมดเป็นเวกเตอร์เก็บลง vector database ครับ พอมีคนถาม ระบบจะหาเอกสารที่เกี่ยวข้องที่สุดมาแนบให้โมเดลตอบ ข้อดีคือถามด้วยคำที่ไม่ตรงกับในเอกสารก็ยังหาเจอ แต่ผมขอเพิ่มการค้นด้วยคำตรงตัวควบคู่ไปด้วย เพราะเรื่องอย่างรหัสระเบียบหรือชื่อแบบฟอร์มต้องเจอแบบเป๊ะ ซึ่งการค้นด้วยความหมายอย่างเดียวมักพลาด และขอให้ระบบแสดงชื่อไฟล์ต้นทางทุกครั้งด้วยครับ พนักงานจะได้เปิดตรวจเองได้"

ระวังสับสนกับ

  • rag : RAG คือรูปแบบการทำงานที่ให้ AI ไปค้นข้อมูลมาประกอบก่อนตอบ ซึ่งเป็นวิธี ส่วน vector database เป็นเครื่องมือชิ้นหนึ่งที่ใช้ทำขั้นตอนค้นในวิธีนั้น RAG ทำได้โดยไม่ใช้ vector database ก็ได้ถ้าใช้การค้นแบบอื่น
  • embedding : embedding คือตัวเลขที่แทนความหมายของข้อมูล ซึ่งเป็นสิ่งที่ถูกเก็บ ส่วน vector database คือที่เก็บและระบบค้นหาที่ทำงานกับสิ่งนั้น
  • memory-system : memory system คือการที่ AI จำสิ่งที่เรียนรู้ข้ามการสนทนา ซึ่งบางระบบใช้ vector database เป็นที่เก็บ แต่ความจำเป็นเรื่องของสิ่งที่ระบบเลือกจดเอง ส่วน vector database เป็นโครงสร้างพื้นฐานที่รองรับการค้นเท่านั้น

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Trivial baselineAgent SDK