Vector database
ฐานข้อมูลที่เก็บข้อมูลในรูปเวกเตอร์แล้วค้นด้วยความหมายใกล้เคียง ไม่ใช่ค้นด้วยคำที่ตรงกันเป๊ะ เป็นชิ้นส่วนหลักของระบบ RAG
Vector database คือฐานข้อมูลเฉพาะทางที่เก็บข้อมูลในรูปของ embedding ซึ่งเป็นชุดตัวเลขที่เก็บความหมายของข้อมูลไว้ในมิติหลายร้อยถึงหลายพันมิติ ความต่างจากฐานข้อมูลแบบเดิมอยู่ที่วิธีค้น ฐานข้อมูลทั่วไปค้นด้วยการจับคู่ที่ตรงกันเป๊ะ เช่น หารายการที่รหัสสินค้าตรงกับที่ระบุ ส่วน vector database ค้นด้วยความใกล้เคียงเชิงความหมาย โดยหาข้อมูลที่เวกเตอร์อยู่ใกล้กับเวกเตอร์ของคำถามมากที่สุด
กลไกที่ทำให้เป็นไปได้คืออัลกอริทึมค้นเพื่อนบ้านใกล้ที่สุดแบบประมาณ ซึ่งมีหลายเทคนิคเช่น HNSW และการแบ่งกลุ่มด้วยดัชนีย้อนกลับ เหตุผลที่ต้องใช้วิธีประมาณแทนการค้นแบบตรงเป๊ะคือการเทียบเวกเตอร์ทุกตัวในคลังที่มีเป็นล้านรายการช้าเกินกว่าจะใช้จริง ผลของวิธีนี้คือถามด้วยคำที่ไม่ตรงกับเอกสารเลยแต่ยังหาเจอได้ เช่น ถามว่านโยบายลาพักร้อนเป็นอย่างไร แล้วระบบหาเอกสารที่ใช้คำว่าวันหยุดประจำปีเจอ ซึ่งการค้นด้วยคำตรงตัวทำไม่ได้
บทบาทที่ทำให้คำนี้สำคัญคือมันเป็นชิ้นส่วนหลักของ rag ขั้นตอนคือแปลงเอกสารขององค์กรเป็นเวกเตอร์แล้วเก็บลงฐานข้อมูล เมื่อผู้ใช้ถามคำถาม ระบบแปลงคำถามเป็นเวกเตอร์ ค้นหาเอกสารที่เกี่ยวข้องที่สุด แล้วป้อนเข้าไปในบริบทของโมเดลให้ตอบ วิธีนี้ทำให้ AI ตอบจากเอกสารจริงขององค์กรได้โดยไม่ต้องเทรนโมเดลใหม่ ข้อควรระวังที่มักถูกมองข้ามคือการค้นด้วยความหมายไม่ได้ชนะการค้นด้วยคำตรงตัวเสมอไป มีงานวิจัยในปี 2026 ที่พบว่าวิธีค้นแบบดั้งเดิมยังเอาชนะได้ในบางเงื่อนไขโดยเฉพาะเมื่อคลังข้อมูลใหญ่มาก ระบบที่ทำงานได้ดีจริงในองค์กรจึงมักผสมสองวิธีเข้าด้วยกัน ไม่ใช่เลือกอย่างใดอย่างหนึ่ง
ตัวอย่างจากบทสนทนาจริง
หัวหน้าฝ่ายบุคคล: "เราอยากให้พนักงานถาม AI เรื่องระเบียบบริษัทได้ค่ะ เอกสารเรามีสามร้อยกว่าไฟล์ ต้องทำยังไง"
นักพัฒนา: "รูปแบบที่ใช้กันคือแปลงเอกสารทั้งหมดเป็นเวกเตอร์เก็บลง vector database ครับ พอมีคนถาม ระบบจะหาเอกสารที่เกี่ยวข้องที่สุดมาแนบให้โมเดลตอบ ข้อดีคือถามด้วยคำที่ไม่ตรงกับในเอกสารก็ยังหาเจอ แต่ผมขอเพิ่มการค้นด้วยคำตรงตัวควบคู่ไปด้วย เพราะเรื่องอย่างรหัสระเบียบหรือชื่อแบบฟอร์มต้องเจอแบบเป๊ะ ซึ่งการค้นด้วยความหมายอย่างเดียวมักพลาด และขอให้ระบบแสดงชื่อไฟล์ต้นทางทุกครั้งด้วยครับ พนักงานจะได้เปิดตรวจเองได้"
ระวังสับสนกับ
- rag : RAG คือรูปแบบการทำงานที่ให้ AI ไปค้นข้อมูลมาประกอบก่อนตอบ ซึ่งเป็นวิธี ส่วน vector database เป็นเครื่องมือชิ้นหนึ่งที่ใช้ทำขั้นตอนค้นในวิธีนั้น RAG ทำได้โดยไม่ใช้ vector database ก็ได้ถ้าใช้การค้นแบบอื่น
- embedding : embedding คือตัวเลขที่แทนความหมายของข้อมูล ซึ่งเป็นสิ่งที่ถูกเก็บ ส่วน vector database คือที่เก็บและระบบค้นหาที่ทำงานกับสิ่งนั้น
- memory-system : memory system คือการที่ AI จำสิ่งที่เรียนรู้ข้ามการสนทนา ซึ่งบางระบบใช้ vector database เป็นที่เก็บ แต่ความจำเป็นเรื่องของสิ่งที่ระบบเลือกจดเอง ส่วน vector database เป็นโครงสร้างพื้นฐานที่รองรับการค้นเท่านั้น
Sources (2)
- https://en.wikipedia.org/wiki/Vector_database fetched 2026-08-06
- https://aws.amazon.com/what-is/vector-databases/ fetched 2026-08-06
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย