Tokenization
การหั่นข้อความเป็นชิ้นย่อยแล้วแปลงเป็นตัวเลขก่อนป้อนโมเดล เป็นเหตุผลที่ภาษาไทยมักกินโทเคนมากกว่าภาษาอังกฤษ
Tokenization คือขั้นตอนแรกสุดก่อนที่ข้อความจะเข้าสู่โมเดล เพราะโมเดลทำงานกับตัวเลขไม่ใช่ตัวอักษร เอกสารอธิบายว่าข้อความต้องถูกแปลงเป็นตัวเลข โดยแต่ละรายการในคลังคำศัพท์ของโมเดลจะได้เลขประจำตัวที่ไม่ซ้ำกัน กระบวนการนี้จึงเป็นการหั่นข้อความเป็นชิ้นย่อยที่เรียกว่า token แล้วแปลงแต่ละชิ้นเป็นเลข
วิธีที่โมเดลส่วนใหญ่ใช้หั่นเรียกว่า byte-pair encoding หรือ BPE หลักการคือเริ่มจากตัวอักษรเดี่ยวเป็นโทเคนตั้งต้น แล้วไล่รวมคู่ที่พบติดกันบ่อยที่สุดเข้าด้วยกันเป็นโทเคนใหม่ที่ยาวขึ้น ทำซ้ำจนได้คลังคำศัพท์ขนาดที่ต้องการ ผลลัพธ์คือโทเคนที่มีความยาวหลากหลาย ตั้งแต่ตัวอักษรเดี่ยวไปจนถึงคำเต็ม โมเดลรุ่นที่ใช้กันแพร่หลายมีคลังคำศัพท์ราวหนึ่งแสนโทเคน วิธีนี้ทำให้แทนข้อความอะไรก็ได้ แม้แต่การผสมตัวอักษรที่ไม่เคยเห็นมาก่อน ด้วยลำดับโทเคนที่ค่อนข้างสั้น
เรื่องนี้กระทบคนไทยโดยตรงและเป็นสิ่งที่ควรรู้ก่อนคำนวณค่าใช้จ่าย เพราะคลังคำศัพท์ของโมเดลส่วนใหญ่ถูกสร้างจากข้อมูลที่มีภาษาอังกฤษเป็นหลัก คำภาษาอังกฤษที่พบบ่อยจึงมักถูกรวบเป็นโทเคนเดียว ขณะที่ข้อความภาษาไทยมักถูกหั่นละเอียดกว่ามาก ข้อความไทยที่ยาวเท่ากันจึงกินโทเคนมากกว่าอังกฤษอย่างมีนัยสำคัญ ซึ่งแปลว่าทั้งค่าใช้จ่ายสูงกว่าและกิน context-window เร็วกว่าเมื่อทำงานกับเอกสารภาษาไทย อีกมุมที่เป็นข่าวในเดือนกรกฎาคม 2026 คือมีงานวิจัยชี้ว่าวิธีหั่นโทเคนแบบ BPE เป็นช่องโหว่ที่การปรับแนวความปลอดภัยตามไม่ทัน เพราะการสะกดคำในรูปแบบแปลกๆ ทำให้ข้อความถูกหั่นเป็นโทเคนคนละชุดกับที่ระบบป้องกันคาดไว้ ซึ่งเป็นช่องทางหนึ่งของการทำ jailbreak
ตัวอย่างจากบทสนทนาจริง
ฝ่ายบัญชี: "บิลค่า AI เดือนนี้สูงกว่าที่ประมาณไว้เกือบเท่าตัวค่ะ ทั้งที่จำนวนเอกสารที่ประมวลผลเท่าเดิม"
หัวหน้าทีมเทคนิค: "ผมว่าน่าจะมาจากภาษาครับ เดือนก่อนเราทดสอบด้วยเอกสารภาษาอังกฤษ เดือนนี้เปลี่ยนมาใช้เอกสารไทยจริง ข้อความไทยถูกหั่นเป็นโทเคนละเอียดกว่าอังกฤษมาก เพราะคลังคำศัพท์ของโมเดลสร้างจากข้อมูลอังกฤษเป็นหลัก เอกสารความยาวเท่ากันจึงกินโทเคนไม่เท่ากัน ผมจะวัดอัตราส่วนจริงของเราแล้วปรับสูตรประมาณการใหม่ครับ จะได้ไม่พลาดอีก"
ระวังสับสนกับ
- token : token คือชิ้นข้อความที่ได้จากการหั่น ซึ่งเป็นผลลัพธ์ ส่วน tokenization คือกระบวนการหั่นนั้น อันหนึ่งเป็นของ อีกอันเป็นวิธีทำ
- embedding : embedding คือการแปลงข้อความเป็นชุดตัวเลขที่เก็บความหมายไว้ ซึ่งเกิดขึ้นหลังจาก tokenization ลำดับคือหั่นเป็นโทเคนก่อน แปลงเป็นเลขประจำตัว แล้วจึงแปลงเป็นเวกเตอร์ที่มีความหมาย
- context-window : context window คือเพดานจำนวนโทเคนที่โมเดลรับได้ ส่วน tokenization เป็นตัวกำหนดว่าข้อความของเราจะกลายเป็นกี่โทเคน ซึ่งเป็นเหตุผลที่เอกสารความยาวเท่ากันในภาษาต่างกันใช้พื้นที่ไม่เท่ากัน
Sources (2)
- https://en.wikipedia.org/wiki/Byte-pair_encoding fetched 2026-08-06
- https://en.wikipedia.org/wiki/Large_language_model fetched 2026-08-06
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย