Speech-to-text
การแปลงเสียงพูดเป็นข้อความอัตโนมัติ ใช้ถอดเทปประชุม ทำระบบรับสาย และทำคลังเสียงให้ค้นหาได้ วัดคุณภาพด้วยอัตราคำผิด
Speech-to-text หรือที่เรียกทางเทคนิคว่า automatic speech recognition คือเทคโนโลยีที่แปลภาษาพูดให้กลายเป็นข้อความหรือรูปแบบอื่นที่ประมวลผลต่อได้ นิยามที่ใช้กันคือซอฟต์แวร์ที่ทำให้รู้จำและแปลงภาษาพูดเป็นข้อความด้วยวิธีทางภาษาศาสตร์เชิงคำนวณ ผลลัพธ์ที่ได้คือข้อความที่ค้นหาและแก้ไขได้ ระบบสมัยใหม่ใช้การเรียนรู้เชิงลึกและทำความแม่นยำได้ใกล้เคียงมนุษย์บนชุดทดสอบมาตรฐาน
ตัววัดคุณภาพที่ใช้กันเป็นมาตรฐานคือ word error rate หรือ WER ซึ่งคำนวณจากจำนวนคำที่แทนที่ผิด คำที่หายไป และคำที่เกินมา เทียบกับข้อความอ้างอิงที่ถูกต้อง ตัวเลขยิ่งต่ำยิ่งดี ตัวเลขนี้สำคัญเวลาเลือกผู้ให้บริการ เพราะคำโฆษณาว่าแม่นยำกี่เปอร์เซ็นต์มักไม่ระบุว่าวัดกับเสียงแบบไหน เสียงในห้องประชุมเงียบกับเสียงในโรงงานที่มีเสียงรบกวนให้ผลต่างกันมาก
การใช้งานในธุรกิจที่พบบ่อยได้แก่ งานบริการลูกค้าที่ถอดบทสนทนาออกมาวิเคราะห์เพื่อพัฒนาการทำงานของเจ้าหน้าที่ งานการแพทย์ที่บันทึกบทสนทนาระหว่างตรวจลงเวชระเบียนอิเล็กทรอนิกส์ งานสื่อและการตลาดที่แปลงคลังเสียงและวิดีโอให้ค้นหาได้พร้อมทำคำบรรยายหลายภาษา และงานธนาคารที่ทำระบบบริการลูกค้าด้วยเสียง สำหรับองค์กรไทย จุดที่ต้องทดสอบเองก่อนเสมอคือคุณภาพกับภาษาไทย เพราะโมเดลส่วนใหญ่เทรนด้วยภาษาอังกฤษเป็นหลัก และภาษาไทยมีความท้าทายเพิ่มทั้งการไม่เว้นวรรคระหว่างคำ เสียงวรรณยุกต์ และการปนคำอังกฤษในประโยคซึ่งพบมากในบทสนทนาการทำงานจริง
ตัวอย่างจากบทสนทนาจริง
ผู้จัดการ: "เราอยากให้ AI ถอดเทปประชุมแล้วสรุปให้ครับ ผู้ให้บริการเคลมว่าแม่น 95% น่าจะพอใช่ไหม"
ฝ่ายไอที: "ต้องถามก่อนว่า 95% นั้นวัดกับอะไรครับ ตัวเลขพวกนี้มักวัดกับเสียงภาษาอังกฤษในสภาพห้องเงียบ ประชุมของเราพูดไทยปนอังกฤษ มีคนพูดทับกัน และบางคนต่อออนไลน์เสียงขาดๆ ซึ่งคนละโจทย์กันเลย ผมเสนอให้เอาไฟล์ประชุมจริงของเราสามครั้งที่ผ่านมาไปให้เขาถอดให้ดูก่อน แล้วเรานับเองว่าผิดกี่คำ ถ้าผลรับได้ค่อยเซ็นสัญญาครับ อย่าเชื่อตัวเลขบนโบรชัวร์"
ระวังสับสนกับ
- text-to-speech : text-to-speech ทำงานทิศทางตรงข้าม คือแปลงข้อความให้เป็นเสียงพูด ระบบผู้ช่วยด้วยเสียงต้องใช้ทั้งสองอย่างประกอบกัน คือฟังด้วยอย่างหนึ่ง พูดด้วยอีกอย่างหนึ่ง
- whisper : Whisper คือชื่อโมเดลถอดเสียงตัวหนึ่งที่เป็นที่นิยม ส่วน speech-to-text คือชื่อของงานหรือความสามารถ อันหนึ่งเป็นสินค้า อีกอันเป็นหมวดของงาน
- full-duplex : full-duplex อธิบายว่าการสนทนาเกิดขึ้นพร้อมกันทั้งสองทางได้หรือไม่ ซึ่งเป็นเรื่องจังหวะเวลา ส่วน speech-to-text เป็นชิ้นส่วนที่ทำหน้าที่ฟัง ระบบจะฟังเก่งแค่ไหนก็ยังผลัดกันพูดอยู่ได้ถ้าออกแบบมาแบบนั้น
Sources (2)
- https://en.wikipedia.org/wiki/Speech_recognition fetched 2026-08-06
- https://aws.amazon.com/what-is/speech-to-text/ fetched 2026-08-06
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย