Dictionary · พื้นฐาน AI · 24 / 291

Speech-to-text

การแปลงเสียงพูดเป็นข้อความอัตโนมัติ ใช้ถอดเทปประชุม ทำระบบรับสาย และทำคลังเสียงให้ค้นหาได้ วัดคุณภาพด้วยอัตราคำผิด

Speech-to-text หรือที่เรียกทางเทคนิคว่า automatic speech recognition คือเทคโนโลยีที่แปลภาษาพูดให้กลายเป็นข้อความหรือรูปแบบอื่นที่ประมวลผลต่อได้ นิยามที่ใช้กันคือซอฟต์แวร์ที่ทำให้รู้จำและแปลงภาษาพูดเป็นข้อความด้วยวิธีทางภาษาศาสตร์เชิงคำนวณ ผลลัพธ์ที่ได้คือข้อความที่ค้นหาและแก้ไขได้ ระบบสมัยใหม่ใช้การเรียนรู้เชิงลึกและทำความแม่นยำได้ใกล้เคียงมนุษย์บนชุดทดสอบมาตรฐาน

ตัววัดคุณภาพที่ใช้กันเป็นมาตรฐานคือ word error rate หรือ WER ซึ่งคำนวณจากจำนวนคำที่แทนที่ผิด คำที่หายไป และคำที่เกินมา เทียบกับข้อความอ้างอิงที่ถูกต้อง ตัวเลขยิ่งต่ำยิ่งดี ตัวเลขนี้สำคัญเวลาเลือกผู้ให้บริการ เพราะคำโฆษณาว่าแม่นยำกี่เปอร์เซ็นต์มักไม่ระบุว่าวัดกับเสียงแบบไหน เสียงในห้องประชุมเงียบกับเสียงในโรงงานที่มีเสียงรบกวนให้ผลต่างกันมาก

การใช้งานในธุรกิจที่พบบ่อยได้แก่ งานบริการลูกค้าที่ถอดบทสนทนาออกมาวิเคราะห์เพื่อพัฒนาการทำงานของเจ้าหน้าที่ งานการแพทย์ที่บันทึกบทสนทนาระหว่างตรวจลงเวชระเบียนอิเล็กทรอนิกส์ งานสื่อและการตลาดที่แปลงคลังเสียงและวิดีโอให้ค้นหาได้พร้อมทำคำบรรยายหลายภาษา และงานธนาคารที่ทำระบบบริการลูกค้าด้วยเสียง สำหรับองค์กรไทย จุดที่ต้องทดสอบเองก่อนเสมอคือคุณภาพกับภาษาไทย เพราะโมเดลส่วนใหญ่เทรนด้วยภาษาอังกฤษเป็นหลัก และภาษาไทยมีความท้าทายเพิ่มทั้งการไม่เว้นวรรคระหว่างคำ เสียงวรรณยุกต์ และการปนคำอังกฤษในประโยคซึ่งพบมากในบทสนทนาการทำงานจริง

ตัวอย่างจากบทสนทนาจริง

ผู้จัดการ: "เราอยากให้ AI ถอดเทปประชุมแล้วสรุปให้ครับ ผู้ให้บริการเคลมว่าแม่น 95% น่าจะพอใช่ไหม"

ฝ่ายไอที: "ต้องถามก่อนว่า 95% นั้นวัดกับอะไรครับ ตัวเลขพวกนี้มักวัดกับเสียงภาษาอังกฤษในสภาพห้องเงียบ ประชุมของเราพูดไทยปนอังกฤษ มีคนพูดทับกัน และบางคนต่อออนไลน์เสียงขาดๆ ซึ่งคนละโจทย์กันเลย ผมเสนอให้เอาไฟล์ประชุมจริงของเราสามครั้งที่ผ่านมาไปให้เขาถอดให้ดูก่อน แล้วเรานับเองว่าผิดกี่คำ ถ้าผลรับได้ค่อยเซ็นสัญญาครับ อย่าเชื่อตัวเลขบนโบรชัวร์"

ระวังสับสนกับ

  • text-to-speech : text-to-speech ทำงานทิศทางตรงข้าม คือแปลงข้อความให้เป็นเสียงพูด ระบบผู้ช่วยด้วยเสียงต้องใช้ทั้งสองอย่างประกอบกัน คือฟังด้วยอย่างหนึ่ง พูดด้วยอีกอย่างหนึ่ง
  • whisper : Whisper คือชื่อโมเดลถอดเสียงตัวหนึ่งที่เป็นที่นิยม ส่วน speech-to-text คือชื่อของงานหรือความสามารถ อันหนึ่งเป็นสินค้า อีกอันเป็นหมวดของงาน
  • full-duplex : full-duplex อธิบายว่าการสนทนาเกิดขึ้นพร้อมกันทั้งสองทางได้หรือไม่ ซึ่งเป็นเรื่องจังหวะเวลา ส่วน speech-to-text เป็นชิ้นส่วนที่ทำหน้าที่ฟัง ระบบจะฟังเก่งแค่ไหนก็ยังผลัดกันพูดอยู่ได้ถ้าออกแบบมาแบบนั้น

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Scaling LawsSupervised learning