Dictionary · พื้นฐาน AI · 28 / 291

Text-to-speech

การแปลงข้อความเป็นเสียงพูด ยุคโครงข่ายประสาทเทียมทำให้เสียงเป็นธรรมชาติจนโคลนเสียงคนได้จากตัวอย่างไม่กี่วินาที

Text-to-speech หรือ TTS คือเทคโนโลยีที่แปลงข้อความภาษาปกติให้กลายเป็นเสียงพูด โครงสร้างของระบบแบ่งเป็นสองส่วน ส่วนหน้าทำหน้าที่จัดรูปข้อความให้เป็นมาตรฐานและกำหนดว่าแต่ละคำออกเสียงอย่างไร ส่วนหลังคือตัวสังเคราะห์ที่ผลิตเสียงจริงออกมา

สิ่งที่เปลี่ยนวงการนี้ไปทั้งหมดคือการเรียนรู้เชิงลึก ก่อนราวปี 2016 ระบบสังเคราะห์เสียงทำงานด้วยการต่อชิ้นเสียงที่บันทึกไว้ล่วงหน้าเข้าด้วยกัน ผลลัพธ์จึงฟังออกทันทีว่าเป็นเสียงหุ่นยนต์ จุดเปลี่ยนคือการแสดงให้เห็นว่าโครงข่ายประสาทเทียมสร้างคลื่นเสียงดิบได้เอง ทำให้เสียงที่ได้เป็นธรรมชาติขึ้นอย่างมาก จากนั้นมีเทคนิคตามมาอีกหลายชั้นที่ปรับทั้งคุณภาพและความเร็ว โดยเฉพาะการเปลี่ยนจากการผลิตเสียงเรียงทีละส่วนมาเป็นการผลิตขนานกัน ซึ่งทำให้เร็วขึ้นมากโดยคุณภาพไม่ตก

ด้านที่ต้องพูดคู่กันเสมอคือความเสี่ยงจากการโคลนเสียง ระบบยุคแรกต้องการเสียงตัวอย่างหลายสิบชั่วโมงเพื่อสร้างเสียงหนึ่งเสียง แต่เทคนิคสมัยใหม่ลดลงเหลือระดับสิบห้าวินาที ซึ่งทำให้การปลอมเสียงคนกลายเป็นเรื่องที่ใครก็ทำได้ ผลที่ตามมาคือการหลอกลวง การฟิชชิง และปฏิบัติการบิดเบือนข้อมูล จนถึงขั้นที่มีผู้ผลิตรายหนึ่งประเมินว่าเครื่องมือโคลนเสียงของตัวเองเสี่ยงเกินกว่าจะปล่อยให้ใช้ทั่วไป สำหรับองค์กรไทย ความเสี่ยงที่ใกล้ตัวที่สุดคือการปลอมเสียงผู้บริหารสั่งโอนเงินทางโทรศัพท์ ซึ่งเกิดขึ้นจริงในหลายประเทศแล้ว มาตรการที่ทำได้ทันทีและไม่ต้องใช้เทคโนโลยีคือกำหนดว่าคำสั่งเรื่องเงินต้องยืนยันผ่านช่องทางที่สองเสมอ ไม่ว่าเสียงในสายจะคุ้นแค่ไหนก็ตาม

ตัวอย่างจากบทสนทนาจริง

ฝ่ายการเงิน: "เมื่อวานมีสายโทรมาเสียงเหมือนท่านกรรมการผู้จัดการเป๊ะเลยค่ะ สั่งให้โอนเงินด่วน โชคดีที่หนูขอโทรกลับก่อน แล้วปรากฏว่าท่านไม่ได้โทรมา"

ฝ่ายความปลอดภัย: "ทำถูกแล้วครับ ทุกวันนี้เทคโนโลยีโคลนเสียงต้องการตัวอย่างเสียงแค่ไม่กี่สิบวินาที ซึ่งหาได้จากคลิปสัมภาษณ์หรือวิดีโอบริษัทที่เผยแพร่อยู่แล้ว การฟังว่าเสียงคุ้นจึงไม่ใช่การยืนยันตัวตนอีกต่อไป ผมจะเสนอให้ออกเป็นระเบียบเลยว่าคำสั่งเรื่องเงินทุกกรณีต้องยืนยันผ่านช่องทางที่สอง เช่น โทรกลับเบอร์ในระบบหรือยืนยันในระบบอนุมัติ ไม่ว่าจะมั่นใจแค่ไหนก็ตามครับ"

ระวังสับสนกับ

  • speech-to-text : speech-to-text ทำงานทิศทางตรงข้าม คือฟังเสียงแล้วแปลงเป็นข้อความ ระบบผู้ช่วยด้วยเสียงใช้ทั้งสองอย่างประกอบกัน
  • deepfake : deepfake มักหมายถึงวิดีโอหรือภาพปลอมที่ทำให้ดูเหมือนคนจริง ส่วนการโคลนเสียงเป็น deepfake ในรูปแบบเสียง ซึ่งอันตรายในทางปฏิบัติมากกว่าเพราะทำง่ายกว่าและใช้กับโทรศัพท์ได้ทันที
  • elevenlabs : ElevenLabs คือชื่อผู้ให้บริการรายหนึ่งในตลาดนี้ ส่วน text-to-speech คือชื่อของความสามารถ อันหนึ่งเป็นสินค้า อีกอันเป็นหมวดของเทคโนโลยี

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Text-to-imageTransfer Learning