Voice cloning
การสร้างเสียงสังเคราะห์ให้เหมือนน้ำเสียงของคนคนหนึ่งจากตัวอย่างเสียงสั้นๆ ใช้ทำงานพากย์หลายภาษาได้ และเป็นเทคโนโลยีเดียวกับที่มิจฉาชีพใช้ปลอมเสียงหลอกโอนเงิน
Voice cloning คือการสร้างเสียงพูดสังเคราะห์ที่เลียนน้ำเสียงเฉพาะตัวของคนคนหนึ่ง วิธีทำคือป้อนตัวอย่างเสียงที่คนนั้นพูดจริงให้ระบบเรียนรู้ไว้ก่อน จากนั้นพิมพ์ข้อความอะไรลงไป ระบบก็อ่านออกมาเป็นเสียงของคนคนนั้นได้ จุดที่ต่างจาก text-to-speech แบบทั่วไปคือระบบทั่วไปมีเสียงมาตรฐานสำเร็จรูปมาให้เลือกใช้ ส่วน voice cloning ผลิตเสียงใหม่ขึ้นมาจากคนจริงที่มีตัวตนอยู่ ผู้ให้บริการมักแบ่งงานนี้เป็นสองระดับ ระดับเร็วใช้ตัวอย่างเสียงสั้น เอกสารของ elevenlabs สำหรับ Instant Voice Cloning แนะนำเสียงที่ชัด ไม่มีเสียงก้องหรือเสียงรบกวน ยาวประมาณ 1 ถึง 2 นาที และเตือนไว้ด้วยว่าอย่าอัดเกิน 3 นาที เพราะแทบไม่ทำให้ผลดีขึ้นและบางกรณีกลับแย่ลง ส่วนระดับสตูดิโอที่ ElevenLabs เรียกว่า Professional Voice Cloning เอกสารหน้านั้นระบุว่าขั้นต่ำเท่าที่แนะนำคือ 30 นาที แต่ถ้าอยากได้ผลดีที่สุดแนะนำให้ป้อนเสียงสำหรับฝึกอย่างน้อยหนึ่งชั่วโมง และดีที่สุดคือใกล้เคียงสามชั่วโมง
ฝั่ง Microsoft แบ่งสองระดับนี้ชัดเจนเหมือนกัน เอกสาร Azure ระบุว่า personal voice ใช้เสียงมนุษย์หนึ่งนาทีเป็นข้อมูลที่ต้องเตรียม ใช้เวลาสร้างน้อยกว่าห้าวินาที แล้วเสียงที่ได้พูดได้มากกว่า 90 ภาษา ครอบคลุมมากกว่า 100 locale ขณะที่ professional voice ซึ่งเป็นฟีเจอร์เดียวกับที่เอกสาร Limited Access ของ Microsoft ยังเรียกด้วยชื่อเดิมว่า custom neural voice ต้องใช้ 300 ถึง 2000 utterance หรือราวสามสิบนาทีถึงสามชั่วโมง แต่สิ่งที่คนทำงานควรอ่านมากกว่าตัวเลขคือด่านความยินยอมที่เขียนบังคับไว้ Microsoft กำหนดว่าทุกเสียงต้องสร้างด้วยความยินยอมชัดแจ้งของเจ้าของเสียง โดยต้องอัดคำแถลงที่เจ้าของเสียงรับรู้ว่าจะมีการนำเสียงไปสร้างเสียงสังเคราะห์ส่งเข้าระบบก่อน และหน้า Limited Access ของ Microsoft ยังสงวนสิทธิ์นำเทคโนโลยียืนยันตัวผู้พูดมาเทียบคำแถลงนั้นกับไฟล์เสียงที่ใช้ฝึกว่าเป็นคนเดียวกันจริง โดยข้อสงวนสิทธิ์นี้เขียนไว้ในหัวข้อ custom neural voice ของหน้าดังกล่าว ส่วนฝั่ง personal voice เอกสารวิธีเพิ่มคำยินยอมของ Microsoft ระบุไว้เองว่าคำแถลงยินยอมถูกใช้ตรวจว่าเจ้าของเสียงเป็นคนเดียวกับผู้พูดในข้อมูลที่ใช้ฝึกด้วยเหมือนกัน นอกจากด่านความยินยอมแล้ว ทั้ง personal voice และ custom neural voice ยังเปิดให้ใช้แบบ Limited Access ที่ต้องลงทะเบียนและได้รับอนุมัติก่อนใช้งาน โดยหน้า Limited Access ของ Microsoft ระบุว่าฝั่ง custom neural voice ให้เฉพาะลูกค้าที่ Microsoft ดูแลเอง คือกลุ่มที่ทำงานกับ Microsoft account team โดยตรง และใช้ได้เฉพาะกรณีที่ยื่นขอและได้รับอนุมัติตอนลงทะเบียน ลูกค้าที่ได้รับอนุมัติให้ใช้ custom neural voice ยังต้องเปิดเผยกับผู้ใช้ปลายทางว่านี่เป็นเสียงสังเคราะห์ และต้องเปิดช่องทางให้ผู้ใช้แจ้งปัญหากลับมาได้ด้วย ส่วน ElevenLabs เข้มอีกแบบหนึ่ง เอกสาร Professional Voice Cloning เขียนตรงว่าในตอนนี้อนุญาตให้สร้างได้เฉพาะเสียงของตัวเอง ต่อให้เจ้าตัวยินยอมก็สร้างเสียงของคนอื่นไม่ได้ และผู้ใช้ต้องผ่านขั้นตอนยืนยันว่าเป็นเสียงของตัวเองจริงก่อนส่งงานฝึก ขณะที่หน้าความปลอดภัยของบริษัทระบุว่ามีการบล็อกการสร้างเสียงคนดังและเสียงที่มีความเสี่ยงสูง ทั้งหมดนี้คือรูปธรรมของ responsible-ai ที่ผสมกันสองชั้น บางข้อเป็นด่านในตัวผลิตภัณฑ์จริง เช่น การบังคับส่งไฟล์คำยินยอมก่อนฝึก การขออนุมัติก่อนเปิดใช้ และการบล็อกเสียงคนดัง ส่วนบางข้อเป็นเงื่อนไขทางกฎหมายตามสัญญาบริการที่ต่างกันไปตามผลิตภัณฑ์ คือการสงวนสิทธิ์เทียบเสียงและการบังคับเปิดเผยกับผู้ฟังที่กล่าวไปข้างต้น
คนทำงานเจอเรื่องนี้สองทางที่ต่างกันมาก ทางแรกคืองานที่องค์กรใช้จริง เช่น เสียงบรรยายบทเรียนภายใน เสียงประกาศ และการพากย์คลิปเป็นหลายภาษา เอกสาร dubbing ของ ElevenLabs อธิบายฟีเจอร์นี้ว่าเป็นการแปลและแทนเสียงต้นฉบับของวิดีโอด้วยภาษาใหม่ โดยยังรักษาลักษณะเฉพาะของเสียงผู้พูดคนเดิมไว้ และรองรับมากกว่า 90 ภาษา ทางที่สองคือความเสี่ยง เมื่อ 8 กุมภาพันธ์ 2024 FCC ของสหรัฐออก Declaratory Ruling ว่าสายที่ใช้เสียงซึ่ง AI สร้างขึ้นถือเป็นเสียง artificial ตามกฎหมาย Telephone Consumer Protection Act โดยคำวินิจฉัยมีผลทันที และภายใต้กฎของ FCC กฎหมายฉบับนี้กำหนดให้ผู้ทำการตลาดทางโทรศัพท์ต้องได้รับความยินยอมล่วงหน้าเป็นลายลักษณ์อักษรจากผู้บริโภคก่อนโทรแบบ robocall โดยประธาน FCC ในขณะนั้นให้เหตุผลว่ามีคนใช้เสียงที่ AI สร้างขึ้นในสายที่ผู้รับไม่ได้ร้องขอ เพื่อรีดเงินจากสมาชิกครอบครัวที่เปราะบาง เลียนแบบคนดัง และป้อนข้อมูลผิดให้ผู้มีสิทธิเลือกตั้ง ข้อควรระวังสำหรับองค์กรคือเลิกใช้เสียงเป็นหลักฐานยืนยันตัวตนในขั้นตอนอนุมัติเงิน เพราะเสียงที่ฟังเหมือนหัวหน้าสั่งโอนด่วนเป็นสิ่งที่เทคโนโลยีนี้ทำได้อยู่แล้ว ส่วนเครื่องมือตรวจจับช่วยได้เท่าที่ขอบเขตของมันเอื้อ ElevenLabs ระบุว่ามี AI Speech Classifier ไว้ตรวจว่าคลิปเสียงถูกสร้างด้วยเครื่องมือของ ElevenLabs หรือไม่ โดยเอกสารปัจจุบันของบริษัทจัดตัวนี้เป็นเครื่องมือรุ่นเก่า และวางให้ Audio Detector เป็นเครื่องมือหลักสำหรับผู้ใช้ที่เข้าสู่ระบบแล้ว ซึ่งตรวจลายน้ำของ ElevenLabs ก่อน แล้วจึงถอยมาใช้ classifier เมื่อไม่พบลายน้ำ โดยเอกสาร Audio Detector เขียนขอบเขตของลายน้ำไว้ด้วยว่าเสียงที่ ElevenLabs สร้างก่อนเดือนมิถุนายน 2026 ไม่มีลายน้ำ และตอนนี้ลายน้ำครอบคลุมงาน text to speech ของผู้ใช้แบบไม่เสียเงินทั้งหมด กับงานแบบเสียเงินเพียงบางส่วนเท่านั้น ส่วนหน้า AI Speech Classifier เดิมยังเปิดให้ใช้แยกต่างหากโดยไม่ต้องเข้าสู่ระบบ และหน้าความปลอดภัยของ ElevenLabs ยังยกมาตรฐานเปิด Coalition for Content Provenance and Authenticity ขึ้นมาเป็นอีกมาตรการหนึ่ง โดยอธิบายว่าเป็นมาตรฐานทางเทคนิคแบบเปิดที่ใช้ตามรอยที่มาของสื่อ แนวทางนี้เดินทางเดียวกับ content-provenance และ watermarking แต่ต้องอ่านขอบเขตให้ตรง เพราะเครื่องมือของ ElevenLabs ทั้งสองตัวตอบได้แค่ว่าเสียงนั้นมาจากระบบของ ElevenLabs หรือไม่ เอกสาร Audio Detector ระบุว่าเครื่องมือตัวนี้อ่านได้เฉพาะลายน้ำที่ ElevenLabs ฝังไว้และอ่านลายน้ำของผู้ให้บริการรายอื่นไม่ได้ จึงไม่ได้ตอบว่าเสียงนั้นเป็นเสียงของคนจริงหรือไม่ ช่องว่างตรงนี้คือเหตุผลที่เสียงสังเคราะห์ยังไหลไปเป็นวัตถุดิบของ misinformation ได้ วิธีที่ใช้ได้จริงในองค์กรจึงเป็นเรื่องขั้นตอนมากกว่าเครื่องมือ เช่น กำหนดให้คำสั่งเรื่องเงินที่มาทางเสียงต้องโทรกลับตามเบอร์ในทะเบียนของบริษัทก่อนเสมอ และตกลงคำถามยืนยันกันไว้ล่วงหน้าภายในทีม
ตัวอย่างจากบทสนทนาจริง
ฝ่ายการตลาด: อยากทำคลิปแนะนำสินค้าสามภาษาโดยใช้เสียง CEO ที่มีอยู่ในคลิปเก่า เอาไฟล์เก่าไปให้ระบบเรียนเสียงท่านเลยได้ไหมคะ จะได้ไม่ต้องรบกวนท่านมาอัดใหม่
ทีมกฎหมาย: เอาไฟล์เก่าไปใส่เองไม่ได้ครับ บริการที่เราใช้บังคับให้เจ้าของเสียงอัดคำยินยอมของตัวเองส่งเข้าระบบก่อน อย่างของ Microsoft ยังสงวนสิทธิ์เอาเทคโนโลยียืนยันตัวผู้พูดไปเทียบว่าเสียงในคำยินยอมกับเสียงในไฟล์ฝึกเป็นคนเดียวกันจริง ขอเวลาท่านห้านาทีอัดให้ถูกขั้นตอนง่ายกว่าครับ
ฝ่ายการเงิน: แล้วเมื่อวานที่มีสายโทรเข้ามา เสียงเหมือนท่านมาก สั่งให้โอนด่วนก่อนปิดยอด อันนั้นคือของแบบเดียวกันใช่ไหมครับ
ทีมกฎหมาย: เทคโนโลยีเดียวกันครับ ต่างกันที่เจตนา ตั้งแต่นี้ไปคำสั่งเรื่องเงินที่มาทางเสียงอย่างเดียวให้ถือว่ายังไม่ผ่าน ต้องโทรกลับตามเบอร์ในทะเบียนบริษัทยืนยันก่อนทุกครั้ง ไม่ว่าปลายสายจะเร่งแค่ไหน
ระวังสับสนกับ
- deepfake : deepfake เป็นคำร่มของสื่อปลอมที่ทำให้คนจริงดูเหมือนพูดหรือทำสิ่งที่ไม่เคยเกิดขึ้น ครอบคลุมทั้งภาพ วิดีโอ และเสียง เมื่อเทียบกันเฉพาะฝั่งเสียง voice cloning เป็นเทคนิคจำลองน้ำเสียงที่ใช้แบบเปิดเผยและได้รับความยินยอมก็ได้ และกลายเป็น deepfake เมื่อถูกเอาไปสวมรอยเป็นตัวจริงเพื่อหลอกคน จุดต่างจึงอยู่ที่เจตนาและการเปิดเผย ไม่ใช่ตัวเทคนิค
- speech-to-text : เดินคนละทิศทางกัน speech-to-text แปลงเสียงพูดที่มีอยู่ให้กลายเป็นข้อความ ซึ่งเป็นงานที่ whisper ทำ ส่วน voice cloning ผลิตเสียงพูดใหม่ออกมาจากข้อความ
- synthetic-persona : synthetic persona คือการให้ LLM สวมบทเป็นผู้บริโภคสมมติเพื่อตอบแบบสอบถามหรือร่วมวง focus group แทนการสัมภาษณ์คนจริง เป็นงานฝั่งวิจัยตลาดที่ไม่ต้องอิงคนที่มีตัวตนจริงคนใดคนหนึ่ง ส่วน voice cloning จำลองน้ำเสียงของคนจริงออกมาเป็นไฟล์เสียง จึงผูกกับตัวบุคคลและเรื่องความยินยอมโดยตรง
Sources (10)
- https://elevenlabs.io/docs/product-guides/voices/voice-cloning/instant-voice-cloning fetched 2026-08-14
- https://elevenlabs.io/docs/product-guides/voices/voice-cloning/professional-voice-cloning fetched 2026-08-14
- https://elevenlabs.io/safety fetched 2026-08-14
- https://elevenlabs.io/docs/product-guides/products/dubbing fetched 2026-08-14
- https://elevenlabs.io/docs/eleven-creative/audio-tools/audio-detector fetched 2026-08-14
- https://learn.microsoft.com/en-us/azure/ai-services/speech-service/personal-voice-overview fetched 2026-08-14
- https://learn.microsoft.com/en-us/azure/ai-services/speech-service/personal-voice-create-consent fetched 2026-08-15
- https://learn.microsoft.com/en-us/azure/ai-services/speech-service/custom-neural-voice fetched 2026-08-14
- https://learn.microsoft.com/en-us/azure/ai-foundry/responsible-ai/speech-service/text-to-speech/limited-access fetched 2026-08-14
- https://docs.fcc.gov/public/attachments/DOC-400393A1.txt fetched 2026-08-14
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย