Whisper
โมเดล AI ถอดเสียงพูดเป็นข้อความจาก OpenAI รองรับ 99 ภาษารวมภาษาไทย ใช้ถอดเทปประชุมหรือสัมภาษณ์ได้ และเปิดให้ใช้ฟรีแบบ open source
Whisper คือ model ด้านการรู้จำเสียงพูด (speech recognition) จาก openai ที่เปิดซอร์สโค้ดออกมาเมื่อเดือนกันยายน 2022 ภายใต้ MIT License · หน้าที่หลักของมันคือ speech-to-text: รับไฟล์เสียงเข้าไป แล้วถอดออกมาเป็นข้อความ นอกจากถอดเสียงแล้วยังทำได้อีกหลายอย่างในตัวเดียว ทั้งแปลเสียงพูดภาษาอื่นเป็นข้อความภาษาอังกฤษ ระบุว่าผู้พูดกำลังพูดภาษาอะไร (language identification) และตรวจจับช่วงที่มีเสียงพูด (voice activity detection) โดยรองรับถึง 99 ภาษา ซึ่งรวมภาษาไทยด้วย
เบื้องหลัง Whisper คือสถาปัตยกรรม transformer แบบ encoder-decoder ที่ผ่านการ training ด้วยคู่เสียง-คำถอดความจากอินเทอร์เน็ตรวม 680,000 ชั่วโมง ในจำนวนนี้เป็นเสียง 96 ภาษาที่ไม่ใช่ภาษาอังกฤษถึง 117,000 ชั่วโมง ทีมพัฒนาระบุว่าข้อมูลที่หลากหลายขนาดนี้ทำให้มันรับมือสำเนียง เสียงรบกวน และศัพท์เฉพาะทางได้ดีกว่าระบบรุ่นก่อนๆ · ตัวโมเดลมีให้เลือกหลายขนาดตามกำลังเครื่อง ตั้งแต่ tiny (39 ล้าน parameters) ไปจนถึง large (1,550 ล้าน) และรุ่น turbo (809 ล้าน) ที่เร็วกว่า large ราว 8 เท่า ใช้งานได้ทั้งผ่าน command line และ Python และเพราะเป็น open-source-ai ใครก็ดาวน์โหลดไปรันในเครื่องตัวเองได้ฟรี ซึ่งสำคัญมากกับงานที่ข้อมูลเสียงห้ามหลุดออกนอกองค์กร
คนทำงานยุค ai ควรรู้จัก Whisper เพราะมันคือเทคโนโลยีเบื้องหลังฟีเจอร์ถอดเทปในเครื่องมือจำนวนมาก งานที่เคยต้องจ้างคนนั่งฟังเป็นวันๆ อย่างถอดเทปประชุม สัมภาษณ์ หรือทำซับไตเติล กลายเป็นงานไม่กี่นาที · แต่มีข้อควรระวังสำคัญ: Whisper มีอาการ hallucination ได้เหมือน AI ตัวอื่น งานวิจัยภายนอกที่ตรวจสอบ 13,140 ช่วงเสียงพบว่า 1.4% มีข้อความที่ต้นฉบับไม่ได้พูดปนออกมา และบางส่วนเป็นเนื้อหาที่อาจสร้างความเสียหาย ดังนั้นงานที่เดิมพันสูงอย่างการแพทย์หรือกฎหมาย ต้องมีคนตรวจทานผลถอดเสียงเสมอ
ตัวอย่างจากบทสนทนาจริง
ฝ่ายขาย: อัดเสียงประชุมกับลูกค้าไว้ชั่วโมงกว่า จะจ้างคนถอดเทปก็แพง พิมพ์เองก็ไม่ไหว AI ช่วยได้จริงไหมครับ
ทีม IT: งานนี้ตรงสาย Whisper เลยครับ โยนไฟล์เสียงเข้าไป มันถอดออกมาเป็นข้อความให้ รองรับภาษาไทยด้วย และถ้ากังวลเรื่องข้อมูลลูกค้า เรารัน Whisper ในเครื่องของเราเองได้เลย เสียงไม่ต้องถูกส่งขึ้น cloud · แต่ถอดเสร็จช่วยตรวจชื่อคนกับตัวเลขอีกรอบนะครับ บางจุดโมเดลอาจเดาผิดหรือเติมคำที่ไม่มีใครพูด
ระวังสับสนกับ
- text-to-speech : ทิศทางตรงกันข้าม Whisper แปลงเสียงเป็นข้อความ ส่วน text-to-speech แปลงข้อความเป็นเสียงพูด (แนวเดียวกับบริการเสียงของ elevenlabs) จำง่ายๆ ว่า Whisper คือ "หูฟัง" ไม่ใช่ "ปากพูด"
- chatgpt / llm : Whisper ไม่ใช่ AI ที่คุยโต้ตอบหรือสรุปเนื้อหาได้ มันถอดเสียงอย่างเดียว ถ้าอยากได้สรุปประชุม ต้องเอาข้อความที่ Whisper ถอดแล้วไปส่งต่อให้ LLM ช่วยสรุปอีกขั้นหนึ่ง
Sources (3)
- https://github.com/openai/whisper fetched 2026-08-01
- https://en.wikipedia.org/wiki/Whisper_(speech_recognition_system) fetched 2026-08-01
- https://raw.githubusercontent.com/openai/whisper/main/whisper/tokenizer.py fetched 2026-08-01
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย