Gemini 3.8 Live และ 3.8 Live Extended Thinking โมเดลเสียงต่อเสียงที่ Google เปิดใช้งานทั่วไป 15 ก.ย. 2026
Gemini 3.8 Live กับ 3.8 Live Extended Thinking
เกิดอะไรขึ้น
บันทึกการเปลี่ยนแปลงของ Gemini API ลงวันที่ 15 ก.ย. 2026 ระบุหัวข้อว่า Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking เปิดใช้งานทั่วไปแล้ว พร้อมคำอธิบายว่าเป็น "two new audio-to-audio models for real-time voice applications using the Live API" (Gemini API changelog)
จุดที่ต้องแยกให้ชัดคือบล็อกประกาศของ Google ไม่ได้ใช้คำว่าเปิดใช้งานทั่วไปเลย ใช้คำว่ากำลังทยอยปล่อยตั้งแต่วันนี้ สถานะเปิดใช้งานทั่วไปมาจากบันทึกการเปลี่ยนแปลงและจากหน้ารายชื่อโมเดลที่ระบุสถานะทั้งสองตัวว่า Stable (Google Blog · models)
ทั้งสองเป็นโมเดลใหม่จริง ไม่ใช่การเปลี่ยนชื่อหรือเลื่อนสถานะของรุ่นทดลองเดิม การไล่ดูบันทึกการเปลี่ยนแปลงย้อนหลังไม่พบรายการใดที่มีคำว่า 3.8 Live มาก่อน ตัวที่ถูกแทนที่เป็นคนละโมเดลคือ gemini-3.1-flash-live-preview ซึ่งถูกทำเครื่องหมายเป็นรุ่นเก่าพร้อมข้อความแนะนำให้ย้ายมาใช้ Gemini 3.8 Live
ทั้งสองตัวต่างกันอย่างไร
Gemini 3.8 Live วางไว้สำหรับงานที่ต้องคุมต้นทุนและปริมาณ ถ้อยคำในประกาศคือ "Built for scale and cost efficiency, combining conversational intelligence with fluid dialogue and visual grounding"
Gemini 3.8 Live Extended Thinking วางไว้สำหรับงานที่ต้องคิดหนักกว่า ถ้อยคำคือ "3.8 Live Extended Thinking reasons and speaks simultaneously" คือคิดเบื้องหลังไปพร้อมกับที่ยังพูดคุยอยู่
ตัวเลขที่ต้องอ่านให้ถูก
คะแนนหลักที่ Google ยกมาสำหรับรุ่น Extended Thinking คือ 82.6 บนดัชนี Artificial Analysis Speech to Speech Index ซึ่งเป็นดัชนีรวมในช่วง 0 ถึง 100 ไม่ใช่ค่าร้อยละ ทั้งบล็อกของ Google และหน้าของ Artificial Analysis เขียนเลขนี้โดยไม่มีเครื่องหมายร้อยละ สื่อบางเจ้าที่เขียนว่า 82.6 เปอร์เซ็นต์นั้นผิด (Artificial Analysis)
จุดสำคัญที่คนอ่านข่าวมักพลาดคือดัชนีตัวนี้เป็นค่าเฉลี่ยถ่วงน้ำหนักเท่ากันของสี่องค์ประกอบ คือ Speech Reasoning (Big Bench Audio), Agentic Performance (τ-Voice), Arena Preference และ Task Success Rate ดังนั้นตัวเลข Big Bench Audio 97.7 เปอร์เซ็นต์ และ τ-Voice 68.6 เปอร์เซ็นต์ ที่ Google ยกมาประกบ เป็นองค์ประกอบย่อยของ 82.6 ตัวเดียวกัน ไม่ใช่ผลสามชิ้นที่แยกจากกัน การเรียงสามเลขนี้ต่อกันเป็นรายการความสำเร็จจึงนับซ้ำ
ตัวเลข Big Bench Audio ยังไม่ตรงกันทุกหลักด้วย Google เขียน 97.7 เปอร์เซ็นต์ ขณะที่หน้าของ Artificial Analysis แสดง 98 เปอร์เซ็นต์ ซึ่งน่าจะเป็นการปัดเศษ
อีกตัวเลขหนึ่งคือ 35.1 เปอร์เซ็นต์บนงานธนาคารผ่านเสียงในชุดทดสอบของ Sierra ซึ่ง Google เรียกในประกาศของตัวเองว่า τ-Voice-banking ข้อเท็จจริงที่ตรวจได้คือ Sierra ไม่ได้ใช้ชื่อนี้ กระดานของ Sierra มี τ³-Voice ที่แบ่งเป็นสี่หมวดรวมหมวดธนาคาร และมี τ³-Banking ซึ่งเป็นกระดานฝั่งข้อความคนละตัว ที่สำคัญกว่าคือหากระดานของ Sierra แล้วไม่พบโมเดลทั้งสองรุ่นและไม่พบค่า 35.1 เลย ตัวเลขนี้จึงเป็นตัวเลขที่ Google รายงานฝ่ายเดียว (taubench)
อันดับบนกระดานเสียงที่ต้องอ่านทั้งภาพ
ณ 16 ก.ย. 2026 บน Speech Agent Arena ของ Artificial Analysis อันดับหนึ่งคือ Gemini 3.1 Flash Live Minimal ที่ Elo 1096 ซึ่งเป็นโมเดลของ Google เองอีกตัวและเป็นรุ่นเล็กกว่า อันดับสองคือ Gemini 3.8 Live ที่ Elo 1083
จุดที่ประกาศไม่ได้บอกคือ Gemini 3.8 Live Extended Thinking ซึ่งนำบนดัชนีรวม กลับอยู่อันดับราวสิบบนกระดานเดียวกันนี้ที่ Elo 990 การอ่านว่าทั้งสองรุ่นอยู่ระดับหัวแถวเท่ากันจึงคลาดเคลื่อน อันดับบนกระดานเหล่านี้เปลี่ยนได้ตลอดเวลา ตัวเลขทั้งหมดในหัวข้อนี้เป็นค่า ณ วันที่ระบุ (Speech Agent Arena)
ภาษาไทยอยู่ในรายชื่อ แต่เอกสารของ Google ขัดกันเอง
ประกาศเขียนว่า "It automatically detects and transitions between 97 supported languages mid-conversation" และหน้าความสามารถของ Live API ลงรายชื่อครบทั้ง 97 ภาษา โดยมีภาษาไทยอยู่ในรายชื่อด้วย รหัส th (Live API capabilities)
ข้อที่ต้องกำกับไว้ทุกครั้งคือหน้าภาพรวมของ Live API ในเอกสารชุดเดียวกันยังเขียนว่ารองรับ 70 ภาษา และแปลเสียงต่อเสียงได้ 70 ภาษาขึ้นไป (Live API overview) ตัวเลขสองตัวนี้ขัดกันอยู่ในเอกสารของผู้ผลิตเอง ใครที่จะวางแผนระบบจริงต้องรู้ว่าเลข 97 มาจากหน้าความสามารถกับบล็อก ส่วน 70 มาจากหน้าภาพรวม
อีกข้อคือประโยคเรื่อง 97 ภาษาเขียนไว้ในระดับ Live API ไม่ได้ผูกกับรหัสโมเดลของ 3.8 Live โดยตรง
ราคา
บล็อกประกาศไม่มีตัวเลขราคา แต่หน้าราคาของ Gemini API ระบุไว้แล้ว และคิดเท่ากันทั้งสองรุ่น คือข้อความเข้า 0.75 ดอลลาร์ต่อล้านโทเคน ข้อความออกซึ่งรวมโทเคนการคิดด้วย 4.50 ดอลลาร์ต่อล้านโทเคน เสียงเข้า 3 ดอลลาร์ต่อล้านโทเคนหรือ 0.005 ดอลลาร์ต่อนาที และเสียงออก 12 ดอลลาร์ต่อล้านโทเคนหรือ 0.018 ดอลลาร์ต่อนาที มีระดับใช้ฟรีด้วย (pricing)
เพราะราคาต่อหน่วยเท่ากัน คำว่าคุ้มต้นทุนของ Gemini 3.8 Live จึงเป็นการวางตำแหน่งเรื่องขนาดงาน ไม่ใช่ราคาต่อโทเคนที่ถูกกว่า สิ่งที่ทำให้บิลของรุ่น Extended Thinking แพงกว่าคือโทเคนการคิดถูกคิดเป็นข้อความออกที่อัตรา 4.50 ดอลลาร์ต่อล้านโทเคน
ขนาดหน้าต่างบริบทที่ยังไม่มีใครตอบได้
หน้าความสามารถของ Live API ระบุว่าเซสชันมีเพดานบริบทที่ 128,000 โทเคนสำหรับโมเดลที่ให้เสียงออกแบบเนทีฟ และ 32,000 โทเคนสำหรับโมเดล Live API ตัวอื่น พร้อมเพดานเวลาเซสชันที่ 15 นาทีสำหรับเสียงอย่างเดียว และ 2 นาทีสำหรับเสียงพร้อมวิดีโอ
แต่หน้านั้นไม่ได้ระบุว่าโมเดล 3.8 Live ทั้งสองตัวอยู่กลุ่มไหน และไม่มีรายชื่อว่ารหัสโมเดลใดนับเป็นโมเดลเสียงออกแบบเนทีฟ ส่วนบล็อกก็ไม่พูดถึงขนาดบริบทเลย ดังนั้นการเขียนว่าโมเดลสองตัวนี้ได้ 128,000 โทเคนคือการเดา ห้ามอ้างจนกว่า Google จะระบุ
ใช้ได้ที่ไหนบ้าง
ทั้งสองตัวอยู่ใน Gemini API และ Google AI Studio และอยู่ในสถานะพรีวิวแบบปิดใน Gemini Enterprise
Gemini 3.8 Live อยู่ใน Search Live ด้วย ส่วน Extended Thinking อยู่ใน Gemini Live และในฝั่ง Workspace นั้นแยกสองระดับ คือใน Docs เฉพาะผู้ใช้แพ็กเกจ Google AI Pro และ Ultra ขณะที่ใน Gmail และ Keep เปิดให้ผู้ใช้แพ็กเกจ Google AI ทุกระดับ
เรื่องที่คนเข้าใจผิดบ่อย
การที่ภาษาไทยอยู่ในรายชื่อภาษาที่รองรับ ไม่ได้แปลว่าทำงานภาษาไทยได้ดี สิ่งที่ยืนยันได้จากเอกสารมีเพียงว่าภาษาไทยอยู่ในตารางรหัสภาษาเท่านั้น ไม่มีแหล่งใดให้คะแนนคุณภาพภาษาไทย ไม่มีชุดทดสอบภาษาไทย และชุดทดสอบทั้งหมดที่ Google อ้างเป็นภาษาอังกฤษ การอนุมานว่าเลข 82.6 แปลว่าเก่งภาษาไทยจึงไม่มีหลักฐานรองรับ
คะแนน 35.1 เปอร์เซ็นต์บนงานธนาคารผ่านเสียงเป็นตัวเลขที่ควรใช้ตัดสินใจมากกว่าเลขคุณภาพเสียง สำหรับใครที่จะเอาไปทำงานบริการลูกค้าที่มีขั้นตอนและกฎเยอะ
สิ่งที่ยังไม่มีหลักฐาน
Google ไม่ได้เผยแพร่คะแนนแยกรายภาษา จึงไม่มีทางรู้จากเอกสารว่าคุณภาพภาษาไทยอยู่ระดับไหนเทียบกับภาษาอังกฤษ
ยังไม่มีผู้วัดอิสระรายใดเผยแพร่ผลของสองรุ่นนี้นอกจาก Artificial Analysis และตัวเลขฝั่ง Sierra ยังยืนยันจากกระดานของ Sierra เองไม่ได้
คำถามที่ยังไม่มีคำตอบ
โมเดลสองตัวนี้อยู่กลุ่มเพดานบริบท 128,000 หรือ 32,000 โทเคน
เลขจำนวนภาษาที่ถูกต้องคือ 97 หรือ 70 และ Google จะแก้เอกสารหน้าไหนให้ตรงกัน
ดูเพิ่มที่ gemini-3-8-flash-2026 · gpt-live · gemini-3-7-flash
Sources (8)
- https://ai.google.dev/gemini-api/docs/changelog fetched 2026-09-16
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ fetched 2026-09-16
- https://ai.google.dev/gemini-api/docs/models fetched 2026-09-16
- https://ai.google.dev/gemini-api/docs/live-api/capabilities fetched 2026-09-16
- https://ai.google.dev/gemini-api/docs/live-api fetched 2026-09-16
- https://ai.google.dev/gemini-api/docs/pricing fetched 2026-09-16
- https://artificialanalysis.ai/speech-to-speech fetched 2026-09-16
- https://taubench.com/#leaderboard?benchmark=voice fetched 2026-09-16
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย