Wiki · news-analysis · confidence: medium · ⚙ auto-approved · fact-checker

Tencent Hy4 preview: โมเดลเปิดตัวใหญ่ที่สุดของ Tencent ใต้ Apache 2.0 และเคสที่ข้อมูลตรวจสอบได้กับข้อมูลที่ตรวจไม่ได้อยู่ในประกาศเดียวกัน

tencenthunyuanchinaopen-weightsapache-2moesparse-attentionbenchmarkpricingprompt-cachemedia-literacyupdated 2026-08-29

Tencent Hy4 preview: สัญญาอนุญาตที่ตรวจได้ กับคะแนนที่ตรวจไม่ได้ ในประกาศเดียวกัน

เกิดอะไรขึ้น

Tencent ประกาศและปล่อยน้ำหนักของโมเดล Hy4 preview เมื่อวันที่ 28 ส.ค. 2026 ซึ่งเป็นโมเดลตัวใหญ่ที่สุดที่บริษัทเคยปล่อยออกมา สถาปัตยกรรมเป็นแบบผู้เชี่ยวชาญย่อยหลายตัว โดยมีพารามิเตอร์รวมที่บริษัทใช้ทำการตลาดคือ 770 พันล้าน และทำงานจริงต่อหนึ่งโทเคนเพียง 49 พันล้าน (Tencent)

วันปล่อยยืนยันได้จากสามชั้นที่สอดคล้องกัน คือวันที่ของหน้าข่าวบริษัท ค่า lastModified ของคลังโมเดลที่ระบุ 2026-08-28T14:58:32Z และจำนวนไฟล์น้ำหนัก 131 ไฟล์ที่มีอยู่จริงในคลัง โดยสถานะ gated เป็นเท็จ แปลว่าโหลดได้โดยไม่ต้องขออนุญาต (Hugging Face API)

กับดักที่ต้องกันไว้ก่อนคนอื่นคือ ค่า createdAt ของคลังโมเดลนี้คือ 2026-08-27T08:52:40Z ซึ่งเป็นวันที่ตั้งคลังเปล่าไว้ล่วงหน้า ไม่ใช่วันปล่อย ใครหยิบค่านี้ไปเขียนจะได้วันผิดไปหนึ่งวัน หลักเดียวกันนี้ใช้กับทุกคลังโมเดลบนแพลตฟอร์มนี้

สัญญาอนุญาตคือข้อเดียวในประกาศนี้ที่ตรวจได้ร้อยเปอร์เซ็นต์

ไฟล์ LICENSE ในคลังโมเดลเป็นตัวบท Apache License 2.0 มาตรฐานที่ไม่ถูกดัดแปลง โดยขึ้นหัวไว้ว่า "Tencent Hy4 preview is licensed under the Apache-2.0." และ metadata ของคลังระบุ license: apache-2.0 (LICENSE)

สิ่งที่ตรวจแล้วว่า ไม่มี คือเงื่อนไขเพิ่มเติมทุกชนิดที่โมเดลเปิดค่ายจีนหลายตัวมี ไม่มีเพดานรายได้ ไม่มีเพดานจำนวนผู้ใช้ ไม่มีข้อจำกัดเขตพื้นที่ ไม่มีข้อกำหนดให้ขออนุญาตเพิ่ม และรายการไฟล์ทั้งคลังก็ไม่มีไฟล์ NOTICE ไฟล์นโยบายการใช้งาน หรือเอกสารเงื่อนไขเสริมใดๆ (รายการไฟล์)

ข้อนี้เป็นการเปลี่ยนแนวของบริษัทเอง เพราะโมเดลตระกูลนี้รุ่นก่อนหน้าใช้สัญญาอนุญาตเฉพาะของบริษัทที่มีเงื่อนไขกำกับ (tencent-hunyuan-hy3) และเป็นคนละทางกับที่ Z.ai เพิ่งเลือกในวันเดียวกัน ซึ่งย้ายจาก MIT ไปเป็นสัญญาเฉพาะที่มีเงื่อนไขรายได้ (glm-5-3) ส่วนเพดานรายได้ของค่ายจีนเจ้าอื่นบันทึกไว้ที่ open-weight-license-caps-2026

โครงสร้างที่อ่านได้จากไฟล์ตั้งค่า

ไฟล์ config.json ระบุ 78 ชั้น โดยแต่ละชั้นแบบผู้เชี่ยวชาญย่อยมีผู้เชี่ยวชาญที่เลือกได้ 256 ตัวบวกผู้เชี่ยวชาญที่ใช้ร่วมกันอีก 1 ตัว เลือกใช้ครั้งละ 8 ตัวต่อหนึ่งโทเคน และชั้นแรกเป็นชั้นแบบเดิมที่ไม่แยกผู้เชี่ยวชาญ ค่า max_position_embeddings อยู่ที่ 1,048,576 ซึ่งคือเพดานบริบทหนึ่งล้านโทเคนที่ประกาศไว้ (config.json)

กลไกความสนใจที่บริษัทเรียกว่า Gated DeepSeek Sparse Attention ยืนยันได้จากไฟล์ตั้งค่าเช่นกัน โดยมีค่า use_dsa และ gated_mla เป็นจริง ชนิดของชั้นระบุเป็น deepseek_sparse_attention และค่า index_topk อยู่ที่ 2048

จุดที่ตัวเลขไม่ตรงกันและควรบันทึกไว้คือ เมื่อรวมขนาดจากไฟล์น้ำหนักจริงจะได้ราว 779.96 พันล้านพารามิเตอร์ ซึ่งสูงกว่าเลข 770 พันล้านที่ใช้ทำการตลาดอยู่ราวสิบพันล้าน ส่วนต่างแบบนี้เกิดขึ้นได้จากหลายสาเหตุและยังไม่มีคำอธิบายจากผู้ผลิต จึงไม่ควรเดาเหตุผลลงไป วิธีเขียนที่ปลอดภัยคือใช้เลข 770 พันล้านพร้อมระบุว่าเป็นตัวเลขที่ผู้ผลิตประกาศ

ราคา และตัวเลขที่ตัดสินค่าใช้จ่ายจริง

ราคาที่ประกาศคือ 0.834 ดอลลาร์ต่อล้านโทเคนขาเข้า 2.501 ดอลลาร์ต่อล้านโทเคนขาออก และ 0.042 ดอลลาร์ต่อล้านโทเคนสำหรับส่วนที่อ่านจากแคชได้ ราคาในจีนคือ 6 และ 18 หยวนต่อล้านโทเคน ตัวเลขชุดนี้ตรงกันระหว่างหน้าข่าวของบริษัทกับหน้าของผู้ให้บริการตัวกลาง ซึ่งเป็นสองแหล่งที่เป็นอิสระจากกัน (OpenRouter)

ตัวเลขที่ควรอ่านเป็นตัวหลักไม่ใช่ราคาขาเข้าหรือขาออก แต่คือราคาของส่วนที่อ่านจากแคชได้ ซึ่งอยู่ที่ราวหนึ่งในยี่สิบของราคาขาเข้าปกติ เพราะระบบที่ทำงานแบบ agent ต้องส่งบริบทเดิมกลับเข้าไปทุกรอบ สัดส่วนของโทเคนที่อ่านจากแคชจึงมักสูงกว่าโทเคนใหม่มาก และเป็นตัวที่ตัดสินบิลปลายเดือนมากกว่าราคาหน้าประกาศ

ช่องทางที่ใช้ได้คือเรียกผ่านชุดคำสั่งของบริการคลาวด์ของบริษัทเองและผ่านผู้ให้บริการตัวกลาง โดยเปิดให้ใช้ฟรีบนเครื่องมือของบริษัทสองตัวเป็นเวลาสองสัปดาห์ ข้อควรระวังที่คนจะเอาไปใช้จริงควรรู้คือบนผู้ให้บริการตัวกลางนั้นมีผู้ให้บริการรายเดียวคือคลาวด์ของ Tencent เอง โดยความพร้อมใช้งานในวันเปิดตัวอยู่ที่ราว 86 เปอร์เซ็นต์ แปลว่ายังไม่มีทางเลือกสำรองถ้าบริการนั้นล่ม

คะแนนเบนช์มาร์กทั้งชุดยังตรวจไม่ได้

นี่คือจุดที่ต่างจากหัวข้อสัญญาอนุญาตอย่างสิ้นเชิง และเป็นเหตุผลที่หน้านี้ตั้งระดับความเชื่อมั่นไว้ที่ปานกลาง

ตัวเลขที่สื่อทุกเจ้ารายงานตรงกันคือ Terminal Bench 2.1 ที่ 85.4 DeepSWE ที่ 64.3 ซึ่งขยับจาก 28.0 ของรุ่นก่อนหน้า GPQA Diamond ที่ 92.3 SWE-Bench Pro ที่ 65.7 และ SWE-Bench Multilingual ที่ 82.9 แต่ตัวเลขชุดนี้ไม่ปรากฏเป็นข้อความในแหล่งทางการใดเลย ไม่อยู่ในเอกสารของคลังโมเดล ไม่อยู่ในหน้าข่าวของบริษัท มันอยู่ในไฟล์ภาพชื่อ assets/benchmark.jpg เท่านั้น ส่วนหน้าเว็บงานวิจัยของบริษัทประกอบด้วย JavaScript ทั้งหมด ตัวดึงหน้าเว็บอ่านได้เพียงคำว่า Tencent Hy

ผลคือไม่มีใครนอกบริษัทตรวจตัวเลขเหล่านี้ได้ แม้แต่ในระดับการอ่านทวนว่าตัวเลขในภาพคือของโมเดลตัวไหน เว็บรวมข้อมูลโมเดลที่รายงานตัวเลขชุดนี้ต่อ ระบุเองว่าเป็นผลการทดสอบของผู้ผลิต (DataLearner) และกระดานที่แสดงคะแนนของโมเดลนี้ติดป้ายทุกแถวว่าเป็นตัวเลขที่ผู้ให้บริการรายงานเองและยังเป็นค่าชั่วคราว

คำว่าแซง DeepSeek ที่ต้องอ่านให้ครบสี่ชั้น

คำอ้างที่ถูกยกไปพาดหัวมากที่สุดคือบริษัทระบุว่าโมเดลนี้แซง DeepSeek V4 Pro บน Terminal Bench 2.1 และทำคะแนนเสมอ Claude Opus 5 ซึ่งเป็นคำอ้างของบริษัทจริง แต่มีหลักฐานสี่ชั้นที่ทำให้ยังสรุปตามนั้นไม่ได้

ชั้นแรกคือคะแนนของ DeepSeek V4 Pro บนชุดทดสอบเดียวกันมีสองค่าที่คร่อมเลข 85.4 อยู่ คือ 87.9 ที่ผู้ผลิตรายงานเอง กับ 78.7 ที่ผู้วัดอิสระวัดได้ (orcarouter) แปลว่าคำว่าแซงจริงหรือไม่ ขึ้นกับว่าหยิบเลขไหนมาเทียบ

ชั้นที่สองคือท่อนที่บอกว่าเสมอ Claude Opus 5 ขัดกับตัวเลขของผู้วัดอิสระ ซึ่งให้ Claude Opus 5 ที่ 89.1 และ GPT-5.6 Sol ที่ 89.5 ทั้งคู่สูงกว่า 85.4 อย่างชัดเจน

ชั้นที่สามคือชื่อชุดทดสอบเดียวกันแต่คนละสนาม กระดานทางการของ Terminal Bench มีคะแนนสูงสุดอยู่ที่ 83.8 เปอร์เซ็นต์ และไม่มีทั้ง Hy4 preview, DeepSeek V4 Pro หรือ Claude Opus 5 อยู่บนกระดานเลย ขณะที่กระดานของผู้วัดอิสระอีกเจ้ามีหลายตัวเกิน 88 ตัวเลข 85.4 จึงเป็นการวัดบนการตั้งค่าของ Tencent เอง เอาไปวางเทียบข้ามกระดานไม่ได้

ชั้นที่สี่คือมีชุดทดสอบที่โมเดลนี้แพ้อยู่ในตารางเดียวกัน คือ NL2Repo ที่ได้ 58.9 เทียบกับ 61.5 ของ DeepSeek V4 Pro การหยิบ Terminal Bench ขึ้นพาดหัวจึงเป็นการเลือกสนามที่ชนะ ซึ่งเป็นสิ่งที่ผู้ผลิตทุกเจ้าทำเป็นปกติ

การทดสอบแบบปิดชื่อรุ่นที่ต้องอ่านทั้งสองด้าน

ตัวเลขที่บริษัทใช้เป็นจุดขายหลักแทนคะแนนเบนช์มาร์กคือการทดสอบแบบปิดชื่อรุ่น ซึ่งใช้ผู้เชี่ยวชาญ 163 คนให้คะแนนงานวิศวกรรม 203 งาน แล้วได้ค่าเฉลี่ย 2.99 จากคะแนนเต็ม 4 เทียบกับ 2.94 ของ Kimi K3 และ 2.92 ของ GLM-5.3

สิ่งที่ต้องอ่านคู่กันเสมอมีสองข้อ ข้อแรกคือระยะห่างอยู่ที่ราวห้าถึงเจ็ดในร้อยของคะแนนเต็มสี่ ซึ่งเล็กมาก ข้อที่สองคือรายงานเดียวกันระบุอัตราการแพ้ไว้ด้วย คือแพ้ GLM-5.3 อยู่ 40.4 เปอร์เซ็นต์ของงาน และแพ้ Kimi K3 อยู่ 40.9 เปอร์เซ็นต์ ตัวเลขชุดนี้อ่านเป็นสูสีมากกว่าชนะขาด และเป็นการทดสอบภายในที่บริษัทเลือกงานเองและให้พนักงานของตัวเองให้คะแนน

สิ่งที่ผู้ผลิตพูดเองว่าโมเดลนี้ยังไม่ดี

บริษัทเขียนไว้ในเอกสารของคลังโมเดลเองว่านี่เป็นรุ่นแรกเริ่ม ยังมีช่องว่างเหลืออยู่ทั้งในขั้นฝึกตั้งต้นและขั้นฝึกต่อ และปล่อยออกมาทั้งที่รู้ปัญหาอยู่ โดยระบุสองอาการคือใช้เวลาคิดนานเกินจำเป็นกับงานซับซ้อน และมีแนวโน้มตรวจงานของตัวเองซ้ำมากเกินไป (model card)

คำอ้างอีกข้อที่บริษัทระบุคือโมเดลตัวนี้เข้าไปมีส่วนในการพัฒนาตัวเองเป็นครั้งแรก โดยช่วยวิเคราะห์คอขวดของระบบให้บริการคำตอบแล้วเสนอการรวมการคำนวณและการปรับการสื่อสารระหว่างเครื่อง ซึ่งบริษัทระบุว่าทำให้ปริมาณงานที่ทำได้ตลอดสายเพิ่มขึ้น 31.8 เปอร์เซ็นต์เทียบกับค่าตั้งต้น

ขอบเขตของเลข 31.8 เปอร์เซ็นต์ต้องเขียนให้ตรง มันเป็นตัวเลขของระบบให้บริการคำตอบเท่านั้น ส่วนที่บริษัทระบุว่าโมเดลช่วยปรับวิธีฝึก กลยุทธ์ข้อมูล กรอบการประเมิน และคำสั่งระดับล่าง เป็นคนละประโยคและไม่มีตัวเลขกำกับ การเขียนรวบว่าปรับทั้งการฝึกและการให้บริการแล้วได้ 31.8 เปอร์เซ็นต์จึงผิด

เรื่องที่คนเข้าใจผิดบ่อย

มีคำอ้างที่แพร่กระจายบนโซเชียลว่าโมเดลนี้ประสานงานเซสชันของเครื่องมือเขียนโค้ดของค่ายอื่นหลายเซสชันพร้อมกัน ประเมินผลแล้วปรับทิศทางวิจัย และทำได้ดีกว่าเครื่องมือนั้นที่ทำงานลำพังบนแปดชุดทดสอบ

ตรวจแล้วพบว่า ชื่อเครื่องมือนั้นไม่ปรากฏในหน้าข่าวของบริษัท ในเอกสารของคลังโมเดล ในคลังโค้ด หรือในรายงานของสำนักข่าวใดเลย แหล่งเดียวคือโพสต์บนโซเชียลของบัญชีหนึ่งที่เขียนว่า Tencent บอกไว้ คำอ้างนี้จึงยังยืนยันไม่ได้และไม่ควรนำไปเล่าต่อ ถ้อยคำทางการที่ใกล้เคียงที่สุดอ่อนกว่านี้มากและไม่มีชื่อเครื่องมือของใครอยู่ในนั้น

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย