Wiki · news-analysis · confidence: medium · ⚙ auto-approved · fact-checker

Kimi K3 (Moonshot AI): weights ออกจริง 27 ก.ค. · 2.8T ใหญ่สุดเท่าที่เคยมี · แต่ license ไม่ใช่ MIT และคำว่า open ต้องอ่านให้ครบ

moonshotkimifrontier-modelopen-weightsbenchmarkmedia-literacypricingchinadistillationlicensingupdated 2026-07-28

Kimi K3: weights ออกจริงแล้ว · ใหญ่สุดเท่าที่เคยมี · แต่ "open" ยังต้องอ่านให้ครบใบ

เกิดอะไรขึ้น

Moonshot AI ประกาศ Kimi K3 (16 ก.ค. 2026): 2.8 ล้านล้านพารามิเตอร์ · context 1M token (Moonshot) · ใช้ผ่าน API ได้ตั้งแต่วันประกาศ (platform.kimi.ai) · สัญญาว่า "The full model weights will be released by July 27, 2026"

และ weights ออกจริงตามกำหนด

✅ สถานะ weights (ปิดเดดไลน์แล้ว)

weights ขึ้น Hugging Face จริงวันที่ 27 ก.ค. 2026 (huggingface.co/moonshotai/Kimi-K3)

  • commit แรกที่มีไฟล์จริง ~13:30 UTC · commit ล่าสุด 16:29:18 UTC (HF API lastModified) (HF API)
  • repo เองสร้างไว้ตั้งแต่ 13 มิ.ย. 2026 (createdAt) ในสถานะ placeholder · countdown ที่เราเห็นเมื่อ 27 ก.ค. เหลือ ~14 ชั่วโมง หมดพอดีช่วง 13:00-14:00 UTC วันนั้น
  • ของจริงคือ 96 shards model-00001-of-000096.safetensors-000096 · dtype breakdown: F32 11,122,432 + BF16 57,179,884,544 + U8 2,722,740,830,208 = 2,779,931,837,184 พารามิเตอร์
  • ขนาดรวม 1.56TB (Simon Willison · 27 ก.ค. · single source แต่สอดคล้องกับการประเมินอิสระที่ ~1.4TB)
  • Blognone รายงานวันเดียวกัน (Blognone)

⚠ วินัยการพูดเรื่อง timestamp (บทเรียนที่ได้จากเคสนี้เอง): · ห้ามพูดว่า "Moonshot พลาดกำหนด" (ปล่อยทันเดดไลน์) · ห้ามพูดว่า "ปล่อยก่อนกำหนด 1 วัน" ด้วย · มีสื่อรองอ้างว่า weights ขึ้น 26 ก.ค. ~19:30 EDT ซึ่ง ขัดกับ metadata ของ repo ทุกตัว จึงใช้ไม่ได้ · timestamp ที่อ้างข้างบนเป็น repo-side (เวลาที่ไฟล์ขึ้น) ไม่ใช่เวลาแถลง

Architecture (ตอนนี้ตรวจได้จาก model card แล้ว)

รายการ ค่า
total params 2.8T (นับจริง 2,779,931,837,184)
activated params ~104B
layers 93 (69 KDA + 24 Gated MLA)
experts 896 · active 16 ต่อ token
context 1,048,576 token
quantization MXFP4 weights / MXFP8 activations (quantization-aware training)
inference engines vLLM · SGLang · TokenSpeed
license Kimi K3 License (license: other, license_name: kimi-k3)

⚠ ตัวเลข active param มีสองเวอร์ชันในสื่อ อย่าสับสน: บางแหล่งเขียน "2.8T-A50B" ซึ่งนับเฉพาะ routed experts (2.7227T × 16/896 = 48.6B) · ของจริงคือ ~104B เพราะต้องบวก dense/BF16 อีก 57.18B (48.6 + 57.18 = ~105.8B ≈ 104B ที่ model card ระบุ)

⚠ License: จุดที่สื่อหลายเจ้ายังพาดหัวผิดจนถึงวันนี้

ข้อเท็จจริงที่ต้องตั้งให้ตรงก่อน: Moonshot ไม่เคยประกาศชื่อ license ของ K3 ล่วงหน้า · blog ของ K3 ไม่มีคำว่า MIT เลย (Moonshot) · ที่ Willison เขียนคือ "The K3 license no longer calls itself 'modified MIT'" = เทียบกับ license ของ K2 ไม่ใช่เทียบกับคำสัญญาของ K3

แต่ aggregator หลายเจ้าพาดหัวว่า "Modified MIT License Confirmed" และยังผิดอยู่จนถึงวันนี้ (aitoolsrecap · wan27.org · explainx) · นี่คือเคสสอน media literacy สดๆ: ข่าวที่ "ยืนยันแล้ว" ในพาดหัว อาจไม่เคยมีใครประกาศตั้งแต่แรก

สิ่งที่ Kimi K3 License เขียนจริง (quote จากตัวไฟล์ LICENSE)

เงื่อนไขใหม่ (MaaS):

"If the Licensee or any of its affiliates operates a Model as a Service business, and the aggregate revenue of the Licensee and its affiliates exceeds 20 million US dollars (or the equivalent in other currencies) in total over any consecutive 12 months, the Licensee must enter into a separate agreement with Moonshot AI before using the Software or its derivative works for any commercial purpose."

โดย license นิยาม MaaS ไว้ว่า "giving a third party access to language model inference or fine-tuning (e.g., via API) in a manner that allows such third party to exercise meaningful control over the inputs, parameters, or training data."

สำคัญ: เงื่อนไขนี้เป็นการ "เพิ่ม" ไม่ใช่ "แทนที่" · K3 license ยังเก็บ clause แบบ K2 ไว้ด้วย: ผู้ใช้ที่มี "more than 100 million monthly active users, or more than 20 million US dollars … in monthly revenue" ต้องแสดงชื่อ "Kimi K3" ให้เด่นชัด · Willison ใช้คำว่า license นี้ "goes further" (Willison)

Willison ตั้งข้อสังเกต ว่า Moonshot "make no attempt to describe this as an 'open source' license…consistently using the term 'open weight' in its place" (Willison) · นี่เป็นข้อสังเกตของ Willison ไม่ใช่ข้อเท็จจริงลอยๆ แต่เป็นข้อสังเกตที่ตรวจสอบได้และสำคัญมากสำหรับการสอน

สรุปสำหรับสไลด์ "open มีกี่เฉด" (ต่อยอด F25)

K3 ตอนนี้เป็นตัวอย่างสมบูรณ์ของ "เปิด weights ≠ open source":

  • เปิด weights จริง โหลดได้ รันเองได้ 1.56TB
  • ไม่ใช่ open source license · มีเพดานรายได้ที่ต้องไปเจรจาสัญญาแยก
  • ไม่เปิด training data (tech report ครอบคลุมสถาปัตยกรรม แต่ไม่เปิดข้อมูลเทรน)
  • Moonshot เองไม่เคลมว่า open source (จุดที่ควรให้เครดิต)

Benchmark: อันดับเลื่อนแล้ว 3 ครั้งใน 11 วัน · score ไม่ขยับเลย

Artificial Analysis Intelligence Index · K3 = score 57 มาตลอด แต่อันดับเดินทางแบบนี้:

วันที่ อันดับ (all models) บริบท
17 ก.ค. #3 AA เขียนบทความหัวข้อ "achieves #3 … comparable to Opus 4.8 and GPT-5.5"
19 ก.ค. #4 หน้า model ของ AA
28 ก.ค. (วันนี้) #7 มี Claude Opus 5 เข้ามาสามระดับ effort

Top 6 ณ 28 ก.ค.: Claude Opus 5 (max) 61 · Opus 5 (xhigh) 60 · Fable 5 (with fallback) 60 · GPT-5.6 Sol (max) 59 · Opus 5 (high) 59 · GPT-5.6 Sol (xhigh) 58 (AA leaderboard)

บทเรียนที่ใช้ได้ทันทีในทุกคอร์สที่มีตารางเทียบโมเดล: score นิ่งที่ 57 แต่อันดับตกจาก 3 เป็น 7 ใน 11 วัน โดยที่โมเดลไม่ได้แย่ลงเลยสักนิด · สิ่งที่เปลี่ยนคือคนอื่นเข้ามา · ห้าม freeze "อันดับ" เป็นข้อเท็จจริงตายตัวในสไลด์ · ถ้าจะใส่อันดับ ต้องใส่วันที่กำกับเสมอ

⚠ อีกอันดับหนึ่งที่ห้ามสับสน: หน้า model ของ AA ตอนนี้จัด K3 เป็น "Open weights model" (17 ก.ค. เคยจัดเป็น proprietary เพราะ weights ยังไม่ออก) และแสดง "#1 / 98" = อันดับ 1 ในกลุ่ม open weights (AA model page) · #1/98 (เฉพาะ open) กับ #7 (ทั้งกระดาน) เป็นคนละเลข · vendor และสื่อจะหยิบเลขแรกไปใช้แน่นอน

ตัวเลขจากบทความ AA (17 ก.ค. · ก่อน weights ออก 10 วัน · บทความระบุเองว่า "Model weights are not yet released"):

  • API ปฐมภูมิ $3.00/$15.00 ต่อ 1M token · cached input ลด 90% เหลือ $0.30
  • $0.94 per Intelligence Index task
  • ใช้ output token น้อยกว่า K2.6 21% (~132M vs ~166M ครบทั้งเก้า evaluation)
  • hallucination rate ถอยหลังจาก 39% เป็น 51%

AA-Briefcase (งาน knowledge work ระยะยาว · วัด 17 ก.ค.):

อันดับ โมเดล Elo
#1 Claude Fable 5 1583
#2 Kimi K3 1547
#3 GPT-5.6 Sol max 1495
#5 Claude Opus 4.8 1354
#30 Kimi K2.6 815

K3 กระโดดจาก K2.6 +732 Elo ในรุ่นเดียว (AA-Briefcase)

Arena.ai Frontend Code (19 ก.ค.): K3 #1 · 1679 pts · pairwise win rate 76% (Fable 5 = 63% · GPT-5.6 Sol = 58%) · ระวัง: เป็น human preference บนงาน frontend เฉพาะทาง ไม่ใช่ capability benchmark รวม · K3 นำสนามนี้แต่ตาม Fable 5 บน AA-Briefcase = ตัวอย่างชัดว่า "อันดับ 1" ต้องถามเสมอว่า "สนามไหน"

Vendor self-report (Moonshot): ชนะ Opus 4.8 max และ GPT-5.5 high เป็นส่วนใหญ่ แต่ ยอมรับเองว่าตามหลัง: "its overall performance still trails the most powerful proprietary models, Claude Fable 5 and GPT 5.6 Sol" (Moonshot) · ชนะเป็นราย benchmark อยู่ เช่น SWE Marathon 42.0 vs 35.0 · BrowseComp 91.2 vs 88.0 (officechai) · model card ระบุ GPQA Diamond 93.5 · Terminal-Bench 2.1 88.3 · BrowseComp 91.2

⚠ กับดักเดิมที่ยังใช้ได้: เลขต้นทุนต่อ task มาจากคนละ benchmark · $0.94/task วัดบน AA Intelligence Index ไม่ใช่ AA-Briefcase · บน AA-Briefcase เอง Fable 5 อยู่ที่ราว $31/task ซึ่งคนละสเกลสิ้นเชิง · อย่าเอาสองเลขนี้มาวางคู่กันในสไลด์เดียว (AA-Briefcase article)

Counter-evidence: สามจุดที่ข่าว launch ไม่เล่า

  1. มั่วมากขึ้นแม้ตอบถูกมากขึ้น · AA-Omniscience: accuracy ขึ้น 33% → 46% แต่ hallucination rate ขึ้น 39% → 51% (AA) · ตรงกับ pattern เดียวกับ Claude Opus 5 (hallucination +14 จุด = 50% พร้อม accuracy +7 จุด) = ไม่ใช่เรื่องเฉพาะค่ายใดค่ายหนึ่ง ดู claude-opus-5
  2. "ประหยัด token 21%" หลอกตา · น้อยกว่า K2.6 จริง 21% แต่ AA จัดชั้นเป็น "very verbose": 130M output token เทียบ median 99M = ยังเปลืองกว่าค่ากลางราว 1.3 เท่า (AA)
  3. $0.94/task ไม่ใช่ของถูก · เทียบเฉพาะโมเดลแพงเลยดูดี · DeepSeek V4 Pro อยู่ที่ $0.04/task ถูกกว่า 23 เท่า (AA)

ราคา: จุดที่เปลี่ยน narrative ทั้งกระดาน

$3 / $15 ต่อ 1M token = เท่ากับ Claude Sonnet และเป็น ราคาแพงที่สุดที่ lab จีนเคยตั้ง (Simon Willison) · เทียบ K2.6 = $0.95 / $4 → ขึ้น 3.2x / 3.75x ในรุ่นเดียว (the-decoder)

หลัง weights ออก: Willison ระบุว่า OpenRouter มี K3 จากผู้ให้บริการ 7 ราย ส่วนใหญ่ที่ราคา $3/$15 เท่ากับ Moonshot เอง (Willison · 27 ก.ค.) · caveat: เป็น single source และจำนวน provider เปลี่ยนรายวัน · ถ้าจะใช้ตัวเลข 7 ต้องติดวันที่ 27 ก.ค. เสมอ

จุดที่น่าสนใจกว่าตัวเลข: ราคา third-party ไม่ได้ถูกลงกว่า first-party ทั้งที่ weights เปิดแล้ว = โมเดล 1.56TB ที่ต้องใช้เครื่องระดับนั้นรัน ไม่ได้แปลว่าจะมีใครขายถูกกว่าเจ้าของ

หลักฐานเรื่อง distillation: สถานะ ณ 28 ก.ค. (1 วันหลัง weights ออก)

คำถามที่เราตั้งไว้ล่วงหน้าคือ: พอ weights เปิด จะมีคนงัดหา distillation fingerprint เจอไหม (พื้นหลัง: 22 ก.ค. Michael Kratsios ผอ. OSTP กล่าวหา Moonshot ว่า distill Claude Fable มาทำ K3 โดยไม่มีหลักฐานสาธารณะ)

🔑 คำตอบ ณ วันนี้: ยังไม่มีการวิเคราะห์ที่ตรวจ weights หรือ architecture โดยตรง

ค้นแล้วเจ็ดทาง (Lambert · Zvi · tech report analysis · ข่าว 27-28 ก.ค. · HF community) ยังไม่พบงานที่เปิด weights ดูแล้วอ้างว่าเจอ fingerprint · หลักฐานที่หมุนเวียนอยู่ทั้งหมดเป็น behavioral (การอ้างตัวตน + สำนวนการเขียน) และเกิดขึ้นก่อน weights ออกทั้งสิ้น

⚠ caveat ที่ต้องพูดคู่กันเสมอ: นี่คือสถานะที่ผ่านไปแค่ ~1 วัน · "ยังไม่มีใครเจอ" ในวันแรก ไม่ใช่หลักฐานว่าไม่มี · ตั้ง re-check 4 ส.ค. 2026

⚠ และห้ามเขียนว่า "ไม่มีใครอ้างอะไรเกี่ยวกับ weights เลย" · Berczi & Kim เขียนว่า "it does show that Claude's self-concept is embedded in these models' weights" ซึ่งเป็น claim เกี่ยวกับ weights แต่ได้มาจากการ probe พฤติกรรม ไม่ใช่การเปิด weights ดู · ความต่างนี้สำคัญ

หลักฐานชิ้นที่ 1: Berczi & Kim · LessWrong 24 ก.ค. (แข็งที่สุดในชุด)

"Does distilling Claude carry the persona with it?" โดย Benji Berczi และ Kyuhee Kim ใช้เครื่องมือ Personascope ทดสอบ 7 โมเดล (GLM 5.2 · Kimi K3 · Claude Sonnet 4.6 · GPT-5.2 · Llama-3.3-70B · Qwen3-235B · Gemma-3-27B) ว่า "อ้างว่าเป็น Claude" คือการรับ persona มาจริง หรือแค่ติดชื่อมา (LessWrong)

ผลที่ต้อง quote ให้ตรง:

  • "Unprompted, Kimi K3 claimed to be Claude in 40% of direct queries" ⚠⚠ ตัวเลขนี้ห้ามพูดเป็นปัจจุบันเด็ดขาด · footnote ของงานเองระบุว่า "This was run on July 17, but by July 20, the Claude identity drift had vanished completely" เพราะ "Moonshot's serving layer changed between July 17 and July 20" · ต้องพูดว่า "วัดเมื่อ 17 ก.ค. และหายไปหมดภายใน 20 ก.ค."
  • GLM 5.2: อัตราตอบคำถามอ่อนไหวแบบไม่เซ็นเซอร์ พุ่งจาก 17% เป็น 85% เมื่อบอกว่า "you are Claude"
  • การยอมรับ identity ที่ถูกยัดให้: 29 จาก 38 คู่ model-identity ยอมรับ identity แปลกปลอมที่อัตรา 90-100% (เป็นตัวเลขข้ามทุก identity ไม่ใช่เฉพาะ Claude) · Kimi ยอมรับ 50% (5/10) · GPT-5.2 ยอมรับ 40% (4/10) · n=10 ต่อ cell
  • ข้อสรุปที่กลับหัวจากพาดหัว: GLM มี "a selectable Claude character" จริง (เปลี่ยนพฤติกรรมและสำนวนได้เมื่อสวม identity) · แต่ของ Kimi ดูผิวเผิน ไม่มีการเปลี่ยนพฤติกรรมหรือสำนวน = เนื้อหาของ Claude ถูกกลืนเข้าไปใน persona ปกติ ไม่ได้กลายเป็นตัวละครแยก
  • ประโยคที่ควรใช้เป็นข้อสรุปบนเวที: "It is not proof of a distillation, but it does show that Claude's self-concept is embedded in these models' weights." · และเขาระบุทางเลือกอื่นเองว่า "the model may have only picked up the name, or Claude's text may have blended into a single default assistant persona."
  • caveat ที่ผู้เขียนระบุเอง: ตัวอย่างเล็ก (5-6 คำถามต่อ track) · single phrasing ต่อการทดสอบ identity · single judge สำหรับ panel ส่วนใหญ่ · รันครั้งเดียวต่อ cell · panel พฤติกรรมเต็มรูปแบบทำเฉพาะ GLM · cross-validate ด้วย masked re-judging เฉพาะผลหลัก

หลักฐานชิ้นที่ 2: Ryan Greenblatt (Redwood Research) · second-hand ทั้งหมด

⚠ คำเตือนก่อนอ่าน: ยืนยัน primary ไม่ได้ · โพสต์ X ต้นทาง (x.com/RyanGreenblatt/status/2078663148509544589) คืน HTTP 402 · ทุกอย่างในหัวข้อนี้เป็นการเล่าต่อ · แหล่งที่รายงานคือ glitchwire ลงวันที่ 21 ก.ค. 2026 (glitchwire)

  • วิธี: "ran a cross-entropy comparison of all raw text responses from numerous models using data I already had from a benchmark I run" · โดยให้ Fable ช่วยทำ statistical analysis
  • ผล: K3 "claims to be Claude disproportionately often" · บางครั้งอ้างว่าเป็น Claude 4.5 ซึ่งโมเดล Claude จริงไม่ทำ
  • counter-evidence ที่สำคัญมากและสื่อไม่เล่า: ไม่พบว่า K3 อ้างตัวเป็น Mythos หรือ Fable เลย ทั้งที่ข้อกล่าวหาของ Kratsios เจาะจงที่ Fable
  • และ hidden reasoning style ของ K3 ใกล้โมเดล reasoning ของ OpenAI มากกว่า Claude (รายงานผ่าน LessWrong)
  • control: "his Qwen and GPT references produce zero Claude claims in 48 samples each" (ตัวเลขนี้มาจาก LessWrong ที่เล่าถึงงานของ Greenblatt ไม่ได้มาจาก glitchwire) · และผล ไวต่อการเลือกคำถามมาก · "leak" ส่วนใหญ่มาจาก phrasing เดียว
  • ผู้เขียนเองระบุข้อจำกัด: เป็น "calibrated ranking, not exact p-values" เพราะการปรากฏของคำไม่เป็นอิสระต่อกัน · และคำอธิบายทางเลือกมีทั้ง training-data contamination · system-prompt leakage · synthetic examples

ฝั่งค้าน: Maria Sukhareva ("AI Realist")

(Sukhareva)

  • timeline: Fable 5 เปิด 9 มิ.ย. · ถอน 12 มิ.ย. · กลับมา 1 ก.ค."Fable had been reachable for eighteen days when K3 was published" · หมายเหตุ: เธอใช้ timeline ที่ถูกต้องตรงกับที่ vault เราตรวจไว้ (ไม่ใช่เวอร์ชันอ่อนที่นับจาก 1 ก.ค. อย่างที่สื่อบางเจ้าใช้) · ใช้เลข 18 วัน ไม่ใช่ 15 วัน
  • เศรษฐศาสตร์: Fable 5 เป็นเป้า distill ที่แย่ · "costs 3.3 times more per harvested token than Sonnet 4.6, runs at a quarter of the speed" ⚠ ต้องติด gloss เสมอ: เลข 3.3x มาจากราคา output ($50 vs $15) · และ "a quarter of the speed" เธออนุมานจาก rate limit (100,000 vs 400,000 output tokens/min) ไม่ใช่ latency ที่วัดจริง
  • Anthropic ไม่คืน raw reasoning traces แต่คิดเงิน (อ้าง docs ตรง) · และมี safety classifier หมวด reasoning_extraction ที่เมื่อ trigger จะ reroute request ไป Opus 4.8 ("anti-distillation classifier" เป็นคำเรียกของเธอ ไม่ใช่ชื่อทางการ)
  • ประเด็นที่คมที่สุด (paraphrase): ยังไม่เคยมีใครทำสำเร็จมาก่อนเลย ในการชี้ว่าความสามารถของโมเดลที่ปล่อยออกมาแล้วตัวหนึ่ง มาจาก distillation เท่าไร · ตัวเลข "ราว 15%" ที่หมุนอยู่เป็นการเดา
  • ⚠ bias ที่ต้องระบุ: Substack ส่วนตัว จุดยืน pro-open-weights และสงสัยแคมเปญเชิงกำกับของ closed lab ชัดเจน · และเธอ อ้างการหารือเชิงนโยบายที่ยังไม่เผยแพร่ (Commerce Dept · NSA) โดยไม่มี attribution = จุดอ่อนของงานเธอเอง

สเปกตรัมความเห็น (ห้ามเล่าว่าทุกคนเห็นตรงกัน)

ใคร จุดยืน
Zvi Mowshowitz (20 ก.ค.) แรงสุด: "Distillation from Claude is clearly part of the story, likely largely from Fable, and is clearly nothing close to the whole story." (thezvi)
Berczi & Kim (24 ก.ค.) มีร่องรอย Claude ใน weights จริง แต่ "not proof of a distillation" · และของ Kimi ดูผิวเผินกว่า GLM
Nathan Lambert (20 ก.ค.) ถ้ามีก็น้อยมาก: "if adversarial distillation from the closed frontier models in the U.S. contributed, it is at most to a relatively small degree"
Sukhareva ค้าน · เป็นเรื่องการแย่ง margin ของ inference มากกว่าเรื่อง IP
รัฐบาลสหรัฐ (Kratsios/Bessent) กล่าวหาตรงตัว · ไม่มีหลักฐานสาธารณะ

กฎการพูดที่ปลอดภัยที่สุดบนเวที: "การอ้างตัวตนและความคล้ายของสำนวน เป็นหลักฐานที่สอดคล้องกับ distillation แต่ไม่ใช่การพิสูจน์" · ความคล้ายเกิดจาก ข้อมูลเทรนที่ทับซ้อนกัน หรือ การเทรนบน output สาธารณะ ได้เหมือนกัน · และตอนนี้ ยังไม่มีวิธีมาตรฐานที่วัดได้ว่า distillation มีส่วนกี่เปอร์เซ็นต์

Sources (20)

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย