Grok 4.6 (SpaceXAI): เสมอ GPT-5.6 Sol บน AA Index ที่ 61 แต่ช้าอันดับ 72/183 · และกับดักราคาที่คิดแพงทั้ง request เมื่อเกิน 200K
Grok 4.6: คะแนนเสมอรุ่นท็อป แต่ต้องอ่านสามตัวเลขคู่กันเสมอ
เกิดอะไรขึ้น
SpaceXAI (บริษัทที่เดิมชื่อ xAI) ปล่อย Grok 4.6 เมื่อ 12 ส.ค. 2026 โดยหน้าเอกสารทางการเขียนว่า "Grok 4.6, SpaceXAI's frontier model for coding, agentic tasks, and knowledge work, is now available on the xAI API" (docs.x.ai)
จุดขายที่บริษัทเน้นคือ agent ที่ทำงานต่อเนื่องยาว โดยหน้าประกาศระบุพฤติกรรมที่สังเกตได้ว่า "On longer trajectories, we also started to see more self-testing and verification, with the model checking its own work before moving on" (x.ai)
หมายเหตุชื่อแบรนด์: เอกสารทางการเรียกบริษัทว่า SpaceXAI ส่วนคำว่า xAI เหลือสถานะเป็นชื่อ API และชื่อโดเมนเท่านั้น (docs.x.ai, "xAI API") เวลาเขียนถึงจึงควรใช้ "SpaceXAI (เดิม xAI)" ครั้งแรก แล้วคงคำว่า "xAI API" ไว้ตอนพูดถึงตัว API เพราะเป็นชื่อที่ผู้ผลิตยังใช้อยู่จริง ต่อเนื่องจาก grok-4-5 ที่บันทึกการ rebrand ไว้ตั้งแต่ ก.ค. 2026
สเปคที่ยืนยันจาก first-party
- หน้าต่างบริบท 500,000 โทเคน (เท่ากับ Grok 4.5 ไม่ได้ขยาย)
- รับข้อความและภาพเข้า ออกเป็นข้อความอย่างเดียว ("text and image inputs with text-only output")
- ปิดโหมดคิดไม่ได้ ("Reasoning cannot be disabled") · ระดับความพยายามมีสี่ขั้น low / medium / high (ค่าเริ่มต้น) / xhigh (docs.x.ai/docs/guides/reasoning)
- knowledge cutoff 1 ก.พ. 2026 ("The knowledge cut-off date of Grok 4.6 is February 1, 2026")
- ช่องทางวันเปิดตัว: xAI API, Grok Build, Cursor, OpenRouter, Vercel, Cloudflare · สัปดาห์แรก แถมโควตาการใช้งานเป็นสองเท่า ใน Cursor และ Grok Build
- ⚠ ระวังแปลผิด: ข่าวบางเจ้าเขียนว่า "2x usage multiplier" ซึ่งอ่านผิดได้ว่าโดนคิดเงินสองเท่า ของจริงคือ แถมโควตาที่รวมอยู่ในแพ็กเกจให้เป็นสองเท่า (the-decoder)
- Grok 4.5 ยังไม่ถูกปลดระวาง (ยังมีเรตราคาของตัวเองอยู่บนหน้า pricing) · หลักฐานนี้เป็นทางอ้อม เพราะ
docs.x.ai/docs/deprecationsตอบ 404 ไม่มีคำประกาศตรง
🔑 กับดักราคา: เกิน 200K เมื่อไหร่ คิดแพงทั้ง request
ราคาต่อ 1M token (docs.x.ai/docs/pricing):
| ระดับ | input | cached input | output |
|---|---|---|---|
| prompt < 200K token | $2.00 | $0.50 | $6.00 |
| prompt ≥ 200K token | $4.00 | $1.00 | $12.00 |
จุดที่คนพลาดกันมากที่สุดและ vendor เขียนไว้ตรงๆ เอง:
"Requests whose prompt reaches the listed token threshold are billed at the higher rate for all tokens in the request."
คือพอ prompt แตะ 200K ราคาที่แพงขึ้นไม่ได้คิดเฉพาะส่วนที่เกิน แต่คิดกับ ทุกโทเคนในคำขอนั้น · prompt 199,999 โทเคนกับ 200,001 โทเคนจึงมีค่าใช้จ่ายต่างกันเท่าตัว ไม่ใช่ต่างกันนิดเดียว
เทียบกับ Grok 4.5: เรต uncached เท่าเดิมเป๊ะ ($2/$6 และ $4/$12) แต่ cached input ขึ้นจริง จาก $0.30 เป็น $0.50 (ชั้นบนจาก $0.60 เป็น $1.00) · หน้าประกาศไม่พูดถึงการขึ้นราคา cache นี้เลย ซึ่งกระทบงาน agent มากที่สุดเพราะเป็นงานที่อ่าน prompt เดิมซ้ำบ่อยที่สุด
Benchmark: อ่านสามชั้นให้ออกจากกัน
ชั้นที่ 1 · คำเคลมของ vendor (quote ตรง)
"Grok 4.6 matches GPT-5.6 Sol on the Artificial Analysis Intelligence Index, which is a composite score of nine benchmarks." (x.ai)
⚠ ห้าม quote ว่า "It matches GPT-5.6 Sol..." ประโยคจริงขึ้นต้นด้วยชื่อรุ่น · และคู่เทียบในตารางคือ GPT-5.6 Sol Max ไม่ใช่ Sol เฉยๆ
ชั้นที่ 2 · independent ยืนยันแล้ว (Artificial Analysis · snapshot 13 ส.ค. 2026)
- AA Intelligence Index = 61 · อันดับ #6 จาก 183 โมเดล · ค่ากลางของกลุ่มราคาเดียวกัน = 34 (Artificial Analysis)
- คะแนนนี้ AA วัดและโพสต์เอง คำเคลม "เสมอ GPT-5.6 Sol" จึง ยืนยันได้จริงในแกนนี้
ชั้นที่ 3 · ตัวเลขที่หน้าประกาศไม่พูดถึงเลย คือความเร็ว
snapshot 13 ส.ค. 2026 (AA providers):
- เวลารอคำตอบแรก (TTFT) = 51.87 วินาที เทียบค่ากลางของกลุ่ม 2.85 วินาที (ราว 18 เท่า)
- throughput = 69.3 tokens/sec ซึ่ง เท่ากับค่ากลางพอดี ไม่ได้เร็วกว่า
- อันดับด้านความเร็ว #72 จาก 183
⚠ ตัวเลขความเร็วต้องติดวันที่เสมอ ค่าเหล่านี้ขยับตามภาระของ provider · ร่างแรกของหน้านี้เคยเขียน 42 วินาที / 78 t/s ซึ่ง fact-checker จับได้ว่าไม่ตรงกับค่าที่วัดได้ตอนนี้ · ห้ามเขียนว่า Grok 4.6 เร็วกว่าค่าเฉลี่ย เพราะไม่จริงในทั้งสองแกน
ตัวเลข benchmark รายตัวที่ยืนยันแล้ว
| benchmark | Grok 4.6 | ที่มา |
|---|---|---|
| AA Intelligence Index | 61 | AA (independent) |
| DeepSWE v1.1 | 65.9% | ตาราง x.ai |
| Terminal-Bench v3.0 | 26.0% | ตาราง x.ai |
| GDPVal-AA v2 | 1,753 | ตาราง x.ai |
| CursorBench v3.2 | 69.9% | ตาราง x.ai |
- ✅ CursorBench = 69.9% ฟันธงได้ · ตัวเลข 70.8% ที่ลอยอยู่ตามสื่อ หาต้นตอไม่เจอ และน่าจะเพี้ยนมาจาก 70.5% ของ Fable 5 Max ที่อยู่ในตารางเดียวกัน
- 🔴 CyberGym 79.7% ไม่ใช่ตัวเลข vendor ไม่มีในตารางของ x.ai เลย · มาจาก leaderboard ของบุคคลที่สาม (อันดับ 7) · ห้ามเขียนว่าเป็นเลขที่บริษัทเคลม
🔴 กติกาการ cite ของหน้านี้: ตัวเลข benchmark ทุกตัวต้อง cite กลับไปที่
x.ai/news/grok-4-6หรือartificialanalysis.aiเท่านั้น ห้าม cite ตัวกลาง · fact-checker เจอตารางชุดเดียวกันถูกลอกผิดอย่างน้อยสองจุดในสื่อรอง (FrontierCode ของ Fable 5 เป็น 63.6% ในหน้า x.ai แต่สื่อเขียน 64.9%)
เรื่องที่ vendor ไม่ได้พูด แต่อ่านได้จากป้ายในตารางเอง
ป้ายกำกับในตารางของ x.ai ระบุคู่แข่งเป็น "GPT-5.6 Sol Max" และ "Fable 5 Max" ขณะที่แถวของตัวเองระบุ "Grok 4.6 High" ซึ่ง docs ยืนยันว่า high คือค่าเริ่มต้น และยังมี xhigh เหนือขึ้นไปอีกชั้น
สิ่งที่พูดได้: ป้ายในตารางบอกว่าคู่แข่งถูกรันที่ tier สูงสุด ส่วน Grok รันที่ค่าเริ่มต้น สิ่งที่ห้ามพูด: ห้ามเขียนว่า SpaceXAI ยอมรับหรือประกาศกรอบนี้เอง · บริษัทไม่เคยอธิบายเรื่องนี้ · footnote เดียวที่มีคือ "Competitor figures are drawn from the respective developers' published system cards or benchmark leaderboards" สิ่งที่ต้องพูดคู่กันเพื่อความเป็นธรรม: Grok เองก็ ไม่ได้รันที่ tier สูงสุดของตัวเอง เหมือนกัน เพราะยังมี xhigh อยู่เหนือ high
บริบท: สามโมเดลแนวหน้าลงวันเดียวกัน
Grok 4.6 ลงวันเดียวกับ น้ำหนักโมเดลเปิดของ Qwen3.8 (qwen-3-8) และการเปลี่ยน build ของ DeepSeek V4 Pro (deepseek-v4-pro-0813) · คำอธิบายที่ถูกยกมาถกกันมากที่สุดในกระทู้คือข้อจำกัดร่วมของทุกค่ายตอนนี้อยู่ที่กำลังประมวลผล ไม่ใช่ไอเดีย ทุกเจ้าจึงถึงเส้นชัยรอบใกล้กัน (Hacker News) · นี่เป็นสมมติฐานของผู้แสดงความเห็น ไม่ใช่ข้อเท็จจริงที่วัดได้
ความเห็นที่คมที่สุดในกระทู้เดียวกันเรื่องการวัดผลคือ "As models get better, valid benchmarks become more 'trust me bro'" ซึ่งสรุปปัญหาของรอบนี้ได้ตรง คือช่องว่างระหว่างโมเดลบนสุดแคบลงจนตัวเลขต่างกันไม่กี่จุดแปลผลได้ยากขึ้นเรื่อยๆ
Sources (9)
- https://x.ai/news/grok-4-6 fetched 2026-08-13
- https://docs.x.ai/developers/release-notes fetched 2026-08-13
- https://docs.x.ai/docs/models fetched 2026-08-13
- https://docs.x.ai/docs/pricing fetched 2026-08-13
- https://docs.x.ai/docs/guides/reasoning fetched 2026-08-13
- https://artificialanalysis.ai/models/grok-4-6 fetched 2026-08-13
- https://artificialanalysis.ai/models/grok-4-6/providers fetched 2026-08-13
- https://the-decoder.com/spacexais-grok-4-6-matches-openais-best-model-and-undercuts-it-on-price/ fetched 2026-08-13
- https://news.ycombinator.com/item?id=49274027 fetched 2026-08-13
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย