AI News · 9 ข่าว

AI News · 2026-07-25

Models

Anthropic เปิด Claude Opus 5: frontier ใกล้ Fable 5 ที่ครึ่งราคาของ Fable 5 · ราคา token $5/$25 = เท่า Opus 4.8 (= ครึ่งของ Fable 5 $10/$50) · effort ladder 5 ระดับ · 1M context · โมเดลตัวที่ 4 ในไม่ถึงสองเดือน (24 ก.ค.) ⚙

Anthropic ปล่อย claude-opus-5 วางเป็น default สำหรับงานออฟฟิศประจำวัน · ราคา token $5/$25 ต่อ MTok = เท่า Opus 4.8 เป๊ะ (ไม่ได้ถูกลงกว่า 4.8) แต่ = ครึ่งหนึ่งของราคา token ของ Fable 5 ($10/$50) · context 1M ทั้ง default และ max (ไม่มี variant เล็กกว่า) · output สูงสุด 128k · thinking เปิด default · รองรับ effort ครบ 5 ระดับ (low·medium·high·xhigh·max) เป็นปุ่ม toggle บาลานซ์ต้นทุน vs ความสามารถ · breaking change: ปิด thinking ได้เฉพาะ effort high หรือต่ำกว่า (ตั้ง disabled ที่ xhigh/max = error 400) · Fast mode เร็ว ~2.5x ที่ราคา 2 เท่า ($10/$50) · API-only + research preview · available (primary docs): Claude API · Bedrock · Google Cloud (Vertex) · Microsoft Foundry · consumer: claude.ai (default บน Max · แรงสุดบน Pro) · Claude Code 2.1.219 ตั้งเป็น default Opus · Cowork · benchmark (Anthropic-reported ทั้งหมด · ยังไม่มี independent replication): CursorBench 3.2 ห่าง Fable 5 แค่ 0.5% ที่ครึ่งต้นทุน/งาน · OSWorld 2.0 ชนะ Fable 5 ที่ ~1/3 ต้นทุน · Frontier-Bench v0.1 มากกว่า Opus 4.8 สองเท่า · ARC-AGI 3 สูงเป็น 3 เท่าของอันดับรอง · หลักฐานอิสระ: Willison + Artificial Analysis ระบุ นำ AA Intelligence Index (Opus 5 = 61 vs Fable 5 = 60 · margin 1 แต้ม พลิกได้) · Safety: Anthropic เรียก "most aligned model to date" อัตรา deception ต่ำสุด · guardrail cyber เข้มขึ้นช่วงแคบ (ห้าม binary vuln scan/exploit gen · ยังตามหลัง Mythos 5) · เก่งสุดสาย scientific research/biology

ทำไมต้องรู้ · default Opus ในเครื่องมือ Claude เปลี่ยนเป็น Opus 5 แล้ว ทั้ง Claude Code, Cowork และ claude.ai จุดที่ต้องอ่านให้ถูกคือพาดหัว "ครึ่งราคา Fable 5" ต้องถามต่อว่าครึ่งของอะไรเทียบกับตัวไหน เทียบกับ Fable 5 ราคาลดลงจริงครึ่งหนึ่งทั้งราคา token และต้นทุนต่องาน แต่เทียบกับ Opus 4.8 ราคา token เท่าเดิม ไม่ได้ถูกลงกว่าเดิม และตัวเลขเบนช์มาร์กต้นทุนต่องานทั้งสี่ตัวเป็นตัวเลขที่ Anthropic รายงานเอง ยังไม่มีการทดสอบซ้ำโดยอิสระ → claude-opus-5

The Stack v3: Hugging Face ปล่อย dataset โค้ดเปิดที่ใหญ่ที่สุด · 114TB raw · 224M repo · 5T token หลัง dedup (smol.ai · 23 ก.ค.)

Hugging Face เปิด The Stack v3 เคลมเป็น "largest open code dataset publicly released": raw 114TB · 224 ล้าน repository · 5 ล้านล้าน token หลัง dedup · เพิ่ม coverage ภาษาแบบก้าวกระโดดเทียบ v2: C++ x15 · TypeScript x7.5 · Rust x7 · Python x4.8

ทำไมต้องรู้ · จุดทึบที่สุดของโมเดล open มักเป็นข้อมูลเทรน ไม่ใช่ตัว weights และ The Stack v3 เปิดวัตถุดิบส่วนนั้นให้ตรวจสอบได้จริง ต่างจากโมเดลที่เปิดให้ใช้แค่ weights อย่างเดียว เรื่องนี้เชื่อมโยงกับประเด็น copyright และที่มาของข้อมูลเทรนที่กำลังเป็นข้อพิพาทอยู่ (ดู anthropic-books-settlement-2026) แต่ dataset ที่ใหญ่ก็ไม่ได้แปลว่าสะอาดหรือปลอดปัญหา license โดยอัตโนมัติ

FLUX 3: Black Forest Labs รวม image/video/audio/action เป็น architecture เดียว + FLUX-mimic คุมหุ่นยนต์บน GPU on-prem ตัวเดียว (smol.ai · 23 ก.ค.)

Black Forest Labs เปิด FLUX 3 เป็น unified architecture ครอบ image · video · audio · action prediction · โชว์งานหุ่นยนต์ผ่าน FLUX-mimic เคลม "general-purpose dexterity" ที่ deploy บน GPU on-prem ตัวเดียว

ทำไมต้องรู้ · data point ทิศทาง multimodal รวมร่าง + local/embodied (คู่ Nativ MLX 07-22 · ABot-World-0 07-23) · จุดสอน landscape: โมเดล generative กำลังขยับจาก "สร้างสื่อ" ไป "สั่งการกายภาพ (action)" = คำเคลม "AI ทำได้ทุกอย่าง" มีตัวอย่างรูปธรรมขึ้น แต่ ยัง vendor demo ไม่มี benchmark อิสระ · ประเด็นที่ใช้ได้จริงกับองค์กร: รันบน GPU ตัวเดียว on-prem = ควบคุมข้อมูลได้ (คุณค่า local = control) · เก็บเป็น landscape

Alibaba Qwen-Audio-3.0-TTS: รองรับ 16 ภาษา · เคลมขึ้นอันดับ 1 Artificial Analysis TTS leaderboard (smol.ai · 23 ก.ค.)

Alibaba ปล่อย Qwen-Audio-3.0-TTS รองรับ 16 ภาษา พร้อมฟีเจอร์ควบคุมเสียงขั้นสูง · เคลม ขึ้นอันดับ 1 บน Artificial Analysis TTS leaderboard

ทำไมต้องรู้ · data point สาย voice/TTS ที่ลูกค้าองค์กรไทยถามบ่อย (คอนเทนต์เสียง/dubbing/IVR) · จุดที่ต้องเช็ค: รองรับไทยดีแค่ไหน (16 ภาษาไม่การันตีคุณภาพไทย · คู่บทเรียน Gemini ไทย 87%) · caveat: อันดับ TTS เป็นคำเคลม vendor อ้าง leaderboard เดียว · เก็บเป็น landscape เทียบเครื่องมือ voice

Tools

Claude Code 2.1.219: ตั้ง Claude Opus 5 เป็น default Opus (1M context · fast mode $10/$50) + setting ใหม่ sandbox.network.strictAllowlist คุม network ใน sandbox + hook DirectoryAdded ยิงเมื่อเพิ่ม working directory กลางเซสชัน

2.1.218 ให้ /code-review รันเป็น background subagent (เก็บ 07-23) · 2.1.219: ตั้ง claude-opus-5 เป็น default Opus (ระบุ 1M context · fast mode $10/$50 ต่อ MTok) · เพิ่ม setting sandbox.network.strictAllowlist คุมการเข้าถึง network ของคำสั่งที่รันใน sandbox · เพิ่ม hook DirectoryAdded ที่ทำงานหลังลงทะเบียน working directory ใหม่กลางเซสชัน · ปรับ nested subagent forwarding ใน stream-json + fix text output หาย/permission ตอน runner restart

ทำไมต้องรู้ · สำหรับคนที่ใช้ Claude Code หรือเครื่องมือ agent ทำงาน มีอัปเดตสองจุดที่มากกว่าแค่ cosmetic การตั้งค่า sandbox.network.strictAllowlist ใหม่ช่วยล็อกการเข้าถึง network ของคำสั่งที่รันใน sandbox ได้ละเอียดขึ้น สะท้อนแนวโน้มว่าเครื่องมือ agent ที่ไม่มี sandbox คือความเสี่ยงด้าน security ส่วน hook DirectoryAdded ที่ทำงานเมื่อเพิ่ม working directory ใหม่กลางเซสชัน เป็นสัญญาณว่า workflow แบบเปลี่ยน directory ระหว่างทางกลายเป็นเรื่องปกติมากขึ้น

Research

AREX (2607.21461 · 116 ▲): agent วิจัยที่พัฒนาตัวเองแบบ recursive · ใช้ asymmetry "หา answer แพง แต่ verify แตกเป็น constraint ย่อยได้" · โมเดล 4B + 122B-A10B MoE นำ baseline บน BrowseComp/WideSearch/DeepSearchQA/HLE

AREX เสนอ agent deep-research ที่มี สอง loop: inner loop สร้างคำตอบชั่วคราว · outer loop audit คำตอบเทียบ constraint หลายข้อแล้วยิง follow-up research เฉพาะจุดที่ละเมิด · แกนคือ asymmetry: "discovering answers is costly, whereas verifying a candidate can often be decomposed into tractable constraint-wise checks" · มี context-update tool อัตโนมัติ ที่บีบ history เป็น state กระชับ (เก็บ evidence ที่ยืนยันแล้ว + constraint ที่ยังค้าง) ให้รันงานยาวได้โดยไม่พึ่งโมเดลนอก · instantiate เป็น dense 4B + MoE 122B-A10B · เคลมนำ baseline ระดับเดียวกันบน BrowseComp · WideSearch · DeepSearchQA · Humanity's Last Exam

ทำไมต้องรู้ · แนวคิดของ AREX สะท้อนหลักการที่ใช้ได้จริงเวลาออกแบบหรือประเมิน agent ทั่วไป การทำให้ agent ตรวจสอบคำตอบของตัวเองได้ถูกกว่าการหาคำตอบใหม่ คือหลักการเดียวกับที่คนใช้ตอน review งาน คือไม่เชื่อคำตอบแรกที่ agent เดามาทันที แต่แตกออกเป็นเงื่อนไขย่อยที่เช็คได้ทีละข้อ ตัวเลขผลทดสอบในเปเปอร์นี้ยังเป็นตัวเลขที่ผู้เขียนรายงานเอง รอการตรวจสอบซ้ำจากภายนอก

Policy / Open vs Closed

Nvidia ลงสนาม open-weight เอง: เอกสาร "Open Weights and American AI Leadership" (HN 111 · 24 ก.ค.) · เข้าข้างฝั่งหนุน open ท่ามกลางศึก distillation/สกัดโมเดลจีน (ต่อเนื่องจาก 2026-07-24)

มีเอกสาร PDF "Open Weights and American AI Leadership" เผยแพร่ผ่าน images.nvidia.com ขึ้น HN 111 คะแนน · เนื้อหาโดยรวมหนุนจุดยืนว่า open-weight สำคัญต่อความเป็นผู้นำ AI ของสหรัฐ · โผล่กลางสัปดาห์ที่ทำเนียบขาว (Kratsios/Bessent) กล่าวหา Moonshot distill Fable + ขู่ sanctions และ Little Tech Association ~200 รายล็อบบี้สวน (07-24 ข้อ 2)

ทำไมต้องรู้ · เอกสารนี้เผยจุดยืนของ Nvidia ในศึก open-weight ที่กำลังร้อนอยู่ Nvidia ได้ประโยชน์ตรงจากระบบนิเวศ open ที่กว้าง เพราะยิ่งมีคนเทรนและรันโมเดลเองเยอะ ยิ่งซื้อชิปเยอะ ตัวอย่างนี้ช่วยฝึกมุมมองสำคัญเวลาอ่านข่าวว่าถ้าเทคโนโลยีถูกห้ามหรือปลดล็อก ใครได้ประโยชน์บ้าง และเอกสารจากบริษัทที่มีส่วนได้เสียโดยตรงควรอ่านเป็น position paper ไม่ใช่รายงานที่เป็นกลาง

Business

Stripe เจรจาซื้อ OpenRouter: WSJ ระบุมูลค่าราว $10B (Blognone · 24-25 ก.ค.) (ต่อเนื่องจาก 2026-07-24) · ตัวเลขขยับจาก ~$1B ที่รายงานแรก

รายงานการเจรจา Stripe ซื้อ OpenRouter ที่ลงเมื่อวาน (07-24 ข้อ 6 · ~$1B) มีตัวเลขใหม่: Blognone อ้าง Wall Street Journal ระบุมูลค่าราว $10 พันล้าน · ดีลยังไม่ปิด

ทำไมต้องรู้ · ตัวเลขที่เปลี่ยนจากประมาณ 1 พันล้านดอลลาร์เป็นประมาณ 1 หมื่นล้านดอลลาร์ในเวลาไม่ถึงวัน เป็นบทเรียนในตัวว่าตัวเลขดีลควบรวมกิจการที่ยังไม่ปิดดีลอย่างเป็นทางการแกว่งได้มาก ไม่ควรเชื่อเป็นข้อเท็จจริงจนกว่าจะมีการประกาศจริง ส่วนแก่นของเรื่องยังเหมือนเดิมคือชั้นกลางที่สลับโมเดลได้ วัดราคาได้ และจ่ายเงินได้ คือชั้นที่มีมูลค่าสูงในตลาดตอนนี้ และถ้าตัวเลขจริงใกล้ 1 หมื่นล้านดอลลาร์ ก็ยิ่งตอกย้ำว่าชั้นกลางแบบนี้มีมูลค่ามากกว่าที่หลายคนคิด

Society

Google เพิ่ม selfie-video authentication: ยืนยันตัวตนด้วยวิดีโอเซลฟี่ ตรวจการขยับหัวแบบ real-time กันปลอมด้วยรูป/deepfake (Blognone · 24 ก.ค.)

Google เพิ่มทางเลือกล็อกอินด้วย วิดีโอเซลฟี่ ใช้การตรวจ การเคลื่อนไหวหัวแบบ real-time เพื่อกันการปลอมด้วยภาพนิ่งหรือ deepfake

ทำไมต้องรู้ · data point สาย identity/authenticity ในยุค deepfake (คู่ thread AI authenticity: Ghost Font/Pangram · Cloudflare Precursor F22) · จุดสอน: ยิ่ง generative เก่ง การพิสูจน์ "คนจริง" ยิ่งต้องอาศัย signal ที่ปลอมยาก (liveness/การเคลื่อนไหว) ไม่ใช่แค่ภาพ · แต่ประกบ media literacy: liveness detection เป็นเกมแมวจับหนู · deepfake วิดีโอ real-time ก็พัฒนาเช่นกัน · เก็บเป็น landscape ความปลอดภัย identity

■ ไม่อยากพลาดของใหม่

สรุปข่าวแบบนี้ระบบทำทุกเช้า ถ้าอยากให้คัดเรื่องเด่นส่งถึงมือทาง LINE โดยไม่ต้องแวะมาเช็คเอง กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย