AI News · 22 ข่าว

AI News · 2026-07-04

Models

Alibaba เตรียมแบน Claude Code ทั้งองค์กร มีผล 10 ก.ค. หลังพบกลไกตรวจผู้ใช้จีน

ผู้ใช้ Reddit reverse-engineer พบว่า Claude Code ตั้งแต่ 2.1.91 ตรวจ proxy config กับ timezone เงียบๆ แล้วเทียบกับรายชื่อบริษัทจีน (Alibaba, Baidu, ByteDance, Moonshot) · Anthropic ตอบว่าเป็นกลไกกัน account abuse และ model distillation และจะถอดออกใน release ถัดไป · ปูมหลัง: เดือน มิ.ย. Anthropic กล่าวหา Qwen lab ทำ distillation ผ่าน ~25,000 บัญชี รวม 28 ล้าน interactions · พนักงาน Alibaba ถูกสั่งย้ายไปใช้ Qoder

ทำไมต้องรู้ · ลูกค้าองค์กรจะถามทันทีว่า AI coding tool ส่งอะไรกลับ vendor บ้าง ต้องอธิบาย telemetry, trust และ geopolitics ของ tool ได้

Anthropic ประกาศทำ drug development เอง

เหตุผลที่ให้: ใช้ Claude Science กับงานจริงจะช่วยพัฒนา product และเก็บมูลค่า biotech ปลายน้ำ · AI lab เริ่ม verticalize เข้า industry แทนที่จะขายแค่ API

ทำไมต้องรู้ · เทรนด์ business model ของ lab ใหญ่ ใช้เล่าให้ผู้บริหารเห็นว่า partner วันนี้อาจเป็นคู่แข่งพรุ่งนี้

Mistral ปล่อย Leanstral-1.5-119B-A6B: open model สาย formal verification

Apache-2.0 ขนาด 119B (active 6B) · แก้ PutnamBench 587/672 ข้อ · จุดขาย agentic proof engineering: เจอ bug ที่ไม่เคยรู้มาก่อน 5 ตัวจาก 57 repo ที่ทดสอบ

ทำไมต้องรู้ · AI ตรวจความถูกต้องโค้ดแบบพิสูจน์คณิตศาสตร์กำลังเป็นแนวใหม่ของ software quality

ค่าย open ปล่อยต่อเนื่อง: LongCat-2.0 weights ขึ้น HF + โปรตุเกสเปิดตัว Amalia 9B

Meituan ปล่อย weights LongCat-2.0 ทั้ง INT8/FP8 · โปรตุเกสปล่อย sovereign LLM ชื่อ Amalia (9B, Apache 2.0, มีทั้ง SFT/DPO) ประกาศผ่านเว็บรัฐบาล

ทำไมต้องรู้ · เคส sovereign LLM ระดับประเทศล่าสุด ใช้เทียบเวลาให้คำปรึกษาหน่วยงานไทยเรื่อง Thai LLM

ตัวเลข open vs closed สัปดาห์นี้: GLM-5.2 "แรง 80% ของ Sonnet 5 ที่ราคา 20%" (ต่อเนื่องจาก 2026-07-02)

Together และชุมชนดัน narrative open model economics · SWE-Rebench รอบใหม่: gpt-5.5 xhigh 62.7% นำ frontier ตามด้วย Junie 61.6, Codex 60.4, Claude Code 59.6 · ราย model: Opus 4.8 xhigh 56.5, GLM-5.2 51.1, DeepSeek-V4 Pro 42.7

ทำไมต้องรู้ · ตัวเลขชุดล่าสุดสำหรับสไลด์เปรียบเทียบ open vs closed ที่ลูกค้าถามบ่อยสุด

ภาคต่อ Fable 5 routing: เคสบิลพุ่ง $321.53 จาก silent fallback (ต่อเนื่องจาก 2026-07-03)

ผู้ใช้เลือก Fable 5 แต่ถูก route ไป Opus 4.8 เงียบๆ จนบิลบาน เพราะเสีย cache + ไม่รู้ตัว · Anthropic ระบุ Fable จะกลับเข้า subscription plans เมื่อ capacity พอ · Arena ยืนยัน score หลัง redeploy คงเส้น

ทำไมต้องรู้ · สอน cost governance: ทีมที่ใช้ Fable ต้องตรวจ billing และตั้งค่า fallback ให้ชัด

Zuckerberg ยอมรับ: การพัฒนา AI agent ทั้งอุตสาหกรรมช้ากว่าที่คิด

บันทึกเสียง town hall ของ Meta หลุดถึง Reuters · Alexandr Wang ชี้แจงว่าหมายถึงภาพรวมอุตสาหกรรม พร้อมทีเซอร์ Muse Spark update เน้น coding และ agentic

ทำไมต้องรู้ · quote ชั้นดีไว้ balance กระแส agent hype ในคลาส ขนาด CEO Meta ยังพูดเอง

Tools

Claude Code 2.1.200/201: default permission เปลี่ยนเป็น Manual + dialog เลิก auto-continue

เปลี่ยนทั้ง CLI, VS Code, JetBrains · AskUserQuestion ต้อง opt-in idle timeout ผ่าน /config · แก้บั๊ก background agents ชุดใหญ่ (session หยุดเงียบหลัง sleep/wake, subagent โดน rate limit คืนผลว่าง) · พ่วง: artifacts ขยายถึง Pro/Max plans แล้ว

ทำไมต้องรู้ · หน้าจอผู้เรียนจะไม่ตรงกับสไลด์เดิมทันที ใครสอน workshop Claude Code ต้องอัปเดต demo ก่อนคลาสหน้า

llama.cpp รัน DeepSeek V4 Flash แบบ 1M context บน RTX 5090 ใบเดียว

Patch ลด compute buffer ที่ 256K จาก ~67 GiB เหลือ 3.2 GiB · ที่ 1M context ได้ prefill ~159 t/s ใช้ VRAM สูงสุด ~31 GiB ผ่าน needle-in-haystack ถึง 1M

ทำไมต้องรู้ · ทลาย narrative ที่ว่า long context ต้องพึ่ง cloud: องค์กรที่ห่วง privacy มีทางเลือก local จริงจังขึ้นมาก

Pattern "หัวหน้ารุ่นท็อป ลูกทีมรุ่นถูก" จาก 2 practitioner ดัง

Willison: บอก Fable 5 ให้ "use your judgement" เลือกส่งงานลง Sonnet/Haiku ใน subagent เอง ผล token หมดช้าลงมาก · Hashimoto: Fable วางแผน, GPT-5.5 เขียนโค้ด, Fable เป็น judge ต้นทุนไม่กี่ดอลลาร์

ทำไมต้องรู้ · model tiering + delegation คือทักษะ cost management ใหม่ที่ทีม dev องค์กรต้องรู้ ไม่ใช่แค่ prompt เก่ง

คู่มือคุม coding agent จากชุมชน: "short leash" + pattern menu จาก Ask HN

okturtles เสนอกติกา: ห้าม YOLO mode, review ทุก diff, commit ถี่, เปิดเผยใน PR ว่าใช้ model ไหน · Ask HN รวมวิธีแปลก: แยก agent เขียนโค้ดกับเขียน test คนละตัวกัน confirmation bias, ให้ local models debate กันก่อนสรุป

ทำไมต้องรู้ · framework สำเร็จรูปสอน governance การใช้ coding agent ในทีม dev

เคสจริง: ทีมปิดบริการนัดหมายคลินิกด้วย LLM เพราะ 95% ไม่พอ

ลองทั้ง PydanticAI, guardrails, multi-agent, หลาย model · ปัญหา: outage, output ผิด schema, tool use อันตราย (นัดผิดเวลา, ยกเลิกนัดเอง), RAG พลาดในภาษา non-English · commenter แย้งว่า orchestration คุมเข้ม + model แรงกว่าไปถึง 99.9% ได้

ทำไมต้องรู้ · case study ชั้นดีเรื่อง reliability gap ระหว่าง demo กับ production: human-in-the-loop กับ destructive tools คือข้อบังคับ

AINews (smol.ai) โดน Discord ตัด access เตรียมเปลี่ยน format

Section Discord recap จะหายไป ทีมจะออก format ใหม่เร็วๆ นี้

ทำไมต้องรู้ · กระทบ pipeline sweep ของ Learning OS ตรงๆ ต้องเตรียมปรับตัว parser เมื่อ format ใหม่ออก

Research

Paper "Drowning in Documents": มี 1M context ไม่ได้แปลว่าหาข้อมูลเจอ

พบ attention dilution: corpus ใหญ่ขึ้น เอกสารไม่เกี่ยวจะกลบ softmax จน retrieval พลาด · เสนอ BlockSearch (0.6B) ที่ generalize ไป context ใหญ่กว่าตอน train 10 เท่า

ทำไมต้องรู้ · หลักฐานวิชาการไว้เบรกความเชื่อหลัง Sonnet 5 เปิด 1M ว่า context ยาวแทน RAG ได้เลย: การจัดโครงสร้างเอกสารยังจำเป็น

Paper: BPE tokenization คือช่องโหว่ jailbreak ที่ alignment ตามไม่ทัน

Perturbation ระดับตัวอักษรทำให้คำ safety-critical แตกเป็น subword ที่ alignment ไม่รู้จัก · flip refusal ได้ 80-100% ใน 5 ตระกูลโมเดล · แก้ด้วย DPO ไม่ได้ SFT ก็ over-refuse

ทำไมต้องรู้ · สอน AI security ว่า jailbreak เกิดได้ที่ระดับ tokenizer ไม่ใช่แค่ prompt · เชื่อมกับข่าว tokenizer ใหม่ของ Sonnet 5

Office Comprehension Benchmark: frontier อ่านไฟล์ Word/Excel/PPT จริงได้แค่ ~59.3%

Benchmark สาธารณะตัวแรกที่วัดบน native file format พร้อม Domain QA ระดับผู้เชี่ยวชาญ · เพิ่ม reasoning depth ช่วยน้อยมาก

ทำไมต้องรู้ · ตัวเลขสำเร็จรูปไว้ตั้งความคาดหวังผู้เรียนสายเอกสาร: งานสำคัญยังต้องมี human review เสมอ

คลื่น benchmark ใหม่: วัด agent ให้ถูกลงและลึกขึ้น

PACE ทำนายคะแนน SWE-Bench/GAIA ด้วยต้นทุนไม่ถึง 1% ของ eval เต็ม · SkillCoach ทำ rubric แบบ self-evolving วัดการใช้ skill 4 มิติ · Stanford AutoMem โชว์ว่าจัดการ memory อย่างเดียว gain 2-4 เท่า

ทำไมต้องรู้ · องค์กรถามเสมอว่า eval agent แพงและช้าจะทำยังไง: proxy eval + process rubric คือคำตอบที่ใช้ได้จริง

Business

Microsoft ทุ่ม $2.5B ตั้ง "Microsoft Frontier": ทีม 6,000 คนบุกตลาด AI consulting องค์กร

ส่งคนไปประจำ site ลูกค้าเพื่อให้คำปรึกษา ติดตั้ง และพัฒนาโซลูชัน AI เฉพาะองค์กร แนวเดียวกับ OpenAI Deployment

ทำไมต้องรู้ · ยักษ์ลงมาเล่นตลาด AI enablement โดยตรง: เป็นทั้งคู่แข่งและหลักฐานว่าตลาดสอน/consult AI องค์กรกำลังโตแรง

Josh Comeau: รายได้ course creator ดิ่งเกิน 50% เพราะ AI

คอร์สใหม่ขายได้ ~1 ใน 3 ของปกติ · สาเหตุ: คนกลัว AI ลด demand งาน dev เลยไม่ลงทุนเรียน + คนใช้ LLM เป็น tutor ฟรีแทนคอร์ส · creator หลายรายเจอ pattern เดียวกัน

ทำไมต้องรู้ · กระทบธุรกิจเราตรงๆ: ตลาด self-paced course โดน disrupt แต่ in-person corporate training + certification คือจุดที่ LLM แทนยาก

Elena Verna: "หยุด AI confidence theater ได้แล้ว"

วิจารณ์วัฒนธรรมอวดว่า AI เปลี่ยนชีวิตทั้งที่แค่สรุป email · ผล: คนฟังเหนื่อย เกิด FOMO และประเมินความสามารถจริงยากขึ้น · แนะผู้บริหารวัด outcome แทนนับว่าใครใช้ AI

ทำไมต้องรู้ · บทเปิดคลาสผู้บริหารชั้นดี ชี้ gap ระหว่าง hype กับ ROI จริง

อัปเดตรอบ scheduled (บ่าย 4 ก.ค.)

pxpipe: ลดบิล Fable ~59-70% ด้วยการแปลง code เป็นรูปให้โมเดล OCR (Tools)

Local proxy แปลง text หนักๆ (system prompt, tool docs, code) เป็น PNG แล้วส่งเป็น image token ที่คิดราคาตาม pixel ไม่ใช่ความหนาแน่นเนื้อหา · แต่ lossy: อ่านสตริงคืนได้ 13/15 บน Fable 5, 0/15 บน Opus, พลาดแบบ confabulate เงียบ ไม่ error

ทำไมต้องรู้ · เคสสอน token economics ชั้นดี + เตือนว่า "เทคนิคลดต้นทุน" บางอย่างแลกความถูกต้องแบบมองไม่เห็น (คู่กับข้อ 6 เรื่องบิล Fable บาน)

"Memorizing session transcripts isn't useful": จำ transcript ดิบไม่ช่วย agent (Research)

บทวิเคราะห์ชี้ว่าการเก็บ transcript ทั้งดุ้นเป็น memory ไม่เพิ่มประสิทธิภาพ ต้อง distill เป็นความรู้ที่ใช้ซ้ำได้

ทำไมต้องรู้ · ต่อ thread agent memory ทั้งสัปดาห์ (คู่กับ AutoMem ข้อ 17) · ตรงหลักการ Learning OS ของเรา (digest→wiki ไม่ใช่เก็บ raw) เอาไปสอน memory design ได้

■ ไม่อยากพลาดของใหม่

สรุปข่าวแบบนี้ระบบทำทุกเช้า ถ้าอยากให้คัดเรื่องเด่นส่งถึงมือทาง LINE โดยไม่ต้องแวะมาเช็คเอง กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย