AI News · 11 ข่าว

AI News · 2026-07-11

Models

Vidu S1 (arXiv 2607.03118 · HF top paper 108 upvotes): real-time interactive video generation 42 FPS บน consumer GPU

โมเดล generate วิดีโอแบบ interactive สั่งด้วยเสียง สร้างคลิปยาวไม่จำกัด (infinite-length) ที่ ~42 FPS บน GPU ผู้บริโภค · ขึ้นเป็นเปเปอร์อันดับ 1 บน HuggingFace daily ช่วงนี้ (108 upvotes นำอันดับสองที่ ~43)

ทำไมต้องรู้ · โมเดลนี้ต่อยอดจากเทรนด์ media-gen ที่ถูกลงและเร็วขึ้นเรื่อยๆ เทียบได้กับ Gemini Omni Flash preview (07-06) และ Meta Muse Video preview (07-08) จุดต่างของ Vidu S1 คือทำงาน real-time และ interactive บน consumer GPU ไม่ใช่ batch render บน cloud เป็นสัญญาณว่างาน video-gen กำลังขยับจาก "รอ render" ไปเป็น "คุมสด" แต่ตอนนี้ยังเป็นงานวิจัยและเดโม ไม่ใช่ product ที่พร้อมใช้งานจริง

Build-off 12 โมเดล (tryai.dev · HN 127 pts): Sol นำงาน raycaster, Fable 5 นำ Rubik's Cube, Grok 4.5 คุ้มสุด (แต่เป็น vibe test ไม่ใช่ benchmark) (ต่อเนื่องจาก 2026-07-08)

รอบใหม่ให้ 12 โมเดล (GPT-5.6 Sol/Terra/Luna, Grok 4.5, Claude Fable 5, Muse Spark 1.1, open-weights) สร้าง 4 แอปเดียวกัน (raycaster maze, 3D Rubik's Cube, calculator, Game of Life) ตัวละ 5 ครั้ง · ผล: Sol ชนะงานซับซ้อน raycaster (5/5 เล่นได้) · Fable 5 ชนะ Rubik's Cube (5/5 แก้สะอาด) · Grok 4.5 ทำได้สูสี Opus ในหลายงานแต่ถูกกว่า · open-weights (Qwen 3.7 Plus) ดีเฉพาะโจทย์คลาสสิก (Game of Life) แต่แหกงานใหม่/ซับซ้อน · ผู้เขียนย้ำเองว่าไม่ใช่คำตัดสินเชิงวิทยาศาสตร์ ("we are not handing down a scientific verdict") ปล่อย artifact ให้คนตัดสินเอง

ทำไมต้องรู้ · นี่คือตัวอย่างที่ดีของการอ่านข่าว AI อย่างมีวิจารณญาณ "vibe test" แบบนี้สนุกและมีประโยชน์เชิง signal แต่วัดแค่ 5 ครั้งต่องานและเลือกงานเองจึงไม่ใช่ benchmark ต้องแยกจากเลข AA Index หรือ SWE-Bench Pro ที่เป็นอิสระ (ซึ่ง Fable นำ Sol ในงาน coding จริงเมื่อ 07-10) เวลาเห็นข่าว "โมเดลนี้ชนะ" ควรถามก่อนว่าวัดกี่ครั้ง วัดงานอะไร และใครเป็นคนเลือกงาน

Tools

pgrust: เขียน PostgreSQL ใหม่ด้วย Rust (AI-assisted) · เคลม compat กับ PG 18.3 100% + เร็วขึ้น 50%/300x (Blognone · HN)

Michael Malis (ผู้ก่อตั้ง Freshpaint) แปลงโค้ด PostgreSQL เป็น Rust แล้วขัดเกลาด้วย AI · เคลม full compatibility กับ PostgreSQL 18.3 + ผ่าน test case ทั้ง 46,000 ตัว · เคลมประสิทธิภาพ transactional เร็วขึ้น 50% และ analytical query เร็วขึ้น 300x (columnar storage + batch) · ตัวเลขทั้งหมดเป็นคำเคลมของผู้พัฒนา ยังไม่มี benchmark อิสระ

ทำไมต้องรู้ · ต่อ thread "AI ช่วยแปลงภาษาโปรแกรมทั้ง codebase" (คู่กับ Bun-in-Rust Zig→Rust $165k 07-10) · pattern ซ้ำ: rewrite ระบบใหญ่เป็น Rust โดยใช้ test suite เดิมเป็น oracle + AI ไล่บั๊ก · แต่ต่างกันที่ยังไม่มีเลขอิสระ (Bun มี test suite ผ่าน 100% ทุก platform ยืนยัน) · ใช้เตือนว่าเลข "เร็วขึ้น 300x" ของ rewrite ต้องรอ independent verify ก่อนเชื่อ

Ello: architecture ทำ AI tutor เด็ก 4-9 ขวบตอบสด sub-second · streaming harness + model tiering + safety ขนาน (HN 138 pts)

Ello เล่า architecture ของ AI tutor สอนเลข/อ่านให้เด็กเล็กแบบ real-time · แทน sequential agent loop ด้วย custom streaming harness ที่โมเดล stream หลาย action ในคำตอบเดียว แล้ว interpreter run แต่ละ action ระหว่างที่โมเดลยัง generate ตัวถัดไป · ดีไซน์ 2 agent: conversational agent คุยสด + async planner เดาก้าวถัดไปตอนเด็กหยุดพูด · เด็กรอแค่ ~30 token แรกแทนทั้งคำตอบ (frontier ใช้ 2-3 วิ/first token) · safety classifier รันขนานกับ "eager response" ไม่ต่อคิว เลยไม่บวก latency 500-1000ms · ใช้ทั้งโมเดลเล็ก (เร็วแต่ตาม instruction ได้แคบ) + frontier (reasoning สอนดีกว่า) ไม่เปิดชื่อรุ่น

ทำไมต้องรู้ · เป็นตัวอย่าง engineering จริงของหลักการสำคัญสองข้อ คือการแบ่งงานไปให้โมเดลที่เหมาะสม (model tiering เทียบได้กับที่ GPT-Live โยนงานหนักไปให้ GPT-5.5) และการที่ harness/orchestration สำคัญไม่แพ้การเลือกโมเดล คำตอบสำหรับคนที่สงสัยว่า "latency ต่ำในงาน AI จริงทำได้ยังไง" คือเทคนิครูปธรรมอย่างการ stream ทีละ action การ pre-generate คำตอบล่วงหน้า และการรัน safety check ขนานกันไป ไม่ใช่แค่รอให้โมเดลเร็วขึ้นเอง

เสียงเรียกร้อง "อย่าปิด Gemini 2.5 Flash" ขึ้น HN 104 pts: model deprecation risk ของโมเดลถูกที่คนพึ่งเยอะ

กระทู้ร้องเรียนบน Google AI dev forum ขอ Google อย่า discontinue Gemini 2.5 Flash ขึ้น HN 104 คะแนน (10 ก.ค.) · สอดคล้อง pattern ใน Gemini changelog ที่ Google ประกาศ deprecate โมเดลเก่าเป็นระยะ (Imagen/Veo รุ่นเก่า shutdown 17 ส.ค./30 มิ.ย.)

ทำไมต้องรู้ · นี่คือมิติ tool-selection ที่คนมักมองข้าม โมเดลที่ถูกและเร็วจนถูกเอาไปใช้ใน production จริงก็อาจถูก vendor สั่ง sunset ได้ ทำให้ workflow ที่ผูกไว้พังหรือต้องรีบย้ายกะทันหัน เป็นความเสี่ยงคนละแบบกับกรณีจีนพิจารณาคุม export (07-09) เพราะอันนี้มาจาก vendor lifecycle ไม่ใช่นโยบายรัฐ ก่อนเลือกใช้โมเดลไหนจริงจังควรถามว่ามีการันตี lifecycle นานแค่ไหน และถ้าถูกปิดมี migration path รองรับหรือไม่

Research

"From Prompts to Contracts" (arXiv 2607.08028): แปลง prototype LLM app เป็น architecture ที่ auditable ด้วย schema validation + boundary แน่นอน

เปเปอร์ (arXiv 07-10) เสนอ production pattern เปลี่ยน LLM app ต้นแบบให้ traceable/auditable ผ่าน schema validation และ deterministic component boundary (แยกส่วนที่โมเดลตัดสินใจออกจากส่วนที่ต้องแน่นอน)

ทำไมต้องรู้ · เปเปอร์นี้เชื่อมสองประเด็นที่กำลังเป็นที่พูดถึง คือความสำคัญของ harness/orchestration (ต่อเนื่องจาก The Harness Effect เมื่อ 07-10) และเรื่อง auditability ของ agent (คล้ายแนวคิด verify-before-execute ของ SAFR/MAS เมื่อ 07-06) เป็นคำตอบสำหรับทีมองค์กรที่สงสัยว่าจะเอา POC ที่ทำเล่นๆ ขึ้น production แบบตรวจสอบได้อย่างไร ด้วยหลักการ contract/schema ที่กั้นขอบเขตระหว่างชั้นให้ชัดเจน

"Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring" (arXiv 2607.08066): chain-of-thought ที่ดูโปร่งใสถูก attacker ใช้ทำให้อนุมัติงานอันตรายมากขึ้น

เปเปอร์ safety (arXiv 07-10) พบว่า reasoning trace แบบ CoT อาจ ย้อนศร: adversary ที่ใช้เทคนิค persuasion ทำให้ monitor ที่อ่าน CoT อนุมัติ action ที่เป็นอันตรายมากขึ้น · เสนอ mitigation แบบ model-diverse fact-checking (ให้หลายโมเดลที่ต่างกันช่วยตรวจ)

ทำไมต้องรู้ · งานวิจัยนี้ต่อยอดประเด็นที่ว่าการอ่านความคิดของโมเดลไม่เท่ากับความปลอดภัย (เกี่ยวโยงกับงาน interpretability เมื่อ 07-08 และตัวเลข LLM conformity 66.5% เมื่อ 07-09) ข้อเตือนตรงๆ คือ "โมเดลโชว์เหตุผลให้ดู" ไม่ใช่ safety guarantee เพราะ CoT ที่ดูสวยอาจถูกจูงใจให้หลอก monitor ได้ หลักการที่ตามมาคืออย่าเชื่อ output เพียงเพราะมันอธิบายได้ดี ต้อง verify อย่างอิสระเสมอ

"CausalDS" (arXiv 2607.08093): benchmark วัด causal reasoning ของ data-science agent · รวม structural causal model กับงาน coding จริง

benchmark ใหม่ (arXiv 07-10) รวม structural causal model เข้ากับงาน data-science coding เพื่อวัด reasoning + tool use + การประเมิน uncertainty ของ agent สาย data

ทำไมต้องรู้ · เป็น data point ที่ชี้ว่างานประเมิน data-science agent เริ่มแยกวัด "reasoning เชิงสาเหตุ" ไม่ใช่แค่ดูว่าได้เลขถูกหรือผิดอีกต่อไป ข้อควรระวังสำหรับคนที่ทำงานสาย data คือ agent ที่ query หรือ plot กราฟได้ ไม่ได้แปลว่ามันเข้าใจ causality จริง กับดัก correlation กับ causation ยังเป็นปัญหาเดิมที่ต้องระวัง

CASP report: กลุ่ม Boko Haram ใช้ frontier AI (ChatGPT/Claude/Gemini/Grok/Meta AI/DeepSeek) แบบ institutionalized · แต่การใช้จริงยังเป็นงาน conventional (HN 161 pts)

รายงาน Cambridge Programme on AI Science & Policy (ผู้เขียน Antonia Juelich) อิงสัมภาษณ์อดีตสมาชิก Boko Haram 27 คน · พบทั้งสองฝ่ายใช้ frontier AI หลายตัวสนับสนุนปฏิบัติการ ผ่าน หน่วยเฉพาะ + โปรแกรมฝึก (institutionalized) · AI ช่วยวางแผนโจมตี แก้ปัญหาอาวุธ ออกแบบวัตถุระเบิด และ มีการ bypass safeguard บางส่วน · แต่รายงานย้ำเองว่าการใช้ที่บันทึกได้ยังเป็นงาน conventional ไม่ใช่ระดับ mass-casualty

ทำไมต้องรู้ · เป็นอีกเคสของ media literacy ที่ต้องระวัง headline "ผู้ก่อการร้ายใช้ AI" ฟังดูน่าตกใจ แต่ตัวรายงานเองระบุ scope ไว้ชัดว่ายังเป็นระดับ conventional ไม่ใช่ WMD จึงควรอ่านให้ครบก่อนสรุปหรือแชร์ต่อ คำถาม dual-use ที่ว่า "AI ช่วยงานร้ายได้จริงแค่ไหน" ควรตอบด้วยกรอบ evidence-based ไม่ใช่ความตื่นตระหนก และเป็น data point ที่ยืนยันว่าเรื่อง jailbreak/safeguard ไม่ใช่แค่ประเด็นวิชาการอีกต่อไป

Business

SK Hynix ทำ IPO ที่สหรัฐ ระดมทุน $26.5B (ADR) · ใหญ่สุดสำหรับบริษัทต่างชาติ · แรงดีมานด์ HBM สาย AI

SK Hynix (ผู้ผลิตชิปหน่วยความจำเกาหลี) ทำ listing ที่สหรัฐผ่าน ADR ราคา $149/หุ้น (ratio 10:1) ระดมทุน $26.5B เป็นสถิติ IPO บริษัทต่างชาติในสหรัฐ · จุดขายคือ HBM (high-bandwidth memory) ที่ป้อน AI processor ของ NVIDIA/AMD (10 ก.ค.)

ทำไมต้องรู้ · ต่อ thread "สงครามต้นทุน/กำลังประมวลผล AI" (คู่กับ Samsung Q2 กำไร ~19 เท่า 07-10, Anthropic เช่า DC Kentucky 07-07) · ตัวเลขฝั่ง supply อีกตัวว่า เงินไหลเข้า hardware layer (memory) ของ AI ยังแรงจริง ไม่ใช่แค่ hype ชั้น application · ใช้เล่าภาพผู้บริหารว่า bottleneck AI ยุคนี้อยู่ที่ memory/compute/พลังงาน bottleneck ก่อนถึงชั้นแอป

Fidji Simo ลงจากหัวหน้า Applications ของ OpenAI (เหตุสุขภาพ) · งานกระจายไป Brockman/Friar/Kwon

Fidji Simo (อดีต CEO Instacart เข้า OpenAI ส.ค. 2025) ก้าวลงจากตำแหน่งหัวหน้า applications เพราะปัญหาสุขภาพเรื้อรัง ย้ายไปเป็นที่ปรึกษา part-time · ความรับผิดชอบกระจายไป Greg Brockman (President), Sarah Friar (CFO), Jason Kwon (Strategy) (10 ก.ค.)

ทำไมต้องรู้ · ถือเป็นข่าว low-signal เชิงเทคนิค แต่ควรบันทึกไว้เป็น context เพราะเกิดขึ้นในช่วงที่ OpenAI เพิ่งดัน product ฝั่ง application อย่างหนัก (ChatGPT Work เมื่อ 07-09, GPT-5.6, Sites) แล้วหัวหน้า applications ก็เปลี่ยนมือพอดี เป็นข้อมูลประกอบเวลาต้องประเมินความเสถียรของ roadmap ฝั่ง vendor

■ ไม่อยากพลาดของใหม่

สรุปข่าวแบบนี้ระบบทำทุกเช้า ถ้าอยากให้คัดเรื่องเด่นส่งถึงมือทาง LINE โดยไม่ต้องแวะมาเช็คเอง กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย