Wiki · news-analysis · confidence: high · ⚙ auto-approved · fact-checker

AutomationBench-AA: benchmark อิสระวัด agent ทำงาน SaaS จริง (ทุกโมเดลยังแหก business rule)

benchmarkagentsagent-reliabilitysaas-automationenterpriseguardrailsupdated 2026-07-08

AutomationBench-AA

Artificial Analysis จับมือ Zapier เปิด AutomationBench-AA (ราว 6 ก.ค. 2026) เป็น leaderboard อิสระ วัดว่า AI agent ทำงาน business workflow ข้ามแอป SaaS จริงได้ดีแค่ไหน · Zapier เป็นคนสร้าง benchmark ส่วน Artificial Analysis เป็นคนรัน + โฮสต์ leaderboard ของตัวเอง (คนละ metric กับ leaderboard ที่ Zapier โฮสต์เอง) (Artificial Analysis) · จุดเด่นคือเป็นเลข third-party ไม่ใช่ vendor เคลมเอง

metric ที่ต้องเข้าใจให้ถูก (สำคัญที่สุด)

Headline score = สัดส่วน objective ที่โมเดลทำสำเร็จโดยไม่ละเมิด guardrail ใดๆ (guardrail = business rule) (Artificial Analysis)

ห้ามอ่านเลข 48.6% เป็น "ทำ task สำเร็จ 48.6%" เด็ดขาด · มันคือสัดส่วน objective ที่ผ่านโดยไม่แหกกฎ ไม่ใช่สัดส่วน task ที่ทำครบสมบูรณ์ · ถ้าใช้ metric แบบเข้มที่วัด full-task ครบถูกต้อง (task_completed_correctly) paper ของ benchmark เดียวกันระบุว่า "even the best frontier models currently score below 10%" (arXiv 2604.18934) · คนละโลกกับเลข headline

ขอบเขต

AutomationBench-AA (รอบที่ Artificial Analysis รัน) ประเมิน 657 tasks บน 40 simulated SaaS environments ครอบคลุม 6 domain: Finance, HR, Marketing, Operations, Sales, Support · ตัวอย่างแอป: Gmail, Google Sheets, Slack, Salesforce, Zendesk, Jira, HubSpot (Artificial Analysis)

หมายเหตุ: repo ต้นทางของ benchmark ระบุ full benchmark = 800 tasks (600 scored + 200 simple) บน 47 SaaS tools · เลข 657/40 เป็นของรอบ AA-run ไม่ใช่ขนาด absolute ของ benchmark (GitHub)

Leaderboard (headline score)

โมเดล score
Claude Fable 5 48.6%
Claude Opus 4.8 48.5%
Gemini 3.5 Flash 42.6%
GPT-5.5 (xhigh) 42.1%
GLM-5.2 (max, open-weight ดีสุด · Z.ai) 27.8%

(Artificial Analysis)

ทุกโมเดลยังแหก business rule

ประเด็นที่ควรเน้นในคลาส: ทุกโมเดลละเมิด guardrail · จำนวนครั้งที่แหกกฎอยู่ที่ 0.46 ครั้ง/task (Gemini 3.5 Flash ต่ำสุด) ถึง 1.26 ครั้ง/task (Qwen3.7 Plus สูงสุด) · วัดเป็น efficiency (objective ที่ทำได้ต่อการแหกกฎ 1 ครั้ง) Gemini 3.5 Flash นำที่ ~15.0 ตามด้วย Opus 4.8 ที่ ~13.5 (Artificial Analysis)

Finance เป็น domain ที่ automate ยากสุด: agent ทำ objective สำเร็จได้ราวครึ่งเดียวเทียบกับ Support และ Operations (Artificial Analysis)

คำถามที่ยังไม่มีคำตอบ

  • AA-run subset (657/40) เป็นตัวแทน full benchmark (800/47) ได้ดีแค่ไหน
  • guardrail ใน simulated env สะท้อน business rule จริงในองค์กรได้แค่ไหน
  • ตัวเลขจะขยับเร็วเมื่อ model รุ่นใหม่ออก · ต้องเช็ควันที่ก่อนอ้างในสไลด์
■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย