AutomationBench-AA: benchmark อิสระวัด agent ทำงาน SaaS จริง (ทุกโมเดลยังแหก business rule)
AutomationBench-AA
Artificial Analysis จับมือ Zapier เปิด AutomationBench-AA (ราว 6 ก.ค. 2026) เป็น leaderboard อิสระ วัดว่า AI agent ทำงาน business workflow ข้ามแอป SaaS จริงได้ดีแค่ไหน · Zapier เป็นคนสร้าง benchmark ส่วน Artificial Analysis เป็นคนรัน + โฮสต์ leaderboard ของตัวเอง (คนละ metric กับ leaderboard ที่ Zapier โฮสต์เอง) (Artificial Analysis) · จุดเด่นคือเป็นเลข third-party ไม่ใช่ vendor เคลมเอง
metric ที่ต้องเข้าใจให้ถูก (สำคัญที่สุด)
Headline score = สัดส่วน objective ที่โมเดลทำสำเร็จโดยไม่ละเมิด guardrail ใดๆ (guardrail = business rule) (Artificial Analysis)
ห้ามอ่านเลข 48.6% เป็น "ทำ task สำเร็จ 48.6%" เด็ดขาด · มันคือสัดส่วน objective ที่ผ่านโดยไม่แหกกฎ ไม่ใช่สัดส่วน task ที่ทำครบสมบูรณ์ · ถ้าใช้ metric แบบเข้มที่วัด full-task ครบถูกต้อง (task_completed_correctly) paper ของ benchmark เดียวกันระบุว่า "even the best frontier models currently score below 10%" (arXiv 2604.18934) · คนละโลกกับเลข headline
ขอบเขต
AutomationBench-AA (รอบที่ Artificial Analysis รัน) ประเมิน 657 tasks บน 40 simulated SaaS environments ครอบคลุม 6 domain: Finance, HR, Marketing, Operations, Sales, Support · ตัวอย่างแอป: Gmail, Google Sheets, Slack, Salesforce, Zendesk, Jira, HubSpot (Artificial Analysis)
หมายเหตุ: repo ต้นทางของ benchmark ระบุ full benchmark = 800 tasks (600 scored + 200 simple) บน 47 SaaS tools · เลข 657/40 เป็นของรอบ AA-run ไม่ใช่ขนาด absolute ของ benchmark (GitHub)
Leaderboard (headline score)
| โมเดล | score |
|---|---|
| Claude Fable 5 | 48.6% |
| Claude Opus 4.8 | 48.5% |
| Gemini 3.5 Flash | 42.6% |
| GPT-5.5 (xhigh) | 42.1% |
| GLM-5.2 (max, open-weight ดีสุด · Z.ai) | 27.8% |
ทุกโมเดลยังแหก business rule
ประเด็นที่ควรเน้นในคลาส: ทุกโมเดลละเมิด guardrail · จำนวนครั้งที่แหกกฎอยู่ที่ 0.46 ครั้ง/task (Gemini 3.5 Flash ต่ำสุด) ถึง 1.26 ครั้ง/task (Qwen3.7 Plus สูงสุด) · วัดเป็น efficiency (objective ที่ทำได้ต่อการแหกกฎ 1 ครั้ง) Gemini 3.5 Flash นำที่ ~15.0 ตามด้วย Opus 4.8 ที่ ~13.5 (Artificial Analysis)
Finance เป็น domain ที่ automate ยากสุด: agent ทำ objective สำเร็จได้ราวครึ่งเดียวเทียบกับ Support และ Operations (Artificial Analysis)
คำถามที่ยังไม่มีคำตอบ
- AA-run subset (657/40) เป็นตัวแทน full benchmark (800/47) ได้ดีแค่ไหน
- guardrail ใน simulated env สะท้อน business rule จริงในองค์กรได้แค่ไหน
- ตัวเลขจะขยับเร็วเมื่อ model รุ่นใหม่ออก · ต้องเช็ควันที่ก่อนอ้างในสไลด์
Sources (3)
- https://artificialanalysis.ai/articles/announcing-zapier-automationbench-aa fetched 2026-07-08
- https://github.com/zapier/AutomationBench fetched 2026-07-08
- https://arxiv.org/abs/2604.18934 fetched 2026-07-08
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย