Dictionary · ความรู้และแหล่งอ้างอิง · 143 / 291

Artificial Analysis

เว็บวัดผลอิสระที่รันชุดทดสอบเดียวกันกับทุกโมเดล AI แล้วเปิดเผยคะแนนความฉลาด ราคา และความเร็ว ให้เทียบข้ามค่ายได้โดยไม่ต้องพึ่งตัวเลขที่บริษัทประกาศเอง

Artificial Analysis คือเว็บไซต์วัดผลโมเดล AIอย่างเป็นอิสระ จุดต่างจากหน้าประกาศของบริษัทเจ้าของโมเดลคือมันรันชุดทดสอบเดียวกันกับทุกโมเดลที่ติดตาม แล้วเอาผลสามด้านมาวางไว้ที่เดียวกันคือคะแนนความฉลาดรวม (Intelligence Index) ราคา และความเร็ว ให้คนที่กำลังจะเลือกใช้หรือเลือกซื้อโมเดลเทียบข้ามค่ายได้โดยไม่ต้องเชื่อตัวเลขที่บริษัทเจ้าของโมเดลเขียนเองในหน้าประกาศ ตารางหลักที่คนพูดถึงบ่อยที่สุดคือ Intelligence Index ของโมเดลภาษา ซึ่งหน้า LLM Leaderboard ระบุ ณ วันที่ 13 ส.ค. 2026 ว่าเทียบโมเดลภาษาไว้มากกว่า 250 ตัว ส่วนกราฟเทียบคะแนนบนหน้าโมเดลแต่ละตัวดึงจากฐานโมเดลภาษา 605 ตัว โมเดลภาพ วิดีโอ และเสียง เว็บแยกตารางและแยกตัวนับไว้ต่างหาก ไม่ได้นับรวมอยู่ในเลข 605 นี้

Intelligence Index เวอร์ชันที่เว็บใช้อยู่ ณ วันที่ 13 ส.ค. 2026 คือ v4.1.1 เป็นคะแนนรวมที่คำนวณจากชุดทดสอบย่อยเก้าชุดแบบถ่วงน้ำหนักไม่เท่ากัน ได้แก่ GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience และ AA-LCR โดยรันด้วยวิธีเดียวกันทุกโมเดล ไม่ใช่เอาตัวเลขที่แต่ละบริษัทประกาศเองมาเรียงต่อกัน ด้านความเร็ววัดสองค่าคือเวลารอคำตอบแรก (time to first token) และความเร็วพิมพ์หลังเริ่มตอบแล้ว (โทเคนต่อวินาที) ส่วนราคาที่เอามาเทียบเป็นราคาผสม โดยหน้าอธิบายวิธีวัดระบุว่าสมมติสัดส่วนโทเคนแบบ cache hit ต่ออินพุตต่อเอาต์พุตเท่ากับ 7:2:1 และยังมีอีกค่าคือต้นทุนต่อการทำหนึ่งงานใน Intelligence Index (cost per task) เว็บนี้ก่อตั้งปี 2023 โดย Micah Hill-Smith และ George Cameron สองคนที่พบกันตอนฝึกงานที่ Google แล้วเห็นตรงกันว่าตอนนั้นยังไม่มีใครทำ benchmark อิสระที่เชื่อถือได้ ธุรกิจใช้โมเดลฟรีเมียม คือเปิดข้อมูลวัดผลพื้นฐานให้ดูฟรีบนเว็บ ส่วนรายงานเจาะลึกและการเข้าถึงแบบ subscription ขายให้ลูกค้าองค์กร

คนทำงานมักเจอชื่อนี้แนบท้ายข่าวเปิดตัวโมเดลใหม่ ในฐานะตัวยืนยันหรือหักล้างคำเคลมของบริษัทเจ้าของโมเดล ตัวอย่างที่เห็นชัดจากการเปิดหน้าโมเดล Grok 4.6 โหมด high ของ SpaceXAI ซึ่งเปลี่ยนชื่อมาจาก xAI เมื่อกรกฎาคม 2026 เมื่อวันที่ 13 ส.ค. 2026 คือ Intelligence Index อยู่ที่ 61 อยู่อันดับ 6 จากโมเดล 184 ตัวในกลุ่มเทียบเดียวกัน ซึ่งเว็บนิยามว่าเป็นโมเดลทั้งแบบปิดและแบบเปิดน้ำหนักที่ราคาผสมแบบอินพุตต่อเอาต์พุต 3:1 สูงกว่า 1 ดอลลาร์ต่อล้านโทเคน ไม่ใช่อันดับจากโมเดลทั้งตาราง คะแนนนี้สูงกว่าค่ากลางของกลุ่มเทียบที่ 34 มาก แต่เวลารอคำตอบแรกอยู่ที่ 31.18 วินาที ขณะที่ค่ากลางของกลุ่มเทียบชุดเดียวกันอยู่แค่ 2.86 วินาที ส่วนความเร็วพิมพ์ 65.5 โทเคนต่อวินาที ต่ำกว่าค่ากลาง 66.0 เล็กน้อย ตัวเลขความเร็วสองค่านี้วัดจาก API ของ SpaceXAI เอง ถ้าเรียกโมเดลเดียวกันผ่านผู้ให้บริการรายอื่นตัวเลขก็เปลี่ยน ข้อควรระวังคือตัวเลขความเร็วพวกนี้เป็นค่ามัธยฐาน (P50) ของผลวัดย้อนหลัง 72 ชั่วโมง โดยเว็บยิงคำขอทดสอบชุดหลักวันละ 8 ครั้ง ห่างกันประมาณ 3 ชั่วโมง ไม่ใช่ค่าที่วัดครั้งเดียวแล้วนิ่งตาย จึงขยับได้ตลอด จะเอาไปอ้างอิงตอนตัดสินใจซื้อจริง ควรเปิดดูหน้าโมเดลใกล้เวลาตัดสินใจที่สุด ไม่ใช่จำตัวเลขจากข่าวเก่า อีกจุดที่ต้องรู้คือนี่ยังเป็นชุดทดสอบสำเร็จรูปที่วัดความสามารถทั่วไป ไม่ได้วัดงานเฉพาะทางขององค์กรใดองค์กรหนึ่ง อีกทั้งเว็บระบุเองว่า Intelligence Index เป็นชุดทดสอบข้อความภาษาอังกฤษล้วน ส่วน Multilingual Index ที่ทำแยกไว้ต่างหากครอบคลุม 16 ภาษาซึ่งยังไม่มีภาษาไทยอยู่ในนั้น จะเอาไปใช้ตัดสินใจเรื่องงานภาษาไทยต้องทดสอบเพิ่มเองอยู่ดี

ตัวอย่างจากบทสนทนาจริง

ฝ่ายจัดซื้อ: "บริษัทที่มาเสนอโมเดลบอกว่าคะแนนเทียบเท่ารุ่นท็อปของคู่แข่งเป๊ะ เชื่อได้แค่ไหน"

ทีมข้อมูล: "เช็คใน Artificial Analysis ก่อนได้เลยครับ เป็นเว็บที่รันชุดทดสอบเดียวกันกับทุกโมเดลแล้ววัดเอง ไม่ได้เอาตัวเลขที่บริษัทแจ้งเองมาแปะ ถ้าคะแนนรวมตรงกันก็เชื่อได้ระดับหนึ่ง แต่อย่าลืมดูความเร็วรอคำตอบแรกด้วย บางทีคะแนนเท่ากันแต่ตัวหนึ่งรอนานกว่าอีกตัวเป็นสิบเท่า"

ระวังสับสนกับ

  • benchmark : benchmark คือชุดทดสอบหรือวิธีวัดผลเดี่ยวๆ ตัวหนึ่ง เช่น GPQA หรือ Humanity's Last Exam ส่วน Artificial Analysis คือแพลตฟอร์มที่เอา benchmark หลายชุดมารันรวมกันแล้วสรุปเป็นคะแนนเดียว
  • primary-source : ตัวเลขที่ Artificial Analysis รันเองนับเป็น primary source ของ "ผลวัดอิสระ" แต่ไม่ใช่ primary source ของสเปกหรือราคาที่บริษัทเจ้าของโมเดลประกาศเอง ต้องแยกสองอย่างนี้เวลาอ้างอิง
  • human-review : Artificial Analysis ใช้ชุดทดสอบอัตโนมัติที่รันซ้ำต่อเนื่องเป็นหลัก ต่างจาก human review ที่ให้คนจริงมานั่งตรวจงานทีละชิ้น

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Vibe codingBenchmark