หลักฐานนอก Anthropic ชุดแรกของ Opus 5: Epoch วัด 159 = อันดับ 4 จาก 213 · CodeRabbit พบ recall ตก · hallucination +14 จุดเป็น 50% · และ "AA ไม่ใช่ independent" (25-26 ก.ค.) (ต่อเนื่องจาก 2026-07-25) ⚙
จุดที่ต้องตั้งให้ถูกก่อนอื่น: อะไรคือ "อิสระ" · Artificial Analysis ประกาศเอง "We supported @AnthropicAI to evaluate Claude Opus 5 ahead of release" = pre-release eval ที่ทำร่วมกับ vendor ไม่ใช่ arm's-length · Scott Wu (Cognition) และ Wade Foster (Zapier) เป็น launch testimonial บนหน้าข่าวของ Anthropic เอง ไม่ใช่หลักฐานอิสระ · ที่อิสระจริงมีสามแหล่ง: Epoch AI · CodeRabbit · Claire Vo
Epoch AI (อิสระ): Opus 5 = 159 · CI 90% = 157-162 · อันดับ 4 จาก 213 โมเดล ตามหลัง GPT-5.6 Sol 162 · Fable 5 161 · GPT-5.5 Pro 161 · ห้ามเขียนว่า "สอง index ขัดแย้งกัน": AA เองเรียกผลตัวเองว่า Opus 5 "effectively tied with Claude Fable 5" และ CI ของ Epoch คร่อม 161 อยู่แล้ว = ต่างกันระดับ noise
AA (ทำร่วมกับ Anthropic): AA-Briefcase ที่ max 1,720 vs 1,574 Elo ต้นทุน $17.79 vs $22.30 (ถูกลง 20%) · Terminal-Bench v2.1 89% ที่ max · HLE 53% เสมอ · ต้นทุนเฉลี่ยต่องาน $2.03 vs $2.75 (ตัวเทียบคือ "Fable 5 with fallback" ไม่ใช่ Fable 5 เปล่า)
ตัวเลขที่สำคัญที่สุด: hallucination rate ขึ้น 14 จุดเป็น 50% · แต่ห้ามพูดลอยๆ ว่า "Opus 5 มั่ว 50%": วัดบน AA-Omniscience ซึ่งเป็น knowledge-recall benchmark ตัวเดียว · baseline คือ Opus 4.8 ไม่ใช่ Fable 5 · accuracy ดีขึ้น 7 จุดพร้อมกัน · กลไกคือ benchmark นี้ไม่ลงโทษการปฏิเสธตอบ โมเดลที่ยอมตอบบ่อยขึ้นจึงได้ทั้งถูกขึ้นและมั่วขึ้น
CodeRabbit (อิสระ · ~100 error pattern จาก PR จริง): precision บน actionable comment ที่ x-high 39.3% vs baseline 35.2% · แต่ recall ตกเป็น 55.2% จาก baseline 61.1% · precision ทั้ง stream ที่ x-high 28.6% ต่ำกว่า baseline 32.8% · nitpick 92 ครั้ง vs 23 · ข้อสรุป: "The practical fit is as a second, precision-oriented reviewer."
Claire Vo (อิสระ): เรียกมันว่า "brilliant but annoying" มี "neurotic streak" และ "flatly refused to touch" merge conflict · แต่ใน blind test เธอจัด Opus 5 เหนือทุกโมเดล รวม Fable 5 และ GPT-5.6
Prompt injection: Boris Cherny โพสต์บน X "Opus 5 is our least prompt injectable model yet" · "หน้า 73 ของ system card" เป็น annotation ของ Willison ไม่ใช่คำของ Cherny · system card เองไม่ได้ใช้คำนั้น แต่รายงานเป็นเลข IPI: โอกาสสำเร็จใน 15 ครั้ง 5.5% → 2.0%
▲ ทำไมต้องรู้ · กรณีนี้สอนบทเรียนสำคัญเรื่องการอ่านคำว่า independent benchmark เพราะแม้แต่ผู้ประเมินที่เรียกตัวเองว่าอิสระก็อาจทำงานร่วมกับบริษัทเจ้าของโมเดลมาก่อนวันเปิดตัวจริง เห็นคำนี้ครั้งหน้าควรถามต่อว่าใครเป็นคนรัน รันเมื่อไหร่ และบริษัทเจ้าของโมเดลมีส่วนร่วมก่อนเปิดตัวหรือไม่ อีกประเด็นที่น่าสนใจคือโมเดลที่กล้าตอบคำถามมากขึ้นมักตอบถูกมากขึ้นและตอบผิดมากขึ้นไปพร้อมกัน ตัวเลขความแม่นยำเพียงตัวเดียวจึงบอกไม่ได้ว่าโมเดลดีขึ้นหรือแย่ลง ต้องดูด้วยว่า benchmark นั้นลงโทษการปฏิเสธตอบหรือไม่ และคะแนนรวมที่สูงกว่าเดิมก็ไม่ได้แปลว่าเครื่องมือนั้นจะแทนของเดิมได้ในทุกงาน
Epoch AI (Opus 5) · Epoch AI benchmarks · Artificial Analysis · AA disclosure · CodeRabbit · Lenny's Newsletter (Claire Vo) · Simon Willison (Cherny)