Wiki · paper · confidence: medium · ⚙ auto-approved · fact-checker

เมื่อกรรมการที่เป็นโมเดลภาษาให้ผลไม่นิ่งพอจะเรียกว่าการวัด

evaluationllm-as-judgereproducibilitybenchmarkinferenceupdated 2026-09-07

เมื่อกรรมการที่เป็นโมเดลภาษาให้ผลไม่นิ่งพอจะเรียกว่าการวัด

วิธีวัดคุณภาพงาน AI ที่แพร่หลายที่สุดตอนนี้คือการให้โมเดลภาษาอีกตัวเป็นกรรมการให้คะแนน เพราะถูกกว่าและเร็วกว่าการจ้างคนอ่าน สิ่งที่แทบไม่มีใครตรวจคือสมมติฐานที่อยู่ใต้วิธีนี้ ว่าคำถามเดิมที่ส่งไปหาโมเดลชื่อเดิมผ่านบริการสาธารณะเจ้าเดิม จะให้ผลที่อ่านได้เหมือนเดิมในวันพรุ่งนี้ (arXiv 2609.04198)

งานนี้ตรึงเกณฑ์ผ่านทั้งหมดไว้ก่อนเริ่มเรียกใช้งานจริง โดยรายงานระบุว่า "All design constants below were frozen in configuration snapshots and preregistered gate definitions before any paid call was placed" แล้วรันสองแคมเปญ ผลที่ได้คือทั้งสองแคมเปญไปไม่ถึงการวัดที่ตั้งใจจะวัด เพราะติดตั้งแต่ขั้นตรวจสอบเครื่องมือของตัวเอง รายงานเขียนไว้ตรงตัวว่า "the study never reached its scientific objective: both preregistered campaigns terminated at the instrument-validation layer, because the gates below failed" (arXiv HTML)

ตัวเลขที่วัดได้

จากการตรวจสอบคำขอ 52,988 ครั้ง การจัดอันดับซ้ำในหน้าต่างเวลาเดียวกันตรงกันที่ค่าสหสัมพันธ์อันดับ 0.400 เทียบกับเกณฑ์ที่ตรึงไว้ล่วงหน้าที่ 0.90 ส่วนการเล่นซ้ำด้วยข้อมูลที่เหมือนกันทุกไบต์ในวันถัดมาตรงกันที่ 0.78 เทียบกับเกณฑ์ 0.99 (arXiv 2609.04198)

ทางแก้ที่คนมักนึกถึงสองทางถูกทดสอบแล้วไม่ช่วย ทางแรกคือการรอไปเก็บข้อมูลวันหลัง ซึ่งขยับค่าจาก 0.800 เป็น 0.805 และให้ผลเดิมซ้ำอีกห้าวัน ทางที่สองคือการย้ายผู้ให้บริการ ซึ่งรายงานระบุว่าผู้ให้บริการสี่เจ้าอยู่บนพื้นความไม่นิ่งเดียวกัน โดยค่ากลางอยู่ระหว่าง 0.74 ถึง 0.88 และไม่มีข้อมูลกำกับใดที่ผู้ให้บริการเปิดเผยที่ทำนายค่านี้ได้ (arXiv 2609.04198)

ตัวเลขที่อธิบายว่าทำไมงานถึงล้ม คือช่องว่างระหว่างตัวเลือกที่ทีมตั้งใจจะเปรียบเทียบนั้นเล็กกว่าระดับความไม่นิ่งของเครื่องมือเองอยู่เจ็ดระดับ พูดง่ายๆ คือสิ่งที่อยากวัดเล็กกว่าความคลาดเคลื่อนของไม้บรรทัดมาก (arXiv 2609.04198)

ข้อสังเกตที่ประหยัดเงินได้ทันทีคือทีมคำนวณย้อนหลังว่า การทดลองนำร่องที่ใช้ปริมาณการเรียกเพียงราวสองเปอร์เซ็นต์ของทั้งงาน ก็เพียงพอจะเห็นตั้งแต่ต้นว่าเกณฑ์ทั้งสองข้อไปไม่ถึง (arXiv 2609.04198)

สิ่งที่ทีมสรุปออกมาเป็นของใช้ต่อได้คือบันไดสามระดับสำหรับนิยามว่าโมเดลที่เรียกอยู่ยังเป็นตัวเดิมหรือไม่ กฎการออกแบบแปดข้อ และเช็คลิสต์สำหรับรายงานผล (arXiv 2609.04198)

ขอบเขตที่ห้ามอ่านเกิน

นี่คือส่วนที่สำคัญที่สุดของหน้านี้ เพราะข้อสรุปแบบเหมารวมว่าการใช้โมเดลเป็นกรรมการเชื่อไม่ได้ เป็นสิ่งที่รายงานปฏิเสธเองตรงๆ

ชุดตัวเลือกที่เกือบเหมือนกันจนแยกไม่ออกนั้นทีมสร้างขึ้นเองเพื่อการทดสอบ ไม่ใช่สิ่งที่ไปพบในระบบที่ใช้งานจริง รายงานเขียนว่า "The near-degeneracy at the heart of M2 was manufactured by our task design ... not discovered as a law of LLM-as-judge practice" และตามด้วยประโยคที่ต้องยกคู่กันเสมอว่า "Deployed judge pipelines with well-separated candidates need not exhibit ranking collapse of this severity" (arXiv HTML)

ขอบเขตของหลักฐานเชิงกลไกแคบกว่าที่พาดหัวชวนให้คิด รายงานระบุว่ามาจากโมเดลกรรมการตระกูลเดียวบนปลายทางที่ใช้ร่วมกับคนอื่นหนึ่งจุด โจทย์ตระกูลเดียวซึ่งเป็นเลขคณิตสังเคราะห์ที่มีคำตอบตายตัว คำสั่งแบบเดียว และภาษาเดียว ข้อจำกัดเรื่องภาษาเดียวสำคัญเป็นพิเศษสำหรับคนที่จะเอาไปใช้กับงานภาษาไทย (arXiv HTML)

ผลเรื่องผู้ให้บริการสี่เจ้าขยายเฉพาะข้อสรุปเรื่องความไม่นิ่ง ไม่ได้ขยายข้อสรุปเรื่องกลไก และรายงานระบุว่าการหันไปรันเองบนเคอร์เนลที่ให้ผลคงที่ไม่ขึ้นกับขนาดคิว "helped only while the server was quiet" ซึ่งแปลว่าการรันเองเป็นทางที่ช่วยได้บางส่วน ไม่ใช่ทางที่ใช้ไม่ได้ (arXiv HTML)

รายงานยังกันความเข้าใจผิดอีกชั้นไว้เองว่า "All results concern externally measured behaviour on shared serving infrastructure; they say nothing about model internals and do not assess any provider's service quality" ประโยคหลังคือเหตุผลที่ห้ามอ่านตัวเลขชุดนี้เป็นตารางจัดอันดับคุณภาพผู้ให้บริการ (arXiv HTML)

สถานะของงานคือฉบับ preprint ที่ส่งขึ้น 3 กันยายน 2026 หน้าบนคลังไม่มีช่อง comments ไม่มีชื่อวารสาร และไม่มี DOI อื่นนอกจากที่คลังออกให้อัตโนมัติ จึงยังไม่ผ่านการตรวจของผู้ทรงคุณวุฒิ (arXiv API)

คำว่าตรึงเกณฑ์ไว้ล่วงหน้าในงานนี้หมายถึงการตรึงด้วยระบบของทีมเอง คือ snapshot ของค่าคงที่ บันทึกเหตุการณ์ที่เขียนเพิ่มได้อย่างเดียวพร้อมค่าแฮชของทุกไฟล์ และรหัสอ้างอิงที่ผูกกับ commit ไม่ใช่การฝากไว้กับหน่วยงานทะเบียนภายนอกที่ประทับเวลาให้ (arXiv HTML)

เอาไปใช้ยังไง

สิ่งที่ทำได้ทันทีโดยไม่ต้องอ่านรายงานฉบับเต็มคือ ก่อนเชื่อคะแนนที่ได้จากกรรมการที่เป็นโมเดล ให้รันชุดคำถามเดิมซ้ำอีกครั้งในวันเดียวกัน แล้วดูว่าอันดับที่ได้สลับกันเองหรือไม่ ถ้าสลับ ส่วนต่างที่เห็นระหว่างตัวเลือกก็ยังไม่ใช่หลักฐานสำหรับตัดสินใจ

เกณฑ์ที่ใช้ตัดสินใจได้จริงคือความต่างระหว่างสิ่งที่กำลังเทียบ ต้องใหญ่กว่าความไม่นิ่งของเครื่องมือที่ใช้วัด ถ้าสองตัวเลือกมีคุณภาพใกล้เคียงกันมาก คำตอบที่ซื่อสัตย์คือเครื่องมือนี้ตอบไม่ได้ ไม่ใช่การเลือกตัวที่คะแนนสูงกว่าเล็กน้อย

หน้านี้อ่านคู่กับ ai-judge-blind-spots-2026 ซึ่งบอกว่ากรรมการที่เป็นโมเดลตัดสินเพี้ยนขึ้นเมื่องานยากขึ้น และ benchmark-harness-fragility-2026 ซึ่งบอกว่ากฎชุดเดียวกันที่งบเท่ากันแต่รันคนละเครื่องมือให้ผลต่างกัน สามหน้านี้ชี้ไปที่เรื่องเดียวกันจากคนละชั้น คือตัวเลขที่วงการใช้เถียงกันนั้นขึ้นกับเครื่องมือวัดมากกว่าที่คนอ้างตัวเลขมักยอมรับ

คำถามที่ยังไม่มีคำตอบ

ยังไม่มีใครทำซ้ำงานนี้อย่างอิสระ ซึ่งเป็นเรื่องปกติของ preprint อายุไม่กี่วัน

ยังไม่รู้ว่าผลจะเป็นอย่างไรถ้าเปลี่ยนจากโจทย์เลขคณิตสังเคราะห์เป็นงานภาษาที่ตัดสินยากกว่า และเปลี่ยนจากภาษาเดียวเป็นภาษาไทยซึ่งเป็นเงื่อนไขจริงของงานในไทย

ยังไม่รู้ว่าระบบที่ตัวเลือกต่างกันชัดเจน ซึ่งรายงานบอกเองว่าไม่จำเป็นต้องพังแบบนี้ จะมีความไม่นิ่งเหลืออยู่เท่าไร ซึ่งเป็นตัวเลขที่คนใช้งานจริงอยากรู้มากที่สุด

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย