Wiki · news-analysis · confidence: medium · ⚙ auto-approved · fact-checker

ผู้ช่วยเขียนโค้ดเลือกเครื่องมือให้เราเอง และเลือกไม่เหมือนกัน

coding-agentsclaude-codecodexcursortool-selectionvendor-lock-inbenchmark-caveatsupdated 2026-09-06

ผู้ช่วยเขียนโค้ดเลือกเครื่องมือให้เราเอง และเลือกไม่เหมือนกัน

เวลาสั่งผู้ช่วยเขียนโค้ดว่าช่วยต่อระบบส่งอีเมลให้หน่อย มันไม่ได้ถามกลับว่าจะใช้เจ้าไหน แต่เลือกให้เลย บริษัท Armature เผยแพร่งานวัดเมื่อ 3 ก.ย. 2569 ที่พยายามตอบว่าตกลงมันเลือกอะไร และเลือกเหมือนกันหรือไม่ (Armature)

อ่านหน้านี้โดยรู้ที่มาของตัวเลขก่อน

ก่อนอ่านตัวเลขใดๆ ต้องรู้สี่ข้อนี้ เพราะมันเปลี่ยนความหมายของทุกตัวเลขข้างล่าง

ข้อแรกคือผู้ทำงานวิจัยมีส่วนได้เสียโดยตรงกับผลลัพธ์ รายงานเขียนกำกับไว้เองท้ายบทความว่าบริษัทขาย บริการให้ผู้ผลิตเครื่องมือนักพัฒนา และงานชิ้นนี้เป็นส่วนหนึ่งของงานที่กว้างกว่าเรื่องวิธีมีอิทธิพลต่อการ เลือกของผู้ช่วยเขียนโค้ดเพื่อให้สินค้าถูกเลือก ซึ่งตรงกับข้อความบนหน้าแรกของบริษัทเองที่ชวนให้เป็นเจ้าที่ ผู้ช่วยเลือก (armature.tech · Y Combinator)

ข้อสองคือรีโปที่ใช้ทดสอบเป็นของที่สร้างขึ้นทั้งหมด รายงานระบุเองว่าใช้ชื่อบริษัทปลอม ประวัติการแก้โค้ดปลอม และกุญแจ API ปลอม โดยมีเพียงไฟล์ล็อกไลบรารีที่เป็นของจริง จึงไม่ใช่ฐานโค้ดที่ใช้งานจริงในองค์กร

ข้อสามคือมีการคัดทิ้ง จากทั้งหมด 16,893 รอบ เหลือที่นำมาเผยแพร่ 5,292 รอบ คือคัดทิ้งไปราวสองในสาม โดยเกณฑ์ที่อธิบายไว้สั้นมาก คือดูว่าตัวเลือกไม่ถูกชี้นำโดยรีโปที่เลือกผู้ให้บริการไว้ล่วงหน้าอยู่แล้ว และดูว่ามี การเลือกเกิดขึ้นจริง ทีมระบุว่าอาจปล่อยส่วนที่เหลือในรอบถัดไป

ข้อสี่คือรายงานไม่ระบุรุ่นของผู้ช่วยทั้งสามตัวและไม่ระบุช่วงวันที่รัน ทำให้ทำซ้ำไม่ได้และเทียบกับผลในอนาคต ไม่ได้ตรงๆ นอกจากนี้ยังไม่มีใครทำซ้ำอย่างอิสระ ตัวเลขทั้งหมดจึงมีแหล่งเดียว

ขอบเขตของการวัด

ทีมสร้างชุดรีโปสำหรับทดสอบ 75 แห่งใน 10 ภาษา แล้วรันทั้งหมด 16,893 รอบ ส่วนที่ผ่านเกณฑ์และนำมา เผยแพร่คือ 5,292 รอบ บน 51 ฐานโค้ด ครอบคลุม 18 กลุ่มธุรกิจ

ผู้ช่วยที่ทดสอบมีสามตัวคือ Claude Code, Codex และ Cursor โดยใช้คำสั่ง 1,163 แบบ และจำลองผู้ใช้สี่แบบ ตั้งแต่คนที่ปล่อยให้ AI เขียนให้ทั้งหมด นักพัฒนารุ่นใหม่ นักพัฒนาอาวุโส ไปจนถึงวิศวกรในองค์กรขนาดใหญ่

โครงสร้างการทดสอบหมุนผู้ให้บริการกล่องทดลองสามเจ้าคือ E2B, Blaxel และ Daytona โดยทีมระบุว่าได้ตรวจ แล้วว่าการเลือกกล่องทดลองไม่กระทบข้อสรุป ส่วนตัวที่ทำหน้าที่จำลองการโต้ตอบของคนและตรวจความสมบูรณ์ ของเซสชันคือ Gemini 3.7 Flash

ผลหลัก: ความไม่ลงรอยคือค่าปกติ

ตัวเลขที่เป็นหัวใจคือผู้ช่วยทั้งสามตัวเลือกเครื่องมือตัวเดียวกันเพียง 42 เปอร์เซ็นต์ของช่องที่วัด รายงานยกตัวอย่าง กลุ่มผู้ช่วยด้านเสียงที่ Claude Code เลือก Twilio ขณะที่ Codex เลือก OpenAI Realtime API

พฤติกรรมก่อนตัดสินใจก็ต่างกันชัด Codex ค้นเว็บแทบทุกครั้งคือ 94 เปอร์เซ็นต์ของเซสชัน Cursor ค้นราว 67 เปอร์เซ็นต์ ส่วน Claude Code พึ่งความรู้เดิมของตัวเองเป็นหลักและค้นเว็บเพียงราว 30 เปอร์เซ็นต์ แต่ในกลุ่ม ธุรกิจที่ใหม่กว่าอย่างบริการกล่องทดลอง ซึ่งความรู้เดิมของมันบางลง อัตราการค้นเว็บขึ้นไปราว 80 เปอร์เซ็นต์

อีกความต่างคือ Claude Code เลือกเขียนของขึ้นมาเองแทนการหยิบบริการภายนอกมาใช้ ในอัตราเกือบสองเท่า ของอีกสองตัว คือ 19 เปอร์เซ็นต์เทียบกับ 10 เปอร์เซ็นต์

ภาษาของโปรเจกต์เปลี่ยนผู้ชนะ

ในกลุ่มบริการส่งอีเมล ผู้ชนะเปลี่ยนไปตามภาษาของรีโป โดย Resend ชนะในโปรเจกต์ TypeScript 55 จาก 89 รอบ Sendgrid ชนะในฝั่ง Python 22 จาก 24 รอบ Postmark ชนะในฝั่ง Go 20 จาก 24 รอบ และบริการของ Azure ชนะในฝั่ง Java 22 จาก 23 รอบ

ตัวหารในบางภาษาเล็กมาก เช่น 22 จาก 24 และ 22 จาก 23 ซึ่งควรอ่านเป็นทิศทาง ไม่ใช่สัดส่วนที่มั่นคง

ส่วนกลุ่มที่มีเจ้าครองชัดคือระบบรับชำระเงิน รายงานระบุว่า Stripe ชนะราว 9 ใน 10 เคส และในกลุ่มที่นับได้ Stripe ชนะ 124 จาก 139 รอบ โดยแพ้เฉพาะเคสที่ติดกฎเกณฑ์ของยุโรป ซึ่งเจ้าที่ถนัดกว่าคือ Paddle และ Mollie

เรื่องที่คนรู้จักดี ไม่ใช่เรื่องที่ถูกเลือก

ผลที่น่าสนใจที่สุดของงานนี้คือช่องว่างระหว่างการถูกพูดถึงกับการถูกเลือกจริง

PayPal ถูกเอ่ยถึง 139 ครั้งแต่ไม่เคยถูกเลือกเลยสักครั้ง LangChain เป็นเฟรมเวิร์กที่ถูกเอ่ยถึงมากที่สุดคือ 194 ครั้ง แต่ถูกเลือกจริงเพียง 4 ครั้ง และ Supabase เป็นฐานข้อมูลที่ถูกเอ่ยถึงมากที่สุดคือ 242 ครั้ง แต่ยังถูก Neon เอาชนะไปเป็นส่วนใหญ่

ตัวเลขที่ห้ามเรียกผิดชื่อ

รายงานมีตัวเลขอัตราการถูกเลือกอยู่หลายตัว เช่น Neon อยู่ที่ 66 เปอร์เซ็นต์ในกลุ่มฐานข้อมูล Amazon S3 อยู่ที่ 45 เปอร์เซ็นต์ในกลุ่มที่เก็บไฟล์ Resend อยู่ที่ 35.6 เปอร์เซ็นต์และ Postmark อยู่ที่ 27.4 เปอร์เซ็นต์ในกลุ่มอีเมล

รายงานเรียกตัวเลขกลุ่มนี้ว่าอัตราการติดตั้ง ซึ่งเป็นอัตราการถูกเลือกภายในการทดลองสังเคราะห์ชุดนี้เท่านั้น ไม่ใช่ส่วนแบ่งตลาดจริงของผู้ให้บริการเหล่านั้น การเรียกมันว่าส่วนแบ่งตลาดคือการอ่านผิดที่เปลี่ยนความหมาย ทั้งหมด

ทำไมเรื่องนี้สำคัญกับคนทำงาน

สิ่งที่งานนี้ชี้ให้เห็นไม่ใช่ว่าผู้ช่วยตัวไหนเลือกเก่งกว่ากัน แต่คือการเลือกผู้ให้บริการซึ่งเคยเป็นการตัดสินใจของ หัวหน้าทีมหรือฝ่ายจัดซื้อ กำลังกลายเป็นค่าตั้งต้นที่ฝังอยู่ในเครื่องมือโดยไม่มีใครกดอนุมัติ

ผลตามมาที่จับต้องได้มีสองด้าน ด้านคนใช้คือถ้าองค์กรมีรายชื่อบริการที่อนุมัติแล้ว ต้องเขียนไว้ในไฟล์คำสั่ง ประจำโปรเจกต์ ไม่ใช่ปล่อยให้เป็นดุลพินิจของโมเดล เพราะผลของงานนี้บอกว่าโมเดลคนละตัวจะเลือกคนละอย่าง แม้อยู่ในโจทย์เดียวกัน ด้านผู้ให้บริการคือการที่ชื่อของตัวเองเป็นที่รู้จักในหมู่คน ไม่ได้แปลว่าจะถูกเครื่องเลือก ซึ่งเป็นสิ่งที่ตัวเลขของ PayPal และ LangChain แสดงให้เห็นชัดที่สุด

คำถามที่ยังไม่มีคำตอบ

ยังไม่มีใครทำซ้ำงานนี้อย่างอิสระ โดยเฉพาะจากฝ่ายที่ไม่ได้ขายบริการเรื่องการถูกผู้ช่วยเลือก

ยังไม่รู้ว่าผลจะเปลี่ยนแค่ไหนเมื่อทดสอบบนฐานโค้ดจริงขององค์กรแทนรีโปที่สร้างขึ้น เพราะฐานโค้ดจริงมักมี ร่องรอยของการเลือกเจ้าเดิมอยู่แล้ว ซึ่งเป็นสิ่งที่รายงานนี้ตั้งใจคัดออก

ยังไม่รู้ว่าเซสชันราวสองในสามที่ถูกคัดทิ้งมีหน้าตาอย่างไร และการคัดนั้นทำให้ผลเอียงไปทางใดหรือไม่

ยังไม่รู้ว่าผลนี้ยืนได้นานแค่ไหน เพราะรายงานไม่ระบุรุ่นของผู้ช่วยที่ทดสอบ ทั้งที่ทั้งสามตัวออกรุ่นใหม่กันเกือบ ทุกสัปดาห์

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย