OpenAI เปิดตัว GPT-6 Astra และเริ่มปล่อยแบบจำกัดวงในวันเดียวกัน พร้อมตัวเลขที่ต้องอ่านวงเล็บให้ครบทุกบรรทัด (ต่อเนื่องจาก 2026-09-03)
OpenAI เปิดตัว GPT-6 Astra เมื่อ 3 ก.ย. โดยวันแรกปล่อยให้องค์กรกลุ่มจำกัดก่อน แล้วจะขยายไปยังผู้ใช้ ChatGPT ระดับ Plus, Pro, Business และ Enterprise ในไม่กี่วันข้างหน้า พร้อมเปิดผ่าน API ของตัวเองและผ่าน AWS ซึ่งระบุไว้อีกที่หนึ่งว่าคือ Amazon Bedrock โดยใช้ชื่อเรียกในระบบว่า gpt-6-astra
ราคาอยู่ที่ 10 ดอลลาร์ต่อล้านโทเคนขาเข้าและ 50 ดอลลาร์ต่อล้านโทเคนขาออก ซึ่งเท่ากับราคาของ Claude Fable 5.1 พอดี และมีโหมดเร่งความเร็วที่เอกสารเขียนว่าเร็วขึ้นได้สูงสุดสองเท่าโดยคิดราคาสองเท่าของราคาปกติ คือราคาเป็นสองเท่าแน่นอนแต่ความเร็วเป็นเพดาน ไม่ใช่การรับประกัน
ตัวเลขที่ต้องอ่านคู่กันคู่แรกคือ ARC-AGI-3 ซึ่งหน้าประกาศของ OpenAI ระบุไว้ที่ 99.9 เปอร์เซ็นต์โดยไม่อธิบายวิธีวัดเลย ส่วนตารางเต็มอยู่ที่บล็อกของ ARC Prize ซึ่งแยกผลเป็นสองเครื่องมือครอบคือตัวที่ OpenAI ทำเองชื่อ Provider Adapter ที่เก็บสถานะการคิดข้ามคำขอและบีบอัดบทสนทนายาวให้เอางานเดิมมาใช้ต่อได้ กับเครื่องมือมาตรฐานของ ARC Prize โดยตัวเลข 99.9 เปอร์เซ็นต์เป็นผลของเครื่องมือฝั่ง OpenAI ที่ระดับความพยายาม high ขณะที่เครื่องมือมาตรฐานทำได้สูงสุด 62.7 เปอร์เซ็นต์ที่ระดับ max และลงไปต่ำสุด 17.5 เปอร์เซ็นต์ที่ระดับ low แปลว่าคะแนนสองตัวที่ถูกเล่าคู่กันไม่ได้มาจากการตั้งค่าเดียวกันด้วยซ้ำ และ ARC Prize ไม่ได้ระบุว่าตรวจสอบผลนี้อย่างเป็นอิสระ
คู่ที่สองอยู่ในหมวดความมั่นคงไซเบอร์ คือ ExploitBench ได้ 100 เปอร์เซ็นต์เทียบกับ GPT-5.6 Sol ที่ 78.5 เปอร์เซ็นต์ แต่หน้าเดียวกันมีอีกบรรทัดคือ ExploitBench ฉบับที่ใช้ช่องโหว่ของสามเดือนล่าสุดคือ มิ.ย. ถึง ส.ค. 2569 ซึ่งได้เพียง 39.0 เปอร์เซ็นต์ โดยบริษัทเขียนเหตุผลไว้เองว่าทำชุดนี้ขึ้นมาเพราะกังวลว่าการเคยเห็นช่องโหว่เก่าอาจมีผลต่อคะแนน
ตัวเลขอื่นที่บริษัทให้มาต้องอ่านชื่อแถวให้ครบเช่นกัน คือ GPQA Diamond 96.0 เปอร์เซ็นต์ Terminal-Bench 4.0 57.9 เปอร์เซ็นต์ ส่วน Humanity's Last Exam 57.2 เปอร์เซ็นต์นั้นตารางกำกับว่าเป็นผลแบบให้ใช้เครื่องมือช่วย และ OSWorld 2.0 72.6 เปอร์เซ็นต์กำกับว่าเป็นชุดออฟไลน์และเป็นคะแนนแบบให้คะแนนบางส่วน ขณะที่ผู้ประเมินภายนอกอย่าง Artificial Analysis ให้คะแนนดัชนีรวมของ Astra ที่ 61 ซึ่งเท่ากับ GPT-5.6 Sol และต่ำกว่า Claude Fable 5.1 ที่ 66 อยู่ห้าคะแนน ส่วนขนาดหน้าต่างบริบทไม่มีอยู่ในหน้าประกาศเลย ต้องไปดูที่หน้ารายการโมเดลของ API ซึ่งระบุไว้ที่ 1.05 ล้านโทเคน และขาออกสูงสุด 128,000 โทเคน
▲ ทำไมต้องรู้ · บรรทัดที่มีประโยชน์ที่สุดในประกาศนี้คือบรรทัดที่คะแนนตกจาก 100 เหลือ 39 เมื่อเปลี่ยนไปใช้โจทย์ที่เพิ่งเกิดใหม่จริง ซึ่งเป็นหลักการเดียวกับที่ใช้ประเมินเครื่องมือทุกตัวได้ คือถ้าผู้ขายวัดกับโจทย์ที่มีอยู่ก่อนที่โมเดลจะถูกฝึก ตัวเลขนั้นบอกได้แค่ว่ามันจำได้ดีแค่ไหน ไม่ได้บอกว่ามันจะทำงานใหม่ของเราได้ดีแค่ไหน คำถามที่ควรถามผู้ขายทุกรายจึงเป็นคำถามเดียวกันว่าชุดทดสอบนี้เกิดขึ้นก่อนหรือหลังโมเดล
OpenAI · ARC Prize · OpenAI model list · Artificial Analysis · Simon Willison