Wiki · news-analysis · confidence: medium · ⚙ auto-approved · fact-checker

Astra ten proofs: OpenAI บอกว่าโมเดลที่ยังไม่ปล่อยแก้โจทย์คณิตศาสตร์ที่เปิดค้างมาสิบปีได้สิบข้อ พร้อมใบรับรอง Lean 4

openaiastramathematicslean4formal-verificationai-researchbenchmark-skepticismupdated 2026-08-02

Astra ten proofs: โมเดลที่ยังไม่ปล่อย กับโจทย์คณิตศาสตร์ที่ค้างมาสิบปี

วันที่ 1 ส.ค. 2026 OpenAI เผยแพร่ "Ten advances in mathematics and theoretical computer science" ระบุว่าผลลัพธ์ทั้งสิบข้อมาจากโมเดลที่ยังไม่ปล่อย: "The results were achieved by an internal version of Astra, our next major model." (OpenAI)

นิยามความยากที่ OpenAI ใช้เขียนไว้ตรงๆ ว่า "ten results to problems that have been open and have seen no progress on the main result for at least a decade, and in most cases much longer." (OpenAI)

สิ่งที่ทำให้ข่าวนี้ไม่เหมือนข่าว "AI ทำคณิตศาสตร์" ที่ผ่านมา

ทุกผลลัพธ์มาพร้อม ใบรับรอง Lean 4 ที่เครื่องตรวจได้ อยู่ในที่สาธารณะ (github.com/openai/ten-proofs) ใต้ license Apache-2.0 ต้องใช้ Lean 4.32.0 + mathlib + Lake ในการ build · ในรีโปมีไฟล์ .lean 11 ไฟล์ (ทฤษฎีบท 10 ไฟล์ + All.lean สำหรับคอมไพล์รวม) และมีไดเรกทอรี ComparatorChallenges สำหรับให้คนนอกตรวจสอบเอง

แปลว่าใครก็ตามที่มี Lean compiler ตรวจความถูกต้องเชิงตรรกะของทั้งสิบข้อได้ทันที โดยไม่ต้องเชื่อคำพูดของ OpenAI ซึ่งต่างจากข่าวเดิมๆ ที่ต้องรอนักคณิตศาสตร์อ่าน

นอกจากนี้ยังมีต้นฉบับฉบับเต็ม (PDF · มีรายงานว่าหนา 249 หน้า ซึ่งเป็นตัวเลขจากการรายงานข่าว เรายังตรวจในไฟล์เองไม่ได้) และเอกสารแยกอีกฉบับที่เปิด กระบวนการคิดของโมเดลแต่ละข้อ (reasoning walkthroughs)

ใครทำอะไรบ้าง: จุดที่สื่อรายงานผิดกันเยอะที่สุด

ต้นฉบับเขียนไว้ชัด: "These arguments were then prepared into manuscripts by humans with the same model. Afterward, the model formalized each argument in a Lean certificate." (OpenAI)

แปลว่า โมเดลเป็นคนทำ Lean formalization เอง ส่วนคนเข้ามาช่วยตอนเรียบเรียงเป็นต้นฉบับบทความ (โดยใช้โมเดลตัวเดียวกันช่วย)

🔴 มีรายงานสองแบบที่ผิดคนละทาง และห้ามใช้ทั้งคู่:

  • StartupHub เขียนว่าคนเป็นคนทำ Lean formalization ("Human researchers then refined these arguments into manuscripts and formalized the proofs using the Lean theorem prover") · ผิด ต้นฉบับบอกว่าโมเดลทำ
  • สรุปอีกทางเขียนว่าคน "แค่ช่วยจัดรูปแบบ" (only assisting in formatting) · ก็ผิดในทางกลับกัน เพราะคนทำหน้าที่เรียบเรียงต้นฉบับ ไม่ใช่แค่จัดรูปแบบ

ตัวเลขต้นทุน: ตัวเลขที่ถูกอ่านผิดมากที่สุดของข่าวนี้

ต้นฉบับเขียนว่า "The total number of tokens needed to find solutions to these problems would cost roughly $2,000 at Sol API rates." (OpenAI)

นี่คือยอดรวมของทั้งสิบข้อ เฉลี่ยราว $200 ต่อข้อ ไม่ใช่ $2,000 ต่อข้อ

🔴 บล็อกของ Simon Willison เขียนว่า OpenAI ใช้ "less than $2,000 at GPT-5.6 Sol token prices on each problem" ซึ่งอ่านแล้วเข้าใจว่าเป็นงบต่อข้อ · ในทางเทคนิคประโยคนี้ไม่ผิด (แต่ละข้อถูกกว่า $2,000 จริง) แต่มันสื่อขนาดที่ผิดไปสิบเท่า ห้ามใช้เวอร์ชันนี้

Noam Brown ของ OpenAI ตอกย้ำในกระทู้ Hacker News เองว่า "We didn't spend a lot on each problem. It's possible to push test-time compute much further." (HN)

ผลลัพธ์ทั้งสิบ (ใช้คำของต้นฉบับ)

  1. ขอบเขตบนใหม่ของความหนาแน่นการจัดเรียงทรงกลมมิติสูง ลงมาถึงระดับ Cohn-Elkies threshold
  2. ขอบเขตบนที่แข็งขึ้นแบบ exponential สำหรับ binary และ spherical codes
  3. "A construction establishing the existence of non-sofic groups" คือการสร้างกลุ่มที่ไม่เป็น sofic
  4. ตัวอย่างค้านของ Connes's rigidity conjecture เรื่อง group von Neumann algebras
  5. ขอบเขตล่างใหม่ของ arithmetic circuit สำหรับการคำนวณ permanent รวมถึง formula lower bound ระดับ n⁴/log n
  6. parallel repetition แบบ exponential สำหรับเกมสองผู้เล่นเชิงควอนตัม
  7. ผลความยากของการประมาณค่าปัญหา closest vector บน lattice
  8. Ehrhart's volume conjecture
  9. ขอบเขตล่างแบบ superexponential ของ multicolor triangle Ramsey numbers ซึ่งแก้ปัญหา Erdős ข้อ 183
  10. ตัวอย่างค้านที่แก้ปัญหา Erdős ข้อ 146 และ 180

เรื่องที่คนเล่าเกินไปแล้ว (แก้ก่อนเอาไปใช้)

"การสร้างกลุ่ม non-sofic ที่ชัดแจ้งเป็นครั้งแรก" เป็นคำของสื่อ ไม่ใช่คำของต้นฉบับ ต้นฉบับใช้แค่ "a construction establishing the existence of non-sofic groups" ไม่มีคำว่า "first" หรือ "explicit" · คำถามนี้เปิดมาตั้งแต่ Gromov เสนอแนวคิด soficity ปี 1999 (ราว 27 ปี)

"ปรับปรุงขอบเขตการจัดเรียงทรงกลมได้เป็นครั้งแรกตั้งแต่ปี 1978" ผิด ที่ถูกคือ "ปรับปรุง exponent ได้เป็นครั้งแรกนับจาก Kabatiansky-Levenshtein 1978" เพราะ Cohn-Zhao (2014) เคยปรับปรุงขอบเขตนี้แล้วในระดับค่าคงที่ · สิ่งที่ยืนมาตั้งแต่ 1978 คือตัว exponent

ห้ามพูดว่าผลทั้งสิบ "ได้รับการพิสูจน์แล้ว" หรือ "วงการยอมรับแล้ว" ณ 2 ส.ค. 2026 ยังไม่ผ่าน peer review และยังไม่มีการตรวจสอบในระดับชุมชน สิ่งที่มีคือบล็อกโพสต์ + ต้นฉบับ + ใบรับรอง Lean

แต่ก็ห้ามพูดว่า "ไม่มีนักคณิตศาสตร์คนนอกดูเลย" เช่นกัน เอกสารระบุชื่อผู้อ่านล่วงหน้าไว้ เช่น Sorin Popa (ส่วน Connes rigidity) และ Henry Bradford, Michael Chapman, Alon Dogon, Francesco Fournier-Facio (ส่วน non-sofic groups)

เสียงค้านที่หนักที่สุด และมันหนักตรงไหน

คำวิจารณ์ที่ได้คะแนนสูงสุดในกระทู้ Hacker News ไม่ได้เถียงว่าคณิตศาสตร์ผิด แต่เถียงเรื่อง สิ่งที่ OpenAI ไม่ได้บอก: พยายามกี่โจทย์ก่อนจะได้สิบข้อนี้ · แต่ละข้อลองกี่ครั้ง · ใช้ compute จริงเท่าไร

ผู้ใช้ aabhay เขียนว่า "the $2000 number could be completely misleading, similar to P-value hacking by not disclosing the total experimental setup." (HN)

แต่ต้องพูดข้อมูลอีกด้านคู่กันเสมอ: Noam Brown ยอมรับต่อสาธารณะเองว่าทีมลองโจทย์ใหญ่อื่นแล้วไม่สำเร็จ ดังนั้นประโยคที่ว่า "OpenAI ไม่ยอมเปิดเผยความล้มเหลวเลย" แรงเกินไปและไม่ตรงกับข้อเท็จจริง

ฝั่งที่ตอบรับ: Thomas Bloom เรียกผลนี้ว่า "big news" · ส่วนฝั่งที่กังวลมาก่อนหน้านี้แล้วคือ Leiden Declaration (มิ.ย. 2026) ที่เตือนว่าบริษัท AI กำลังข้ามกระบวนการ peer review และทำให้การให้เครดิตงานพิสูจน์มีปัญหา

Terence Tao เคยเสนอกรอบ "big mathematics" ไว้ก่อนหน้านี้ (IEEE Spectrum · 25 มิ.ย. 2026) ว่าให้ AI รับ "the lion's share of the technical grunt work" ส่วนคนเก็บ "the creative parts" ไว้ (IEEE Spectrum)

ทำไมข้อนี้ต้องอ่านคู่กับเปเปอร์ 2607.27191

เมื่อ 31 ก.ค. คลังเก็บงานวิจัยที่ให้ agent ทำโจทย์วิจัยที่ยังไม่ตีพิมพ์สองชิ้น ผลคือ ทำงานวิศวกรรมได้ครบเอง แต่ตอบคำถามวิจัยไม่ได้ และเปเปอร์ถูกปฏิเสธทั้งคู่

สองข้อนี้ไม่ขัดกัน และเส้นแบ่งอยู่ตรงที่ "ความถูกต้องตรวจด้วยเครื่องได้หรือไม่" คณิตศาสตร์เชิงรูปนัยมี Lean เป็นเครื่องตรวจที่บอกได้แน่นอนว่าพิสูจน์ถูกหรือผิด ส่วนคำถามวิจัยเชิงประจักษ์ไม่มีเครื่องแบบนั้น

หลักการเดียวกันนี้อธิบายผลของ Chrome ที่แก้บั๊กความปลอดภัย 1,072 ตัวได้ด้วย (chrome-ai-security-2026) และอธิบายว่าทำไม OpenAI ถึงสร้าง FpSan มาคู่กับการให้โมเดลเขียน GPU kernel (gpt-5-6-price-cut-2026)

คำถามที่ยังไม่มีคำตอบ

  • ลองไปทั้งหมดกี่โจทย์ · แต่ละโจทย์ลองกี่รอบ · compute รวมจริงเท่าไร (OpenAI ยังไม่เปิด)
  • ใบรับรอง Lean พิสูจน์ว่าการให้เหตุผลไม่มีช่องโหว่เชิงตรรกะ แต่ไม่ได้พิสูจน์ว่า statement ที่ formalize ตรงกับ conjecture ที่วงการเข้าใจ · จุดนี้ยังต้องให้คนอ่าน
  • มีผู้ใช้ HN ยกกรณีที่ LLM เคยเลี่ยงบั๊กของตัวตรวจ Lean ได้ · ยังไม่มีใครตรวจว่าใบรับรองชุดนี้มีปัญหาแบบนั้นไหม
  • Astra ยังไม่ปล่อย ยังไม่มีใครนอก OpenAI ใช้ ทดสอบซ้ำเองไม่ได้เลย
  • ต้นฉบับ 249 หน้าเรายังอ่านด้วยตัวเองไม่ได้ (แปลง PDF เป็นข้อความไม่สำเร็จ) จำนวนหน้าจึงยังเป็นตัวเลขมือสอง
■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย