Transformer
สถาปัตยกรรม AI ที่เปิดตัวปี 2017 ใช้กลไก attention อ่านข้อมูลทั้งประโยคพร้อมกัน และเป็นรากฐานของ AI สร้างเนื้อหายุคใหม่แทบทุกตัวรวมถึง ChatGPT
Transformer คือสถาปัตยกรรม (โครงสร้างการออกแบบ) ของ neural-network ที่เปิดตัวในงานวิจัยชื่อ "Attention Is All You Need" ปี 2017 โดยทีมนักวิจัย 8 คนจาก Google Brain และ Google Research (มีหนึ่งคนที่ระบุสังกัด University of Toronto) เปเปอร์เขียนเชิงอรรถกำกับไว้ว่าทุกคนมีส่วนร่วมเท่ากันและเรียงลำดับชื่อแบบสุ่ม จึงไม่ควรอ้างว่าใครเป็นหัวหน้าทีมจากลำดับชื่อ แนวคิดหลักคือใช้กลไก attention-mechanism เพียงอย่างเดียวในการประมวลผลข้อมูล โดยตัดการประมวลผลแบบวนซ้ำ (recurrence) และ convolution ทิ้งทั้งหมด ขั้นตอนการทำงานคร่าวๆ คือ ระบบแปลงข้อความเป็น token แล้วแปลงต่อเป็นเวกเตอร์ตัวเลขผ่านชั้น embedding เติมข้อมูลตำแหน่งของคำ (positional encoding) จากนั้นส่งผ่านชั้น attention และ feedforward network หลายชั้น ก่อนแปลงกลับเป็นความน่าจะเป็นของคำถัดไป
จุดที่ทำให้ transformer พลิกวงการคือมันอ่านทุก token พร้อมกันทีเดียว ต่างจากสถาปัตยกรรมรุ่นก่อนอย่าง RNN และ LSTM ที่ต้องไล่อ่านทีละคำตามลำดับ จึงเร่งความเร็วด้วย gpu ได้ไม่เต็มที่ การประมวลผลแบบขนานทำให้ training ใช้เวลาน้อยลงมาก ขณะที่กลไก attention ช่วยให้โมเดลจับความสัมพันธ์ระหว่างคำที่อยู่ห่างกันในประโยคได้โดยตรง ย่นระยะทางที่สัญญาณต้องเดินทางระหว่างคำสองคำให้สั้นลง จึงเรียนรู้ความสัมพันธ์ระยะไกลได้ง่ายกว่า RNN งานวิจัยต้นฉบับพิสูจน์ด้วยงานแปลภาษา WMT 2014: ทำคะแนนได้ 28.4 BLEU (อังกฤษเป็นเยอรมัน) ดีกว่าสถิติเดิมกว่า 2 BLEU และ 41.8 BLEU (อังกฤษเป็นฝรั่งเศส) โดยใช้เวลาเทรนเพียง 3.5 วันบน GPU 8 ตัว
สำหรับคนทำงานยุค AI คำนี้สำคัญเพราะมันคือรากฐานของ generative-ai แทบทุกตัวที่เราใช้กันทุกวันนี้: ตระกูล gpt ของ OpenAI, BERT ที่ Google ใช้ในระบบค้นหาตั้งแต่ปี 2019, chatgpt, งานด้านภาพอย่าง Vision Transformer, งานวิดีโออย่าง sora ที่ใช้สถาปัตยกรรมแบบ diffusion transformer ไปจนถึงงานเสียงและหุ่นยนต์ ข้อควรระวังคือไม่ใช่ทุกระบบในลิสต์นี้เป็น transformer ล้วนทั้งตัว: stable-diffusion ใช้ transformer เป็นชิ้นส่วนภายใน (เช่นชั้น attention และตัวเข้ารหัสข้อความ) ร่วมกับสถาปัตยกรรมอื่น ไม่เหมือน Vision Transformer ที่เป็น transformer ทั้งตัว พูดง่ายๆ เวลาได้ยินว่า llm หรือ model แบบ multimodal ตัวไหน "สร้างบนสถาปัตยกรรม transformer" ให้เข้าใจว่าข้างในใช้พิมพ์เขียวเดียวกันกับที่เปเปอร์ปี 2017 วางไว้ ต่างกันที่ข้อมูล ขนาด และวิธีเทรนของแต่ละค่าย
ตัวอย่างจากบทสนทนาจริง
ทีมการตลาด: "ในสไลด์ของ vendor เขียนว่าแชตบอตเขาใช้ Transformer เหมือน ChatGPT เลย แบบนี้แปลว่าเราจะได้ AI เก่งเท่า ChatGPT ใช่ไหมคะ"
ทีม AI: "ยังสรุปแบบนั้นไม่ได้ครับ Transformer เป็นแค่ชื่อสถาปัตยกรรม เหมือนบอกว่ารถสองคันใช้เครื่องยนต์แบบเดียวกัน แต่ความเก่งจริงขึ้นกับขนาดโมเดล ข้อมูลที่ใช้เทรน และวิธีจูนของแต่ละค่าย ซึ่งต่างกันได้มหาศาลครับ"
ระวังสับสนกับ
- attention-mechanism : attention คือกลไกชิ้นส่วนหนึ่งที่อยู่ข้างใน ส่วน transformer คือสถาปัตยกรรมทั้งชุดที่นำ attention หลายชั้นมาประกอบกับส่วนประกอบอื่น ชื่อเปเปอร์ "Attention Is All You Need" ทำให้หลายคนเข้าใจว่าสองคำนี้คือสิ่งเดียวกัน
- llm : transformer คือแบบแปลน ส่วน LLM คือบ้านที่สร้างเสร็จแล้ว · LLM คือโมเดลภาษาขนาดใหญ่ที่ได้จากการนำสถาปัตยกรรมไปเทรนกับข้อความปริมาณมหาศาล ซึ่งแทบทั้งหมดที่ใช้งานกันอยู่ตั้งอยู่บน transformer แม้จะมีสถาปัตยกรรมทางเลือกอื่นอยู่บ้างก็ตาม
Sources (3)
- https://arxiv.org/abs/1706.03762 fetched 2026-08-02
- https://arxiv.org/html/1706.03762v7 fetched 2026-08-02
- https://en.wikipedia.org/wiki/Transformer_(deep_learning) fetched 2026-08-02
อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย