Dictionary · พื้นฐาน AI · 6 / 291

Cross-Lingual Consistency Gap

ปรากฏการณ์ที่ AI ตัวเดียวกันเดินคนละขั้นตอนเมื่อสั่งงานเดียวกันด้วยคนละภาษา งานวิจัย 11 ส.ค. 2026 วัดพบว่าโมเดลแนวหน้าคงลำดับการกระทำข้ามภาษาได้ 71-73%

Cross-lingual consistency gap คือชื่อเรียกปรากฏการณ์ที่ agent หรือ llm ตัวเดียวกัน ได้รับคำสั่งเดียวกันเป๊ะแต่เขียนด้วยคนละภาษา แล้วเลือกเดินขั้นตอนหรือลงมือทำคนละแบบ ทั้งที่คำตอบสุดท้ายที่เห็นบนหน้าจออาจดูใกล้เคียงกันมาก จุดที่ทำให้เรื่องนี้ต่างจากความรู้สึกทั่วไปที่ว่าพิมพ์ไทยแล้ว AI ตอบแย่กว่าพิมพ์อังกฤษ คือมันเป็นสิ่งที่วัดได้จากลำดับการกระทำจริงของ agent ที่เรียกใช้ tool-call ไม่ใช่แค่การเทียบว่าคำตอบสุดท้ายถูกหรือผิด

งานวิจัยที่เผยแพร่บน arXiv วันที่ 11 สิงหาคม 2026 ทดสอบโมเดล 8 ตัวรวมถึงตระกูล gemma qwen และ Llama กับ 6 ชุดทดสอบคู่ขนานใน 41 ภาษา รวม 2.38 ล้านรอบ (arXiv 2608.11110) เมื่อบังคับให้โมเดลเลือกทางที่มั่นใจที่สุดเสมอเพื่อตัดความสุ่มออกจากการเปรียบเทียบ โมเดลแนวหน้าสี่ตัวให้ค่าใกล้เคียงกันมาก คือคงลำดับการกระทำเดิมข้ามภาษาไว้ได้ 71 ถึง 73 เปอร์เซ็นต์ ตัวเลขนี้เป็นค่าที่ปรับฐานด้วยความคงเส้นคงวาของโมเดลแต่ละตัวเองแล้ว ไม่ใช่อัตราการทำซ้ำแบบดิบ และในกลุ่มนี้ตัวตนของโมเดลอธิบายความต่างที่วัดได้เพียง 5.7 เปอร์เซ็นต์ ขณะที่ชุดทดสอบอธิบายได้ถึง 26.9 เปอร์เซ็นต์ แปลว่าในกลุ่มสี่ตัวที่ทดสอบ ซึ่งได้แก่ Gemma-3-27B, Sarvam-M, Qwen3-235B และ Llama-4-Maverick การเปลี่ยนไปใช้อีกยี่ห้อไม่ได้ช่วยลดช่องว่างนี้ลงมากนัก ข้อควรระวังคืองานนี้ไม่ได้ทดสอบโมเดลปิดของห้องแล็บใหญ่ จึงสรุปแทนโมเดลเหล่านั้นไม่ได้ ส่วนโมเดลที่เล็กกว่าราว 10 พันล้านพารามิเตอร์ลงมา ทีมวิจัยระบุว่าการวัดแบบนี้ใช้ไม่ได้ผล กลไกเบื้องหลังที่ทีมวิจัยพบคือ agent มักแปลคำสั่งที่ไม่ใช่ภาษาอังกฤษกลับไปคิดเป็นภาษาอังกฤษก่อนเสมอ เครื่องมือแปลภาษาเป็นเครื่องมือที่ถูกเรียกใช้บ่อยที่สุดในทุกชุดทดสอบที่ดัดแปลงมาจากชุดข้อมูลมาตรฐานเดิมอย่าง FLORES-200 XQuAD XNLI Belebele และ XCOPA มีเพียงชุดทดสอบสังเคราะห์ที่พลิกกลับไปให้เครื่องคิดเลขเป็นตัวที่ถูกเรียกมากที่สุดแทน และร่องรอยการให้เหตุผลของโมเดลราว 99 เปอร์เซ็นต์เป็นตัวอักษร ASCII แม้ป้อนคำสั่งที่เขียนด้วยอักษรเทวนาครี ทมิฬ หรือโอเดีย เข้าไปก็ตาม ที่น่าสนใจกว่านั้นคือแม้จะสั่งตรงๆ ให้เลิกแปลกลับไปคิดเป็นอังกฤษ โมเดลก็ทำตามคำสั่งนั้นได้ในอัตราต่ำกว่า 1 เปอร์เซ็นต์ของครั้งที่สั่งเท่านั้น (full text)

คนทำงานมักเจอเรื่องนี้ตอนเทสต์ agent หรือ chatbot ด้วยประโยคภาษาอังกฤษจนผ่านทุกเคส แล้วเปิดใช้จริงกับผู้ใช้ไทยจึงพบว่าพลาดขั้นตอนบ่อยกว่าที่คาดไว้ งานวิจัยอีกชิ้นที่เผยแพร่วันที่ 6 สิงหาคม 2026 วัดในมุมของงานอ่านตอบคำถามจากเอกสาร ไม่ใช่งาน agent พบว่าคุณภาพคำตอบในคำถามปลายเปิดที่ซับซ้อนลดลงราว 17 เปอร์เซ็นต์เมื่อเอกสารหลักฐานที่ให้อ่านไม่ใช่ภาษาอังกฤษ (arXiv 2608.06506) ข้อค้นพบที่สำคัญคือแม้แต่ภาษาโปรตุเกสซึ่งเป็นภาษาที่มีข้อมูลฝึกสูง ก็ยังตกคะแนนจากฐานภาษาอังกฤษไป 0.061 ขณะที่ช่องว่างเฉลี่ยของทุกภาษาอยู่ที่ 0.077 เมื่อหักส่วนที่โปรตุเกสตกไปแล้วเหลือช่องว่างสุทธิเพียง 0.016 แปลว่าโทษก้อนใหญ่มาจากการที่หลักฐานไม่ได้อยู่ในภาษาอังกฤษ ไม่ได้มาจากการเป็นภาษาที่มีข้อมูลฝึกน้อยเพียงอย่างเดียว แต่ทีมวิจัยก็ยังพบว่าภาษาที่มีทรัพยากรน้อยกว่าเจอช่องว่างกว้างกว่าอย่างมีนัยสำคัญทางสถิติ และในการให้คนตัดสินแบบปิดตา คำตอบจากภาษาที่มีทรัพยากรสูงกว่าถูกเลือกว่าดีกว่า 61.6 เปอร์เซ็นต์ของครั้งที่ผู้ตัดสินเลือกข้างได้จริง ไม่นับครั้งที่ตัดสินว่าเสมอกัน จึงสรุปไม่ได้ว่าระดับทรัพยากรของภาษาไม่มีผล ข้อควรระวังที่สำคัญที่สุดคือทั้งสองงานนี้ไม่ได้ยืนยันว่าทดสอบภาษาไทยเลย งานแรกระบุว่ารายชื่อภาษาทั้ง 41 ภาษาซึ่งครอบคลุม 17 ตระกูลภาษาและ 16 ระบบตัวเขียนอยู่ในภาคผนวก แต่ฉบับที่เปิดอ่านได้ไม่ได้แสดงตารางนั้นออกมา จึงยังยืนยันไม่ได้ว่ามีภาษาไทยรวมอยู่ด้วยหรือไม่ ส่วนงานที่สองระบุรายชื่อ 16 ภาษาเป้าหมายไว้ชัดเจน ตั้งแต่ไอซ์แลนดิก มอลตา บาสก์ จอร์เจีย ไปจนถึงสวาฮีลี เนปาล เซบัวโน และเกชัว โดยไม่มีภาษาไทยหรือภาษาในเอเชียตะวันออกเฉียงใต้แผ่นดินใหญ่อยู่เลย การเอาตัวเลขเหล่านี้ไปพูดถึงภาษาไทยตรงๆ จึงเป็นการอนุมานทิศทาง ไม่ใช่ผลที่วัดมาแล้วสำหรับภาษาไทยโดยตรง อีกข้อควรระวังคือสถานะการตรวจสอบของงานสองชิ้นนี้ไม่เท่ากัน งานแรกระบุบนหน้า arXiv ว่าได้รับตอบรับให้ตีพิมพ์ใน COLM 2026 แล้ว ส่วนงานที่สองยังเป็น preprint ที่เพิ่งส่งเข้าวารสาร Computational Linguistics และยังไม่มีผลตอบรับ ตัวเลขจากงานที่สองจึงยังไม่ผ่านการตรวจสอบโดยผู้เชี่ยวชาญในสาขา วิธีที่ปลอดภัยกว่าการเชื่อตัวเลขเหล่านี้ตรงๆ คือทดสอบระบบของตัวเองด้วยประโยคภาษาไทยจริงที่ผู้ใช้พิมพ์เข้ามา ไม่ใช่ทดสอบด้วยภาษาอังกฤษแล้วสรุปว่าใช้ได้กับทุกภาษาเหมือนกันหมด

ตัวอย่างจากบทสนทนาจริง

หัวหน้าทีมบริการลูกค้า: "เราเทสต์ AI agent ตอบแชทลูกค้าเป็นภาษาอังกฤษผ่านทุกเคส พอเปิดใช้จริงกับลูกค้าไทยกลับพลาดขั้นตอนบ่อยกว่าที่คิด เป็นเพราะโมเดลตัวเดียวกันนี่แหละแต่ทำงานแย่ลงเวลาเจอภาษาไทยใช่ไหม"

ทีม AI ภายใน: "ไม่จำเป็นต้องเป็นเพราะโมเดลแย่ลงครับ มีงานวิจัยที่วัดพบว่า agent มักเดินคนละขั้นตอนเมื่อเปลี่ยนภาษาที่สั่ง ทั้งที่เป็นโมเดลตัวเดียวกัน เพราะมันมักแปลคำสั่งกลับไปคิดเป็นภาษาอังกฤษก่อนตัดสินใจ สิ่งที่ต้องทำคือทดสอบด้วยประโยคภาษาไทยจริงที่ลูกค้าพิมพ์เข้ามา ไม่ใช่เชื่อผลเทสต์ภาษาอังกฤษแล้วสรุปว่าใช้ได้เหมือนกันทุกภาษา"

ระวังสับสนกับ

  • non-determinism : non-determinism คือความไม่คงที่ของคำตอบแม้ถามซ้ำด้วยคำสั่งเดียวกันภาษาเดียวกัน เกิดจากการสุ่มเลือกคำตอนโมเดลตอบ ส่วน cross-lingual consistency gap คือความต่างที่เกิดขึ้นเฉพาะเมื่อเปลี่ยนภาษาที่ใช้สั่ง ซึ่งงานวิจัยวัดพบว่ายังต่างกันแม้บังคับให้โมเดลเลือกทางที่มั่นใจที่สุดเพื่อตัดความสุ่มออกไปแล้ว
  • hallucination : hallucination คือการที่โมเดลตอบข้อมูลที่ไม่จริงหรือไม่มีอยู่จริงไม่ว่าจะใช้ภาษาไหน ส่วน cross-lingual consistency gap ไม่ได้วัดว่าคำตอบจริงหรือไม่ แต่วัดว่าลำดับขั้นตอนหรือการกระทำเปลี่ยนไปหรือไม่เมื่อเปลี่ยนภาษาที่สั่งงาน

ดูคำนี้ใน Knowledge Atlas →

■ ไม่อยากพลาดของใหม่

อ่านจบแล้วอยากตามเรื่อง AI แบบนี้ต่อทุกวัน เรามีสรุปข่าวภาษาไทยส่งทาง LINE ทุกเช้า กดเพิ่มเพื่อนไว้ได้เลย ไม่มีค่าใช้จ่าย

เพิ่มเพื่อนใน LINE →
QR เพิ่มเพื่อน LINE ของ TRAINIAC AIคอมพิวเตอร์สแกนด้วยมือถือได้เลย

Computer visionDataset