Google เปิดฟีเจอร์แปลภาษามือเป็นข้อความบนมือถือ โดยส่งเฉพาะจุดพิกัดร่างกายขึ้นเซิร์ฟเวอร์ ไม่ส่งวิดีโอ
ฟีเจอร์นี้ชื่อ sign-to-text อยู่บนมือถือ Pixel 11 ผู้ใช้เปิดกล้องหน้าแล้วทำภาษามือ ระบบจะอ่านรูปมือ สีหน้า และการเคลื่อนไหวของร่างกาย แล้วแปลออกมาเป็นประโยคภาษาอังกฤษบนหน้าจอแบบทันที รองรับทั้งการทำมือเดียวและสองมือ และใช้ได้ทั้งใน Gboard และ Live Transcribe โดยไม่คิดเงินเพิ่ม
โมเดลที่อยู่เบื้องหลังชื่อ SL2T ฝึกด้วยข้อมูลกว่า 100,000 ชั่วโมงจากภาษามือมากกว่า 50 ภาษา โดยราวหนึ่งในสี่เป็นภาษามืออเมริกัน คะแนนที่รายงานคือ 70 BLEURT บนชุดทดสอบ FLEURS-ASL แบบไม่เคยเห็นตัวอย่างมาก่อน ซึ่งทีมงานระบุว่าสูงกว่าคะแนนที่เคยมีใครรายงานไว้
จุดที่น่าสนใจกว่าตัวคะแนนคือวิธีออกแบบเรื่องความเป็นส่วนตัว เครื่องจะใช้ MediaPipe Holistic แปลงวิดีโอเป็นลำดับพิกัดจุดสำคัญบนร่างกายตั้งแต่บนเครื่องผู้ใช้ แล้วทิ้งวิดีโอต้นฉบับทันที สิ่งที่ส่งขึ้นไปให้เซิร์ฟเวอร์แปลจึงเป็นลำดับตัวเลขพิกัด ไม่ใช่ภาพหน้าคน
ข้อจำกัดที่ทีมงานเขียนไว้เองคือระบบยังผิดกับท่ามือที่พบไม่บ่อย การสะกดนิ้วเร็วๆ ประโยคที่ประธานถูกกระทำ ท่าบรรยายลักษณะ และการระบุกาลเมื่อไม่มีบริบทช่วย และตอนเปิดตัวรองรับเฉพาะภาษามืออเมริกันเป็นภาษาอังกฤษเท่านั้น แม้ข้อมูลฝึกจะมีเกิน 50 ภาษาก็ตาม
▲ ทำไมต้องรู้ · แบบแผนที่ใช้ในฟีเจอร์นี้เอาไปใช้ต่อได้กับงานอื่นที่ต้องส่งข้อมูลอ่อนไหวขึ้นคลาวด์ คือแปลงข้อมูลดิบให้เหลือเฉพาะสิ่งที่โมเดลต้องใช้จริงตั้งแต่บนเครื่องก่อน แล้วค่อยส่งของที่แปลงแล้วออกไป องค์กรที่ติดปัญหาว่าเอาภาพหรือเสียงของลูกค้าขึ้นระบบภายนอกไม่ได้ ลองถามคำถามนี้ก่อนว่าจริงๆ แล้วโมเดลต้องการอะไรบ้าง อาจไม่ต้องส่งของทั้งก้อน