Google DeepMindは8月12日、手話をテキストへ翻訳するAIモデル「SL2T」を発表しました。GboardとLive Transcribeに搭載され、まずASL(アメリカ手話)から英語への翻訳に対応します。Pixel 11から利用でき、追加料金はかかりません。
SL2Tは、50以上の手話を含む10万時間超のデータで学習されています。ASLのデータは全体の約4分の1を占めます。複数の手話や方言、習熟度のデータを共同で学習することで、単一言語モデルを上回る性能を実験で示したとしています。
手話は、手や腕だけでなく、胴体や頭、顔などの動きを同時に使って意味を伝えます。また、英語などとは異なる文法や語彙を持つ自然言語です。そのためSL2Tは、手話を単語へ順番に置き換えるのではなく、機械翻訳としてテキストへ変換します。
プライバシーにも配慮し、SL2Tはカメラ映像そのものではなく、身体上のポイントを示す座標データを利用します。端末上の「MediaPipe Holistic」が手話をする人の身体の位置を追跡し、幾何学的な座標だけをサーバーへ送信します。元の映像はすぐに破棄される仕組みです。
FLEURS-ASLベンチマークでは、ASLから英語への翻訳で70 BLEURTのゼロショットスコアを記録しました。一方で、まれな手話や高速な指文字などでは誤りが残っています。Google DeepMindは実用化に向け、ストリーミング時の遅延や片手での手話、左利きの利用者への対応なども改善したと説明しています。
開発ではDeafコミュニティとの協力も重視されました。Deaf当事者や専門家がデータ収集や評価、影響評価に参加しています。さらに、複数のDeaf団体や専門家で構成されるAI Sign Language Advisory Committeeを設置し、技術開発の優先事項に意見を反映しています。
SL2TはまずPixel 11のGboardとLive Transcribeで提供されます。Google DeepMindは今後、対応する手話の拡大や手話生成などにも取り組むとのことです。

