Home » スマホのカメラで手話を認識、Google Deepmindが手話翻訳AIをPixel 11に提供


AI 2026.08.13

スマホのカメラで手話を認識、Google Deepmindが手話翻訳AIをPixel 11に提供

Google DeepMindは8月12日、手話をテキストへ翻訳するAIモデル「SL2T」を発表しました。GboardとLive Transcribeに搭載され、まずASL(アメリカ手話)から英語への翻訳に対応します。Pixel 11から利用でき、追加料金はかかりません。

SL2Tは、50以上の手話を含む10万時間超のデータで学習されています。ASLのデータは全体の約4分の1を占めます。複数の手話や方言、習熟度のデータを共同で学習することで、単一言語モデルを上回る性能を実験で示したとしています。

手話は、手や腕だけでなく、胴体や頭、顔などの動きを同時に使って意味を伝えます。また、英語などとは異なる文法や語彙を持つ自然言語です。そのためSL2Tは、手話を単語へ順番に置き換えるのではなく、機械翻訳としてテキストへ変換します。

プライバシーにも配慮し、SL2Tはカメラ映像そのものではなく、身体上のポイントを示す座標データを利用します。端末上の「MediaPipe Holistic」が手話をする人の身体の位置を追跡し、幾何学的な座標だけをサーバーへ送信します。元の映像はすぐに破棄される仕組みです。

FLEURS-ASLベンチマークでは、ASLから英語への翻訳で70 BLEURTのゼロショットスコアを記録しました。一方で、まれな手話や高速な指文字などでは誤りが残っています。Google DeepMindは実用化に向け、ストリーミング時の遅延や片手での手話、左利きの利用者への対応なども改善したと説明しています。

開発ではDeafコミュニティとの協力も重視されました。Deaf当事者や専門家がデータ収集や評価、影響評価に参加しています。さらに、複数のDeaf団体や専門家で構成されるAI Sign Language Advisory Committeeを設置し、技術開発の優先事項に意見を反映しています。

SL2TはまずPixel 11のGboardとLive Transcribeで提供されます。Google DeepMindは今後、対応する手話の拡大や手話生成などにも取り組むとのことです。

参考

GoogleDeepMind

もぐら関連記事


CONSULTING / DEVELOPMENT

コンサルティング・開発サービス

Moguraの知見を、あなたのプロジェクトに

mogura_next

Moguraの知見を、あなたのビジネスに
編集長の久保田を筆頭に、XR/メタバースなどバーチャル領域を知り尽くす専門チームが、リサーチからコンサルティング、企画、開発までを一貫支援。
Mogura VRで培った豊富な情報力と業界ネットワークを強みに、企業・行政機関の成果につながる最適な解決策をご提案します。