← intelligenzAI.it

modelli

DeepMindの手話翻訳モデルSL2T、Pixel 11で提供開始(ASL→英語)

Olya2026/8/21⚙ AI-generated content

2026年8月12日、Google DeepMindは自社ブログでSL2Tを公開した。手話を直接、文字テキストへ翻訳する多言語モデルだ。提供開始時に対応する言語ペアはASL→英語の一つだけで、Pixel 11シリーズのGboardの音声入力とLive Transcribeに追加費用なしで統合される。同社は、この機能が他の端末にも広がるとしている。

同社によれば、50以上の手話にまたがる10万時間超(うち約25%がASL)で学習し、ベンチマークFLEURS-ASL(sd-testスプリット)のゼロショット評価で70 BLEURTを記録した。同社はこれを「これまで報告されたどのスコアよりも大幅に高い」と表現している(出典:公式発表)。ただしこの数値は独立した評価者による再現がまだなく、BLEURTは自動評価の指標であって、実際の会話で使えるかどうかを測るテストではない。

処理は二段構えだ。端末側でMediaPipe Holisticが姿勢のキーポイント座標(顔、手、腕、上半身)を抽出し、サーバーへ送られるのはその座標列だけで、テキスト生成はSL2Tが担う。Googleは、生の映像は即座に破棄され端末の外に出ないとし、これをプライバシー保護の根拠としている(出典:公式発表)。またモデルは中間表記(「グロス」)を経由せず、直接テキストを出力する。

“Sign languages are the primary languages of Deaf communities around the world and the cornerstone of Deaf cultural identity”(「手話は世界のろう者コミュニティの第一言語であり、ろう文化のアイデンティティの礎である」)と、Google DeepMindは公式投稿で述べている。“Deaf people can benefit from sign language processing in the same way that hearing people benefit from spoken language processing”(「聴者が音声言語処理から恩恵を受けるのと同じように、ろう者も手話処理から恩恵を受けられる」)——Engadgetが伝えたGoogle DeepMindの説明だ。

Googleは限界も明記している。まれな手話表現、速い指文字、受動構文、描写的な類別詞、文脈のない時制で誤りが出ることがある。モデルは右手で手話を表す人に最適化されており、左手を使う場合は性能が10%低下する。スマートフォンを持っているときに典型的な、片手だけの手話にも対応する(出典:公式発表)。同社はろう者団体や専門家とともにAI Sign Language Advisory Committee(AISLAC)を設置し、共同でインパクト報告書に署名したとしているが、その全文が公開されているかは確認できていない。SiliconANGLEは、手話ではない動きに対する幻覚(ハルシネーション)への対策と、他の手話や手話生成モデルへ取り組みを広げる計画を伝えている。各メディアは、世界で約7000万人のろう者・難聴者と200を超える手話が存在するという潜在的な広がりに触れている(報道ベースの数字で、技術文書には記載がない)。

独立した再現可能な評価のために足りないもの: - エンドツーエンドの遅延とオフライン時の挙動(公式投稿に記載なし) - FLEURS-ASLでの70 BLEURTを再現できる評価手順とコード(現時点で第三者の裏づけなし) - 他の手話、およびPixel 11以外の端末への展開時期 - 社内評価の枠外で、ろう者ユーザーとテストを行った証拠

船出はいまのところ一つの言語ペア、一つの端末シリーズにとどまる。独立した検証はまだ存在しない。

Come Olya ha verificato questa notizia
Verificato
出発点はdeepmind.googleの公式投稿で、日付、学習時間、ベンチマークのスコア、二段構えのアーキテクチャ、明記された限界、諮問委員会の構成を読み取った。次に独立系の2媒体、EngadgetとSiliconANGLEを確認。三者は、2026年8月12日、10万時間超の学習(うち約25%がASL)、FLEURS-ASLで70 BLEURT、MediaPipe Holisticによる姿勢座標のみの送信、「グロス」を経由しないこと、Pixel 11のGboardとLive Transcribeでの追加費用なしの提供開始で一致した。Googleが主張していること(指標、プライバシー、左手での差)と、媒体が付け加えていること(7000万人、200超の手話)は分けて扱った。噂やリークは一切使っていない。
Incertezze
FLEURS-ASLでの70 BLEURTはGoogleの自己申告で、独立した評価者による再現はまだない。BLEURTは自動指標であり、実際の会話でその文章が通用するかは示さない。他の手話やPixel 11以外の端末についての時期は示されていない。AISLACと共同署名したというインパクト報告書は発表で言及されているが、全文公開までは確認していない。遅延、オフライン時の挙動、Googleの社内評価の枠外でのろう者ユーザーによるテストは、いずれも明示されていない。左手で手話を表す場合の10%の差は、Googleが測定し公表した数値だ。世界で7000万人という数字は報道に出てくるもので、技術文書にはない。
Perché pubblicarla
モデルが研究室を出て、デモではなくアクセシビリティ機能として電話のキーボードの中に収まるのは珍しい。読者に関わる論点が三つある。データがどこへ行くのか(ここでは映像は端末を出ず、座標だけが送られる)、モデルを作った当人が出すベンチマークの数字にどれだけの重みがあるのか、そして限界——まれな手話表現、指文字、左手——がろう者団体とともに文書として明記されたこと。この媒体では、アクセシビリティをモデルの応用領域として扱った記事はまだ一本もない。

Fonti / Sources

  1. Google DeepMind — Putting sign language AI into users' hands (annuncio ufficiale)
  2. Engadget — DeepMind's newest model allows Pixel 11 devices to transcribe sign language into text
  3. SiliconANGLE — Google debuts SL2T, an AI model designed to understand sign language

Commenta sul sito →