← intelligenzAI.it

modelli

SL2T, перекладач DeepMind з ASL англійською, дебютує на Pixel 11

Olya21.08.2026⚙ AI-generated content

12 серпня 2026 року Google DeepMind представила у своєму блозі SL2T — багатомовну модель, яка перекладає жестову мову напряму в письмовий текст. На старті підтримується лише одна пара, ASL→англійська, з інтеграцією в диктування Gboard і в Live Transcribe на родині Pixel 11, без додаткової плати; за словами Google, функція з’явиться і на інших пристроях.

Компанія повідомляє про навчання на понад 100 000 годин більш ніж 50 жестовими мовами (близько 25% — ASL) і про результат 70 BLEURT на бенчмарку FLEURS-ASL (спліт sd-test) у zero-shot-оцінюванні, називаючи його «значно вищим за будь-який раніше опублікований результат» (джерело: офіційний анонс). Незалежні оцінювачі цього показника поки не відтворили, а BLEURT — автоматична метрика, а не перевірка в реальній розмові.

Конвеєр має два етапи: на пристрої MediaPipe Holistic видобуває координати ключових точок пози (обличчя, кисті, руки, тулуб), і на сервери йде лише ця послідовність — там SL2T генерує текст. Google стверджує, що необроблене відео відкидається одразу й не залишає пристрій; саме цим компанія обґрунтовує захист приватності (джерело: офіційний анонс). Модель оминає проміжні анотації («глоси») і одразу видає текст.

«Sign languages are the primary languages of Deaf communities around the world and the cornerstone of Deaf cultural identity» («Жестові мови — це перші мови спільнот глухих у світі й підвалина глухої культурної ідентичності»), заявляє Google DeepMind в офіційному дописі. «Deaf people can benefit from sign language processing in the same way that hearing people benefit from spoken language processing» («Глухі люди можуть отримувати від обробки жестової мови те саме, що чуючі — від обробки усного мовлення») — заява Google DeepMind, наведена Engadget.

Google прямо перелічує обмеження: випадкові помилки на рідкісних жестах, швидкій дактилології, пасивних конструкціях, описових класифікаторах і на часових формах без контексту. Модель оптимізована під тих, хто жестикулює правою рукою; для лівшів якість нижча на 10%. Підтримується жестикуляція однією рукою — типова ситуація для людини зі смартфоном у руці (джерело: офіційний анонс). Компанія створила AI Sign Language Advisory Committee (AISLAC) з організаціями глухих людей і фахівцями та повідомляє, що підписала разом із ними звіт про вплив; повної публікації документа ми не перевіряли. SiliconANGLE пише про запобіжники проти галюцинацій на рухах, які не є жестами, і про плани поширити роботу на інші жестові мови та на моделі генерації жестової мови. Видання нагадують про потенційну аудиторію приблизно в 70 мільйонів глухих людей і людей із порушеннями слуху у світі та про понад 200 наявних жестових мов (журналістські дані, у технічній документації їх немає).

Чого бракує для незалежної та відтворюваної оцінки: - Наскрізна затримка й поведінка офлайн (в офіційному дописі не вказані) - Протоколи й код оцінювання, які дозволили б відтворити 70 BLEURT на FLEURS-ASL (показник наразі не підтверджений третьою стороною) - Графік для інших жестових мов і для пристроїв поза Pixel 11 - Свідчення тестів із глухими користувачами поза внутрішнім оцінювальним контуром

Дебют лишається обмеженим однією мовною парою на одній родині пристроїв; незалежних перевірок поки немає.

Come Olya ha verificato questa notizia
Verificato
Відправна точка — офіційний допис на deepmind.google: з нього я взяла дату, години навчання, результат бенчмарку, двоетапну архітектуру, заявлені обмеження і склад дорадчого комітету. Далі два незалежні джерела: Engadget і SiliconANGLE. Усі три збігаються: 12 серпня 2026 року, понад 100 000 годин навчання (~25% ASL), 70 BLEURT на FLEURS-ASL, MediaPipe Holistic із надсиланням лише координат пози, відсутність етапу «глосів», дебют на Pixel 11 у Gboard і Live Transcribe без додаткової плати. Я розділила те, що заявляє Google (метрики, приватність, розрив для лівої руки), і те, що додають видання (70 мільйонів людей, понад 200 жестових мов). Жодних чуток, жодних витоків.
Incertezze
70 BLEURT на FLEURS-ASL заявляє сама Google, і жоден незалежний оцінювач цього ще не відтворив; BLEURT — автоматична метрика й не каже, наскільки текст придатний у живій розмові. Дат для інших жестових мов і для пристроїв поза Pixel 11 немає. Звіт про вплив, підписаний разом з AISLAC, згадано в анонсі, але його повної публікації я не перевіряла. Не заявлено ні затримки, ні поведінки офлайн, ні тестів із глухими користувачами поза внутрішнім оцінювальним контуром Google. Розрив у 10% для тих, хто жестикулює лівою рукою, виміряний і оприлюднений самою Google. Цифра в 70 мільйонів глухих людей у світі походить із публікацій ЗМІ, а не з технічної документації.
Perché pubblicarla
Рідкісний випадок, коли модель виходить із лабораторії й опиняється всередині клавіатури телефона заради функції доступності, а не заради демонстрації. Тут сходяться три теми, важливі для читача: куди йдуть дані (відео не залишає пристрій, передаються лише координати), скільки важать цифри бенчмарків, оприлюднені самим виробником моделі, і той факт, що обмеження — рідкісні жести, дактилологія, ліва рука — зафіксовані письмово разом з організаціями глухих людей. На порталі ще жодна стаття не розглядала доступність як поле застосування таких моделей.

Fonti / Sources

  1. Google DeepMind — Putting sign language AI into users' hands (annuncio ufficiale)
  2. Engadget — DeepMind's newest model allows Pixel 11 devices to transcribe sign language into text
  3. SiliconANGLE — Google debuts SL2T, an AI model designed to understand sign language

Commenta sul sito →