跳至主要內容
Lizely
Google DeepMind 推出手語轉文字模型,於 Gboard 與 Live Transcribe 上登陸 Pixel 11

文字工具 · 2026-08-13

Google DeepMind 推出手語轉文字模型,於 Gboard 與 Live Transcribe 上登陸 Pixel 11

重點結論

三家媒體於 2026-08-12 發布了同一則 Anthropic 浮水印公告(ABC News、Deccan Chronicle、YourStory),其中 SFG Media 與 Deccan Chronicle 補充了機器可讀的標籤細節。目前尚無任何我們文字處理流程實際可用的偵測器有相關文件記載,因此小組選擇以七天觀察期列入 WATCH(觀察)。偵測將成為一項未來不可計費的項目,若處理不當將會破壞複製貼上的信任度。

一句話總結:在有具備完整文件的偵測器問世,且我們的解析器能記錄每次請求的結果而不造成渲染退化之前,先暫停所有浮水印的建置作業。

來源報導了什麼

發布內容與上線位置

Google DeepMind 的手語團隊於 2026 年 8 月 12 日推出 SL2T,一款手語轉文字翻譯模型,並將其描述為針對聾人與聽力受損使用者的突破性進展。SL2T 以消費性功能而非研究展示的形式首次亮相:在 Pixel 11 上的 Gboard 與 Live Transcribe 中提供手語轉文字聽寫功能,首發支援的語言對為美式手語(ASL)翻譯為英文。Google 的發布將此次上線定位為首次「將手語 AI 從實驗室帶進消費性產品」。

該功能瞄準此類使用者日常仰賴的書寫與編輯介面。使用者可以透過手語搜尋網路、起草訊息或文件,並請 Gemini 處理查詢與任務,模擬聽人向文字欄位聽寫的體驗。在 Live Transcribe 中,相同的輸入讓使用者在對話中以手語回覆。Google 的測試人員表示,以 ASL 手語輸入比以英文打字更快速、更自然且更令人愉悅;此結果若在不同使用者間成立,將對 Android 上的文字產生產生直接影響。輔助文字工具的相關報導請見 [accessiBe 將對話式 AI 層內建於 accessWidget,從 Growth 級網站起步](/insights/text/accessibe-ships-conversational-ai-layer-inside-accesswidget-starting-with/)。

模型運作方式與影片處理方式

根據 Google 的貼文,SL2T 被建構為翻譯系統,而非手語轉單詞的管線。團隊將手語視為具有獨立文法與詞彙的獨立語言,這意味著該模型執行的是跨模態的機器翻譯。為了擷取手語輸入,裝置端的 MediaPipe Holistic 追蹤器將攝影機影像轉換為姿勢特徵點座標,僅將這些座標傳送到伺服器進行翻譯。Google 的發布指出,此設計可讓原始影片立即丟棄,並將其定位為保護隱私的架構。

翻譯過程直接從特徵點座標串流到文字,省略了詞位(glosses)——這是過去手語研究中廣泛使用的中間標籤。Google 的貼文主張,詞位無法捕捉非手控標記與空間構詞,因此移除詞位能去除人為造成的詞彙限制,讓翻譯品質隨資料規模而提升。該貼文也列出團隊在基準測試之外所追求的實務工程目標,包括串流延遲、對非手語輸入產生幻覺的問題、對左手使用者的公平性,以及一手手語、另一手握持手機的情境。

訓練規模與基準測試聲明

Google 表示,SL2T 訓練資料橫跨超過 50 種手語、超過 100,000 小時,其中約四分之一為 ASL 資料。貼文將跨語言、方言與熟練程度的聯合訓練,定位為模型在團隊實驗中勝過單一語言版本的原因。此訓練規模是發布所宣稱、屬於高風險的關鍵數字。

在評測方面,Google 報告 SL2T 在 FLEURS-ASL(sd-test)上創下新紀錄,達到 70 BLEURT 的零樣本分數,並稱其顯著高於先前任何已發表的分數。發布方亦宣稱,根據該基準,SL2T 是迄今為止最強大的手語翻譯模型。標記:70 BLEURT 數字與「最強大」的說法直接來自發布方,而非獨立的排行榜,因此下游讀者應將其視為仍有待在原始來源之外複製驗證的研究聲明。

對寫作者、編輯與重度排版工作流程的讀者影響

對仰賴 Gboard、Live Transcribe 及周圍 Android 生態系的讀者而言,此次發布改變了文字最初被產生的方式。以手語向手機輸入的使用者,現在能夠在不切換鍵盤的情況下進行搜尋查詢、訊息草稿、文件內文,以及 Gemini 提示,而 Live Transcribe 讓他們能在對話中回覆,而非來回打字。這改變了在 Android 上能產出乾淨初稿的使用者族群,也改變了編輯對附件與聊天紀錄的未來預期。

同時,這也重新框定了此類別所追蹤的書寫工具對話。現有的工具如 [粗體文字產生器](/text/bold-text-generator/) 或 [文字格式化工具](/text/text-formatter/) 仍運作於打字或聽寫輸入的下游,因此 SL2T 是上游的基礎建設,而非取代品。正確的解讀方式是:它是一種新的輸入模態,餵入那些負責清理、格式化並輸出文字的相同文字介面。評估無障礙聲明的讀者,應將發布方的說法與獨立評測相互權衡,特別是延遲、單手手語與左撇子使用者公平性等貼文提及但未量化的面向。

後續觀察重點與仍不明確之處

有三件事值得持續追蹤。首先, rollout 路線:Google 表示將很快支援更多裝置,並在現有 ASL 轉英文之外陸續新增其他語言,但貼文並未列出裝置、日期或語言順序。其次,基準測試聲明:FLEURS-ASL(sd-test)上的 70 BLEURT 分數被宣稱為前所未有,獨立團隊是否能重現,以及模型在訊息與文件中面對專業術語的表現如何,仍有待觀察。第三,隱私與幻覺問題:儘管貼文宣稱影片會立即丟棄且能處理非手語輸入,但實際在 Pixel 11 上的部署將是這些承諾在消費規模下的首次驗證。

公開的不確定性:Google 的發布是此處唯一的來源,且讀來像是發布方報告。獨立的基準重現、真實裝置上的延遲測量、除左撇子手語之外的公平性稽核,以及確認的跨語言路線圖,都仍在前方。標記:在這些結果出爐之前,應將此次上線視為 Google DeepMind 的功能發布,而非業界對最先進手語翻譯的全面確認。

站內相關工具

資料來源

本頁分析由 Lizely AI 產生,內容以所連結的公開證據為根據;參與者為虛構的編輯角色,並非真人作者。