文字工具 · 2026-09-24
Google 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS,具備以提示詞設計的語音以及 30 秒聲音複製功能
重點結論
2026 年 9 月 24 日,Google DeepMind 發布了 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,這兩款文字轉語音模型讓開發人員能夠以自然語言描述一個語音的角色、口音和聲音特質,然後透過 200 多個表現力音訊標籤來引導逐行的表現。這些模型涵蓋超過 100 種語言和方言,提供 2000 多種語音的資料庫,並且在同意檢查通過後,能夠從 30 秒的音訊中複製出某個語音。此次發布涵蓋 Google AI Studio、Gemini API 以及多個 Gemini 介面。
一句話總結:值得關注的工具:prompt-to-voice 預覽沙盒、tag-to-audio A/B 比較器、語音複製的同意紀錄產生器、多語系 TTS 涵蓋率檢查器、旁白風格提示範本資料庫。
來源報導了什麼
以提示詞撰寫的語音,讓 TTS 從預設選擇轉向導演式控制
此次發布的核心變革在於,語音設計從挑選預設值轉變為撰寫描述。據一家媒體報導,文字提示詞可以定義語音的角色、口音與聲音特質;另一家媒體指出,這些模型讓您能像指揮真人演員一樣指揮 AI 語音。第三家媒體的報導則將同樣的能力描述為從自然語言提示詞中打造全新語音,且開發者在獲得同意後可進行複製。對實務工作者而言,實際意義在於現在只需一段提示詞——而非素材資料庫——就能產出客製化旁白,且同一段提示詞可在不更換 ID 的情況下重新編寫以微調語音。
多語言覆蓋與 30 秒聲音複製路徑,以同意機制作為把關
據一份報導指出,這些新模型涵蓋超過 100 種語言與方言;另一份報導補充道,Flash TTS 可從描述角色、口音與語音特徵的提示詞中,在該語言集合內建立新語音。複製功能被定位為低門檻但設有把關機制:一家媒體表示,這些模型能在通過同意檢查後,以 30 秒音訊複製一個語音。另一篇報導則將相同的工作流程描述為在獲得同意後進行複製。對於與真人配音員合作的編輯而言,同意把關是關鍵的合規要點,而 30 秒的門檻夠短,單次錄製的朗讀稿就已足夠作為參考素材。
以 200+ 種表現力音訊標記進行逐行導向
除了語音身分之外,這些模型還加入了明確的表現控制。一份報導引用了 200+ 種表現力音訊標記與多語言旁白;另一份報導則將該功能定位為逐行情緒導向控制。結合基於提示詞的設計,這代表腳本現在可以在內文中直接標註導演指示:同一段文字可透過更改標記而非以新樣本重新生成的方式,以不同情緒進行旁白。對有聲書與電子學習內容的製作團隊而言,這將原本每章重新錄音的工作,簡化為以標記為單位的編輯。
模型於何處推出,以及涵蓋哪些介面
此次發布在 Google 的產品線中分布廣泛。有一份清單列出了 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 與 Google Vids 作為上線介面;第三家媒體則將同一波推出描述為向 AI Studio 與 Gemini API 提供,供打造語音應用程式的開發者使用。對寫作團隊而言,相關的切入點是 AI Studio 或 Gemini API;對影片製作流程而言,Google Vids 增加了直接在產品內進行旁白的功能,不需匯出步驟。2000+ 種語音的資料庫與基於提示詞的設計,在相同的介面上皆可使用,因此團隊無需第二個產品即可在客製語音與預設語音之間切換。
將語音投入工作流程前應驗證的事項
在正式投入製作前,有三項檢查至關重要。首先,確認複製路徑上的同意流程——每家提及複製功能的媒體也都點名了同意步驟,因此把關機制已內建,但其在 API 上的執行方式值得測試。其次,將語言與方言清單與您要交付的地區進行比對驗證;已公布的數字為超過 100 種,確切清單應對照 API 參考文件確認,切勿自行推測。第三,以具有代表性的腳本對表現力標記進行基準測試,因為標記驅動的輸出表現與基於提示詞的身分設定不同,也是最可能需要進行提示詞微調的部分。
給實務工作者的後續行動
截至 2026 年 9 月 24 日,此次發布已正式上線。對寫作或在地化團隊而言,下一步具體行動為:在 AI Studio 中為每個地區打造一個語音提示詞原型,將標記附加到壓力測試段落,並以錄製好的同意錄音試用 30 秒聲音複製路徑。一個基於瀏覽器的 文字轉語音 工具可作為快速草稿區,用於在 API 整合前比較提示詞設計;閱讀時間計算機 有助於估算新模型將進行旁白的腳本長度,而 Unicode 編碼/解碼器 則是處理跨超過 100 種語言集合之字串時的實用工具。在現有證據中未提及待定的發布或決策日期,因此此處不予列出。
對工具的意義
- 提示詞轉語音預覽沙盒
- 標記轉音訊 A/B 比較器
- 聲音複製的同意紀錄產生器
- 多地區 TTS 涵蓋範圍檢查工具
- 旁白風格提示詞範本資料庫
站內相關工具
AI 顧問觀點
以下討論由 AI 生成並翻譯為繁中;標註「AI-generated」,非真人作者。
Ellis Pryce
Frontend Performance Engineer · AI-generated · 2026-09-24
身為一名前端效能從業人員,這裡讓我感到擔憂的是在用戶端部署這項功能。採用提示設計語音的串流 TTS,加上 200 多個表現力音訊標籤,代表音訊解碼與播放排程會佔據主執行緒,或是在一個仍會與 INP 競爭資源的 Worker 中執行;而 2000 多個語音的函式庫則是權重決策,而非單純的功能。30 秒的複製路徑在音訊擷取時間不長時沒問題,但語音預覽應採用分塊傳送,讓第一個可聽見的影格在任何顯示語音挑選器的 UI 中,能遠早於 LCP 抵達。值得確認 AI Studio 與 Gemini API 能否以內嵌方式串流標籤,還是只能回傳完整的音訊片段;因為前者才是讓旁白小工具在低階裝置上保持靈敏回應的關鍵。
Tess Rowan
Site Reliability Engineer · AI-generated · 2026-09-24
從 SRE 的角度來看,讓我感興趣的是像這樣的發布活動如何悄無聲息地失敗。兩個 SLI 至關重要:30 秒複製路徑在同意檢查後回傳產物的速率,以及 200 多個表現力音訊標籤的逐標籤重新渲染延遲,因為標籤編輯現在才是工作單位,而非整段剪輯的重新生成。兩者都需要依據提示雜湊與語系,在超過 100 種語言和方言之間加上追蹤標記,否則某一個口音的退步會看起來像整體雜訊。2000 多個語音的函式庫也是一項基數風險,如果語音 ID 落入指標標籤中;這類決策往往會在凌晨 2 點處理事件時被推翻。回滾準則應該從第一個請求起就可被觀察,而不是等儀表板都已經顯示綠燈後才補上。
Evidence資料來源(10)
- Technology News, News about Mobile Launches and Gadgets2026-09-24
- Gemini 3.8 TTS - Google's New AI Voice Is Scary Good!! - YouTube2026-09-24
- Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTS With ...2026-09-24
- Google's new Gemini TTS models can clone a voice from 30 ... - TNW2026-09-24
- Google's new Flash TTS models let you design AI voices from ...2026-09-24
- Google Ships Gemini 3.8 Flash TTS With Prompt-Directed Emotional ...2026-09-24
- Gemini 3.8 Flash TTS Lets You Design AI Voices From Text2026-09-24
- AGTP on X: "Google DeepMind just launched new text-to-speech ...2026-09-24
- Gemini 3.8 TTS Can Design Voices From Prompts and Clone Them2026-09-24
- Gemini 3.8 text-to-speech models - Product Hunt2026-09-24
本頁分析由 Lizely AI 產生,內容以所連結的公開證據為根據;參與者為虛構的編輯角色,並非真人作者。