Android 手機可以透過一個名為 Text To Speech 的瀏覽器工具,大聲朗讀最多 20,000 個字元的輸入或貼上文字,速度可從 0.5× 調整到 2.0×,音調可從 0.5 調整到 2.0,並隨時提供明確的暫停、繼續和停止按鈕供你控制。這種方式與大多數人第一時間搜尋的 Android 設定不同。系統的設定選單確實包含「文字轉語音輸出」面板和「選擇並朗讀」無障礙功能,可朗讀螢幕上顯示的內容。這些工具內建於作業系統中,不需要額外安裝軟體,對於瀏覽應用程式和閱讀可見內容來說是合理的預設選擇。然而,它們並不允許你直接放入一份 500 字的電子郵件草稿、稿件中的一個章節,或從其他地方複製的一段文字,然後無需先在另一個應用程式中選取,就能聽到它被朗讀出來。瀏覽器型的 TTS 工具填補了這個缺口,它接受你貼上或輸入的文字,從手機瀏覽器所支援的各種語音中做選擇,並提供直接的播放控制,且無需上傳任何內容。本文將完整說明的權衡之處在於,瀏覽器 TTS 會承襲你特定 Android 裝置上底層語音引擎的所有怪癖:語音、品質、語言和發音全都來自你的硬體和軟體,而非遠端伺服器。

how to use text to speech on android
如何在瀏覽器中於 Android 上使用文字轉語音

Android 內建的朗讀工具及其涵蓋範圍

Android 配備全系統通用的文字轉語音引擎,以及至少一項用於朗讀螢幕內容的無障礙功能,而大多數搜尋這個關鍵字的人都希望這些內建功能之一能解決他們的問題。相關的進入點位於設定中的「無障礙設定」下。「文字轉語音輸出」讓你選擇引擎(通常是 Google 的,有時是 Samsung 的或其他廠商的)、選擇偏好的語言,並調整預設的語音速度。「選擇並朗讀」同樣位於「無障礙設定」選單中,讓你點選螢幕上的一個目標,讓手機大聲朗讀段落,這對於文章和應用程式內容很實用。Google 助理也可以透過「閱讀」指令來大聲朗讀網頁。

當你想要聆聽的文字已經顯示在另一個應用程式的螢幕上時,這些內建工具運作良好。它們與作業系統緊密整合,遵循 Android 使用者已熟悉的導覽模式,並且不需要額外安裝軟體。不過,它們有其限制。「選擇並朗讀」只能朗讀目前顯示的內容;它無法朗讀你在另一個應用程式中撰寫的草稿,除非你複製該文字、貼到某個可見的地方,然後加以選取。設定中的系統速度和音調控制是全域性的,而非針對個別工作階段,因此調整它們會影響手機上所有其他的 TTS 互動。內建工具也與系統引擎綁定,這意味著要新增第三方語音,就必須安裝另一個 TTS 引擎應用程式,並從設定中切換過去。瀏覽器型的 TTS 工具則處於不同的定位。它直接接受你貼上或輸入的文字,讓你針對每個工作階段變更速度和音調,並提供「朗讀」、「暫停」、「繼續」和「停止」的控制選項。因為一切都在瀏覽器分頁中進行,你無需授予無障礙權限或安裝獨立的應用程式就能試用。

瀏覽器工具更適合的情況

在幾種常見情況下,瀏覽器型的 TTS 工具是正確的解答。如果你在送出前撰寫或複製了一份草稿並想聽聽看,這個工具會直接朗讀你貼上或輸入的文字,無需開啟其他應用程式或反覆複製貼上文字。如果你想比較兩個語音對某個難唸的單字或專有名詞的發音方式,切換語音選擇器並重新點選「朗讀」就能立即進行 A/B 測試。如果你正在研讀一段文字,並且只想針對本次工作階段放慢或加快速度,從 0.5× 到 2.0× 的速度設定讓你不必更改手機的永久 TTS 設定就能做到。當你不想在手機上安裝另一個應用程式時,瀏覽器 TTS 也同樣適用。許多使用者會碰到儲存空間或背景處理程序的上限,因此偏好完全在瀏覽器中執行的工具。由於 Text To Speech 是在瀏覽器中執行,可用的語音和執行階段的播放行為取決於你特定的瀏覽器和作業系統。其權衡之處在於,語音品質、語言涵蓋範圍和發音會反映你特定瀏覽器和 Android 版本所支援的內容,這之間的差異比人們預期的更大,值得在依賴此工具處理重要工作之前先行了解。

準備好你的 Android 瀏覽器

在開啟工具之前,花一分鐘確認手機的瀏覽器處於良好狀態。瀏覽器使用的文字轉語音引擎,與 Android 向其他應用程式公開的是同一個,因此你聽到的語音來自裝置上安裝的 TTS 套件。在大多數現代的 Android 手機上,Google 的 TTS 引擎已經預先安裝並啟用。Samsung 手機通常也包含 Samsung TTS,切換引擎是從「設定」→「無障礙設定」→「文字轉語音輸出」來進行。兩項實際的檢查能節省之後的時間。首先,如果你想聽到播放內容,請確認手機未處於靜音或「勿擾」模式,因為瀏覽器音訊遵循與其他應用程式相同的音量混音器。其次,請注意在手機上點選文字欄位會叫出螢幕鍵盤,導致部分頁面被遮住;在輸入後向上滑動頁面可以修正檢視。準備就緒後,請在手機的瀏覽器中開啟 Text To Speech。介面會在頂端顯示一個大型文字區、語音選擇器、速度和音調控制項,以及一個「朗讀」按鈕。「暫停」、「繼續」和「停止」會在播放開始後出現。

逐步在 Android 上大聲朗讀文字

請依照下列步驟,在你的 Android 手機上聽到文字被朗讀出來。

  1. 在 Android 瀏覽器中開啟 Text To Speech。可用的語音和合成行為取決於你的瀏覽器和作業系統。
  2. 點選文字區域,貼上或輸入最多 20,000 個字元。工具會拒絕空白字元、null 字元,以及超過 20,000 字元上限的輸入內容。
  3. 點選語音選擇器,查看你的瀏覽器和 Android 目前支援的語音。每個項目會顯示名稱和語言標籤,清單會因裝置而異。
  4. 將速度調整在 0.5× 到 2.0× 之間,以放慢或加快語音。
  5. 將音調調整在 0.5 到 2.0 之間。較低的值會讓語音變得低沉,較高的值會使其提高。這些是 SpeechSynthesisUtterance 的控制值,並非實際測量出來的音樂音程。
  6. 點選「朗讀」。工具會取消任何舊的播放序列,將長文字分割成不超過 220 個 UTF-16 字碼單位的有限區塊,然後依序開始朗讀。
  7. 隨時使用「暫停」來中斷播放,使用「繼續」來接續,或使用「停止」來結束。編輯文字也會停止目前的作用中佇列,讓你可以從新的內容重新開始。

如果瀏覽器沒有可用的語音,或在執行階段拒絕所選的語音,工具會回報播放錯誤,而不是假裝語音已朗讀完成。請在切換語音後,或瀏覽器完成載入其語音引擎後,再次點選「朗讀」。

在手機上調整速度、音調和語音

速度和音調都會公開瀏覽器透過 Web Speech API 的 SpeechSynthesis 介面傳遞給底層語音引擎的標準控制值。工具會以包含方式驗證速度介於 0.5× 到 2.0× 之間、音調介於 0.5 到 2.0 之間,因此超出範圍的輸入會被拒絕。不同的引擎對這些值的解讀方式不同,這就是為什麼同一個滑桿位置在搭載 Chrome 的 Pixel 上,聽起來會與搭載 Samsung Internet 的 Samsung 手機略有不同。下表概述了每個控制項的功能及其限制所在。

控制項範圍它的作用
速度0.5× 到 2.0×語音說話的速度。較低的值會放慢每一段話,較高的值則會加快速度。
音調0.5 到 2.0語音聽起來偏高或偏低。較低的值會讓音色變得低沉,較高的值則會使其變得明亮。
語音選擇器裝置所支援的內容決定播放文字的引擎、語言、腔調和品質設定檔。清單來自目前的瀏覽器和 Android 安裝環境,而非來自此工具。

語音選擇器是多數人最低估的變數。安裝了 Google 高品質語音的手機,與僅執行基本精簡語音的手機相比,聽起來有明顯差異。如果你看不到想要的語音,你的瀏覽器或 Android 版本可能並未支援該語音;新增更多語音是透過手機的 TTS 引擎設定來完成,而不是從工具內部進行。

為什麼不同手機之間的語音和品質會有所不同

你所看到的語音清單並非由工具所策劃。它是你的手機瀏覽器透過標準的 Web Speech API 所傳遞的清單,而該 API 接著會向作業系統中已安裝的語音引擎查詢目前可用的內容。這條鏈路正是為什麼同一個工具在相同的網路上,於不同的 Android 裝置上會呈現出完全不同的語音選單。以下是一些常見的例子:近期 Pixel 上的 Google TTS 引擎會在多種語言中提供一套高品質語音,並讓你視需要下載更多;Samsung 手機將 Samsung TTS 與 Google 的並列打包,瀏覽器預設可能會優先採用 Samsung 的清單;較舊的 Android 版本,或使用者已停用高資料量功能的手機,可能僅會顯示一兩個語言涵蓋範圍有限的精簡語音。在 Android 上執行的某些瀏覽器根本不公開明確的語音清單,而是退回到系統預設值,工具會據此回報。發音也會有所不同。專有名詞、技術術語和品牌名稱會由當下啟用的引擎進行解讀,而沒有任何兩個引擎會以完全相同的方式處理這些詞彙。如果某個語音持續將某個單字發音錯誤,最可靠的解決方法是在文字中以音標方式改寫該單字,而不是期望引擎能學會新詞。如需更深入了解瀏覽器用來擷取語音清單和提交發音請求的底層方法,上方連結的 MDN 參考文件記載了完整的介面範圍。

Honest Limits of Browser TTS on Android

The tool is intentionally narrow, and that scope is part of why it is quick and predictable. Knowing the limits helps you decide whether it fits the task at hand. The tool does not produce a downloadable audio file. The browser's standard speech interface provides playback controls but does not expose a portable audio buffer, so MP3 or WAV export is not available; if you need a reusable recording, a fixed pronunciation dictionary, SSML markup, or reproducible voice across machines, a dedicated synthesis service with its own licensing is the right choice. The tool is not a screen reader. It reads the text you enter and nothing else, and it does not announce page structure, focus changes, control roles, or live regions, so it should not be used in place of dedicated assistive software for essential accessibility needs. The tool does not upload your text. Words and punctuation are passed to the local browser speech interface as you entered them, with only line endings and repeated horizontal spaces normalized before playback; Lizely does not store or transmit the text. Long passages are split into chunks of up to 220 UTF-16 code units, preferring sentence and clause boundaries, so the splitter can place natural pauses between ideas rather than cutting mid-thought. Some Android browsers require a user gesture before the first audio output, which is why tapping Speak once is necessary even though the text is already loaded. If the browser has no usable voice available or rejects a chosen voice at runtime, the tool reports a playback error rather than silently failing.

Practical Ways to Use It on a Phone

A few real workflows that work well with browser TTS on Android. Drafting and proofreading: paste an email, a status update, or a long-form article into the text area, slow the rate to around 0.7×, and listen for clumsy phrasing, run-on sentences, and missing words, since reading your own writing out loud catches problems your eyes glide over. Pronunciation checks: paste a paragraph containing unfamiliar names, brand spellings, or technical terms and flip through the available voices to see how each one handles them, which is faster than asking colleagues to read for you and lets you iterate privately. Listening practice: paste a passage in a language your installed voices support and slow it down to 0.6× or 0.7× to hear syllables clearly, with the caveat that the tool does not parse grammar or track progress, so treat it as a listening aid rather than a structured course. Reading long articles hands-free: copy a wall of text from a browser, document, or note app into the tool and listen while your phone sits on a desk, using Stop, Pause, and Resume to stay in control without picking the device up. For everything outside this scope, including recordings, fixed pronunciation, offline mobile-native apps, or accessibility-grade navigation, use a dedicated, maintained tool built for that job.