是的 —— 賽博龍娘 VTuber Zentreya 在直播中使用文字轉語音引擎來取代她本人的即時語音。她那辨識度極高的機械式節奏、金屬感的語速,以及在激烈情緒爆發時偶爾出現的斷音,正是該 TTS 流程的招牌特色,這也正是為什麼這麼多新觀眾會跑到她的頻道,想弄清楚這種效果是怎麼做出來的。這股熱潮把 TTS 從一個小眾的無障礙工具推向了主流的 VTuber 文化,但底層機制其實就是每個現代瀏覽器免費提供的同一套東西:一個語音合成介面,運用裝置本身提供的語音,把書面文字轉成音訊。
如果你想從螢幕這一端聽聽 TTS 流程實際聽起來是什麼樣子,或者只是想在手空不出來的時候聽一份草稿、一段文章或一份腳本,那麼文字轉語音工具就能在本地端完成完全相同的轉換。你貼上或輸入文字,瀏覽器就會透過作業系統原本就提供的語音來朗讀,而你的內容從頭到尾都不會離開這個分頁。
本指南接下來會說明 Zentreya 是誰、為什麼她的創作者選擇使用 TTS、瀏覽器內建的語音介面底層究竟做了什麼、如何逐步操作文字轉語音工具、每個設定代表什麼意思,以及有哪些明確的限制會決定某一項任務究竟適合用這個工具,還是該交給更專業的方案。

Zentreya 是誰?為什麼她會使用 TTS?
Zentreya 是一位美國 VTuber,在網路上以賽博龐克龍娘的形象聞名。她於 2017 年獨立出道,後來成為 VShojo 的創始成員之一,此後便持續以獨立身分運作。她的角色圍繞著冷靜、沉著、機械感的說話方式,並會在輕鬆的互動中失控暴走成高能量的暴走狀態 —— 這種反差逐漸成為她品牌的核心,也讓她的直播與眾不同。
這個問題之所以被如此頻繁地提出,原因其實很單純:Zentreya 的直播聲音並不是透過麥克風錄下她的自然人聲,而是她即時操控的文字轉語音引擎所產生的即時輸出。觀眾聽到的是合成後的成果,包含其獨特的語速、激烈反應時偶爾出現的口語破音,以及定義她角色的始終一致音調。
對創作者而言,這種做法有雙重吸引力。第一,TTS 免除了一邊直播一邊說話的需求,因此降低了偏好文字、重視自然嗓音隱私,或希望數百小時內容擁有統一聲音形象的創作者門檻。第二,TTS 語音的可預測性高且易於調整,對於希望長期維持特定人設的創作者來說非常實用。觀眾很快就將 Zentreya 的聲音與那套流程劃上等號,這也是「does zentreya use text to speech」這個搜尋詞彙始終如此熱門的原因。
瀏覽器內建的文字轉語音究竟在做什麼
當網頁把文字大聲念出來時,幾乎都是呼叫 Web Speech API —— 具體來說是 SpeechSynthesis 介面,它會為每一段文字包裝一個 SpeechSynthesisUtterance。瀏覽器會把每個 utterance 交給作業系統所提供的語音引擎,再由引擎透過你一般的輸出裝置回傳音訊,整個過程都不會離開你的電腦。
這其中最後一點最為關鍵。瀏覽器 TTS 完全在本地端執行:沒有雲端往返、不會留下錄製的聲音樣本、也不會在伺服器端建立任何人設。相對地,你的語音清單、語音品質、語言涵蓋範圍與發音特性,全都正是作業系統原本就提供的內容 —— 這也說明為什麼 Zentreya 直播的聲音,跟 Mac 上預設的瀏覽器語音聽起來像是兩個完全不同的世界。
文字轉語音工具採用的就是同一套機制。你的文字會先針對換行符與連續空白進行正規化處理,再切成每段不超過 220 個 UTF-16 字碼單元 (code unit) 的短 utterance,然後送進瀏覽器的本地佇列。長段落的文字會依序讀出,不會讓引擎過載,並且你可以隨時中斷。你聽到的,就是你裝置的語音在朗讀你的文字,就這樣。
如何用「文字轉語音」工具把任意文字大聲唸出來
操作流程刻意設計得很短。三個步驟幾乎就能涵蓋所有常見情境,從測試一句話聽起來的感覺,到一邊煮飯一邊聽完整份長稿都沒問題。
- 輸入或貼上你想讓瀏覽器朗讀的文字。直接在輸入區中輸入,或是複製任何一段文字 —— 不論是文章、腳本、歌詞或學習筆記 —— 上限為 20,000 個字元。
- 挑選可用的語音,視需要調整語速或音調,然後按下「朗讀」。下拉選單只會列出你目前裝置回報的語音。選好一個語音後,可以把語速滑桿從 0.5× 拖到 2.0× 之間;若想讓朗讀更低沉或更明亮,也可以把音調從 0.5 拖到 2.0 之間調整。
- 隨時使用暫停、繼續或停止。需要休息時按下暫停;繼續會從引擎大致停下的位置接著播放;停止則會立刻清空佇列。編輯文字或更改任何設定也會停止當下的朗讀,因此下次按下「朗讀」時會從頭開始。
這就是整個操作循環的全部內容。不需要安裝任何東西,朗讀出來的音訊就會在同一個瀏覽器分頁中,透過你一般的喇叭或耳機播出。
可調整的設定:語速、音調與語音
每一個你能調整的控制項都有明確的範圍。下方表格列出的是這個工具實際強制執行的驗證後界線 —— 而不是估算值或坊間觀察到的行為。
| 設定 | 範圍或行為 |
|---|---|
| 最大輸入長度 | 20,000 個 UTF-16 字碼單元;超過的輸入會直接被拒絕 |
| 每個 utterance 的分段大小 | 上限 220 個 UTF-16 字碼單元;優先以句子切分,其次子句、再來空格,最後才是硬性上限 |
| 語速滑桿 | 0.5×(慢)至 2.0×(快) |
| 音調滑桿 | 0.5(低)至 2.0(高) |
| 語音清單 | 僅列出本地瀏覽器與作業系統回報的語音;本工具不會下載任何東西 |
| 控制項 | 朗讀、暫停、繼續、停止 —— 暫停與繼續作用於頁面的全域語音佇列 |
| 處理位置 | 本地瀏覽器分頁;沒有上傳、沒有伺服器端語音、也不會產生音訊檔 |
| 可下載的輸出 | 標準化的瀏覽器語音介面並不支援 |
有幾項表格無法呈現的實用補充:
- 語音可用性因裝置而異。在已安裝「Karen」或「Daniel」加強包的 Mac 上看得到的語音,在一般 Windows 筆電或某支 Android 手機上很可能根本不存在。如果下拉選單是空的,代表你的瀏覽器沒有公開任何語音合成語音 —— 如需跨平台教學,請參考在 MacBook 上用 Chrome 或 Safari 使用文字轉語音。
- 語速與音調是由引擎自行解讀。這兩個值只是底層 SpeechSynthesisUtterance 上的控制項,並非實際量測的每秒字數或音樂音程。兩台不同裝置在「1.0× 語速」下讀同一段文字,聽起來可能會明顯不同。
- 分段機制對你來說是完全隱形的。切分器會優先選擇句子邊界,其次是子句、再來是空格,最後才會以 220 字碼單元的硬性上限切開。你不會看到分段結果,你的標點符號也絕對不會被改寫。
隱私、限制與這個工具做不到的事
隱私是最重要的核心特色。你的文字會先針對換行符與連續空白進行正規化處理,然後交給當前分頁中瀏覽器的本地語音介面。這個工具不會上傳、不會記錄、不會儲存、也不會把你的文字傳送到任何伺服器。編輯輸入內容或按下停止都會取消進行中的佇列,因此未完成的朗讀不會延續到下個工作階段繼續念下去。一個世代編號 (generation number) 會保護開始、結束與錯誤回呼,避免已停止朗讀所產生的延遲回呼覆蓋掉新一輪朗讀的狀態。
這個工具刻意保持定位單純。它不會產生可下載的 MP3 或 WAV,因為瀏覽器的語音 API 只提供播放控制,並不開放可攜的音訊緩衝。它不會作為螢幕閱讀器運作:沒有導航功能、不處理焦點、不發出語意公告、也沒有 live-region 更新。它無法轉錄音訊、複製 (clone) 人聲,也無法作為醫療、語言學習或無障礙合規用途的服務。若有必要的輔助需求,正確的工具應該是搭配平台無障礙設定、由專人持續維護的螢幕閱讀器。
在貼上內容前,先把以下硬性限制列入規畫:
- 超過 20,000 字元的輸入會直接被拒絕,不會默默截斷。
- 空白內容、空字元 (null character) 以及只有空白的輸入會在佇列啟動前就被拒絕。
- 語速與音調的數值若超出 0.5–2.0 的範圍會被拒絕;引擎只會收到經過驗證的值。
- 暫停與繼續作用於目前頁面的全域語音佇列,因此同一分頁上其他使用 Speech Synthesis API 的腳本可能會與該佇列互動。
- 如果瀏覽器在使用者操作之前拒絕播放音訊,或在執行階段拒絕某個語音,工具會回報播放錯誤,而不是假裝語音已順利播放完成。
如果你需要可重複使用的錄音、取得授權的商業語音、固定的發音字典、SSML 工作流程,或是可在不同機器之間重現的語音,那就要交給專門的語音合成服務。請務必詳閱該服務的隱私與授權條款,因為它在資料處理與音訊授權方面的取捨,與本地化的瀏覽器工具差異極大。
為什麼大家會把 Zentreya 的 TTS 拿來跟瀏覽器 TTS 比較
Zentreya 的設定與瀏覽器內的 TTS 小工具並非完全相同的流程 —— 她的語音是為現場直播調校的,執行於實際的直播軟體中,並搭配一套她多年來反覆打磨的專屬語音。兩者的共通點在於核心理念:輸入的文字會在不使用麥克風的情況下變成可聽見的語音,而輸出的特性完全取決於所選的語音。這樣的共同基礎,正是為什麼看過她的直播後,很容易浮現本文所回答的那個問題。
如果只是想快速試聽、進行校稿,或是單純想滿足一下對「在你自己的硬體上 TTS 聽起來如何」的好奇心,那麼一個瀏覽器工具就能涵蓋大多數休閒使用者的需求。打開文字轉語音工具,貼上本指南中的任何段落或你自己的筆記,按下「朗讀」,你就會聽到與驅動她直播的同一類系統 —— 只是少了那個龍娘人設、她的世界觀,以及背後的製作預算。