CapCut 的文字轉語音功能可將螢幕上的字幕轉為口述旁白,而讓這些旁白聽起來正確的最快方法,就是先在瀏覽器型的文字轉語音工具中撰寫並預覽。CapCut 在文字元素上提供內建文字轉語音選項,但大多數編輯器只會在你把文字加入軌道後才顯示語音清單,因此在正式加入前先排練冗長腳本會額外耗時。一個獨立的瀏覽器工具,可支援最多 20,000 個字元、語速從 0.5× 到 2.0× 可調、音調從 0.5 到 2.0 可調,並具備明確的暫停、繼續和停止按鈕,讓你在打開 CapCut 之前就能排練整份腳本、挑出發音錯誤,並精準判斷哪些句子該放進時間軸。把瀏覽器階段視為排練步驟,能讓你的 CapCut 時間軸保持整潔,避免因為某個字念起來不對而重新算繪片段。最重要的是,排練完全在你的瀏覽器分頁中本機執行,因此未公開的腳本和客戶草稿在反覆修改時都能保持隱私。

為什麼要在獨立的瀏覽器工具中預覽你的腳本
CapCut 最佳化的是剪輯,而不是冗長旁白的排練。行動版和桌面版編輯器都預期你直接在文字元素中輸入、挑選語音,然後接受引擎回傳的結果。對五秒鐘的字幕來說沒問題,但六十秒的配音很快就會浮現問題:名字發音怪怪的、句子在錯誤的地方斷氣、笑點需要特定節奏。這些問題在片段算繪之前都無法在螢幕上察覺,而每一個問題都代表要重新算繪或手動修補。
專用的瀏覽器文字轉語音朗讀工具提供專為腳本本身設計的工作環境,而不是為時間軸設計。你可以貼上完整的配音、從頭聽到尾、跳回某個彆扭的句子,並重寫用字直到節奏到位。由於語音透過瀏覽器引擎在本機執行,當你把文字貼回 CapCut 時,在 CapCut 語音資料庫中聽起來仍會是熟悉的。預覽只是排練,不是最終匯出,而你的腳本從不離開目前的瀏覽器分頁。
在瀏覽器中撰寫並預覽你的配音
這是使用 Text To Speech 頁面的核心排練工作流程。對每一份你打算放進 CapCut 的腳本,請依序執行下列步驟,並讓瀏覽器分頁與 CapCut 專案同時開啟,這樣你就能在排練和剪輯之間快速切換。
- 在目前的瀏覽器分頁中開啟 Text To Speech 頁面。
- 將你的完整 CapCut 配音腳本貼到文字區,最多可達 20,000 字元的上限。標點符號請完全依照你預計在螢幕上呈現的方式保留,因為瀏覽器引擎會照你所輸入的內容朗讀。
- 從下拉選單挑選一個可用的系統語音。語音名稱、語言和品質會因作業系統和瀏覽器而異,請選擇符合你受眾預期地域口音的語音。
- 把語速和音調滑桿設為你的目標值。語速範圍從 0.5× 到 2.0×,音調範圍從 0.5 到 2.0。如果你鎖定的是過去用過的 CapCut 語音,請把滑桿值對齊到該語音當時呈現的效果。
- 按下「朗讀」並從頭到尾聽完全部草稿,過程中不要碰觸頁面。文字會在內部切分為不超過 220 個 UTF-16 程式碼單位的區塊,確保引擎不會在長段落上卡住。
- 使用「暫停」停在某個彆扭的句子、即時修改措辭,再按「繼續」接著唸。修改文字或任何控制項都會停止正在進行的朗讀,因此過時的摘要無法瞞騙你、告訴你引擎剛才唸了什麼。
- 當你想放棄這次朗讀、從頭開始時,請按「停止」;或更換語音或音調後再按一次「朗讀」,聽聽新的設定。
- 當排練的成果聽起來滿意時,從文字區複製最終文字,留待 CapCut 使用。
按下「朗讀」會取消這個小工具先前建立的所有舊有佇列,而一個世代編號能防止過時的回呼覆蓋較新執行的顯示狀態。當你快速反覆修改時,這個細節很重要:你看到的永遠是最近一次朗讀嘗試的誠實反映,而不是先前朗讀留下的殘影。卸載小工具也會取消其佇列中的語音,因此關閉分頁是立即停止所有動作的安全方式。
將修訂完成的腳本加入 CapCut 的文字轉語音
瀏覽器排練只有在修訂後的腳本乾淨地進入 CapCut 自身的文字轉語音引擎時才真正發揮價值。請使用下列步驟作為從瀏覽器分頁銜接到 CapCut 時間軸的橋樑。
- 在行動版或桌面版開啟 CapCut,並載入你正在準備的時間軸,或開始新專案。
- 在旁白應出現的位置將「文字」元素加入時間軸。拖曳片段的持續時間以符合預期的配音長度,長度請以秒而非字元為單位來衡量。
- 開啟該文字圖層上的「文字轉語音」選項。CapCut 此時才會顯示其語音清單,與排練時使用的瀏覽器語音分開。
- 將排練過的腳本貼進 CapCut 的文字輸入框。用字必須與瀏覽器中聽起來滿意的版本完全一致,包含標點符號,因為兩個引擎都會將其解讀為停頓與強調的提示。
- 挑選一個 CapCut 語音。盡量對應到你排練時用的系統語音,或挑一個口音和音色接近你預覽效果的 CapCut 語音。
- 產生語音後,在片段上拖動播放頭,逐句聆聽是否仍有不順的地方。如果某句聽起來怪怪的,請先回到排練來源修改該句、在瀏覽器中重播,確認後再去更新 CapCut 中的文字。
- 微調片段的入點和出點,讓旁白與剪輯對齊,並重新算繪受影響的區段。
瀏覽器排練步驟並不會取代 CapCut 自身的產生步驟,但能消除意外。當你按下 CapCut 的「產生」時,每個彆扭的字都已經在更快速的本機預覽中修正過,剩下的唯一未知數就是 CapCut 語音本身的確切特性。
對應 CapCut 語音的語速與音調設定
瀏覽器工具以直接的數值呈現語速和音調,而 CapCut 內建語音則提供具名預設,例如 Normal、Fast、Lively 和 Energetic。兩者之間的對應是近似的,下表所記錄的是定性關係,而非保證可用的轉換。請利用瀏覽器排練,確認所選數值對你的受眾聽起來合適,再決定採用哪個 CapCut 預設。
| 瀏覽器語速值 | 大致感受 | 優先嘗試的 CapCut 預設 |
|---|---|---|
| 0.5× 到 0.75× | 緩慢、刻意,適用於教學和冥想場景 | Slow 或可用的 "Calm" 風格 |
| 1.0× | 預設節奏,符合一般對話速度 | Normal 或預設語音 |
| 1.25× 到 1.5× | 明快、充滿活力,常見於社群媒體開場 | Fast 或 "Lively" |
| 1.75× 到 2.0× | 高速,適合重點回顧片段和預告 | 所選語音中可用的最快預設 |
音調的運作原則相同。將音調設為 1.0 會保留系統語音原貌。1.0 以下的數值會讓感知到的聲音變低,適合旁白角色;1.0 以上則會提高聲音,適合角色對白。不同的語音引擎對這些數值的解讀方式不同,因此排練階段才能告訴你某個數值聽起來是否合適,而不是靠任何單一數字保證。
在進入 CapCut 之前要先抓出的撰稿錯誤
大多數 CapCut 配音重新算繪的成因,都是在排練時就看得到、但輸入時容易忽略的問題。在瀏覽器中預覽時,請特別留意以下幾點。
- 數字與日期:「2025」會依引擎不同被讀成「two thousand and twenty-five」或「twenty twenty-five」。凡是必須以特定方式讀出的內容,請拼寫出來。
- 縮寫:「AI」、「API」和「DIY」可能被讀成字母,也可能被讀成單字。若錯誤的讀法會讓受眾感到困惑,請將縮寫改為完整詞彙。
- 標點提示:過長的破折號或缺少句號,都會改變停頓長度。如果 CapCut 中的句子聽起來太趕,通常就是腳本中的標點出了問題。
- 同音異義詞:像「read」(現在式和過去式)和「lead」(金屬和引導)這類字,在瀏覽器預覽中聽起來相同,但螢幕上意思不同。請確認周圍的字幕也能讓意義清楚。
- 過長且未中斷的詞元:網址、hashtag 和序號可能會讓引擎卡住或讀得很怪。請用空白或連字號中斷,或改用一般文字描述。
瀏覽器預覽不足的情境
有些 CapCut 專案僅靠瀏覽器排練只能完成一部分。當你需要授權的商用語音、固定的發音字典、SSML 標籤,或跨機器可重現的語音時,瀏覽器工具狹隘且本機的範疇就不是合適的選擇。Lizely 工具刻意保持本機執行:它不會上傳文字、不提供伺服器語音、不提供可下載的 MP3 或 WAV,也無法保證跨裝置播放完全一致。針對這類專案,請在啟動 CapCut 時間軸之前改用專用的合成服務。
至於其他所有情境,包括草稿、節奏檢查、單段發音測試,以及針對你打算貼進 CapCut 的精確腳本進行排練,瀏覽器階段都是在錯誤造成算繪成本之前抓出它們最便宜的方式。將它與 CapCut 自身的文字轉語音選項搭配使用,你就能同時擁有本機預覽的速度,以及 CapCut 語音資料庫的精緻表現。
如需更深入的說明,請參閱 How to Use Text to Speech on Android in a Browser。