正確的剪音方法取決於四個實際因素:來源檔案的格式、剪輯邊界所需的精確度、來源是否能離開你的裝置,以及你想要輸出的格式。每個因素都會縮窄可用工具的範圍,而讓工具與因素相匹配,才能在不重新編碼的情況下產生可靠的結果。一個基於瀏覽器的 PCM16 WAV 剪輯工具(例如 Audio Cutter)適用於來源檔案留在本機、只需要一段連續剪輯,並且可接受未壓縮 WAV 的情境。桌面型數位音訊工作站則適用於你需要淡入淡出、多區段剪輯、標準化,或需要取樣精度的壓縮幀編輯的情境。
在實務上,「剪輯」涵蓋的範圍比字面上的意思更廣。它可能意味著從 Podcast 中去除無聲片段、從歌曲中擷取一段歌詞、切割訪談的精華片段、從較長的現場錄音中保存一個音效,或是製作一段簡報用短片。這些情境的處理方式各不相同。PCM 資料中的幀精確剪輯會對齊到特定的取樣位置,而在 MP3、AAC 或 Ogg 等壓縮格式中,剪輯通常必須落在接近幀邊界的位置,這就是為什麼有損編輯器經常會將剪輯點對齊到最近的有效解碼點。輸出同樣重要:WAV 保留每個未壓縮的取樣,而 MP3 則會以新的壓縮失真重新編碼該片段。選擇錯誤的組合會在邊界產生可聽見的爆音、遺失詮釋資料,或是產生一個意外過大的檔案。

「剪輯音訊」真正的含義
在嚴格的音訊工程意義上,剪輯音訊意味著在已解碼的取樣中定義起始幀與結束幀,並將這兩幀之間的片段寫成新檔案。結束幀不會被包含,以便剪輯點精準落在編輯器所選的邊界上。片段中的浮點取樣會被箝制到 −1 到 1 的 PCM 範圍內,帶正負號的 16 位元值以小端位元組順序寫入,並由一個 44 位元組的 RIFF/WAVE 標頭記錄格式。每個商用 WAV 剪輯工具,無論是在瀏覽器分頁中執行,或是作為桌面應用程式執行,在音訊解碼後都會執行同樣的機械化操作。
不同工具之間改變的,是圍繞這個核心操作的所有周邊細節。有些工具在伺服器上解碼、剪輯並重新編碼檔案,這會將來源上傳。有些工具使用 Web Audio API 在瀏覽器內執行,讓檔案保留在本機。有些工具透過在編解碼器幀邊界上修剪來保留原始壓縮編碼,有些則總是將片段重新編碼為未壓縮的 PCM。有些工具在剪輯前後提供淡入淡出、音量變更或標準化,有些則沒有。正是這些周邊選擇決定了哪種方法適合特定任務。
決策因素:格式、隱私、精確度與輸出
在挑選工具之前,四個問題通常就能決定選擇:
- 來源格式是什麼? WAV 或 FLAC 等無損來源可以在不損失品質的情況下剪輯並重新匯出。MP3 或 AAC 等有損來源已經缺少資訊;剪輯並重新編碼會產生第二代的壓縮。
- 來源可以被上傳嗎? 機密錄音、未發行音樂、語音備忘錄與授權素材不應離開裝置。本機瀏覽器工具或離線桌面工具是較安全的選擇。
- 邊界需要什麼樣的精確度? 在強拍上開始的 Podcast 開場只需要大致時間。需要當作取樣使用的鼓點則需要取樣精度的對齊。
- 目標用途預期什麼輸出格式? 影片編輯器與 DAW 通常預期是 WAV。通訊應用、鈴聲與網頁嵌入通常接受 MP3 或 AAC。
一旦回答這四個問題,可用工具的範圍就會大幅縮窄。結合「單一段落」、「需要本機處理」與「WAV 輸出」的任務,會直接指向基於瀏覽器的 PCM16 剪輯工具。結合「多段落、淡入淡出與詮釋資料保留」的任務,則會指向桌面編輯器。
基於瀏覽器的 PCM16 WAV 方法
瀏覽器音訊工具依賴 BaseAudioContext.decodeAudioData 方法將檔案轉成 AudioBuffer,也就是一個在記憶體中保存已解碼取樣的 JavaScript 物件。一旦解碼完成,工具會選取起始與結束時間,將這些時間四捨五入到解碼後取樣率的最近取樣幀,並將這些幀複製到一個新的交錯緩衝區。該緩衝區會編碼為 PCM16 WAV,並透過一個暫時的本機網址提供下載。沒有任何資料會被傳送到遠端伺服器。
Audio Cutter 完全遵循這個模式。頁面會驗證所選檔案名稱與位元組大小,呼叫 Web Audio 進行解碼,顯示解碼後的時長、取樣率、聲道數與幀數,以秒為單位接受起訖時間,將其對齊到取樣幀邊界,然後將該片段匯出為新編碼的 RIFF/WAVE 檔案。當進行新的剪輯或載入新檔案時,先前的結果會被清除,音訊內容會在解碼後關閉以釋放資源。由於每個步驟都在當前分頁中執行,來源檔案從不離開裝置。
如何使用 Audio Cutter 剪輯精確的時間範圍
- 在瀏覽器中開啟 Audio Cutter,並選擇頁面能夠解碼的檔案。檔案選擇器會比對常見的 MP3、WAV、M4A、AAC、Ogg、WebM 與 FLAC 檔名與 MIME 類型,且檔案大小必須為 25 MB 或更小。
- 等待 Web Audio 完成解碼。頁面接著會顯示解碼後的時長、取樣率、聲道數與總幀數。如果解碼器拒絕該檔案,會出現明確的解碼錯誤,且不會進行任何其他動作。
- 輸入以瞬間為單位的非負起始時間,以及稍後的結束時間。兩者都會四捨五入到解碼後取樣率的最近取樣幀,起始幀會被包含,結束幀則不會。四捨五入後不足一個幀的選取範圍會被拒絕。
- 選擇剪輯並匯出為 WAV 的選項。頁面會在下載開始前回報輸出的時長與最終檔案大小。
- 預覽 PCM16 結果,確認兩個邊界的口語字詞或音樂瞬態,然後下載 WAV。當新的剪輯取代先前結果,或載入新檔案時,先前的結果及其下載網址會被釋放。
因為頁面上顯示的可視時長與實際剪輯都是由同一個幀範圍計算出來,你所輸入的時間會與預覽中聽到的時間一致。這種一致性正是生產環境匯出工具與預覽共用同一個幀範圍函式,而不是使用獨立計時器估算的主要原因。
限制、取捨與何時應選擇其他方法
Audio Cutter 設有四個明確的解碼限制,決定檔案是否能夠被處理。編碼後的輸入檔案必須為 25 MB 或更小、解碼後的音訊必須為 15 分鐘或更短、聲道數不得超過 8 個、取樣率不得超過 192 kHz。一個合計 3000 萬聲道取樣的預算會限制所有聲道的總解碼大小。較高的取樣率或多聲道檔案可能會在達到 15 分鐘時長限制前就先撞上 3000 萬取樣的限制,頁面會拒絕超出限制的檔案,而不是將其截斷。
另外兩個取捨來自 PCM16 WAV 的輸出。首先,原始的 MP3、AAC、Vorbis、Opus 或 FLAC 編碼不會在下載檔案中保留;每個結果都是新編碼的未壓縮檔案,不會繼承任何標籤、專輯封面、提示點、章節、響度詮釋資料或編碼器設定。其次,由於 PCM WAV 為每個聲道的每個取樣儲存兩個位元組,加上 44 位元組的標頭,輸出檔案可能會比來源大上許多。48 kHz 的 10 秒立體聲選取範圍會產生大約 1.92 MB 的音訊資料;而同一段來自 128 kbps MP3 來源的選取範圍則接近 160 KB。之後再將 WAV 重新編碼為 MP3 是另一個獨立步驟。
該工具也不提供淡入淡出、音量變更、標準化、音高偏移、重取樣控制或降噪功能。如果任務需要這些功能,專用的桌面編輯器才是正確的選擇。同樣地,如果任務需要將多個不連續的範圍拼接在一起,Audio Joiner 會從已經剪輯好的片段產生單一 WAV,而不是嘗試在同一個工具中進行多次剪輯。
依情境選擇
下表將常見任務對應到處理起來最可靠的方法。第三列與第四列中的數值限制是 Audio Cutter 的文件規範,而非估算值。
| 情境 | 最佳方法 | 為何合適 |
|---|---|---|
| 從本機檔案剪輯單一段落,可接受 WAV 輸出 | 基於瀏覽器的 PCM16 WAV 剪輯工具 | 解碼、幀選取與編碼全部在分頁內執行;無需上傳 |
| 從同一來源剪輯多個不連續範圍 | 桌面編輯器,或剪輯兩次後使用 Audio Joiner 合併 | 瀏覽器剪輯工具每次操作只輸出一個範圍 |
| 來源達到或超過 25 MB、15 分鐘、8 聲道、192 kHz,或 3000 萬聲道取樣 | 桌面編輯器或命令列工具 | Audio Cutter 會以訊息拒絕超出限制的檔案,而不是截斷 |
| 輸出必須保留 MP3 或 AAC 等壓縮編解碼器 | 先剪輯為 WAV,再於第二步重新編碼為 MP3 或 AAC | 瀏覽器剪輯工具不會保留來源編解碼器 |
| 基於隱私或授權原因,來源不能離開裝置 | 本機瀏覽器剪輯工具或離線桌面工具 | 檔案讀取、解碼、幀選取與編碼都在當前分頁中進行 |
驗證剪輯並保護你的來源
可靠的剪輯是經過驗證的剪輯。在 WAV 產生後,聆聽兩個邊界的前後半秒。起始處應落在預期的字詞、拍點或瞬態上,結束處則不應切斷持續音的尾音或錄音的空間殘響。如果邊界聽起來不對,輸入稍早的起始或稍晚的結束時間,重新產生 WAV,然後再聽一次。由於下一次剪輯時,先前的下載會被取代,其本機網址也會被釋放,重複這個循環的成本很低。
在新的 WAV 確認無誤之前,請保留原始來源檔案。當新檔案被載入或分頁關閉時,基於瀏覽器的剪輯工具會覆寫工作緩衝區與暫時下載網址,因此唯一能跨工作階段存活的副本就是磁碟上的檔案。如果是淡入淡出、無損壓縮幀剪輯、詮釋資料保留或母帶製作,應將工作交給專用編輯器,而不是將單一功能的瀏覽器工具推到其設計極限之外。一開始就選對方法,比從糟糕的剪輯中挽救要快得多。
如需更深入的瞭解,請參閱 比較剪輯音訊的方法並選擇正確的方式。
如需更深入的瞭解,請參閱 我該如何判斷是否需要剪輯音訊。