在瀏覽器中剪輯音訊從三個動作開始:選擇一個瀏覽器可以解碼的檔案、輸入兩個以秒為單位的時間標記,以及點擊一個按鈕將選取的範圍匯出為未壓縮的 WAV。整個過程都在本機執行,因此來源檔案和裁剪後的結果永遠不會離開你目前的分頁,沒有上傳步驟,也不涉及任何轉檔伺服器。新手常常以為剪輯需要安裝桌面編輯器或建立帳號,但一次性裁剪最務實的做法是開啟一個瀏覽器頁面、將它指向一個本機音訊檔,並在裁剪前先讀取工具所顯示的解碼時長、採樣率、聲道數與幀數。一旦這些數字顯示出來,裁剪本身只剩下輸入起始時間與結束時間,並確認結束時間晚於起始時間且不超過精確的解碼時長。讓新手操作順利與挫折連連的差異,通常就在於按下裁剪按鈕之前先檢查格式支援與大小限制。

開始剪輯音訊實際上代表什麼
需要剪輯音訊的人通常只有一個目標:保留較長檔案中的某一段,把其餘部分丟掉。原因多半很小且務實,例如手機錄音收進了背景雜訊、一首歌裡只有副歌很重要、要傳給同事的一段播客片段,或是必須配合影片時間軸的一段剪輯。剪輯是音訊編輯最簡單的形式,因為它不會改變音高、加入效果、標準化音量,或重新混音聲道。它只是選取一段連續的樣本,並將該範圍寫入新檔。
新手覺得起步不確定的原因是,音訊工具分成兩個截然不同的世界。Audacity、Adobe Audition 或 GarageBand 等桌面編輯器是在本機安裝並以波形檢視操作。瀏覽器內的工具處理相同的樣本資料,但完全不需要安裝任何東西,並在當前頁面上執行完整的解碼與編碼迴圈。對於已知起訖時間的一次性裁剪,瀏覽器內的路徑通常更快,因為沒有安裝步驟、沒有帳號,也不用上傳來源檔案。音訊剪輯工具頁面正是為這個任務而設計:選擇一個檔案、讀取解碼後的數字、設定兩個時間標記,然後匯出 WAV。
開啟工具前要確認的三件事
在開啟任何瀏覽器型剪輯工具之前,三項檢查能節省時間並避免中途出錯:
- 檔案是你的瀏覽器可以解碼的。檔案選擇器辨識常見的 MP3、WAV、M4A、AAC、Ogg、WebM 和 FLAC 副檔名與 MIME 類型,但實際解碼取決於目前瀏覽器內建的編解碼器。Safari、Chrome、Firefox 與不同的作業系統搭載不同的解碼器組合,因此在 Firefox 能解碼的 Ogg 或 FLAC 檔案,在 Safari 中可能無法解碼。標示錯誤、加密或損壞的檔案會產生明確的解碼錯誤,而非靜默失敗,而且該工具不會安裝編解碼器、不會將檔案送到轉檔伺服器,也不會替代其他來源。
- 編碼後的檔案大小不超過 25 MB。瀏覽器會在解碼開始前拒絕任何更大的檔案。以低位元率編碼的長播客通常最容易保持在這個限制內,而高位元率的音樂檔案和長的無損音軌則更容易超過。
- 解碼後的音訊保持在工作限制之內。解碼後,工具會檢查 15 分鐘的時長、八個聲道、192 kHz 的採樣率,以及所有聲道合計 3000 萬個樣本。高採樣率或多聲道檔案可能會在到達時長上限之前就觸及樣本上限,因為樣本數會乘上所有聲道。不會自動縮短任何內容,因此超過上限的檔案會以訊息提示被拒,而不是被截斷。
對於想深入了解這些檢查隱私面的讀者,關於在瀏覽器內裁剪時音訊檔案是否會被上傳的指南詳細介紹了純本機處理的模式。
用三個步驟在瀏覽器中剪輯音訊
裁剪本身很短。打開頁面並選擇檔案後,剩下的就只有三個動作。
- 選擇瀏覽器可解碼的音訊檔案。點擊檔案選擇器,從你的裝置中選取一個音訊檔。保持在 25 MB 的編碼檔案限制內,並優先選擇你目前瀏覽器確實能解碼的格式。請等待頁面顯示解碼時長、採樣率、聲道數與幀數後再繼續。這些數字描述的是解碼後的工作緩衝區,未必是來源檔案的編碼率。
- 輸入起始時間與結束時間。起始必須是非負數,且必須早於結束。結束必須晚於起始,且不得超過頁面上顯示的精確解碼時長。兩個值都會四捨五入到 AudioBuffer 採樣率下最近的解碼樣本幀邊界,起始幀會被包含,結束幀不會被包含,而四捨五入後少於一整幀的選取會被拒絕,不會產生空白檔。
- 選擇「剪輯並匯出 WAV」、預覽,然後下載。點擊剪輯動作。頁面會從選定的幀範圍編碼一個新的 RIFF/WAVE 檔,顯示輸出時長與檔案大小,播放結果,並提供下載。變更任一時間欄位會清除先前的 WAV 並釋放先前的下載 URL;選擇另一個檔案則會清除舊的解碼緩衝區、播放器、錯誤訊息與結果。
剪輯邊界是如何計算的
該工具不是依據可見的波形猜測或以牆上時鐘計時來裁剪。它會使用解碼後的 AudioBuffer 採樣率,將起始與結束秒數轉換成最近的幀索引,包含起始幀、排除結束幀。生產環境的匯出器和獨立的測試共用同一個幀範圍函式,因此裁剪後顯示的時長等於選定的幀數除以解碼後的採樣率,而不是某個無關的計時器估算值。
Web Audio 在解碼時可能會將來源重新取樣至 AudioContext 的採樣率,這代表顯示的採樣率描述的是解碼後的工作緩衝區與匯出的 WAV,未必是來源檔案的編碼率。一個 48 kHz 的 FLAC 在 44.1 kHz 的 AudioContext 中解碼後會變成 44.1 kHz 的緩衝區,而裁剪後的 WAV 會繼承這個 44.1 kHz 的採樣率。關於 AudioBuffer 以及 decodeAudioData 的音訊文件說明了緩衝區物件如何回報採樣率,以及重新取樣如何在解碼過程中發生。
浮點的 Web Audio 樣本會在編碼前被箝制在 -1 到 1 的 PCM 範圍內。負的最大值在 WAV 中會變成 -32768,正的最大值會變成 32767,非有限值會被寫成靜音。多個聲道保持獨立,並依其原始聲道順序交錯排列,因此立體聲來源在最多八個聲道的工作限制內會維持立體聲。
WAV 下載檔案實際包含什麼
每次下載都是一個新編碼的檔案,而非原始檔案的一段切片。輸出永遠是 RIFF/WAVE 容器,格式代碼 1(PCM)、使用解碼緩衝區的聲道數與採樣率、每樣本 16 位元、小端序帶正負號整數樣本,以及一個 44 位元組的標頭,後接音訊資料。這對首次使用者帶來三個可預期的結果:
- 原始的壓縮編碼消失了。MP3、AAC、Ogg、WebM 或 FLAC 來源會變成未壓縮的 PCM16 WAV。標記、專輯封面、提示點、章節、音量元資料與編碼器設定都不會保留。
- 輸出可能比來源大很多。PCM16 WAV 每個聲道每幀儲存 2 個位元組,再加上 44 位元組的標頭。一段 60 秒、以 44.1 kHz 解碼採樣率的立體聲剪輯會產生 60 × 44,100 × 2 聲道 × 2 位元組 = 10,584,000 位元組的音訊資料,加上標頭 44 位元組,總計 10,584,044 位元組(約 10.1 MB)。
- 聲道配置會被保留。立體聲來源會維持立體聲,更多聲道的來源在最多八個聲道的限制內也會保留其聲道數。播放軟體必須支援最終的聲道配置。
為了清楚比較,下表顯示輸入的處理方式與你可以預期的輸出。
| 屬性 | 輸入檔案 | 輸出 WAV |
|---|---|---|
| 編碼 | 瀏覽器可解碼時為壓縮格式(MP3、AAC、Ogg、WebM、FLAC 等) | 未壓縮 PCM16、小端序、帶正負號 |
| 容器 | 來源容器與編解碼器 | RIFF/WAVE,格式代碼 1 |
| 採樣率 | 來源編碼率(不會直接使用) | 經任何 Web Audio 重新取樣後的解碼緩衝區採樣率 |
| 聲道 | 最多 8(解碼後) | 與解碼後相同,最多 8 |
| 元資料 | 標記、專輯封面、章節、提示點 | 不保留任何資料 |
| 檔案大小 | 取決於編解碼器與位元率 | 幀數 × 聲道數 × 2 位元組 + 44 位元組標頭 |
在使用檔案前先驗證裁剪結果
因為 WAV 是根據幀索引而非可見波形建立的,在將其視為最終結果前值得先預覽。頁面會透過同一個瀏覽器分頁播放編碼後的 WAV,這讓你容易聆聽起始與結束邊界的實際內容。如果目的是擷取口說詞彙,請確認第一個音節落在選取範圍內。如果剪輯目標是音樂的暫態,請確認重拍或音的起始點在兩側都沒有被截掉。
頁面在下載前也會顯示輸出時長與檔案大小,作為對你所輸入時間標記的健全性檢查。顯示的輸出時長與依起訖時間隱含的時長之間出現落差,代表幀的四捨五入將邊界向內推進,裁剪結果仍然有效但會略短於你輸入的數字。音訊情境(AudioContext)會在解碼後以及清理過程中被關閉,進行中的讀取與解碼作業也會受到保護,因此較舊的工作無法覆蓋較新的選取。關於此檢查的逐步作法,在瀏覽器內裁剪後驗證結果的指南會逐步說明相同的邊界檢查。
當瀏覽器剪輯不夠用時
瀏覽器剪輯會產生乾淨、影格精準的 WAV,沒有淡入淡出也沒有元資料,這對大多數一次性任務來說是合適的形狀。但在少數情況下,專用的編輯器才是更好的工具:剪輯需要淡入、淡出或交叉淡化,以避免交界處產生爆音;輸出必須保留來源的 ID3 標籤、專輯封面或章節標記;剪輯必須在不重新編碼的情況下,於壓縮容器內部完成,這和取樣精準的 PCM 重新匯出是不同的操作;音訊在裁切之後需要降噪、EQ、 normalization 或母帶處理;來源超過 25 MB 檔案上限或 15 分鐘解碼長度,此時工具會直接拒絕,而不是截斷它。
在上述所有情況下,保留原始檔案是最安全的做法:瀏覽器剪輯可以做為快速的第一刀,再由桌面編輯器後續細修。若要確保品質,請預覽剪輯後的 WAV,確認兩端邊界的口語字句或音樂暫態,保留原始檔案,並在任務需要波形層級的淡入淡出、無損壓縮影格剪輯、元資料保留,或是專業母帶處理時,改用專用編輯器。