影片轉音訊的轉換過程,是將影片檔案中的聲音獨立取出,並儲存成一個可以獨立播放、編輯或另行使用的音軌,不必再依賴影像。大多數現代影片其實是兩股串流打包在一起 —— 一股是影像畫面,另一股是聲音 —— 因此只要只需要聲音時,分離聲音就是一件例行工作。人們把影片轉成音訊,是為了將訪談片段重複使用於 podcast、從錄製的演出中保存一首歌曲、為專案擷取環境音、將口說簡報封存起來,或從自己擁有的影像素材中拉出一段乾淨的參考音軌。像 MP4、MOV 和 WebM 這類容器格式,本身就把影像與聲音分別存放在同一個檔案中的不同音軌上,這也是為什麼擷取通常可以在不重新錄製真實世界聲音的情況下完成。一個能在當前分頁中解碼檔案、並只錄製音軌的本機瀏覽器工具,就能在不上傳任何來源檔案的情況下完成這種分離。

為何要把影片轉成音訊:實際理由與限制
動機之所以重要,是因為輸出格式與品質的選擇,應該符合你當初決定轉檔的理由。從 podcast 片頭拉一段、把講座存成離線收聽、從家中演出中挑出一段吉他 riff,或從螢幕錄影中擷取一段乾淨的語音備忘錄,全都落在同一個光譜上 —— 你手上有一段影片,但只需要其中被錄下的內容。影片轉音訊轉換器正是為這種情境所設計:你已經擁有的短片,在本機處理,讓來源檔案從不離開瀏覽器分頁。
最常出現的理由有六個:
- 將語音重新用作音訊。訪談、簡報、講道、講座和網路研討會常常藏在影片檔中,難以分享。光是要分享的音訊本身,在即時通訊應用、podcast 摘要和電子郵件附件中傳遞起來就方便得多。
- 保存一首歌曲或一段演出。當某一首歌曲只存在於排練、直播隨選 (VOD) 或螢幕錄影中時,把音訊抽出來,你就能得到一個真正可在音樂資料庫中播放的檔案。
- 擷取環境音或擬音。用攝影機錄下的背景氛圍、室內底噪或自然聲音,獨立成音訊檔後會比作為影片檔的一部分實用得多。
- 建立參考音軌。剪輯師和製作人有時會從粗混的影片中拉出單一人聲或樂器聲部,用來與新的錄音做比較。
- 縮減檔案大小以便分享。純音訊檔會比它們原本來自的影片小非常多,在儲存空間或頻寬吃緊時特別重要。
- 封存語音備忘。用相機快速錄下的備忘錄容易錄,但不容易搜尋;把它們轉成音訊後,就能用任何音訊應用播放。
瀏覽器如何將聲音與影像分離
瀏覽器式擷取的運作方式不同於桌面型轉檔工具,後者可以直接複製原始壓縮音訊封包。當你在分頁中開啟本機影片時,瀏覽器會將影像與音訊分別解碼成獨立的媒體軌。根據 MDN 對於 HTMLMediaElement.captureStream 的參考資料,媒體元素會公開一個即時的 MediaStream,其中可以包含音軌、影軌,或兩者皆有。瀏覽器工具接著可以建立一個只包含音訊的新 MediaStream,將它交給一個設定為 Opus WebM 容器的 MediaRecorder,然後從零秒開始播放原本的媒體元素,同時讓錄製器即時擷取已解碼的音訊。
這就是為什麼擷取出來的音訊,並不是原始音訊封包的逐位元複製。MP4 內部壓縮的音訊本來可能是 AAC;瀏覽器在播放過程中會將它解碼為未壓縮的取樣,錄製器再將這些取樣重新編碼為 WebM 容器中的 Opus。因此,品質與檔案大小取決於錄製器的位元率,而非來源音訊的壓縮設定。
在瀏覽器中從本機影片擷取音訊
本機擷取的端對端流程很短,但每一步都很重要,因為每一步都是下一步的輸入。
- 選擇一個含音軌且受支援的本機影片。可接受的容器格式為 MP4、WebM、MOV、M4V 或 Ogg,且檔案大小不得超過 500 MiB。請先確認該影片片段確實含有音訊 —— 輸出為靜音代表來源本來就沒有音軌。
- 選擇「擷取音訊」並在影片以即時方式處理期間保持分頁開啟。瀏覽器會播放媒體元素,同時 MediaRecorder 擷取公開的音軌,所以執行時間會等同於影片長度。
- 檢查工具回報的長度與檔案大小,然後下載 Opus WebM 音訊檔。所回報的長度來自一個 Segment Info patch,可讓相容的播放器顯示一個有限的時間軸,而不是出現「未知長度」的標示。
擷取進行期間,畫面上的預覽會被靜音,以避免瀏覽器重複播放聲音。被錄製的串流仍會收到音訊,因為 MediaRecorder 是連接到被擷取的 MediaStream,而不是連接到喇叭。工具也提供一個取消控制項,可以在不產生半成品檔案的情況下停止目前的工作。
輸出檔案實際上是什麼
瀏覽器式擷取的結果,是一個帶有單一 Opus 音軌的 WebM 容器,而非 MP3、WAV、AAC 或 FLAC。當瀏覽器支援時,錄製會使用 128 kbps 的 Opus WebM MIME 類型。這個選擇會帶來幾個值得在採用輸出前先了解的實際影響。
- 編碼器改變。如果來源音訊原本是 MP4 內的 AAC,新檔案將會是 WebM 內的 Opus。大多數現代播放器都能處理 WebM 中的 Opus,但較舊的裝置和某些專業工作流程可能無法支援。
- 重新編碼的品質。因為音訊會經過解碼再重新編碼,可能會產生非常細微的品質差異。128 kbps 的 Opus 音軌在語音方面普遍被認為是透明的,對音樂也可接受,但它並不是原始壓縮串流的無損複製。
- 檔案大小。一分鐘的片段通常落在數百 KB 到大約 1 MB 之間,遠小於原始影片,但仍大於逐位元精確複製串流時的大小。
- 中繼資料。WebM 容器會被打上測量到的媒體長度補丁,讓相容的播放器回報有限的時間軸。來源影片中的標籤、章節、內嵌封面與歌詞都不會保留。
想更全面地了解實際擷取結果的樣貌,請參考指南 轉換影片為音訊時可以預期什麼結果,其中會更詳細地說明典型的數字。
需要知道的限制與失敗情況
瀏覽器式轉檔工具無法接受所有影片。工具會拒絕超過其硬性上限、或瀏覽器無法解碼的輸入,並會顯示明確訊息後停止,而不是產出損壞的檔案。事先了解這些限制,可以省下一次徒勞的嘗試。
| 限制 | 數值 | 存在的原因 |
|---|---|---|
| 檔案大小 | 最多 500 MiB | 限制瀏覽器在解碼時必須持有的記憶體 |
| 解碼後的長度 | 最多 5 分鐘 | 讓播放與錄製的工作階段短到能在同一分頁中完成 |
| 畫面較長的一邊 | 最多 4096 像素 | 限制解碼後的影像記憶體與每幀處理成本 |
| 總像素面積 | 最多 3840 × 2160 | 攔截那些會繞過邊長限制的超寬或堆疊解析度 |
| 音軌 | 至少需要一條 | 靜音檔案毫無用處,因此工具會明確失敗 |
| 輸出編碼器 | WebM 中的 Opus,128 kbps | 使用瀏覽器內建的 MediaRecorder,不額外增加媒體相依性 |
有兩個真實世界的失敗模式值得特別提出。第一,檔案副檔名只能識別容器,容器內部的編解碼器仍須受瀏覽器支援。含有特殊影像編解碼器的「.mp4」檔案仍可能無法解碼。第二,Safari 與部分其他瀏覽器並未公開 captureStream 或相容的 MediaRecorder 格式,因此即使檔案本身能解碼,工具也無法在那些瀏覽器中執行。解碼錯誤、不受支援的錄製器、空的輸出、無效的長度、超過限制的尺寸,以及被取消的工作,都會以明確訊息呈現,而不是以靜默失敗收場。
什麼時候瀏覽器工具是正確的選擇
當來源是你已擁有的短片、輸出可以接受 WebM 中的 Opus,且希望檔案保留在本機時,瀏覽器式擷取是相當合適的選擇。但對於長錄音、無損的製作工作、多聲道保存、精確剪輯,或成品必須是特定編解碼器 (例如 MP3 或 WAV) 時,它就不適合。在這些情況下,使用具有明確匯出設定的專用桌面音訊編輯器會是更安全的做法。
無論採用哪種方式,都適用兩條使用規則。只能從你擁有或有重複使用權的內容中擷取音訊,因為轉檔行為本身並不會改變底層著作權的歸屬。也不要期待瀏覽器工具能繞過 DRM、平台存取控制、受保護的串流、遠端 URL 或著作權限制 —— 該工具只處理本機檔案,並明確不承諾能突破這些保護機制。
對於大多數人們把影片轉成音訊的日常理由 —— 儲存一段訪談、挑出一首歌、封存一場講座、擷取環境音 —— 本機瀏覽器的路徑是取得乾淨音訊檔最快速的方式,不必安裝軟體,也不用上傳來源。選好影片、在分頁中執行擷取,錄製完成後下載產生的 WebM 音訊即可。
延伸閱讀:何時應該使用影片裁切:觸發條件與限制。