規劃合併音訊所需的步驟意味著在點擊任何按鈕之前,先描繪出四個簡短的階段——收集並驗證輸入、在瀏覽器中解碼、設定播放順序、然後編碼結果。整個合併流程會在本機的分頁中執行,透過一個共享的 AudioContext 解碼 2 到 10 個常見的音訊檔案,並產生一個無縫的 PCM16 WAV 檔案供你下載。由於合併是直接的,曲目之間不會插入淡入淡出、靜音、重疊、標準化、過場或自動裁剪,因此你在螢幕上看到的順序也就是輸出後保留的順序。花十分鐘規劃工作流程,可以避免幾乎所有錯誤:檔案大小不符、聲道不符、不支援的編解碼器,以及下載的 WAV 與預期順序不一致。下方流程會逐步說明每個階段要檢查什麼、確認什麼,以及預期會發生什麼,最後再以 Audio Joiner 進行逐步示範。

規劃音訊合併實際涵蓋哪些內容
規劃音訊合併不只是一份待辦清單——它是你的來源檔案與合併工具嚴格的解碼與編碼規則之間的契約。規劃應該在開始前回答四個問題:要合併哪些檔案、它們是否都能在同一規則下解碼、應以什麼順序出現,以及輸出應該長什麼樣子。
Audio Joiner 會將 2 到 10 個可在瀏覽器解碼的音訊檔案合併成一個本機 WAV,無需上傳任何東西。因此規劃完全存在於你的分頁中:你選擇的檔案、安排的順序、瀏覽器產生的解碼 PCM 樣本,以及下載的 WAV,全都來自從未離開過你裝置的資料。了解這一點後,你就能依據可見的限制(而非臆測)建立規劃檢查清單。
下方四個階段涵蓋了規劃時的決策。第五節是實際的執行順序;第六節說明預期輸出;最後一節則涵蓋規劃應指向其他工具的情況,例如當你只需要時間範圍而非完整曲目時,可使用 Audio Cutter。
階段 1:收集並驗證你的來源檔案
首先收集你打算合併的檔案,並依三項限制檢查每個檔案:數量、單檔大小與總大小。合併工具一次選擇可接受 2 到 10 個檔案。每個編碼後的檔案不得超過 25 MiB(26,214,400 位元組),整個選擇不得超過 100 MiB(104,857,600 位元組)。超出限制的檔案會以明確訊息拒絕,而非默默地裁剪。
規劃檔案清單時,請將單檔上限 25 MiB 與總上限 100 MiB 納入考量。簡單的算術檢查就能判斷你的選擇是否合適:100 MiB ÷ 25 MiB 每檔 = 4 個檔案達到單檔上限。再加入第 5 個 25 MiB 的檔案會使總計達到 125 MiB,合併工具會以明確訊息拒絕。如果你打算合併更大的錄音,請事先決定是否將它們轉換為較小的壓縮格式,或切割成較短的片段。
可辨識的檔案類型包括 MP3、波形、M4A、AAC、Ogg、WebM 與 FLAC,可透過副檔名或 MIME 類型識別。可辨識的副檔名並不保證能解碼,因為實際解碼取決於你的瀏覽器與作業系統中安裝的編解碼器。如果你使用不常見的編解碼器、加密檔案,或不確定錄音是否完整,請規劃先透過合併工具測試一個來源檔案。損壞、加密、不完整、標示錯誤或不支援的檔案會產生明確錯誤,合併作業會停止。
下表總結了你規劃時應參考的明確限制。
| 限制 | 數值 |
|---|---|
| 最少檔案數 | 2 |
| 最多檔案數 | 10 |
| 單檔大小 | 25 MiB(26,214,400 位元組) |
| 選擇總大小 | 100 MiB(104,857,600 位元組) |
| 總解碼時長 | 30 分鐘 |
| 每檔最大聲道數 | 8 |
| 最大解碼取樣率 | 192 kHz |
| 總聲道樣本數 | 30,000,000 |
階段 2:確認聲道與取樣率相容性
收集完成後,下一個規劃步驟是確認每個解碼後的檔案將落在相同的聲道數與可接受的取樣率上。網路音訊解碼使用單一 AudioContext,而該共享的內容可能會將你的來源重新取樣到工作取樣率。因此結果顯示的取樣率可能與原始檔案中儲存的取樣率不同。輸出不會保留各來源獨立的取樣率,所以請將此後果納入規劃,而非在下載後才發現。
聲道是更嚴格的限制。每個解碼後的曲目必須共用相同的聲道數。單聲道與立體聲混用會被拒絕,而非默默地複製、捨棄、平均或重新對應。請規劃在來源端就匹配好(兩者皆匯出為立體聲或皆為單聲道),或將工作拆分為兩次獨立的合併。如果你的輸入來自不同硬體擷取的語音備忘錄——電話錄音為單聲道而影片音訊為立體聲——請事先轉檔,讓合併能一次完成。
聲道會依其解碼順序保留,各聲道會在檔案間獨立串接,再將波形交錯排列。在立體聲中,曲目 1 的左聲道接著是曲目 2 的左聲道;曲目 1 的右聲道接著是曲目 2 的右聲道;然後將這兩串流交錯成最終的波形。這就是為什麼左右聲道數值不同的立體聲測試樣本,可以在合併後證明順序與聲道身分皆完整保留。
解碼作業透過網路音訊 API 執行,該 API 會透過 BaseAudioContext.decodeAudioData 將支援的檔案解碼為 AudioBuffer。了解解碼後音訊資料的位置,有助於說明為何合併無縫,以及為何部分驗證發生在解碼後的緩衝區而非來源檔案上。
階段 3:在合併前設定順序
檔案準備就緒後,請在開啟合併工具前規劃好播放順序。你在清單中看到的順序,就是最終落入波形的順序:前一個解碼曲目的最後一個樣本框,會緊接著下一個曲目的第一個樣本框,出現在輸出聲道陣列中,期間不會插入靜音、重疊、交叉淡入淡出、標準化、過場或自動裁剪。
兩項實用的規劃小技巧能讓排序更輕鬆。首先,在載入任何檔案之前,先在工具外建立一份編號清單——寫在紙上或文字檔中——特別是當順序對影片時間軸、會議錄音或多段旁白至關重要時。其次,預期合併工具會在順序變更時立即清除任何舊的波形預覽,避免陳舊的結果仍顯示先前的順序。如果你在規劃中途重新排序,請在下載前從頭再聽一次預覽。
重新排序也會同時重新排列解碼後的緩衝區陣列與可見清單。上移與下移控制項作用於已解碼的緩衝區,因此反覆調整順序不會產生解碼成本。
依下列順序執行合併工作流程
- 在你的瀏覽器分頁中開啟 Audio Joiner。無需帳號、安裝或上傳。
- 在單次挑選中選取 2 到 10 個音訊檔案。每個檔案都必須符合上述單檔與總大小限制。挑選器依檔名或 MIME 類型接受 MP3、波形、M4A、AAC、Ogg、WebM 與 FLAC;不支援的檔案會以明確錯誤失敗。
- 等待瀏覽器透過共享的 AudioContext 解碼每個檔案。每個緩衝區就緒時,解碼時長、取樣率與聲道數會顯示在個別曲目預覽中。
- 聆聽每首曲目的預覽。如果有任何曲目聽起來有誤、無法解碼,或顯示的聲道數與其他曲目不同,請先停止並修正該來源,再繼續。
- 使用上移或下移,直到清單呈現你規劃的精確順序。解碼後的緩衝區會同時重新排序,任何舊的波形預覽都會被清除。
- 選擇「按此次序合併」。合併工具會依規劃順序獨立串接每個聲道,根據預算驗證結果,並寫入一個全新的 44 位元組小端序 RIFF/WAVE 標頭。
- 在瀏覽器中預覽產生的 PCM16 波形。從頭到尾聆聽,特別留意曲目之間的接合處:不應出現間隙、爆音、淡入淡出或多餘的靜音。
- 將波形下載到你的電腦。在你確認下載檔案的時長、順序、接合處、聲道播放與檔案大小之前,請保留你的來源檔案。
這個序列是規劃的執行面。更逐步點擊的版本收錄在 如何開始在本機合併音訊檔案;上述步驟呈現的是規劃順序的觀點,而連結指南則會逐一點擊帶你走過相同的控制項。
輸出的波形會與不會包含哪些內容
提前規劃也代表要知道哪些內容會在編碼後保留下來、哪些會被捨棄,這樣你才不會失去任何仍然需要的東西。輸出是一個新編碼的 RIFF/WAVE 檔案,包含交錯、小端序、有號 16 位元 PCM 樣本。編碼器寫入的標頭包含 RIFF 大小、WAVE 與 fmt 識別碼、PCM 格式標記、聲道數、解碼取樣率、位元率、區塊對齊、16 位元深度、資料識別碼,以及精確的資料位元組長度。浮點樣本會被裁剪至 -1 到 1 的範圍,其中 -1 對應到 -32768,+1 對應到 +32767,任何非有限值則寫為靜音。
輸出不會保留:原始編解碼器、位元率、編碼器設定、ID3 或 Vorbis 註解標記、章節、循環點、提示點、音量資訊、時間戳記,或其他容器欄位。它也不會保留各來源獨立的取樣率,因為整個合併會使用單一工作取樣率。如果你仍需要上述任何屬性,請保留你的原始檔案;下載的波形是瀏覽器解碼樣本的新靜態 PCM 表示,而非重新包裝的容器。
一個實際的大小後果:PCM16 波形是未壓縮的,可能會比你所選的 MP3、AAC、Opus、Vorbis 或 FLAC 檔案大上許多。請相應地規劃你的下載資料夾與任何後續上傳步驟,特別是當接收端也接受壓縮格式時。
When your plan calls for a different tool
If your plan is for the joiner but the actual job is something else, pick a different tool. The table below summarizes the common decision points.
| Your plan | Right tool |
|---|---|
| Combine 2–10 full tracks into one WAV | Audio Joiner |
| Extract a specific time range from one track | Audio Cutter |
| Need a fade-in, fade-out, crossfade, or loudness matching | Dedicated audio editor |
| Need compressed output that preserves metadata | Dedicated audio editor with tag support |
| Need to convert mono and stereo to one channel layout | Dedicated audio editor with channel conversion |
| Need sample-level repair or rate conversion at a specific target | Dedicated audio editor with sample-accurate tools |
The general rule is: if every input is a full track, every track shares a channel count, you accept PCM16 WAV as the output, and you do not need fades, transitions, or metadata, the Audio Joiner handles the whole plan. The moment your plan asks for any property not listed above — normalization, dynamic compression, EQ, time stretching that preserves pitch, ID3 tags, or compressed formats — step out of the joiner workflow and into a full audio editor.
The decision to upload your files is also part of the plan. With the Audio Joiner, file reading, Web Audio decoding, channel concatenation, WAV encoding, preview, and download happen in your current browser tab; nothing is sent to a server. Selected files and the finished WAV use temporary local object URLs that are released when replaced or when the page closes. If your plan requires server-side processing for any reason — long-form mastering, AI noise reduction, or large-format delivery — the joiner is the wrong choice and you should plan around a tool designed for that workload.
If you're weighing options, Repeat the Same Result When You Join Audio Files covers this in detail.