殘響(Reverb)是原始聲音停止後,殘留在空間中的聲音反射模式,而頁面所使用的延遲時間,正是一份可用的草稿和一場猜測之間的差別。在這個工具中,三個固定反射位於 29.7、37.1 和 41.1 毫秒,獨力完成所有的殘響工作 — 沒有脈衝響應(impulse response)、沒有擴散網路(diffusion network)、也沒有捲積(convolution)階段。「線上為音訊加入殘響」的意思,是在瀏覽器分頁中執行那個已公開的效果,把一份延遲的濕訊號(wet)混入乾燥錄音,再匯出成新的 WAV。這個詞描述的是一種工作流程,而非單一硬體:你讓瀏覽器頁面指向一個音訊檔,從六個選項中挑選一個效果,設定一個百分比強度,然後下載處理後的結果。這個詞並未暗示伺服器渲染、需要註冊、或隱藏的人工智慧轉換;最誠實的解讀,是一個可在筆電上執行、明天可重複、且能逐位元組重現的確定性本地操作。一旦把這兩個概念 — 聲學效果與本地瀏覽器遞送 — 分開,剩下工作流程就只是選擇檔案、控制選項和輸出格式而已。

「殘響」在音訊中的意義
殘響最初是一種物理現象。當你在小臥房裡拍手時,你會聽到原本的啪聲,接著是一團從牆壁、地板和天花板快速反射回來的模糊能量,然後歸於寂靜。在大教堂裡,同樣的掌聲會產生一條漫長、緩慢衰減的尾巴,因為空間更大、表面更硬。音訊工程師借用「殘響」這個詞,來描述任何模仿那團模糊的處理方式,無論模擬是粗糙或細緻。乾音訊(dry audio)是尚未加入殘響的訊號;濕音訊(wet audio)是把反射重新混回去的版本;兩者的混合比例通常稱為濕/乾比(wet/dry mix)。
因此「為音訊加入殘響」這句話的意思,是把訊號的殘響複本混入原始訊號,通常只靠一個百分比控制項。較高的百分比比較接近全濕聲,幾乎聽不到原始乾燥訊號;較低的百分比聽起來像是為乾淨錄音加上少量的房間感。經過殘響處理的人聲,聽起來比乾燥版本離麥克風更遠,即使麥克風的位置完全沒變。
「線上為音訊加入殘響」在實務上的意義
加入「線上(online)」這個詞,會把問題從效果本身轉移到遞送方式。線上殘響工具指的是在瀏覽器分頁中執行,而不是作為數位音訊工作站(DAW)內部的外掛程式(plug-in)。要達成這一點,頁面內部必須完成三件事:從你的裝置讀取檔案、解碼成瀏覽器可操作的 PCM 緩衝區、由 JavaScript 或 WebAssembly 效果處理,最後再寫回成可下載的音訊檔。「線上」是「無需安裝、無需外掛鏈、無需專案檔」的簡稱。
在實務上,「線上為音訊加入殘響」對一般讀者來說,更接近一項小型且可重複的工作:開啟頁面、拖入錄音、選擇殘響、設定強度,然後下載結果。有些頁面會把音訊送到伺服器處理,有些則是利用瀏覽器內建的音訊圖(audio graph)在本地完成。合約內容很重要,因為伺服器路徑會上傳音訊並可能保留副本,而本地路徑則從不離開分頁。線上音訊效果明確採用後者:所有解碼、效果和 WAV 匯出都在當前分頁內完成(依據瀏覽器所實作的 W3C Web Audio API 1.1 規格),你的檔案不會被上傳,也不需要建立帳號。
本地輕量級殘響是如何建構的
完整建模的殘響會模擬房間的物理現象:成千上萬的早期反射、隨頻率變化的衰減、 stereo 擴散,以及一條又長又平滑的尾巴。輕量級殘響則更為簡單:它在固定偏移位置堆疊少量乾燥訊號的延遲複本,讓濕/乾控制項決定每個複本的音量。這個結果不如捲積殘響真實,但更容易預測、更容易測試,且即時運算成本更低。
線上音訊效果中的殘響,是一個具有公開係數的三點早期反射設計。頁面在 29.7、37.1 和 41.1 毫秒處加入乾燥訊號的複本,權重分別為 0.50、0.35 和 0.25,並乘上選定強度。在 100% 強度下,三個複本會以該完整權重混入;在 50% 強度下,每個點都會依比例縮放為 0.5;在 0% 時,殘響完全不貢獻任何成分。這三個延遲時間短到足以被解讀為「早期反射」,而非漫長的大廳尾巴,而且它們彼此相當接近,讓混合後的濕訊號感覺像是一次快速的暈染,而不是一連串可辨識的重複。這段算式就是整個殘響引擎 — 沒有脈衝響應、沒有擴散網路,也沒有捲積階段。這個設計適合用來勾勒需要一點空間感的人聲或鼓擊,但刻意不去宣稱能模擬真實房間。
完整的尾巴會在處理開始前先預留好,所以最後一道早期反射在衰減過程中絕不會被截斷。如果產生的檔案超過頁面三千萬聲道樣本(channel samples)的輸出預算,執行會被拒絕,且不會產出任何檔案 — 頁面不會悄悄地把殘響切斷。有限的樣本在量化為 16 位元 PCM 之前,也會被箝制在合法的 −1 到 +1 範圍內,以防止多個延遲複本在滿音量堆疊時產生的數位削波(clipping)。
為什麼這三個延遲時間很重要
殘響中的延遲時間並非可以互換。如果挑了三個彼此太靠近、相差不到大約五毫秒的延遲,濕訊號聽起來會像是一個鑲邊器(flanger)或梳狀濾波器(comb filter) — 一道會自我吸引注意力的金屬掃描聲。同樣三個點若分散到較寬的範圍,例如相隔五十或八十毫秒,結果就會開始被聽成離散的重複,而非房間氛圍。29.7、37.1 和 41.1 毫秒這幾個值,落在乾燥訊號後大約二十到五十毫秒的早期反射區間,大腦仍會把濕訊號解讀為同一個聲學事件的一部分。把這個位置配上 0.50、0.35 和 0.25 的遞減權重,濕訊號會在同一個視窗內溫柔地消退,給人一間小而堅硬房間的印象,卻不會產生可聽見的重複。
權重也扮演著刻意的角色。第一個位於 29.7 毫秒的點以 0.50 的音量最大,承載了大部分的空間感。第二個位於 37.1 毫秒的點是 0.35,強化暈染但不與第一點競爭。第三個位於 41.1 毫秒的點以 0.25 收尾,剛好足以讓包絡的尾巴更厚實。因為每個點都會先乘上選定強度再進行混合,所以調低強度不只是把殘響調小 — 而是按比例讓整個濕訊號包絡變薄,這就是為什麼 30% 的設定聽起來像小房間,而 100% 的設定聽起來像是同一房間稍微再多一點的感覺。
如何使用「線上音訊效果」線上為音訊加入殘響
- 在最新的桌面瀏覽器(例如 Chrome、Firefox、Safari 或 Edge)開啟線上音訊效果。
- 選擇一個瀏覽器可解碼、且大小不超過五十 mebibyte 的音訊檔。可接受的副檔名包含 MP3、WAV、M4A、AAC、Ogg、WebM 和 FLAC,不過被辨識出副檔名並不保證你的特定編碼檔案能在瀏覽器中順利解碼。
- 從效果選單中選擇「輕量級殘響(lightweight reverb)」。
- 設定一個介於 0 到 100 百分比的整數強度。0% 基本上會原封不動地回傳乾燥訊號,僅在最後經歷浮點到 PCM 的捨入;100% 會套用完整的三點混合;中間值則會線性縮放已公開的點權重。
- 在本地執行該效果。頁面會使用瀏覽器的 Web Audio 實作來解碼你的檔案、原位套用殘響,並回報聲道數、取樣率、輸入與輸出框數(frame count)、輸出峰值,以及精確的 WAV 位元組大小。
- 將處理後的檔案下載為一份新的 PCM16 WAV。你磁碟上的原始檔案不會被修改,也不會被上傳。
- 若想讓聲音更深沉,可以提高強度後重新執行,或是把第一次的結果下載,再把那個 WAV 當成新輸入送回去做另一輪效果處理。
如果因為你的檔案內部的編解碼器或 profile 瀏覽器不支援而解碼失敗,頁面不會產生輸出,而是會直接放棄,絕不會輸出損壞的 WAV。如果你想以逐步引導的方式走過相同的步驟,並了解每個控制項的預期表現,如何在瀏覽器中為音訊加入殘響會把同一套流程用白話拆解開來。
「線上音訊效果」中可用的六種效果
| 效果 | 它對音訊做了什麼 | 常見用途 |
|---|---|---|
| 回音(Echo) | 為每個樣本加入一個 200 毫秒、半音量的複本,且完整尾巴會事先配置。 | slap-back 人聲、節奏性重複、dub 風格效果。 |
| 輕量級殘響 | 在 29.7、37.1 和 41.1 毫秒處加入三道早期反射,權重分別為 0.50、0.35 和 0.25,並乘上強度。 | 為乾燥錄音加上快速的空間感與深度、作為草圖層級的聲音設計。 |
| 反轉(Reverse) | 以相反方向讀取已解碼的框,並按強度與原始訊號混合。 | 倒放人聲、轉場效果、聲音設計圖層。 |
| 淡入(Fade in) | 從檔案開頭的乾燥音量,逐漸放大到結尾的滿音量。 | 平滑地引入一段音軌、播客或取樣。 |
| 淡出(Fade out) | 從檔案開頭的滿音量,逐漸縮減到結尾的乾燥音量比例。 | 段落收尾、ring-out 效果、播客結尾。 |
| 標準化(Normalization) | 把最大的絕對解碼樣本依比例縮放,讓峰值落在 0.95。 | 在不超過合法 PCM 範圍的前提下達到最大音量;並非響度匹配。 |
每種效果只會執行一輪。頁面每次只會套用一個選定的轉換,並輸出一份 WAV。若要堆疊效果,請先把第一份輸出下載,再以新輸入重新開啟檔案,並選擇下一個效果。
解讀音量控制與輸出報告
音量滑桿是此混響唯一的控制旋鈕。在百分之零時,工具會傳回本質上未變更的乾訊號,但在匯出階段可能會經過浮點轉 PCM 的四捨五入。在百分之一百時,乾訊號會依其完整公開的權重,與三個混響分支混合。介於兩者之間的值會以線性方式調整每個分支的權重,這也是頁面可將此運算描述為確定性的原因:相同的輸入檔案與相同的音量,永遠會產生相同的位元組序列,但在最後的 PCM 量化步驟中可能會有所差異。
處理完成後,頁面會報告聲道數、採樣率、輸入影格數、輸出影格數、輸出峰值,以及精確的 WAV 位元組大小。對於迴音與混響,由於配置了尾音,輸出影格數會略高於輸入;如果此增長會超過三千萬個聲道樣本,頁面會拒絕建立檔案。輸出峰值可告訴您結果是否曾在任何樣本處發生削波;當高音量設定的延遲與大聲的乾訊號部分重疊時,便可能發生這種情況。如果削波造成問題,請降低音量、對結果執行正規化,或使用 音訊剪輯器 修剪來源檔案後再試一次。
此混響未建模的項目
設定正確的預期,與了解各項控制同樣重要。這裡的混響是一套公開說明的三分支早期反射設計,而非經過測量的音樂廳、板式混響、彈簧、錄音室空間或品牌處理器。它不會模擬室內尺寸、依頻率而異的衰減、立體聲擴散、阻尼、前置延遲,或專業混響尾音。如果您需要具有大教堂般尾音的人聲,或能置身真實空間中的小鼓,載入脈衝響應的卷積混響才是合適工具——本頁面並不是。
同樣地,正規化並不等同於響度匹配。它會找出絕對值最大的樣本,並調整訊號,使峰值位於全刻度的 0.95。它不會測量 LUFS、感知響度、廣播規範符合度、動態、樣本間的真正峰值,或檔案間的等響度。靜音檔案會維持靜音,因為沒有可作為調整目標的峰值。如果您的目標是符合廣播要求的電平,請先執行正規化,再使用不同工具,在獨立步驟中套用響度匹配。
如果您正在比較選項,無需應用程式,在 Android 上線上為音訊加入混響 對此有詳細說明。