Audio Equalizer 是一款免費的瀏覽器工具,可在本地對音訊檔套用三頻段峰值等化器,採用 0.99 的峰值安全縮放,並輸出完整的 PCM16 WAV。該工具使用 W3C Audio EQ Cookbook 中公開的雙二階濾波器,Q 值為 1,中心頻率分別為 100 Hz、1,000 Hz 和 10,000 Hz(當取樣率過低、使得 10 kHz 會超過 Nyquist 頻率時,則改為解碼後取樣率的 45%),每個頻段提供 -12 至 +12 dB 的整數增益。統一的安全縮放會降低處理後的訊號,使輸出峰值為 0.99,避免串接的增益超過數位全刻度時,PCM 編碼器對個別樣本進行削峰。所有處理都在當前瀏覽器分頁中透過 Web Audio API 完成,原始音訊位元組、解碼後的樣本、等化器設定與檔案名稱絕不會離開裝置。最終結果是一個全新的未壓縮 PCM16 WAV,帶有全新的 RIFF 標頭,而非原始編碼器的重新編碼副本。

「免費將音訊轉為文字」實際涵蓋的內容
搜尋「convert audio to text free」通常會指向語音轉文字的轉錄服務,將口說內容轉成書面文字。這與音訊處理器屬於不同類型的工具。然而,免費的音訊處理工具屬於相關類別:它們處理的是音訊檔本身,而非其內容。Audio Equalizer 屬於第二類。它不會轉錄語音,但確實能讓你免費在瀏覽器中調整錄音的音色平衡,無需上傳來源檔案。
對於為了尋找轉錄工具而來的讀者而言,這個區別很重要。等化器透過增強或衰減頻段來改變音訊聽起來的樣子;轉錄器則將音訊轉換為文字字元。這兩項任務共享免費、基於瀏覽器的工作流程,但解決的是完全不同的問題。本文聚焦於免費瀏覽器工具中音訊調整的面向,詳細說明 Audio Equalizer 的功能、底層運作方式,以及何時該選用更強大的工具。
Audio Equalizer 如何在瀏覽器中運作
Audio Equalizer 會載入瀏覽器可解碼的檔案,串接套用三個獨立的峰值濾波器,然後寫入一個新的 WAV。峰值偵測與安全縮放邏輯在編碼前執行,因此下載的檔案絕不會包含編碼器自行截斷所產生的削峰樣本。
解碼階段使用 Web Audio API,特別是 AudioBuffer 介面。瀏覽器會回傳一個以解碼後取樣率表示的浮點樣本緩衝區,若瀏覽器在解碼過程中重新取樣,該取樣率可能與容器所標示的速率不同。工具會從該緩衝區讀取聲道數、取樣率與總幀數,然後執行濾波器。
這三個濾波器是依 W3C Audio EQ Cookbook 中的係數公式所建構的峰值雙二階濾波器。每個頻段具有中心頻率、Q 值為 1,以及使用者設定的以分貝為單位的增益。頁面會將所選的 dB 值轉換為 Cookbook 中定義的 A 參數,以 a0 對所有係數進行歸一化,然後在每個聲道上執行產生的二階遞迴濾波器。三個區段依 Bass、Mid、再 Treble 的順序串接。當三個增益皆設為 0 dB 時,工具會在不執行任何非零濾波器區段的情況下直接複製解碼後的聲道樣本,提供真正的平直路徑。
有一個細節:當解碼後的取樣率過低、使得 10 kHz 會落在 Nyquist 頻率之上時,高音中心頻率會降低為取樣率的 45%。這能讓濾波器保持在可表示的頻譜範圍內,而非要求一個無效的數位濾波器在範圍之外運作。介面上會反映實際使用的中心頻率。
| 頻段 | 中心頻率 | Q | 增益範圍 |
|---|---|---|---|
| Bass | 100 Hz | 1 | -12 至 +12 dB(整數) |
| Mid | 1,000 Hz | 1 | -12 至 +12 dB(整數) |
| Treble | 10,000 Hz,或當 10 kHz 超過 Nyquist 頻率時改為取樣率的 45% | 1 | -12 至 +12 dB(整數) |
逐步調整 Bass、Mid 與 Treble
工作流程很簡單,全部在同一個分頁內完成。
- 選擇一個瀏覽器可解碼的音訊檔,須在 50 MiB 與五分鐘解碼長度的限制內。當目前的瀏覽器與作業系統支援實際的編碼器時,工具接受 MP3、WAV、M4A、AAC、Ogg、WebM 或 FLAC。熟悉的副檔名並非保證:容器可能包含瀏覽器無法讀取的編碼器,解碼失敗時會產生錯誤,且不會留下過期的下載檔案。
- 將 Bass、Mid 與 Treble 設為 -12 至 +12 dB 之間的整數值。每個控制項僅接受該範圍內的整數。使用負值來衰減中心頻段周圍的能量,使用正值來增強它。正值會增強中心頻段周圍的能量,負值則會衰減它;峰值濾波器影響的是其中心周圍的區域,而非低於或高於某個硬性邊界的每一個頻率。
- 在本地套用等化器。工具會在每個接受的聲道上串接執行三個雙二階濾波器,每個聲道使用相同的設定獨立進行濾波。
- 檢查介面中顯示的原始峰值、輸出峰值、安全縮放、取樣率與幀數。這些數字來自編碼前實際處理後的樣本,因此反映的是編碼器將寫入的內容。
- 預覽結果並下載 PCM16 WAV。下載的是一個全新的未壓縮檔案,而非來源的重新編碼副本。在匯出之前,請用實際會使用的喇叭或耳機聆聽。
峰值安全與 0.99 縮放規則
即使輸入從未發生削峰,串接的增益仍可能將樣本推高到超過數位全刻度。在 WAV 編碼器執行之前,工具會測量所有處理後樣本與所有聲道上的絕對峰值。若該原始峰值超過 0.99,便會以單一統一的縮放係數降低整個處理結果,使最大振幅恰好成為 0.99。介面會顯示原始峰值、輸出峰值,以及實際套用的縮放係數。
這很重要,因為 PCM16 WAV 編碼器會將浮點樣本轉換為有號 16 位元整數。若沒有安全縮放,高於 1.0 的樣本會個別被截斷為可表示的最大值,產生嚴重的數位削峰。統一縮放可防止這種情況,但會降低整體音量。若想更深入地從概念上了解 Bass、Mid 與 Treble 控制項對訊號的作用,三頻段等化器完整解析指南以淺顯的方式說明了濾波數學。
重要的是要說明安全縮放不是什麼。它不是響度正規化,不會以 LUFS、RMS、replay gain 或任何串流平台規格為目標。它是一種單一統一的調整,用以保護 PCM 編碼器不會在個別樣本層級發生硬削峰。工具也會顯示原始峰值,讓你確切知道縮放裁掉了多少,並判斷是否應改為降低增益。
下載的 WAV 包含什麼
下載的是一個全新的未壓縮 PCM16 WAV 檔案。標頭記錄了實際的聲道數、取樣率、位元速率、區塊對齊、位元深度與完整的資料長度。浮點樣本會轉換為有號 16 位元小端序 PCM,並以幀為單位交錯排列。每個聲道保持與解碼後輸入相同的取樣幀數,所有接受的聲道皆使用相同的設定獨立進行濾波。
結果不會保留原始的編碼器、位元速率、壓縮模式、標籤、封面、章節、循環標記,或任何容器專屬的中繼資料。它是一個由處理後樣本所建構的全新 RIFF 檔案。標頭格式遵循 Microsoft 所記錄的 WAVEFORMATEX 結構,實際寫入的數值來自處理後的緩衝區,而非從來源容器複製而來。
由於 Web Audio 在解碼時可能會重新取樣,因此 WAV 包含的是解碼後的取樣率,而非來源容器所宣稱的數值。所顯示的取樣率與幀數符合磁碟上的實際資料,而非仰賴可能在解碼過程中未保留下來的容器中繼資料。驗證的約定是數值化的:測試會讀取實際的 RIFF 欄位與樣本資料,而非僅接受顯示的成功訊息。
何時你需要完整的音訊編輯器
Audio Equalizer 刻意保持精簡。它是一個具有固定 Q、固定中心頻率與整數 dB 步進的三頻段峰值等化器。它不是十頻段圖形等化器、線性相位母帶處理器,也不是自動房間校正系統。它不會分析頻譜、不會隨時間自動化增益變化,也不會套用抖動處理。
當你需要精確的中心頻率、可調的 Q、頻譜分析、自動化曲線、線性相位處理、響度計量、抖動控制、編碼器選擇或中繼資料保留時,請改用完整的音訊編輯器。此工具也不能取代轉錄服務:它調整的是音訊聽起來的樣子,而非音訊所說的內容。
請將預覽與顯示的數字視為檢查,而非理想混音的證據。請在相近的感知音量下與原始檔比較,避免僅依據更響的輸出進行判斷。強烈的增益可能會放大噪音、齒音、低頻隆隆聲或既有的失真。相較於堆疊多個增益,衰減通常更安全,而使用原始錄音的平直路徑有時反而是正確的答案。相關限制可保護分頁免於意外過大的解碼資料:輸入上限為 50 MiB,解碼後音訊長度不得超過五分鐘,支援一到八個聲道,取樣率介於 8,000 至 192,000 Hz,聲道樣本數不得超過 3,000 萬。超出限制的檔案會在濾波前被拒絕,絕不會被靜默截斷。
如需更深入的瞭解,請參閱 Convert Audio to a Waveform Image Free with Local SVG。