音訊變調器會以半音為單位,將錄製聲音的感知音高向上或向下調整,而 Audio Pitch Changer 能在你的瀏覽器中本機完成這項作業,一次處理一個檔案,範圍從 -12 半音(下降一個八度)到 +12 半音(上升一個八度),接著匯出全新的未壓縮 PCM16 WAV。由於此工具採用播放速率重取樣而非相位聲碼器,音高與時長會同步變動:升高音高會使音訊變短、播放更快,降低音高則會使其變長、播放更慢。這項單一事實決定了此工具擅長之處、不足之處,以及你該如何預先規劃使用方式。本指南的其餘部分將帶你了解相關術語、計算方式、Audio Pitch Changer 頁面中的精確操作步驟,以及在你按下「render」之前需要留意的限制。所有處理都在你的瀏覽器分頁內本機進行;解碼、重取樣與 WAV 編碼都在你已有的檔案上於本機執行。

音訊變調器實際上做了什麼
變調意指在不必重新錄製的情況下,提升或降低聲音的感知頻率。人聲、樂器、完整混音,甚至口白音訊都能進行變調。半音是十二平均律中使用的最小音程——也就是鋼琴鍵盤所依循的相同音階——而一個八度由十二個堆疊的半音組成。每個半音會將頻率以 2^(1/12) 的倍率提升或降低,換算下來大約是 1.0595。麥基爾大學(McGill University)關於 MIDI 與頻率轉換的課程教材確認了同一套機制,並指出每個半音還可進一步細分為一百個 cent(音分)。
以整數半音進行變調是入門工具的預設方式,因為依其設計,這種做法恰好落在具備音樂意義的音程上。+1 是上升一個小二度,+5 是上升完全四度,+7 是上升完全五度,+12 是上升完整八度,依此類推。選擇整數值通常比任意小數位移聽起來更悅耳,這也是 Audio Pitch Changer 採用整數輸入欄位而非連續滑桿的原因。
為何半音對應到一個播放速率數值
半音與播放速率之間的關係由一個簡短的公式表示:rate = 2^(n/12),其中 n 是你所選擇的整數半音位移量。MDN 參考文件中關于 AudioBufferSourceNode.playbackRate 的說明指出,該值代表原始取樣速率的比例:低於 1 時音訊變慢,高於 1 時音訊變快,任何非 1 的數值皆會觸發重取樣。在底層,W3C Web Audio 規範將 detune cent 與 2^(detune/1200) 的倍率相連結;十二個半音等於一千兩百 cent,可化簡為相同的 2^(n/12)。
這個單一數值驅動著此工具的所有行為。一組對照點涵蓋了整個範圍且不出現意外:0 = 1× 且音訊不變,+12 = 2× 速率且時長約為原本的一半,-12 = 0.5× 速率且時長約為原本的兩倍,中間的半音則沿著曲線填補。透過一個實際計算的範例可清楚展示整個推導鏈:
- 選擇 +5 半音,因此 n = 5。
- Rate = 2^(5/12) ≈ 1.3348。
- 長度為 3:00(180 秒)的來源音訊會變為約 180 / 1.3348 ≈ 134.85 秒,亦即約 2:14.9。
請直接使用工具本身來取得你檔案的精確數值,因為解碼後的幀數在配置時已向上取整,不見得會與離線計算結果完全相符。
音高與時長之間的取捨說明
這是多數初學者最常卡關的地方,因此值得單獨說明。播放速率重取樣器將速度與音高視為同一個參數:較快的速率會把所有頻率向上推升,較慢的速率則會把所有頻率向下拉低。如果你需要在保持節拍格線或語句時長不變的情況下改變音高,那是時間拉伸(time-stretching)的問題,而非變調的問題,適合的工具類別是相位聲碼器、SOLA 類引擎,或其他專門的時間拉伸演算法。Audio Pitch Changer 並未嘗試解決此問題,也無法保留 tempo、語音節奏、節拍位置或原始時長。
不過,對於許多初學者的實際任務來說,這項取捨是誠實合理的。透過降低音高來放慢歌曲,有助於聽寫練習,特別是當原調超出你在吉他或鋼琴上舒適演奏的音域時。透過升高音高來加快歌曲,則有助於你學習快速樂段,或跟上錄音的節奏。花栗鼠聲與食人妖聲等變聲效果之所以能成立,正是因為時長與音高會同步變動、成為單一參數。聲音設計通常也希望兩者同步移動,而這正是此重取樣器所產生的行為。
如何使用 Audio Pitch Changer 進行變調
整個流程簡短明確,且完全在你目前的瀏覽器分頁中執行。
- 從你的裝置中選擇一個音訊檔案。常見且瀏覽器可解碼的類型——MP3、WAV、M4A、AAC、Ogg、WebM 與 FLAC——皆可接受,但編解碼器支援終究取決於你目前使用的瀏覽器,因此即使副檔名被識別,也無法保證每個特殊的編解碼器設定檔皆能順利解碼。
- 確認檔案編碼後小於 50 MiB,且解碼後的音訊符合下表所列的限制。
- 從 -12 到 +12 半音中選擇一個整數位移量。+12 為上升一個八度,-12 為下降一個八度,0 則保持原始音高。
- 觸發本機渲染。瀏覽器會透過一次離線處理流程,以來源取樣速率對整個檔案執行重取樣。
- 查看渲染完成後介面上所顯示的時長變化。其方向與幅度皆遵循上述公式。
- 下載結果。無論你上傳的是什麼格式,輸出檔案永遠是全新的未壓縮 PCM16 RIFF/WAVE,且此頁面刻意不在工具內播放結果——請在本機音訊播放器中開啟 WAV 檔以聆聽成果。
可上傳的內容與可下載的內容
此工具會在開始任何耗資源的渲染之前先檢查限制,因此盡早失敗能節省時間。下表所列為確切公開的門檻,而非估計值。
| 項目 | 限制 |
|---|---|
| 編碼輸入大小 | 最高 50 MiB |
| 解碼輸入預算 | 最高 3,000 萬個聲道樣本 |
| 解碼輸出預算 | 最高 3,000 萬個聲道樣本(獨立檢查) |
| 解碼時長 | 最高 5 分鐘 |
| 聲道數 | 最高 8 |
| 取樣速率 | 8,000 Hz 至 192,000 Hz |
| 變調範圍 | -12 至 +12 整數半音 |
| 輸出容器 | PCM16 RIFF/WAVE,交錯,小端序 |
有兩項預算需要留意:輸入樣本預算與輸出樣本預算。降低音高會增加輸出幀數,因此一個向上升八度尚可容納的音檔,在向下降八度時可能會失敗;失敗訊息會指出所要求的變調已超出預算,且內容並未遭到截斷。若發生此情況,請嘗試較小的位移量或較短的片段。
下載的 WAV 檔案預期內容
下載的檔案為新編碼而成,並非對來源檔案的重新封裝。輸出為未壓縮、交錯、小端序的 PCM16 音訊,封裝於 RIFF/WAVE 容器內,浮點樣本在轉換前會先裁剪至合法的 -1 到 +1 區間。原始 MP3/AAC/FLAC 的壓縮品質、位元率、ID3 或 Vorbis 標籤、封面圖片、章節、cue 點、循環中繼資料,以及任何其他容器中繼資料皆不會保留,這是刻意為之的設計。
重取樣品質取決於瀏覽器自身的重取樣器,且屬於實作定義。對明亮素材(如鈸、hi-hat、帶齒擦音的人聲)進行大幅度的向上變調,可能會暴露出原本較不明顯的混疊或編解碼器失真。這對練習用的音軌、音效、輕鬆短劇與粗略剪輯來說已足夠,但它並非透明的母帶處理流程。當你需要保留原始 tempo 的同時進行變調時,請改用專門的時間拉伸工作流程。
適合初學者的實用入門專案
以下是一些時長取捨反而是特色而非缺陷的初學者專案簡短清單:
- 將歌曲轉調至舒適的調性以利聽寫。將流行或搖滾錄音下移 -3 至 -5 半音,通常會讓它們在吉他或鋼琴上更易於演奏。
- 為短劇製作花栗鼠聲或食人妖聲的對白。+12 聽起來像是上升完整一個八度;-12 則是下降完整一個八度。
- 將兩個短樣本對齊至同一個調性以製作混搭作品。整數半音的位移在短片段中已足夠接近,能順暢融合。
- 加快外語錄音以釐清語句內容,再放慢回來確認細節。
- 在決定重新錄製之前,先預覽變調效果。快速的本機渲染比重建整個錄音 session 更快。
此方法的不足之處
在某些情境下,播放速率法並非合適的工具,值得事先了解:
- 需要對多軌 session 進行節拍精準的變調,且必須維持底層節拍格線。請改用相位聲碼器或其他時間拉伸演算法。
- 素材時長達到或超過 5 分鐘上限;解碼限制會在任何變調套用之前擋下渲染。
- 檔案中內嵌的中繼資料很重要時。輸出是刻意設計為乾淨、未帶標籤的 PCM16 WAV。
- 對明亮的鈸、hi-hat 或帶齒擦音的人聲進行非常高的向上變調時,瀏覽器重取樣的失真將主導聽感。
遇到這些情況時,請從品質更高的來源檔案著手、縮短片段長度、採用較小的半音位移量,或將結果串接到另一個獨立的時間拉伸工作流程中處理。若你想要更深入的教學,且特別聚焦於本機優先(local-first)的處理流程,請參閱 Change Audio Pitch in Browser Locally。想了解從檔案讀取、解碼、重取樣到 WAV 編碼的每一步細節時,整個過程皆在你目前的分頁內執行,結果自下載完成的瞬間起便存放在你的裝置上。
延伸閱讀:Change Audio Speed on YouTube and Save the WAV Locally。