跳至主要內容
Lizely
Meta 即時語音模型以每小時 0.18 美元推出,音訊 AI 成本下降

音訊工具 · 2026-09-07

Meta 即時語音模型以每小時 0.18 美元推出,音訊 AI 成本下降

重點結論

Meta 於 2026 年 9 月 6 日發布了 Muse Voice Transcribe,這是一款即時語音模型,可處理 80 毫秒的音訊片段、偵測句子邊界,並區分多達 20 位講者,每小時定價為 0.18 美元。同一天,Google 將 Lyria 3.5 音樂生成功能整合進 Gemini 應用程式,Cadence 發表了專為語音 AI 與沉浸式音訊設計的第六代 DSP,LEWITT 則推出了一款免費的虛擬監聽外掛,供耳機混音使用。

一句話總結:值得關注的工具:即時轉錄成本計算機、講者 diarization 基準測試工具、AI 音樂風格提示產生器、耳機特性檔配對工具、沉浸式音訊 DSP 授權查詢工具。

來源報導了什麼

即時語音模型以低於既有業者的價格問世

Meta 的 Muse Voice Transcribe 可進行語音轉錄、偵測句子邊界,並在無需額外系統的情況下區分最多 20 位講者,會將輸入音訊切分為 80 毫秒的區塊,並調整每個詞的延遲以平衡速度與準確度。Meta 將此模型定價為每小時 0.18 美元,該價格設定低於 OpenAI 與 ElevenLabs。對播客製作人與音樂製作人而言,最直接的改變在於轉錄與講者分離 (diarization) 的預算:過去需要專屬管線處理的長篇訪談素材,現在可透過單一 API 呼叫完成,而多人主持的節目也不再需要人工調校的講者分離流程。80 毫秒的區塊切分與自適應延遲在收音端同樣重要,因為此模型設計上是在錄音進行中(而非僅在後製階段)保持低延遲。

音樂生成功能進駐 Gemini 應用程式

Google 於 2026 年九月 6 日在 Gemini 應用程式內及透過 API 推出 Lyria 3.5,相較前代擁有更豐富的表現力人聲與編曲。使用者可於 Gemini 內選擇曲風與風格、於人聲與純器樂輸出間切換,並選擇短曲或長曲,介面中亦提供背景音樂與個人化歌曲的範本,瞄準新使用者。Lyria 3.5 同時於 Google Flow Music 提供更多功能,並於 Google AI Studio 供開發者使用,也整合進 Google Vids。對音樂人與剪輯師而言,工作流程上的影響相當直接:過去需要在另一個 Google 介面中進行的生成步驟,現在直接內建於製作人撰寫企劃或草擬 metadata 時可能已開啟的助理工具中,且同一個模型可透過 API 供 DAW 相關工具串接。

針對語音 AI 與沉浸式音訊的晶片層級目標

Cadence 發表第六代 Tensilica Hi-fi iQ DSP IP,這是為新世代語音 AI 與新興沉浸式音訊應用所設計的新架構,涵蓋家庭娛樂、車用資訊娛樂系統與智慧型手機領域。該公司將此 DSP 定位於符合上述應用中語音驅動系統單晶片 (SoC) 設計的能耗與效能預算。對硬體製造商與音訊軟體開發者而言,實際意義在於一款具備裝置端語音與空間音訊擴充餘量的更新版 DSP 核心已進入 IP 目錄,這將影響耳機、車用資訊娛樂堆疊與機上盒韌體在不往返雲端的情況下所能執行的功能。

一款免費的耳機監聽外掛進駐 DAW

LEWITT 推出 Space Replicator Free,這是其虛擬監聽系統的免費版本,於九月 1 日發表,可作為 DAW 外掛或獨立應用程式,於 macOS 與 Windows 上支援 VST3、Audio Unit 與 AAX 格式。此外掛結合耳機補償功能與模擬的專業錄音室及消費性播放裝置檢查,並內含超過 800 組耳機設定檔。對以耳機進行混音的混音師而言,改變在於提供了一條成本更低的途徑,可在無需經過聲學處理的房間下,將混音結果與錄音室及消費端播放裝置的聽感進行交叉比對,同時也提供一條與自動化轉錄任務互補的工具路徑,例如為參考曲目產生具時間標記的歌詞檔([從檔案產生歌詞並輸出為 LRC 格式](/audio/guides/generate-lyrics-from-a-file-into-lrc-format/))。

廣告科技與研究領域形成完整循環

AdsWizz 正與 AI Music 合作,將 Sympaphonic Ads 整合進 AdsWizz AudioMatic DSP(一個音訊與播客廣告購買平台),將個人化音訊廣告生成功能疊加到程式化播客購買上。另外,Meta Research 發表了 Alignment-Free Text-Audiobox,這是一個建構於 Diffusion Transformer 並結合 flow-matching 的統一架構,專為高品質語音配音與全雙工對話合成設計;其使用 DAC-VAE 特徵,將 48 kHz 波形編碼為 25 Hz 的低速率潛在序列,提供比先前 EnCodec 表示法高出超過 10 倍的壓縮率,同時改善再合成品質,並隱式地學習文字與語音的對齊關係。整體而言,這些發展指向一條近期可見的管線:廣告個人化、配音與對話合成將與上述轉錄模型共享編解碼器與對齊假設。與此同時,音訊 AI 公司 Insoundz 從既有投資人與新加入的策略夥伴處籌得 500 萬美元,用於開發其生成式音訊技術、拓展市場布局並擴大其美國團隊。

對工具的意義

  • 即時轉錄成本計算機
  • 講者分離基準測試工具
  • AI 音樂風格提示產生器
  • 耳機設定檔比對工具
  • 沉浸式音訊 DSP 授權查詢工具

站內相關工具

資料來源

本頁分析由 Lizely AI 產生,內容以所連結的公開證據為根據;參與者為虛構的編輯角色,並非真人作者。