Skip to content

音影片與即時轉錄模型配置

WiseMindAI 提供兩類語音辨識能力:

  1. 音影片轉錄:處理已經存在的音訊或影片檔案,用於生成字幕、摘要和看點。
  2. 即時轉錄:接收麥克風的連續聲音,用於會議、課堂和訪談的即時逐字稿。

兩類功能在「設定 → 模型設定」中分別顯示。線上服務商可能需要單獨開通檔案轉寫和即時語音辨識;FunASR 本機模型則可以在兩個入口共用。

使用線上服務 Key 產生的費用,完全由對應模型服務商收取,與 WiseMind AI 無關。

音影片轉錄模型

服務提供商申請地址其他說明
本機 Whisper無需申請下載本機 Whisper 模型後使用,適合離線處理
FunASR無需申請支援本機音訊轉寫,並與即時轉錄共用模型
智譜 AI獲取 API Key支援線上音影片轉寫
阿里雲百煉獲取 API Key支援透過百煉音影片模型轉寫檔案
小米 MiMo獲取 API Key支援 MiMo 音訊辨識模型
階躍星辰獲取 API Key支援線上音訊轉寫
火山引擎開啟控制台需要按控制台要求開通語音辨識服務

生成影片字幕、匯入錄音轉寫時,請在「音訊模型」中選擇這類服務。完整影片使用方式可以查看:影片學習

即時轉錄模型

服務提供商申請地址主要配置
FunASR無需申請下載或匯入本機模型,不需要 API Key
阿里雲百煉獲取 API KeyAPI Key、Workspace ID、地區和模型名稱
火山引擎開啟控制台API Key、資源 ID 和介面位址
科大訊飛開通即時語音轉寫App ID、AccessKey ID 和 AccessKey Secret
百度智能雲開啟語音辨識控制台App ID、API Key、Secret Key 和辨識模型
騰訊雲獲取雲 API 金鑰App ID、Secret ID、Secret Key 和引擎模型

不同版本開放的平台可能不同,請以客戶端「即時轉錄」模型列表為準。

配置完成後,可以直接點擊模型卡片中的「測試」。測試會播放一段內建短音訊,並顯示辨識文字、首段返回時間和總耗時,不會建立正式轉錄記錄。

WiseMindAI 即時轉錄模型

FunASR 本機轉錄

FunASR 適合希望錄音不上傳、離線也能繼續轉錄,或不想產生雲端轉錄費用的場景。目前提供中英輕量版、中英高精度版和粵語專用版。

模型可以直接在 WiseMindAI 中下載,也可以匯入準備好的離線套件或已經解壓縮的模型資料夾。匯入前會檢查檔案是否完整、模型類型是否正確,以及電腦空間是否足夠。

WiseMindAI 即時轉錄模型

完整使用流程可以查看:即時轉錄

配置建議

  1. 先在服務商控制台開通對應產品,並確認帳號有可用額度。
  2. 按 WiseMindAI 表單填寫驗證資訊,不要把一般語音辨識產品的參數填到即時轉錄中。
  3. 儲存後先使用「測試」確認配置,再開始長時間錄音或處理大檔案。
  4. 即時轉錄還要單獨檢測麥克風,模型測試正常不代表系統已經授予錄音權限。
  5. 不同平台支援的語言、檔案大小、單次時長和計費規則不同,正式使用前請查看服務商說明。

常見問題

為什麼音訊檔案可以轉寫,但即時錄音不能使用?

如果使用線上平台,檔案轉寫和即時轉錄可能屬於服務商的不同產品,請進入「即時轉錄」分類重新配置並測試。如果使用 FunASR,請確認已經準備好本機模型,並在兩個入口都選擇 FunASR。

為什麼即時轉錄測試提示沒有權限?

通常是目前帳號只建立了金鑰,但沒有開通對應即時語音辨識產品,或者所填模型、地區和資源 ID 與已開通服務不一致。

本機 Whisper 可以用於即時轉錄嗎?

目前本機 Whisper 主要用於處理已經存在的音影片檔案。如果希望在本機進行即時錄音,請使用 FunASR。

線上轉錄會產生費用嗎?

多數線上平台會按音訊時長或請求量收費,具體費用和免費額度由服務商決定。WiseMindAI 不會額外收取模型呼叫費用。FunASR 在目前電腦上執行,不會產生雲端轉錄費用。