Skip to content

音影片與即時轉錄模型配置 ​

WiseMindAI 提供兩類語音辨識能力:

  1. 音影片轉錄:處理已經存在的音訊或影片檔案,用於生成字幕、摘要和看點。
  2. 即時轉錄:接收麥克風的連續聲音,用於會議、課堂和訪談的即時逐字稿。

兩類功能在「設定 → 模型設定」中分別顯示。線上服務商可能需要單獨開通檔案轉寫和即時語音辨識;FunASR 本機模型則可以在兩個入口共用。

使用線上服務 Key 產生的費用,完全由對應模型服務商收取,與 WiseMind AI 無關。

音影片轉錄模型 ​

服務提供商申請地址其他說明
本機 Whisper無需申請下載本機 Whisper 模型後使用,適合離線處理
FunASR無需申請支援本機音訊轉寫,並與即時轉錄共用模型
智譜 AI獲取 API Key支援線上音影片轉寫
阿里雲百煉獲取 API Key支援透過百煉音影片模型轉寫檔案
小米 MiMo獲取 API Key支援 MiMo 音訊辨識模型
階躍星辰獲取 API Key支援線上音訊轉寫
火山引擎開啟控制台需要按控制台要求開通語音辨識服務

生成影片字幕、匯入錄音轉寫時,請在「音訊模型」中選擇這類服務。完整影片使用方式可以查看:影片學習。

即時轉錄模型 ​

服務提供商申請地址主要配置
FunASR無需申請下載或匯入本機模型,不需要 API Key
阿里雲百煉獲取 API KeyAPI Key、Workspace ID、地區和模型名稱
火山引擎開啟控制台API Key、資源 ID 和介面位址
科大訊飛開通即時語音轉寫App ID、AccessKey ID 和 AccessKey Secret
百度智能雲開啟語音辨識控制台App ID、API Key、Secret Key 和辨識模型
騰訊雲獲取雲 API 金鑰App ID、Secret ID、Secret Key 和引擎模型

不同版本開放的平台可能不同,請以客戶端「即時轉錄」模型列表為準。

配置完成後,可以直接點擊模型卡片中的「測試」。測試會播放一段內建短音訊,並顯示辨識文字、首段返回時間和總耗時,不會建立正式轉錄記錄。

WiseMindAI 即時轉錄模型

FunASR 本機轉錄 ​

FunASR 適合希望錄音不上傳、離線也能繼續轉錄,或不想產生雲端轉錄費用的場景。目前提供中英輕量版、中英高精度版和粵語專用版。

模型可以直接在 WiseMindAI 中下載,也可以匯入準備好的離線套件或已經解壓縮的模型資料夾。匯入前會檢查檔案是否完整、模型類型是否正確,以及電腦空間是否足夠。

WiseMindAI 即時轉錄模型

完整使用流程可以查看:即時轉錄。

配置建議 ​

  1. 先在服務商控制台開通對應產品,並確認帳號有可用額度。
  2. 按 WiseMindAI 表單填寫驗證資訊,不要把一般語音辨識產品的參數填到即時轉錄中。
  3. 儲存後先使用「測試」確認配置,再開始長時間錄音或處理大檔案。
  4. 即時轉錄還要單獨檢測麥克風,模型測試正常不代表系統已經授予錄音權限。
  5. 不同平台支援的語言、檔案大小、單次時長和計費規則不同,正式使用前請查看服務商說明。

常見問題 ​

為什麼音訊檔案可以轉寫,但即時錄音不能使用? ​

如果使用線上平台,檔案轉寫和即時轉錄可能屬於服務商的不同產品,請進入「即時轉錄」分類重新配置並測試。如果使用 FunASR,請確認已經準備好本機模型,並在兩個入口都選擇 FunASR。

為什麼即時轉錄測試提示沒有權限? ​

通常是目前帳號只建立了金鑰,但沒有開通對應即時語音辨識產品,或者所填模型、地區和資源 ID 與已開通服務不一致。

本機 Whisper 可以用於即時轉錄嗎? ​

目前本機 Whisper 主要用於處理已經存在的音影片檔案。如果希望在本機進行即時錄音,請使用 FunASR。

線上轉錄會產生費用嗎? ​

多數線上平台會按音訊時長或請求量收費,具體費用和免費額度由服務商決定。WiseMindAI 不會額外收取模型呼叫費用。FunASR 在目前電腦上執行,不會產生雲端轉錄費用。