音影片與即時轉錄模型配置
WiseMindAI 提供兩類語音辨識能力:
- 音影片轉錄:處理已經存在的音訊或影片檔案,用於生成字幕、摘要和看點。
- 即時轉錄:接收麥克風的連續聲音,用於會議、課堂和訪談的即時逐字稿。
兩類功能在「設定 → 模型設定」中分別顯示。線上服務商可能需要單獨開通檔案轉寫和即時語音辨識;FunASR 本機模型則可以在兩個入口共用。
使用線上服務 Key 產生的費用,完全由對應模型服務商收取,與 WiseMind AI 無關。
音影片轉錄模型
| 服務提供商 | 申請地址 | 其他說明 |
|---|---|---|
| 本機 Whisper | 無需申請 | 下載本機 Whisper 模型後使用,適合離線處理 |
| FunASR | 無需申請 | 支援本機音訊轉寫,並與即時轉錄共用模型 |
| 智譜 AI | 獲取 API Key | 支援線上音影片轉寫 |
| 阿里雲百煉 | 獲取 API Key | 支援透過百煉音影片模型轉寫檔案 |
| 小米 MiMo | 獲取 API Key | 支援 MiMo 音訊辨識模型 |
| 階躍星辰 | 獲取 API Key | 支援線上音訊轉寫 |
| 火山引擎 | 開啟控制台 | 需要按控制台要求開通語音辨識服務 |
生成影片字幕、匯入錄音轉寫時,請在「音訊模型」中選擇這類服務。完整影片使用方式可以查看:影片學習。
即時轉錄模型
| 服務提供商 | 申請地址 | 主要配置 |
|---|---|---|
| FunASR | 無需申請 | 下載或匯入本機模型,不需要 API Key |
| 阿里雲百煉 | 獲取 API Key | API Key、Workspace ID、地區和模型名稱 |
| 火山引擎 | 開啟控制台 | API Key、資源 ID 和介面位址 |
| 科大訊飛 | 開通即時語音轉寫 | App ID、AccessKey ID 和 AccessKey Secret |
| 百度智能雲 | 開啟語音辨識控制台 | App ID、API Key、Secret Key 和辨識模型 |
| 騰訊雲 | 獲取雲 API 金鑰 | App ID、Secret ID、Secret Key 和引擎模型 |
不同版本開放的平台可能不同,請以客戶端「即時轉錄」模型列表為準。
配置完成後,可以直接點擊模型卡片中的「測試」。測試會播放一段內建短音訊,並顯示辨識文字、首段返回時間和總耗時,不會建立正式轉錄記錄。

FunASR 本機轉錄
FunASR 適合希望錄音不上傳、離線也能繼續轉錄,或不想產生雲端轉錄費用的場景。目前提供中英輕量版、中英高精度版和粵語專用版。
模型可以直接在 WiseMindAI 中下載,也可以匯入準備好的離線套件或已經解壓縮的模型資料夾。匯入前會檢查檔案是否完整、模型類型是否正確,以及電腦空間是否足夠。

完整使用流程可以查看:即時轉錄。
配置建議
- 先在服務商控制台開通對應產品,並確認帳號有可用額度。
- 按 WiseMindAI 表單填寫驗證資訊,不要把一般語音辨識產品的參數填到即時轉錄中。
- 儲存後先使用「測試」確認配置,再開始長時間錄音或處理大檔案。
- 即時轉錄還要單獨檢測麥克風,模型測試正常不代表系統已經授予錄音權限。
- 不同平台支援的語言、檔案大小、單次時長和計費規則不同,正式使用前請查看服務商說明。
常見問題
為什麼音訊檔案可以轉寫,但即時錄音不能使用?
如果使用線上平台,檔案轉寫和即時轉錄可能屬於服務商的不同產品,請進入「即時轉錄」分類重新配置並測試。如果使用 FunASR,請確認已經準備好本機模型,並在兩個入口都選擇 FunASR。
為什麼即時轉錄測試提示沒有權限?
通常是目前帳號只建立了金鑰,但沒有開通對應即時語音辨識產品,或者所填模型、地區和資源 ID 與已開通服務不一致。
本機 Whisper 可以用於即時轉錄嗎?
目前本機 Whisper 主要用於處理已經存在的音影片檔案。如果希望在本機進行即時錄音,請使用 FunASR。
線上轉錄會產生費用嗎?
多數線上平台會按音訊時長或請求量收費,具體費用和免費額度由服務商決定。WiseMindAI 不會額外收取模型呼叫費用。FunASR 在目前電腦上執行,不會產生雲端轉錄費用。
