
Vosk 離線語音識別 5 分鐘跑通20 語言、流式識別、說話人識別全都有【免費下載鏈接】vosk-apiOffline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node項目地址: https://gitcode.com/GitHub_Trending/vo/vosk-apiVosk 是一個完全在本地運行的離線語音識別工具包模型約 50MB裝上就能把英語、中文、日語等 20 多種語言的音頻轉成文字全程不聯網。識別結果不出設備流式 API 延遲極低同一套代碼從樹莓派、Android 手機一直能用到服務器集群。為什么先考慮離線語音識別很多場景里把音頻發到云端換文字既慢又不合適數據不出設備醫療記錄、會議錄音這類敏感音頻本地處理最穩妥實時性基于流式 API 邊收音邊出結果適合實時字幕、語音助手可用性斷網環境照常工作也沒有 API 調用成本最小上手路徑模型下載與放置位置整條鏈路分三步裝庫、放模型、喂音頻。git clone https://gitcode.com/GitHub_Trending/vo/vosk-api pip install vosk模型的放置有三種方式見 python/example/test_simple.py 的注釋Model(langen-us)首次調用自動下載并緩存Model(model_namevosk-model-en-us-0.21)按名稱加載Model(models/en)直接指向你手動解壓的本地目錄。核心調用不到十行下面是簡化版 demofrom vosk import Model, KaldiRecognizer, SetLogLevel SetLogLevel(-1) model Model(langen-us) # 首次運行自動下載模型 rec KaldiRecognizer(model, 16000) rec.SetWords(True) # 輸出詞級時間戳輸入音頻要求是 16kHz、單聲道、16-bit PCM 的 WAV 文件。完整寫法直接看 python/example/ 目錄里面有 17 個示例腳本。能力細節逐項展開流式識別。調用rec.AcceptWaveform(data)分段喂音頻PartialResult()返回中間結果Result()返回整段終稿。開著SetWords(True)后每個詞都帶 start/end 時間戳和置信度做實時字幕就靠這個。字幕生成。python/example/test_srt.py 輸出 SRTtest_webvtt.py 輸出 WebVTT。命令行場景可以直接用內置 transcriberpython -m vosk.transcriber -m vosk-model-en-us-0.21 input.wav -o out.srt它內部會調 ffmpeg 重采樣輸出支持 srt、txt、json 三種格式源碼在 python/vosk/transcriber/。批量處理。test_gpu_batch.py 演示多 worker 批量識別go/batch_example/ 是 Go 版對照示例。說話人識別。test_speaker.py 里用SpkModel加載聲紋模型識別結果中會帶spk字段拿余弦距離和庫里存的指紋比對就能區分是誰在說話。多語言綁定按技術棧選目錄倉庫給每種語言都留了目錄選對應入口即可目錄說明python/綁定最全example/ 下示例最多java/ 和 android/Java 庫加 Android 服務封裝SpeechService.java 處理錄音權限和生命周期kotlin/Kotlin Multiplatform 綁定覆蓋 jvm/android/native 三個目標nodejs/demo/ 里有麥克風、ffmpeg 轉流、說話人識別示例csharp/附帶 nuget/ 下的 NuGet 打包配置go/通過 CGO 綁定example/ 是最小 demosrc/C 核心vosk_api.h就是全部 C 接口選型與避坑清單注意這幾處能少走很多彎路WAV 格式不達標會直接退出非單聲道 16-bit PCM 的輸入示例腳本會報錯終止。手頭是 mp3 就用 ffmpeg 轉test_ffmpeg.py 給了現成命令模型大小標準模型約 50MB內存緊張的設備樹莓派、手機優先考慮這個量級追求準確率再上大模型日志開關SetLogLevel(-1)關掉調試輸出生產環境建議加上Go 批量示例libvosk.so必須在庫路徑里否則會加載失敗見 go/batch_example/README.md說話人識別短于 4 秒的語音片段x-vector 指紋不可靠test_speaker.py末尾專門注明了這一點項目入口導航跑示例、抄代碼python/example/看核心實現src/ 下的recognizer.cc、model.cc自訓語言模型training/基于 Kaldi 的訓練腳本跨平臺構建CMakeLists.txt 和 travis/ 里的 Docker 構建腳本建議下一步先用本地音頻跑一遍 python/example/test_simple.py確認鏈路通了再讀 test_srt.py 接字幕輸出。【免費下載鏈接】vosk-apiOffline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node項目地址: https://gitcode.com/GitHub_Trending/vo/vosk-api創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考