
Parakeet-tdt-0.6b-v2 實時語音識別快速指南【免費下載鏈接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages項目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx開一場離線會議你希望發(fā)言剛停、字幕就跟上來。sherpa-onnx 是一個不依賴聯(lián)網(wǎng)的本地語音工具箱把小米開源的 Parakeet-tdt-0.6b-v2 模型接進來之后它能在普通 CPU 上做到延遲低于 300ms 的實時語音識別——邊說邊出文字全程無網(wǎng)絡(luò)請求。這篇指南講清楚它適合誰、三步跑起來、參數(shù)怎么調(diào)。它是什么為什么值得試Parakeet-tdt-0.6b-v2 是小米發(fā)布的輕量級語音識別模型sherpa-onnx 將其轉(zhuǎn)換為 ONNX 格式本地推理ONNX 是跨平臺模型格式一套文件到處能跑主要面向英文場景。架構(gòu)Transformer-Transducer識別準(zhǔn)確率 98%模型體積壓縮到傳統(tǒng)方案的 1/3量化方式INT8把浮點權(quán)重壓成 8 位整數(shù)CPU 即可實時跑無需 GPU資源占用整套運行約需 2GB 內(nèi)存平臺覆蓋Linux / macOS / WindowsAndroid、iOS 等移動端同樣支持。5 分鐘跑通實時識別只需三步克隆倉庫、下載模型、運行示例。git clone https://gitcode.com/GitHub_Trending/sh/sherpa-onnx cd sherpa-onnx cmake -B build -DCMAKE_BUILD_TYPERelease cmake --build build -j4模型與 VAD 文件的獲取命令寫在示例文件頭部注釋里見 cxx-api-examples/parakeet-tdt-simulate-streaming-microphone-cxx-api.cc下載silero_vad.onnx和sherpa-onnx-nemo-parakeet-tdt-0.6b-v2-int8.tar.bz2解壓后與二進制文件放在同一目錄。然后./build/cxx-api-examples/parakeet-tdt-simulate-streaming-microphone-cxx-api程序打開默認(rèn)麥克風(fēng)對終端說話文字實時打印出來。構(gòu)建選項可在 CMakeLists.txt 中查看。從麥克風(fēng)到文字?jǐn)?shù)據(jù)流全解整條鏈路可以拆成四段1. 采音PortAudio 以 16000Hz、單聲道從麥克風(fēng)抓聲音16kHz 是語音識別的常用采樣率若設(shè)備采樣率不同程序內(nèi)部會線性重采樣對齊。2. VAD 切句VAD 是一個小分類模型負(fù)責(zé)判斷哪段是人聲、哪段是靜音。音頻按 512 個采樣點的窗口送入 VAD檢測到起聲后開始累積緩沖靜音持續(xù)超過設(shè)定時長就把整句送入結(jié)果隊列。下面的配置來自示例的CreateVad()核心就幾行VadModelConfig config; config.silero_vad.model ./silero_vad.onnx; config.silero_vad.threshold 0.5; // 人聲判定閾值 config.silero_vad.min_silence_duration 0.25; // 靜音多久算一句話說完 config.silero_vad.min_speech_duration 0.25; // 太短的人聲片段直接丟棄 config.silero_vad.max_speech_duration 5; // 一句話說太長就強制切分 config.sample_rate 16000;3. 三段式解碼模型分為 encoder把音頻變成聲學(xué)特征、decoder把特征變成文本、joiner把前兩者的輸出對齊融合配合tokens.txt詞表model_type設(shè)為nemo_transducer加載。4. 終端輸出說話期間每 0.2 秒把當(dāng)前緩沖送一次識別器得到中間結(jié)果即時顯示VAD 切出完整句子后做最終解碼整句定稿。這就是邊說邊出字的實現(xiàn)方式。4 個參數(shù)調(diào)到位參數(shù)建議值作用VAD threshold0.4–0.6人聲判定靈敏度調(diào)低更靈敏但環(huán)境噪聲容易被誤判為人聲解碼線程數(shù)2–4平衡推理速度與 CPU 占用對應(yīng)num_threads采樣率16000麥克風(fēng)采集與模型輸入統(tǒng)一用這個值波束寬度5–8搜索候選路徑的寬度噪聲環(huán)境下有助于提升準(zhǔn)確率調(diào)參順序建議先動 VAD 閾值和靜音時長解決斷句不對再動線程數(shù)解決跟不上語速。從 PC 到手機、再到服務(wù)移動端flutter-examples/README.md 里有 VAD 加非流式識別的麥克風(fēng)示例覆蓋 iOS / Android模型以離線方式打包進 App服務(wù)端python-api-examples/streaming_server.py 是 WebSocket 流式識別服務(wù)多客戶端可同時接入瀏覽器端界面效果如下。適合做什么會議實時字幕說話結(jié)束前文字已經(jīng)出來離線環(huán)境同樣可用直播字幕低延遲語音轉(zhuǎn)文字不依賴云端 API智能硬件語音輸入樹莓派、嵌入式設(shè)備等資源受限平臺客服錄音轉(zhuǎn)寫批量處理本地音頻文件。選型提示如果你的場景要求本地離線、低延遲、純 CPU 可跑它就是當(dāng)前 sherpa-onnx 中值得優(yōu)先考慮的方案。下一步把示例換掉麥克風(fēng)輸入、接上自己的業(yè)務(wù)代碼就是一個可用的實時轉(zhuǎn)寫服務(wù)。體驗命令見上文5 分鐘跑通一節(jié)版本更新看 CHANGELOG.md問題與討論可直接提 Issue。【免費下載鏈接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages項目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考