ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Sherpa-Onnx 入门指南:5 分钟跑通离线语音识别与语音合成

Sherpa-Onnx 入门指南:5 分钟跑通离线语音识别与语音合成 Sherpa-Onnx 入门指南5 分钟跑通离线语音识别与语音合成【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx想把语音助手装到树莓派上又不想把用户语音传到云端Sherpa-Onnx 解决的就是这个问题离线语音识别、语音合成、说话人识别全部本地运行全程不联网。一条pip install sherpa-onnx之后对着麦克风说话就能出文字。快速上手从安装到出声音的 3 步你只需要 Python 环境。第一步pip install sherpa-onnx装完即可import sherpa_onnx。第二步下载一个预训练模型模型文件都是现成的无需训练。第三步直接跑仓库里的脚本比如 python-api-examples/speech-recognition-from-microphone.py传入--tokens、--encoder、--decoder三个模型文件路径对着麦克风说话文字实时蹦出来。整个过程不到 5 分钟没有一行网络请求。如果你不想写代码仓库里连 App 都给你做好了flutter-examples/tts/ 是一个跨平台的 Flutter 语音合成 Demo输入一段中文点 Generate 就能播放。macOS 版跑出来长这样4.3 秒的语音只用了 1.3 秒生成RTF 0.305也就是比实时快三倍。核心能力拆解它具体能干什么语音识别实时出字也能整段转写对着麦克风说话文字实时蹦出来或者先录完一整段再转两种模式都有。中文、英文、粤语、日语、韩语、法语、俄语、泰语都有对应模型会议实时字幕这种场景就是流式模式最典型的用法。语音合成输入中文直接出声上面那张 Flutter Demo 的截图就是它干的活。文本丢进去出来的 wav 文件能直接播放支持多音色切换界面上那个 Speaker ID 滑块。Piper、Matcha、Kokoro 等引擎可选中文和英文都有适合做离线朗读、语音导航这类应用。语音活动检测与说话人相关Silero-VAD 模型负责判断现在有没有人在说话是唤醒词、会议分段的基础往上做说话人分离这段话里谁说了什么和说话人识别这是谁也都有对应 API不用自己拼管道。顺手可用的附加能力语音增强去背景噪声、音频标签识别音乐类型、环境声、关键词唤醒、自动加标点、音源分离每个功能在 c-api-examples/ 和 python-api-examples/ 里都有独立示例拿来就能跑。多平台与多语言覆盖平台架构语言绑定桌面Windows / macOS / Linuxx64、x86、arm64C、C、Python、C#、Go、Rust、JavaScript、Pascal移动Android / WearOS / iOS / HarmonyOSarm64、arm32、x64Java、Kotlin、Swift、Dart嵌入式树莓派、Jetson、RISC-V 板卡、RK/Ascend NPUarm32、arm64、riscv64C / C浏览器WebAssemblyx86JavaScript基本是你能想到的设备都覆盖了12 种语言绑定加上 WASM 版可以直接在浏览器里跑离线识别和合成一台 Cortex A7 的树莓派也有专门的 14M 参数轻量模型。实战场景与示例Web 端实时字幕python-api-examples/web/ 里是一个基于 WASM 的浏览器 Demo页面提供上传音频文件识别和实时录音识别两个入口起个本地服务器就能在 Chrome 里体验离线语音识别适合做在线课堂字幕、远程会议工具。跨平台语音合成 Appflutter-examples/tts/ 一份代码同时覆盖 Android、iOS、Linux、macOS、Windows 五个平台Windows 版运行效果如下——文本输入框、音色滑块、Generate/Play 按钮合成完直接把 wav 存到磁盘桌面语音输入用 C# 或 Go 绑定接一个流式识别就是说话自动打字。README 里列了不少社区项目语音速记软件、游戏互动工具、智能音箱都是这个思路仓库根目录的 README.md 有完整清单可参考。模型与部署模型都是现成下载不用自己训练Whisper多语言识别的兜底选择tiny.en 小模型在低端设备上也能跑Paraformer中英识别主力还支持多种中文方言Zipformer轻量流式模型14M 版本专为 Cortex A7 这类弱 CPU 准备SenseVoice中、粤、英、日、韩五语混合识别Piper / Matcha / KokoroTTS 三选一中英都有Silero-VAD语音活动检测几 MB 的小模型部署方式按场景选本地离线服务器或桌面纯 CPU 即可/ 移动端现成的 Android APK 和 Flutter、Tauri 预编译包/ 嵌入式树莓派、RISC-V、RK NPU 官方支持/ WebWASM 在浏览器里直接跑用户零安装。社区与资源仓库根目录的 README.md 是最全的入口预编译 APK、Flutter/Tauri 应用、模型下载地址都列在里面CHANGELOG.md 记录了每个版本的新增功能更新节奏相当快。各语言的示例目录go-api-examples/、nodejs-examples/、rust-api-examples/可以直接当学习材料读。回到开头那个问题语音数据留在本地不产生 API 费用树莓派上照样能跑。git clone https://gitcode.com/GitHub_Trending/sh/sherpa-onnx拉下来先跑python-api-examples/里的麦克风识别脚本10 分钟之内你就能听到自己的声音被机器读出来。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表