ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

RK3566 上跑通 sherpa-onnx 流式语音识别:RKNN 部署实战复盘

RK3566 上跑通 sherpa-onnx 流式语音识别:RKNN 部署实战复盘 RK3566 上跑通 sherpa-onnx 流式语音识别RKNN 部署实战复盘【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx先给结论RK3566 板子上sherpa-onnx一个构建在 ONNX Runtime 之上的开源语音工具集支持识别、合成、说话人分离等搭配 RKNN 2.2.0 运行时瑞芯微 NPU 的推理后端模型需先转成 .rknn 格式 中英双语流式 zipformer 预训练模型用下面这条命令可以稳定出结果sherpa-onnx \ --providerrknn \ --encoderencoder.rknn \ --decoderdecoder.rknn \ --joinerjoiner.rknn \ --tokenstokens.txt \ test.wav我们实测中踩了三个坑换对版本和模型类型后全部消失。下面是完整复盘。 RKNN 版本怎么选一张表说清三个候选版本的兼容性我们逐一验证过结果如下项目配置结论硬件RK3566 开发板NPU 可用但不支持核心绑定框架sherpa-onnx基于 ONNX Runtime需在板端现场编译模型sherpa-onnx 官方中英双语流式 zipformer 预训练模型转成 encoder/decoder/joiner 三个 .rknn tokens.txtRKNN 2.1.0报 Meet unsupported input dtype for gather弃用RKNN 2.2.0全程稳定✅ 当前唯一推荐RKNN 2.3.2段错误程序意外访问非法内存导致崩溃弃用 板端部署三步走取模型下载 sherpa-onnx 提供的流式 zipformer 中英双语预训练模型转成 RKNN 格式得到encoder.rknn、decoder.rknn、joiner.rknn三个文件和tokens.txt词表。仓库的转换脚本可参考 scripts/paraformer/rknn/ 下的流程。板端编译不要直接用 PC 交叉产物建议在板子上按目标架构直接编译 sherpa-onnx避免动态库与板子环境不匹配——这一步常被忽略却是最容易出诡异错误的环节。运行验证把一段测试音频拷进板子执行开头那条命令。能持续打印识别文本即部署成功。⚠️ 故障排查对照表现象原因处置段错误GDB 断点在 RKNN 运行时内部函数2.3.2 运行时与模型不兼容降级到 2.2.0Meet unsupported input dtype for gather2.1.0 对 Gather 算子按索引取值的基础操作的输入类型支持不全升级到 2.2.0换用离线模型二进制如 sherpa-onnx-vad-alsa-offline-asr后加载失败RKNN 目前只吃流式模型离线模型依赖完整 ONNX 文件.rknn 格式覆盖不了只选流式识别入口跑 RKNN第三行单独提醒一句选模型前先确认它是流式还是离线这两者的工具链不能混用否则会白白浪费排查时间。 调优与外推线程数num_threads按板子实际 CPU 核数设置多给不会更快反而加重调度开销。chunk 大小流式识别按块送音频调大 chunk 准确率略升但延迟变高反之亦然按业务场景取平衡点。核心绑定RK3566 不支持 NPU 核心绑定先别折腾如果之后迁移到 RK3588 这类高阶平台这项优化值得做。最后说两句sherpa-onnx 在 RK3566 上用 RKNN 跑流式语音识别这条路是通的前提就两条版本锁 2.2.0、模型只用流式。RKNN 运行时后续版本大概率会补齐算子支持并解锁更多模型值得定期看一眼更新说明说不定下一次升级就能换成新版。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表