ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

RVC变声器:10分钟语音训练出可用的AI音色模型

RVC变声器:10分钟语音训练出可用的AI音色模型 RVC变声器10分钟语音训练出可用的AI音色模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI通常简称 RVC是一个开源的语音音色转换框架用网页界面完成从音频处理到模型推理的全部流程。它最直接的承诺是准备 10 分钟左右的低底噪语音就能训出一个可用的音色模型实时变声的端到端延迟约 170ms。这三个场景是它的主场想做 AI 歌手过去需要自己搭 VITS 一类完整的语音合成管线处理特征、调试训练脚本周期以周计现在把歌手的人声素材丢进 RVC 的训练选项卡点一键训练得到 .pth 模型后上传一段旋律清唱就能转换。想在直播或游戏里实时变声过去要凑齐多个开源工具的命令行环境现在双击go-realtime_gui.bat打开实时变声界面选模型、选麦克风对着说话即可。README 说明使用 ASIO 声卡设备时延迟可以进一步降到 90ms。想清理录音素材过去人声伴奏分离要单独跑去混响、去回声工具现在 WebUI 里内置了 UVR5 选项卡人声伴奏分离、DeEcho、DeReverb 在同一条流程里完成输出结果直接可当作训练集。三步完成首次运行环境要求一句话带过Python 3.12 x64Ubuntu 推荐 24.04NVIDIA 显卡按 CUDA 版本选依赖清单requirments_cu118_py312.txt或requirments_cu128_py312.txt没有 N 卡就装requirments_cpu_py312.txt。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python3.12 -m venv .venv source .venv/bin/activate pip install -r requirments_cpu_py312.txt python webui.py启动后浏览器会自动打开本地页面默认端口 7865。Windows 用户也可以用仓库自带的go-webui.bat它走随包的 runtime 环境。依赖装好之后还差预训练模型用 huggingface_hub 拉到 assets 目录保持 README 约定的路径结构hubert_base、rmvpe、pretrained、pretrained_v2 等pip install --upgrade huggingface_hub hf download lj1995/VoiceConversionWebUI --include hubert_base/* --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --local-dir assets/rmvpe hf download lj1995/VoiceConversionWebUI --include pretrained/* pretrained_v2/* --local-dir assets之后把待转换音频的 .pth 模型放进assets/weights/、索引文件放进assets/indices/打开模型推理选项卡上传音频第一次转换就出来了。版本、采样率、音高算法这样选选项适合谁一句话理由版本 v2新训练者的默认选择新模型结构WebUI 默认值底模在约 50 小时 VCTK 开源集上训练版本 v1需要用社区旧模型的人兼容存量模型库采样率只有 40k/48k 两档采样率 40k日常语音、显存紧张速度更快资源占用低采样率 48k素材本身是高音质上限更高但更吃显存带音高指导唱歌场景界面原话唱歌一定要语音可以不要音高算法 rmvpe默认选择速度快、资源占用小能根绝哑音问题音高算法 pm无 GPU 跑 rmvpe 时纯 CPU 方案推理选项卡另有 fcpe 可选检索特征占比 index_rate推理时微调调高更贴近训练集音色、防音色泄露调低音质更依赖源音频训练轮数total_epoch界面默认 20FAQ 的建议是训练集底噪大时 20~30 轮足够高音质、低底噪、时长多的数据可以提到 200。一分钟理解检索机制RVC 名字里的 Retrieval检索指这件事推理时不只靠模型本身还会从训练集特征里做 top1 最近邻检索把检索到的训练集特征替换输入源的特征再合成从而杜绝音色泄露。打个比方它像是给目标音色做了一张「声纹档案卡」——你每次说话系统先拿这句话去档案卡里查一个最接近的参照再按参照的音色重新发声所以无论源音频是谁、音质如何输出都稳定落在训练集那个人的音色上。index_rate 就是档案卡与原始声音的配比。踩坑速查现象大概率原因一行解法备注ffmpeg error / utf8 error不是 ffmpeg 的锅是路径带空格、括号或中文把训练集路径改成纯英文无空格FAQ 里最常见的误判Cuda out of memory显存不够训练缩小 batch_size推理调小 configs/config.py 里的 x_pad、x_query、x_center4G 以下显存基本放弃推理列表里没有刚训的音色列表未刷新点「刷新音色列表」还没有就查 logs/实验名 下的日志一键训练完成但没生成索引训练集太大内存 add 索引卡住再次点击「训练特征索引」索引文件生成在 assets/indices分享模型时对方报 f0、tgt_sr 等 key 缺失把 logs 下的实验大 pth 直接拿去推理用 ckpt 选项卡的「小模型提取」导出 60MB 的 pth 再分享分享 weights 下的小模型加索引Expecting value: line 1 column 1系统全局代理干扰关闭局域网/全局代理服务器上的 http_proxy 也要 unset控制台黑窗口被关掉会报 Connection Error往深里看webui.py全部选项卡、一键训练流程与参数入口都在这里2000 行左右是理解界面行为最快的入口train/preprocess.py数据切分与归一化配合 train/dataset/slicer2.py 看切片逻辑infer/vc/pipeline.py单次与批量推理的完整管线检索占比、音量包络融合都发生在这里infer/rmvpe.pyRMVPE 音高提取网络的推理代码docs/cn/faq.md官方中文 FAQ上面速查表之外的细节都以它为准两个延伸方向想混合两个音色用 ckpt 选项卡的模型融合ckpt-merge按权重合成新模型想跑实时变声入口是 realtime_gui.py音频切块时长、阈值、交叉淡入等参数都写在 GUIConfig 里。建议先凑齐 10 分钟干净低噪的人声素材用默认参数跑通一次完整流程再谈调参唱歌用途务必打开音高指导训练完在模型推理选项卡里先听一遍再决定是否加索引。仓库按 MIT 协议开源导出声音的责任由使用者自行承担商用前先看清 LICENSE 条款。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表