ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

RVC变声指南:30分钟从零配置到首个模型训练

RVC变声指南:30分钟从零配置到首个模型训练 RVC变声指南30分钟从零配置到首个模型训练【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUIRVC是一个开源语音转换框架喂给它 10 分钟目标人声就能训练出音色模型把任意音频转成该音色。它自带网页版训练与推理界面和实时变声器支持 CPU、NVIDIA 以及 AMD/Intel 显卡MIT 协议。本文按一条主线讲清两件事在一台新机器上跑通首次语音转换以及如何训练自己的音色模型。RVC 是什么RVC 做的是训练 推理的音色转换而不是端到端黑盒推理时用 top1 检索把输入源特征替换为训练集特征用来抑制原说话人的音色泄漏。底模基于约 50 小时的开源 VCTK 数据集训练无版权问题。入口有两个WebUI 负责训练和文件转换实时 GUI 负责直播变声端到端延迟 170ms配 ASIO 设备可到 90ms。环境准备Python 3.12、显卡与模型清单系统与硬件要求Python 3.12 x64建议用虚拟环境Ubuntu 用户推荐 24.04 x86_64并安装 ffmpegWindows 用户把 ffmpeg.exe、ffprobe.exe 放进项目根目录即可不强制 NVIDIA 卡显存低于 4GiB 或旧架构会自动回落到 CPUPascal 和 GTX 16 系用 fp32更新的卡用 fp16检测逻辑在 configs/config.py依赖安装选择硬件依赖文件说明CPU / AMD / Intelrequirments_cpu_py312.txtWindows 走 DirectMLLinux 走 CPUNVIDIARTX 50 系以前requirments_cu118_py312.txt先装 torch 2.7.1cu118NVIDIA RTX 50 系requirments_cu128_py312.txt先装 torch 2.7.1cu128主流程克隆到首次转换的四步第一步克隆仓库并安装依赖git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI python -m pip install -r requirments_cpu_py312.txt # 按硬件换成对应文件装完执行一行 Python 命令打印 torch 版本与 cuda 可用性看到 True 说明 GPU 就绪CPU 环境可忽略。第二步把预训练模型放进 assets 目录用 huggingface_hub 命令从官方模型仓库 lj1995/VoiceConversionWebUI 下载最少需要的文件assets/hubert_base/Hubert 特征模型推理必需assets/rmvpe/rmvpe.pt音高提取模型Windows AMD/Intel 环境另需 rmvpe.onnxassets/pretrained/与assets/pretrained_v2/训练要用的 v1/v2 预训练模型assets/uvr5_weights/仅在使用人声伴奏分离时必需把 mute.zip 解压到logs/下得到静音样本第三步启动 WebUI 并完成首次转换python webui.py默认监听 7865 端口无桌面服务器加--noautoopen。界面有四个主标签页模型推理单次/批量、伴奏人声分离与去混响去回声、训练、ckpt 处理。首次转换走单次推理选一个 pretrained_v2 下的模型上传一段音频音高提取选 rmvpeindex_rate 保持默认 0.5点开始听完输出再谈调参。训练自己的音色模型数据、流程与症状速查准备 10 分钟低底噪音频至少收集 10 分钟干净的目标人声。源音频带伴奏或底噪的先用分离标签页抽出人声。预处理会自动切片默认能量阈值 -40dB单段最短 5 秒每刀保留的静音不超过 0.5 秒。训练流程与关键参数训练标签页支持一键跑完或分步执行切片预处理 → 提取 F0 与 Hubert 特征 → 训练模型。常用配置采样率 48k、音高算法 rmvpe、总轮次 100-200、batch_size 按显存调整爆显存就降到 1-2。训练结束后要再跑一次训练索引生成 .index 文件。常见现象、原因与处理现象原因处理输出和输入音色像未启用索引或模型欠拟合推理时选中对应 .index增加轮次音色发金属感index_rate 偏高或数据带噪从 0.5 下调换更干净的数据输出断句、卡顿F0 提取出错换 rmvpe 重新提取底噪残留训练集信噪比低先过分离标签页检查切片阈值训练很慢显存或 batch 受限降 batch_size开启特征缓存典型问题速查6 个高频项端口被占用冲突时 webui.py 会自动换用空闲端口按控制台输出打开浏览器即可。AMD/Intel 无加速选 cpu 依赖包Windows 自动启用 DirectMLLinux 用 CPU音高提取需补下 rmvpe.onnx。训练爆显存降 batch_size或把采样率降到 32k 再跑。训练后找不到模型.pth 在 assets/weights/索引在 assets/indices/刷新模型列表重新加载。分离效果差换 UVR5 模型试试MDX-Net 与 BS-RoFormer 实现在 tools/uvr5/ 目录。界面语言i18n/locale/ 下放了 13 种语言包可在 WebUI 内切换。深入资源核心源码与文档入口核心源码模块地图infer/推理流水线 vc/pipeline.py、RVC 模型结构 vc/module、特征提取 hubert.py、音高提取 rmvpe.py 与 fcpe.pytrain/预处理 preprocess.py、切片 slicer2.py、F0 提取 extract_f0.py、训练入口 train.py、索引 train_index.py、模型融合与小模型提取 process_ckpt.pyckpt 处理标签页对应上述脚本支持权重融合、信息修改官方文档与多语言资源中文常见问题docs/cn/faq.md英文训练指南docs/en/training_tips_en.mddocs/ 下另有日文、韩文、法文、土耳其文、葡萄牙文 README 与 faiss 检索使用笔记下一步清单完成环境安装确认 torch 能识别到 GPU 或按计划走 CPU。下载预训练模型启动 WebUI用 pretrained_v2 跑通一次单次推理。收集 10 分钟低底噪数据完成一次完整训练并生成索引文件。用同一段输入对比用索引/不用索引的输出记录音色相似度差异。在 Windows 上试一次实时变声入口 go-realtime_gui.bat实测麦克风到扬声器的延迟。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表