
录10分钟就能练一个自己的变声模型Retrieval-based-Voice-Conversion-WebUI 实操指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI录 10 分钟干净人声就能练出一个属于自己的 AI 变声模型。这是 Retrieval-based-Voice-Conversion-WebUI下文简称 RVC做的事。它是一个基于 VITS 架构VITS 是主流的语音合成架构RVC 输出的声音由它生成的网页版变声训练与推理框架主要解决两件事练音色模型需要的语音素材太多、变声结果串入说话人原本的音色。RVC 对你最有用的三件事RVC 不比参数对比的是你实际能拿到什么。10 分钟素材就够普通显卡能跑官方推荐的训练集时长是 10min 至 50min素材音质高、底噪低、音色统一的话5min 至 10min 也能用。整个训练过程在相对较差的显卡上也能完成不必为练一个音色专门升级硬件。防止“串味”变声时如果模型记住了输入音频的原始音色输出的声音会带着原说话人的特点这就是音色泄漏。RVC 的处理方式推理时从它训练时学过的音色里挑出最接近的特征顶掉输入特征再按目标音色合成。这个机制叫 top1 检索替换效果是输出基本只剩目标音色。人声分离和音高提取工具里顺手做了UVR5把素材里的人声和伴奏快速分开训练集不用手工清理伴奏。RMVPE音高说话时声音的高低提取算法即 InterSpeech2023-RMVPE。传统算法在哑音段检测不到音高声音会卡顿RMVPE 对这类情况处理得更好速度也更快、资源占用更小。从零到跑起来四步路线第 1 步拿到代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI不想配环境的话直接下载整合包RVC-beta.7z解压Windows 双击 go-web.batMacOS 执行sh ./run.sh。第 2 步依赖一次装齐通用要求Python 版本大于 3.8。先装 torch 及其核心依赖已装可跳过pip install torch torchvision torchaudioWindows 系统 Nvidia Ampere 架构RTX30xx的显卡按经验要指定 pytorch 对应的 cuda 版本pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117再按显卡类型安装硬件环境安装命令备注N 卡pip install -r requirements.txtcu117 情况见上A 卡 / I 卡DirectMLpip install -r requirements-dml.txtRMVPE 可换用 rmvpe.onnxA 卡 LinuxROCmpip install -r requirements-amd.txt先配驱动与用户组I 卡 LinuxIPEXpip install -r requirements-ipex.txt启动前需加载 oneapi 环境用 Poetry 管理依赖也可以先安装 Poetrycurl -sSL https://install.python-poetry.org | python3 -再执行poetry init -n poetry env use path to your python.exe poetry run pip install -r requirements.txt走 Poetry 时 Python 建议 3.7-3.10其余版本在安装 llvmlite0.39.0 时会冲突。MacOS 用户可以跳过本步直接sh ./run.sh脚本会处理依赖安装和预模型下载。AMD ROCmLinux另需要pacman -S rocm-hip-sdk rocm-opencl-sdk export ROCM_PATH/opt/rocm export HSA_OVERRIDE_GFX_VERSION10.3.0 sudo usermod -aG render $USERNAME sudo usermod -aG video $USERNAME部分型号显卡如 RX6700XT需要按实际情况配置HSA_OVERRIDE_GFX_VERSION。第 3 步预模型下载清单训练和推理依赖的预模型都放在 assets/ 下对照这份清单核对文件 / 目录用途assets/hubert/hubert_base.pt语音特征相关预模型assets/pretrainedv1 变声预训练模型assets/pretrained_v2v2 预训练模型要用 v2 才需要assets/uvr5_weightsUVR5 人声分离权重另外两件配套的事ffmpeg / ffprobe 必须可用。Ubuntu/Debiansudo apt install ffmpegMacOSbrew install ffmpegWindows下载 ffmpeg.exe 与 ffprobe.exe 放进 RVC 根目录。要用 RMVPE 就下载音高提取模型 rmvpe.ptA 卡 / I 卡用户可选用 rmvpe.onnx。不必逐个手动下tools/ 目录自带脚本tools/dlmodels.sh需要 aria2c或python tools/download_models.py都会自动核对上面清单并补齐缺的文件。第 4 步一条命令启动 WebUIpython infer-web.py之前用 Poetry 装的依赖改用poetry run python infer-web.pyI 卡 IPEX 用户Linux先执行source /opt/intel/oneapi/setvars.sh再启动。训练前先自查素材达不达标素材时长直接影响模型效果官方参考线如下素材时长结论10min - 50min推荐区间5min - 10min音质高、底噪低、音色统一时可以1min - 2min有人成功过但经验不可复现仅供参考1min 以下没有成功案例不建议尝试底线条件始终一致音质高、底噪低。音色有个人特色且统一的话素材多多益善。RVC 排障速查表症状可能原因处理读取或训练时报 ffmpeg error / utf8 error大概率不是 ffmpeg 本身的问题。路径带空格、() 等特殊符号会触发 ffmpeg error训练集路径带中文时写入 filelist.txt 会报 utf8 error路径改成纯英文、无空格、无特殊符号训练结束没有 added 开头的索引文件出现 Training is done. The program is closed. 说明模型已训好紧邻的报错是假的训练集太大会卡住添加索引步骤再点一次“训练索引”按钮索引已改用批处理 add缓解了内存需求过大的问题训练结束推理里看不到训练集的音色音色列表没刷新先点“刷新音色”仍不行就检查训练有没有报错把控制台输出、WebUI 截图和 logs/实验名 下的 log 整理出来给开发者看接下来你可以做先用 10 分钟干净素材完整跑一遍训练不改任何参数重点听输出音色、看 logs/ 下的记录。跑通全流程之后再去调索引相关参数遇到问题优先核对上面的速查表。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考