ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

RVC语音克隆上手教程:10分钟语音数据训练出可用音色模型

RVC语音克隆上手教程:10分钟语音数据训练出可用音色模型 RVC语音克隆上手教程10分钟语音数据训练出可用音色模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI通常简称RVC是一个开源的语音转换VC框架它的核心卖点是一个数字只需要10分钟以内的低底噪语音就能训练出一个音色可用的模型。RVC是什么基于VITS的开源语音转换框架RVC是一个基于VITS架构的变声框架以网页界面覆盖数据集处理、模型训练到推理的全流程。它针对个人开发者的硬件条件做了适配N卡、A卡、I卡均可运行4GB以上显存就能开始训练。原理上RVC通过top1检索机制把输入源的语音特征替换为训练集中的特征以此抑制音色泄漏这也是它用少量数据也能得到可用音色的原因。项目采用MIT协议底模由接近50小时的VCTK数据集训练而来可自由使用与分发。最小验证路径从装好依赖到第一次出声最短链路是装依赖 → 放置预训练模型 → 启动WebUI → 一键训练 → 推理验证。以下三个阶段各有一个明确的校验点。依赖与预训练模型装好后的验证方法完成后应看到执行启动命令后浏览器自动打开7865端口的训练推理界面端口冲突时可在配置文件中修改。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt接着把几个预训练模型放入assets/目录hubert/hubert_base.pt、pretrainedv1或pretrained_v2、uvr5_weights使用RMVPE音高提取还需把rmvpe.pt放在根目录。tools/download_models.py提供了批量下载脚本。最后python infer-web.py常见偏差漏装ffmpeg时数据处理阶段必然报错。Windows用户需把ffmpeg.exe、ffprobe.exe放入项目根目录Linux/macOS用包管理器安装即可。第一次训练的参数怎么填完成后应看到控制台输出Training is done. The program is closed.且weights文件夹出现一个60MB以上的.pth文件。操作准备几分钟干净人声并切成3~10秒的片段把目录填进训练选项卡。显存不足时batch_size调到1~4训练集底噪大的话20~30轮够用音质干净且时长多可以加到200。点击一键训练它会依次完成数据集切分、音高提取、模型训练和索引添加。常见偏差训练集底噪大时加训练轮数救不回音质应先清洗素材而不是调参数。训练完成后如何验证并推理完成后应看到推理选项卡中刷新音色后能选中新模型上传测试音频并转换后得到输出wav。操作模型下拉菜单选择weights里的.pth音高提取选默认的RMVPEindex rate从0.6左右开始试f0up_key填半音数正数升调、负数降调0表示不变。常见偏差下拉菜单看不到新音色时先确认weights里确有60MB以上的.pth再对照下文排查。训练推理阶段的四个常见报错ffmpeg error / utf8 error现象数据处理阶段报ffmpeg error或写入文件列表时报utf8编码错误。 原因多数不是ffmpeg本身的问题而是训练集路径里含空格、括号等符号或中文。 解法把训练集目录挪到纯ASCII的短路径下重跑。一键训练结束但没有索引文件现象训练显示完成却找不到added开头的.index文件。 原因训练集过大时添加索引的步骤会卡住内存中直接建索引的开销过高。 解法单独回到索引选项卡再次点击训练索引以批处理方式补建。拿错了模型文件去分享或推理现象把logs下几百MB的.pth复制到weights强行推理报f0、tgt_sr等key不存在。 原因那个文件是保存训练状态、用于复现与继续训练的完整checkpoint不是推理模型。 解法分享和使用weights下60MB以上的.pth确需使用logs里的文件先在ckpt选项卡底部做ckpt小模型提取。Cuda out of memory现象训练或推理过程中报显存不足。 原因显存不够4GB以下的显卡基本无法运行。 解法训练时调小batch_size推理时调小configs/config.py末尾的x_pad、x_query、x_center、x_max。跑通之后模型融合与实时变声模型融合ckpt选项卡支持把两个.pth按权重融合成新模型。当训出的音色过于贴源或存在明显漂移时混入另一个风格不同的模型比重新训练更快地微调音色方向。实时与批量推理直播或变声场景用go-realtime-gui.bat启动实时界面端到端延迟约170ms配ASIO设备可压到90ms左右。离线处理大批量素材则直接调用tools/infer_batch_rvc.py避免在网页里逐个操作。回到开头那个数字10分钟的低底噪语音足以产出一个可推理的模型。 下一步动作录或整理出10分钟目标人声放入训练目录按上面这条最短链路完整跑一遍。 卡住时可先对照常见问题文档逐步排查。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表