ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

RVC语音转换:用10分钟录音练出一个能用的声音模型

RVC语音转换:用10分钟录音练出一个能用的声音模型 RVC语音转换用10分钟录音练出一个能用的声音模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是一个基于VITS的开源语音转换项目你提供十几分钟的人声录音它训练出一个能模仿该音色的模型再把任意音频转换过去。新手按其Web界面操作约10分钟数据即可得到可试听的结果。RVC能帮你做什么三个最常见的用法。给短视频换音色把旁白或歌曲人声换成某个训练好的声音常用于二创内容。直播实时变声RVC内置实时推理链路README给出的端到端延迟约170ms配合ASIO设备可压到90ms基本不拖后腿。分离人声做伴奏它集成了UVR5在Web界面里可直接把人声和伴奏拆开拿到干净的人声素材还能反过来当作训练数据。上手前一次备齐先确认三件事Python大于3.8、Git已安装、磁盘留足约10GB预训练模型加训练产物会占空间。依赖安装按显卡区分装错文件是最常见的环境问题对照下表选一份硬件环境依赖文件NVIDIA显卡主流方案requirements.txtAMD/Intel显卡DirectMLrequirements-dml.txtAMD显卡ROCm仅Linuxrequirements-amd.txtIntel显卡IPEX仅Linuxrequirements-ipex.txt另外需要系统装好ffmpegLinux可用apt安装macOS用brew。从克隆到出声完整走一遍流程是拉代码、装依赖、下预训练模型、训练、试听。先获取代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI进入目录后按你选的显卡装依赖以NVIDIA卡为例pip install -r requirements.txt然后下载推理和训练所需的预训练文件hubert、rmvpe、pretrained等脚本会自动放入assets/对应子目录python tools/download_models.py接下来启动训练与推理界面python infer-web.pyWindows用户也可以直接双击go-web.batmacOS和Linux可以用run.sh它会自动建虚拟环境并下载模型。浏览器打开后按界面提示操作指定一个装有训练音频的目录设置实验名跑切片、特征提取选RMVPE做音高提取然后训练并训练索引。训练用的就是界面里的模型选项卡产物是weights/目录下的pth文件和logs/目录下的index文件。最后切到推理选项卡上传一段音频选刚训好的模型点转换就能听到结果。效果调优三个参数最关键出现什么现象就调什么按这个思路排查。音色不像或漏了原声调索引率index_rate它控制检索特征的替换比例默认0.0调到0.3到0.7之间。音色不稳、有哑音或音高跑偏换音高提取算法首选RMVPE基于InterSpeech 2023的算法精度高且占用小其次才是crepe、harvest这类。变声后调性不对调pitch偏移男转女一般加12左右微调范围在-12到15之间正值为升调。参数默认值建议调整index_rate索引率0.00.3-0.7f0method音高提取算法fcpermvpepitch音高偏移12-12到15这些参数在configs/config.json里也有记录Web界面里改的是同一份配置。进阶玩法实时变声与模型融合实时变声独立脚本python tools/rvc_for_realtime.py可以脱离Web界面跑适合接语音聊天和直播配合ASIO输入输出延迟更低。模型融合把两个训好的模型按权重混成一个新音色命令是python tools/trans_weights.py适合你想在两个音色之间找个中间态的时候。原理速览一行流程原始语音 → 特征提取 → 检索匹配 → 特征替换 → 语音合成。第一RVC底模是VITS一种端到端语音合成模型用约50小时的开源语音数据预训练你只需在自己的数据上微调。第二它的特色是top1检索从训练集里找出与输入最接近的特征去替换以此杜绝原声音色泄漏。第三音高由独立的提取算法如RMVPE单独算出再喂给模型所以换声后音高曲线依然稳定。避坑指南训练完没有索引文件索引和模型是分开生成的回训练选项卡手动点一次训练索引即可。分享模型时该发什么发weights/目录下几十MB的pth文件加对应的index文件不要发logs/下几百MB的检查点。训练数据要多少官方建议至少10分钟低底噪语音干净的话5到10分钟也能出可用效果关键是环境安静、内容多样。实时变声延迟高换ASIO设备调小缓冲区关掉占用声卡的后台程序。显存不够批量大小调到1推理可切CPU模式4GB以下显存训练会比较吃力。资源指引想深入代码语音转换核心在infer/modules/vc/训练逻辑在infer/modules/train/音频处理在infer/lib/audio.py。界面语言文件都在i18n/locale/含简中、英文、日文、韩文等十余种。文档入口在docs/目录各语言FAQ和训练技巧说明齐全。最后提醒一句转换他人声音用于公开传播前先确认你获得了本人授权尊重声音版权与隐私。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表