ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OpenVoice 语音克隆实战指南:三步在本地克隆任意声音,支持跨语言与多情感控制

OpenVoice 语音克隆实战指南:三步在本地克隆任意声音,支持跨语言与多情感控制 OpenVoice 语音克隆实战指南三步在本地克隆任意声音支持跨语言与多情感控制【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice如果你手里只有十几秒的录音却想让合成语音听上去就是他OpenVoice 就是为此而生的开源即时语音克隆项目由 MIT 和 MyShell 联合推出从一段短语音中提取音色套到任意语言、任意情绪的文本朗读上几秒钟出结果V1/V2 均采用 MIT 协议商用免费。先说说它帮你解决什么麻烦做过音频产品的人大概都有过这种纠结给助手、小说旁白或游戏角色配音要么自己录一遍素材库贵、慢要么找商业克隆服务按量收费数据还得出内网。更麻烦的是多语言同一个人声读中文、英文、西语逐语种重新录制不现实。而且你还想控制风格——这句要耳语那句要兴奋普通 TTS 根本不给这个能力。OpenVoice 的思路是把读什么和谁来读拆成两个独立模块基础说话人模型负责把文本读成语音决定口音、情感、节奏音色转换器只负责把参考人的音色贴上去。这套技术从 2023 年 5 月起就在线上平台驱动即时语音克隆功能到同年 11 月累计被调用了数千万次。三步跑通本地语音克隆安装过程很短先跑通再抠细节。以下是最简路径对应文件在 docs/USAGE.md 里都有详细说明步骤做什么命令/文件备注1. 建环境建一个 Python 3.9 的 conda 环境conda create -n openvoice python9后激活避免污染系统 Python2. 拿代码克隆仓库并进入目录git clone https://gitcode.com/GitHub_Trending/op/OpenVoice3. 装依赖一次性装好全部依赖pip install -e .版本由 setup.py 锁定4. 放模型下载对应版本 checkpoint 并解压V1 →checkpoints/V2 →checkpoints_v2/压缩文件名称及下载位置见 docs/USAGE.md5. 跑起来打开 notebook 或起 Web 界面demo_part1.ipynb 或python -m openvoice_app --share首次运行会自动下载 VAD 等组件跑通之后核心调用就三件事加载两个模型 → 提取参考音色 → 转换合成。最关键的片段长这样from openvoice import se_extractor from openvoice.api import BaseSpeakerTTS, ToneColorConverter device cuda:0 if torch.cuda.is_available() else cpu # 基础说话人负责把文本读出来决定口音/情感/语速 base BaseSpeakerTTS(checkpoints/base_speakers/EN/config.json, devicedevice) base.load_ckpt(checkpoints/base_speakers/EN/checkpoint.pth) # 音色转换器负责把参考人的音色贴上去 converter ToneColorConverter(checkpoints/converter/config.json, devicedevice) converter.load_ckpt(checkpoints/converter/checkpoint.pth) # 从参考音频提取音色建议 5~15 秒干净录音 target_se, _ se_extractor.get_se(resources/example_reference.mp3, converter, vadTrue) # 先合成再转色speaker 可选 whispering、excited、sad 等 8 种风格 base.tts(Hello, this is OpenVoice., tmp.wav, speakerwhispering, languageEnglish, speed0.9) converter.convert(tmp.wav, source_se, target_se, output_pathout.wav)两个模型类的完整实现可以看 openvoice/api.pyget_se内部会用 Whisper 把参考音频切段、去掉静音再对每段提音色取平均逻辑都在 openvoice/se_extractor.py 里。一张图看懂音色转换原理整条链路是双轨的左边轨道上基础说话人 TTS 模型接收文本内容和风格参数口音、情感、语调等先把语音读出来——这一轨决定说什么、怎么读。右边轨道是音色转换器它从参考音频中抽出音色特征同时把左轨的语音过一遍编码器、Flow 网络和解码器只替换其中的音色成分情感、节奏、停顿这些风格信息原样保留最终输出参考人的声音 受控风格的语音。IPA 对齐——简单说就是让不同语言的发音对得上号转换器内部用国际音标做特征对齐保证跨语言转换时只动音色、不乱掉其他风格这也是它能做到零样本跨语言的关键。另外有个容易忽略的设计生成的音频默认会写入不可听见的水印convert的message参数用于标识和追溯避免被滥用。V1 和 V2 怎么选不用纠结按需求对号入座就行如果你只是想快速验证音色克隆效果、或者想把自己的 TTS 模型接进来当底座 —— 选V1装完解压检查点就能用风格控制8 种说话人预设和跨语言克隆是它的招牌能力。如果你在意音质、或者需要中文/英文/日语/韩语/法语/西语这六种语言开箱即用 —— 选V22024 年 4 月发布它换了一套训练策略音质明显更好并集成了 MeloTTS 作为完整 TTS 流水线安装 MeloTTS 后执行python -m unidic download获取日语词典即可。对比项V1V2适合谁快速验证、自接第三方基础 TTS要音质、要六语种原生支持语言覆盖自带英/中底座其他语言需自备基础说话人模型六种语言原生支持额外代价无需安装 MeloTTS检查点文件更大使用入口demo_part1 / part2.ipynbdemo_part3.ipynb两版都是 MIT 协议商用、研究都不花钱这是它相对不少同类方案最实在的一点。两个真正会用到的进阶场景场景一用英语参考声克隆出中文跨语言克隆目标参考录音是英语但想让他开口说中文。关键做法只换底座、不换音色。把基础说话人从checkpoints/base_speakers/EN换成checkpoints/base_speakers/ZH并把source_se换成中文底座自带的zh_default_se.pth音色转换需要一个源音色作参照必须与底座匹配参考人的target_se保持不变。零样本的意思是参考语音和目标语言都不需要在训练集里出现过。注意迁移的只有音色口音和情感由底座决定——想要带北京味的中文得换对应口音的底座模型。细节可参考 demo_part2.ipynb。场景二批量文本转语音怎么提速目标把一整个目录的文本文件全部转成某个人的声音。关键做法模型只加载一次、参考音色target_se只提取一次之后每条文本走底座合成 → 转色两步即可再配合多线程并行提交整体耗时基本线性下降。注意两个坑get_se的结果会按文件名缓存在processed目录不会自动覆盖。换了参考音频却沿用旧文件名拿到的还是老音色——改个文件名即可。底座tts的speed参数可以批量调速0.9 放慢、1.2 加快不用后期处理音频。顺带一提跑单条调试嫌麻烦的话直接python -m openvoice_app --share起一个本地 Gradio 网页浏览器里拖音频就能玩。踩坑清单对照着查一遍现象启动时报 Silero VAD 相关错误。原因VAD 模型要从外网拉取网络不通就失败。解决手动下载 silero-vad 的 zip 包解压到~/.cache/torch/hub/snakers4_silero-vad_master/。现象克隆出来的音色像但口音、情绪不像参考人。原因这不是 bug——音色转换器只克隆音色口音和情感来自基础说话人模型。解决想换风格就换底座模型或切换speaker预设friendly、cheerful、excited、sad、angry、terrified、shouting、whispering 共 8 种。现象生成语音有杂音、发闷、音质差。原因参考音频带背景噪声、太短、多人说话或有大段空白。解决换一段 5~15 秒、单说话人、无噪声的干净录音采样率 16kHz 以上。现象换了参考音频输出却还是老味道。原因文件名相同命中了processed目录里的旧缓存。解决给参考音频起一个唯一的新文件名。现象CPU 上跑极慢或显存/内存吃紧。原因模型默认走 GPU设备没配对。解决确认torch.cuda.is_available()把device设为cuda:0批量任务控制并发、必要时把非关键模块放 CPU。更多问题可查 docs/QA.md。写在最后OpenVoice 把语音克隆从一件录音棚工程变成了一段几行的代码音色与风格解耦带来灵活控制IPA 对齐带来零样本跨语言MIT 协议则把商用门槛清零。对想搭个性化语音助手、多语言内容生产的团队来说它已经是目前可自托管方案里相当完整的一块拼图。可以期待的方向更多语言的原生支持、实时克隆的性能优化以及更简化的端到端训练流程。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表