
30分钟跑通本地文本转语音VoxCPM 声音克隆实操教程【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM给短视频配旁白、把小说稿读成播客或者用家人的声音录一段语音留言这些场景都需要先把文字变成自然的语音。VoxCPM 是一款免费开源的本地文本转语音工具支持多语言语音合成、声音克隆和声音设计装好 Python 环境后十几分钟就能在自己电脑上生成第一条音频。本地文本转语音怎么实现VoxCPM 的输入与输出VoxCPM 的工作方式可以一句话讲清输入一段文字可选地再配一段参考音频或一句声音描述模型在本地完成全部计算输出一个 48kHz 的 wav 音频文件。它采用无 tokenizer 的扩散自回归架构直接生成连续语音表示不经过离散语音 token这是它听起来比传统 TTS 更自然的原因。整个过程数据不出本机音频文件留在本地。最新版本 VoxCPM2 参数量 2B支持 30 种语言和多种中文方言提供声音设计、可控克隆、极致克隆三种模式。从安装到首次跑通VoxCPM 本地部署完整流程这一节按顺序做四步每步都有明确的成功标志做完第四步就能在网页上生成语音。安装 voxcpm 并确认命令可用做什么安装 Python 包确认命令行工具在 PATH 中。要求 Python 3.10–3.12、PyTorch 2.5 以上用 NVIDIA 显卡还需要 CUDA 12 及以上。pip install voxcpm voxcpm --help成功标志终端打印出帮助信息能看到 design、clone、batch 等子命令。用 design 命令生成第一段合成语音做什么不依赖任何参考音频用一句话描述想要的音色把文字合成语音。--control 参数控制音色、语气和语速。voxcpm design \ --text 你好这是用 VoxCPM 合成的第一条语音。 \ --control 年轻女声语气自然语速适中 \ --output hello.wav成功标志终端输出 Saved audio to: hello.wav 和音频时长打开 hello.wav 能正常播放。首次运行会自动下载模型权重需要额外等几分钟。用参考音频克隆一个声音做什么准备一段 3–10 秒、背景干净的人声 wav 作为参考让模型用这个音色朗读新文本。仓库自带示例音频 examples/reference_speaker.wav克隆仓库后可直接用来测试。voxcpm clone \ --text 这是一段声音克隆效果测试。 \ --reference-audio examples/reference_speaker.wav \ --output clone.wav成功标志生成的 clone.wav 音色与参考音频接近而不是随机音色。启动网页版界面生成语音做什么不想敲命令的话用仓库自带的 Gradio 页面在浏览器里填文本、上传参考音频即可。依赖在上一步已装好直接运行git clone https://gitcode.com/GitHub_Trending/vo/VoxCPM cd VoxCPM python app.py --port 8808成功标志浏览器打开 http://localhost:8808页面出现声音描述、参考音频上传和待合成文本三个区域。Apple Silicon 的 Mac 可加 --device auto 自动走 MPS。声音设计、可控克隆与极致克隆怎么选声音设计适合手上没有任何参考音频的情况操作路径是在 --control 里写清性别、年龄、语气比如低沉的中年男声语速偏慢得到的结果是一个符合描述的全新音色不满意可以换 --seed 多生成几次对比。可控克隆适合用自己或同事的声音配音操作路径是 --reference-audio 提供音色、--control 指定情绪和语速得到的结果是保留原音色、说话风格却可以按需调整。有用户用它把项目周报念成语音版再叠加稍快、轻松一点的描述效果接近真人改口重录。极致克隆适合相似度优先操作路径是同时给 --prompt-audio参考音频和 --prompt-text这段音频对应的文字内容模型把它当作已说出的前文往下续写得到的结果是最接近参考音频的延续音色、节奏、情绪都尽量还原。模式需要准备适用场景得到的结果声音设计一句声音描述从零创造旁白、角色音符合描述的全新音色可控克隆一段参考音频用指定音色配音需调情绪语速原音色 描述里的风格极致克隆参考音频 其文字内容相似度优先、同风格续写最接近参考音频的延续下图是早期版本 VoxCPM 的架构示意VoxCPM2 在同样的管线上扩展了多语言与声音设计能力两个顺手的扩展给每个字打时间戳在生成命令后加 --timestamps需先执行 pip install voxcpm[timestamps]想长期固定某个音色则可以用 5–10 分钟音频做 LoRA 微调配置模板见仓库 conf/voxcpm_v2/ 目录。生成失败或报错时的自查步骤第一次运行长时间卡在模型下载。确认网络能否访问模型仓库公司内网一般要走代理也可先 pip install modelscope用 snapshot_download 把权重下到本地再用 --model-path 指向本地目录确认磁盘剩余空间足够2B 模型权重有几个 GB仍不行时换一台外网正常的机器把权重整目录下载好拷过来后用 --model-path 指向它clone 命令报参数错误如 --prompt-audio requires --prompt-text。极致克隆的 --prompt-audio 必须和 --prompt-text或 --prompt-file成对出现只做音色克隆时只带 --reference-audio不要混入 --prompt-* 参数--control 与 --prompt-text 互斥同一命令里不要混用仍不行时先跑只带 --reference-audio 的最简 clone 命令验证流程确认通了再逐个加参数显存不足或 CPU 上生成太慢。VoxCPM2 大约需要 8GB 显存先关掉其他占显存的程序CPU 运行时把 --inference-timesteps 调低推荐范围 4–30越小越快仍不行时换参数更小的 VoxCPM1.5显存需求约 6GB跑完上面的流程对照确认一下voxcpm --help 能看到 design、clone、batch 子命令voxcpm design 生成了一条能正常播放的 wavvoxcpm clone 用参考音频产出了音色接近的克隆语音接下来日常用法就是替换文本和参考音频等想固定某个音色时再去动 conf/voxcpm_v2/ 里的微调配置。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考