ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Parler-TTS:用一句自然语言描述生成语音的开源文本转语音方案

Parler-TTS:用一句自然语言描述生成语音的开源文本转语音方案 Parler-TTS用一句自然语言描述生成语音的开源文本转语音方案【免费下载链接】parler-ttsInference and training library for high-quality TTS models.项目地址: https://gitcode.com/GitHub_Trending/pa/parler-ttsParler-TTS 是 Hugging Face 推出的全开源文本转语音TTS工具库面向想按音色、语速、情绪自然语言描述生成语音的开发者与内容生产者。它把数据集、训练代码和模型权重全部公开让你既能直接推理也能自己训练和微调 TTS 模型。从想要这种声音到真的生成出来假设你在做播客节目需要一段低一点的女声、语速快一点、在比较小的房间里录制的旁白。传统做法是去挑一个现成音色模型挑来挑去发现它的风格和你描述的对不上只好接受。Parler-TTS 的处理方式不同你直接把这段描述写成文字模型读完后按这个风格朗读你给的文本。官方推理示例里的描述是A female speaker with a slightly low-pitched voice delivers her words quite expressively... She speaks very fast.生成的语音确实呈现出了低音色、快语速的特点。这种用文字指挥声音的方式来自 Stability AI 与爱丁堡大学在 2024 年发表的论文而本仓库是该论文中首个完全开源的实现。核心能力拆解声音怎么被描述出来的按描述控制风格的生成模型接收两个输入一句风格描述和一段要读的文本。当前发布的是 Parler-TTS Mini v0.16 亿参数在 1.05 万小时标注音频上训练得到。描述里可以写说话人性别、音高、语速、环境噪音、情绪语气这些维度都被训练数据里的自然语言标注覆盖。三段式生成管线整个架构分三步training/README.md 有完整说明文本编码器用冻结的 Flan-T5 把风格描述转成表示供解码器跨注意力使用解码器一个自回归语言模型条件于描述表示逐步生成音频 token音频编解码器Descript 的 DAC 模型把 token 还原成 44.1kHz 波形。选 DAC 是因为它质量优于 EnCodec仓库里也封装了可替换的 DAC wrapper。推理与训练全链路公开多数 TTS 项目只放权重训练细节拿不到。这里连训练数据配方都给出来了LibriTTS-R 全量加上 MLS 英语 1 万小时子集两段数据都用 Data-Speech 工具自动生成了描述标注不需要人工逐条听写。一条命令复现官方训练训练脚本是端到端的自动合并数据集、预计算音频 token、再启动训练日志走 wandb。官方用 8 卡 H100 大约 4 天训出 v0.1想微调的话只需把起点模型路径换成 v0.1 的仓库 ID其余参数照抄即可。传统 TTS 做法和 Parler-TTS 的差异对比维度常见 TTS 模型Parler-TTS风格怎么定一个音色模型固定一种风格自然语言描述动态指定换描述即换风格换一种声音找、下载另一个音色模型改一行描述文本数据标注人工录制并逐条标注视觉/声学特征Data-Speech 自动生成描述训练资料通常只发布权重数据、配方、脚本全公开单命令复现授权不少权重限制商用代码、权重、数据全部采用宽松许可模块地图仓库里各目录干什么parler_tts/推理核心含模型定义与生成逻辑ParlerTTSForConditionalGeneration是主要入口类parler_tts/dac_wrapper/DAC 音频编解码器的配置与建模封装负责 token 和波形互转training/训练脚本与完整训练文档覆盖架构介绍、起步步骤、参数说明helpers/training_configs/现成的训练配置 JSON可直接作为启动参数helpers/model_init_scripts/从零初始化 300M/600M 模型的脚本helpers/gradio_demo/可交互的 Gradio 演示应用快速上手一条命令装好并听到第一句语音依赖很轻从源码装一次即可git clone https://gitcode.com/GitHub_Trending/pa/parler-tts cd parler-tts pip install -e .验证方式运行 helpers/gradio_demo/app.py 里的演示应用输入一句话和一段风格描述几秒后就能听到结果不用自己写推理代码。注意 Apple Silicon 用户需要额外装 nightly 版 PyTorch 才能启用 bfloat16这一点 README 里有单独说明。进阶路线想深入时按顺序看这几处training/README.md第一次接触架构和训练流程时看从三个组件讲到完整超参helpers/training_configs/starting_point_0.01.json想复现 v0.1 训练配方时这就是全部超参的集中存放处helpers/model_init_scripts/不打算用官方权重、要从零训练时从这里初始化你的起点模型helpers/gradio_demo/app.py想搭自己的交互演示或二次开发 Web 界面时参考什么场景下值得试如果你有明确的风格控制需求——同一句话要换不同音色、语速、情绪反复生成或者要为内部产品定制音色——这套描述即控制的路线比挑现成音色省事得多。两点需要提前知道它不承诺克隆指定真实人物的声音当前版本也只做英语。对这两点没意见的场景直接装起来跑演示应用是最快的验证方式。【免费下载链接】parler-ttsInference and training library for high-quality TTS models.项目地址: https://gitcode.com/GitHub_Trending/pa/parler-tts创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表