)
9 月 21 日上架的 Qwen-Audio-3.1-TTS-Next主打的是“一段剧本进、一整场戏出”人声、音效、环境声在同一次生成里按时序排好。本文把半天实测的 8 笔调用整理成四步走接口怎么调、时序怎么控、上限在哪、钱怎么算命令与数字全部来自实际调用。一、先说结果四个工种收进一次调用传统做一段有声内容是四个工种接力配音录对白、音效翻素材库、混音调层次、剪辑拼场景。这个模型把这几道手合并了模态是 TextAudio 进、Audio 出写一段剧本式提示词成品直接是排好顺序的声景。官方给了两种落位语音与对话旁白、多人对话、播客、有声书、广播剧以及综合声音场景给台词配雨声、海浪、游戏音效。提示词按官方六要素写创作任务、人物及音色、台词加引号、注明说话人、表达方式、背景与音效、声音变化。先摸能力面bl model list--modelqwen-audio-3.1-tts-next返回里能看到 09-21 上架、按 token 计价适用场景列了多语种语音合成、多人对话、播客、影视剧声景。要早知道的细节它没有传统的“音色 ID”角色音色直接写在提示词描述里。8 笔实测的关键数字先放这儿298 字剧本出 32.08 秒三人广播剧439 字出 69.96 秒双人播客。参考音频可以自产自用先用bl生成音色样本base64 回喂用voice1/voice2分配台词。提示词超 3000 字符立刻报错成品超 120 秒静默截断结尾消失但账单照收。输出 token 生成内容秒数 × 200每秒约 0.24 分钱4 分钟满格播客约 6 毛钱。二、环境准备npminstall-gbailian-cliCLI 负责外围查目录、核账、回读。也可以走官方 skill 包让 Agent 代跑。合成要 API Key去控制台签一个放进环境变量。三、第一步CLI 报 400合成改走官方 HTTP 接口用 CLI 自己的合成命令发请求bl speech synthesize--text雨突然下大了。要伞吗\--modelqwen-audio-3.1-tts-next--voicelonganhuan_v3.6--formatwav--outsmoke.wav返回 HTTP 400报错原文text_prompt must not be empty.。原因是请求体对不上bl speech synthesize按经典语音合成发input.text加voice新模型要的是input.text_prompt也不认voice。换回老模型qwen-audio-3.0-tts-flash同样的命令一次过。合成走官方 HTTPcurl-sS-XPOST\https://$WORKSPACE_ID.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/SpeechSynthesizer\-HAuthorization: Bearer$DASHSCOPE_API_KEY\-HContent-Type: application/json\-d{ model: qwen-audio-3.1-tts-next, input: { text_prompt: 你的剧本, format: wav, sample_rate: 48000, channels: 2 } }返回 JSON 里三个字段最有用output.audio.url成品地址24 小时有效、output.audio.duration成品秒数、usage这一单记了多少 token。冒烟那笔 6.6 秒成品生成等了 41.5 秒。四、第二步跑三场戏验证时序面馆广播剧298 字 → 32.08 秒。三个角色老板 55 岁、加班顾客 26 岁、骑手 23 岁各标音色、情绪、语速两组环境声雨棚上的雨、后厨沸水两个情绪转折。成品 32.08 秒一个字约 0.11 秒生成等了 121.6 秒。验证靠回读bl speech recognize直读生成的 wav六句台词逐句对上。时间戳给出两个信息人声第 2.7 秒进来前面是雨声铺场最后一句第 27.8 秒收余下 4 秒雨声收尾。时序确实按剧本在走。参考音频自举37.36 秒。做连续剧集要固定角色音色机制是参考音频最多三条voice1到voice3引用每条不超过 30 秒、10MB。没有现成素材可以先用bl里的qwen-audio-3.0-tts-flash造两段音色样本base64 塞进请求的references提示词里分配台词。成品 37.36 秒回读四句全对。注意环境声写在最前面它会先铺 18 秒环境声人声 18.4 秒才进来想让人声快点进来就把顺序写明。播客439 字 → 69.96 秒。成品 69.96 秒一个字约 0.16 秒全文回读一句不缺生成 101.6 秒约是成品时长的 1.45 倍。长音频的生成效率更高6.6 秒冒烟等了 41.5 秒六倍多70 秒这一笔压在 1.5 倍以内。五、第三步两个上限第二个会静默切尾提示词上限 3000 字符是软墙3058 字符的脚本 0.2 秒返回text_prompt exceeds the maximum length of 3000 characters.拦在门口。时长上限是硬墙469 字的独白按 0.16 秒/字估约 75 秒成品正好 120.0 秒顶格最后一句没了finish_reason却显示stop。超时长不报错、不提醒直接切结尾账单按 120 秒照收约 3 毛钱。做有声书的最容易踩。土办法按“一个字约 0.16 秒”估时长对话多按 0.12 到 0.15接近 120 秒就拆段生成。六、第四步逐单成本核算规律每 1 秒生成内容记 200 个输出 token。6.6 秒记 1320、32.08 秒记 6416、69.96 秒记 13992、37.36 秒记 7472、120 秒记 240008 笔全部吻合。按目录价输入 6 元、输出 12 元每百万 token折算每秒约 0.24 分钱成品生成耗时费用约6.6 秒冒烟41.5 秒2 分钱32 秒面馆广播剧121.6 秒8 分钱37 秒复刻对话90.2 秒12 分钱70 秒播客101.6 秒17 分钱120 秒顶格独白174.6 秒30 分钱一集 4 分钟满格播客约 6 毛钱8 笔共 289 秒成品、总花费约 0.77 元。模型有单独的免费额度90 天、每模型独立、仅北京地域输出侧 100 万 token 约够 83 分钟成品。核账两个经验。先记一个前提核账这两条命令在bl帮助里标着[Console]要bl auth login --console浏览器登录和合成、回读用的 API Key 是两拨凭证。bl usage free面板有入账延迟逐单对账走bl log audit list --output json语速参数不省钱rate1.6让成品从 9 秒缩到 5.3 秒但计费量只从 1808 缩到 1688 个输出 token-6.6%。另外同一提示词两遍的 md5 不一样满意版本马上存档。bl log audit list--outputjson七、常见问题Q1bl speech synthesize报text_prompt must not be empty.请求体字段不匹配。CLI 按经典语音合成发input.text加voice新模型要input.text_prompt且不认voice改用官方 HTTP 接口见第三步。Q2怎么控制角色音色两条路写进提示词描述六要素之“人物及音色”或用参考音频voice1到voice3最多三条、每条不超过 30 秒、10MB、支持 WAV/MP3/OGG Opus。参考音频可以先自己用bl造样本。Q3怎么确认台词没被吞bl speech recognize读回成品逐句对稿时间戳还能看人声进入时间和各句落点。Q4怎么提前发现 120 秒截断按 0.16 秒/字估成品时长对话多按 0.12 到 0.15接近 120 秒就拆段。截断发生在服务端finish_reason仍显示stop只能靠回读发现。Q5一次调用多少钱怎么算输出 token 生成内容秒数 × 200乘以 12 元每百万就是输出侧金额。每秒约 0.24 分钱。逐单金额用bl log audit list --output json核对。Q6调rate参数能省钱吗不能。同一段稿子rate1.6再跑成品从 9 秒缩到 5.3 秒计费量只从 1808 缩到 1688 个输出 token-6.6%。省钱的开关是缩短内容。Q7同一个提示词两次结果一样吗不一样md5 每次不同固定随机种子也一样。满意的版本立即归档。Q8免费额度怎么算90 天有效、每模型独立、仅北京地域、过期不补发。输出侧 100 万 token 约够 83 分钟成品。八、怎么选什么时候值得上播客和有声书的初稿最合适一集 6 毛钱以内哪句太长、哪个转场生硬听一遍就暴露。游戏 NPC 台词、短剧声景的概念验证也比写需求文档直观。批量口播就是标准 HTTP 调用接进流水线。要等的部分接话密度和情感演播与真人还有差距精修得人耳过一遍偶尔配一段音控制台里的开箱即用产品可能更省事。三场戏成品还开着面馆广播剧、复刻对话、播客。想自己跑官方 skill 包或npm install -g bailian-cli合成要 Key这里签。