
📖标题:Spoken Language Models that Think Aloud🌐来源:arXiv, 2609.26488v1🛎️文章简介🔸研究问题:如何让具备复杂推理能力的语音模型在思考时不出现长时间的静音空白,从而保持对话的流畅性和实时响应感?🔸主要贡献:论文提出了一种异步“自言自语”框架,通过双轨并行机制,在后台进行深度推理的同时,前台生成简短的进度反馈语音,显著减少了用户听到的静音时间且不影响答案准确性。📝重点思路🔸采用Thinker-Talker架构,将系统分为负责逻辑推导的“推理思考者”和负责生成语音的“统一讲述者”,并新增一个轻量级的“自言自语模块”。🔸实现异步双轨处理:推理流在后台持续生成思维链,而自言自语流根据推理的关键节点和用户输入,实时生成简短、基于任务的进度提示语(如“让我算一下总数”),而非暴露完整的内部推理过程。🔸设计动态平衡策略协调两路输出:当推理仍在进行但语音播放完毕时(音频饥饿),自动触发新的进度提示以填补沉默;当推理提前完成时,立即取消待生成的提示语并切换至最终回答,避免冗余延迟。🔸利用特殊触发令牌连接推理与语音:推理模型在生成思维链的关键位置插入触发信号,自言自语模块接收这些信号及上下文隐藏状态,生成与之连贯的中间语音片段。🔎分析总结🔸实验显示,该方法在口语推理和问答基准测试中,答案准确率与传统的“先想后说”串行模式相当,证明了异步处理未损害推理质量。🔸在延迟方面,该方法大幅降低了用户可感知的静音时长(Unmasked Silence),相比串行基线从12.82秒降至极低水平,同时通过动态策略控制了因语音过长导致的额外计算开销。🔸人工评估表明,用户更偏好这种带有进度反馈的交互方式,认为其响应更及时、自然度更高,且在多步推理任务中能有效维持用户的注意力。🔸语音质量指标(如PESQ和NISQA)优于或