
很多人第一次用实时翻译开跨国会议时会遇到一个很具体的问题。翻译已经出来了字幕也正常显示甚至电脑本地已经能播放翻译后的语音。可会议对面的客户听到的还是自己的原声或者干脆什么都听不到。问题通常不在翻译本身而在音频有没有真正进入会议软件。这中间缺的一步就是虚拟麦克风。一、为什么电脑自己能听到会议对面却听不到Zoom、Teams、Google Meet 这类会议软件在工作时会先让你选择一个“麦克风输入”。通常这里选的是 MacBook 内置麦克风、AirPods或者外接麦克风。会议软件只会把这个输入设备收到的声音传给对方。问题来了。实时翻译软件生成的外语语音通常属于“电脑内部播放的声音”。它可能已经从你的扬声器里播出来但会议软件并不会自动把这段声音当成你的麦克风输入。所以电脑里其实同时存在两条音频路线。一条是你的真实麦克风负责收录你说的话另一条是软件生成的翻译语音负责在本地播放。如果想让电脑另一端的客户直接听到翻译后的声音就需要把第二条路线重新接到会议软件的麦克风入口里。虚拟麦克风做的就是这件事。二、虚拟麦克风本质上是在电脑里“造一个麦克风”它并不是一个真正的硬件麦克风。更准确地说它是一个虚拟音频设备。软件生成一段声音以后可以把这段声音送进这个虚拟设备Zoom 或 Teams 再把它当成普通麦克风读取。对于会议软件来说它并不知道声音最开始来自真人还是另一个软件只知道当前选择的麦克风正在持续输出音频。整个路径可以简单理解成你说中文 → 实时翻译 → 生成英文语音 → 虚拟麦克风 → Zoom / Teams / Meet → 客户听到英文这样一来你自己依然按照习惯讲话会议软件收到的却是处理后的声音。我自己觉得虚拟麦克风真正有意思的地方就在这里。它解决的其实不是“翻译”而是软件和软件之间怎么传声音。三、真正设置时最重要的是分清“谁负责听谁负责播”这一类工作流看起来复杂理清输入和输出之后其实很简单。实时翻译软件需要连接你的真实麦克风因为它首先要听见你说什么会议软件则不再直接读取真实麦克风而是读取翻译软件输出的虚拟麦克风。比如使用同言翻译时在 macOS 上可以直接把会议软件的麦克风切换成Transync AI Translation Mic。这样你在本地继续通过真实麦克风讲话翻译后的语音则通过虚拟麦克风送进会议。官方文档目前列出的适用场景包括 Zoom、Microsoft Teams、Google Meet 等可以自行选择麦克风输入的会议平台。Windows 的思路一样只是连接方式稍微不同。目前官方方案需要借助虚拟音频设备把翻译软件的输出送到一个虚拟输入再让会议软件读取对应的虚拟输出。真正容易弄混的地方反而是不要把两个麦克风选反。翻译软件要听你的真人声音。会议软件要听翻译后的声音。把这两个角色分清楚后面的逻辑就顺了。四、为什么声音克隆会让这种方式更自然一点虚拟麦克风解决的是“怎么把声音送过去”。声音本身听起来怎么样则属于另一层问题。传统 TTS也就是文字转语音通常使用预设音色。于是你本人说中文时是一种声音翻译成英语以后对方突然听到另一种完全不同的声音。信息没有问题但身份感会弱很多。现在一些语音工具开始加入声音克隆让翻译后的播报尽量接近原讲话人的声线。同言翻译目前也支持在部分语言中把 Voice Clone 和虚拟麦克风一起使用包括中文、英语、西班牙语、法语、日语、韩语、德语和葡萄牙语等。这种体验最容易在连续交流里体现出来。如果只是问一句路声音像不像本人其实没那么重要如果连续开四十分钟会议对方一直听着一个相对稳定的声音会更容易维持正常交流感。不过声音克隆依然只是辅助。真正决定会议体验的还是翻译延迟、句子是否完整以及双方能不能自然轮流说话。虚拟麦克风真正改变的是“翻译结果去哪里”以前实时翻译完成以后结果通常停在屏幕上。你看字幕。或者自己听翻译后的声音。虚拟麦克风相当于多加了一条路把这段已经生成好的译音直接送进另一款软件。这件事看起来很技术真正理解以后其实很朴素。麦克风本来就是电脑接收声音的入口。既然会议软件只认这个入口那就让翻译后的声音也从这里进去。于是跨语言会议里的动作就会变得更简单你继续说自己的语言翻译在后台完成客户那边直接收到另一种语言的语音。真正复杂的部分都发生在电脑里面。对会议双方来说理想状态反而应该越来越简单。