
Buzz 离线语音转文字完整指南5 分钟让 Whisper 在本地跑起来【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz开完会桌上躺着一段两小时的录音第二天上午就要交文字稿。把它丢给云端转录服务代价是按分钟计费外加文件必须先传到别人服务器上。Buzz 是把这套流程搬到本地的工具基于 OpenAI 的 Whisper 模型识别、翻译、导出全部在你自己的电脑上完成录音从头到尾不出机器。装好并跑起来三个平台都有现成方案Windows / macOS从发布页下载安装包或 .dmg 拖进 Applications 即可Windows 版本没有数字签名安装时按更多信息 → 仍要运行放行LinuxFlatpak 或 Snap 包管理器直接装Python 用户走 pip需要 Python 3.12 环境并先装好 ffmpeg# pip 方式安装并启动 Buzz约一行装好第二行启动 pip install buzz-captions python -m buzz装完打开主界面左上角就是导入按钮。详细的各平台安装说明见 安装文档。从一段录音到字幕文件导入音频或视频文件视频会自动抽音轨第一次使用要先选模型并等待下载——模型只下载一次之后离线可用。任务类型分两种transcribe 识别原语言translate 则直接产出英文译文。建议第一遍就把手动指定语言打开比自动检测稳。跑完后双击任务行打开转录查看器波形、文本、播放条三件套拖动播放位置对应文字会高亮哪句听着别扭就回听哪句。确认没问题后导出TXT、SRT、VTT 三种格式任选。让识别更准的 4 个设置准确率主要看这几个开关按顺序调收益递减手动指定语言短文件和方言内容自动检测容易翻车指定语言后识别率提升最明显填写初始提示录音里有专有名词、产品名、术语把它们写进提示框模型会倾向于按你给的词认换更大的模型tiny 够快速粗览正式内容建议 medium 或 largeNVIDIA 显卡、Apple Silicon、大多数核显Vulkan 路径都有加速大模型也能跑得动开启语音分离嘈杂环境录的音Buzz 会在转录前先把人声分离出来比单纯降噪有效模型下载、删除、量化版本牺牲一点精度换速度都在偏好设置的模型页管理偏好文档里有完整说明。说话时实时转文字Buzz 不只能处理存好的文件还支持麦克风实时转录点录制按钮说出来的话立刻变成文字往下排。三种模式可选——新句子追加到下方、追加到上方、或追加并纠正会对上一句的识别错误做二次修正吃硬件性能。演讲和会议场景可以开演示窗口全屏显示实时文字开启实时导出后文字还会边生成边写进 txt 文件方便同步给别的程序。文件多起来之后怎么办一批访谈录音或整季讲座别一个一个拖文件夹监视在偏好里设好输入目录和输出路径新文件落进文件夹就自动开始转录会一结束文件丢进去这种工作流完全不用人盯命令行buzz add一条命令就能指定模型、语言、提示词并直接导出 SRT/VTT适合写脚本批量跑全部参数见 CLI 文档插件扩展内置插件系统提供 AI 摘要、字幕自动拆行等能力源码在 buzz/plugins/想加自己的功能也有现成骨架做字幕的话还有一个拆行工具按静音间隙合并、按标点分割逐条调整每条字幕的时长再导出省掉字幕编辑器里的大部分手工活。Buzz 和云端转录服务怎么选维度Buzz云端转录服务文件去向留在本机上传到服务商服务器网络下载模型后离线可用依赖网络费用免费按分钟计费速度取决于你的硬件取决于对方服务器排队语言覆盖99 种因服务而异可控性模型、提示词、导出模板都能调基本不可调涉及客户信息、商业机密的音频文件不出机器这一条就是决定性的偶尔一段小音频求快用云服务也无妨不必硬上本地。下一步做什么装上 Buzz找一段短音频用 base 模型走一遍导入 → 运行 → 查看器指定语言、填上几个关键词的初始提示对同一段音频再跑一次对比识别差异打开文件夹监视、固定输出目录之后的批量文件丢进去就行【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考