
Buzz把语音转成文字的离线音频转录工具使用教程【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的开源桌面应用在你自己的电脑上完成音频转录和翻译音频文件不会上传到任何服务器。它支持音频/视频文件转录、YouTube 链接导入、麦克风实时录音转写并可将结果导出为 TXT、SRT、VTT。如果你需要整理会议录音、给视频做字幕或不想让音频经过云端这个工具值得试试。安装 Buzz 并完成第一次转录Buzz 支持 macOSIntel 和 Apple Silicon、Windows、Linux也提供命令行方式。按你的系统选一种即可macOS下载.dmg安装包打开后拖入 ApplicationsWindows下载安装文件。程序未签名安装时会弹出警告点更多信息→仍要运行即可LinuxFlatpak 或 Snap 二选一flatpak install flathub io.github.chidiwilliams.Buzz # 或 sudo snap install buzz开发者需要 Python 3.12 和系统里已安装 ffmpegpip install buzz-captions python -m buzz也可以直接克隆源码git clone https://gitcode.com/GitHub_Trending/buz/buzz第一次使用只需四步点 File 菜单里的 Import Media File或按 Ctrl/CmdO选一个音频文件在列表里选择任务Transcribe 或 Translate to English、音频语言、模型类型和大小点 RunBuzz 首次会下载对应模型之后转录在本地进行状态变为 Completed 后双击该行打开转录查看器主界面是一个任务队列可以同时挂多个文件的转录任务各占一行互不阻塞。Buzz 能干什么转录音视频文件除了 MP3、WAV、FLAC、OGG 等音频格式视频文件MP4、AVI、MKV也可以直接导入Buzz 会自动提取音轨处理。输入不限于本地文件还能粘贴 YouTube 链接。转录完成后从查看器里导出TXT 用于纯文本SRT/VTT 可直接导入剪辑软件当字幕用。典型场景手头有一段 30 分钟的课程录像导入后选 medium 模型转录导出 SRT拖进剪映就是一份现成字幕。️ 麦克风实时转录选好录音任务、语言、模型和麦克风后点 Record 就开始实时转写。适合课堂笔记、访谈、会议说完的话几秒后出现在屏幕上Buzz 还会持续修正之前不确定的片段。录音时还可以打开 Presentation window把转写结果投到大屏上。注意默认 Whisper 模型实时转录比较吃资源官方建议实时场景用 Whisper.cpp 后端配 small 或更小的模型。转录查看器搜索、播放、校对转录结果打开后是一个带时间戳的表格每行有 Start、End 和 Text 三列。常用操作点任意一行音频直接跳到对应位置支持循环播放该片段Ctrl/CmdF 搜索全文回车跳到下一处匹配播放速度可调 0.5x–2.0xFollow Audio 选项让文本自动跟随播放位置滚动用 Resize 功能微调片段的起止时间把句子拆细或合并让字幕与语音对齐⚙️ 多后端与多模型可选Buzz 内置五种模型后端在偏好设置的 Models 页切换后端特点WhisperOpenAI 原版实现准确但慢、吃内存Faster Whisper优化版速度快几个量级适合显存 6GB 以上的 Nvidia 显卡Whisper.cppC 实现支持 Vulkan 加速集显和 Mac 的首选纯 CPU 也能跑Hugging Face可加载社区微调模型如针对特定语言优化的模型OpenAI API用云端 API 转写需要 API key模型大小从 tiny、base、small、medium 到 large含 large-v3、turbo 变体小模型快但错得多大模型准但要求硬件更好。官方 FAQ 的建议很直接拿同一段音频把候选模型都试一遍按你的语言选效果最好的。说话人识别与插件多人对话的录音可以跑说话人识别speaker identification把不同人的发言分开标注整理会议纪要时省去了手动划分。Buzz 还有一个插件系统仓库 plugins/ 目录自带若干插件AI 摘要生成、转录段落自动重排、导出 DOCX、降噪DeepFilterNet、跳过已转录部分等。什么场景下 Buzz 最合适适合会议与访谈记录录音转成带时间戳的文字配合说话人识别区分发言人视频字幕制作一次导出 SRT/VTT比手打字幕快得多隐私敏感的音频数据不出本机。首次下载模型需要联网之后可以把模型缓存文件夹拷到离线机器上继续使用模型缓存在 Linux 的~/.cache/Buzz、macOS 的~/Library/Caches/Buzz、Windows 的%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache不适合或要降低预期很老的电脑CPU 需要支持 AVX2 指令集更老的机器跑不了低配机器上的长音频实时转录会卡顿实时场景请换 Whisper.cpp 后端把转录文本翻译成第三语言这个功能依赖 OpenAI 兼容 API在偏好设置里填 key 和地址不算完全离线翻译成英文属于 Whisper 自带能力可以离线跑进阶技巧手动指定语言 初始提示知道音频语言就手动选别用自动检测有专有名词、术语时在 Advanced 里的 Initial prompt 填入这些词能明显减少错拼嘈杂音频先做语音分离勾选 Extract speech1.3.0 起Buzz 会先把人声从背景中抽出来再转录批量与自动化偏好设置里的 Folder Watch 页可以监视一个文件夹新文件进来自动转录脚本化场景用 CLI例如buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 文件.mp4完整参数见 docs/docs/cli.md常见问题转录速度太慢怎么办先换更小的模型tiny/base或换成 Whisper.cpp 后端有 6GB 以上显存的 Nvidia 显卡可以换 Faster Whisper同时关掉其他占资源的程序。支持哪些音频格式MP3、WAV、FLAC、OGG 等常见音频格式以及 MP4、AVI、MKV 等视频格式自动提取音轨也支持直接输入 YouTube 链接。没有联网的机器能跑吗能。先在联网机器上下载好模型通过 偏好设置 → Models → Show file location 找到模型目录把整个目录拷到离线机器相同位置即可。仓库里还有 scripts/download-models.py 可以批量准备离线模型缓存。麦克风没反应提示 PaErrorCode-9999 之类基本是系统权限问题。Windows 到 设置 → 隐私 → 麦克风 里确认 Buzz 有访问权限杀毒软件也可能拦截可临时禁用测试。模型下载后 Buzz 崩溃多半是模型文件不完整到 偏好设置 → Models 里删除该模型重新下载。Buzz 采用 MIT 许可代码模块划分清晰核心逻辑在 transcriber/多种后端实现、widgets/界面组件、db/转录记录存储。想深入细节可以从 docs/ 的官方文档读起。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考