
Buzz 本地离线音频转录指南用 Whisper 快速完成语音转文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的免费开源离线转录工具。它在你个人电脑上完成音频转录与翻译无需上传文件、不依赖网络转录结果可导出为 TXT、SRT、VTT 字幕。它解决什么问题Buzz 的定位是完全本地的语音转文字。你导入的录音、会议音频、视频文件全程不出本机跑通一次模型下载之后断网也能继续工作。与云端转录服务相比它没有按分钟计费的订阅也不会把敏感内容送到第三方服务器与直接用命令行跑 Whisper 相比它带完整的图形界面任务列表、带时间戳的查看器、播放器、快捷键以及插件系统。简单说它把跑一个模型包装成了一个可以日常使用的工具。从安装到出第一个结果根据你的系统选一条安装路径Linuxflatpak install flathub io.github.chidiwilliams.Buzz也有 Snap 包macOS / Windows从发行说明页下载 dmg 或安装程序Windows 安装程序未签名首次运行时点更多信息→仍要运行PyPI适合开发者先装好 ffmpeg在 Python 3.12 环境执行pip install buzz-captions python -m buzz跑通第一条转录只需四步按CtrlOmacOS 为CmdO或点工具栏的导入音频/视频文件选择任务Transcribe转录原文或Translate to English翻译成英文指定语言——官方建议尽量手动选择自动检测偶尔会认错语言再选模型大小tiny/base/small/medium/large点 Run。首次会下载对应模型状态变为 Completed 后双击任务行打开转录查看器任务列表显示每个文件的进度双击行打开转录结果核心用法详解文件转录从录音到可编辑的带时间戳文本在任务行上双击进入查看器后转录结果按段落拆分并带起止时间。顶部工具栏提供三种视图时间戳表格、纯文本、译文。CtrlF搜索文本CtrlP播放/暂停CtrlShiftP从头重播当前段还可以把播放速度调到 0.5x–2.0x 逐句校对。如果音频里有专有名词或术语老被拼错在Advanced...里填一个 Initial prompt把常见词列进去模型会优先按提示拼写。勾选 Word-Level Timings 后每个词都会生成独立时间戳为后面合并字幕做准备。转录查看器段落带时间戳可搜索、回放、调整实时录音会议和讲座的即时字幕切换到实时录音后选择麦克风、语言和模型大小点 Record 即可。几个实用细节模型选 Whisper.cpp官方明确提示默认 Whisper 模型很吃资源实时场景建议 Whisper.cpp它支持 Vulkan 加速集显笔记本也能实时跑优先选 small 及以下的小模型呈现窗口录音开始后会出现Presentation window选项把实时字幕投到另一个窗口适合现场分享Append and correct 模式新句子追加的同时会回头修正上一句的错误代价是占用更多算力可配合Transcription step调节延迟与负载若开了Enable live recording transcription export偏好设置中实时文字会边生成边写入 txt 文件方便接 OBS 等应用编辑与导出把转录变成能用的字幕转录不等于最终成品。Buzz 的 Resize 工具可以把逐词时间戳按最大字幕长度、是否按标点断句等规则合并成字幕开启后如果原音频文件还在它会分析静音区间让断句更准还可以给每条字幕统一延长显示时长。时间戳微调有快捷键Ctrl←/→以 0.5 秒步进调整段落的开始时间CtrlShift←/→调整结束时间。Resize 选项控制字幕合并长度与断句规则最后从导出菜单选择 TXT、SRT 或 VTT。想直接批量出 SRT/VTT 而不开界面也可以走命令行buzz add --model-type whispercpp --model-size small --srt --vtt ./会议录音.mp4适合这样用它会议记录把整场会议的音频导入转录后点Identify speakersBuzz 会给每段话打上说话人标签你可以试听 10 秒样本并改名成真人姓名得到一份带发言人的纪要底稿视频字幕创作者把成片导入开 Word-Level Timings 转录用 Resize 合并出 SRT/VTT直接导入剪辑软件。注意.En结尾的模型只支持英文多语言内容整理转录外语播客后在偏好设置里填一个 OpenAI 兼容 API可用本地 Ollama/LM Studio在查看器点 Translate 得到译文原文译文对照学习无人值守批处理开启监视文件夹后新放进目录的文件自动开始转录配合buzz add命令行脚本可以搭一条固定的字幕流水线上手前要知道的事模型要预先下载模型缓存在Help - Preferences - Models可查看Linux 在~/.cache/Buzz。完全离线的电脑可以先把有网机器上的 models 目录拷过去仓库里也提供了 scripts/download-models.py 帮你在有网环境预生成模型缓存先小后大tiny 快但错得多large 准但吃内存GPU 显存 6GB 以上可以用 Faster Whisper没有独显的 Mac 和集显机器选 Whisper.cpp。拿不准就用同一份音频把几个模型都试一遍崩溃多半是模型文件损坏删掉已下载的模型重下即可另外 Buzz 要求 CPU 支持 AVX2太老的机器跑不起来已知限制说话人识别在 Intel Mac 上不可用AI 翻译需要可用的 API key按官方估算一小时音频约 1 美元纯离线翻译则只能依赖 Whisper 自带的翻译成英文Windows 用户麦克风报错PaErrorCode-9999通常是系统隐私设置拦截了应用对麦克风的访问去 设置→隐私→麦克风 里放行 Buzz详细使用手册在 docs/docs/usage/各转录后端的实现可以看 buzz/transcriber/。小结Buzz 最适合这样一类用户手里有一批不想上传到云端的音频会议、课程、播客想快速拿到可编辑、可导出字幕的转录文本。装好、下好模型、导入文件三分钟就能看到第一条结果。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考