
Buzz 离线音频转录完整指南从录音到可编辑字幕只要 3 步【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 Whisper 的离线音频转录工具全部计算在你的个人电脑上完成支持 99 种以上语言的转录与翻译。适合经常处理会议录音、采访素材、播客和课程视频的人文件不出本地不交订阅费转录完直接编辑导出字幕。 两个先想清楚的场景场景一会议录音当天要出纪要一场 90 分钟的会录音文件躺在电脑上。你不想把内容上传给第三方服务又没时间手动听写。Buzz 的做法是导入录音 → 选语言 → 点运行模型在你本机跑完输出带时间戳的文本再改几个专有名词就能当纪要用。场景二给视频做字幕剪视频的你熟悉这个流程先粗出字幕打底再逐条改错、调长短。Buzz 生成的转录带时间戳可以直接当 SRT 底稿转录还能识别说话人多人对话的视频不用自己猜这句话是谁说的。Buzz 离线转录的 3 步上手路径第 1 步安装并启动按系统选一条装就行都只有一两条命令# macOS / Windows从项目发布页下载安装包Windows 未签名弹窗选更多信息 → 仍要运行 # Linux (Snap) sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz # Linux (Flatpak) flatpak install flathub io.github.chidiwilliams.Buzz # 跨平台 (PyPI需要 Python 3.12 并已安装 ffmpeg) pip install buzz-captions python -m buzz第 2 步导入第一个文件点击工具栏或按 CtrlO→ 选择音频或视频文件 → 选择任务转录/翻译成英语、语言、模型 → 点运行。第 3 步看到结果状态列变成完成后双击那一行转录文本就打开在查看器里左边时间轴右边文字可以边播边改。导出选 TXT、SRT 或 VTT 三种之一。首次使用建议先下载 base 或 medium 模型下载入口在帮助 → 首选项 → 模型里也可以手动指定本地模型文件。核心能力与对应操作路径转录已有的音视频文件含链接操作路径点击文件 → 导入媒体文件 → 选文件1.2.0 起也支持粘贴 URL 导入在线音视频→ 在任务行里选任务、语言、模型 → 点运行。两个常被忽略的选项初始提示在高级里填上容易写错的词人名、产品名能明显减少专名错拼。语音分离嘈杂音频可以开启先抽取人声再转录提升准确率。实时录音转录操作路径选好任务、语言、麦克风 → 点录音文字边说边出。三个要点默认 Whisper 后端比较吃资源实时场景换 Whisper.cpp 后端配合小模型tiny/base才跟得上。录音过程中会出现演示窗口按钮投屏时放大展示实时字幕适合活动现场。开启实时导出后文字会边生成边写入本地文本文件可以对接 OBS 等工具。编辑字幕与调整长短操作路径双击任务行打开转录 → 点调整大小Resize → 设置单条字幕最大长度、是否按标点断句、每段延长几秒 → 导出。如果转录时勾选了词级时间戳调整工具可以把逐词结果合并成符合屏幕阅读习惯的字幕条并且会分析静音段来切分更准。识别说话人操作路径双击转录 → 点识别说话人 → 自动标注的标签可以改名成真人姓名可试听该说话人 10 秒片段确认保存时勾选合并同一说话人相邻句子多人访谈、会议各说各话的文本会清晰很多。注意Intel 版 macOS 不支持此功能。模型档位与后端对比Buzz 离线转录怎么调模型大小怎么选Whisper 系列 5 档外加一个均衡款 Turbo模型大致内存占用速度准确率适合你如果…Tiny1GB最快基础只要草稿、要实时效果Base~1GB快良好日常转录、批量文件Small~2GB较快良好速度质量要平衡Medium~3GB中等优秀重要内容、正式交付Large-V38GB慢最佳精度优先偶尔会编造音频里没有的词Turbo~6GB较快较高想要接近 Large 的精度但嫌它慢四个后端怎么选同一套模型Buzz 提供 4 种推理后端选择逻辑看你的硬件后端跑在特点WhisperOpenAI 原版CPU/GPU基准实现准但慢、吃内存Faster WhisperNvidia GPU≥6GB 显存比原版快一个数量级省内存Whisper.cpp任意 GPUVulkan含核显、纯 CPU、Apple Silicon省资源集成显卡的笔记本也能实时转录Hugging FaceGPU/CPU支持 MMS1000 语言、Parakeet、Qwen3-ASR 等自定义模型系列经验法则有 Nvidia 独显选 Faster WhisperMac 或核显笔记本选 Whisper.cpp要跑非 Whisper 的语音模型才用 Hugging Face。显存紧张时在首选项 → OpenAI API里勾选降低 GPU 显存占用会改用压缩过的模型。避坑与排错现象 → 原因 → 解决启动与安装类现象Windows 安装时报未知发布者警告。原因安装包未签名。解决点更多信息 → 仍要运行这是正常现象不是中毒。现象Buzz 启动即崩溃。原因模型文件下载不完整或损坏也可能是 CPU 太老不支持 AVX2。解决先在帮助 → 首选项 → 模型里删掉模型重新下载仍崩溃则查硬件是否过老。现象录音报错PaErrorCode-9999。原因系统隐私设置禁止应用访问麦克风。解决Windows 去设置 → 隐私 → 麦克风允许 Buzz并留意杀毒软件拦截。使用类现象转录速度太慢。原因模型过大或只能用 CPU。解决换 base/small Whisper.cpp 后端或下载量化版本如 q5省显存有 Nvidia 卡就换 Faster Whisper。现象语言识别错了。原因自动检测只看开头几秒音频。解决手动指定语言官方文档也明确建议这样做多数情况下质量更好。现象想在完全断网的机器上用。原因模型需要联网下载。解决在有网机器上下载模型把整个模型目录拷到离线机的缓存位置Linux~/.cache/BuzzmacOS~/Library/Caches/BuzzWindows%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache仓库里 scripts/download-models.py 就是干这个的。选型建议按你的机器对号入座你的情况推荐组合理由MacApple SiliconWhisper.cpp base/small原生支持 Apple Silicon资源占用最低笔记本核显 / 老机器Whisper.cpp tiny 或 baseq5 量化唯一能跑得动实时转录的方案Nvidia 独显 ≥6GB 显存Faster Whisper medium速度最快的一档日常到专业都够专业交付、精度优先Faster Whisper large-v3最准遇到幻觉问题回退到 large-v2要批量、要自动化命令行 监听文件夹buzz add --model-type whispercpp --model-size small --srt 文件.mp4一条命令出 SRT详见 CLI 文档最后一步Buzz 的价值就一句话你的音频只在你自己的机器上变成文字隐私、成本、格式三个问题一次解决。现在打开它导入一段 1 分钟的音频用 base 模型跑一次转录——10 分钟后你会知道它适不适合你的日常流程。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考