ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SnapOtter音频处理指南:转写、降噪、音量均衡,27个音频工具完全手册

SnapOtter音频处理指南:转写、降噪、音量均衡,27个音频工具完全手册 SnapOtter音频处理指南:转写、降噪、音量均衡,27个音频工具完全手册【免费下载链接】SnapOtterOpen-source, self-hosted file-processing tool. Convert, compress, OCR, transcribe run local AI across image, video, audio, PDF documents, via UI, REST API pipelines. Your files never leave your network.项目地址: https://gitcode.com/gh_mirrors/st/SnapOtterSnapOtter 是一个开源、可自托管的文件处理工具,主打音频转写、音频降噪与音量均衡等 27 个音频工具,支持通过网页 UI、REST API 和流水线批量处理。所有文件始终留在你的网络内部,不上传到任何第三方服务器。无论你只需要把一段录音转成文字字幕,还是想批量压掉背景噪音,这篇完整指南都能帮你快速上手。 为什么选择自托管音频处理?上传录音到在线平台,意味着声音数据要离开你的设备。SnapOtter 的思路相反:整套能力部署在你自己的服务器上,通过 docker/docker-compose.yml 一条命令即可拉起,包含 PostgreSQL、Redis 与应用本体。隐私:语音、会议录音、播客素材全程不出内网本地 AI:语音转写由本地模型完成,无需调用云端接口三种用法:网页界面、REST API、可编排的 pipeline 流水线零成本:开源许可,任意规模自用 最快部署方法:一条命令启动克隆仓库后,使用内置的 Docker 编排文件启动完整服务:git clone https://gitcode.com/gh_mirrors/st/SnapOtter cd SnapOtter docker compose -f docker/docker-compose.yml up -d打开浏览器访问服务地址,进入Tools页面,点击顶部的Audio 27标签页,即可看到全部 27 个音频工具,支持关键词搜索(如 noise、transcribe)。️ 27 个音频工具全景图所有工具注册于 apps/api/src/routes/tools/index.ts,元数据定义在 packages/shared/src/constants.ts。按用途可分为六大类:分类工具用途️ 转写与字幕Transcribe Audio、Auto Subtitles、Extract/Burn/Embed Subtitles语音转文字、自动字幕、字幕烧录与嵌入 降噪与清理Noise Reduction、Silence RemovalFFT 降噪、剔除静音片段 音量均衡Normalize Audio、Adjust Volume、Video Loudnorm、Fade Audio广播级响度归一、增益、淡入淡出✂️ 编辑与拼接Trim/Split/Merge Audio、Extract/Replace Audio、Mute Video剪切、分段、合并、音轨提取与替换️ 效果与变调Audio Speed、Pitch Shift、Reverse Audio、Audio Channels、Ringtone Maker变速、变调、反转、声道处理、铃声制作 格式与元数据Convert Audio、Audio Metadata、Waveform Image格式互转、ID3 标签管理、波形图生成️ 重点一:语音转写(本地 Whisper)Transcribe Audio是本项目的招牌音频 AI 能力,路由实现见 apps/api/src/routes/tools/transcribe-audio.ts,底层调用 Python 侧车脚本 packages/ai/python/transcribe.py。关键特性:11 种语言:自动检测,或手动指定中文、英语、日语、韩语、法语、德语、西语等3 种输出格式:纯文本(txt)、SRT 字幕、VTT 字幕,带逐句时间戳本地运行:转写在你服务器内完成,最长支持约 30 分钟的任务,带实时进度条使用提示:转写属于 AI 功能,首次使用需在 Settings 中安装对应的 AI 功能包(界面会提示预计下载大小);若未安装,API 会返回501 Feature not installed,安装后即可正常转写。转出的 SRT/VTT 可直接接给Burn Subtitles或Embed Subtitles,完成录音 → 字幕视频的完整链路。 重点二:降噪与静音清理Noise Reduction:基于 FFT 的频域降噪,擅长压制录音中的恒定背景噪音(空调、电流声、键盘声)。工具路由:apps/api/src/routes/tools/noise-reduction.tsSilence Removal:自动检测并剔除录音中的静音段,适合播客、面试录音的快速瘦身典型工作流:先Silence Removal去掉停顿,再Noise Reduction压底噪,最后Normalize Audio统一响度——三步即可让粗糙录音变得专业。 重点三:音量均衡Normalize Audio:把整体响度归一到广播标准电平,解决忽大忽小问题,实现见 apps/api/src/routes/tools/normalize-audio.tsAdjust Volume:按固定增益放大或缩小音量Video Loudnorm:针对视频文件,把音轨响度对齐广播标准,让不同来源的视频音量一致Fade Audio:添加淡入/淡出,制作片头片尾过渡或自定义铃声✂️ 其他常用工具速览Extract Audio:从 MP4/MOV 等视频中无损提取音轨Replace Audio / Mute Video:替换视频音轨或彻底静音Trim / Split / Merge Audio:剪切片段、按时间或静音点自动分段、多文件合并Audio Speed / Pitch Shift:变速(不变调)、按半音升降调Reverse Audio / Audio Channels:声音反转、单声道/立体声转换、左右声道交换Ringtone Maker:从任意歌曲裁出铃声片段Convert Audio:MP3、WAV、FLAC、AAC、M4A、OGG、OPUS 等 11 种格式互转,支持的格式清单见 packages/shared/src/modality.tsAudio Metadata:查看、编辑或清除 ID3 标签Waveform Image:把音频渲染成 PNG 波形图,适合做播客封面素材 三种使用方式:UI、API、流水线网页 UI:上传文件 → 选择工具 → 调整参数 → 下载结果,适合日常单文件处理REST API:每个工具对应一个POST /api/v1/tools/...端点,如转写为/api/v1/tools/audio/transcribe-audio,配合 API Key 即可集成到自己的系统;完整接口文档见 apps/api/src/openapi.yamlPipeline 流水线:把多个工具串成链,例如extract-audio → silence-removal → noise-reduction → normalize-audio → convert-audio,批量处理整个录音库;流水线入口见 apps/api/src/routes/pipeline.ts 支持格式与常见问题输入音频格式:mp3、wav、flac、aac、m4a、ogg、opus、wma、aiff、amr、ac3,共 11 种;视频输入(mp4、mov、mkv、webm 等)也可直接用于提取与替换音轨。常见问题:转写提示 Feature not installed?这是 AI 功能包尚未安装,在 Settings 中按提示安装对应 bundle 即可降噪后声音发闷?降低降噪强度,或先做静音清理再降噪想让多个视频音量一致?使用 Video Loudnorm 统一归一,而非手动加减音量✅ 总结SnapOtter 的 27 个音频工具覆盖了从语音转写、FFT 降噪到广播级音量均衡的完整链路,并额外提供剪辑、拼接、变调、格式转换与元数据管理。自托管架构保证你的录音数据永不离开自己的网络,UI、REST API 与 Pipeline 三种入口让个人用户和自动化场景都能开箱即用。结合 docker/feature-manifest.json 按需安装 AI 功能包,按需扩展能力,是隐私敏感场景下处理音频文件的高性价比方案。【免费下载链接】SnapOtterOpen-source, self-hosted file-processing tool. Convert, compress, OCR, transcribe run local AI across image, video, audio, PDF documents, via UI, REST API pipelines. Your files never leave your network.项目地址: https://gitcode.com/gh_mirrors/st/SnapOtter创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表