ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

开源SOTA语音转写模型MOSS-Transcribe-Diarize:0.9B参数如何一举超越GPT-4o与Gemini?

开源SOTA语音转写模型MOSS-Transcribe-Diarize:0.9B参数如何一举超越GPT-4o与Gemini? 开源SOTA语音转写模型MOSS-Transcribe-Diarize0.9B参数如何一举超越GPT-4o与Gemini【免费下载链接】MOSS-Transcribe-DiarizeA 0.9B model for long-form transcription in 50 languages with speaker diarization, timestamps, and acoustic event awareness项目地址: https://gitcode.com/gh_mirrors/mo/MOSS-Transcribe-DiarizeMOSS-Transcribe-Diarize 是一个开源 SOTA 语音转写模型仅 0.9B 参数一次推理即可同时完成多语言语音转写、说话人分离Diarization、时间戳对齐和声学事件感知支持 50 语言。在 AISHELL-4、Alimeeting、Movies 等基准上它的说话人归因字错率cpCER全面领先 GPT-4o 与 Gemini 系列并斩获 INTERSPEECH 2026 第二届 MLC-SLM 挑战赛冠军。对于做会议记录、播客整理、字幕生产的同学这是一套可以完全本地部署的轻量方案。 为什么它能以小博大看评测数据官方用三个客观指标评测CER字错率、cpCER含说话人归因的字错率、Δcp转写与说话人分离之间的差距负值说明分离反而降低了错误。数值越低越好模型AISHELL-4 cpCERAlimeeting cpCERPodcast cpCERMovies cpCERGPT-4o–––23.67Gemini 2.5 Pro53.4241.6410.2324.15Gemini 3 Pro27.4332.84–14.73MOSS-Transcribe-Diarize 0.9B15.8322.177.3712.76两个值得注意的细节Alimeeting 上 Δcp 为 -2.69加入说话人标签后错误不升反降说明转写和分离是真正联合建模而非简单拼接。在中文会议场景AISHELL-4、Alimeeting优势最明显cpCER 领先 Gemini 3 Pro 近 10 个和 10 个点。完整表格见 README.md 的 Objective Evaluation 一节中文说明在 README_zh.md。 模型架构Whisper 编码器 自回归语音大模型模型把语音转文本与判断谁在说话合并成一条流水线音频先经 Whisper-Medium 配置16 kHz、80 维 mel、30 秒分块的音频编码器提取特征再通过 4 倍时序合并 MLP 适配器注入到 Qwen3-0.6B 风格的因果解码器中自回归地直接输出带时间戳和说话人标签的紧凑文本。标准输出格式为[起始时间][Sxx]转写文本[结束时间]例如[0.48][S01]Welcome everyone[1.66][12.26][S02]The new transcription pipeline is ready[13.81]下游只需解析这一串文本就能得到时间对齐的说话人分段无需外挂 VAD 或独立的说话人分离模型。解析逻辑位于 moss_transcribe_diarize/transcript_parser.py。 快速上手3步搭建本地语音转写环境 建议使用 Python 3.12 Transformers 5.x 的干净环境。第 1 步克隆仓库git clone https://gitcode.com/gh_mirrors/mo/MOSS-Transcribe-Diarize cd MOSS-Transcribe-Diarize第 2 步创建虚拟环境并安装uv venv --python 3.12 .venv source .venv/bin/activate uv pip install -e .[torch-runtime] --torch-backendauto第 3 步运行推理安装后即可通过 Transformers 加载模型或直接用官方命令行工具定义在 pyproject.toml 中。有 CUDA GPU 时可加装flash-attn加速长音频推理。 四种使用方式从代码调用到字幕 Web 应用Python 直接调用核心流程非常短AutoModelForCausalLM加载模型记得trust_remote_codeTrue→build_transcription_messages构造消息 →generate_transcription生成 →parse_transcript解析成分段。完整示例见 README.md。vLLM / SGLang Omni 部署为 API 服务生产环境推荐用SGLang OmniCUDA 13或vLLM提供OpenAI 兼容的/v1/audio/transcriptions接口一行 curl 即可转写音频response_formatverbose_json可直接拿到解析好的说话人分段。单张 H100 在长音频场景 RTF 可低至约 0.02处理速度是实时的 50 倍以上支持 16 并发。字幕 Web 应用上传视频直接出字幕 这是新手最友好的入口mtd-subtitle-web --model OpenMOSS-Team/MOSS-Transcribe-Diarize --port 7860浏览器打开http://127.0.0.1:7860上传音视频 → 在线校对转写分段 → 下载JSON / SRT / ASS字幕若系统装有 ffmpeg 还能一键把字幕烧录进 MP4。界面支持中英文切换入口在 moss_transcribe_diarize/app/web_cli.pySRT/ASS 导出与说话人配色逻辑见 moss_transcribe_diarize/subtitle/export.py。批量处理则使用命令行版mtd-subtitle。融入 FunASR 生态FunASR 1.4.12 可将 vLLM 服务返回的说话人归因结果归一化为通用sentence_info结构方便接入既有 ASR 工作流。 实用技巧热词提示与自定义 Prompt默认 Prompt 已针对时间戳 说话人分离优化。遇到专有名词识别不准时只需在 Prompt 末尾追加一句请将音频转写为文本每一段需以起始时间戳和说话人编号[S01]、[S02]…开头……热词提示热词1, 热词2, 热词3更多 Prompt 配方仅转写、仅说话人标签、中英双语版整理在 examples/prompts.md可直接通过--prompt参数传给字幕工具。 进阶用 finetune.py 微调模型仓库内置了基于 HuggingFace TransformersTrainer的最小微调流程训练数据为 JSONL 格式每条含 Prompt、音频路径、参考转写单卡直接python finetune.py --train_jsonl data/train.jsonl ...即可多卡用torchrun。详见 FINETUNING.md 与 finetune.py。总结一个模型搞定三件事转写 说话人分离 时间戳输出紧凑可解析天然适配会议、播客、视频字幕场景。效果对标闭源大模型cpCER 在四个基准上全面超越 GPT-4o 与 Gemini 系列还拿了 INTERSPEECH 2026 挑战赛冠军。部署门槛低0.9B 参数本地可跑附带 CLI、Web 字幕应用、API 服务和微调脚本Apache-2.0 协议可商用。【免费下载链接】MOSS-Transcribe-DiarizeA 0.9B model for long-form transcription in 50 languages with speaker diarization, timestamps, and acoustic event awareness项目地址: https://gitcode.com/gh_mirrors/mo/MOSS-Transcribe-Diarize创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表