ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【VLM】Qwen3.8-Omni-Flash长音视频理解Agentic模型

【VLM】Qwen3.8-Omni-Flash长音视频理解Agentic模型 noteQwen-MM-Plugins视频问答给视频问答加了三类工具记忆建设omni-memory / video-memory建结构化记忆再检索模型驱动的时间区间定位 粗看/细看omni_av_grounding perceive_media直接一次性感知perceive_media / watch_and_answer asr/caption/grounding 等文章目录note一、Qwen3.8-Omni-Flash二、 Qwen-MM-PluginsReference一、Qwen3.8-Omni-Flash1、向 Qwen3.8-Omni-Flash 提出了一项任务在 12 小时内提升 Qwen2.5-Omni-3B 的四川话识别能力并交付可用模型。它自主选定 WenetSpeech-Chuan 评测集、固定评测标准并完成基线测试随后直接听取语音样本结合识别结果诊断问题构建针对性的训练数据。在连续 4 轮实验中Agent 累计构建了 3,413 条训练数据并根据评测反馈调整方案、保留有效改进、回退无效尝试。最终Qwen2.5-Omni-3B 在同一评测集上的字符错误率从 25.79% 降至 15.30%相对下降约 40.7%。2、扩展了 Qwen-MM-Plugins为长音视频的按需感知、工具调用与工作流执行提供支持同时开源 Qwen-Live Harness为实时、持续的全模态交互提供原生运行环境。两者分别面向长程工作流与实时交互并在与模型的共同迭代中持续拓展全模态 Agent 的能力边界Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-PluginsQwen-Live HarnessComing Soon: https://github.com/QwenLM/Qwen-Live-Harness3、Qwen3.8-Omni-Flash 原生 Agent 则从问题出发自主决定该看什么、听什么并通过由粗到细的多轮取证定位关键信息4、通过扩展数据、上下文与 Agentic EnvironmentQwen3.8-Omni-Flash 的音视频能力接近 Gemini 3.8 Flash音频能力整体超过 Gemini 3.8 Flash。二、 Qwen-MM-Plugins扩展了 Qwen-MM-Plugins为长音视频的按需感知、工具调用与工作流执行提供支持同时开源 Qwen-Live Harness为实时、持续的全模态交互提供原生运行环境。两者分别面向长程工作流与实时交互并在与模型的共同迭代中持续拓展全模态 Agent 的能力边界Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-PluginsQwen-Live HarnessComing Soon: https://github.com/QwenLM/Qwen-Live-Harness1通用类core读本地图片/视频帧把文档、代码、3D 模型、NIfTI 医学体数据可视化给模型看。默认原生模式不用 API key。最推荐装api调云端模型服务做图/视频/音频理解——VL 视觉问答/OCR/定位、Omni 转写/说话人分离/字幕、ASR、SAM3 分割。走 DashScope 或自建兼容服务。search联网搜索 网页抽取 反向图搜Serper/Exa/Tavily 等。2Qwen VL 系列专用video-memory长视频分层记忆问答不用重看、video-edit图/视频/音频生成与剪辑、blender驱动 Blender 建模渲染、freecad参数化 CAD、edu-agent生成中文数理讲解视频。3Qwen Omni 系列专用omni-chatcut音乐 MV / 影视解说 / 保留音色的视频翻译、omni-video2note教程视频转带插图 PDF 笔记、omni-skill-creator把演示视频变成可复用的 Agent Skill、omni-memory长视频的音画记忆谁在场、谁说了什么、怎么说的。omni toolperceive_media omni_asr omni_asr_timestamped omni_multi_speaker_asr omni_av_caption omni_av_grounding omni_av_counting omni_music_caption transcribe_audio# Qwen3-ASRsegmentation# SAM3vision_chat ocr grounding专门处理长视频的音视频联合记忆omni-memory链路举例~10min↓ watch_and_answer ↓ Omni 一次看完整视频10~30min↓ 视情况建立 memory~30min↓ build audio-visual memory ↓ retrieval ↓ answer这个omni-memory能对视频每30s进行总结存储出memory比如下面的entitity实体、episodic区间视频含义等omni-memory对应的工具get_memory_status get_memory_overview plan_and_search watch_and_answer replay_and_answer get_people get_person_dialogue search_dialogue search_facts search_memory get_timeline get_moment总结下Reference[1] Qwen3.8-Omni-Flash从理解到交付释放全模态Agent生产力
返回列表