ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

小米 MiMo-V2.6 全面解析:1.02T MoE、1M 上下文,Coding 有多强?API 输入 1 元/百万 Token 起

小米 MiMo-V2.6 全面解析:1.02T MoE、1M 上下文,Coding 有多强?API 输入 1 元/百万 Token 起 2026 年 9 月 22 日小米正式发布并开放MiMo-V2.6 系列。这一代 MiMo 的几个关键词非常明确万亿参数 MoE、1M 超长上下文、原生全模态、Coding、Agent、大规模强化学习以及低价 API。其中 MiMo-V2.6-Pro 总参数达到1.02T并在 Artificial Analysis Intelligence Index 中取得46 分左右而 MiMo-V2.6-Flash 的国内 API 普通输入价格只有1 元/百万 Token。那么 MiMo-V2.6 到底用了什么架构Coding 能力怎么样API 有多便宜值不值得用本文一次讲清楚。一、MiMo-V2.6 有哪些版本目前主要有三个其中真正的两个核心模型是Flash 和 Pro。UltraSpeed 可以理解成 Pro 的高速服务版本。官方称在保持 Pro 能力的情况下最高可以达到普通 Pro20 倍输出速度但 API 价格也明显更高。Pro 和 Flash 都支持文本、图片、视频、音频输入 → 文本输出并支持深度思考、工具调用、联网搜索、结构化输出、上下文缓存等功能。两者 API 最大上下文都是1M Token最大输出128K Token。二、架构万亿参数不代表每次都跑万亿参数MiMo-V2.6 的核心架构是Sparse MoE稀疏混合专家模型简单理解输入 Token ↓ Router 路由器 ↓ 从大量 Expert 中选择少数专家 ↓ 参与本次计算 ↓ 生成结果以 Pro 为例总参数1.02T每个 Token 激活参数42B70 层 Transformer384 个 Routed Experts每次激活 8 个 ExpertFlash 则是总参数309B激活参数15B48 层 Transformer256 个 Routed Experts每次激活 8 个 Expert所以 Pro 虽然超过1 万亿参数但推理时不会让全部参数同时参与计算。SWA Global AttentionMiMo-V2.6 还采用了混合注意力Sliding Window AttentionSWA Global AttentionGASWA 负责处理局部信息Global Attention 定期进行全局信息交互。这样做的一个重要目的就是降低超长上下文的计算和 KV Cache 压力。此外模型还包含5 层 MTP speculative decoder用于加速生成。所以 MiMo-V2.6 的整体思路可以简单概括成Sparse MoE SWA / Global Attention MTP 1M Context三、不只是文本模型而是原生全模态MiMo-V2.6 原生支持视觉部分采用681M 参数 MiMo ViT音频部分包含308M AudioTokenizer 127M Audio Patch Encoder。所以这一代 MiMo 的目标明显已经不只是“聊天机器人”。小米展示的实际应用已经包括前端开发PPT 制作3D 建模游戏开发Computer Use多 Agent 协作科研任务甚至提出了Vibe World通过自然语言、图片或视频让多个 Agent 协作完成 3D 场景、交互逻辑和视觉验证。四、真正值得关注的是 Agent 强化学习MiMo-V2.6 一个很重要的变化就是强化了Agentic RL。小米没有把 Coding、Agent、视觉、网络安全完全拆开训练而是把Coding General Agent Visual Agent Cybersecurity混合进同一套强化学习训练中。官方披露Flash 和 Pro 都在不到 6 天内完成约30 个 RL Step、约 75 万条 Trajectory训练成本分别约85 万美元和 262 万美元。在训练过程中DeepSWE v1.1 成绩也出现明显提升Flash48.8 → 65.68Pro58.4 → 72.57需要注意这是RL 训练过程曲线与最终模型卡公布的正式 Benchmark 数字不是同一组测试结果。五、Coding 能力到底怎么样这可能是开发者最关心的一部分。小米官方模型卡公布的数据如下以上数据来自小米官方模型卡。从这些数据能看出一个比较明显的特点MiMo-V2.6 的强项并不是简单写一道代码题而是 Agentic Coding。也就是读取代码仓库 ↓ 分析问题 ↓ 调用 Terminal / 工具 ↓ 修改多个文件 ↓ 执行测试 ↓ 检查结果 ↓ 继续修改例如 DeepSWE v1.1 中MiMo-V2.6-Pro 达到71.9与官方模型卡列出的 Claude Opus 5 的 74.0、GPT-5.6 Sol 的 73.0 已经比较接近。但它也不是所有榜单都领先。例如 Terminal Bench 4.0MiMo-V2.6-Pro 34.9 GPT-5.6 Sol 39.9 Claude Opus 5 49.0所以更准确的说法应该是MiMo-V2.6 的 Coding 和 Agent 能力已经进入当前主流旗舰模型竞争区间但不同任务之间依然存在明显差异。而不是简单说“全面超过 Claude / GPT”。六、第三方榜单表现怎么样除了小米自己的模型卡还可以看独立评测机构Artificial Analysis。截至本文撰写时指标FlashProIntelligence Index3846输出速度约51 token/s约42 token/s每任务成本$0.06$0.13上下文1M1MArtificial Analysis 当前将 MiMo-V2.6-Pro 列在其开放权重模型 Intelligence Index 的#1 / 117。小米发布时给出的更精确分数为46.32对应 Artificial Analysis Intelligence Index v4.3。这里一定要注意“Artificial Analysis 榜单第一” ≠ “所有任务都是世界第一”。它只能说明 MiMo-V2.6-Pro 在这个综合指数及对应比较范围中表现非常突出。七、API 价格可能才是最大的亮点国内实时 API 价格如下模型缓存命中输入普通输入输出Flash¥0.02/M¥1/M¥2/MPro¥0.025/M¥3/M¥6/MPro-UltraSpeed¥0.25/M¥30/M¥60/M单位均为元 / 100 万 Token。其中 Flash 特别夸张普通输入 100 万 Token 只要 1 元。如果长期运行 Coding Agent往往会重复传入项目代码System Prompt历史对话Agent Memory工具调用结果这时候缓存价格也非常关键。Flash 的缓存命中输入只有0.02 元 / 100 万 Token。另外小米还提供Batch API目前 Pro 和 Flash 的批量推理价格只有实时 API 的50%。对于批量数据处理、模型评测、摘要和离线任务来说会更加便宜。八、API 接入也比较简单MiMo API 同时兼容OpenAI APIAnthropic Messages API如果项目原本使用 OpenAI SDK通常只需要修改API Key base_url modelOpenAI 兼容接口的 Base URL 为https://api.xiaomimimo.com/v1模型名称主要使用mimo-v2.6-flash mimo-v2.6-pro因此对于已有 AI 应用或者 Coding Agent 来说迁移成本比较低。九、MiMo-V2.6 到底好不好用综合目前公开数据可以把它的优缺点概括得很清楚。优点1. Coding / Agent 能力强DeepSWE、AutomationBench、Terminal Bench 等测试已经达到较高水平。2. API 非常便宜尤其是 Flash输入 ¥1/M输出 ¥2/M。对于需要大量 Token 的 Agent 应用很有吸引力。3. 1M 超长上下文适合代码仓库、长文档、Agent 历史记录和大型工作流。4. 原生全模态文本、图片、视频、音频可以进入同一个模型。需要注意的地方第一Pro 本地部署门槛非常高。1.02T 是完整模型参数规模即使推理时只激活 42B也不意味着只需要存储 42B 权重。对于绝大多数普通用户来说直接调用 API 更现实。第二普通 Pro API 的速度不是最大优势。Artificial Analysis 当前测试约为42 token/s并不属于最快的一档。如果特别在意实时响应可以考虑 UltraSpeed但价格约为普通 Pro 的 10 倍。第三不要只看 Benchmark。Benchmark 成绩并不完全等于真实开发体验。最终还是应该比较任务成功率 Token 消耗 运行时间 API 成本十、Flash 和 Pro 怎么选其实非常简单。MiMo-V2.6-Flash更适合日常 Coding批量 API 调用AI Agent数据处理自动化工作流成本敏感场景它只有 15B 激活参数却在很多 Agent Benchmark 中与 Pro 差距并不算特别大而 API 价格只有 Pro 的约三分之一。MiMo-V2.6-Pro更适合大型代码工程长程 Agent复杂推理科研任务多 Agent 协作对成功率要求更高的任务Pro-UltraSpeed适合对延迟非常敏感而且愿意用更高成本换速度的生产场景。十一、最后总结如果用几个关键词概括 MiMo-V2.6MiMo-V2.6-Pro 已经在 Artificial Analysis Intelligence Index 中进入当前开放权重模型的最前列Coding 和 Agent 相关 Benchmark 也已经能够与主流旗舰模型放在同一张表里比较。但对普通开发者来说我认为更值得关注的其实是MiMo-V2.6-Flash309B 总参数、15B 激活参数、1M 上下文、DeepSWE 67.9普通 API 输入仅 1 元/百万 Token。小米同时已经公开 MiMo-V2.6-Pro-RL 和 Flash-RL 权重并采用MIT License。所以 MiMo-V2.6 真正值得关注的地方并不是某一项 Benchmark 有没有拿第一而是它正在把模型能力、Coding、Agent、长上下文和 API 成本同时做到一个相当有竞争力的位置。对于 Coding Agent、大规模自动化工作流和高 Token 消耗的 AI 应用MiMo-V2.6 已经值得实际跑一次自己的项目测试。
返回列表