返回博客
·AI技术

小米 MiMo-V2.6 登顶开源多模态:1.02 万亿参数,专治「Agent 只会聊天」

小米 MiMo-V2.6 Pro/Flash 用「一次 RL 走通全模态」的路线,把开源多模态 Agent 的智能指数推到了 46,逼近 Claude Opus 5。

#多模态#AI智能体#开源#小米

# 小米 MiMo-V2.6 登顶开源多模态:1.02 万亿参数,专治「Agent 只会聊天」

如果要给 9 月的开源模型排个座次,小米的 **MiMo-V2.6** 一定在前排。它一次性放出了 Pro 和 Flash 两款全模态(omnimodal)模型:**总参数 1.02 万亿、激活 42B 的稀疏 MoE**,文本、图像、视频、音频全都能处理,还带 **100 万 token 上下文**。Pro 版在 Artificial Analysis 智能指数上拿到 **46 分,是所有开源模型里的最高分**。

一、它凭什么「能打」

MiMo-V2.6 真正的卖点不是大,而是**它能干活**。在 Agent 相关的硬核评测上,它的成绩几乎和对面的闭源旗舰拉到了同一档次:

  • DeepSWE v1.1:71.9;
  • AutomationBench:53.1(Claude Opus 5 是 50.3);
  • OSWorld-Verified:82.0(真实操作系统操作);
  • Toolathlon-Verified:76.9(工具调用);
  • 安全向:**CyberGym 94.0**。
  • 也就是说,**它不只是「看得懂图」,而是能操作电脑、调用工具、完成多步任务**——这才是「多模态 Agent」这个词真正该有的含义。

    二、方法论:一次 RL 走通所有模态

    更有意思的是它的训练路线,官方总结成一句话:**「You Only RL Once」**。

    传统做法是给每种能力(编程、视觉、安全)分别做强化学习,成本高、容易互相打架。MiMo-V2.6 的思路是**一次混合 RL 把编码、通用智能体、视觉、网络安全全过一遍**,再配合两个机制:

  • Groupwise Agentic Grading(GRS + GAR):把奖励信号放大成一个自我改进的循环;
  • Multi-Prefix Multi-Teacher On-Policy Distillation(MOPD2):把能力扩展到那些「难以验证对错」的任务上。
  • 这套组合拳的意义在于:**让「多模态」和「Agent 能力」不再是两张皮**,而是在同一个训练过程里长出来。

    三、价格上有诚意

    Flash 版把价格压到了:**输入 $0.14/百万 token、输出 $0.28、缓存命中 $0.0028**。对一个 1 万亿参数级别的模型来说,这个价位相当激进。加上**权重、技术报告、RL 环境、训练代码全部开源**,对想自建 Agent 的团队来说,可选项又多了一个。

    四、该怎么看这条消息

    2026 年的开源模型竞争,有个很明显的规律:**谁能在「智能体基准」上咬住闭源旗舰,谁就能拿到开发者的注意力**。MiMo-V2.6 的打法很典型——**不追求在所有榜单第一,但要在「操作系统级任务」和「工具调用」这些真正决定产品体验的地方,做到开源最强**。

    小结

    MiMo-V2.6 的出现说明,开源多模态正在跨过「能看能听」的阶段,进入「**能操作、能协作、能干活**」的阶段。对开发者而言,这既是机会(多了一个高性能又便宜的选择),也是提醒——**模型选型的标尺,该从「跑分」换成「能不能把活干完」了**。