Featured image of post 小米MiMo-V3将采用HySparse 2新架构,开源V2.6系列强化RL训练能力

小米MiMo-V3将采用HySparse 2新架构,开源V2.6系列强化RL训练能力

MiMo-V3将采用HySparse 2架构;V2.6系列开源并支持1M上下文、1568样本Batch。

新版本发布与关键事实一览

新版本发布与关键事实一览
新版本发布与关键事实一览|新闻截图

小米MiMo团队于9月22日深夜正式发布并开源MiMo-V2.6系列,同时公布MiMo-V3将采用全新架构的信息。核心Highlights如下:

  • 发布时间:2026年9月22日深夜(公开时间为9月23日)
  • 新版本:MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,以及MiMo-V2.6-Distill-Qwen-9B
  • 即将发布:MiMo-V3,将采用HySparse 2核心架构
  • 价格策略:Flash模型每百万词元输入1元、输出2元;Pro模型为输入3元、输出6元;支持99%缓存折扣
  • 何时可用:MiMo-V2.6系列已上线小米MiMo开放平台;MiMo-V3尚未开放具体上线时间
  • 权重开放:MiMo-V2.6-Pro、Flash模型权重及全部技术报告已全面开源

来自RL训练的突破性数据

来自RL训练的突破性数据
来自RL训练的突破性数据|新闻截图

MiMo-V2.6系列是小米探索递归自我改进(RSI)路径的关键一步,其最大突破在于RL(强化学习)训练阶段的算力投入与效率提升:

  • 单次更新使用1568个样本,支持100万上下文长度训练,单步训练Token达3.5至3.7B
  • 训练历时不到6天,成本分别约262万美元(Pro)与85万美元(Flash)
  • 两个模型累计完成约75万条训练轨迹
  • 训练任务平均通过率分别相对提升25%(Pro)和12%(Flash)

在智能体能力方面,模型在三个维度扩展RL算力:更大的Batch与更高吞吐、更多任务与复杂环境、更大的Grader算力。训练体系覆盖Code、General、Visual、Cyber等方向,提供更精准的奖励信号。

一个出人意料的反差在于:尽管Pro模型在AA综合智能指数v4.3.2中取得46分、成为当前开源模型中最高,但距离闭源头部模型(如Claude Fable 5.1和GPT-6 Astra的53分)仍有差距。更值得关注的是,MiMo-V2.6系列(未接受Lean专项后训练的版本)协助研究人员在Lean 4中完成了Li-Yorke《周期三蕴含混沌》原始主定理的完整形式化证明,形成6000余行通过Lean内核实验证通过的源码,展现了通用推理向专业形式化验证领域的跨域能力。

模型能力对比与app落地版本

特性MiMo-V2.6-ProMiMo-V2.6-Flash
AA v4.3.2分数46未披露
训练成本~262万美元~85万美元
DeepSWE v1.1提升+17分(48.8→65.7)+14分(58.4→72.6)
单步训练Token3.5-3.7B3.5-3.7B
SWE-bench Verified61.1→66.2未披露
API定价($/M)3/61/2

MiMo Desktop桌面客户端同步上线,支持Windows与Mac系统,内置UltraSpeed超高速模式,最高提供20倍推理速度提升。订阅会员可直接使用Pro与Flash模型,也可通过API Key配置使用。

开源贡献与科研成果

开源贡献与科研成果
开源贡献与科研成果|新闻截图

小米同步开源三大核心资产:

  1. 7k+高质量RL任务环境:覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类智能体任务
  2. 端到端RL训练框架:基于verl、uni-agent与mini-swe-agent,支持完整训练流程
  3. 轻量可组合的Harness:开源极简mini-harnesses,通过Multi-Harness Training提升泛化能力

在科研落地层面,模型已协助完成金属有机框架(MOF)材料设计方案筛选,并在Lean 4中完成了Li-Yorke《周期三蕴含混沌》原始主定理的完整形式化证明,形成6000余行通过Lean内核实验证通过的源码。

落地使用建议

落地使用建议
落地使用建议|新闻截图

  • 适合立即尝试的用户:需要处理长上下文(1M Token)任务的企业与研究者;希望低成本接入大模型API的开发者;对RL训练流程、多智能体框架感兴趣的开源社区参与者
  • 建议再等等的用户:对纯闭源场景、极致低延迟有硬性要求的生产系应用;对AA指数53+分有明确需求且无法接受开源权重的商业产品方(可等待V3正式发布)

写在最后

小米此次将100万上下文、1568样本Batch的RL训练实践完整开源,为中文社区提供了难得的可复现工业化级大模型强化学习基础设施。开源权重与高性价比API的组合,有望推动国产模型在智能体与长文本领域建立新的技术平权基准。