ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

小米做了一个“架构最平淡“的模型,然后拿了开源第一:这里面藏着今年最重要的一课

小米做了一个“架构最平淡“的模型,然后拿了开源第一:这里面藏着今年最重要的一课 摘要2026 年 9 月 21 日小米 MiMo 团队发布了 MiMo-V2.6 系列旗舰款 MiMo-V2.6-Pro 以 46 分登上 Artificial Analysis 智能指数榜首——这是开源权重模型的历史最高分。而它的前代只有 26 分。有意思的地方在于它的架构非常平淡。经典的 GQA 加滑动窗口注意力窗口小到 128 个 token。没有花哨的新式注意力变体。这恰好印证了一个正在被反复验证的判断如今大部分进步来自数据和后训练配方而不是架构创新。本文拆解小米技术报告里真正起作用的三件事——更多 agent 任务与跨 harness 训练、从判对错升级到看执行轨迹的奖励信号、以及超大强化学习批次顺便讲清楚开源第一这个头衔到底值多少。正文一、一个反常识的组合架构最平淡分数最高先说结论是什么MiMo-V2.6-Pro 在 Artificial Analysis 智能指数 v4.3.2 上拿到 46 分官方口径是 46.32。这个分数让它排到开源权重模型第一位超过 Z AI 的 GLM-5.345 分和 Kimi K344 分。而真正值得玩味的是它怎么拿到这个分数的。如果只看架构你几乎会以为这是一份保守的技术方案稀疏 MoE1.02 万亿总参数、每 token 激活 420 亿70 层主干其中 60 层用滑动窗口注意力SWA10 层用全局注意力隐藏维度 6144384 个路由专家每 token 激活 8 个。没有新发明的注意力机制没有颠覆性的结构。用经典 GQA 搭配 SWA窗口大小设到 128 个 token。128 个 token 是什么概念大概相当于两三个中文句子的长度。也就是说模型在大部分层里只能看见眼前极小的一段内容。这听起来像个缺陷。按直觉上下文窗口都做到 100 万 token 了注意力窗口怎么反而缩小到 128传统认知里注意力看得越远模型越能把握长距离依赖能力应该越强。但 MiMo 的选择说明了一件事注意力窗口大小是个效率问题不是能力问题。全局注意力对每个 token 都要和所有其他 token 计算关系序列一长计算量平方级增长。把大部分层换成小窗口计算成本瞬间降下来而那些真正需要跨长距离理解的层——10 层全局注意力加上第一层——保留全局视野就够了。用一句通俗的话说不是每一层都需要纵观全文多数层只需要读懂眼前的句子。这一观察其实不是小米的原创。Sebastian Raschka 在点评这个模型时把话挑明了这几年他一直在讲一个观点——大部分进步仍然来自数据和后训练配方的改进花哨的注意力变体大多只是效率优化。MiMo-V2.6-Pro 是这句话的一个有力实证架构层面几乎没做什么新鲜事分数却冲到了开源第一。二、那进步到底从哪来技术报告里的三件事既然不是架构我们就得往训练配方里找。小米这次的技术报告写得相当细还开源了训练环境和 RL 代码。里面有三件事最值得琢磨。第一件把 agent 任务加进来而且跨 harness 训练。这是最容易被忽略但可能最重要的一条。过去训练模型的常见做法是在固定的一套评测环境harness里反复练。问题是模型很容易过拟合到这套环境的特性上——在你自己的测试框架里表现优异换个框架就露馅。小米的做法是混合多个 harness 一起训。结果是DeepSWE 这个长程软件工程基准上在没见过的 harness 上的 pass1 准确率从约 50% 提到了 66%。这 16 个百分点的含义比数字本身更重要它代表的是泛化能力而不是记忆能力。模型学到的不是这套环境该怎么应付而是这类任务该怎么解决。在真实业务里这个差别就是能上线和只在 Demo 里能用的差别。第二件换掉判对错的裁判改成看过程的裁判。强化学习靠奖励信号驱动而奖励信号的质量决定了模型学什么。绝大多数团队还在用简单的正确性验证器答案对给 1 分错给 0 分。这套方法在一个致命缺陷——它没法区分侥幸做对和漂亮地做对。一个模型绕了 30 步、试错 8 次才蒙对答案和一个模型 5 步干净利落解决在二元裁判眼里得分完全一样。长此以往模型学到的就是多试几次总能对。小米把验证器换成了一个agentic grader智能体评分器它除了看结果还看执行轨迹。配套的是两个机制GRS组内奖励合成在离线阶段用对比不同轨迹的方式为具体任务生成评分标准GAR组内优势重分配在训练时对通过的轨迹排序把优势值往更高质量的解法上倾斜。效果是模型被引导去用更短的路径、更少的 token 完成任务。这句话值得单独拿出来看——它意味着奖励设计直接影响了推理成本。省 token 不是靠事后压缩而是在训练阶段就被写进了激励。第三件把强化学习批次开到极大。具体规模是每次更新用 1,568 个样本每个样本 16 次采样合计 25,088 条轨迹单步训练 token 数达到 27 亿到 37 亿支持 100 万 token 上下文长度训练。这不是简单的堆算力。全异步的 GRPO 架构、控制面与数据面解耦、混合批次里各任务样本配比的稳定全是工程难题。大 batch 的意义在于梯度信号更稳定——正如前文所说二元奖励的噪声本来就大靠小批量是压不住的。顺带一提规模上去之后还有个隐患MoE 的专家会出现负载漂移也就是流量过度集中在少数专家上。小米的处理是冻结 MoE Router同时建立一套防 reward hacking 的机制——覆盖奖励设计、对抗性评测、异常检测、验证器交叉校验四个环节。这部分讲得比较技术但它是训练没崩和训练崩了之间的分界线。三、还有一件事他们把训练过程直播了这部分我觉得是这次发布里最有意思的决策。小米把生产环境的强化学习训练全程直播了。在不到 6 天里Flash 和 Pro 各自完成 30 步 RL累计约 75 万条轨迹。训练成本分别约 85 万美元和 262 万美元。对应的效果是训练任务的平均通过率相对提升 25%Flash和 12%Pro样本外的长程软件工程基准 DeepSWE v1.1 分别提升约 17 分48.8 到 65.7和约 14 分58.4 到 72.6。为什么直播这件事值得单独说因为它把一个通常被藏起来的东西摆到了台面上一次大规模 RL 训练的真实成本、真实耗时、真实失败率。行业里大部分关于训练一个模型要多少钱的说法都是模糊的而这次给了可以对照的具体数字——不到 6 天、262 万美元、14 个基准分。这个数字还有另一层含义。小米在公告里说MiMo-V2.6-Pro 在同智能水平下价格只有海外模型的 1/20 到 1/60按 Artificial Analysis 的口径它在智能指数上每完成一个任务约花 0.13 美元。技术报告、训练环境、RL 代码全部开源权重以 MIT 协议发布在 Hugging Face 和 ModelScope 上。再叠加一个背景MiMo 团队由前 DeepSeek 研究员罗福莉Fuli Luo带领小米承诺三年投入 87 亿美元做 AI。把这些放在一起看这是一次非常明确的战略表态——中国团队正在用压低单位成本 全面开源的方式去撼动闭源前沿模型的定价权。四、冷静一下这个第一的边界在哪讲完亮点必须把边界划清楚。这部分比前面所有内容都重要。第一开源第一不等于全面第一。46 分这个成绩的定语是在开源权重模型里排第一。Artificial Analysis 自己的页面上SpaceXAI 的 Grok 4.7xhigh同样拿到 46 分。也就是说它是在开源阵营里登顶在最顶尖的闭源模型面前属于同一梯队但并非领先。第二细分项目上它仍然落后。看小米自己公布的数据DeepSWE v1.1 上 Pro 得 71.9 分而 DeepSeek V4.1 Flash 是 74.2、Claude Opus 5 是 74.0、GPT 6 Astra 是 74.0。GDPval 上 Pro 的 Elo 是 1673落后 Claude Fable 5.1 的 1735 和 Opus 5 的 1708。CyberGym 上的 94.0 分则确实亮眼。换句话说这是一个在多项任务上进入第一梯队、但并非每项都第一的模型。综合分数的优势更多来自均衡而非碾压。第三速度数据有两个口径。流传的对比图上标注的输出速度约 326 token/秒而 Artificial Analysis 在标准端点上实测是 129.7 token/秒、首 token 延迟 2.17 秒。这大概率是端点配置不同导致的差异官方另有 UltraSpeed 变体号称同质量下最高快 20 倍。看到快多少倍这类结论时先确认测的是什么配置。第四也有信息没给。第三方点评指出小米没有发布 system card也没有公布训练数据截止时间未列出参与红队的合作方。对一个宣称可商用的 MIT 开源模型来说这些是后续要补的。第五性能数据仍需独立验证。小米自家的评测把多项分数描述为比肩 GPT-5.6 Sol 和 Claude Opus 5这类厂商口径需要等待第三方复现。五、给做 AI 的人最重要的那一课如果这篇文章只能留一个结论我希望是这个当架构创新进入平台期真正的差距来自数据、任务多样性和奖励信号的设计。MiMo-V2.6-Pro 的架构是教科书级别的朴素。它能登顶靠的是把 agent 任务和多种 harness 混进来训让模型学会泛化把二元裁判换成看过程的 agentic grader让模型学会走短路径把 batch 开到两万多条轨迹让噪声大的奖励信号变得可用。这三件事没有一件需要发明新的注意力机制。它们需要的是把训练当成一个完整的系统来设计——任务从哪来、环境怎么搭、奖励怎么写、失败怎么防。对照自己的工作可以问三个问题第一我的评测环境是单一的还是多样的如果只有一套模型在演示里表现好很可能只是过拟合了这套环境。第二我的奖励信号区分得出侥幸对和漂亮地对吗如果区分不出就要接受模型学会绕远路。第三我的规模化是只堆了算力还是同时把任务多样性和评分器的算力一起放大了结语这次发布最反直觉的地方在于它用一份极其朴素的技术方案拿到了一个极其亮眼的分数。它给整个行业提供了一种心理上的松绑你不必等着下一代的注意力机制出现才能做出更好的模型。手边那些不性感的活儿——把任务多样性做上去、把奖励信号写准、把训练流程跑稳——才是真正的胜负手。那个 128 token 的极小窗口像是一个隐喻不用看得很远把眼前的数据和反馈做扎实就足够登顶了。当然只在开源阵营里而且for now——这是原文作者自己加的那个限定词。互动话题你觉得花哨的架构创新和扎实的数据配方哪个更值得投入如果是你在做技术选型会为了 46 分的开源第一放弃闭源前沿模型吗评论区聊聊。免责声明文中模型参数、训练数据、成本与跑分信息来自小米 MiMo 官方技术报告与公告、Artificial Analysis 榜单、以及 Sebastian Raschka 等第三方的公开点评。其中开源权重第一指特定榜单的特定维度厂商自报的评测分数尚未全部经第三方独立验证速度数据因测试端点不同存在口径差异。本文不构成任何技术选型或投资建议。
返回列表