大模型江湖风起云涌,格局正在重塑。9月21日,小米MiMo团队正式发布并全面开源新一代MiMo V2.6系列,一口气端出三款模型——Pro、Flash和Ultraspeed,彻底改写了全球开源模型的版图。

MiMo V2.6 Pro在Artificial Analysis智能指数中斩获46分,超越了Kimi K3和Qwen3.8 Max,一举夺得全球开源模型第一和国产模型第一的宝座。放眼全球榜单,虽然尚未追平Fable 5.1、GPT-6 Astra等顶尖闭源模型,但已稳稳跻身全球顶尖第一梯队,将其他所有开源模型甩在身后。更令人瞩目的是,其价格维持V2.5不变,但智能水平实现翻倍,直接开辟了新的“智能-成本”帕累托前沿。当其他厂商还在打价格战时,小米直接掀翻了游戏桌。

小米大模型负责人罗福莉在X平台上撰文《The Hard Road to Scaling Up RL》,指出MiMo V2.6很可能是开源世界迄今最大规模的单次RL训练,团队将所有算力押注于强化学习的扩展边界。她直言这次RL的研究创新和工程挑战甚至超过了DeepSeek R1。同一天,SpaceX的Grok 4.7发布,马斯克兴奋转发,但AI博主Chubby迅速改口,称赞MiMo V2.6比Grok 4.7更强且便宜30倍。两者同为46分,但MiMo单任务成本仅0.13美元,Grok 4.7则高达3.74美元。同分、开源、全模态、价格低廉,这五个字成为了社区的共识。

MiMo V2.6是一个系列,针对不同工作场景分工明确。MiMo V2.6 Pro是整个系列的绝对旗舰,全模态、超高性能,覆盖复杂项目、长程任务、高价值工作,甚至能啃网络安全和科研的硬骨头。放眼开源世界,它是唯一一个同时做到全模态和旗舰性能的模型。在多数Agent Benchmark上,它已经能比肩Opus 5和GPT-5.6 Sol。在Design Arena的排名更加细致地暴露了它的实力,在Chat综合场景、Website类别、Web Apps前端开发场景中,它多次超越Opus 5、Fable 5、GPT-5.6 Sol等闭源旗舰。请注意,被它超越的那些名字——Opus 5、Fable 5、GPT-5.6 Sol,每一个都是各家公司几百亿美元投下去的闭源旗舰。一个开源模型,在真实的开发者投票场景中把它们踩在了脚下。

MiMo V2.6 Flash走的是“效率怪兽”路线,全模态、高智能、低成本,专为专业办公中的高频调用和规模化任务设计,已经全面超越上一代旗舰V2.5 Pro。MiMo V2.6 Pro Ultraspeed则是为“高效率”的人准备的,它保留了Pro的旗舰级性能——不做量化,不因速度牺牲智能,同时提供最高10倍推理速度,常态500 TPS,峰值可达1000 TPS。3倍价格换10倍速度,对于强实时交互和对响应速度敏感的生产场景来说,这笔账怎么算都划算。

榜单成绩只是入场券,实战能力才是开发者买单的原因。MiMo V2.6在几个关键场景中的表现,验证了它不是为跑分而生的“应试选手”。游戏开发场景中,它生成的3D开放世界不仅帧率稳定,而且审美统一。复杂3D场景建模中,它能根据文本描述在Blender中生成线框3D模型,空间推理和细节控制不输旗舰闭源模型。多模态输入生成Office文档场景中,它生成了一份“关键矿产”基金路演幻灯片,封面透着投行研报的克制感,文字组织也展现了真正的分析师自觉。新材料研发“Co-Scientist”场景中,小米前沿材料团队用MiMo V2.6 Pro设计了一种能从水中捕获PFAS的新型金属有机框架材料,整个流程实现了端到端闭环,人类专家工作效率提升约10倍,研发周期从压缩到2至3天。北京大学材料科学与工程学院特聘研究员窦锦虎教授评价:“它在这次任务中展现出的研究能力,已经达到了训练有素的博士研究人员的水平。”

MiMo V2.6有一个被低估的优势:单轮交付速度极快。在复杂多步任务中,同等时间内MiMo可以完成更多迭代轮次,结果更可控。MiMo是怎么做到的?这是整个V2.6最让人好奇的问题——预训练基座没有变,参数没有变,凭什么智能水平能跃升到“全球开源第一”?答案藏在四个字里:后训练革命。小米官方给这次发布的定位是探索RSI(递归自我改进)路径的关键一步。罗福莉在9月17日发了一条让整个AI社区炸锅的推文,阅读量冲到了三百万。她说团队沉寂了近半年,只研究一件事:强化学习究竟能扩展到多远。然后,她做了一件前所未有的事:把MiMo V2.6的RL训练过程全程直播。不到6天,Flash和Pro两个模型各跑完30步,累计约75万条轨迹,训练成本分别约85万和262万美元。所有数据实时挂在 mimo.xiaomi.com/rl 上,全世界的研究者都能看到训练曲线一步步攀升。这波操作直接把海外AI社区看懵了。Nathan Lambert评价说这是“迄今为止公开的最酷的大规模RL资源之一”。直播的成绩单也很硬:两个模型的训练任务平均通过率分别相对提升25%和12%;更关键的是样本外——在没参与训练的长程软件工程基准DeepSWE v1.1上,Flash从48.8涨到65.68,Pro从58.4涨到72.57。

真正的核心技术是MixRL——混合任务强化学习。罗福莉把这套方法论浓缩为一句话:You Only RL Once。一次大规模混合任务RL,就能让模型在各个方向上同时涌现能力,不需要针对每个任务分别训练。MiMo V2.6的后训练不是简单地“多练几轮”,而是沿着三个轴同时扩展,形成一个“环境×任务×评分器”三轴协同的自我改进系统。第一轴是Rollout计算,练得够不够多。每个训练步骤使用1568个Prompt,每个Prompt进行16次Rollout,单步训练Token达27亿至37亿,支持1M上下文长度训练,完全异步执行。这是在用4000块GPU铺开一张巨大的“刷题网”,让模型同时面对25000条轨迹,用海量的试错来逼近最优解。16次是成本和信号质量之间的甜蜜点。而“完全异步”四个字,藏着一个关键的工程洞察。传统同步RL像是一场全班统考,所有GPU先一起生成答案,再一起评分,再一起更新模型,必须等所有人交卷才开始下一轮。MiMo V2.6把生成、评分、训练拆成连续流水线,哪条轨迹先跑完就先评分、先学习。不等任何人交卷。

第二轴是环境与Harness,见得够不够广。传统RL只让模型在单一任务上练,MiMo V2.6把编程、通用办公、视觉设计、网络安全等多种Agent任务混在一起训练。编程占68%、通用Agent占12%、视觉设计占13%、网络安全占4%、指令遵循占3%,横跨25个数据源、21种Harness框架。每个领域都有专门的质量把关机制。编程任务建立了三重质检,网络安全方向直接用OSS-Fuzz的真实漏洞做训练环境,视觉设计分两类检查。

第三轴是Grader计算,反馈够不够准。V2.6不满足于简单的“做对了给1分、做错了给0分”,而是把评分过程本身做成了一个Agent。简单任务用离线Rubric按预设维度逐项打分,复杂长链路任务则启动在线的Agentic Grader,在同一组16条Rollout中横向对比所有方案,做“组内排名+信用分配”。这个Agentic Grader会从五个维度进行细粒度评分:方案是否恰当、修改是否精准、改动是否最小化、有没有引入副作用、工程质量是否过关。它甚至能识别出“虽然通过了测试但其实是投机取巧”的方案,把奖励重新分配给真正高质量的解法,并引导模型用更短的路径、更少的Token把任务做完。MiMo做了一个反常识的决定:在评分环节也大量投入算力。传统观点认为算力应该全花在“让模型多练”上,但小米发现,精细的评分信号能让每一步训练都更有效率。

三轴同时发力,构成了一个自我改进的闭环。但三轴扩展只是硬币的一面,另一面是:把这么多不同类型的任务混在一次RL中跑,最大的挑战不是“怎么跑”,而是“怎么不翻车”。MiMo团队为此建了一整套稳定性基建。Sample Mixer调度器负责动态平衡,Router冻结保证训练一致性,MoE架构下每个词由384个专家中的8个处理,RL过程中锁死路由。还有Reward Hacking三层防线,环境消毒、对抗筛查、持续审计。

MiMo V2.6的做法更简单粗暴:智能翻倍,价格不变,直接画一条新线。旗舰档对比一目了然:MiMo V2.6 Pro的三项价格全面最低。相比Opus 5和GPT-5.6 Sol,缓存价格低约99%,输入价格低约89%,输出价格低约95%以上。效率档也是同样的故事:MiMo V2.6 Flash与DeepSeek V4.1 Flash闲时输入价格接近,但输出价格低50%。Artificial Analysis第一时间给出了数据:MiMo V2.6 Pro实测单任务成本仅0.13美元,首次将全球前沿智能带入0.1美元区间。换算到同等智能水平,MiMo V2.6 Pro的价格只有海外模型的1/20到1/60。说白了,在“智能-成本”的帕累托图上,能逃出MiMo V2.6斩杀范围的模型,预计只剩下Fable 5.1、Fable 5、GPT-6、GPT-5.6 Sol、Opus 5和Muse Spark 1.3这寥寥几个。而它们无一例外都是闭源的、定价高得多的旗舰模型。

这不是一次爆发,是三代模型积累的技术复利。回顾MiMo的技术路线,“效率”这个词像一条暗线贯穿始终。从2025年12月的MiMo-V2和2026年4月发布的V2.5,通过MoE稀疏激活、滑动窗口注意力、多Token预测和推理系统协同,在扩大模型容量和上下文能力的同时,把实际激活计算、KV Cache和生成延迟全部压下来。V2.5-Pro的UltraSpeed版本在单台标准8卡GPU节点上突破1000 tokens/s输出速度。V2.5在Agent基准ClawEval上取得相近成绩的前提下,比Kimi K2.6少用42% Token,比Meta Muse Spark少用50% Token。而且,市场已经给出了真金白银的投票:2026年7月,MiMo V2.5登顶OpenRouter全球模型调用量月榜、周榜双料第一,单周调用量突破10万亿Token。一个开源模型,在全球最大的模型API聚合平台上打败所有闭源竞品。MiMo V2.6,正是这条效率路线的阶段性闭环:前两代积累的高效架构降低了长轨迹成本,更快的推理速度扩大了RL探索规模,更丰富的环境与Grader提高了任务成功率。增长后的能力又通过同一套高效系统,以更低成本、更高速度交付。飞轮一旦转起来,越转越快。

小米MiMo V2.6用一个全程直播的RL训练、一套“环境×任务×评分器”三轴协同的自我改进系统、一张全球开源第一的成绩单,证明了——强化学习可以扩展到很远,开源模型可以站到很高,技术效率可以创造真正的帕累托最优。

最新快讯

2026年09月23日

14:09
截至2026年9月22日收盘,红利低波50ETF南方(515450)成交额为1.41亿元,换手率为0.70%,跟踪的标普中国A股大盘红利低波50指数微涨0.04%,走势平稳。 当日市场风格显著偏向科技成长,AI与半导体等高弹性板块领涨,导致红利防御板块的资金关注度出现阶段性回落,指数在窄幅波动中收出接近平盘的小阳线。不过,资金面出现值得关注的变化:红利类ET...
14:09
截至2026年9月22日收盘,计算机ETF南方(159586)交投活跃,换手率达5.58%,成交额为0.15亿元。该基金跟踪的中证全指计算机指数(H30182.CSI)单日上涨1.66%,延续了近期板块的强势走势。 板块走强主要受多重利好催化。首先是当日开幕的2026云栖大会,大会以“智以致用”为主题,核心聚焦Agentic AI,集中展示了千问办公、Qod...
14:09
据鼓狮财经9月23日报道,能源数据机构Kpler警告称,若美国实施柴油出口禁令,全球柴油供应将陷入紧缺,并立刻推高欧洲、拉美及美国西海岸的柴油价格。 Kpler馏分油高级研究分析师戴维·托尼安在9月22日的报告中指出,美国庞大的出口量目前尚无替代来源。他表示,实施禁令的可能性“不大”,因为这会导致美国炼油行业蒙受数百万美元的收入损失,并造成效率损耗。Kple...
14:09
据鼓狮财经9月23日报道,美联储上周实施加息后,金融市场表面看似平静,但安联首席经济顾问、前PIMCO投资官穆罕默德·埃尔-埃利安却发出预警,指出市场动态正迫使全球主要央行不得不跟进加息。 事实上,美联储上周加息后,市场定价迅速转向鹰派,目前甚至计入了明年年中前再加息三次的可能性。尽管英国央行是9月份唯一未加息的主要央行,但其利率预期同样呈现出紧缩趋势。 在...
13:45
大模型训练的核心在于算力,而Agent训练的核心在于环境构建。如何构建环境?DeepSeek署名的最新论文公开了技术细节。这套名为DSec(DeepSeek Elastic Compute)的系统,致力于为Agent训练批量制造沙盒。其性能指标惊人:每秒可生成5000个以上沙盒,日产量达300万个,峰值同时运行38万个。支撑这一规模的集群极其庞大,包含160...
13:45
DeepSeek也加入了这场参数竞赛。据《The Information》报道,DeepSeek目前正在训练一个约2万亿参数的新模型;公司创始人梁文锋近期在投资者会议上表示,下一步计划将模型规模推至8万亿。一年前,8万亿还是难以想象的数字,但现在,Kimi K3已达到2.8万亿参数;字节跳动正在预训练一个最高可能达到10万亿参数的新模型;阿里也公开宣布,下一...
13:45
9 月 16 日,谷歌 DeepMind 核心研究员 Bonnie Li 宣布离职,转投 OpenAI。她在社交媒体上提及了 Ilya Sutskever 曾提出的“Feel the AGI”口号,并坦言自己“第一次感受到了 AGI,之后彻夜难眠”。对于这家曾以 12:1 的人才净流入比傲视硅谷的顶级实验室而言,Bonnie Li 的离开不过是冰山一角。如今...
13:38
截至2026年9月22日收盘,科创人工智能ETF南方(589230)交投活跃,录得0.18亿元成交额,换手率8.15%。其紧密跟踪的上证科创板人工智能指数(950180.CSI)当日收涨2.98%,领跑全市场主要指数。 此次领涨主要得益于AI产业多重利好共振。海外CSP巨头推出的个人AI助手Muse登顶美国iOS免费应用榜首,引爆了AI应用流量,并再度点燃市...
13:38
9月22日收盘,恒生科技指数报4438.21点,涨幅0.34%;港股通互联网指数报699.12点,涨幅0.77%;香港科技指数报1513.64点,涨幅0.50%。 昨日市场的主线逻辑聚焦于海外端侧AI的映射。Meta公司旗下的AI智能体Muse上线一周即登顶美国App Store免费应用榜,推动其股价隔夜大涨超10%。此外,北京时间9月24日Meta Con...
13:38
**资金、产业与政策共振,港股创新药配置价值凸显** 9月22日,港股创新药板块呈现冲高回落的走势,部分获利资金选择离场。当日,国证港股通创新药指数收报1891.17点,跌幅为0.80%。作为紧密跟踪该指数的代表产品,港股通创新药ETF(159297)交投活跃,成交额达3.22亿元,换手率为12.74%。 **资金面持续回暖** 今年以来,南向资金对医药生物...
13:38
截至上午10时17分,恒生港股通创新药指数与中证创新药产业指数双双上涨1.1%,市场表现强劲。今年以来,中国创新药“出海”步伐显著加快。数据显示,2024年1月至8月,中国创新药对外授权交易总额已突破1200亿美元,同比增长36%,首付款规模超过百亿美元,多笔大额交易接连落地。 当前,创新药行业正经历深刻变革,从过去单纯追求管线的“数量竞争”转向注重临床价值...
13:38
据鼓狮财经9月23日报道,黄金素有“加息周期疲软”的规律,但盛宝银行大宗商品策略主管Ole Hansen指出,这一传统关系可能正迎来转折。尽管美债十年期收益率突破5%,创下二十年新高,但黄金ETF持仓量却逆势上扬,触及七个月高位。这反映出市场对美国财政状况的担忧正在重塑收益率与金价之间的关联,两者正呈现日益明显的脱钩态势。当前收益率飙升主要源于通胀高企及长期...