什么情况?小米新模型的强化学习训练,直接开了现场直播。

点进去一看,这哪是训练现场啊,这就是烧钱现场,一眨眼就是10美刀,一分钟就是4000多元人民币出去了。

当然烧钱的速度可能不是均匀的,从pro模型开始训练算起36小时,两款模型已经花了超过108万美元,平均每小时3万美元

要是别人干这事得喊一句误闯天家,但是小米干这事只能喊一句误闯米家了。

在这个页面上,训练花了多少钱、跑了多少步、奖励曲线涨没涨、哪个节点的显卡出了故障,全部公开可查。

见过开放权重、开放训练代码和开放训练数据的,开放训练过程的还真是没见过,围观群众纷纷大呼过瘾。

那么目前MiMo-V2.6的Flash和Pro两款模型训练得怎么样了?

其实还在初期,毕竟刚开始训练1天多一点。

不过已经能看出两者在RL过程中都有了比较明显的能力提升:

Pro的dynsam/avg@n从第1步的约0.565提升至0.614,Flash则从约0.514提升至0.603;最新公开的DeepSWE v1.1离线评测中,Pro和Flash分别达到62.24和60.77。(对比DeepSeek-Flash v1.1是74.2%)

Flash从更低的起点快速追近,Pro目前只保持小幅领 先。不过Pro训练完一个Step更慢,所以最新的评分还没出来。

自4月份开源MiMo-v2.5后,小米沉默了近半年。

现在负责人罗福莉出来解释,这期间只研究了一件事:强化学习能扩展到多远

小米公开如何Scaling强化学习

传统的预训练scaling很容易理解:更多数据 × 更多参数 × 更多算力 → 更强模型

现在前沿模型越来越关注RL能不能也这样scaling?

也就说如果持续增加每轮生成多少轨迹;模型面对多少种真实任务环境;为判断这些轨迹好不好投入多少计算;

模型能力是否还能持续提高?

小米给出的答案是沿三个维度扩展:训练计算量、环境/执行框架、评分计算3量。

计算量的Scaling

第 一个维度最直观,就是把RL本身的计算规模做大。

MiMo-V2.6系列每个训练Step大约会处理20亿Token,配置为1568个Prompt × 每个Prompt 16条Rollout

也就是说,同一道题并不是只让模型回答一次,而是让它尝试多条不同的解题和行动轨迹,再从这些尝试中获得强化学习信号。

1568×16意味着一轮就可能产生超过2.5万条Rollout。而对于Agent任务来说,一条Rollout又远不只是“一问一答”:模型可能要经历几十轮思考、工具调用、环境反馈和再次行动,因此最终一个Step的Token数可以达到数十亿级别。

更重要的是,整个系统采用了Fully Async,也就是完全异步的执行方式

传统意义上可以把一次RL训练想象成一条整齐的流水线:先把所有样本生成完,再统一评分,然后训练模型,最后开始下一轮。

但大规模Agent RL很难这样等待。

在MiMo的系统里,不同任务可以同时处于不同阶段:有的Agent还在环境中执行任务,有的已经完成、等待判分,有的正在计算Reward,还有新的任务正在进入系统。生成、执行、评分和训练不再严格排队,而是组成了一套持续运转的异步流水线。

环境的Scaling

第二个扩展方向是Environments and Harnesses,也就是训练环境和执行框架的扩展

MiMo-V2.6做的是Multi-task Agentic RL:代码、通用任务、视觉、Chat等不同类型的任务,可以被混合到同一次RL Run中训练,而且这些任务还可以运行在不同的Harness里。

例如一个编程Agent的Harness可能允许模型打开终端、修改代码、执行测试、阅读报错,然后继续修改;另一个视觉Agent面对的则可能是一套完全不同的工具、环境反馈和成功条件。

因此,MiMo想扩展的除了“题目数量”,还有模型能够进入多少种环境、使用多少种工具、解决多少种类型的问题

这也是为什么直播页面会专门展示Batch Composition:这一栏实际上是在告诉外界,每一个训练Step中,模型正在从什么样的任务和环境里获取经验。

评分的Scaling

第三个Scaling方向则更容易被忽略:Grader Compute,也就是给打分本身增加算力。

强化学习需要奖励,但复杂Agent任务的奖励 并不像数学选择题那样容易得到。

代码任务还可以运行Test Case:100个测试通过了多少个,就可以形成相对客观的反馈。

但面对更开放的Agent任务,仅仅判断“最终成功还是失败”往往远远不够,负责判断模型做得好不好的评分者,同样开始消耗越来越多计算资源。

而这里还有一个更加关键的问题Credit Assignment,也就是信用分配。

假设一个Agent为了完成任务连续执行了40步:搜索资料、打开网页、阅读信息、编写代码、运行测试、发现错误、修改代码,最终成功完成任务。

如果系统最后只告诉模型一句“成功,Reward=1”,这个学习信号其实非常粗糙。

因为模型并不知道:前面的40步中,究竟哪些动作真正帮助了成功?哪些步骤其实毫无必要?哪一次修改扭转了整个任务?又有哪些动作虽然最后没有导致失败,却实际上是不好的选择?

MiMo在这次训练中特别提到了Agentic In-group Credit Assignment。目前还没有公布具体算法,但结合“同一个Prompt生成16条Rollout”的训练方式,可以理解其基本目标:利用同组多条Agent轨迹及其结果,获得比简单的最终成败更加细致的强化学习信号。

同一组任务尝试,哪些行为应该获得更多鼓励、哪些应该减少鼓励,以及如何把这种判断转成训练信号。

这样一来,MiMo所说的三个Scaling方向实际上构成了一套完整体系:

扩展计算量,让模型产生更多经验;扩展环境和Harness,让模型获得更加多样的经验;更多评分计算量,则负责从这些海量经验中提取更加准确的学习信号。

当预训练的Scaling已经发展多年之后,能否把模型与环境交互、产生经验、评价经验再到学习经验的整个RL循环,也变成一台可以持续扩大规模的机器?

不过前来围观的大佬ViT大佬给出更直接的翻译:三件事,背后都是算力。

最新快讯

2026年09月17日

12:21
鼓狮财经9月17日电,IDC最新数据显示,2026年第二季度全球智能眼镜市场出货量达到354.7万台,同比增长35.3%。其中,音频及音频拍摄眼镜出货量为249.4万台,同比增长54%;AR/ER眼镜出货量为50.5万台,同比增长75.7%;VR/MR头显出货量为54.8万台,同比下降23.3%。2026年上半年,全球智能眼镜市场累计出货量达到711.4万台...
12:21
鼓狮财经9月17日电,知情交易员表示,印度央行在境内外汇市场抛售美元,以此托举卢比。相关人士因未获公开发言授权,要求匿名。美元兑卢比上涨0.1%,报 96.0963。过去数周,印度央行持续在汇市进行干预操作。卢比今年贬值幅度超 6%,表现弱于亚洲其他货币。
12:21
鼓狮财经9月17日讯,国务院新闻办公室今日举行“开局起步‘十五五’”系列主题新闻发布会,介绍“十五五”时期加快推动广播电视和网络视听高质量发展有关情况,并答记者问。 国家广播电视总局网络视听节目管理司司长王小亮说,微短剧深受老百姓的喜爱,全国现在微短剧用户已经超过了8亿人,2025年,微短剧市场规模突破千亿元,近几年涌现出《家里家外》《北往》等一批优秀作品。...
11:52
摩根士丹利认为,中国消费级AI每周使用率已达80%,领 先美国54%,核心驱动在于超级App生态分发与丰富日常场景。报告预测2030年中国C端AI可变现市场规模约3000亿元,99%来自商户意图变现。阿里、腾讯、美团因具备分发与场景优势获正向评级。摩根士丹利认为,中国在消费端AI普及方面已处于全球领 先位置,但真正的变现机会在于将AI能力嵌...
11:52
就在今天(9月16日),新一代搭载豆包手机助手的努比亚手机正式开售了。截至正式开卖前,仅努比亚京东旗舰店单个渠道,预约人数已超过38.6万。消费者的热情很容易让人回想起九个月前,搭载豆包手机助手技术预览版的工程样机M153以3499元限量开售,几分钟内售罄,二手平台的最高报价一度被推至万元。只是这一次,摆在货架上的不再是一台面向尝鲜者的工程...
11:51
9月16日,科技成长板块震荡修复,双创板块成反弹主力,截至收盘,上证科创板50成份指数上涨4.1%,中证科创创业50指数上涨3.3%,创业板指数上涨2.0%。同花顺iFinD数据显示,截至昨日,创业板ETF易方达(159915,联接基金A/C/Y:110026/004744/022907)连续4日获资金净流入,合计超31亿元。
11:51
农业农村部近日正式印发《全国种植业发展“十五五”规划》,为未来农业发展描绘了蓝图。该规划确立了多项核心目标,旨在全面提升粮食及重要农产品的供给保障能力,推动种植业向绿色低碳转型,并依托农业新质生产力强化防灾减灾救灾水平。 展望2030年,我国粮食综合生产能力将稳步攀升,预计达到1.45万亿斤左右。规划明确要求,必须坚守谷物基本自给和口粮绝对安全的底线,确保国...
11:51
据鼓狮财经9月17日报道,阿斯利康中国今日宣布,将投入近2亿元人民币,对无锡生产供应基地的新药开发及供应大楼进行全面升级。此次升级旨在服务于阿斯利康在研心血管创新药物的工艺开发与生产,并确保该药物商业化后的全球供应。项目规划建筑面积约5800平方米,计划于2029年第四季度投入运营,预计年产能可达4亿片。建成后,无锡基地将深度参与药物研发阶段的商业化工艺开发...
11:51
据鼓狮财经9月17日报道,知情人士透露,沙特阿美正着手绕开受损的管道段,计划在数日内恢复约一半的运力,预计全面修复工作将耗时六周。此前,该管道于上周五遭无人机袭击受损,导致沙特方面紧急关停。这一供应中断事件直接冲击了石油市场,推动布伦特原油现货价格飙升至每桶105美元。市场分析指出,随着管道关闭,沙特延布地区的出口库存仅能维持5至7天,未来该国面向全球市场的...
11:22
9月16日,网易有道「NEXT,AGENT|有道AI Open Day」在北京举办。活动现场,网易有道集中展示了覆盖办公、学习、营销等多场景的AI Agent产品矩阵与最 新技术成果,并通过“有道AI Agent未来市集”打造沉浸式体验空间,让到场嘉宾亲身近距离感受到AI如何进入真实工作流。围绕“模型 × Agent × 工作流”模式,网易...