小米近期开启了一场极具话题性的直播:公开其MiMo-V2.6模型强化学习训练的全过程。打开页面,与其说是技术现场,不如说是一场“烧钱”秀。数据触目惊心:每分钟消耗约4000元人民币,36小时内两款模型已烧掉超过108万美元,平均每小时高达3万美元。若换作其他公司,这场景恐被调侃为“误闯天家”,但小米却坦然面对,将其称为“误闯米家”。页面实时公开训练成本、步数、奖励曲线变化及硬件故障信息,这种对训练过程的透明化操作极为罕见,引得围观群众纷纷叫好。
目前,MiMo-V2.6的Flash和Pro两个版本正处于初期训练阶段(约1天)。尽管如此,性能已现端倪:Pro的dynsam/avg@n指标从初期的0.565提升至0.614,Flash则从0.514升至0.603。在DeepSWE v1.1离线评测中,Pro与Flash分别取得了62.24和60.77的分数,虽然仍落后于DeepSeek-Flash v1.1的74.2%,但Flash凭借较低的起点实现了快速追赶,而Pro目前仅小幅领先,且因单步训练耗时较长,最新评分尚未出炉。
自今年4月开源MiMo-v2.5以来,小米团队已沉寂近半年。近日,负责人罗福莉透露,这期间团队专注于攻克一个核心问题:强化学习的扩展边界究竟有多远。传统预训练的Scaling Law(扩展法则)早已成熟,即“更多数据×更多参数×更多算力=更强模型”。如今,业界前沿模型正试图将这一逻辑复刻至强化学习领域,即通过增加轨迹生成量、丰富任务环境、加大评分计算投入,来持续提升模型能力。小米对此给出的答案是,将在三个维度上进行扩展:训练计算量、环境与执行框架、以及评分计算量。
第一个维度是计算量的扩展。MiMo-V2.6在单步训练中处理约20亿Token,具体配置为1568个Prompt,每个Prompt生成16条Rollout。这意味着模型对同一问题会进行多次尝试,而非单一回答,单轮即可产生超过2.5万条轨迹。对于Agent任务,一条Rollout往往包含数十轮交互,涉及思考、工具调用及环境反馈,使得单个Step的Token数可达数十亿。更关键的是,系统采用了“完全异步”执行模式。不同于传统流水线必须等样本全部生成后再评分,MiMo实现了生成、执行、评分和训练的无缝衔接。不同任务可同时处于不同阶段:有的在执行,有的在等待判分,有的在计算奖励,形成持续运转的异步流水线。
第二个维度是环境的扩展,涵盖训练环境与执行框架。MiMo-V2.6致力于多任务Agent强化学习,将代码、通用任务、视觉、对话等不同类型任务混合在同一轮次中训练。每种任务可能运行在特定的Harness(执行框架)上。例如,编程Agent的Harness允许其操作终端、修改代码并运行测试;而视觉Agent则可能拥有另一套工具集和交互逻辑。因此,MiMo的扩展不仅在于增加“题目数量”,更在于丰富模型接触的环境类型、工具种类及问题解决方式。直播页面中的“Batch Composition”栏目,正是实时展示模型在每一步训练中从何种环境与任务中汲取经验。
第三个维度是评分计算的扩展,即增加给分所需的算力。复杂Agent任务的奖励机制远非选择题般简单,代码任务可通过运行测试用例获得客观反馈,但在开放性任务中,仅判断“最终成败”往往不够。此外,更关键的是“信用分配”问题。若Agent完成40步操作才成功,仅告知“Reward=1”过于粗糙,模型无法分辨是哪一步起决定性作用。MiMo提出了“Agentic In-group Credit Assignment”,旨在利用同组多条轨迹的对比,更细致地判断哪些行为应获奖励、哪些应受惩罚,从而生成更精准的学习信号。至此,MiMo的三大扩展方向形成闭环:通过扩展计算量增加经验数量,通过扩展环境丰富经验类型,通过增强评分计算提升经验质量。面对“能否将RL循环也变为可规模化机器”的质问,围观者ViT大佬给出了直白的总结:这三件事,归根结底都是算力。
