小米近期开启了一场极具话题性的直播:公开其MiMo-V2.6模型强化学习训练的全过程。打开页面,与其说是技术现场,不如说是一场“烧钱”秀。数据触目惊心:每分钟消耗约4000元人民币,36小时内两款模型已烧掉超过108万美元,平均每小时高达3万美元。若换作其他公司,这场景恐被调侃为“误闯天家”,但小米却坦然面对,将其称为“误闯米家”。页面实时公开训练成本、步数、奖励曲线变化及硬件故障信息,这种对训练过程的透明化操作极为罕见,引得围观群众纷纷叫好。

目前,MiMo-V2.6的Flash和Pro两个版本正处于初期训练阶段(约1天)。尽管如此,性能已现端倪:Pro的dynsam/avg@n指标从初期的0.565提升至0.614,Flash则从0.514升至0.603。在DeepSWE v1.1离线评测中,Pro与Flash分别取得了62.24和60.77的分数,虽然仍落后于DeepSeek-Flash v1.1的74.2%,但Flash凭借较低的起点实现了快速追赶,而Pro目前仅小幅领先,且因单步训练耗时较长,最新评分尚未出炉。

自今年4月开源MiMo-v2.5以来,小米团队已沉寂近半年。近日,负责人罗福莉透露,这期间团队专注于攻克一个核心问题:强化学习的扩展边界究竟有多远。传统预训练的Scaling Law(扩展法则)早已成熟,即“更多数据×更多参数×更多算力=更强模型”。如今,业界前沿模型正试图将这一逻辑复刻至强化学习领域,即通过增加轨迹生成量、丰富任务环境、加大评分计算投入,来持续提升模型能力。小米对此给出的答案是,将在三个维度上进行扩展:训练计算量、环境与执行框架、以及评分计算量。

第一个维度是计算量的扩展。MiMo-V2.6在单步训练中处理约20亿Token,具体配置为1568个Prompt,每个Prompt生成16条Rollout。这意味着模型对同一问题会进行多次尝试,而非单一回答,单轮即可产生超过2.5万条轨迹。对于Agent任务,一条Rollout往往包含数十轮交互,涉及思考、工具调用及环境反馈,使得单个Step的Token数可达数十亿。更关键的是,系统采用了“完全异步”执行模式。不同于传统流水线必须等样本全部生成后再评分,MiMo实现了生成、执行、评分和训练的无缝衔接。不同任务可同时处于不同阶段:有的在执行,有的在等待判分,有的在计算奖励,形成持续运转的异步流水线。

第二个维度是环境的扩展,涵盖训练环境与执行框架。MiMo-V2.6致力于多任务Agent强化学习,将代码、通用任务、视觉、对话等不同类型任务混合在同一轮次中训练。每种任务可能运行在特定的Harness(执行框架)上。例如,编程Agent的Harness允许其操作终端、修改代码并运行测试;而视觉Agent则可能拥有另一套工具集和交互逻辑。因此,MiMo的扩展不仅在于增加“题目数量”,更在于丰富模型接触的环境类型、工具种类及问题解决方式。直播页面中的“Batch Composition”栏目,正是实时展示模型在每一步训练中从何种环境与任务中汲取经验。

第三个维度是评分计算的扩展,即增加给分所需的算力。复杂Agent任务的奖励机制远非选择题般简单,代码任务可通过运行测试用例获得客观反馈,但在开放性任务中,仅判断“最终成败”往往不够。此外,更关键的是“信用分配”问题。若Agent完成40步操作才成功,仅告知“Reward=1”过于粗糙,模型无法分辨是哪一步起决定性作用。MiMo提出了“Agentic In-group Credit Assignment”,旨在利用同组多条轨迹的对比,更细致地判断哪些行为应获奖励、哪些应受惩罚,从而生成更精准的学习信号。至此,MiMo的三大扩展方向形成闭环:通过扩展计算量增加经验数量,通过扩展环境丰富经验类型,通过增强评分计算提升经验质量。面对“能否将RL循环也变为可规模化机器”的质问,围观者ViT大佬给出了直白的总结:这三件事,归根结底都是算力。

最新快讯

2026年09月18日

14:52
9月17日,D-Space中欧公益路演平台具身智能专场在中欧深圳校区成功举办。本次活动聚焦具身智能领域的前沿探索与商业化落地,共吸引百余位知名投资机构、产业导师及优秀创业企业代表,共同探讨具身智能从技术热潮走向产业时代的破局之道。链接全球创新资源,助力青年科创力量。D-Space中欧公益路演平台由中欧深圳校区发起,以学术引领、资本赋能、产业...
14:52
9月10日,Anthropic发布了一份威胁情报报告,内容覆盖网络攻击、非法模型蒸馏等AI“滥用”行为。其中最受关注的部分,是报告点名7家中国AI公司,指控它们对Claude实施了“工业规模蒸馏”。这已经是该公司今年以来第三次公开此类指控。被置于指控中心的“蒸馏”,并不是一项新技术。2015年,Google Brain团队的一篇论文将其确立...
14:49
鼓狮财经9月18日电,据农业农村部监测,9月18日“农产品批发价格200指数”为116.97,比昨天下降0.12个点,“菜篮子”产品批发价格指数为117.70,比昨天下降0.17个点。截至今日14:00时,全国农产品批发市场猪肉平均价格为16.62元/公斤,比昨天上升1.0%;牛肉71.35元/公斤,比昨天上升0.5%;羊肉66.61元/公斤,比昨天上升0....
14:49
鼓狮财经9月18日电,国务院新闻办公室举行“开局起步‘十五五’”系列主题新闻发布会,住房和城乡建设部城市管理监督局局长张强在发布会上表示,高质量推进城市更新,离不开政策机制保障。我们将着力推动建立健全4项机制:一是城市体检与城市更新一体化推进机制,把体检出来的问题作为城市更新的重点。二是城市更新规划实施机制,建立从专项规划到片区策划,再到项目实施方案的实施体...
14:48
A股市场见证了史无前例的一幕。9月18日,上市仅第二个交易日的沈鼓集团(601091)便走出了堪称历史极值的极端走势。继首日暴涨373.80%之后,该股今日竞价大幅低开近28%,随即快速反弹。尽管在10:08左右股价仍较昨日收盘低约6%,但较15元的开盘价已上涨30%,触发临时停牌。此次停牌从10:06持续至10:16,时长10分钟。令人意想不到的是,这一停...
14:21
一片森林的冠层合拢后,后来者很难再从开阔地上笔直长成大树,但林下并不会因此空无一物:有的植物把根扎进大树够不到的土层,有的攀上既有枝干,借着缝隙向光生长。今年的 AI 办公市场正在经历类似的重新整合。9月2日,腾讯宣布 WorkBuddy 开放平台上线,现场发布9款联名硬件,合作方包括 Plaud、Rokid、影石、科大...
14:21
Mythos模型终于解禁了!就在刚刚,Anthropic正式宣布生命科学验证计划测试版全面上线。此前一直保密的神秘Mythos,首次对专业群体开放。这意味着,以前Claude不敢碰的生物学问题,现在经认证的科学家可以直接提问。 此次权限开放包含两种授权类型。标准使用覆盖了日常大多数生命科研工作,可授权整个团队,每年只需续期一次;高风险使用则移除所有安全限制,...
14:21
9月16日下午,努比亚正式发布并开售NaviX Ultra,该机起售价为5999元,官方补贴后价格为5499元起。这款被外界视为“豆包手机二代”的产品,搭载了全新的豆包手机助手消费者版。用户只需通过语音指令,助手便能调用工具、串联应用,帮助用户完成原本需要逐项手动操作的任务。 第一代豆包手机诞生于2025年12月,由努比亚与字节跳动联合推出,搭载助手技术预览...
14:17
9月18日下午,沈鼓集团股价表现极为抢眼,盘中一度暴涨逾283.65%,股价突破79元大关,总市值飙升至2400亿元。截至发稿时,该股涨幅收窄至236.53%,但上市两天累计涨幅已超过15倍。受此带动,次新股指数整体上扬超4%,信诺维、腾信精密、托伦斯等个股均录得超过20%的涨幅。 回顾过去十年的次新股行情,大致经历了几个显著阶段。2014年至2018年间,...
14:17
今日盘中,溜溜梅股价最高触及197.70港元,创下6月上市以来的新高,盘中涨幅一度接近20%,成交同步放大,总市值约155亿港元。此次上涨缺乏独立公告催化,主要源于资金博弈。6月15日挂牌上市时,因股票简称拼音缩写“LLM”与大语言模型重合,公司被市场戏称为“最正宗LLM概念股”,这一话题在投资者社区迅速发酵。尽管上市首日即录得超200%的涨幅,基石投资者阵...