罗福莉素来对“天才少女”这一标签嗤之以鼻。去年,她曾公开吐槽围绕自己的文章充斥着事实错误,甚至直言如果自己不认识她,也会给那些买热搜的评论点赞。一年多后,她再次成为焦点。这次,小米没有选择沉默,而是将MiMo模型的训练进度公之于众,进行了一场为期数日的“直播”。
北京时间9月22日,随着MiMo-V2.6系列正式发布,这场持续数日的“直播”终于画上句号。在第三方评测机构Artificial Analysis的综合智能指数中,MiMo-V2.6-Pro以46分登上了开放权重模型榜首,而上一代V2.5-Pro的分数仅为26分。从26分跃升至46分,这一进步幅度显然远超版本号中那个小数点所暗示的变化。
除了亮眼的成绩,极具竞争力的定价也吸引了开发者的目光。MiMo-V2.6沿用了上一代的API价格,Pro的常规输入价格为每百万Token 3元,输出6元;更便宜的Flash输入1元,输出2元。对比来看,DeepSeek-V4.1-Flash的输出价格在空闲时段为4元,高峰时段为8元。小米的Flash输出价格仅为DeepSeek高峰时段的一半。至少从价目表上看,开发者多了一个极具性价比的选择。
罗福莉在X平台上发文称,MiMo背后的研究创新和工程挑战超过了她曾参与过的DeepSeek R1。这番言论显示出她强烈的自信。这次发布,小米不仅交出了成绩单,还开放了技术报告、RL版权重、约7000个训练任务环境及配套框架,甚至提供了一个学过MiMo解题经验的90亿参数模型供同行研究。Hugging Face的研究员Elie Bakouch将这批资源的分享称为此次发布中“最疯狂的部分”。
罗福莉给那篇长帖起的标题直译为《MiMo-V2.6:扩展RL的艰难之路》。她指出,按计算投入衡量,这很可能是开源模型团队迄今为止进行过的最大规模单次RL训练。小米此次探索的是通过增加尝试、扩充任务、投入更多算力并检查结果,从而推动模型进步的方法。按照技术报告,一次训练更新会安排1568条任务提示,每条尝试16次,合计约2.5万次完整尝试。
在工程实现上,团队面临如何衔接流程、减少机器闲置时间的难题。此外,团队还解决了模型“找现成答案”的问题,通过清理缓存、限制网络访问以及引入Agent检查漏洞,并区分方案的质量(如简洁性),确保训练的有效性。针对不同任务耗时差异大的问题,团队采用了MixRL策略,将游戏、3D等任务单独训练,再通过“蒸馏”融合。
小米还提到了RSI,即“递归自我改进”,这是让AI参与出题和评分、推动自我进化的重要方向。在正式发布前的“直播”中,外界看到6天RL训练显著提升了模型在DeepSWE评测中的表现。这种公开透明的训练过程,配合大方的资源分享,让小米和罗福莉从单纯的“营销噱头”转向了实质性的技术展示。
回顾罗福莉的职业生涯,2024年11月她正式加入小米MiMo团队。此前,她在阿里达摩院和DeepSeek都有过研究经历,关于“雷军千万年薪挖人”的传闻早已甚嚣尘上。尽管外界对她的学历、年龄和身价津津乐道,但今年3月MiMo以Hunter Alpha匿名上线时,仍有开发者调侃小米的营销手段一流。然而,此次MiMo-V2.6的发布,用实打实的技术成果和慷慨的开源策略,让质疑声逐渐消散。
罗福莉的团队管理风格也逐渐清晰。她曾提出“次日对话少于100次可以辞职”的言论,虽被解读为狼性管理,但她解释这只是为了推动团队真正使用Agent工具。她强调团队不按传统预训练、后训练划分小组,而是扁平化管理,不同领域的人坐在一起讨论,这种协作方式也呼应了模型MixRL训练的理念。她提醒负责人不应有绝对控制权,认为没了自己团队也能运转。
做出成绩固然需要天赋,但将一切归功于“天才”则忽略了太多的努力与细节。罗福莉和小米已经交出了一份不错的阶段性答卷,但未来的路依然漫长,模型能否持续进步、开发者是否买账、桌面端能否成为日常工具,仍需时间检验。
