在首个模型Inkling亮相引发轰动后,Thinking Machines今日正式发布了第二款重磅力作——Inkling-Small。该模型拥有2760亿总参数和120亿激活参数,支持原生多模态及100万token上下文。半个月前,975B参数的开源Inkling曾搅动AI圈,而Inkling-Small仅用四分之一的体量,便实现了对这一“万亿大哥”的性能反超。回顾Thinking Machines近期的动态,剧情可谓跌宕起伏:联创翁荔宣布离职仅两天,OpenAI便证实她将带队攻坚“递归自我提升”项目;而就在第三天,这家刚刚失去核心骨干的公司,便迅速甩出了新模型的“全量权重”。
**01 全新Inkling-Small登场,276B参数击败万亿级模型**
官博介绍显示,Inkling-Small采用MoE架构,总参数2760亿,单次推理激活120亿。相较于初代Inkling,其体量浓缩至四分之一。正如PyTorch大神Horace He所言,“Inkling-Small无需举全村之力,直接沿用前代技术即可”。最核心的是,体量虽缩,实力却升。在数学、推理、智能体编码及多模态基准测试中,Inkling-Small的表现堪比甚至超越了Inkling和DeepSeek V4 Flash。特别是在HLE、Terminal-Bench和IFBench三个核心指标上,Inkling-Small每一FLOP带来的性能提升均高于Inkling。可以看到,Inkling-Small的性能曲线全程压制着Inkling。多模态方面也毫不逊色,图表理解、视觉推理、语音及长音频理解,Inkling-Small在评测中“接近”原版,但代价却低得多。
**02 后训练细节全公开**
官方详细披露了训练方法,关键在于两步。由于Inkling-Small训练晚于初代,它吸收了前一轮踩过的坑,优化了预训练数据配比和机器学习配方。训练过程分为两步:首先用初代Inkling作为老师进行on-policy蒸馏,生成preview检查点;随后基于该检查点进行了整整两周的智能体编码强化学习。正是这两周的努力,让“学生”成功反超“老师”,仅用两周时间便将性能差距拉回并反超。这意味着Thinking Machines成功打通了一条可反复产出模型的工业化流水线:第一个模型是作品,第二个模型则是产能证明。
**03 120亿激活参数,才是真正的分水岭**
对于开发者而言,能否用起来是核心关切。原版Inkling门槛极高,BF16检查点最低要求2TB聚合显存(如8张B300或16张H200);即便是NVFP4量化版,也需600GB起步。Inkling-Small则将这道门槛大幅降低。LMSYS指出,276B总参数配12B激活参数是强化学习的“甜点位”,使得LoRA和全参数训练变得触手可及。以前只有大厂能玩的模型定制,现在中等规模团队也有机会将其训成自己的东西。实测数据显示,在8张B200、TP8、NVFP4、batch size 1的环境下,使用SGLang运行Inkling-Small,开启DSpark可达648 tok/s解码速度,不开启也有288 tok/s。
**04 六位联创离去四位,模型却越发越快**
去年2月,Thinking Machines带着一份“OpenAI梦之队”的六人名单惊艳开局:Mira Murati、John Schulman、Barret Zoph、翁荔、Andrew Tulloch、Luke Metz。当时他们手握20亿美元种子轮和120亿美元估值的剧本。谁能想到,今年1月那轮500亿美元估值的融资最终流产,成为了转折点。如今,六人团仅剩Murati和Schulman。更有趣的是,离去的四人中,Zoph和Metz先后回归OpenAI,翁荔也成为第三个回归者。一家由OpenAI“叛逆者”组建的公司,核心骨干终究没能逃脱OpenAI的引力场。但最充满戏剧性的是团队在动荡中的反应:7月15日,沉默了17个月后公司交出了首个大模型Inkling;不到两周,翁荔离职;仅三天后,第二个带全量权重的开源模型便上线。人才在加速流失,模型在加速狂飙。这两条背道而驰的曲线,成了AI行业最具代表性的一幕。或许这就是通往ASI(人工超级智能)的必经之路:无论留下的人多么稀少,机器向前的车轮只会越转越快。
