Thinking Machines发布Inkling-Small:体量减半性能反超,团队动荡下的AI奇迹
首款模型Inkling亮相之后,Thinking Machines再次掀起波澜。今日,该公司正式发布了第二款重磅模型——Inkling-Small。这款模型拥有2760亿总参数和120亿激活参数,支持原生多模态及100万token上下文。
半个月前,首代975B参数的开源模型Inkling曾引发业界轰动。而此次发布的Inkling-Small,仅用原模型四分之一的体量,便实现了对“万亿参数巨兽”的性能反超。特别是在ARC-AGI-2基准测试中,它刷新了开源领域的最高纪录。
回顾Thinking Machines近期的动态,剧情可谓跌宕起伏。就在联创翁荔官宣离职仅两天,OpenAI便确认其回归并带队攻坚“递归自我提升”项目。而仅仅在第三天,这家刚失去核心大将的公司,就甩出了新模型的“全量权重”。
官方介绍显示,Inkling-Small采用MoE架构,总参数达2760亿,单次推理激活120亿,相比初代模型体量缩减至四分之一。Pytorch大神Horace He评价道:“Inkling-Small无需过度优化,直接沿袭前代技术路线即可。”
尽管体量缩小,其实力却显著提升。在数学推理、智能体编码及多模态基准测试中,Inkling-Small的表现堪比甚至超越了Inkling和DeepSeek V4 Flash。在HLE、Terminal-Bench、IFBench等核心指标上,其单位算力的性能表现全面优于初代Inkling。多模态方面,图表理解、视觉推理、语音理解及长音频推理等任务,Inkling-Small的评测成绩也紧追原版,且成本大幅降低。
关于后训练细节,官方披露了关键两步:首先利用Inkling进行on-policy蒸馏,生成预览检查点;随后基于此检查点进行了为期两周的智能体编码强化学习。通过改进预训练数据配比和机器学习配方,仅用两周时间便完成了“学生反超老师”的逆袭。这标志着Thinking Machines成功打通了可重复的模型产出流水线。
12B激活参数是真正的分水岭。原版Inkling门槛极高,BF16版本最低要求2TB聚合显存(如8张B300或16张H200),即便NVFP4量化版也需600GB起步。而Inkling-Small大幅降低了这一门槛。LMSYS指出,276B总参数配12B激活是强化学习的“甜点位”,使得LoRA和全参数训练对中等规模团队触手可及。实测显示,在8张B200、TP8、NVFP4配置下,SGLang推理速度可达648 tok/s。
曾经的“OpenAI梦之队”如今仅剩Murati和Schulman,Zoph、Metz及翁荔相继回归。面对核心人才流失,Thinking Machines展现出了惊人的韧性:17个月沉默后发布首模,两周后联创离职,三天后新模型全量权重上线。人才在流失,模型在狂飙。这两条背道而驰的曲线,构成了AI行业最具戏剧性的一幕。或许通往ASI的道路注定如此:无论人员如何更迭,机器前行的车轮只会越转越快。
