9月22日的云栖大会上,阿里重新将大模型的“大参数”路线推向台前。阿里CEO吴泳铭现场披露,公司正筹备训练参数规模介于5万亿至10万亿的新一代人工智能模型。ATH事业群Token Foundry负责人刘大一恒也同步指出,Scaling(缩放定律)是迈向超级人工智能的关键路径,Qwen 4.5和Qwen 5的参数规模将锁定在5万亿至10万亿之间。
同日,行业流传消息称,据The Information报道,DeepSeek正在训练一个约2万亿参数的新模型,其创始人梁文锋更表示,下一步计划将模型推至8万亿参数。而两个月前,英国《金融时报》援引知情人士消息,字节跳动正在训练一个最高可达10万亿参数的大模型。参数可通俗理解为模型的“脑容量”,即推理时调用的经验权重总量。以10万亿为基准,对比2025年引爆行业的DeepSeek-R1(6710亿参数),差距显而易见。从阿里到DeepSeek,再到字节跳动,国产大模型公司集体重拾“越大越好”的信仰。
然而,规模竞赛的另一面是高昂的投入与边际回报递减。参数越大,投入资源与成本越高,而智能增长并非同倍。模型扩容必须伴随数据量的增加与质量的提升。当所有人都在堆参数,真正的分水岭便转向了算力效率——即单位算力能换回多少智能。
目前,国产已发布模型的参数顶点由月之暗面的Kimi K3(2.8万亿)占据,其次是阿里的Qwen 3.8-Max(2.4万亿)和DeepSeek V4-Pro(1.6万亿)。对比海外,闭源阵营的参数规模更高,业内估计Anthropic的Mythos 5约8万亿,Fable 5约5万亿。这意味着,国产已发布模型与海外头部水平尚差一到两个身位,若以10万亿为靶心,现役旗舰普遍还需放大五倍。
为何要豪赌10万亿?Scaling Law提供了理论支撑,即在模型、数据、算力同步放大时,能力随之提升。但Scaling Law并非无限有效,它需要高质量数据的支撑,且边际回报在万亿级别明显递减。此外,MoE架构(混合专家架构)的出现,使得名义参数与实际激活参数解耦。例如Kimi K3名义参数2.8万亿,实际激活仅约1040亿。然而,大参数模型在推理速度和成本上仍面临挑战,用户等待时间拉长,成本转嫁至价格。归根结底,参数规模决定能力上限,而上限决定排位。
10万亿的账单极其惊人。海外巨头资本开支指引飙升至7200亿至7450亿美元。国内同样激进:阿里2026年Q2单季资本开支677亿元,自由现金流由正转负;字节跳动2026年资本开支上限最高可达700亿美元,2027年可能再冲1000亿美元。钱花在哪?首先是基础设施。训练10万亿参数模型需数万张高端GPU连续运转数月,电费与运维成本天文数字。其次是推理成本,部署到千万用户后,电费开销往往比训练更持久。最后是数据,高质量数据比裸算力更稀缺。
现金流已给出预警。阿里过去五个季度中有四个季度自由现金流为负,虽账上现金尚可托底,但面对万亿美元级的算力投入,持续融资不可避免。字节跳动虽上半年净利润仍保持个位数下降,但作为国内AI投入最大的公司,其近期完成了300亿美元的银团贷款,以填补千亿级的资金缺口。
云栖大会前不到一个月,阿里刚推出Qwen 3.8-Flash-Next(1250亿总参数),主打低成本与高速度。一个月后,战略又转向10万亿大参数。Flash模型优化“高频、实时、成本敏感”场景,而大参数模型则覆盖最难、最杂的场景。两者能共存,得益于MoE架构——把模型拆成众多“专家”,每次推理只唤醒一部分。这把总参数与实际计算量解耦,让厂商能同时押注“小而快”与“大而强”两条路线。
Flash与大参数最终都在回答同一个问题:如何让每一分钱产出更多智能。不过,10万亿目前仍是期许,现役国产旗舰顶点仍在2.8万亿。等模型真正落地时,牌桌可能已换了一轮,10万亿不再是终点,而是新的起跑线。
