DeepSeek也加入了这场参数竞赛。据《The Information》报道,DeepSeek目前正在训练一个约2万亿参数的新模型;公司创始人梁文锋近期在投资者会议上表示,下一步计划将模型规模推至8万亿。一年前,8万亿还是难以想象的数字,但现在,Kimi K3已达到2.8万亿参数;字节跳动正在预训练一个最高可能达到10万亿参数的新模型;阿里也公开宣布,下一代模型将向5万亿至10万亿参数推进。Anthropic虽不公开参数规模,但据《金融时报》此前援引业内估计,其最新旗舰Mythos 5大约就在8万亿参数左右。大模型行业兜了一圈,又开始比谁的参数更大了。

这事儿放在DeepSeek身上其实挺反常。毕竟DeepSeek去年给整个AI行业留下最深的印象,并不在参数上。它曾一度引发行业重新思考:前沿模型是否真的需要无限烧GPU。2024年底发布V3时,DeepSeek特意公布了训练账单:6710亿总参数,每个Token激活370亿参数,完整训练消耗278.8万H800 GPU小时,按每GPU小时2美元计算,官方给出的训练成本仅557.6万美元。这个数字以及背后的效率,成了DeepSeek后来最重要的标签之一。DeepSeek没有OpenAI或Anthropic那样充裕的先进GPU供应,过去也长期依赖梁文锋旗下的幻方量化自我输血,不接受外部融资。这种条件决定了它的路线——既然钱和算力有限,就尽可能从架构、训练和推理效率里抠性能。

但现在,条件变了。DeepSeek今年6月刚完成成立以来首轮外部融资,募资约74亿美元;目前第二轮约500亿元人民币(约75亿美元)的融资已进入敲定阶段,对应估值约5000亿元人民币。如果本次融资顺利完成,DeepSeek几个月内累计外部融资将接近150亿美元、约1000亿元人民币。与此同时,DeepSeek已聘请中信证券筹备科创板IPO,新增资本明确将用于算力基础设施、模型开发和人才投入;9月21日,原高瓴创投合伙人严文韬正式加入DeepSeek并出任CFO,结束了公司成立三年来CFO一直空缺的状态。以前的DeepSeek,是在有限的钱和算力里尽可能把模型做好;现在融资、上市都在往前推,手里的钱多了,算力也能跟着往上堆。有条件以后,DeepSeek也开始大胆卷参数了。

这轮竞赛的推手,是月之暗面。今年7月,Kimi K3做到了2.8万亿总参数、1040亿激活参数。K3至今仍是已正式发布、参数规模最大的开放权重模型。它不仅大,性能也强劲,官方评测显示其GPQA Diamond达到93.5,Terminal-Bench 2.1达到88.3,已与同期GPT-5、Claude 5等顶级模型打得难解难分。8月,字节跳动被曝正在训练一个更大的模型。据《晚点 LatePost》披露,字节内部认为与其在现有尺寸上追赶,不如一次把参数规模推到同行数倍。字节正在预训练的新模型规模最高可能达到10万亿参数;据《金融时报》援引知情人士称,这个数字甚至可能超过Anthropic最前沿的Mythos(业内估计约8万亿)。现在,5万亿以上的超大参数量又开始反复出现在前沿模型的讨论里。今天,阿里CEO吴泳铭公开宣布,下一代模型计划做到5万亿到10万亿参数;DeepSeek则在训练2T模型的同时,把后续目标放到了8T。

可以理解为,头部实验室重新把更大的总参数规模当成了冲击能力上限的一条重要路线。就连不公开参数的美国闭源模型也逃不开外界的审视,Anthropic的Mythos被外界估到8T;OpenAI从GPT-4时代起就不再公开模型规模,但社区流传着Astra达到了10T级MoE的说法。参数量从未失去吸引力,如同游戏面板上的战力值——人们知道它不能代表全部,但它永远是最直观、最有压迫感的那个数字。大模型行业其实有段时间不太爱谈参数。这两年,蒸馏、小模型、MoE、强化学习和推理时计算轮番上阵,比起炫耀自己有几千亿、几万亿参数,模型厂商更愿意讲性能、成本和效率。单纯把模型做大,很容易显得有钱没地方烧。时至今日,参数量被重新抬了上来,又一次成为了前沿模型的“排面”。

不过,今天的5T、8T、10T,和上一轮Scaling里的“参数越多,模型越大”,已经不是同一回事了。参数量能重新上桌,最直接的原因是超大模型的主流架构变了。过去的大模型,主流还是Dense架构,参数规模和计算量基本绑在一起。简单说,就是模型里有多少参数,每次计算基本都得一起上。参数越多,能力上限往往越高,但训练和推理成本也跟着往上涨。现在,越来越多超大模型用的是MoE,Mixture of Experts,混合专家架构。它更像一家养了很多专家的公司,模型可以拥有几百、几千个专家,但每次任务只挑其中一小部分上班。比如Kimi K3有2.8T总参数,但每个Token只激活104B,大约3.7%;DeepSeek V4-Pro有1.6T总参数,每个Token只激活49B,大约3%。所以今天说一个模型有5T、8T甚至10T参数,并不意味着它每生成一个Token都要跑完这10T参数。模型能装多少,和每次要算多少,变成了两个不同的数字。参数可以理解成模型用来承载知识、模式和能力的空间。总参数越大,模型理论上就有更大的空间去学习更多、更复杂的分布;MoE又允许它只在需要的时候调用其中一部分。

于是,模型可以继续增加总参数的容量,而不需要让每一次计算都同比变重。依然拿K3举例,它把总参数做到2.8T,规模约是K2.5的3倍,但896个专家里,每个Token只激活16个。月之暗面称,靠更稀疏的MoE和一系列架构优化,K3的整体Scaling效率相比K2提升了约2.5倍。而Agent时代,恰好又把这种“容量”重新推到了竞争中心。过去衡量一个Chatbot,能力往往是一项一项测的。数学看数学,代码看代码,问答看知识。模型在几个关键Benchmark上把峰值做高,就足以证明自己很强。但Agent把这些能力串进了同一条任务链。一个真实的长任务,可能从搜索资料开始,中间读网页、看图片、写代码、调用终端,再遇到报错、修改方案、调用别的工具,甚至把子任务分给其他Agent。OpenAI今年9月发布Agents API时,就把长时间运行、上下文管理、工具使用和子Agent协调直接列成了Agent的核心基础设施,并强调Agent需要可靠运行数小时甚至数天。一次问答里,某项能力偶尔失手可能只丢一道题;几十步、上百步的Agent任务里,任何一个薄弱环节都可能中断整条链路。任务越长,对能力覆盖面和稳定性的要求就越高。前沿竞争因此开始出现明显的“木桶效应”。METR现在甚至直接用“任务时间跨度”衡量Agent能力,因为任务越长,对模型持续完成一连串不同操作的要求越高。Chatbot时代更容易看到能力峰值,Agent时代开始越来越看能力覆盖面。

这时候,更大的参数容量就有了新的价值。任务越长,模型越不能偏科;Agent能做的事情越多,底座需要覆盖的能力就越广。MoE打开了容量继续扩张的空间,Agent则把容量的价值进一步放大。于是,模型厂商一边拼命提高效率,一边又重新把参数往5T、8T、10T推。省下来的算力并没有让Scaling消失,反而给Scaling腾出了新的空间。

最新快讯

2026年09月23日

14:39
据五大信披媒体精选报道,深圳华强北的MLCC商家近期出现爆单,高端产品更是“一货难求”,这充分暴露了高容量MLCC供需关系的紧张态势。与此同时,Meta智能体产品的走红也助推了AI应用板块的大幅飙升。 造成这一局面的核心原因在于,AI服务器对高容量MLCC的需求正在快速增长,叠加海外大厂主动缩减低毛利消费级产能、优先保障高端订单的策略,使得结构性缺口得以延续...
14:39
9月22日下午,现货黄金价格急剧下跌,盘中跌破4300美元/盎司关口,跌幅接近1%。机构分析指出,受人工智能产业崛起及国际油价反弹等因素影响,全球通胀回落速度放缓,主要央行大概率将继续加息,从而对贵金属价格形成压制。 能源市场方面,受中东供应中断、俄罗斯炼厂遭袭及出口限制等多重因素叠加影响,全球成品油供应持续收紧。9月21日,美国柴油零售价突破6.5美元/加...
14:39
据新华财经报道,第81届联合国大会一般性辩论于22日在纽约开幕。美国总统特朗普在会上发表讲话,一方面声称美国有能力迅速“摧毁”伊朗,另一方面又表示不排除双方在中期选举后达成结束冲突协议的可能,并预测油价将大幅下跌。此外,特朗普还重申了对人工智能采取“只鼓励、不限制”的宽松监管态度。 特朗普的上述言论发布后,国际油价跌幅有所收窄,WTI原油期货在当晚一度出现跳...
14:39
截至2026年9月22日收盘,自由现金流ETF南方(159232)换手率为6.09%,成交额达1.47亿元。当日,该基金跟踪的中证全指自由现金流指数(932365.CSI)微跌0.14%。受AI与半导体等高弹性成长板块领涨带动,市场资金明显聚焦于科技主线。 从策略基本面来看,该基金采取季频调样策略,持续纳入现金流改善的企业并剔除转弱标的。受益于上市公司分红意...
14:39
截至2026年9月22日收盘,新能源ETF南方(516160)换手率为4.97%,成交额达1.79亿元。其跟踪的中证新能源指数(399808.SZ)微跌0.14%。 当日市场资金主要流向AI算力、半导体等科技主线,导致新能源板块整体呈现窄幅震荡、结构分化的格局。具体来看,锂电方向表现相对占优,储能板块的高景气度提供了有力支撑;而光伏方向则面临一定压力。 从产...
14:39
近期高盛的一份研究报告描绘了中国家庭财富正在经历的一场深刻结构性变革。报告测算,中国家庭总资产约为730万亿元,在经历了连续六个季度的下滑后,总量已止跌企稳。然而,总量的筑底并不意味着扩张周期的重启,真正的变革在于资产内部结构的调整:长期以来作为家庭财富压舱石的房地产权重持续下降,金融资产正逐渐占据舞台中央。 数据对比显示,2021年中,中国居民房产占比为6...
14:09
截至2026年9月22日收盘,红利低波50ETF南方(515450)成交额为1.41亿元,换手率为0.70%,跟踪的标普中国A股大盘红利低波50指数微涨0.04%,走势平稳。 当日市场风格显著偏向科技成长,AI与半导体等高弹性板块领涨,导致红利防御板块的资金关注度出现阶段性回落,指数在窄幅波动中收出接近平盘的小阳线。不过,资金面出现值得关注的变化:红利类ET...
14:09
截至2026年9月22日收盘,计算机ETF南方(159586)交投活跃,换手率达5.58%,成交额为0.15亿元。该基金跟踪的中证全指计算机指数(H30182.CSI)单日上涨1.66%,延续了近期板块的强势走势。 板块走强主要受多重利好催化。首先是当日开幕的2026云栖大会,大会以“智以致用”为主题,核心聚焦Agentic AI,集中展示了千问办公、Qod...
14:09
据鼓狮财经9月23日报道,能源数据机构Kpler警告称,若美国实施柴油出口禁令,全球柴油供应将陷入紧缺,并立刻推高欧洲、拉美及美国西海岸的柴油价格。 Kpler馏分油高级研究分析师戴维·托尼安在9月22日的报告中指出,美国庞大的出口量目前尚无替代来源。他表示,实施禁令的可能性“不大”,因为这会导致美国炼油行业蒙受数百万美元的收入损失,并造成效率损耗。Kple...
14:09
据鼓狮财经9月23日报道,美联储上周实施加息后,金融市场表面看似平静,但安联首席经济顾问、前PIMCO投资官穆罕默德·埃尔-埃利安却发出预警,指出市场动态正迫使全球主要央行不得不跟进加息。 事实上,美联储上周加息后,市场定价迅速转向鹰派,目前甚至计入了明年年中前再加息三次的可能性。尽管英国央行是9月份唯一未加息的主要央行,但其利率预期同样呈现出紧缩趋势。 在...
13:45
大模型训练的核心在于算力,而Agent训练的核心在于环境构建。如何构建环境?DeepSeek署名的最新论文公开了技术细节。这套名为DSec(DeepSeek Elastic Compute)的系统,致力于为Agent训练批量制造沙盒。其性能指标惊人:每秒可生成5000个以上沙盒,日产量达300万个,峰值同时运行38万个。支撑这一规模的集群极其庞大,包含160...
13:45
大模型江湖风起云涌,格局正在重塑。9月21日,小米MiMo团队正式发布并全面开源新一代MiMo V2.6系列,一口气端出三款模型——Pro、Flash和Ultraspeed,彻底改写了全球开源模型的版图。 MiMo V2.6 Pro在Artificial Analysis智能指数中斩获46分,超越了Kimi K3和Qwen3.8 Max,一举夺得全球开源模型...