7月29日,一则关于大模型公司北京月之暗面科技有限公司(下称“月之暗面”)的融资消息在业内迅速传开——月之暗面已完成新一轮超35亿美元融资,投后估值升至350亿美元,Pre-IPO轮也已启动,投前估值达到500亿美元。

这意味着,相较2025年底C轮融资时的估值43亿美元,月之暗面在半年多的时间里估值增长超过10倍,这一速度在全球AI创业公司中也不多见。记者就上述融资信息向月之暗面方面发送了求证邮件,截至发稿未获回复。

推动这轮估值跃升的核心催化剂是月之暗面7月16日发布的旗舰模型Kimi K3,该模型的参数规模达到约2.8万亿(精确值为2.78万亿),是目前全球参数量最 大的开源模型。

7月19日,月之暗面发布公告,宣布暂停C端(个人用户)新用户订阅,将全部算力投入保障已有用户的服务。7月27日晚间,月之暗面进一步公开了Kimi K3的模型权重和一份47页的技术报告,对模型架构和训练方法做了全面披露。

Kimi K3的发布只是“中国大模型集体转向大参数”的一个切面:阿里7月19日发布的旗舰模型Qwen3.8 Max,参数量约2.4万亿;百度1月上线的文心5.0,参数量同样达到2.4万亿;DeepSeek 4月发布的V4-Pro,参数量为1.6万亿。另据记者了解,MiniMax(00100.HK)下一代模型的参数量也将超过2万亿。

2025年,DeepSeek R1的发布曾让行业一度转向更小参数、更低成本的路线,“Scaling Law(规模法则,即模型性能随参数规模和算力增加而可预测地提升的经验规律)是否已经失效”成为贯穿全年的热议话题。

但仅一年之后,“参数竞赛”再次启动,中国头部大模型厂商开始集体冲击2万亿以上参数。

01

参数跃升

Kimi K3的参数跃升幅度在行业内并不常见。

和上一代相比,Kim K3的总参数从1.04万亿增至2.78万亿,增长了167%;激活参数从326亿增至1042亿,增长220%;上下文窗口从128K(K代表千)扩展至100万词元(Token,AI模型处理文本的基本计量单位),扩大了近8倍。

月之暗面团队在7月27日发布的Kimi K3技术报告中指出,过去一年,开源模型在推理阶段的强化学习上进展很快,但预训练基座的参数规模停滞在1万亿左右。

大模型的训练分为两个阶段——预训练阶段,模型在海量数据上学习语言、知识和推理模式,形成底层能力,参数规模和数据质量决定了这层能力的上限;后训练阶段,研发团队通过强化学习(用奖励信号引导模型改进推理策略)、思维链(让模型把推理过程拆解成多个步骤逐步推导)等方法,在底层能力之上做精细打磨。

过去一年,行业把主要精力放在了后训练上——DeepSeek R1证明了强化学习可以在较小参数的模型上取得很好的效果,国内外厂商纷纷跟进。但Kimi K3技术报告提出的问题是,后训练的优化空间受制于预训练基座的容量,基座的能力边界决定了后训练的上限。

早在今年3月的中关村论坛上,月之暗面创始人杨植麟就公开阐述过类似的判断。他认为,做大模型本质上是把更多的能源转化成智能,规模化绝非暴力增加算力投入,而是关于转化效率的竞赛。他在演讲中拆解了三个提升效率的维度:提升词元效率,从有限的存量数据中挖掘更多智能;优化长上下文架构,以低损耗完成长时间复杂任务;引入Agent集群(多个AI智能体并行协作)模式,通过协作扩展模型执行复杂任务的边界。

华南一家大型券商的半导体分析师告诉经济观察报,参数竞赛重启还有外部推力——2026年6月下旬起,以Claude为代表的海外头部模型开始限制国内模型对其API(应用程序编程接口)的访问,这意味着蒸馏(用大模型的输出来训练小模型)作为过去两年国内模型缩短差距的重要路径,正在变得越来越窄。

在他看来,大模型的发展可以划分为三个阶段:第 一阶段从2023年初到2024年第三季度,以预训练参数竞赛为主;第二阶段从2024年下半年开始,行业转向后训练的强化学习和推理优化;2026年正在进入第三阶段,模型能力从单体智能升级为系统编排,AI开始向智能体(Agent)的形态演进。

他认为,第三阶段并没有取代前两个阶段,参数量的持续增长仍然是关键变量。中国大模型的追赶将主要依赖三条路径:训练范式与海外对齐,构建自有的数据反哺循环,持续扩大预训练基座的参数规模。

深圳一家互联网游戏企业的产品经理告诉记者,对使用者来说,参数规模的直接体感是模型“能处理复杂的任务”。

据其介绍,他所在的团队从今年年初开始把AI编程工具接入日常开发流程。在一个完整的编程任务中,模型需要读取整个项目的上下文,连续调用编译、测试、调试等工具,执行多轮自我修正,单次会话消耗的词元量是传统对话场景的很多倍。这类长程任务对模型底层能力的要求,和简单的一问一答完全不在一个量级上。

由此,“模型能连续工作多久”正在成为衡量模型能力的新指标。

02

规模法则

2.8万亿参数规模巨大,但Kimi K3的每次推理并不需要动用全部参数。

根据技术报告,Kimi K3采用了MoE架构(Mixture of Experts,混合专家系统)。这种架构的核心思路是把模型参数分成多个功能模块,称为“专家”。在处理每一个输入时,路由系统只激活与当前任务最相关的一小部分专家,其余专家不参与计算。

Kimi K3拥有896个专家模块,每次推理只激活其中16个,稀疏度达到56倍,实际参与计算的激活参数约1040亿。换言之,一个2.8万亿参数的模型,单次推理的算力消耗大致相当于一个千亿参数级别的稠密模型(即每次运算都调用全部参数的传统模型)。

MoE架构解决的是“参数量大但推理成本可控”的问题。在此基础上,月之暗面还需要解决两个难题:长上下文场景下的计算开销,以及信息在深层网络中的逐层衰减。

根据Kimi K3技术报告,月之暗面分别为此开发了两项底层架构。

第 一项是KDA(Kimi Delta Attention,混合线性注意力机制)。传统Transformer架构(当前主流大模型普遍采用的底层技术框架)在处理长上下文时,需要维护一个缓存,这个缓存的体积随输入长度线性增长。100万词元的上下文意味着庞大的显存占用和计算开销,KDA的做法是,把这个不断膨胀的缓存压缩成固定大小的矩阵状态,使百万级上下文的计算开销大幅下降。

第二项是注意力残差(Attention Residuals)。在传统的深层网络中,信息从底层逐层向上传递,每经过一层都会有部分信息衰减或丢失。注意力残差的做法是,让每一层都能选择性地回看前序所有层的输出,跳过逐层传递的限制。根据KimiK3技术报告,这项改进的额外成本约为2%,但显著缓解了信息在深层网络中的衰减问题。

MoE、KDA和注意力残差三项技术叠加之后,KimiK3相比K2的整体扩展效率提升了约2.5倍,即同样的算力投入下Kimi K3能达到更好的模型表现。

效率的提升也直接反映在了使用成本上。

根据公开的API定价,KimiK3的输入价格为每百万词元人民币20元,输出价格为100元。折合美元计算,Kimi K3的输出单价约为14美元/百万词元,低于GPT-5.6 Sol的30美元和Claude Fable 5的50美元。Kimi K3在第三方评测中的单任务平均成本约0.94美元,与GPT-5.6 Sol基本相当,约为Claude Opus 4.8的一半。

在“用更少的算力产出更多的智能”这个方向上,端侧模型厂商走得似乎更快一些。

面壁智能CEO李大海在接受经济观察报采访时提到了一组对照数据:面壁的端侧模型用10亿到20亿的参数量,已经达到了两年前GPT-4o(OpenAI于2024年发布的旗舰多模态模型,参数量在数百B级别)的水平,相当于实现了近百倍的压缩。面壁联合创始人、总裁雷升涛将这个方向称为“知识密度定律”,即大约每3.5个月端侧模型的能力密度翻一倍。

云端模型在扩大参数规模,端侧模型在压缩参数规模,底层逻辑一致,都在提升每单位算力的智能产出。

在李大海看来,云端编程、长程Agent等场景的爆发已经开始,端侧虽然还没有迎来类似的商业爆发,但模型能力的提升一直在发生。两年前,达到GPT-4o水平需要数百亿参数量级的模型,如今面壁用10亿到20亿参数量级的端侧模型就能做到。云端在做大,端侧在做小,但驱动两者进步的底层规律是同一个——投入更多的算力和更好的架构,就能换来更强的模型能力。“没有爆发不代表没有Scaling Law”,他说。

野村证券7月27日发布的研报指出,3万亿参数被行业视为中国大模型的下一个里程碑,但模型竞争力将越来越依赖架构效率、后训练优化和长程任务表现。

03

产业链传导

参数竞赛重启的同时,头部模型厂商的商业化也在加速。

公开信息显示,月之暗面的ARR(年度经常性收入)在6月中旬突破3亿美元,API收入占比超过七成。

月之暗面企业业务负责人黄震昕在6月的一次公开活动中提到,自今年1月Kimi K2.5发布以来,Kimi海外付费用户数增长了4倍,产品进入200多个国家和地区。互联网、金融、制造、教育、医疗等行业已成为Kimi重要的企业客户来源。

Kimi K3发布带来的需求激增也让算力紧缺浮出水面。公开信息显示,Kimi K3的部署需要一台8卡B300服务器,训练需要万卡级集群。多位接受采访的业内人士提到,智算中心的大部分算力已被头部大厂锁定,独立模型公司获取算力的能力相对滞后,即便遇到Kimi K3这样的需求爆发也难以及时补充。

李大海从端侧的角度提供了观察。他用八个字概括端侧和云端的分工关系——端侧主内,云端主外。端侧掌握用户的私有数据和即时需求,数据不出设备,负责隐私敏感的本地推理;云端接入外部世界的信息和服务,处理对模型能力要求更高的开放性任务。他认为,随着云端模型参数规模持续做大,端侧和云端协同的格局会长期共存。

上述券商半导体分析师告诉记者,国内大模型竞争已经形成两个梯队:阿里和DeepSeek在模型能力和业务覆盖上位居前列,腾讯、字节、智谱、月之暗面紧随其后。竞争焦点也正在从底层模型能力转向AgentOS(智能体操作系统,即模型之上负责任务编排、工具调用和长程执行的系统层)的综合能力。

在国内竞争格局高速变动的同时,海外市场正在成为中国头部大模型厂商争夺的另一个增量来源。

野村在前述研报中提到,DeepSeek截至6月的ARR约为5.2亿美元,其中海外市场贡献了约47%到48%。不过,采用者以个人开发者和中小团队为主,大型企业的渗透率仍然有限。而且,在实际的开发流程中,不少海外开发者已经形成了分层调用的习惯,使用Claude Code、Codex等海外模型做架构设计和复杂推理,再切换到DeepSeek等国产模型做持续的代码生成和执行。也就是说,国产模型率先拿下的,是词元消耗最密集的执行环节。

华东一家大型公募机构的研究员告诉记者,词元的整体成本在持续下降,预计年降幅在三成到五成。值得注意的是,Agent链路中等复杂度的任务,单次调用消耗的词元量是传统对话场景的二十多倍,超复杂任务的单次消耗达到百万词元级别。成本下降正在激发更多复杂任务的需求,整体利润由增量市场驱动。“做大参数”对算力产业链的影响也已经开始传导到芯片层面。

聆思科技是一家由科大讯飞体系孵化的端侧AI推理芯片公司,已累计出货超过1.5亿颗芯片,7月刚完成近5亿元B轮融资,首颗端侧大模型推理芯片Nebula系列计划于年底流片。

聆思科技市场副总裁韩超阳告诉经济观察报,端侧推理市场的规模未来将比云端大出不止一个数量级。他同时强调,算力利用率比绝 对算力峰值更关键,一颗标称200T(每秒200万亿次运算)算力但利用率只有百分之十几的芯片,和一颗100T算力利用率达到七成的芯片,实际产出完全不同。

但当前端侧芯片在推理性能和功耗上仍无法满足需求,在他看来整个市场仍处于萌芽阶段。

聆思科技副总裁徐燕松提到,芯片公司和算法公司未来可能不再独立存在,芯片设计必须比算法迭代更前置地投入研发,“芯片的研发周期通常在两到三年,必须提前判断两三年后模型架构的走向,否则芯片推出时就已经落伍了”。

这也意味着,参数竞赛重启的影响不会停留在模型层面,它正在沿着产业链上游的芯片设计和算力基础设施传导。

在上述公募机构研究员看来,大模型向行业场景的渗透可以分为三个阶段:第 一阶段是AI编程代理,对应全球约3000万软件开发者和部分外包采购市场,核心规模约7000亿美元;第二阶段是流程性AI代理,面向客服、财务、行政等约3.7亿白领办公人群,薪酬池规模超过1万亿美元;第三阶段及之后将延伸至金融、医疗、法律等专业领域,市场体量达到3万亿至4万亿美元以上。

他认为,目前仅处于第 一个阶段的初期。按照上述框架来看,当前围绕AI编程场景的词元消耗量爆发,距离真正的规模化渗透还很远。

最新快讯

2026年08月03日

11:24
刚刚完成 GPT-5.6 系列的大幅降价,OpenAI 又传出了新模型的消息。大家都在讨论,降价之后必有新模型发布,还是网友在总结?据外媒 The Information 报道,OpenAI 正准备推出一个新的模型系列,目前暂定名为“阿斯特拉”。该系列在执行长时间任务方面的能力将有所提升。 知情人士称,本周 OpenAI CEO 山姆·奥特曼在华盛顿向政策制...
11:24
AI演员近期热度飙升。微博话题“两个AI演员比内娱待爆艺人都火”登顶热搜,霸榜超8小时,引发全网热议。与此同时,AI漫剧男女主官宣二搭新剧,定档视频半天斩获29万点赞,热度不输真人顶流。更关键的是,整个真人影视行业开始拥抱AI。不仅有老牌明星先后将脸“卖”给AI,传统卫视也向AI演员开放。安徽卫视就宣布,7月22日起,晚间黄金档开播全AI制作剧集。这意味着,...
11:23
美国总统特朗普与财政部长贝森特相继证实,美国上周参与了与日本协调的外汇市场干预行动,通过买入日元、卖出美元的方式,旨在遏制日元的无序波动。日本财务省随后也确认了这一消息。这是自2011年东日本大地震以来,美日时隔15年再次联手干预汇市;而采取买入日元的联合行动,更是自1998年亚洲金融危机以来时隔28年的罕见之举。 周一,日元兑美元汇率一度突破156关口,日...
11:22
截至二季度末,沪深港通北向资金持仓市值首次突破3万亿元大关,外资加仓A股的意愿愈发强烈。QFII的调仓动作则呈现出显著的“头部集中”特征,二季度末重仓38只个股,总持仓市值达170.29亿元,其中新进投资了19只股票。在行业布局上,半导体、自动化、算力硬件及创新医疗是外资调研的焦点领域。 数据显示,AI相关贸易额贡献了上半年进出口增长的一半以上,这一强劲表现...
11:22
8月3日清晨,亚太市场开盘之际,美股三大指数期货全线走高,其中纳斯达克100指数期货上涨0.78%,标普500指数期货上涨0.44%。受此带动,贵金属市场同步上扬,现货黄金收涨0.64%,报价4067.12美元/盎司;现货白银涨幅达到1.5%。 消息面上,美伊紧张局势出现戏剧性逆转,美国总统特朗普宣布将于8月3日与伊朗举行谈判。受此影响,国际油价大幅跳水,布...
11:22
截至8月3日,中国人民银行已连续四个交易日通过隔夜逆回购操作累计投放21000亿元。此次操作延续了“给量不给价”的特征,旨在通过精准投放呵护资金面平稳跨月。 展望8月,资金面将面临政府债供给放量(预计净融资约1.33万亿元)及中长期资金到期规模升至1.9万亿元等扰动,预计DR001将在政策利率上下5个基点区间运行。 7月30日政治局会议提出“综合运用并适时调...
11:22
据鼓狮财经8月3日消息,香港证监会与中国证监会今日联合宣布,将推出一系列新举措以进一步深化两地市场的务实合作与协同发展。这些措施主要包括:在期货领域深化合作,支持香港推出更多人民币计价结算的期货品种;在ETF产品方面,支持两地机构开发基于两地市场、布局中国现代化产业体系的ETF产品,并实施常规股票ETF的快速注册机制;此外,还将支持具备一定实力、运作规范及管...
11:22
鼓狮财经8月3日讯,美股上市公司正陆续发布第二季度财报,市场整体表现向好。据金融数据服务商FactSet统计,综合已公布财报公司数据及分析师预测,标普500指数成分股本季度盈利有望实现47.4%的同比增长,创下过去五年中盈利增长的最强纪录。 在已披露财报的158家公司中,营收表现呈现两极分化:123家公司的业绩超出市场预期,34家不及预期,1家持平。不过,从...
10:52
**见证创新力量,共筑AI生态——第二届“数龙杯”全球AI创新大赛圆满落幕** 7月31日,第二届“数龙杯”全球AI创新大赛颁奖典礼在上海圆满举行。本次大赛由世纪华通发起,联合中国音数协游戏工委、上海市浦东新区区委宣传部、上海市文化创意产业促进会等多方权威机构指导,携手ChinaJoy、财联社、潮新闻等平台媒体共同打造。盛典汇聚了百余位政府主管部门、行业协会...
10:52
人工智能早已不再局限于辅助工具,甚至摇身一变成了写作的“枪手”。这种趋势不仅蔓延至网络文学领域,更在传统出版圈引发了轩然大波。随着生成式AI技术的迭代,其生成的内容已进化得难以辨认,这无疑给甄别工作带来了巨大挑战。 就读者而言,他们并不希望所有创作都由AI代劳。正如有人所言:“AI的加入或许能让书的内容更完美,但同时也模糊了作者身上关于这个世界的信号。”近日...
10:52
8月3日早盘,韩国存储芯片双雄遭遇“闪崩”。截至8时30分,SK海力士与三星电子股价直线跳水,跌幅分别达8.93%和8.19%,带动韩国KOSPI指数大幅下挫5.4%。 这轮调整始于上周五的美国市场。当时,美股存储板块全线回调,铠侠、闪迪及美光等个股跌幅显著,SK海力士ADR亦跌逾3%。周一亚太市场接力下挫,日经225指数跌1.98%,软银与铠侠控股跌幅均超...
10:48
今年以来,可转债市场迎来了密集的发行窗口。Wind数据显示,截至8月2日,年内已有48只可转债公开发行,累计募资规模达573.32亿元,同比显著增长。其中,创业板及科创板公司的发行数量明显增多,科创企业已成为发行主力。 受此带动,今年以来上市的36只新券表现十分亮眼,无一破发,平均涨幅超过50%,更有24只新券首日涨幅触及57.3%的上限。业内预计,下半年发...