8月13日凌晨,DeepSeek V4 Pro正式发布,为开源模型生态注入了一剂强心针。从Kimi K3到MiniMax H3,再到DeepSeek V4 Flash、DeepSeek V4 Pro,在中国开源模型的强势攻势下,美国AI公司终于坐不住了。英伟达CEO黄仁勋亲自下场,发布了个人首条推文,呼吁全行业共同推动美国开源生态的发展。目前,除了Anthropic之外,美国AI圈的主要玩家几乎全员到齐,OpenAI的Sam Altman、谷歌的Sundar Pichai等闭源模型掌门人也罕见地发文表示支持。为何这些平日里竞争激烈的巨头这次罕见地站在了同一战线?Anthropic坚持不加入的原因又是什么?要回答这个问题,我们需要先搞清楚一个更基础的问题:今天AI行业所说的“开源模型”到底是什么?以及模型开源后,对厂商和行业意味着什么?

**01、开源模型,到底开了什么?**

很多人误以为开源就是把代码发出来,其实并非如此。要理解模型到底开放了什么,需要梳理大模型从训练到发布的完整流程,大致可分为七个环节。

第一是训练数据。研发团队决定使用网页、书籍、代码等哪些数据,以及如何清洗和筛选,这决定了模型的“底子”。第二是模型架构和参数规模。涉及模型规划、架构选择、参数规模及训练配置,这决定了模型的能力上限和训练效率。需要区分的是,参数规模并非指数据量,而是指模型需要调整的参数数量,规模越大,能捕捉的细节和规律越复杂。第三是训练基础设施,包括GPU集群、高速网络、存储系统及训练框架,这是如今最火的AI Infra领域。像DeepSeek的DeepGEMM、Kimi K3的FlashKDA、MoonEP都属于这一层的创新。第四是训练流程和Checkpoint,包括预训练、微调和强化学习,以及训练过程中的“存档”机制。第五是“模型权重”。经过漫长训练,模型内部数十亿乃至数万亿个参数被调整到合适数值,这些参数形成的集合记录了模型的知识,是核心成果。第六是模型部署,将权重部署到服务器,通过API或本地部署提供服务。最后是“技术报告”,介绍架构思路、数据构成、踩过的坑及评测结果,更多是方法论而非操作步骤。

搞清楚流程后,“开源”具体指什么?主要分为闭源、开放权重和完全开源三类。闭源即以上环节全部不开放,客户只能通过API使用。完全开源是指数据、代码、存档、报告全公开,如Ai2的OLMo系列。但现在主流的其实是中间地带的“开放权重”,即只公开模型训练的最后结果(权重)和推理代码,允许下载、微调和改进。

不同开放权重模型的开放程度存在差异。以Meta的Llama系列为例,它是最基础的开放权重代表,公开了权重和推理代码,但训练数据、调整策略和内部工具链始终未公开。DeepSeek和Kimi则更进一步。DeepSeek V3和R1不仅详细公开了技术报告,还开源了DeepEP、FlashMLA等工程工具链。Kimi K3同样如此,除了详细的技术报告,还同步开放了三大底层基础设施:解决MoE专家间通信效率的MoonEP、加快注意力计算的FlashKDA,以及给智能体训练搭建环境的AgentEnv。这些工具分别对应了训练大模型的通信、计算和训练环境三个卡点,让行业得以了解其高效训练背后的工程细节。

**02、开放权重模型,怎么赚钱?**

过去一年,中国大部分模型厂商的许可证正变得越来越开放。DeepSeek从最初的自定义协议切换到MIT License,阿里Qwen从自定义协议切换为Apache 2.0,智谱GLM也采用了宽松的MIT License。当然,并非所有公司都完全放开。Kimi K3采用了全新的Kimi K3 License,虽然对绝大多数开发者和中小企业实际使用体验差别不大(免费下载、商用、修改),但设置了两个门槛:月活超1亿或月收入超2000万美元需展示标识;做模型即服务且年收超2000万美元需另行签署商业协议。限制最多的则是Meta的Llama,采用自定的Llama Community License,限制繁多,如月活超7亿需额外授权、曾限制欧盟使用、禁止利用输出训练其他模型等。不过Meta近期有所回转,其新模型Muse Glimmer采用Apache 2.0。

许可证划定了红线,但开源模型如何盈利?开放权重并不等于放弃商业化。企业下载模型只是第一步,真正部署到生产环境还需要算力、运维、持续更新和定制开发。因此,开放模型可以带动一系列服务收入。

第一,通过开放模型带动云计算和基础设施消费。企业下载权重后仍需GPU、云存储、网络等资源,云厂商可借此收费。第二,为企业提供部署和定制服务。企业往往希望私有化部署,模型公司可出售私有化部署、行业微调、技术支持和维护服务。第三,提供收费的后训练和模型开发平台。企业希望在开放模型基础上加入自身数据和规则,模型公司可提供微调、强化学习、评测等工具并收费。

此外,开源模型厂商的另一部分收入来自提供模型服务的MaaS厂商和云厂商。Kimi的年化经常性收入已达约3亿美元。一个反常识的观点是,云厂商和MaaS厂其实欢迎模型厂商收费。因为这意味着官方认证,能保证token质量和性能,类似“Intel Inside”的背书机制。

**03、开放权重,意味着什么?**

过去几年,最强模型(Claude、ChatGPT、Gemini)多为闭源,能力掌握在少数公司手中。开放权重则让前沿模型像软件一样可被下载、部署、微调。对企业而言,这是天大的好事。

首先是成本。面对高昂的API调用费用,开源模型成了最优解。中国开源模型能力已追平闭源最强模型,且便宜、可定制。企业通常对高难任务使用最强闭源模型,日常任务使用开源模型。

其次是所有权问题。在能力相当的情况下,开放模型让企业拥有模型的所有权,能自主控制数据和安全。对开发者而言,开放权重降低了创新门槛,借助权重和技术报告,开发者可以修改、训练模型,适配不同场景。vLLM和SGLang等推理引擎也提供了Day-0支持,无需解决复杂部署问题。

此外,开放权重加速了模型迭代。Kimi K3的技术报告中,关于MoE负载均衡的优化方法,就是基于DeepSeek V3方案的演进。闭源模型的技术突破可能只留在服务器里,而开放的技术经验能让行业站在巨人肩膀上加速发展。

这也是为何黄仁勋会牵头建立“开放安全AI联盟”。面对中国开源模型的崛起,美国政府可能考虑限制,但联盟认为开源对网络安全、创新和AI主权至关重要,监管应针对风险而非技术路线本身。不过,联盟背后也有商业考量:云厂商(微软、亚马逊、谷歌)无论客户部署何种模型,只要在云上都能获益;基础设施企业(英伟达、AMD、Baseten)则从每次部署、微调和推理中获利;企业软件公司(Palantir、Databricks)能服务更多客户。

Anthropic坚持不开源,主要出于两方面担忧:一是前沿开放模型带来的安全风险,一旦权重公开,恶意使用门槛降低;二是蒸馏问题,认为中国开源模型通过蒸馏美国闭源模型降低了追赶算力门槛。但更多人认为,Anthropic更多是出于商业利益,担心开放权重冲击其API依赖和竞争壁垒。近期,在开源声势下,Anthropic的立场正面临巨大压力和质疑。

不过,并非所有人都支持Anthropic的观点。Kimi K3开源后,有声音认为将最前沿模型公开本身是风险。近期OpenAI和Anthropic的模型接连曝出越狱攻击,即便闭源模型也非绝对安全。未来,若更多接近Fable 5水平的开放权重模型被部署到成千上万企业或个人设备上,模型治理和安全控制将面临更大挑战。

目前,关于开源模型的讨论仍在激烈进行。但无论如何,开放权重已成为推动AI发展的重要力量,降低了门槛,加快了创新。但同时,它也带来了新的问题和风险。接下来,我们将持续追踪中美开源模型的发展及其对产业的影响。

最新快讯

2026年08月14日

15:55
鼓狮财经8月14日电,据韩国央行周五公布的最新数据,韩国6月份货币供应量延续了此前的上升态势。此次增长主要受短期存款与货币市场基金规模攀升的推动。 据韩国央行初步统计,衡量货币供应量的核心指标M2在6月平均规模达到了4213万亿韩元(约合2.97万亿美元),较上月增长了0.7%,增加了29.4万亿韩元。值得注意的是,该指标自去年11月以来便一直保持稳步上升。...
15:55
鼓狮财经8月14日报道,受霍尔木兹海峡基本处于关闭状态的影响,亚洲炼油商正为本年度晚些时的交付寻找替代供应。本周,至少有四家亚洲炼油商完成了对美国原油的采购。 目前,美伊双方均宣称控制该海峡,导致本周后半段的船舶通行量已降至本月平均水平之下。鉴于短期内航运恢复的可能性不大,燃料供应趋紧的局面将推高炼油利润率,促使炼油商从海峡以外的市场锁定未来数月所需的原油库...
15:55
韩国企划财政部于8月14日表示,自7月6日韩元全天候外汇交易机制正式启用以来,外汇市场日均即期交易规模显著扩大,增幅已超过10%。该机制旨在进一步放宽境外投资者准入,从而提升韩国金融市场的开放程度。对比数据表明,上半年韩国外汇日均即期交易额为173.9亿美元,而在该机制落地后,日均规模已升至191.4亿美元,增幅达到10.1%。
15:55
据鼓狮财经8月14日消息,美国总统特朗普于7月7日曾释放可能向土耳其出售F-35隐形战机的信号,然而截至目前,相关计划仍未取得实质性进展。据8月13日美国方面透露,土耳其装备俄制S-400防空系统是阻碍军售的关键因素。美国国会部分议员指出,土耳其必须放弃该系统才能获得F-35战机。此外,以色列方面也公开对这项军售计划表示反对。
15:38
英伟达于今日凌晨宣布,其Spectrum-X以太网硅光交换机已正式进入全面量产阶段。该产品在性能上实现了显著突破,激光器数量减少四倍,功耗降低五倍,同时平均故障间隔时间提升了十倍。 这一交换机系统由富士康负责系统组装,Lumentum提供激光芯片,矽品负责晶圆级及芯片级封装测试,天孚通信负责激光器模块子组件组装,并依托台积电的先进硅光子工艺制造。该产品基于英...
15:38
8月14日,A股三大指数集体收涨,沪指微涨0.01%报3927.18点,深证成指涨0.45%,创业板指涨幅显著达1.12%。相比之下,北证50指数表现疲软,跌幅为0.94%。当日市场成交额为21566亿元,较前一交易日缩量4114亿元,全市场共有2400只个股录得上涨。 **盘面表现:板块分化明显** **热点板块方面:** * **CPO概念受资本运作...
15:38
根据国家发展改革委通知,今日24时国内成品油调价窗口将正式开启。回顾本轮调价周期(7月31日至8月14日),国际油价走势呈现先抑后扬的态势。 根据监测结果,本次调价后,国内汽、柴油每吨零售限价将分别下调230元和220元。折算成升价,全国平均92号汽油、95号汽油及0号柴油每升价格将分别下调0.18元、0.19元和0.19元。 此次调价落实后,私家车主加满一...
15:28
Meta 内部突发人事震荡。今日清晨,Meta 超级智能实验室核心研究员余家辉在社交媒体上宣布离职,并计划创办一家新公司。这距离 Meta 发布 Muse Spark 1.2 仅有 8 天时间。余家辉在文中表示,与马克·扎克伯格及 Alexandr Wang 共建 TBD Lab 是一段极具启发且充实的经历,并为团队在多模态领域的成果感到骄傲。关于新公司,目...
15:28
北京时间 8 月 13 日晚 8 点半,DeepSeek 正式发布了其成立以来的首个 Agent 产品——DeepSeek Harness。经过长时间的预热,这款备受期待的产品一经亮相便引发了巨大反响。截至发稿,其 GitHub 仓库在公开仅 12 小时内,Star 数已突破 5 万大关。官方将其定义为模型与 Harness 的结合,模型是大脑,Harnes...
15:28
谷歌动作极快!继 3.6 Flash 发布仅三周后,Gemini 3.7 Flash 便迅速登场。这也是在哈萨比斯卸任、Koray Kavukcuoglu 接任后,谷歌公开亮相的首款 Gemini 模型。虽然模型早已在内部测试,但何时发布、如何定位,如今全由 Koray 掌舵。这一发布时机耐人寻味,恰如“新官上任三把火”,首刀便砍向了价格。 官方宣布,3.7...
15:28
AI再次引发数学界地震!OpenAI下一代最强模型Astra在10个长期悬而未决的难题上取得重大进展,其中一些成果甚至足以让候选人入选菲尔茨奖。OpenAI将功劳归于AI,声称人类会歪曲事实,所有数学论证均由内部版本的Astra生成,人类仅协助准备手稿并检查形式化内容。这则消息如同炸弹般在数学界引发新一轮轩然大波。面对这场重塑领域的剧变,数学家们不得不重新审...
15:24
据日本方面8月14日公布的最新数据,13日开始的强降雨已导致千叶县8人死亡。日本气象厅指出,千叶县自13日傍晚起便持续遭遇强降雨。数据显示,截至14日凌晨1点,千叶市12小时内的累计降雨量达到347毫米,创下历史最高纪录。这一半天的雨量,已接近往年8月全月平均降雨量的3倍。