8月13日凌晨,DeepSeek V4 Pro正式发布,为开源模型生态注入了一剂强心针。从Kimi K3到MiniMax H3,再到DeepSeek V4 Flash、DeepSeek V4 Pro,在中国开源模型的强势攻势下,美国AI公司终于坐不住了。英伟达CEO黄仁勋亲自下场,发布了个人首条推文,呼吁全行业共同推动美国开源生态的发展。目前,除了Anthropic之外,美国AI圈的主要玩家几乎全员到齐,OpenAI的Sam Altman、谷歌的Sundar Pichai等闭源模型掌门人也罕见地发文表示支持。为何这些平日里竞争激烈的巨头这次罕见地站在了同一战线?Anthropic坚持不加入的原因又是什么?要回答这个问题,我们需要先搞清楚一个更基础的问题:今天AI行业所说的“开源模型”到底是什么?以及模型开源后,对厂商和行业意味着什么?
**01、开源模型,到底开了什么?**
很多人误以为开源就是把代码发出来,其实并非如此。要理解模型到底开放了什么,需要梳理大模型从训练到发布的完整流程,大致可分为七个环节。
第一是训练数据。研发团队决定使用网页、书籍、代码等哪些数据,以及如何清洗和筛选,这决定了模型的“底子”。第二是模型架构和参数规模。涉及模型规划、架构选择、参数规模及训练配置,这决定了模型的能力上限和训练效率。需要区分的是,参数规模并非指数据量,而是指模型需要调整的参数数量,规模越大,能捕捉的细节和规律越复杂。第三是训练基础设施,包括GPU集群、高速网络、存储系统及训练框架,这是如今最火的AI Infra领域。像DeepSeek的DeepGEMM、Kimi K3的FlashKDA、MoonEP都属于这一层的创新。第四是训练流程和Checkpoint,包括预训练、微调和强化学习,以及训练过程中的“存档”机制。第五是“模型权重”。经过漫长训练,模型内部数十亿乃至数万亿个参数被调整到合适数值,这些参数形成的集合记录了模型的知识,是核心成果。第六是模型部署,将权重部署到服务器,通过API或本地部署提供服务。最后是“技术报告”,介绍架构思路、数据构成、踩过的坑及评测结果,更多是方法论而非操作步骤。
搞清楚流程后,“开源”具体指什么?主要分为闭源、开放权重和完全开源三类。闭源即以上环节全部不开放,客户只能通过API使用。完全开源是指数据、代码、存档、报告全公开,如Ai2的OLMo系列。但现在主流的其实是中间地带的“开放权重”,即只公开模型训练的最后结果(权重)和推理代码,允许下载、微调和改进。
不同开放权重模型的开放程度存在差异。以Meta的Llama系列为例,它是最基础的开放权重代表,公开了权重和推理代码,但训练数据、调整策略和内部工具链始终未公开。DeepSeek和Kimi则更进一步。DeepSeek V3和R1不仅详细公开了技术报告,还开源了DeepEP、FlashMLA等工程工具链。Kimi K3同样如此,除了详细的技术报告,还同步开放了三大底层基础设施:解决MoE专家间通信效率的MoonEP、加快注意力计算的FlashKDA,以及给智能体训练搭建环境的AgentEnv。这些工具分别对应了训练大模型的通信、计算和训练环境三个卡点,让行业得以了解其高效训练背后的工程细节。
**02、开放权重模型,怎么赚钱?**
过去一年,中国大部分模型厂商的许可证正变得越来越开放。DeepSeek从最初的自定义协议切换到MIT License,阿里Qwen从自定义协议切换为Apache 2.0,智谱GLM也采用了宽松的MIT License。当然,并非所有公司都完全放开。Kimi K3采用了全新的Kimi K3 License,虽然对绝大多数开发者和中小企业实际使用体验差别不大(免费下载、商用、修改),但设置了两个门槛:月活超1亿或月收入超2000万美元需展示标识;做模型即服务且年收超2000万美元需另行签署商业协议。限制最多的则是Meta的Llama,采用自定的Llama Community License,限制繁多,如月活超7亿需额外授权、曾限制欧盟使用、禁止利用输出训练其他模型等。不过Meta近期有所回转,其新模型Muse Glimmer采用Apache 2.0。
许可证划定了红线,但开源模型如何盈利?开放权重并不等于放弃商业化。企业下载模型只是第一步,真正部署到生产环境还需要算力、运维、持续更新和定制开发。因此,开放模型可以带动一系列服务收入。
第一,通过开放模型带动云计算和基础设施消费。企业下载权重后仍需GPU、云存储、网络等资源,云厂商可借此收费。第二,为企业提供部署和定制服务。企业往往希望私有化部署,模型公司可出售私有化部署、行业微调、技术支持和维护服务。第三,提供收费的后训练和模型开发平台。企业希望在开放模型基础上加入自身数据和规则,模型公司可提供微调、强化学习、评测等工具并收费。
此外,开源模型厂商的另一部分收入来自提供模型服务的MaaS厂商和云厂商。Kimi的年化经常性收入已达约3亿美元。一个反常识的观点是,云厂商和MaaS厂其实欢迎模型厂商收费。因为这意味着官方认证,能保证token质量和性能,类似“Intel Inside”的背书机制。
**03、开放权重,意味着什么?**
过去几年,最强模型(Claude、ChatGPT、Gemini)多为闭源,能力掌握在少数公司手中。开放权重则让前沿模型像软件一样可被下载、部署、微调。对企业而言,这是天大的好事。
首先是成本。面对高昂的API调用费用,开源模型成了最优解。中国开源模型能力已追平闭源最强模型,且便宜、可定制。企业通常对高难任务使用最强闭源模型,日常任务使用开源模型。
其次是所有权问题。在能力相当的情况下,开放模型让企业拥有模型的所有权,能自主控制数据和安全。对开发者而言,开放权重降低了创新门槛,借助权重和技术报告,开发者可以修改、训练模型,适配不同场景。vLLM和SGLang等推理引擎也提供了Day-0支持,无需解决复杂部署问题。
此外,开放权重加速了模型迭代。Kimi K3的技术报告中,关于MoE负载均衡的优化方法,就是基于DeepSeek V3方案的演进。闭源模型的技术突破可能只留在服务器里,而开放的技术经验能让行业站在巨人肩膀上加速发展。
这也是为何黄仁勋会牵头建立“开放安全AI联盟”。面对中国开源模型的崛起,美国政府可能考虑限制,但联盟认为开源对网络安全、创新和AI主权至关重要,监管应针对风险而非技术路线本身。不过,联盟背后也有商业考量:云厂商(微软、亚马逊、谷歌)无论客户部署何种模型,只要在云上都能获益;基础设施企业(英伟达、AMD、Baseten)则从每次部署、微调和推理中获利;企业软件公司(Palantir、Databricks)能服务更多客户。
Anthropic坚持不开源,主要出于两方面担忧:一是前沿开放模型带来的安全风险,一旦权重公开,恶意使用门槛降低;二是蒸馏问题,认为中国开源模型通过蒸馏美国闭源模型降低了追赶算力门槛。但更多人认为,Anthropic更多是出于商业利益,担心开放权重冲击其API依赖和竞争壁垒。近期,在开源声势下,Anthropic的立场正面临巨大压力和质疑。
不过,并非所有人都支持Anthropic的观点。Kimi K3开源后,有声音认为将最前沿模型公开本身是风险。近期OpenAI和Anthropic的模型接连曝出越狱攻击,即便闭源模型也非绝对安全。未来,若更多接近Fable 5水平的开放权重模型被部署到成千上万企业或个人设备上,模型治理和安全控制将面临更大挑战。
目前,关于开源模型的讨论仍在激烈进行。但无论如何,开放权重已成为推动AI发展的重要力量,降低了门槛,加快了创新。但同时,它也带来了新的问题和风险。接下来,我们将持续追踪中美开源模型的发展及其对产业的影响。
