一个月内发布9款旗舰模型,这在行业里并不多见。从月初腾讯混元Hy3正式版的开源,到月末Anthropic发布Claude Opus 5,Kimi K3、Qwen3.8-Max预览版、Grok 4.5等也相继登场。7月成为近一年少见的发布高峰。各家厂商选择的时间点各有千秋:有的借竞争对手更新的空档跟进,有的在世界人工智能大会前后亮相,有的则通过价格调整来回应市场竞争。但7月不仅仅是发布数量多,更重要的是这轮发布折射出两个显著变化。
第一,模型间的能力差距正在收窄。根据Artificial Analysis的最新综合智能指数,头部模型之间的分差已明显缩小。随着版本快速迭代,“最强模型”的位置越来越难长期稳固,各家开始围绕不同任务寻找优势,而非追求单一维度的领先。第二,开源模型正加速迈向第一梯队。7月发布的新模型中,腾讯混元Hy3、Kimi K3等选择开放权重。其中,Kimi K3在Code Arena前端编程榜单中位列第一,超过了GPT-5.6和Claude Fable 5。过去两年,开源模型多被视为闭源模型的追赶者,而这一轮竞争显示,开源模型已在部分开发场景中与闭源模型正面交锋。
那么,这一个月的密集发布究竟带来了哪些变化,又意味着什么?
**01. 不再只比谁更聪明**
过去几年,大模型行业主要比拼通用能力,看谁的知识面更广、回答更准确。但现在,竞争维度已发生改变。这一轮,代码能力成为最明显的争夺方向。OpenAI继续强化编程和复杂推理,扩展Codex生态,试图通过开发工具绑定程序员用户;Anthropic押注代码理解和安全审计,帮助开发者处理大型项目的复杂工程问题;Grok 4.5则强调速度和低成本,与AI编程工具Cursor绑定,覆盖日常开发场景。大模型研究者姚宇航表示,各家公司都在重点投入编程能力,差距也在快速缩小,例如Kimi K3的代码能力提升显著,正接近头部闭源模型水平。
Agent是另一大争夺方向。GPT-5.6 Sol配合Codex探索自动化编程,Opus 5强调长程任务执行,Kimi K3展示连续运行完成复杂任务的能力,腾讯混元Hy3则试图结合微信生态探索智能体应用。然而,Agent在实际工作中仍不成熟。独立开发者北城认为,目前部分智能体产品的短板不在工具调用,而在任务调度。例如,Codex的Ultra模式会开启大量子代理,重复读取同一文件,增加Token消耗却未增加有效工作。在他看来,智能体能力的提升不能只靠增加子代理数量,关键在于判断哪些任务值得分析、哪些步骤可以省略。姚宇航也持相似观点,他认为智能体是当前最值得关注的领域,但离成熟还有距离。在他看来,医疗、金融等垂直领域的智能体仍有较大机会;下一阶段拉开差距的关键,不只是模型能力本身,还在于智能体在具体场景中好不好用、客户愿不愿意买单。
国产模型通过不同能力的提升寻找突破口。Kimi K3强化了长上下文、前端编程和产品设计能力,在多个编程测试中跻身头部。参数规模与推理效率之间的竞争也成另一主线。7月发布的多款模型进入万亿甚至数万亿参数区间,但参数规模已不能简单等同于能力高低。随着MoE架构的发展,模型拥有更大参数容量,同时只激活其中一小部分完成推理,降低计算成本。行业由此形成两条路线:一是继续扩大规模,用更大参数换更强能力;二是强调效率,用更小激活参数实现接近旗舰的效果。价格也成为7月竞争中最直接的变量。海外厂商采取差异化定价:OpenAI细分市场,将GPT-5.6拆分不同版本;Anthropic维持高性能旗舰路线;Grok 4.5则采取低价策略,输出价格仅为Opus系列的四分之一。国内厂商则更强调成本优势,过去半年多家厂商持续下调API价格,降低使用门槛,扩大用户规模。
一句话总结,7月的大模型竞争已从单一能力比拼,扩展到代码、智能体、参数效率和价格等多个维度。
**02. 谁超出预期,谁评价两极?**
综合相比前代的变化、榜单表现和开发者反馈,7月发布的模型大致可分为三类。
先看超出预期的一类:Kimi K3、Grok 4.5、混元Hy3。其中最受关注的是Kimi K3。该模型采用MoE架构,总参数达万亿级别,重点强化长上下文、前端编程和产品设计能力。发布当天,Kimi K3就以1679分登上Code Arena前端编程榜第一,相比前代Kimi K2.6的第18名,提升了17个位次。一周后,Kimi K3在Arena综合榜上首次进入全球前十。但Kimi K3也有明显的能力边界。在Artificial Analysis的知识可靠性测试中,其幻觉率从Kimi K2.6的39%升至51%,输出速度约33 Token/s,远低于同类模型。开发者的实际体验也印证了这种“偏科”。北城认为Kimi K3相比上一代有明显提升,优势主要集中在前端开发、UI设计和产品表达。例如在优化网站UI、设计APP界面时,Kimi K3能产出更好的产品,但涉及复杂工程任务时,表现不够稳定。
同样受关注的是Grok 4.5。7月9日发布后,它进入Artificial Analysis智能指数前列,并在部分工具调用测试中表现突出,被不少开发者视为性价比较高的选择。北城的体感与此一致,他认为Grok 4.5的最大优势是速度,同一个需求用它可能三五分钟就做完了,用GPT-5.6有时要二十分钟甚至半小时,加上价格较低,适合有快速开发需求时使用。姚宇航认为,Grok 4.5的编程能力经过专门优化,搭配Cursor使用整体体验很好。背景是,SpaceX宣布收购Cursor母公司Anysphere,交易预计三季度交割;xAI与Cursor的数据合作也被认为帮助Grok 4.5优化了编程体验。
混元Hy3则代表了效率路线的突破。该模型总参数295B、激活参数仅21B,以不到旗舰模型五分之一的参数规模,在多个公开基准中的成绩接近体量更大的竞品。不过在SWE-Bench Pro中,混元Hy3的57.9分与Claude Opus 4.8的69.2分仍有明显差距,说明复杂代码修复能力仍需追赶。姚宇航认为,混元Hy3相比腾讯之前的模型有进步,加上开源和小尺寸设计,是中等体量里不错的选择。
再看稳定在第一梯队、但惊喜有限的一类:GPT-5.6 Sol和Claude Opus 5。GPT-5.6 Sol和Claude Opus 5依然保持第一梯队位置,但并未带来重大变化。GPT-5.6 Sol强化了复杂推理和智能体编程能力,在Terminal-Bench 2.1测试中达到88.8%,Ultra模式进一步提升至91.9%。Claude Opus 5则继续保持复杂任务优势,更强调模型在复杂工程、代码理解和安全分析等场景中的可靠性。Opus 5的优势是性能接近Fable 5,而价格只有后者的一半。两款模型仍处于第一梯队,只是没有带来重大突破。北城提到,GPT-5.6已能覆盖大部分日常开发需求,但遇到特别复杂的问题时,会调用Opus 5来解决。不过,更强的能力也意味着更高成本。对他而言,Opus 5的定位更接近解决关键问题时调用的“专家”。
最后是反馈分化、仍待验证的一类:Gemini 3.6 Flash和Qwen3.8-Max预览版。最典型的是Gemini 3.6 Flash。它在Artificial Analysis智能指数榜单上得分为50,与前代3.5 Flash持平。开发者社区反馈比较一致,认为这一代相比前代没有明显提升,表现也不如同期竞品。不过也有人认为,作为一款轻量模型,Gemini 3.6 Flash的输出质量基本过关。独立开发者卡普迪姆认为,Gemini 3.6 Flash日常使用体验不错,虽然编程能力不突出,但多模态理解仍然比较出色。它支持输入任何格式的文件,日常聊天的文风和体验也好过很多竞品。
Qwen3.8-Max预览版在7月上线后,模型效果不稳定,市场反馈有所差异。北城最大的感受是Qwen3.8-Max预览版的思考深度较高,但有时会陷入长时间推理,“好像自己把自己绕进去”,但最终没有给出有效解决方案。卡普迪姆则认为Qwen3.8-Max预览版低于预期,他用自己的前端审美测评集进行测评时发现,实际能力与宣传存在明显差距。作为一款仍在调整中的预览版产品,最终表现还需要等正式版发布后再验证。
7月没有出现一个在所有维度都领先的模型,不同模型开始围绕具体场景形成分工。以北城为例,他会根据任务选择工具:GPT-5.6负责日常开发,Grok 4.5用于快速完成需求,Kimi K3用来做产品和前端场景,Claude Opus 5负责解决复杂问题。卡普迪姆的搭配则不同,他会使用Claude的Fable 5或Opus 5进行规划,再通过GPT-5.6 Sol执行。
**03. 发布越来越快,开源闭源之争升温**
这轮密集发布背后,有几个问题值得分析:模型迭代为何越来越快?为何集中发生在7月?开源为何会冲击现有商业模式?
首先,模型迭代方式正在发生变化。过去,大模型能力提升主要依靠重新训练更大规模模型,周期长、成本高。但随着强化学习、后训练等技术成熟,模型升级开始更多依赖训练后的优化。姚宇航表示,近两年模型发布速度明显加快,一个重要原因是行业已掌握了更成熟的后训练方法。现在很多模型的提升并不需要重新训练,而是在已有基础模型上通过强化学习、自我迭代等方式优化。这意味着,模型竞争的周期正在缩短。过去,一个领先模型可能保持数月优势;现在,版本更新带来的领先窗口可能只有几周。发布节奏跟不上,就可能很快被新版本覆盖。对厂商而言,发布模型不只是技术展示,发布时间本身也成为竞争的一部分。
其次,7月是多个节点叠加的时间。对于国内厂商,世界人工智能大会(WAIC)在7月举行,厂商集中在此前后发布模型、展示技术进展。对于海外厂商,多家头部公司也选择在这一阶段更新模型,希望在开发者生态和商业竞争中占据主动。
再者,行业竞争规则正在变化。模型能力够强不再是唯一目标,竞争已延伸到模型如何被使用、如何转化为收入。这也是为什么开源与闭源之争在7月再次升温。长期以来,开源与闭源模型之间存在能力差距。但随着部分开源模型进入第一梯队,一个更现实的问题出现:当高性能模型可以免费获得,模型公司的API调用和订阅收入会不会被分流?支持开源的一方认为,开放权重能降低技术门槛,让更多企业和开发者参与AI创新;开源意味着技术提供方主动让渡部分利益,推动生态发展。而闭源阵营则担心用户会被开源模型分流。Anthropic等公司认为,随着模型能力提升,开放权重可能带来安全风险,需要更严格的治理。这场争论背后,其实对应着不同公司的利益诉求。对于英伟达等基础设施企业,模型开放意味着更多部署需求,也意味着更大的算力市场。对于OpenAI、Anthropic等模型公司,闭源模式能维持API调用和订阅收入。不过也要看到另一面:开源确实会扩大部署需求,但随着参数效率提升,单位任务的算力消耗也可能被摊薄,算力市场的增量未必与模型开放程度同步。对于国内厂商,开放权重不只是技术路线的选择,也是在争取开发者生态、云服务和后续商业化的入口。
7月之后,大模型竞争还会继续。开发者社区普遍预计,DeepSeek V4正式版、Fable 5.1、GPT-6等新模型将在8月陆续发布。模型能力差距正在缩小,单靠发布一个更强的模型,越来越难建立长期优势。接下来值得观察的是几个具体指标:DeepSeek V4正式版能把开源模型的能力上限推到哪里,API价格是否继续下探,智能体能否出现稳定的付费场景,以及开源模型能否进入更多企业的私有化部署。这些问题的答案,会比榜单名次更能说明这一轮混战真正改变了什么。
