一个月内,九款旗舰模型扎堆发布,这在当前的大模型行业中实属罕见。从月初腾讯混元Hy3正式版的开源,到月末Anthropic发布Claude Opus 5,中间Kimi K3、Qwen3.8-Max预览版以及Grok 4.5等相继登场,7月成为了近一年来少见的发布高峰。各家厂商选择的时间点各不相同:有的借竞品更新的间隙跟进,有的在世界人工智能大会前后亮相,也有厂商通过价格调整来应对市场竞争。

然而,7月发布潮的亮点不仅在于数量,更在于它折射出两个显著变化。首先是模型间的能力差距正在收窄。根据Artificial Analysis的最新综合智能指数,头部模型之间的分差已明显缩小。随着版本快速迭代,“最强模型”的地位越来越难以长期保持,各家开始围绕不同任务寻找优势,而非追求单一维度的绝对领先。其次是开源模型正式进入第一梯队。7月发布的新款中,腾讯混元Hy3和Kimi K3等均选择开放权重,允许开发者自行下载部署。其中,Kimi K3在Code Arena前端编程榜单中登顶,超越了GPT-5.6 Sol和Claude Fable 5。这表明,开源模型已不再是闭源模型的追赶者,而是在部分开发场景中已具备与其正面竞争的实力。

那么,这一个月密集的发布究竟带来了哪些变化,又意味着什么?

01 不再只比谁更聪明

过去几年,大模型行业主要比拼通用能力,看谁的知识面更广、回答更准确。但现在,竞争维度已经发生了转移。代码能力成为最明显的争夺焦点。OpenAI继续强化编程与复杂推理,扩展Codex生态以绑定程序员;Anthropic押注代码理解与安全审计,助力开发者处理大型工程问题;Grok 4.5则主打速度与低成本,并与AI编程工具Cursor绑定,覆盖日常开发场景。大模型研究者姚宇航表示,各家公司都在重点投入编程能力,差距正在快速缩小,例如Kimi K3的代码能力提升显著,已逼近头部闭源模型水平。

Agent是各家争夺的另一个方向。GPT-5.6 Sol探索自动化编程,Opus 5强调长程任务执行,Kimi K3展示了连续运行完成复杂任务的能力,腾讯混元Hy3则试图结合微信生态探索智能体应用。然而,Agent在实际工作中仍显稚嫩。独立开发者北城指出,目前智能体产品的短板往往不在工具调用,而在任务调度能力。例如,某些模式的子代理会重复读取同一文件,导致Token消耗增加但实际产出未变。在他看来,智能体能力的提升不能仅靠增加代理数量,关键在于能否精准判断哪些任务值得分析,哪些步骤可以省略。姚宇航也认为,智能体目前最值得关注,但距离成熟尚有距离。医疗、金融等垂直领域的智能体仍有较大机会;下一阶段的差距,将取决于智能体在具体场景中是否好用以及客户是否愿意买单。

国产模型则通过特定能力的提升寻找突破口。Kimi K3强化了长上下文、前端编程和产品设计能力,在多项编程测试中跻身头部,能力接近国外闭源旗舰模型。参数规模与推理效率之间的竞争也成为另一条主线。7月发布的多款模型进入了万亿甚至数万亿参数区间,但参数规模已不能简单等同于能力高低。随着MoE架构的发展,模型可以拥有更大的参数容量,同时只激活其中一小部分进行推理,从而降低实际计算成本。行业由此形成了两条路线:一是继续扩大规模,用更大参数换取更强能力;二是强调效率,用更小的激活参数实现接近旗舰模型的效果。

价格也成为7月模型竞争中最直接的变量。海外厂商更多采取差异化定价策略。OpenAI将GPT-5.6拆分为不同版本,让用户根据任务复杂程度选择;Anthropic维持高性能旗舰路线,通过Opus系列覆盖高价值场景;Grok 4.5则采取低价策略,输出价格仅为Opus系列的四分之一,并通过与Cursor的绑定吸引开发者。国内厂商则更强调成本优势,过去半年多家厂商持续下调API价格,旨在降低使用门槛,扩大用户规模。

一句话总结,7月的大模型竞争已经从单一能力比拼,扩展到代码、智能体、参数效率和价格等多个维度。

02 谁超出预期,谁评价两极?

综合相比前代的变化、榜单表现和开发者反馈,7月发布的模型水平大致可以分为三类。

首先是超出预期的一类:Kimi K3、Grok 4.5、混元Hy3。其中最受关注的是Kimi K3。该模型采用MoE架构,总参数达万亿级别,重点强化了长上下文、前端编程和产品设计能力。发布当天,Kimi K3便以1679分登上Code Arena前端编程榜第一,相比前代Kimi K2.6的第18名提升了17个位次。一周后的Arena综合榜上,Kimi K3也首次进入全球前十。但Kimi K3也有明显短板,Artificial Analysis的知识可靠性测试显示其幻觉率从39%升至51%,输出速度约33 Token/s,低于同类模型。开发者的实际体验也印证了这种“偏科”,北城认为Kimi K3在前端开发、UI设计和产品表达方面优势明显,但在涉及复杂工程任务时表现不够稳定。

同样受关注的是Grok 4.5。7月9日发布后,它迅速进入Artificial Analysis智能指数前列,并在部分工具调用测试中表现突出,被不少开发者视为性价比较高的选择。北城的体感与此一致,他认为Grok 4.5最大的优势是速度,同一个需求可能三五分钟就能完成,而用GPT-5.6有时需二十分钟甚至半小时,加之价格较低,非常适合快速开发需求。姚宇航也认为Grok 4.5的编程能力经过专门优化,配合Cursor使用体验很好。SpaceX收购Cursor母公司Anysphere以及与Cursor的数据合作,也被认为是Grok 4.5优化编程体验的背景因素。

混元Hy3则代表了效率路线的突破。该模型总参数295B、激活参数仅21B,以不到旗舰模型五分之一的参数规模,在多个公开基准中的成绩接近体量更大的竞品。不过在SWE-Bench Pro中,混元Hy3的57.9分与Claude Opus 4.8的69.2分仍有明显差距,说明复杂代码修复能力仍需追赶。姚宇航认为,混元Hy3相比腾讯之前的模型有进步,加上开源和小尺寸设计,是中等体量里不错的选择。

再看稳定在第一梯队但惊喜有限的一类:GPT-5.6 Sol和Claude Opus 5。这两款模型依然保持领先,但并未带来重大变化。GPT-5.6 Sol强化了复杂推理和智能体编程能力,在Terminal-Bench 2.1测试中达到88.8%,Ultra模式进一步提升至91.9%。Claude Opus 5则继续保持复杂任务优势,更强调在复杂工程、代码理解和安全分析中的可靠性,其优势是性能接近Fable 5,价格却只有后者的一半。北城提到,GPT-5.6 Sol已能覆盖大部分日常开发需求,但在遇到特别复杂的问题时会调用Opus 5解决。对他而言,Opus 5定位更接近解决关键问题的“专家”,但也意味着更高的成本。

最后是反馈分化、仍待验证的一类:Gemini 3.6 Flash和Qwen3.8-Max预览版。典型的是Gemini 3.6 Flash,其在Artificial Analysis榜单上的得分为50,与前代3.5 Flash持平。开发者社区反馈普遍认为,这一代相比前代没有明显提升,表现也不如同期竞品。但也有人认为,作为一款轻量模型,其输出质量基本过关。独立开发者卡普迪姆认为,Gemini 3.6 Flash日常使用体验不错,虽然编程能力不突出,但多模态理解出色,支持任何格式文件输入,聊天文风和体验也优于很多竞品。

Qwen3.8-Max预览版上线后效果不稳定,市场反馈存在差异。北城最大的感受是Qwen3.8-Max思考深度较高,但有时会陷入长时间推理,像“自己把自己绕进去”,最终未给出有效方案。卡普迪姆则认为Qwen3.8-Max低于预期,用前端审美测评集测试时发现实际能力与宣传存在差距。作为仍在调整的预览版,其最终表现需待正式版发布后再验证。

7月没有出现一个在所有维度都领先的模型,不同模型开始围绕具体场景形成分工。以北城为例,他会根据任务选择工具:GPT-5.6负责日常开发,Grok 4.5用于快速完成需求,Kimi K3做产品和前端场景,Claude Opus 5负责解决复杂问题。卡普迪姆的搭配则不同,他会使用Claude的Fable 5或Opus 5进行规划,再通过GPT-5.6 Sol执行。

03 发布越来越快,开源闭源之争升温

这轮密集发布背后,有几个问题值得分析:模型迭代为何越来越快?为何集中发生在7月?开源为何冲击现有商业模式?

首先,模型迭代方式正在发生变化。过去,大模型能力提升主要依靠重新训练更大规模模型,周期长、成本高。但随着强化学习、后训练等技术成熟,模型升级开始更多依赖训练后的优化。姚宇航表示,近两年发布速度加快的一个重要原因是行业掌握了更成熟的后训练方法。现在很多模型的提升不需要重新训练,而是在已有基础模型上通过强化学习、自我迭代来提升。这意味着竞争周期正在缩短。过去领先模型可能保持数月优势,现在版本更新带来的领先窗口可能只有几周。发布时间本身也成为竞争的一部分。

其次,7月是多个节点叠加的时间。对于国内厂商,世界人工智能大会在7月举行,厂商集中在此前后发布模型、展示进展。对于海外厂商,多家头部公司也选择在这一阶段更新,意在争夺开发者生态和商业竞争的主动权。

再者,行业竞争规则正在变化。模型能力够强不再是唯一目标,竞争已延伸到模型如何被使用、如何转化为收入。这也是开源与闭源之争在7月再次升温的原因。长期以来,开源与闭源之间存在能力差距。但随着部分开源模型进入第一梯队,一个现实问题出现:当高性能模型可以免费获得,模型公司的API调用和订阅收入会不会被分流?支持开源的一方认为开放权重能降低门槛,推动生态发展;闭源阵营则担心用户被分流。Anthropic等公司认为开放权重可能带来安全风险,需要更严格治理。这场争论背后对应着不同利益诉求:英伟达等基础设施企业希望开源带来更多部署需求;OpenAI、Anthropic等模型公司则希望维持收入;而国内厂商开放权重是为了争取开发者生态、云服务和后续商业化入口。

7月之后,大模型竞争还将继续。开发者社区普遍预计,DeepSeek V4正式版、Fable 5.1、GPT-6等新模型将在8月陆续发布。模型能力差距正在缩小,单靠发布一个更强的模型越来越难建立长期优势。接下来值得观察的指标包括:DeepSeek V4正式版能把开源模型的能力上限推到哪里,API价格是否继续下探,智能体能否出现稳定的付费场景,以及开源模型能否进入更多企业的私有化部署。这些问题的答案,会比榜单名次更能说明这一轮混战真正改变了什么。

最新快讯

2026年08月04日

20:21
据鼓狮财经8月4日报道,伊朗高级消息人士当地时间透露,伊朗正与阿曼商讨重开霍尔木兹海峡的航运方案。根据该方案,伊朗将掌控海峡内的进港航运,并掌握出港船只的动态,保留在必要时进行干预的权力。消息人士指出,阿曼方面将在向伊朗通报后,才放行出港船只。 此外,该消息人士强调,伊朗方面立场坚定,不太可能改变态度,也不太可能接受任何其他重新开放海峡的替代方案。
20:21
据鼓狮财经8月4日报道,韩国疾病管理厅最新数据显示,截至8月3日,韩国全国累计报告中暑病例2221例,其中19人不幸死亡。面对日益常态化的极端天气,韩国总统李在明强调,必须从根本上完善国家危机管理体系。 近期,韩国遭遇了历史罕见的极端高温。气象数据显示,庆尚南道梁山连续5天日间气温超过40摄氏度,8月2日达到42.5摄氏度,刷新了韩国气象观测史上的最高气温纪...
20:15
8月5日初步询价,8月10日网上申购,按照已披露的发行安排,宇树科技即将正式登陆科创板。过去一周,关于这份招股书的解读铺天盖地:估值几何、打新策略、创始人持股比例……剥开这些资本市场的喧嚣,这份文件其实是具身智能行业在A股市场披露的第一份经过审计的完整财务样本。对于AIoT从业者而言,这份文件更像是一面镜子,值得我们“倒过来读”,去读采购明细里AIoT缺席的...
20:15
这家AI巨头正全力押注医疗健康行业,过去半年已推出三款新品。但它必须确保ChatGPT的准确性足够有保障,毕竟已有亿万人向它寻求医疗健康方面的建议。OpenAI想向美国顶级医疗系统推销其医疗业务的规划时,往往会搬出一位医院CEO们无法忽视的人物:山姆·阿尔特曼。 41岁的阿尔特曼是OpenAI的联合创始人兼CEO,身家亿万,最擅长打消外界疑虑、促成订单。他已...
20:15
当你在千问App里输入“新手孕妈需要买什么”,AI几秒钟就能列出一份清单;在豆包对话框输入“4000元以内的手机”,AI会直接帮你比价算优惠;打开淘宝,AI导购迅速上线……不知不觉间,AI购物助手已成为各大综合电商和本地生活平台的标配。购物这件事,正悄然从“搜索框”转向“对话框”。 2026年以来,主流电商平台集体押注AI对话购物:淘宝依托通义千问升级全链路...
20:15
仅仅一个周末之隔,字节跳动与阿里巴巴相继出招。周一,传闻已久的「千问办公」正式公测,这是整合了QoderWork、MuleRun、悟空三款阿里产品的全新Agent,主要面向个人与企业的生产办公场景。阿里官方将其定位为激活组织生产力,全面瞄准企业级市场。而五天前,字节跳动也宣布了飞书产品团队与豆包产品团队整合,成立新的豆包产品团队,并将飞书商业化团队与火山引擎...
20:15
过去几天,DeepSeek 和 Qwen 对大模型行业带来了前所未有的颠覆效果。Hermes Agent 背后的公司 Nous Research 宣布,刚刚正式推出的 DeepSeek V4 Flash 模型在其平台上启动一折促销,持续 7 天。这是一个荒诞却又务实的价格,Nous 原话说 DSV4 Flash 的调用成本比 Fable 5 便宜千倍以上。即...
20:14
2026年7月,国内新能源汽车市场迎来强劲复苏行情。根据乘联会月度初步数据综合测算,当月国内车企新能源乘用车预估批售量达到147万辆,同比增长23%,环比微降1%。这一增速不仅创下2026年7月以来的最高纪录,且环比下滑幅度低于季节性指数,标志着国内新能源汽车板块的复苏迹象已初步显现。 相比之下,整体车市走势承压,表现偏弱。然而,新能源汽车已稳居国内乘用车市...
20:14
8月4日,上交所数据显示,2026年7月A股新增开户265.54万户,较上月环比下降7.30%,但同比2025年7月的196.36万户增长了35.23%。2026年A股累计新开2281.68万户,同比增长56.69%。 同期,基金新开户19.9万户,环比下降14.81%,同比2025年7月的16.15万户增长23.22%。2026年基金累计新开203.05万...
19:43
据鼓狮财经8月4日消息,欧洲企业正交出近年来最为强劲的财报成绩单。分析师对多个行业的前景愈发乐观,预计区域股市有望创下历史新高。 本轮财报季多项指标表现亮眼:MSCI欧洲指数利润大幅增长14%,超过半数成分股在第二季度的业绩超出预期,这两项数据均为2023年以来的最高水平。受油价上涨推动,大宗商品板块贡献突出。此外,高盛数据显示,即便是欧斯托克600指数中的...
19:42
7月30日晚间,宇树科技正式披露了科创板上市招股意向书及初步询价公告,敲定了发行时间。与此同时,具身智能行业的资本化浪潮正持续高涨,多家国内人形机器人企业正处于IPO辅导、申报或发行的关键阶段。其中,宇树科技的最大竞争对手智元创新也传出了新动向,确认已启动赴港上市流程,但暂未透露保荐机构、递表时间及募资规模。智元官网亦首次公开了完整的合伙人团队名单,标志着其...