过去一周,随着 Grok 4.5、GPT-5.6 以及 Claude Sonnet 5 的相继问世,大模型领域的叙事焦点发生了显著偏移。与发布节奏相比,更值得玩味的是各家厂商对模型价值的重新定义。

这一转向在马斯克介绍 Grok 4.5 时表现得尤为明显:他几乎不再强调“xAI 最强”,而是反复强调其“Opus 级”的能力,但具备更快的速度、更低的 token 消耗和成本优势。OpenAI 将 GPT-5.6 的目标定义为“让每个 token 产出更多有用工作”,Sam Altman 直言企业客户更看重 AI 支出的实际回报;Anthropic 则指出,Sonnet 5 能完成的智能体任务,在几个月前还需要更昂贵、更大的模型才能实现。

当“更便宜”成为行业默认动作,真正的竞争便不再是单纯的“降价幅度”,而是“同样的价格,谁能干更多、更难的任务”。性价比,正逐渐成为竞争的核心变量。

**一、性价比之争:重构能力、成本与场景**

这一变化首先体现在模型产品的形态上。厂商开始打破单一模型“全能”的设定,通过组合不同能力、成本和调用方式来满足多元需求。

OpenAI 的 GPT-5.6 是这一趋势的典型代表。其命名体系从过去的“旗舰+mini/nano”演变为“Sol / Terra / Luna”,逻辑从“按强弱排序”变为“按场景分工”。Sol 承担复杂推理、编程和 Agent 等高难任务,价格却对标旗舰;Terra 综合表现接近旗舰,却落入中端价格区间;Luna 则主打高并发、低延迟的走量场景。

这套分层逻辑的核心在于“能力跟随场景走,成本跟随任务变”。OpenAI 今年 3 月推出的 Standard/Batch/Flex/Priority 定价机制,进一步将这一思路延伸至调用层面:能批处理、可等待的请求更便宜,而追求低延迟、高确定性的请求更贵。这意味着,价格不再只取决于模型能力,也取决于任务对时间和稳定性的要求。Anthropic 的 Claude Sonnet 5 引入了“effort”机制,允许开发者根据任务复杂度动态调节推理强度,打破了“选定模型就锁定成本”的旧逻辑。

Grok 4.5 则将性价比前置到了训练阶段:先锁定高频场景(如编程),再围绕场景定义模型能力和成本结构。作为 xAI 首个专门针对编程和智能体任务训练的模型,它与 Cursor 联合训练,使用了大量真实交互数据。这种做法解决了编程和 Agent 任务中上下文长、调用频繁、链路复杂且容易触发重试的成本痛点。

综上,大模型竞争已从“追求能力最大化”转向“追求有效能力的成本最优化”。

**二、经济账的算计:从“Token 单价”到“单任务成本”**

不同于传统互联网应用,AI 调用每一次都对应真实的推理成本。使用越多,价值越大,成本压力也越真实。随着模型竞争进入应用阶段,性价比问题已从单纯的价格问题,延伸为商业模式问题。

当模型真正进入真实任务场景,决定商业可持续性的,不再是模型单价,而是模型在高频调用中完成任务的综合成本。一个真实任务的成本,通常由一整条任务链路共同决定:输入输出 token 数、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率等,都会被计入最终账本。

这引出一个反直觉的结论:定价便宜的模型未必真的划算。如果单次 token 价格低,却需要更多轮对话、更长上下文、更高重试率,那么单位任务成本未必低。反之,一个看似更贵的模型,如果能用更少轮次完成任务,减少返工和失败率,最终反而可能更经济。

因此,模型性价比的衡量单位正在发生变化——不只看 token 单价,还有完成单个任务所需的成本。

近期国产大模型集体押注 MoE(混合专家)架构,正是为了在这一框架下优化成本。DeepSeek-V4-Flash 是 284B 总参数、每 token 激活 13B;Qwen3-235B-A22B 是 235B 总参数、22B 激活;腾讯混元 Hy3 正式版拥有 295B 总参数,但仅激活 21B 参数。MoE 的关键价值在于:让模型拥有接近超大规模模型的能力边界,同时让每次调用不必承担全量参数的计算开销。

总参数决定模型的能力池大小,激活参数决定一次推理真正要支付的计算成本。这意味着,性价比已经前置到模型架构设计阶段,而不再只是模型发布后的定价策略。

**三、默认调用之争:大模型迎来“杰文斯时刻”**

当性价比的衡量单位转向“单任务成本”,模型竞争的重心也随之改变。企业和开发者真正关心的,正在从“哪个模型最强”,转向“哪个模型能被长期、稳定、低成本地默认调用”。

所谓“默认调用”,指的是模型在办公、知识管理、Agent、客服、代码等高频场景中,成为系统优先调用的底层能力。它未必总被用户看见,却会持续承接大量真实任务。

这一趋势正在被云平台和开发者工具产品化。Amazon Bedrock 推出的 Intelligent Prompt Routing、微软 Azure AI Foundry 上线的 Model Router,本质上都在将模型调用从“手动选择”推进到“统一调度”:系统根据任务复杂度、成本、延迟和性能,自动将请求路由到最合适的模型。

开发者生态中的 OpenRouter、LiteLLM、Dify 等工具,也在承担类似角色。统一 API、多模型路由、预算控制,正在把模型嵌入更上层的应用框架和企业 AI 网关。这会重塑模型市场的竞争方式:未来很多调用未必由终端用户直接决定,而会由云平台、AI 网关提前分配。

谁能进入这些系统的默认配置,谁就能获得更高比例的真实调用。默认调用的第一重价值是规模,它能形成更扎实的商业基本盘;第二重价值是反馈,真实任务中的失败率、重试率、用户修正等数据,能帮助模型和系统持续优化;第三重价值是生态绑定,一旦开发者围绕某个模型调好了提示词、工具调用、RAG 流程,这个模型就会从一个可替换的 API,变成应用架构的一部分。

由此,“性价比”形成了一个新的竞争飞轮:更低单任务成本 -> 更多默认调用 -> 更多反馈 -> 进一步降低成本。腾讯混元 Hy3 与企业办公工具 WorkBuddy 的结合便是例证。Hy3 通过这一高频入口进入真实工作流,日均 token 消耗从 preview 阶段增长了 20 倍,任务成功率从 72% 提升至 90%,平均耗时缩短约 34%。这表明,只有进入真实任务链路,模型才能获得持续优化的土壤。

类似协同优化已成为行业共识。Google 将 Gemini 深度嵌入 Gmail、Docs 等工作场景,Adobe Firefly 嵌入 Photoshop 等创意工作流,都是为了围绕真实任务迭代模型。

因此,性价比竞争已经超出降价竞赛本身。它真正改变的,是需求边界。19 世纪经济学家杰文斯观察到的“蒸汽机效率越高,煤炭消耗反而越多”的现象,正在大模型领域重演。大模型正在接近自己的“杰文斯时刻”。性价比竞争的结果,未必是 AI 总成本下降,而是 AI 使用密度上升。模型调用会从少数高价值任务,扩展到大量日常任务,最终让 AI 变得更实用,也更普惠。

最新快讯

2026年09月02日

18:59
据中国人民银行官网消息,2026年8月31日至9月1日,二十国集团(G20)财长和央行行长会议在美国阿什维尔举行。会议聚焦全球经济形势与前景、促进经济增长、全球失衡及发展中国家主权债务等议题。中国人民银行行长潘功胜出席会议并发言。 与会各方普遍认为,尽管全球经济面临多重风险挑战,但整体韧性依然存在。为实现稳定且可预期的增长环境,各国应加强政策协调,降低市场主...
18:59
近日,全国粮油作物大面积单产提升现场会在新疆伊犁召开。会议要求,深入贯彻习近平总书记关于粮食生产和单产提升的重要指示精神,落实党中央、国务院决策部署,牢固树立正确政绩观。要毫不松懈抓好粮食生产,高标准推进大面积单产提升,促进良田、良种、良机、良法集成增效,深挖增产潜力,为保障国家粮食安全提供坚实支撑。 会议指出,近年来实施的粮油作物大面积单产提升行动成效显著...
18:49
鼓狮财经9月2日电,盛达资源(000603.SZ)公告称,公司全资子公司赤峰金都矿业有限公司(简称“金都矿业”)于近日完成十地银铅锌矿采矿权(矿区面积:4.4750平方公里)和外围十地地区铅锌多金属矿勘探探矿权(勘查面积:3.73平方公里)的整合工作,并收到赤峰市自然资源局颁发的《不动产权证书(采矿权)》《采矿许可证》。本次金都矿业完成矿业权整合工作,取得新...
18:49
据鼓狮财经9月2日报道,东宏股份(603856.SH)发布公告,确认中标新疆维吾尔自治区水利电力物资有限公司2026年钢管采购Ⅲ标,中标金额达1.44亿元。此次中标是公司深耕水利领域的重要成果,预计将对经营业绩产生积极影响,但项目最终金额及细节仍需以正式签订的合同为准。
18:49
据鼓狮财经9月2日报道,国芳集团(601086.SH)发布公告,确认其股票于9月1日及9月2日连续两个交易日收盘价格涨幅偏离值累计达到20%,属于股票交易异常波动。 自8月28日起,国芳集团股价已连续4个交易日触及涨停板,累计上涨幅度达46.44%,显著偏离上证指数同期表现。数据显示,截至9月1日,公司市盈率为56.58倍,显著高于行业平均的20.03倍;市...
18:16
9月2日,鼓狮财经报道,出版传媒发布公告称,公司拟以自有资金2.4亿元参与设立辽宁省数智文化产业投资基金。该基金总认缴出资额为10亿元,公司作为有限合伙人,认缴出资额占基金总额的24%,首期实缴金额为4800万元。 此次设立的投资基金将聚焦文化与科技的深度融合,重点投向人工智能、新一代信息技术在文化及互联网产业的应用领域。 此外,公司控股股东辽宁出版集团旗下...
17:58
**2026 奇点智能技术大会首批核心议题公布:聚焦 AI 自进化与工程落地** 11 月 20 日至 21 日,由 CSDN 与奇点智能研究院联合主办的 2026 奇点智能技术大会将在北京万达文华酒店举行。在技术迭代日益加速的今天,一线开发者和技术决策者究竟能从大会现场带走什么?我们希望带给您的答案不是几页 PPT,也不只是几个新概念,而是真正影响未来半年...
17:58
Meta的程序员在社区分享,Token消耗排行榜成了内部最被关注的榜单。为了提升排名,员工们不得不大量挥霍Token。这种“Token消耗最大化”的现象,在KPMG、亚马逊等公司也蔚然成风。有些公司甚至将Token用量与晋升挂钩,员工Token额度未用完、AI生成率低于80%,都会受到批评。这些听起来像段子,实则是企业迈入Agent时代后发生的真实故事。然而...
17:58
OpenAI 即将推出的 Astra 模型在内部评测中表现惊人,不仅拿到了漏洞利用基准 ExploitBench 的满分,还意外发现了两个此前无人知晓的零日漏洞。更令人咋舌的是,面对一个经过加固的浏览器,Astra 能够从零开始挖掘出多个未知漏洞,并成功拼凑出一条完整的沙箱逃逸链——这意味着,只要用户打开一个 HTML 文件,该模型就能在用户的电脑上执行任意...
17:58
澳大利亚开发者Andrew厌倦了抢健身课的繁琐过程,于是决定把这件小事交给自己的AI助理。然而,几分钟后,AI带回的消息却让他大吃一惊。它不仅成功预订了数周后的课程,还擅自将候补名单上的第1名用户移除,将Andrew从第4名直接提升到了第3名。Andrew从未授权AI这样做,但他只是想订一节课而已。这件事被澳大利亚广播公司(ABC)称为澳大利亚已知的首个自主...
17:58
想象一下,你的胸前挂着一个小巧的吊坠,它能监测你的健康,感知你的情绪,还能记录你的日常生活,在一天结束之后,给你推送一份当日总结。也就是说,融入了AI能力的吊坠,不仅仅是一个配饰,更是一名贴身陪伴的助理或者朋友。在可穿戴设备AI化的潮流中,AI吊坠已经与智能眼镜、智能戒指并列为增长最快的可穿戴品类,Counterpoint预测,2026到2...