同一款模型,官方价格仅降了20%,你的账单却减少了八成。8月24日,OpenAI与AWS联合发布了一项测试结果:在Terminal-Bench 2.1基准测试中,GPT-5.6 Terra模型在Kiro平台上的单任务成本降低了约82%。Kiro是AWS推出的软件开发智能体平台,覆盖IDE、CLI和Web端。GPT-5.6家族的Sol、Terra、Luna三个版本已在Kiro上运行了一个多月。
这82%的成本降幅并非官方降价带来的。Terra最近一次官方调价是在7月30日,幅度仅为20%。尽管单价降幅不大,但账单却能削减八成。这中间省下的六十个百分点究竟从何而来,才是我们需要关注的重点。
GPT-5.6于今年7月登陆Kiro。先是13日,AWS宣布GPT-5.6 Sol、Terra、Luna在Amazon Bedrock正式可用。紧接着第二天,Kiro宣布这三款模型上线IDE、CLI和Web。这是OpenAI模型首次进入Kiro,正值Kiro公开预览一周年。先上架,再干活,一个多月后OpenAI交出了这份答卷:两家联手对Kiro环境和OpenAI模型进行了优化,Terra完成一个成功任务的成本降低了约82%。
01、省下的是走弯路的成本
7月30日的官方调价中,Terra降了20%,但在Kiro的测试中,单任务成本却降了82%。多省下的这六成,究竟从何而来?方向主要集中在:模型产生的token更少了,工具调用的次数更少了,失败后的重试和绕远路的情况更少了。因此,节省的这部分并非来自每次调用的费用,而是原本会白白消耗的费用。
道理很简单:一个AI智能体把任务搞砸一次,账单照记;它中途选错路径、跑偏三轮再回头,这些token也照收。在实际开发中,钱往往就是这样流失的。OpenAI在官方博客中也提到了同样的逻辑:效率来自三个层面——发起请求的智能体框架、中间调度请求的编排系统,以及最后跑在GPU上的模型本身。
省钱还能省在模型分工上。OpenAI还举例说明:编码工作流可以先让Sol把问题想清楚、制定计划,再换Luna去实施那些已经定义好的改动、编写测试、运行评估。同一条流水线上,不同环节匹配不同档位的智能体。
02、模型只占账单一半,换个框架就换个价
Terminal-Bench 2.1这套测试题,并非让模型单独答卷。它将模型置于一个终端环境中,给出一个模糊目标,要求其自己规划路径、调用工具、编写脚本、处理报错并进行反复迭代。因此,跑出来的成绩是「智能体+模型」这个组合的成绩。
榜单中的四行数据最能说明问题:Claude Code配合Fable 5,分数为83.8%,花费552.67美元;Codex配合GPT-5.5,分数为83.1%,花费2059.19美元;Codex配合GPT-5.6 Terra,分数为78.4%,花费421.15美元;Codex配合GPT-5.6 Luna,分数为75.7%,花费241.45美元。前两行分数仅差0.7个百分点,账单却相差近4倍。
同一个模型,装入不同的框架,搭配不同的上下文组织和工具策略,跑出来的价格根本不同。根据Kiro官方数据,Terra在Coding Agent Index上获得了77.4分,仅比Claude Fable 5的77.2分高一点点。它的卖点不在分数,而在于这个分数对应的成本。
Kiro那套”需求驱动”的发力点就在于此,核心玩法只有一句:禁止直接编写代码。它先把用户含糊的目标拆解为正经的需求文档、技术设计和可执行任务清单,再交给模型。这样,模型收到的不再是一句模糊不清的话,而是一份梳理清楚的活儿。熟悉Agent的人立刻就能反应过来,这一步省的正是最昂贵的那部分开销。模型跑偏、返工、推倒重来,烧掉的token往往比正经干活还多。
Kiro还在流程中设置了两个关卡:代码真正修改前,先停下来由人审核;活干完后,再自动运行测试验证。这两道关卡下的每一次返工,都能省下真金白银。
03、Claude在亚马逊的地盘GPT分走了一半
一年前,Kiro还只是个”需求驱动”的IDE,模型选择器是Anthropic的主场。一年后,AWS在自己的开发智能体平台上,一口气摆进了三档OpenAI模型。Sol、Terra、Luna与Claude并列在同一个下拉菜单中,这种画面在一年前很难想象。
虽然GPT-5.6这次是”全家入驻”,但并未”全面开放”。三款模型是渐进式、实验性开放,面向Pro、Pro+、Pro Max和Power用户,区域仅限美国弗吉尼亚北部和欧洲法兰克福,支持跨区域推理。还有一个令人不适应的点是:这批模型在Kiro中走的是隐藏思维链,用户看不到推理步骤,只能看到最终结果。习惯了盯着Agent一步步推理的人,会觉得像把活扔进了一个不透明的盒子。官方说法是,这是预期行为,不影响输出质量。
三档模型在Kiro中明码标价。7月14日刚上线时,同样的任务,Sol扣2.4倍,Terra扣1.2倍,Luna扣0.6倍。7月30日OpenAI降价落地后,第二天Kiro跟进调整:Luna从0.6倍一路砍到0.1倍,Terra从1.2倍降到1.0倍,只有Sol未动。AWS的态度显而易见:一个开发平台,不能只绑定一家模型。同一个选择器里,两家前沿模型开始互相压价。模型的评价标准也跟着变了:分数高不再默认能赢,花钱少同样能赢。对开发者来说,选模型以前问的是”这个模型多少钱一百万token”,现在得问”让它把这件事做完,我到底要花多少”。
