同一款模型,官方价格仅降了20%,你的账单却减少了八成。8月24日,OpenAI与AWS联合发布了一项测试结果:在Terminal-Bench 2.1基准测试中,GPT-5.6 Terra模型在Kiro平台上的单任务成本降低了约82%。Kiro是AWS推出的软件开发智能体平台,覆盖IDE、CLI和Web端。GPT-5.6家族的Sol、Terra、Luna三个版本已在Kiro上运行了一个多月。

这82%的成本降幅并非官方降价带来的。Terra最近一次官方调价是在7月30日,幅度仅为20%。尽管单价降幅不大,但账单却能削减八成。这中间省下的六十个百分点究竟从何而来,才是我们需要关注的重点。

GPT-5.6于今年7月登陆Kiro。先是13日,AWS宣布GPT-5.6 Sol、Terra、Luna在Amazon Bedrock正式可用。紧接着第二天,Kiro宣布这三款模型上线IDE、CLI和Web。这是OpenAI模型首次进入Kiro,正值Kiro公开预览一周年。先上架,再干活,一个多月后OpenAI交出了这份答卷:两家联手对Kiro环境和OpenAI模型进行了优化,Terra完成一个成功任务的成本降低了约82%。

01、省下的是走弯路的成本
7月30日的官方调价中,Terra降了20%,但在Kiro的测试中,单任务成本却降了82%。多省下的这六成,究竟从何而来?方向主要集中在:模型产生的token更少了,工具调用的次数更少了,失败后的重试和绕远路的情况更少了。因此,节省的这部分并非来自每次调用的费用,而是原本会白白消耗的费用。

道理很简单:一个AI智能体把任务搞砸一次,账单照记;它中途选错路径、跑偏三轮再回头,这些token也照收。在实际开发中,钱往往就是这样流失的。OpenAI在官方博客中也提到了同样的逻辑:效率来自三个层面——发起请求的智能体框架、中间调度请求的编排系统,以及最后跑在GPU上的模型本身。

省钱还能省在模型分工上。OpenAI还举例说明:编码工作流可以先让Sol把问题想清楚、制定计划,再换Luna去实施那些已经定义好的改动、编写测试、运行评估。同一条流水线上,不同环节匹配不同档位的智能体。

02、模型只占账单一半,换个框架就换个价
Terminal-Bench 2.1这套测试题,并非让模型单独答卷。它将模型置于一个终端环境中,给出一个模糊目标,要求其自己规划路径、调用工具、编写脚本、处理报错并进行反复迭代。因此,跑出来的成绩是「智能体+模型」这个组合的成绩。

榜单中的四行数据最能说明问题:Claude Code配合Fable 5,分数为83.8%,花费552.67美元;Codex配合GPT-5.5,分数为83.1%,花费2059.19美元;Codex配合GPT-5.6 Terra,分数为78.4%,花费421.15美元;Codex配合GPT-5.6 Luna,分数为75.7%,花费241.45美元。前两行分数仅差0.7个百分点,账单却相差近4倍。

同一个模型,装入不同的框架,搭配不同的上下文组织和工具策略,跑出来的价格根本不同。根据Kiro官方数据,Terra在Coding Agent Index上获得了77.4分,仅比Claude Fable 5的77.2分高一点点。它的卖点不在分数,而在于这个分数对应的成本。

Kiro那套”需求驱动”的发力点就在于此,核心玩法只有一句:禁止直接编写代码。它先把用户含糊的目标拆解为正经的需求文档、技术设计和可执行任务清单,再交给模型。这样,模型收到的不再是一句模糊不清的话,而是一份梳理清楚的活儿。熟悉Agent的人立刻就能反应过来,这一步省的正是最昂贵的那部分开销。模型跑偏、返工、推倒重来,烧掉的token往往比正经干活还多。

Kiro还在流程中设置了两个关卡:代码真正修改前,先停下来由人审核;活干完后,再自动运行测试验证。这两道关卡下的每一次返工,都能省下真金白银。

03、Claude在亚马逊的地盘GPT分走了一半
一年前,Kiro还只是个”需求驱动”的IDE,模型选择器是Anthropic的主场。一年后,AWS在自己的开发智能体平台上,一口气摆进了三档OpenAI模型。Sol、Terra、Luna与Claude并列在同一个下拉菜单中,这种画面在一年前很难想象。

虽然GPT-5.6这次是”全家入驻”,但并未”全面开放”。三款模型是渐进式、实验性开放,面向Pro、Pro+、Pro Max和Power用户,区域仅限美国弗吉尼亚北部和欧洲法兰克福,支持跨区域推理。还有一个令人不适应的点是:这批模型在Kiro中走的是隐藏思维链,用户看不到推理步骤,只能看到最终结果。习惯了盯着Agent一步步推理的人,会觉得像把活扔进了一个不透明的盒子。官方说法是,这是预期行为,不影响输出质量。

三档模型在Kiro中明码标价。7月14日刚上线时,同样的任务,Sol扣2.4倍,Terra扣1.2倍,Luna扣0.6倍。7月30日OpenAI降价落地后,第二天Kiro跟进调整:Luna从0.6倍一路砍到0.1倍,Terra从1.2倍降到1.0倍,只有Sol未动。AWS的态度显而易见:一个开发平台,不能只绑定一家模型。同一个选择器里,两家前沿模型开始互相压价。模型的评价标准也跟着变了:分数高不再默认能赢,花钱少同样能赢。对开发者来说,选模型以前问的是”这个模型多少钱一百万token”,现在得问”让它把这件事做完,我到底要花多少”。

最新快讯

2026年08月28日

15:33
8月28日,财政部发布《中华人民共和国地方附加税法(征求意见稿)》公开征求意见。其中提到,地方附加税实行11%-13%的幅度税率。具体适用税率的确定和调整,由省、自治区、直辖市人民政府统筹考虑本地区经济社会发展和促进全国统一大市场建设等情况,在11%-13%的税率幅度内提出,报同级人民代表大会常务委员会决定,并报全国人民代表大会常务委员会和国务院备案。地方附...
15:33
百亿私募大佬冯柳,最新动向曝光。最新披露的数据显示,高毅邻山1号远望基金在2026年二季报中,共出现在7只股票的十大股东名单里,期末参考市值合计73.94亿元。二季度,冯柳新进传音控股、龙佰集团和爱博医疗,加仓安琪酵母,大幅减持海康威视和中伟新材,对瑞丰新材持仓保持不变。新进持仓中,变化最大的是传音控股。传音控股半年报显示,截至二季度末,冯柳管理的高毅邻山1...
15:33
据国家发展改革委,8月28日24时国内成品油调价窗口将开启。本轮成品油调价周期内(8月14日24时——8月28日24时),国际油价震荡运行。8月28日24时起,国内汽、柴油零售限价每吨分别上调375元、360元。全国平均来看,92号汽油、95号汽油和0号柴油每升分别上调0.29元、0.31元、0.31元。按此计算,本轮成品油零售限价上调确认后,私家车单次加满...
15:33
今天A股又有新股申购!鼓狮财经获悉,8月28日,创业板新股电科思仪(301689)申购,发行价格16元/股,发行市盈率为44.81倍,低于63.1倍的行业市盈率。公司是电子测量仪器“国家队”,属于稀缺的硬科技公司,建议积极参与申购。思仪科技专业从事电子测量仪器研发、制造和销售,电子测量仪器被誉为现代工业的"眼睛"和"尺子",能检测电子信号、性能及故障,是电子...
15:33
有的开发商,狠狠地瞄准了深圳。但被要求两年内“抢救”一个项目。拖了16年的转机最近,深圳楼市在悄然间,解决了一块硬骨头。位于深圳市罗湖区的布心花园,迎来新的进展。7月底中交城市投资发展(广东)有限公司正式成为罗湖区东湖街道布心花园一、二、四区城市更新单元纾困盘活前期服务公司。中标要求相当严格——服务合同周期2年,最多延期1年;3个月内须完成全体居民意愿摸底;...
15:14
随着国产算力加速迈向规模商用,如何跨越从“适配验证”到“真实生产”的关键鸿沟,已成为行业亟待破解的难题。近期,商汤大装置携手智象未来,以视频生成业务为突破口,成功打通了从国产算力适配到规模化落地的全链路。对于以图像和视频生成模型为核心的AI企业来说,国产化绝非简单的GPU替换。尤其是视频生成模型,因其参数规模庞大、推理链路复杂、计算密集度高,从底层算力、推理...
15:14
北京时间8月27日凌晨,英伟达交出了一份近乎完美的季度财报。截至7月26日的2027财年第二季度,公司营收高达962亿美元,同比增长106%;其中数据中心业务收入约890亿美元,同比增长117%。公司给出的下一季度营收指引为1080亿美元,再次超出市场预期。英伟达首席财务官科莱特·克雷斯还描绘了一幅更为激进的中期蓝图,预计2028财年营收将增长约70%。她同...
15:14
据鼓狮财经8月28日报道,国内商品期货市场今日呈现大面积收涨态势。其中,碳酸锂、苹果、钯涨幅居前,均超过4%;原油、沪银、纯碱紧随其后,涨幅逾3%;PVC、铂、焦煤、沥青涨势超2%;BR橡胶、PTA、焦炭、豆油、生猪、塑料、棕榈油涨幅超1%。跌幅方面,燃料油和集运欧线跌幅超过1%。
14:57
即将召开的杰克逊霍尔全球央行年会,将是沃什修复美联储政策沟通信誉裂痕的关键时刻。7月FOMC会议留下了一个巨大的信誉缺口:沃什弱化了传统的前瞻指引,认可市场自发收紧金融条件的效果,却未明确界定美联储的政策边界。市场目前处于“摸着石头过河”的状态,导致大类资产定价出现严重分歧。因此,本次杰克逊霍尔年会不仅是为9月利率决议预热,更是沃什修正前期沟通偏差、重塑美联...
14:57
近日,针对标普国际信用评级公司维持中国主权信用评级“A+”及展望“稳定”一事,财政部相关负责人接受了记者采访。 记者提问称,标普于8月28日发布报告,决定维持中国主权信用评级“A+”、展望“稳定”。对此,财政部有何看法? 财政部对此表示欢迎。这一评级结果充分肯定了中国宏观经济的韧性、财政运行的稳健性以及风险防控的有效性,也体现了国际市场对中国高质量发展前景的...