GPT-5.6再次刷新人工智能的智能上限。OpenAI今日发布了《GPT-5.6构建者指南》,交出了一份令人瞩目的成绩单。在ARC-AGI-3基准测试中,GPT-5.6 Sol的得分从13.3%跃升至38.3%,且输出Token数量暴减六倍。另一边,“超小杯”Luna的表现同样惊艳:在BrowseComp测试中,它以84.04%的准确率逼近GPT-5.5的84.36%,同时将成本从33.27美元压缩至1.33美元。此外,官方还附带了详细的“保姆级”教程,指导初创团队如何以更低成本部署GPT-5.6。
01、GPT-5.6实力暴涨,Token输出削减六倍
仅仅一个月的时间,GPT-5.6 Sol内部悄然完成了进化。ARC-AGI-3一直是顶尖人工智能尚未攻克50%分值的难关,测试规则看似简单——将AI投入未见过的2D小游戏,不给说明书,让其自主摸索规则。结果显示,GPT-5.6 Sol在官方榜单上获得了7.8%的成绩,而上一代GPT-5.5仅有0.4%。若对比上一代,同一模型在ARC-AGI-2上曾拿到92.5%的高分,并通关了《宝可梦·火红》。
针对这一显著提升,OpenAI研究员Ilan Bigio和Ted Sanders进行了深度排查,发现问题出在“harness”机制上。ARC官方的通用harness存在两个问题:每走一步就丢弃模型的私有推理过程;上下文一旦填满,就从最老的开始截断。这意味着模型每走一步,记忆就会被清空,随后重新开始。
团队将harness替换为Responses API,并开启了“推理保留”和“压缩”两个开关,重新运行公开题集。结果令人惊喜:GPT-5.6 Sol的得分从13.3%飙升至38.3%,同时输出Token减少了六倍。
02、“超小杯”Luna成本大幅降低
在《构建者指南》中,最引人注目的一组对比来自BrowseComp。这是OpenAI自建的一个专测“全网冷门事实”的榜单。三个月前,GPT-5.5开启Extra High档位,以84.36%的成绩拿下榜首,总花费33.27美元。如今,GPT-5.6家族中体积最小、成本最低的Luna,同样使用Extra High档位,以84.04%的成绩紧随其后,仅花费1.33美元。
虽然成绩仅相差0.32%,但成本却削减了整整25倍。这充分说明,OpenAI希望传达的理念是:三个月前只有旗舰GPT能胜任的任务,现在即使是最低档的小模型Luna也能八九不离十地完成。
03、官方指南:三种降低成本部署方式
此外,OpenAI在指南中还提供了另外三种降低部署成本的方法:
第一种,是**程序化工具调用**。以前的Agent像事必躬亲的老板,每收到一份材料都要亲自过目,调一次工具就得来回一趟(调100次工具需100次往返)。现在模型可以直接编写JavaScript代码,在沙箱中批量调用工具、筛选和汇总,最后只将结果呈现给主模型。金融研究公司Rogo的实测显示,在质量持平的前提下,输入Token减少了21%。
第二种,是**原生多智能体**。主模型充当工头,将任务拆解分发给一组子模型并行处理,最后回收汇总。ChatGPT中的Ultra档位正是采用此模式,默认四个agent同时开工。产品公司Obvious的联合创始人Jon Bell表示,他们一次性扔进六份需求,实现了边写边搭边讨论,全程运行稳定。
第三种,是**提示词缓存**。缓存有效期延长至至少30分钟,并支持自定义断点。AI公司Ploy的工程师在一段29000 token的共享提示词中加入了断点和工作区专属键,结果未命中缓存的输入减少了28%。
04、速度狂飙:每秒750个Token,提速14倍
同日,OpenAI还上线了Ultrafast模式预览版。GPT-5.6 Sol最高支持14倍速,每秒可生成750个Token。这一突破撕掉了一条沿用两年的潜规则——想要实现实时响应,必须退而求其次换用小模型。如今,Ultrafast模式跑的依然是Sol,其智能水平丝毫不减。
Cerebras公司进行了一组对照测试,题目选自Humanity’s Last Exam——这是一套通常只有博士才能答对的2500道题。Sol Ultrafast跑完全部题目耗时11小时11分,而Claude Fable 5跑同样的题目耗时78小时27分,耗时接近7倍。准确率相当,速度却快了近7倍。
提分、降本、提速,短短一个月,GPT-5.6完成了真正意义上的全方位进化。
