7月30日凌晨,OpenAI接连发布四项重磅消息,涵盖了模型自我优化、核心人才回流、硬件研发突破以及用户规模创新高。随着模型性能、核心人才及用户体量全线突破,OpenAI揭晓了其最强模型GPT-5.6系列在自我优化方面的技术细节。
**01. GPT-5.6 Sol登场,Token生成效率提升超15%**
当前,模型服务需求的增长速度已超越算力扩容速度,因此提升效率成为系统设计的核心目标。OpenAI的首要任务是在保持智能性、响应速度和可靠性的前提下,利用相同的硬件提供更多服务。这需要对系统进行全方位优化,涵盖流量路由、任务调度、GPU内核、缓存机制以及模型代码实现。
本月初发布的GPT-5.6系列包含三个版本:旗舰版GPT-5.6 Sol在编程智能体评测中优于Claude Fable 5,调用成本约为其三分之二;均衡版Terra对标GPT-5.5,费用仅为前者的二分之一;快速版Luna则是系列中响应最快、性价比最高的模型,定价较Sol降低八成。
为实现上述效果,OpenAI从两大技术栈入手:一是推理服务体系,通过优化负载均衡、推测解码、缓存机制和内核算子,提升有效输出量;二是智能体调度基座,针对性优化上下文膨胀、工具调用逻辑和冗余计算。
GPT-5.6 Sol已展现出强大的自主优化能力。
**负载均衡与内核优化:**
在全球层面,GPT-5.6 Sol根据地理位置、算力容量和芯片类型分发请求;在集群内部,依据负载压力和上下文长度分配任务;在实例内部,则高效拆分任务至加速芯片和计算核心。搭载于Codex的GPT-5.6 Sol能分析线上流量,定位算力失衡问题并迭代调度规则。同时,它还能自主重写并优化负责核心数学运算的GPU代码,利用训练好的能力在Triton和Gluon语言中编写优化程序。这一举措将整体推理服务成本降低了20%。
**推测解码与缓存优化:**
在推测解码方面,GPT-5.6 Sol迭代了配套预测模型,开展了数百组架构实验,并实现了自动化的训练任务监控与异常处理,使Token生成效率提升15%以上。
在缓存机制上,GPT-5.6 Sol利用Codex解析真实负载,生成并比对各类配置方案,对推理引擎和参数进行精细化超参优化。同时,构建了一个可持续运转的闭环反馈体系,不断采集数据、定位短板并验证优化效果。
**02. 三大手段优化智能体调度,削减冗余计算**
ChatGPT Work和Codex通过连续的模型调用及工具链路完成复杂任务。在单次交互中,从指令下达到结果返回,往往涉及查看源代码、检索记录、编辑文件等多个步骤,每次调用都会产生耗时与算力消耗。研究人员认为,提升性能不能仅靠提速模型本身,还需削减全系统范围内的重复性计算与冗余操作。
**1. 避免不必要冗余信息**
智能体容易因调用过多工具或获取过多历史数据而导致上下文膨胀。为此,智能体调度框架采用延迟加载机制,仅在被实际调用时才载入组件、MCP工具和插件。同时,系统默认将工具返回输出限制在10000 Token以内,防止无节制占用上下文。
**2. 保留提示词缓存的确切前缀**
在多轮交互中,相同的指令和历史数据会被重复推送计算。为稳定保留前缀缓存,框架采用仅追加写入模式,新增内容接续在上下文末尾,不修改前文。同时,以固定有序的格式推送工具信息,确保运行时配置参数动态生效。
**03. ARC-AGI-3表现提升,关键在于API配置**
GPT-5.6 Sol虽攻克了数学难题,但在二维解谜评测基准ARC-AGI-3上得分仅为7.8%,远低于上一代GPT-5.5的0.4%。ARC-AGI-3使用极简框架,未挂载任何工具,旨在客观暴露模型短板。
研究发现,这并非模型缺陷,而是调度框架配置问题。
* **问题一:** 原框架在每步操作后直接清空私有推理过程,导致模型每次操作都要从头分析规则,无法留存推演思路。
* **问题二:** 采用滚动截断窗口机制,随着历史累积,早期记录会被自动剔除,导致模型无法调取过往操作记录和思考链路。
**解决方案:**
OpenAI基于自家Responses API重构了调度框架。该API能便捷管控上下文链路,只需传入上一轮应答ID,即可在多轮交互中完整保留推理过程。
开启推理内容持久留存功能后,GPT-5.6 Sol每步操作前的推演耗时显著下降,且能利用过往思考记录习得规律,提升策略连贯性。同时,利用API自带的上下文压缩功能替换滚动截断机制,模型能在更长的解谜流程中留存经验。
在ARC-3公开测试集上,GPT-5.6 Sol的得分从7.8%提升至13.3%。OpenAI建议开发者采用类似设置,以模拟ChatGPT和Codex的实际表现。
**04. 结语:大模型竞争迈入全栈工程化时代**
GPT-5.6的各项效率提升,源于OpenAI在算法研究、模型推理、智能体调度等整套技术体系上的长期迭代与累积。OpenAI预计后续优化迭代速度将持续加快,未来将深耕算子内核优化并升级底层架构。这表明AI行业已进入全栈工程化优化的竞赛阶段,谁能提供低成本、高效率、可规模化的产业落地能力,谁就能降低行业门槛,促进大模型规模化应用。
