这回,AI终于开始接管自己的基础设施了。GPT-5.6上线伊始,就主动对自己赖以生存的运行环境进行了大刀阔斧的“翻修”。它自主重写并优化了OpenAI线上运行模型的生产级GPU内核。
7月29日,OpenAI公布了一组亮眼的数据:得益于GPT-5.6 Sol对内核的优化,对外服务成本降低了20%;推测解码的改进,使模型生成Token的效率提升了15%以上。这并非针对演示环境的Demo,而是真正运行在承载着数十亿级用户请求的生产系统上。
OpenAI总裁Greg Brockman指出,正是这种强大的自主能力,让GPT-5.6 Sol变得既高效又经济。在内部,OpenAI已形成一套成熟的打法。Codex项目负责人Tibo将其概括为两步:首先训练出强大的模型,其次利用该模型反哺基础设施、推理栈和内核,让一切变得更好。
这20%的成本节省究竟从何而来?GPT-5.6 Sol接入生产推理栈后,直击核心领域:GPU内核、负载均衡、推测解码以及KV缓存。它在智能体框架、API编排和模型推理三个层面进行优化,旨在减少网络传输、降低CPU开销、增加GPU产出。
简单来说,负载均衡就是避免某些显卡过载而其他显卡闲置;KV缓存则是存储中间结果以避免重复计算;推测解码则是利用小模型先“抢答”,大模型负责“验收”,答对了就能一次性输出多个字符,而非逐字生成。
在具体执行上,GPT-5.6 Sol做了很多精细的工作。它分析真实生产流量,优化路由策略;自主重写了基于Triton和Gluon语言的生产内核,寻找可并行和可跳过的计算任务;在推测解码环节,针对配套的draft模型设计了数百次架构实验,并能自主启动并监控训练流程,自动处理硬件故障和训练不稳定问题。
实际上,早在7月9日GPT-5.6发布时,OpenAI就已透露端倪。内部研究员已开始利用它排查故障、优化训练系统及解释结果。OpenAI还专门设立了KernelGen、NanoGPT、RSI Index等评测项目来衡量其“自我改进”能力。此次降本20%,标志着这些布局首次转化为实打实的经济效益。
比节省成本更重要的,是这一闭环的跑通。从分析流量、提出优化方案、编写代码、运行实验、处理故障,再到用生产数据验证结果,模型几乎参与了每一个环节。在推测解码任务中,过去需要工程师凭经验手动尝试数月的配置空间,现在模型能将“测量-优化-验证”的循环压缩到极致,快速迭代。
更关键的是,这个闭环具备自我增强的飞轮效应。模型越强,推理栈越优化,同样的硬件就能服务更多请求。OpenAI内部数据佐证了这一趋势:GPT-5.6内测阶段,每位活跃研究员的日均Token输出量是GPT-5.5时代的两倍以上;过去半年,内部用于代码推理的研究算力占比增长了100倍,智能体Token用量约增长了22倍。
这是否意味着“AI开始自我进化”?目前来看,还不算。GPT-5.6 Sol优化的是运行自己的软件和配置,并未改动主体权重。如果把模型智能比作“货物”,内核和配置就是“卡车和路线”。它优化的是运输,而非货物本身。因此,这更准确地说是一种“自优化飞轮”的早期形态,而非递归自我改进。
此外,官方虽称部分操作为“自主”,但这并不代表完全无人干预。目标设定、系统接入、工具验证和部署上线等环节仍由工程团队把控。例如,模型编写的内核必须经过FpSan等工具的结构和数据流检查,自动验证体系的效率才是关键瓶颈。OpenAI一直在为递归自我改进(RSI)铺路,GPT-5.3-Codex曾被称为“参与了自己的创造”,此次GPT-5.6 Sol又自主后训练了更小的Luna模型,RSI Index得分显著提升。
竞争的维度正在发生根本性变化。过去比拼的是谁的GPU更多,现在比拼的是谁能从同样一批卡中榨出更多Token。GPT-5.6一口气推出Sol、Terra、Luna三档,主打“同等智力,更少Token”。效率已成为与智能同等重要的筹码。而这一次,帮助OpenAI提升推理效率的,正是模型自己。飞轮已经转动起来。
