这次,AI真的开始为自己写代码了!GPT-5.6一上线,接到的第一个大活,就是给自己的运行环境来了一次大“翻修”。它自主重写并优化了OpenAI线上那套底层代码,也就是真正负责跑模型的生产GPU内核。
7月29日,OpenAI官方公布了一组数据:GPT-5.6 Sol参与的内核优化,让OpenAI对外的服务成本降低了20%;推测解码的改进,让模型生成token的效率提升了超过15%。这次GPT-5.6 Sol动的不是一个跑在演示环境里的Demo,而是OpenAI正在线上运行、每天承载十亿级用户请求的那套生产系统。用OpenAI总裁Greg Brockman的话说:让GPT-5.6 Sol去提升生产服务效率,正是它又强又便宜的原因之一。而OpenAI内部,早已形成一套完整的打法,Codex掌门人Tibo将其概括为两步:第一步,训出一个足够强的模型;第二步,用这个模型去把一切变得更好,包括运行它自己的基础设施、推理栈和内核。
### 20%的成本降幅是如何实现的?
这20%的服务成本,到底是怎么省出来的?GPT-5.6 Sol通过Codex,接入了OpenAI的生产推理栈,主要针对的是推理栈里最核心的几块:GPU内核、负载均衡、推测解码、KV缓存。
负载均衡,简单来说就是避免某几张显卡过载,而其他显卡却闲置;KV缓存则是把计算过的中间结果存下来重复利用,避免无效计算;推测解码则是让一个小模型先抢答,大模型只负责验收,如果答对了,就能一次性输出多个字符,而不是像往常那样一个字一个字地挤。
再来看GPT-5.6 Sol具体做了什么。它分析真实的生产流量,找出以前被忽略的负载不均,测试新的路由策略;它自主重写了用Triton和Gluon这两种GPU编程语言写成的生产内核,专门寻找那些可以预先计算、可以跳过、可以并行的任务;在推测解码环节,它针对配套的draft模型,设计并运行了数百次架构实验,还自己启动并监控训练流程,遇到硬件故障和训练不稳定时,会主动介入处理。这些环节逐一优化后,最终换来了那两个数字:服务成本降20%,token生成效率涨15%以上。
其实早在7月9日GPT-5.6发布时,OpenAI就已透露端倪。内部研究员已经在用它排查故障、优化训练系统、跑实验、解释结果,还专门给它设了KernelGen、NanoGPT、RSI Index这几项“自我改进”评测。这次降本20%,意味着这些布局,第一次变成账单上实打实的数字。
### 比节省20%更重要的,是一个闭环
真正重要的变化,是一个闭环跑通了。分析流量、提出优化、写出代码、跑完实验、处理故障,再拿生产指标回来验证结果,现在这条回路中的每一环,模型几乎都能参与。
以推测解码为例。这项技术需要配合一个更小的draft模型。GPT-5.6 Sol针对这个draft模型,设计并运行了数百次架构实验,调整尺寸、结构、特性。过去这需要一名稀缺的GPU工程师,凭借经验和直觉,一个配置一个配置地手工尝试,试上几个月。配置空间太大,人根本试不完,只能靠粗糙的经验法则拍脑袋。现在,模型能把这个“测量、优化、验证”的循环压到极短。团队能探索更多想法,更快跟上不断变化的负载。
更关键的是,这个闭环还会自己滚起来。模型越强,越能把推理栈优化得越省;越省,同样的硬件就能服务越多请求;服务的人越多,OpenAI就能把更强的模型铺给更多人用。OpenAI的内部数据佐证了这一点:GPT-5.6内测阶段,每位活跃研究员的日均token输出,是GPT-5.5时代的最高值的两倍以上;过去半年,用于内部代码推理的研究算力占比增长了100倍,内部智能体token用量增长了约22倍。省下的每一分算力,最后都变成了让更多人能用上的智能。
### AI开始自进化了吗?
那么,这到底算不算“AI开始自我进化”?至少现在,还不算。GPT-5.6 Sol优化的,是运行自己的软件、服务配置,还有辅助的draft模型。没有证据表明它在线改动了自己的主体权重,也没有证据表明它能脱离工程团队,自己升级出下一代模型。如果把权重比作模型智能的“货物”,内核和配置就是运货的卡车和路线。它这次优化的是运输,还没碰到货物。因此,更准确地说这是“自优化飞轮”的早期形态,不是递归自我改进。
还有一点要注意。官方这次用了“自主”来形容内核重写和部分实验,但不等于“完全无人参与”。目标由谁定、接进哪套生产系统、拿什么工具验证、怎么部署上线,这些环节都还牢牢攥在OpenAI的工程体系手里。比如验证环节:模型写完的生产内核,要经过审核才能上线。OpenAI专门使用了名为FpSan(浮点消毒器)的开源工具,检查这些内核的结构和数据流是否正确。自动验证体系跟不跟得上,才是“敢让AI写底层代码”的真正瓶颈。
往前看,OpenAI也一直在为RSI(Recursive Self-Improvement,递归式自我改进)铺路。早在2月,GPT-5.3-Codex就被官方形容为“参与了自己的创造”;这一次,GPT-5.6 Sol又自主后训练了更小的Luna;在内部专门衡量自我改进能力的RSI Index上,它比GPT-5.5高出16.2分。老对手Anthropic的一个判断更激进:人类如今只对个位数百分比的方向性决策负责。其联创Jack Clark更是称2028年底前出现完整的递归自我改进,概率超过60%。飞轮是转起来了,但真正的“AI自己造AI自己”还在路上。
### 竞争轴变了:从谁GPU多到谁榨出更多token
这20%,意味着同样一批卡,OpenAI现在能多接两成的活。它指向一个更大的变化。
过去几年,AI公司比的是谁买得起更多GPU。这套逻辑简单粗暴,也砸钱如流水。但在一个算力永远不够、需求涨得比产能快的世界里,另一个关键变量已经浮出水面:同样一批卡,谁能榨出更多token?推理效率,正在变成和芯片数量同样重要的筹码。
OpenAI自己已经用产品线投了票。GPT-5.6这次一口气分成Sol、Terra、Luna三档,就是要主打一个卖点:同等智力,更少token。效率,被摆到了和智能同样重要的位置。而这一次,帮OpenAI的模型提升推理效率的,正是模型自己。模型越强,越能优化推理栈;推理栈越高效,同样硬件就能服务更多token;成本一降,更强的模型又能铺给更多人用。这个飞轮,OpenAI已经让它转起来了。
