OpenAI的RSI“焚诀”来了!在黄仁勋呼吁开放权重后,OpenAI也终于变得开放起来。最新技术报告透露,GPT-5.6开始“左脚踩右脚”,自己动手改造运行系统。它已进入生产环境,负责分析流量、调整路由,甚至亲自重写底层Kernel和优化推测解码。结果,端到端服务成本降低20%,Token生成效率提升15%以上。值得一提的是,报告作者中还有Triton之父Philippe Tillet。从教人类写Kernel到让模型改Kernel,这种“递归自进化”的味道越来越浓了。
RSI(递归式自我改进),简单说就是AI进入一个“改进AI”的闭环。GPT-5.6虽然还不能完全训练下一代模型,但它已经开始优化自己的运行环境,从被动的工具变成了主动的工程师。具体来说,它参与了四项关键工作:
第一,分析OpenAI真实的生产流量,寻找节点间的负载不均并测试新的路由策略。
第二,重写和优化生产Kernel,深入模型的forward pass,通过Codex改写生产环境中的Triton和Gluon Kernel。
第三,优化自己的推测解码系统,设计draft model方案,自动运行数百次实验。
第四,针对不同任务,自动搜索batching、sharding和KV Cache管理的更优组合。
这四件事串联起来,形成了一个真实的工程反馈回路:观察生产系统、寻找瓶颈、提出方案、运行实验、处理故障,再把有效改进部署回承载自己运行的系统。虽然距离完全的“AI训练AI”还有距离,但这已经是RSI的雏形。
当然,RSI尚未完全成熟,人类依然在“回路”中把关。人类负责设定优化目标、工具权限、评测指标以及代码能否进入生产环境。此外,模型外部的Agent循环仍有大量重复开销。为此,OpenAI搭建了一层由Rust编写的Agent Harness,连接模型、工具和用户环境,专门减少Agent循环里的重复工作。这里的关键优化有两点:一是延迟发现,模型只在需要时才展示工具,而不是一开始就把所有说明书塞进上下文;二是只追加、不回写,让Prompt缓存一直有效,只处理本轮新增的内容。
除了让GPT-5.6参与优化自身,报告还透露了另一个现象:在GPT-5.6内部测试期间,每名活跃研究人员的日均输出Token,超过了GPT-5.5时期峰值的两倍。过去半年,OpenAI用于内部编程推理的研究算力占比增长了100倍,内部Agent Token用量也增长了约22倍。这组数字说明了一个趋势:AI一旦变得更便宜、更好用,它的用量不仅不会减少,反而会不断增加。
