8 月 14 日凌晨,OpenAI 与 AI 芯片厂商 Cerebras 联合发布了旗舰模型 GPT-5.6 Sol 的全新服务层级「超高速模式」(Ultrafast Mode)。在该模式下,GPT-5.6 Sol 的输出速度最高可达 750 tokens/s,相比标准模式的 53 tokens/s,速度提升最高达 14 倍,且质量保持不变。横向对比,其速度比 Claude 的 Fable 5 快 11 倍,比 Opus 4.8 的 Fast 模式快 5 倍。目前该功能已在 OpenAI API 上线,并面向部分用户开放有限预览。
Cerebras 博客展示了在“人类最后的考试”(HLE)基准测试中的对比。HLE 包含 2500 道极具挑战性的题目,通常需要化学、经济学和文学等领域的博士才能解答。在 Ultrafast 模式下,GPT-5.6 Sol 仅用 11 小时 11 分钟就完成了所有题目,而 Claude 的 Fable 5 则需要 78 小时 27 分钟。这意味着在保持相近准确率的前提下,GPT 的速度几乎是竞品的 7 倍。
随着模型能力的提升,快速推理的应用范围也在扩大。GPT-5.6 Sol 是 OpenAI 在法律文书、金融模型和工程报告领域的表现最出色的模型。在 GDP-Val 基准测试中,Ultrafast 模式实现了 5.6 倍的端到端速度提升,且质量未受影响,充分展现了更快的推理速度如何加速经济价值工作。这种速度让智能体可以部署在关键任务路径上,应用场景包括事件响应与可靠性、金融研究与安全、客户支持、商务互动以及实时研究实验。
在 OpenAI 内部,工程师利用 Ultrafast 模式进行事件响应。当警报触发时,AI 能在系统和证据动态变化的情况下,快速分析日志、跟踪信息和对话,帮助构建事件图景并协助准备修复方案,从而缩短了从观察到行动的延迟。在研究方面,团队利用该模式快速检索知识库和数据,支持在工作日内进行多次实验迭代,取代了过去夜间启动实验、次日查看结果的模式。
Ultrafast 模式的核心突破在于打破了传统 GPU 集群在解码阶段的内存带宽瓶颈,这得益于 Cerebras 独特的晶圆级硬件架构。Cerebras 的芯片采用整片晶圆设计,单片集成海量计算核心与超高速互联网络。相比之下,传统 GPU 在生成 Token 时,受限于显存带宽,需要频繁在片外 HBM 和计算核心间搬运权重,且多卡并行存在通信延迟。Cerebras 最新的 WSE-3 芯片集成 4 万亿晶体管、125 petaflops 算力和 44 GB 片上 SRAM,使得模型参数常驻片内,消除了等待时间。
面对大模型庞大的参数量,Cerebras 引入了“多晶圆流水线并行”机制,将模型各层分布在不同晶圆上,实现 Token 的无缝传输。对于用户而言,14 倍的速度提升意味着以前需要切换次级模型(如 Luna 和 Terra)的任务现在可以直接使用旗舰模型全速运行。对于涉及多轮工具调用和复杂思考的 Agent 任务,原本耗时数小时的流程可缩短至几分钟。随着社区对 Luna 和 Terra 版本超高速模式的期待,Cerebras 的硬件能力也备受关注。
