美东时间9月3日,OpenAI正式发布了GPT-6 Astra。官方将其定位为“最智能、最对齐”的旗舰模型,核心能力覆盖计算机操作、软件工程、数学科学、专业办公及网络安全等场景。相比OpenAI过往几次更新,Astra的市场反响更为热烈。据Latent Space统计,发布仅9小时,相关内容的浏览量已达3600万,点赞16.4万,成为继Sora之后最受关注的发布。此外,Astra被市场视为OpenAI对Anthropic Fable 5.1及Opus系列进展的强力回应。
从能力披露看,OpenAI给出的核心表述是:“任何你能在电脑上完成的事,Astra都可以替你完成。”这反映出模型竞争的重心正从聊天、写作和代码生成,向电脑操作、长程Agent及端到端任务交付转移。在评测方面,Astra在Terminal-Bench 4.0、OSWorld 2.0、AutomationBench、FrontierMath Tier 4、ARC-AGI-3、ExploitBench等基准测试中均取得高分,其中OSWorld和AutomationBench更值得关注,因为它们侧重衡量模型在真实软件环境和专业工作流中的执行能力。
然而,Astra的发布也伴随着争议。外部评测显示,其在Coding智能体、Computer Use和长程知识工作中表现突出,但在通用智能指数上并未全面超越Claude Fable 5.1;同时,由于Token单价较GPT-5.6 Sol显著上涨,其成本优势高度依赖具体任务和运行框架。安全方面,尽管OpenAI披露Astra的对齐表现改善,但链式思考的可监控性下降,引发安全研究者担忧。
结合券商观点,市场对GPT-6 Astra的影响已形成几项基本共识:第一,模型竞争正从“聊天/写代码”转向端到端执行,Computer Use与长程Agent成为新主线,能力边界从对话框扩展到真实工作流;第二,Astra在Token单价上涨的同时,通过提高完成率、减少返工来降低特定场景任务成本,头部模型并未失去定价权;第三,无论是训练侧的十万卡投入,还是推理侧为Agent和安全监控配置的集群,都强化了算力长期需求逻辑;第四,OpenAI在Coding和Agentic Coding上的表现明显追近Anthropic,行业竞争重回胶着格局。分歧则主要集中在架构对存储需求的影响、市场影响方向以及Benchmark可信度和安全约束上。
**01 GPT-6三层核心变化:训练方式、技术架构、产品能力**
GPT-6 Astra的三大核心变化体现在训练方式、技术架构和产品能力上。
首先是训练方式。基于德州超过10万颗GPU训练,Astra首次大规模引入前代模型GPT-5.6 Sol参与监督,训练后期系统可自主连续运行,这被视为递归自我改进的雏形,模型迭代从单次训练转向更连续的系统工程。
其次是技术架构。可能采用Recurrent Depth或Looped Transformer架构,通过层复用和隐藏空间推理实现“用计算换存储”,减少显式Token消耗,提高复杂任务执行效率。但这导致推理过程更难被外部观察,安全监控和可解释性成本上升。OpenAI为此额外投入约20%的推理算力用于监控,并承认Astra的书面推理比GPT-5.6 Sol更难监控。此外,这种隐空间推理可能增大“蒸馏”难度。
最后是产品能力。OpenAI将Astra定义为“最好的computer use模型”,能填写在线表格、更新CRM客户记录、整理日历、进行在线研究并写入邮件或文档编辑器,也可以分析科学数据、生成图表、创建网站、运行前端QA、安装测试软件等。这些例子比传统跑分更能说明GPT-6的产品方向,即模型开始深入软件界面、工具链和业务流程。
**02 成本再定义:从Token到任务能力**
GPT-6的价格策略极具信息量。据OpenAI披露,Astra API标准价格为每百万输入Token 10美元、输出50美元,较GPT-5.6 Sol当前促销价上涨约2.5倍。这表明OpenAI并未用低价抢市场,而是选择把旗舰模型重新放回高价区间。但OpenAI强调的是单任务成本,而非Token成本。
在Terminal-Bench 4.0等评测中,Astra相对5.6 Sol和Fable 5.1,估算API成本分别低9%和63%;在Terminal-Bench Science 0.1中,得分64.6%,高于Claude Fable 5.1的52.6%,且成本低约31%。这说明OpenAI并不试图证明Token更便宜,而是证明它在特定任务里更少绕路、更快完成、更少返工。
对企业客户来说,单Token价格只是成本的一部分。如果模型需要更多轮交互、人工校正或在最后一步失败,便宜Token并不一定带来低成本。反之,如果更贵的模型能一次性完成复杂任务,总成本可能更低。不过,Artificial Analysis指出,Astra在Coding智能体任务上的Token效率较Sol提升约70%,但在通用智能指数中输出Token仅减少约10%,由于单价上涨,单任务成本反而比Sol高75%。这意味着“GPT-6更便宜”不是通用结论,它在Agent框架下更有可能成立,在裸API和通用问答场景中未必。
**03 模型叙事转变起点:从Coding到任务交付**
过去一年,Coding能力是前沿模型竞争的核心。Anthropic正是靠“赌对”Coding方向成为历史上最快达到万亿美元市值/估值的公司之一。此前,OpenAI用GPT-5.6 Sol、Codex追赶,但GPT-6发布后,这个叙事可能发生变化——Coding更像是端到端任务的一部分,而不是终点。
原因很简单,会编程不等于能完成工作。Astra在Codex中可以跨上下文检索前序窗口中的需求、测试结果和工具输出,避免在长时间调试或大型重构中丢失关键细节。Jane Street相关负责人表示,Astra在内部编码基准和交易直觉评估中较GPT-5.6 Sol有明显提升,用于Agentic Coding时生成代码达到生产质量所需迭代更少。
这正是大模型产品形态的变化。过去模型更多是“回答者”,现在头部公司希望它变成“执行者”。Astra可以在指令不完整时补足信息、在关键决策前提问,或在Codex中异步提问同时继续处理不依赖用户回复的部分。这类能力比单次回答准确率更接近企业使用场景,因为真实工作很少是一次性、结构化、边界清晰的。
**04 对中国大模型公司的叙事影响:差距在任务执行层**
GPT-6发布前,中国头部模型刚完成一轮追赶,在普通对话、中文场景、部分Coding能力和低成本调用上已具备较强竞争力。但GPT-6 Astra把前沿差距重新拉回执行层,集中在长程任务、软件操作、终端任务和专业流程上。这恰好是国内模型公司仍需补齐的地方。
据中金公司评价,部分国产小参数模型除长程任务外,大部分日常任务已可较好运转。国产模型在多数日常任务上不弱,但在长程Agent、Computer Use和闭环执行上仍有短板,而GPT-6主打的正是这些能力。一些观点认为,短期看中国模型公司和OpenAI的差距可能在执行层重新扩大,而非所有维度同时扩大。但这种差距并非无法追赶,Recurrent Depth和Latent Reasoning并非完全封闭路线,国内外已有相关论文和开源实践;Astra的提升也不完全来自更大的知识库,而与后训练、强化学习、工具调用和工程系统相关。
9月4日收盘,智谱股价跌2.98%,MiniMax涨1.8%,两家公司股价并未大幅波动,显示出市场对国产模型追赶能力的信心。
