今日凌晨,科技圈被一声惊雷惊醒。“世界上最智能、对齐程度最高”的模型——GPT-6 Astra横空出世。前者,无可否认;后者,显然是夸大其词。具体细节稍后详述。更引人注目的是OpenAI总裁格雷格·布罗克曼的高调宣言:AGI时代已经到来。外界第一反应多是嗤之以鼻,认为这是为了缓解IPO压力的炒作。然而,AGI的定义本就模糊,OpenAI或许真的有底气。
01 目前,对AGI的定义主要有三个方向。第一,实用层面。OpenAI将其定义为:高度自主、能在大多数具有经济价值的工作中超越人类的系统。关键词在于“高度自主”和“经济价值”。第二,学术层面。DeepMind提出的“Levels of AGI”框架最为靠谱。它将AGI拆解为性能深度、能力广度和自主性三个维度。简单来说,AGI是一个渐进式的能力谱系,而非达到某个节点后的突变。这也解释了为何同一模型有人觉得已近AGI,有人觉得尚远——尺子不同。第三,科幻层面。即有意识、能交流、自我迭代的机器人。在此层面,GPT-6 Astra显然还差得远。
既然科幻层面不谈,我们来看看技术指标。OpenAI此次给出的成绩单令人咋舌。上下文与生成极限达到105万Token输入、12.8万Token输出。在ARC-AGI-3抽象推理中取得99.9%,击碎了“大模型只是概率填空”的质疑。FrontierMath Tier 4数学测试达到98%,甚至协助人类解决了未决问题。在网络安全ExploitBench测试中更是满分,自主发现并利用了两个零日漏洞。在OSWorld 2.0计算机自主操作测试中,效率提升47%。与Anthropic的Fable 5.1相比,Astra全面碾压。OpenAI在公告中多次提及“饱和”,意即现有榜单已无法测出上限。更关键的是,Astra展现了一种新行为:将陌生环境压缩成符号化模型,再按规则规划。这意味着AI正从“模式匹配器”向“环境建模器”转变。这才是OpenAI敢称“AGI时代”的底气。从实用层面看来,不能完全否定这句话。
02 GPT-6 Astra在特定的复杂工作流中,确实展现出了极强的实用性。OpenAI公布的数据非常直观:在Agents’ Last Exam上,GPT-6 Astra达到59.3%,GPT-5.6 Sol为53.6%。在OSWorld 2.0上,Astra达到72.6%,GPT-5.6 Sol为65.7%。在ScreenSpot-Pro上,Astra达到92.7%,GPT-5.6 Sol为76.9%。在法律科技公司Legora的真实财务审计测试中,Astra将财务报表处理工作流的效率提升了40%,并且在跨越41份冗长法律文档的交叉比对中,准确找出了所有隐蔽错误。在量化交易机构Jane Street的内部测试中,Astra不仅大幅减少了代码迭代次数,还能在发现指令模糊时主动向人类发送异步提问,并继续处理其他不依赖答复的子任务。简单来说,GPT-6 Astra在特定赛道,真的展现出了超人的生产力。它不再是一种“软件功能”,而是实实在在的数字劳动力。从OpenAI自己定义的实用层面触发,GPT-6 Astra确实实现了自主、能够在具有经济价值的工作中超越人类。称之为AGI不能说完全说错。当然,也不完全对。
距离真正的“实用”,GPT-6 Astra依然存在很明显的缺陷。第一,长期自主性。它确实已经可以自主完成复杂任务,但“完成一个复杂任务”和“连续数天、数周、数月稳定地承担一个复杂岗位”,完全是两码事。让Astra做一次性工作,它可能表现得非常优秀。但是让它长时间面对突发情况、制度调整、数据异常、人际沟通、权限变化、目标变化,并且始终保持正确决策,就很难做到。尽管OSWorld 2.0达到了72.6%,但在面对超过数天的开放式、无明确边界的现实业务时,Astra依然会在多步长尾调用中累积微小误差,最终导致决策偏离目标。第二,成本。虽然OpenAI宣称Astra在同等任务下的API成本比GPT-5.6 Sol和Claude Fable 5.1降低了27%至31%,但在进行上百万Token上下文与上千步多工具连续调用的复杂作业时,单次任务的计算成本依然高达数十美元。对于绝大多数工作而言,这一成本远远差过了人类的薪水,并不划算。第三,安全。OpenAI研究副总裁艾丹·克拉克透露,GPT-6 Astra的训练消耗了超过10万张GPU,引入了“隐式递归/循环深度”计算机制。过去的语言模型依赖显式链式思考显式输出Token,而Astra允许模型在其内部潜在状态中进行深度递归演算,不需要把思考过程全写在屏幕上。这不仅大幅节省了输出Token(最高减少20%),还极大地提升了多步推理的连贯性。但是,对AI思维链的监控也因此变得极其困难。Astra可以在许多防护严密的系统里发现此前未知的安全漏洞,并在无需人工逐步指导的情况下设计漏洞利用方式。OpenAI自己也承认,Astra的安全监管成本极高,甚至达到了威胁级别的“临界危急”阈值。
综上所述,结论是什么?从技术上、产业应用上,Astra确实表现出了OpenAI对AGI定义的特点。只是因为无法胜任长期任务、太贵、不安全等等问题,它并不能大规模落地。既然如此,那它其实就没有那么“实用”,当然还不能称之为AGI。但这并不妨碍AGI时代的到来。
03 按照上面提到的DeepMind框架,AGI是一个过程,而非节点。这其实很符合当下的情况。真正转变不是某个人宣布“AGI已实现”,而很多原本需要人类完成的数字工作,逐渐被交给AI,而且AI真的能长期稳定地完成。过去五年的AI革命,主要是在改造信息生产。GPT-6 Astra确实带来了历史性的变化:AI可以直接作为劳动力使用。只是这个“可以”,目前并非“普遍”而已。比如Astra的公开部署,就是逐步进行中的。首先向一部分组织开放,之后才逐步扩大到Plus、Pro、Business和Enterprise用户,以及API和AWS。包括后续的模型,当然也是如此。所以以上讨论的一切,本身仍然是技术证明阶段,到完整的社会证明仍需要一段时间。这一段时间,或许就是从可以到普遍的过程。这可能才是“AGI时代”的真正含义。不是AI突然拥有了灵魂,而是它终于开始上班了。
