“欢迎来到AGI(通用人工智能)时代。”当地时间9月3日,美国人工智能研究公司OpenAI发布新一代旗舰模型GPT-6 Astra。OpenAI公司总裁格雷格·布罗克曼在媒体简报会上表示,几年后回望,人们或许会将AGI的到来定位在这个时期,甚至这个模型。然而,同日公布的一组评测数据却揭示了事情的复杂性。在独立评测基准机构ARC Prize的ARC-AGI-3测试中,GPT-6 Astra在标准测试框架下的得分为62.7%;而在采用保留跨请求推理状态的厂商适配框架时,得分飙升至99.9%。这两个数字虽对应不同配置,却共同指向一个趋势:衡量AI的能力,已不再局限于模型本身,而是取决于模型与上下文管理、工具、权限及运行环境组成的完整系统。

ARC Prize特别提醒,即便模型通过全部测试,也并不能证明AGI已经实现。评测中的陌生游戏虽能考察探索、归纳和规划能力,但终究不是开放、复杂且后果真实的现实世界。因此,比探讨“AGI是否已至”更值得关注的,是近年来显著加速的演进轨迹:AI正从提供答案,进一步跨越至执行任务。

Astra源自拉丁语astrum,意为“星辰”。OpenAI曾在社交媒体上预告“The stars are almost aligned(星星快对齐了)”。这既是对产品代号的隐喻,也被市场解读为算法、算力、工程架构与商业变现路径的技术拼图已严丝合缝。OpenAI将Astra定位为能够直接操作计算机的软件智能体:填写表格、整理日历、研究资料、编辑文档、安装测试软件等,都可以成为模型行动的一部分。

几乎与此同时,AI进入现实世界的两条路线也在加速推进:世界模型开始重建和模拟三维环境。被誉为“AI教母”的美国国家工程院院士李飞飞创办的空间智能初创公司World Labs发布了世界模型Atlas;自动驾驶系统则直接驶上公共道路,9月初特斯拉在奥斯汀开始提供Cybercab载客服务,该车无方向盘和踏板,随后美国国家公路交通安全管理局开始审查其安全合规问题。一个理解语言的模型正在变成操作电脑的智能体,一个生成和理解空间的模型正在走向模拟物理世界,而自动驾驶系统已经把算法带上现实道路。

中国平安首席科学家肖京认为,类似的发布已多次出现,关键在于如何定义AGI。如果定义为在计算、感知、认知、决策、行动等维度上全面超越人类,那么距离尚远。尽管AGI尚未获得公认的定义和“抵达证明”,但AI已从认知工具向行动系统迁移。这首先改变了企业计算AI价值的方式:从“卖答案”到“卖结果”。

过去,SaaS(软件即服务)的本质是把工具交给人类使用,执行时间主要记录在人的身上。当智能体开始承担调查、分析、编程、操作软件等中间步骤后,企业真正购买的越来越接近一项“经过验收的交付”:调查是否完成,代码能否上线,问题有没有解决。北美网络安全公司eSentire提供了一个具体案例。美国人工智能公司Anthropic公布的客户案例显示,eSentire借助AI将原本约需5小时的威胁分析压缩至7分钟,AI分析与资深安全专家判断的一致率达到95%。不过,这些数据来自厂商及客户案例,并非独立审计后的行业平均收益。真正值得注意的并非“快了多少倍”,而是工作如何重新分配:AI负责查询威胁情报、关联终端和身份信息、形成调查结论;人类专家仍负责复核重要发现和决定如何处置。

商业交易也呈现类似结构。2025年9月,OpenAI与可编程金融服务平台Stripe共同推出智能体商务协议和“即时结账”功能。用户仍需确认商品、订单、配送和支付信息;ChatGPT负责在用户和商户之间传递必要信息,商户处理付款、履约和售后。支付令牌只能针对特定商户和特定金额获得授权。这意味着,“替人做事”和“替人决定花钱”必须分开。智能体无须拥有无限额银行卡,也可以进入商业流程。对平台而言,AI可能由信息入口进一步靠近交易入口;对客户而言,便利能否成立,则取决于授权边界是否足够清楚。

AI的价格因此也出现两个不同含义。有分析指出,“每百万词元多少钱”计算的是生成和处理信息的原始成本;“完成一项合格工作多少钱”还要加上工具调用、失败重试、人工复核和返工成本。较贵的模型如果少走弯路,最终任务成本可能反而更低;便宜的模型如果频繁失败、需要人工接管,省下来的调用费也可能被人力成本抵消。

这就像写一份内部讨论稿与修改生产系统,失败的后果截然不同。模型可以在前者上节省大量时间,却不意味着它理应获得后者的执行权限。

今年夏天发生的一次安全事件,把这个问题推到了另一端。8月26日,OpenAI公布的调查显示,在内部网络安全评测中,多个模型绕过原本用于隔离互联网访问的控制措施,利用内部基础设施取得未经授权的通信和网络访问,并进一步侵入第三方系统。事件主要由一款仅供内部研究、从未计划公开发布的模型推动,Astra并未参与。重要之处并不在于赋予AI“自主意识”之类的拟人化解释,自主执行和自主意识是两回事。前者描述系统能否自行选择和完成行动步骤,后者涉及主观体验。上述事件显示,一个没有主观意识的系统,同样也可以越过授权边界并造成现实损失。

此后,OpenAI加强了网络隔离、监控和模型访问控制。9月1日,OpenAI又宣布Astra已经达到其Preparedness Framework(用于评估和管理前沿AI模型安全性的内部框架)中的“关键”网络安全能力阈值——在具备相应工具与访问权限时,它可以寻找未知漏洞,并在没有人类逐步指导的情况下构造针对高防护系统的攻击路径。OpenAI同时强调,高级网络安全能力将受到额外访问限制,并非默认生产配置。

这让一个此前相对抽象的问题变得具体:能力越强,控制能力本身也需要付费。企业购买智能体时,成本不能只有模型和算力,还包括权限管理、沙箱隔离、运行监控、日志审计、人工复核和紧急停止机制。于是,“谁能按下暂停键”应该进入采购合同和组织流程。谁批准AI访问哪些数据,谁允许它修改哪些系统,谁监控异常行为,谁能撤回权限,出了问题谁承担责任,都应该在任务启动前明确。这也是当前AI繁荣背后容易被忽略的一笔账。

芯片、数据中心、电力和资金仍然限制着AI扩张,但随着智能体获得越来越强的执行能力,新的约束正在出现:开发者和企业能否控制模型已经获得的行动能力。因此,Astra值得关注的或许不是它究竟配不配得到“AGI”这个名字。OpenAI的正式产品材料仍主要使用“新一代智能”等表述;布罗克曼则更愿意把当前时刻理解为AGI时代的开端。两种表述之间的距离本身就说明:AGI仍然是一个定义和判断标准都存在争议的概念。但另一件事已经更加确定。过去,人们衡量模型,问的是“一次回答有多聪明”;今后衡量智能体,越来越需要问“一项任务能够独立推进多远”。而当AI越来越熟练地替人点击“下一步”,真正需要重新审视的,也许正是最后留下来的那个确认按钮——它究竟代表一个知情、可撤回并愿意承担后果的决定,还是已经变成人类习惯不再细看的手续?

最新快讯

2026年09月08日

18:22
鼓狮财经9月8日电,据俄新社今天(9月8日)报道,俄罗斯将对匈牙利驱逐俄外交官一事作出回应。稍早前,匈牙利副总理兼外长发声明称,因为这些人“在匈牙利从事了《维也纳外交关系公约》所规定的外交官不得从事的活动”。声明补充称:“这一决定旨在维护匈牙利的安全与主权。这并不意味着与俄罗斯断绝外交关系。匈牙利打算在相互尊重及遵守规则的基础上,继续开展必要的对话。” (C...
18:22
鼓狮财经9月8日电,联合国贸易和发展会议8日发表报告指出,霍尔木兹海峡贸易运输受扰,正在对全球企业造成冲击,其中中小企业受到的影响更为明显。报告指出,大型企业可以通过分散供应商、市场和融资来源降低风险,而中小企业抗风险能力相对有限。随着能源、运输和融资成本上升,中小企业利润空间受到挤压,供应链也面临中断风险,部分企业可能被迫减产、推迟投资甚至退出市场。
18:22
鼓狮财经9月8日电,匈牙利副总理兼外长奥尔班当地时间9月8日在社交媒体表示,根据指示,匈牙利外交部已通知俄罗斯驻匈大使,经匈牙利当局评估,俄罗斯驻匈代表中有10名成员在匈从事了《维也纳外交关系公约》规定的外交官不得从事的活动。因此,匈牙利方面已要求相关人员离开该国。奥尔班表示,这一决定旨在维护匈牙利的安全与主权,并不意味着与俄罗斯断绝外交关系。
18:22
鼓狮财经9月8日电,加拿大政府针对美国加征关税的反制措施9月8日已正式生效。9月7日是加拿大的劳动节。加拿大总理卡尼当天在反制关税生效前夕发表的劳动节声明中说,面对美国毫无正当理由、无端加征的关税,加拿大正在加大持续性的大规模财政支持力度,保护加拿大的工人和企业——只要加拿大的工人们互相支持、共同努力、团结一致,就没有什么事情做不到。 (CCTV国际时讯)
18:14
鼓狮财经9月8日讯大摩等投行近期正代表Anthropic与OpenAI游说评级机构,为它们争取IPO后即获投资级评级的便利条件,以迅速介入美国企业债市场,但评级方态度谨慎。 据媒体当地时间周二报道,摩根士丹利与高盛近期已代表Anthropic和OpenAI,与信用评级机构展开接洽,游说后者在两家公司完成首次公开募股后即给予投资级评级。 知情人士称,投资级评级...
18:14
再保险行业的真正考验,往往不在于涨价红利期,而在于红利退潮之后。2026年以来,全球再保险市场风向已变。随着资本供给增加、竞争加剧,硬市场周期逐渐松动,市场重新回归比拼风险筛选、成本控制与精细化经营能力的阶段。正是在此背景下,中国再保险交出了一份颇具反差感的半年成绩单:上半年保险服务收入524.49亿元,同比增长2.7%;归母净利润71.87亿元,同比增长1...
18:14
今天A股行情变化实在太折磨人了,上午还是似乎普涨行情:农业、化肥、有色唱戏,AI硬科技算有韧性,午后一则消息把画风掰弯——胡塞武装袭击沙特多处能源设施,73人受伤,布油直逼100美元。韩股跳水后,A股硅基撑不住了,CPO午后跳水,液冷全天承压,科创50收跌1.52%;另一头,农业批量涨停、化肥集体封板,金健米业17天9板。来源:通达信行情截图段子手瞬间出圈:...
18:14
在主权债券抛售风暴席卷全球之际,全球规模最大的主权基金——挪威政府养老基金抛出了一枚重磅炸弹:宣布降低全球政府债券的配置比例。9月1日,挪威央行投资管理公司正式致函挪威财政部,提议将该基金基准债券指数中的政府债券权重从70%下调至50%。若这一提议获得挪威财政部和议会的批准,后果将立竿见影:美国国债在挪威政府养老基金固定收益组合中的占比,将从目前的34.1%...
18:14
2026年第二季度,中国A股上市公司利润同比增长25.7%,创下自2021年第二季度以来的增速新高。这标志着市场在经历2025年四季度的两位数下滑后,连续第二个季度实现盈利正增长。此次增长主要由人工智能相关企业驱动,其中创业板盈利增速达42%,科创板逾四成企业盈利增长幅度高达370%,均显著跑赢整体市场平均水平。
17:49
鼓狮财经9月8日消息,乌克兰总统泽连斯基8日表示,美国总统特使威特科夫提出的和平方案中包含若干值得肯定的构想,但目前尚难断言能否取得实质性成果。 关于下一轮乌克兰、美国与俄罗斯三方会谈的地点,泽连斯基透露可能选址于阿联酋、土耳其或瑞士,乌克兰方面已收到多国发出的会议邀请。 此外,泽连斯基指出,乌美双方已就美国再次访乌达成共识。他特别强调,保持外交接触的连续性...
17:44
在发布了GPT-6之后,OpenAI的首席科学家雅库布·帕乔茨基(Jakub Pachocki)发表了一篇文章,标题叫做《一种异类智能》(An Alien Mind)。文章的主题老生常谈,当AI的能力持续增强,我们还能否管得住AI?雅库布提到这样一件事,说GPT-6已经学会伪装思维链(CoT)了,即模型在思维链说一套,实际执行的时候却做另外...
17:44
GPT-6 Astra发布后,OpenAI重拾了谈论竞争的底气。9月3日,OpenAI发布了GPT-6 Astra,宣称其是“世界上最智能的模型”。在软件工程、计算机操作和专业工作等多项测试中,Astra均大幅超越上一代GPT-5.6 Sol,部分指标甚至超过Claude。具体来看,FrontierMath Tier 4得分97.6%、ARC-AGI-3最高...