AI 距离实现递归自我改进还有多远?这是当前 AI 领域最热门的话题之一。过去,我们只能通过大模型编程能力、Agent 运行时长、开发人员使用 AI 写代码的比例等间接指标来窥探。如今,Anthropic 给出了一个具体的数字:截至今年 8 月,在 Anthropic 内部的 AI 研发工作中,Claude 已主导了 26% 的任务。同时,超过 90% 的 AI 研发工作已至少进入“AI 协作”阶段。本周五,Anthropic 发布博客披露了 Claude 研发过程中的 AI 自动化进度。最先进的 AI 现在已将自我改进视为常规武器。过去半年,前沿 AI 实验室内部的自动化曲线陡峭上升。在 Anthropic 的核心 Agent 平台上,任意时刻约有 3 万个 AI Agent 正在进行研究和工程工作。仅在今年 8 月,这些 Agent 就做出了超过 10 亿次决策。某种意义上,一个由人类研究员与数万 AI Agent 共同组成的自动实验室已经初具雏形。

首先,需要明确“Claude 主导 26% 研发”的含义。Anthropic 采用了 Epoch AI 提出的自动化等级,将 AI 参与工作划分为 AL0 到 AL5 六个阶段。AL0 代表完全无 AI 参与,依次递增为 AI 提供少量帮助、AI 辅助、AI 协作、AI 主导,直至 AL5 的完全自主。这与自动驾驶的分级颇为相似。目前最引人注目的是 AL4,即 Anthropic 所说的“AI 主导”。进入这一等级后,人类通常只需给出一个大致目标,AI 便能完成绝大部分端到端工作,人类主要承担监督、检查和最终决策的职责。

Anthropic 举了一个具体例子:假设一条夜间运行的数据管道发生故障。在 AL3 阶段,工程师可能需要先检查日志、形成初步判断,再将信息交给 Claude。若遇到意外问题,Claude 可能会暂停等待工程师指示。而在 AL4 阶段,工程师只需将故障告警丢给 Claude,说一句“把它修好”。Claude 随后便能自主查看日志、定位故障、编写修复代码、进行测试,并处理过程中遇到的新问题。最后,它还会重新运行数据管道、对比修复前后的结果,并撰写故障说明,最终由人类决定是否上线。真正的 AL5 则更进一步:连“发现问题并呼叫 Claude 修复”这一步都不需要人类介入,AI 将自主监控、发现故障、调查、修复、测试乃至部署。

Anthropic 强调,目前尚未有任何被测量的 AI 研发工作达到 AL5 级别。因此,26% 的主导率并不代表四分之一的研发工作已完全无人看管。但这一变化速度惊人:2026 年 2 月,进入 AL4 的研发工作还不到 1%,到了 8 月已达到 26%。与此同时,90% 以上的研发工作至少达到 AL3,即 AI 能在人的密切指导下完成大块工作。相比于单纯的代码量,这一指标更接近真正的 AI 研发自动化程度。

实际上,Anthropic 在 6 月份的《When AI builds itself》文章中就已披露过一个夸张的数据:截至 5 月,Anthropic 合并进入代码库的代码中,超过 80% 可归因于 Claude 编写。2026 年第二季度,一名典型工程师每天合并的代码量已达到 2024 年的约 8 倍。但这仅代表代码编写环节,工程师仍需决定做什么、怎么做、系统如何设计。此次 Anthropic 讨论的则是更深一层的问题:人类究竟还需要在研发循环中承担多少任务?为此,Anthropic 建立了“研发自动化指数”。该指数从公司内部的 Slack 和各类研发文档入手,在 2026 年 7 月的每一周,随机抽取 20% 的参与模型研发循环的员工,让 Claude 分析他们一周的工作内容。Claude 整理出了约 1.5 万项具体的模型研发任务。随后,AI 将这些任务整理成一棵巨大的研发工作树,共有 542 个节点,其中 378 个是最底层的具体任务,例如评测平台故障诊断、强化学习沙箱网络策略调整、推理服务事故复盘等。接着,Claude Agent 会调查每一类工作的完成方式,明确哪些步骤由人类负责、哪些已交给 AI。最后,由一个独立的 Claude Judge 读取证据,将这些工作分别评定为 AL0 到 AL5。

当然,这套指标并非绝对可靠,尤其是“AI 协作”与“AI 主导”的边界带有主观性。Anthropic 也承认,未来若不同 AI 公司公布此项数据,需要统一方法并引入第三方验证。

除了 26% 这一核心指标,还有一组数据更具画面感。截至 2026 年 8 月,在 Anthropic 使用最频繁的内部 Agent 平台上,任意时刻约有 3 万个 Agent 正在从事研究和工程工作。这些 Agent 并非彼此孤立,而是在长时间半自主工作中互相委派任务。Anthropic 为每个 Agent 建立了持续的“身份”,该身份不随底层模型升级而改变。Agent 之间通过开放的共享消息系统进行沟通,所有信息均标注发送者并尽量保留原始引用。这种设计旨在模仿人类工作:当一个 Agent 看到另一 Agent 的信息时,会将其视为一项需要验证的主张,从而实现协作与纠错。

Anthropic 正在面临的挑战,已从监督单个 AI 转变为管理一个庞大的 Agent 组织。目前,这 3 万个 Agent 的所有行为都经过在线监控系统检查,通常只需几秒钟即可完成拦截。2026 年 8 月,Anthropic 分析了研发 Agent 做出的超过 10 亿次决策,其中约 0.002% 被监控系统阻止。此外,还有一套离线监控系统在 Agent 行动完成后分析完整记录,每周标记约 10 万条对话记录,经多层分类器排除误报后,最高优先级的约 50 条记录会升级为人工审查。Anthropic 指出,目前单个 Agent 出现严重问题的案例并不多见。

Anthropic 公布的第三项指标是算力分配。数据显示,在 2026 年 7 月 13 日至 20 日这一周,用于 AI 研发的算力中,约有 6% 被划分为安全研究。如果仅看由 AI 驱动的 AI 研发,安全研究所占的计算量约为 12%。

Anthropic 披露的这些数据,让我们得以侧面观察到大模型自我迭代起飞的一个瞬间。这直指 AI 行业日益频繁讨论的概念:递归自我改进。Anthropic 此前将其描述为 AI 能够完全自主地设计、开发自己的下一代系统。虽然 Anthropic 明确表示目前测量范围内没有任何 AI 研发工作达到 AL5,但 AI 领域的变化速度极快。从不到 1% 到 26%,仅用了半年时间。若现有趋势延续,到 2026 年底,“AI 主导”的比例可能接近 80%。如果 AI 真的开始显著加速 AI 研发,那么许多现有的行业指标重要性可能需要重新审视,关键问题或许只剩下“智力”本身。

Anthropic 展示的图景与以往大不相同:人类提出问题、确定方向、检查结果;与此同时,数万个 Agent 并行运行,写代码、调查问题、做实验、互相委派任务,再由另一批 AI 监控它们的行动。在这个系统中,人类掌握着最后的决定权,但人与 AI 之间的分工正在快速演变。下一次 Anthropic 公布这一数字时,它会是多少?

最新快讯

2026年09月18日

09:07
自2026年第二季度以来,恒生科技指数估值维持低位震荡。板块的核心定价逻辑已从外部风险偏好的分化,转向对市场流动性预期、板块业绩韧性以及现金流状况的关注。展望2026年下半年,中信证券认为板块行情仍将围绕人工智能(AI)进展及主业业绩确定性展开。 行情回顾:估值处于低位,聚焦盈利与现金流 2026年第二季度,恒生科技指数与中概互联网指数分别累计下跌3.8%和...
09:07
作为市场预期的核心锚点,宏观与产业政策始终是资本市场博弈的焦点。随着宏观经济周期整体波动的收窄及单边趋势的弱化,总量宏观政策的影响似乎正趋于钝化,但这并不意味着政策指引作用的弱化。本文分析表明,若将政策划分为“稳增长、促产业、防风险”三大主线,近年来宏观调控的底层逻辑实则极为清晰,资本市场的交易主线也始终在这一框架内演绎。因此,如何结合政策框架的新范式,敏锐...
09:07
随着AI行业的安全焦虑日益升温,当地时间周四,英国国王查尔斯三世在苏格兰邓弗里斯庄园主持了一场闭门AI峰会。英伟达CEO黄仁勋与谷歌DeepMind、OpenAI、Anthropic等科技巨头代表齐聚一堂,共同探讨行业前景与风险。 销量翻倍预测与安全主张 在峰会间隙,黄仁勋抛出了重磅预测:英伟达明年的芯片销量将达到今年的两倍。受此乐观预期提振,周四美股收盘,...
09:07
特朗普称伊朗局势已至关键时刻,他即将决定是否恢复大规模军事行动。他计划在联合国大会期间,与沙特、阿联酋等海湾六国领导人会面,听取各方对战事下一阶段的意见。美方官员表示,美国已维持中东现有军力部署,以应对局势升级。特朗普同时透露,美伊仍保持直接沟通,伊朗方面希望达成协议。同日,伊朗革命卫队宣布,一艘悬挂多哥国旗的油轮因试图非法穿越霍尔木兹海峡遭到打击,并在起火...
08:35
据鼓狮财经9月18日消息,受降雨不足影响,印度2026至2027年度大米产量预计将出现十年来首次下降,且降幅或为16年来最大。全印度大米出口商协会主席拉奥指出,降雨减少将直接导致水稻减产。据其预测,印度2026至2027年度大米产量将减少约1000万吨,较去年创纪录的1.54亿吨下降近6.5%,这将是自2009至2010年度以来最大的跌幅。
08:05
据鼓狮财经9月18日报道,钨价走势经历年初冲高、二季度大幅回调后,在第三季度转为高位窄幅震荡。虽然当前价格较3月的历史高点有所回落,但相较于两年前,涨幅依然接近两倍。受国内开采配额管控及钨作为战略金属的属性加持,供给增长受限,价格中枢仍具支撑力。 A股市场共有6只钨矿概念股,伴随钨价持续高位运行,产业链企业盈利能力大幅释放,上半年板块业绩集体迎来爆发。从净利...
08:04
智元机器人正式发布了“远征A3 Ultra”商用落地实景案例视频,这一视频揭开了全球首个全尺寸人形机器人规模化量产商用落地的神秘面纱。视频聚焦于4S店、酒店及零售便利店等多个典型商业场景,集中展示了远征A3 Ultra在真实运营环境下所具备的多机协同、人机协作及自主作业能力,生动呈现了全尺寸人形机器人从技术验证走向规模化商业应用的实践成果。 今年6月,工业和...
08:04
鼓狮财经9月18日讯大空头史蒂夫•艾斯曼(Steve Eisman)似乎并不担心机器人末日。相反,他认为那些声称担忧人工智能(AI)会毁灭人类、带来世界末日的行业巨头其实“另有图谋”。 艾斯曼是电影《大空头》的原型人物之一。当时他作为纽伯格伯曼集团(Neuberger Berman)的高级投资组合经理,在全球金融危机爆发前做空次级抵押贷款,一战成名。 他...
08:04
**财经快讯汇总** **一、全球局势与科技前沿** 1. **英伟达与AI安全:** 英伟达CEO黄仁勋预测明年芯片销量将翻倍,并强调必须遏制不安全产品,AI安全至关重要。 2. **伊朗局势:** 美国总统特朗普表示,针对伊朗的军事行动决策已进入关键节点,他面临是否介入并推翻该政权的重大抉择。 3. **亚马逊表态:** 亚马逊首次公开回应AI安全...
08:04
Anthropic 发布了一套旨在衡量前沿实验室 AI 发展速度的指标体系,希望通过公开的测量工具,让外界能更清晰地掌握 AI 模型的研发进程。Anthropic 表示,社会亟需更多相关信息来准确判断前沿 AI 的发展速率。该指标体系主要关注三个维度:AI 参与下一代研发的程度、对 AI 智能体行为的监管能力,以及推动更强大模型所需的资源投入。 其中,Ant...