AI 距离实现递归自我改进还有多远?这是当前 AI 领域最热门的话题之一。过去,我们只能通过大模型编程能力、Agent 运行时长、开发人员使用 AI 写代码的比例等间接指标来窥探。如今,Anthropic 给出了一个具体的数字:截至今年 8 月,在 Anthropic 内部的 AI 研发工作中,Claude 已主导了 26% 的任务。同时,超过 90% 的 AI 研发工作已至少进入“AI 协作”阶段。本周五,Anthropic 发布博客披露了 Claude 研发过程中的 AI 自动化进度。最先进的 AI 现在已将自我改进视为常规武器。过去半年,前沿 AI 实验室内部的自动化曲线陡峭上升。在 Anthropic 的核心 Agent 平台上,任意时刻约有 3 万个 AI Agent 正在进行研究和工程工作。仅在今年 8 月,这些 Agent 就做出了超过 10 亿次决策。某种意义上,一个由人类研究员与数万 AI Agent 共同组成的自动实验室已经初具雏形。

首先,需要明确“Claude 主导 26% 研发”的含义。Anthropic 采用了 Epoch AI 提出的自动化等级,将 AI 参与工作划分为 AL0 到 AL5 六个阶段。AL0 代表完全无 AI 参与,依次递增为 AI 提供少量帮助、AI 辅助、AI 协作、AI 主导,直至 AL5 的完全自主。这与自动驾驶的分级颇为相似。目前最引人注目的是 AL4,即 Anthropic 所说的“AI 主导”。进入这一等级后,人类通常只需给出一个大致目标,AI 便能完成绝大部分端到端工作,人类主要承担监督、检查和最终决策的职责。

Anthropic 举了一个具体例子:假设一条夜间运行的数据管道发生故障。在 AL3 阶段,工程师可能需要先检查日志、形成初步判断,再将信息交给 Claude。若遇到意外问题,Claude 可能会暂停等待工程师指示。而在 AL4 阶段,工程师只需将故障告警丢给 Claude,说一句“把它修好”。Claude 随后便能自主查看日志、定位故障、编写修复代码、进行测试,并处理过程中遇到的新问题。最后,它还会重新运行数据管道、对比修复前后的结果,并撰写故障说明,最终由人类决定是否上线。真正的 AL5 则更进一步:连“发现问题并呼叫 Claude 修复”这一步都不需要人类介入,AI 将自主监控、发现故障、调查、修复、测试乃至部署。

Anthropic 强调,目前尚未有任何被测量的 AI 研发工作达到 AL5 级别。因此,26% 的主导率并不代表四分之一的研发工作已完全无人看管。但这一变化速度惊人:2026 年 2 月,进入 AL4 的研发工作还不到 1%,到了 8 月已达到 26%。与此同时,90% 以上的研发工作至少达到 AL3,即 AI 能在人的密切指导下完成大块工作。相比于单纯的代码量,这一指标更接近真正的 AI 研发自动化程度。

实际上,Anthropic 在 6 月份的《When AI builds itself》文章中就已披露过一个夸张的数据:截至 5 月,Anthropic 合并进入代码库的代码中,超过 80% 可归因于 Claude 编写。2026 年第二季度,一名典型工程师每天合并的代码量已达到 2024 年的约 8 倍。但这仅代表代码编写环节,工程师仍需决定做什么、怎么做、系统如何设计。此次 Anthropic 讨论的则是更深一层的问题:人类究竟还需要在研发循环中承担多少任务?为此,Anthropic 建立了“研发自动化指数”。该指数从公司内部的 Slack 和各类研发文档入手,在 2026 年 7 月的每一周,随机抽取 20% 的参与模型研发循环的员工,让 Claude 分析他们一周的工作内容。Claude 整理出了约 1.5 万项具体的模型研发任务。随后,AI 将这些任务整理成一棵巨大的研发工作树,共有 542 个节点,其中 378 个是最底层的具体任务,例如评测平台故障诊断、强化学习沙箱网络策略调整、推理服务事故复盘等。接着,Claude Agent 会调查每一类工作的完成方式,明确哪些步骤由人类负责、哪些已交给 AI。最后,由一个独立的 Claude Judge 读取证据,将这些工作分别评定为 AL0 到 AL5。

当然,这套指标并非绝对可靠,尤其是“AI 协作”与“AI 主导”的边界带有主观性。Anthropic 也承认,未来若不同 AI 公司公布此项数据,需要统一方法并引入第三方验证。

除了 26% 这一核心指标,还有一组数据更具画面感。截至 2026 年 8 月,在 Anthropic 使用最频繁的内部 Agent 平台上,任意时刻约有 3 万个 Agent 正在从事研究和工程工作。这些 Agent 并非彼此孤立,而是在长时间半自主工作中互相委派任务。Anthropic 为每个 Agent 建立了持续的“身份”,该身份不随底层模型升级而改变。Agent 之间通过开放的共享消息系统进行沟通,所有信息均标注发送者并尽量保留原始引用。这种设计旨在模仿人类工作:当一个 Agent 看到另一 Agent 的信息时,会将其视为一项需要验证的主张,从而实现协作与纠错。

Anthropic 正在面临的挑战,已从监督单个 AI 转变为管理一个庞大的 Agent 组织。目前,这 3 万个 Agent 的所有行为都经过在线监控系统检查,通常只需几秒钟即可完成拦截。2026 年 8 月,Anthropic 分析了研发 Agent 做出的超过 10 亿次决策,其中约 0.002% 被监控系统阻止。此外,还有一套离线监控系统在 Agent 行动完成后分析完整记录,每周标记约 10 万条对话记录,经多层分类器排除误报后,最高优先级的约 50 条记录会升级为人工审查。Anthropic 指出,目前单个 Agent 出现严重问题的案例并不多见。

Anthropic 公布的第三项指标是算力分配。数据显示,在 2026 年 7 月 13 日至 20 日这一周,用于 AI 研发的算力中,约有 6% 被划分为安全研究。如果仅看由 AI 驱动的 AI 研发,安全研究所占的计算量约为 12%。

Anthropic 披露的这些数据,让我们得以侧面观察到大模型自我迭代起飞的一个瞬间。这直指 AI 行业日益频繁讨论的概念:递归自我改进。Anthropic 此前将其描述为 AI 能够完全自主地设计、开发自己的下一代系统。虽然 Anthropic 明确表示目前测量范围内没有任何 AI 研发工作达到 AL5,但 AI 领域的变化速度极快。从不到 1% 到 26%,仅用了半年时间。若现有趋势延续,到 2026 年底,“AI 主导”的比例可能接近 80%。如果 AI 真的开始显著加速 AI 研发,那么许多现有的行业指标重要性可能需要重新审视,关键问题或许只剩下“智力”本身。

Anthropic 展示的图景与以往大不相同:人类提出问题、确定方向、检查结果;与此同时,数万个 Agent 并行运行,写代码、调查问题、做实验、互相委派任务,再由另一批 AI 监控它们的行动。在这个系统中,人类掌握着最后的决定权,但人与 AI 之间的分工正在快速演变。下一次 Anthropic 公布这一数字时,它会是多少?

最新快讯

2026年09月18日

10:27
鼓狮财经9月18日讯当地时间周四,人工智能软件公司Palantir的首席执行官Alex Karp呼吁制定人工智能(AI)监管的“合理准则”,但他表示,由于该技术“无限风险”带来的责任,可能需要实行国有化。 “我认为这些企业必须国有化,因为如果不国有化,我的每一个客户都会起诉我,”他在接受最新采访时表示。 在上述采访中,Karp反复提及构建这项强大技术所带来的...
10:26
Nebius宣布将于10月1日起全面上调旗下GPU云服务定价,平均涨幅约20%,叠加英伟达发布强劲季度财报,推动该股盘后大涨近7%,AI算力供需格局持续偏紧的市场判断进一步获得印证。此轮提价覆盖H100、H200、B200及B300多款芯片型号,是Nebius今年5月以来的第二轮涨价。市场将此解读为AI算力需求持续过热、供给仍然紧张的强烈信...
10:26
英伟达、谷歌与Emerald AI联手组建行业联盟,试图从根本上改变数据中心与电网的关系,将AI基础设施从被动用电方转变为可调度的电网资源。三家公司于2026年9月16日宣布成立AI能源管理联盟(AEMA),核心目标是推动数据中心根据电网实时状况动态调整用电量。英伟达与Emerald AI正与能源及基础设施领域合作伙伴共同开发能够实时响应电...
10:26
当AI狂写代码,最 先扛不住的,竟是自家的CI!就在今天,Anthropic在一篇博客中,披露了一组极为震撼的内部真实数据——全公司80%的代码,直接由Claude编写!工程师平均每季度交付的代码量,达到2021—2025年平均水平的整整8倍。更离谱的是,Claude不仅负责疯狂堆代码,还在PR的代码审查、合并批准环节承担了大量主力工作。写...
10:26
如果你是Claude用户,这里有个“好消息”:以后再遇到复杂任务,不用先纠结到底该留在Chat里聊,还是切去Claude Cowork让它开工了。Anthropic刚刚把两者塞进了同一个入口。你只管告诉Claude自己想干什么,至于是随口回答两句,还是打开工具、处理文件、跑一个长任务,都由Claude自己判断。一起被收进对话里的,还有Cla...
10:26
Manus恢复自由身才半个多月,“突然”身价倍增了?!最新消息,Manus正在推进新一轮约5亿美元融资,目标估值约40亿美元。这是它与Meta完成拆分、恢复独立运营后的第 一轮融资。据彭博援引知情人士消息,这轮融资已经接近完成,但谈判仍在进行,最终金额和条款仍可能发生变化。目前,最新新资方身份尚未披露,腾讯、HSG和真格基金等现有股东也没有...
10:26
AI完成任务之后,还能留下什么?北京航空航天大学、香港中文大学和新加坡国立大学的研究团队最近发布了OmniHarness,给出的路径是:让视觉智能体主动练习、检查结果,再将有效流程留下。面对下一个需求,AI手里能多一份经过验证的方法。论文全文:https://arxiv.org/abs/2609.16057项目主页:https://omni...
10:26
今日A股开盘,医药板块一改颓势,集体走强。具体来看,百普赛斯涨幅超过14%,海特生物涨逾13%,泓博医药涨幅超10%。此外,南华生物与双成药业双双实现10%涨停,金石药业涨9%,近岸蛋白、毕得医药、键凯科技涨幅均在7%以上。康希诺、振东制药、百奥赛图、华大智造、三元基因、义翘神州、诺禾致源、禾元生物-U等个股涨幅均超6%,南模生物涨幅也超过5%。 此次行情上...
10:26
近日,国家发展改革委、国家能源局及国家矿山安监局联合印发通知,采取多项举措加快煤炭稳产保供工作。通知要求,各产煤省份及煤炭企业必须在确保安全的前提下,全力落实稳产保供任务。通过持续抓好监测调度、优化生产组织,积极稳妥推动煤矿复产达产,加快联合试运转煤矿验收,促进煤炭产量平稳回升,为经济增长和能源保供提供有力支撑。此外,通知还对电煤中长期合同履约、发挥进口煤补...
09:50
据鼓狮财经9月18日消息,SK集团控股公司SK Inc.近日将旗下四名副董事长中的三名调任至子公司SK海力士。这三位高管分别是徐镇宇、俞钟俊和李亨希,此前主要负责集团的全球业务及对外合作。鉴于半导体行业地缘政治环境的不确定性日益加剧,SK集团进行了此次人事部署。公司官员解释称,此举旨在让具备全球视野和专业经验的资深高管为SK海力士的整体经营提供建议,并支持其...
09:49
鼓狮财经9月18日讯,工业和信息化部、国家发展改革委等十部门联合发布了《医药工业发展“十五五”规划》。根据《规划》,到2030年,生物医药研发应用将稳居世界前列,创新驱动效能充分释放,重点领域关键核心技术实现系统性突破,生物医药产业将加速成为国家新兴支柱产业。 围绕产业规模效益、创新发展、企业培育与集群发展等方面,《规划》设定了10项预期性指标。具体而言,产...