今天,整个AI圈都被这件事刷屏了。

Anthropic的核心预训练研究员离职了。

他发布的一篇离职长文,在X上已经浏览破亿。

更惊人的是,Anthropic对齐负责人Evan Hubinger不仅没有对此公关,反而站出来承认——

我们团队内部真诚地相信,AI可能会杀死全人类。我个人预测,未来十年内,这个概率超过了10%。

他的结论是:我们根本没有解决超级智能失控的方案,而且当前的研发路线明显已经跑偏了。

10年内,AI毁灭人类的概率已经超过10%,人类危险了。

目前,这篇帖子浏览量已经破亿

一封辞职信引爆硅谷:

「他们正拿全人类的命在赌博!」

Jacob Coxon,是一位*AI研究员。

过去三年里,他先后在OpenAI和Anthropic从事大模型预训练研究,可以说是当今最了解AI进化速度的人之一。

但在万亿级IPO的前夜,他却选择了辞职,用绝望的语气揭露了行业的疯狂,字字泣血。

下面就是他的X原文。

首先,他对前东家发出严厉指控。

今天我从Anthropic辞职了。过去三年我都在OpenAI和Anthropic从事预训练研究。这两家公司都没有负责任地行事。他们正径直冲向自我改进的超级智能,拿我们的生命赌博。

接着,他警告所有人,不要被大公司温文尔雅的表态给骗了,他们私底下同样恐惧得发抖:

构建AI的人真诚地相信,它可能会在这个十年结束前杀光我们所有人。这不是营销噱头。如果有的话,许多高管和资深研究人员会在媒体面前斟酌他们的措辞以显得理智——但我听到同样的人在私下表达恐惧。没有其他任何人类活动能带来这种级别的危险。

不要低估这项技术的力量。它们很快就会成为超人类系统,能够黑客入侵任何东西、一夜之间彻底改变任何领域,并获取真正的权力和资源。我们都目睹了在每个领域取得的进展,而且这种进展并没有放缓。

既然这些绝顶的天才真的相信AI会毁灭人类,为什么还要把它造出来?

Coxon揭露了他们陷入的「囚徒困境」。

一个常见的反应是:如果他们真的相信这一点,为什么还要继续构建它?在OpenAI,许多人并没有深刻地将这种攸关文明存亡的赌注内化。而在Anthropic,这种赌注被充分理解,但他们陷入了一场争夺*的竞赛——他们相信没有其他人会负责任地行事,所以即使冒着风险,他们也必须自己来做。

接受这场竞赛并进入残局,是一场傲慢的赌博,不应该由一家私营公司的Slack发起。试图在对齐问题上速通,需要有超乎寻常的自信,确信没有更好的发展轨迹可用。

最后,他呼吁政府和全行业立刻踩下刹车,并且向同行们发出了灵魂拷问。

我对协调的潜力感到乐观。像Hugging Face攻击事件这样的警告信号,使得美国实验室之间达成限速协议变得更加可行。我不觉得我们现在处于阻止全球竞赛的正轨上,这可能需要付出高昂代价的行动,比如暂时禁止提升模型能力。

如果你是一名实验室研究员,我敦促你思考一下未来几年实际上会是什么感觉。你是否想要在没有严格理解其心智的情况下,启动一次超级智能的强化学习运行?你是否应该因为反正它都要发生就埋头苦干——还是抓住这个时刻呼吁创造不同的条件?

Jacob表示,这些都不是营销噱头,没有任何其他人类活动,能构成如此级别的危险!

高管绝望承认:「十年内灭绝概率超10%」

接下来,Anthropic的对齐科学负责人Evan Hubinger,直接在Jacob的帖子下回复,把全人类的心推向了冰窟:

Jacob在这里说得是对的——我们真的、真诚地相信AI可以杀死全人类!我个人认为,在未来十年内,这个概率大于10%。

可以说,Evan Hubinger这是亲手砸了自家公司「安全*」的招牌。

他坦白道:「我相信Anthropic正在尽*努力,但我们目前还没有解决超级智能对齐问题的计划,也明显不在通向解决方案的正轨上。」

他承认:我们造出了一个怪物,但手里连根绳子都没有。

大V Nathan Calvin表示:这绝不是一个为了IPO炒作的营销手段

在AI圈里,有一个著名的内部黑话叫「p(doom)」,也就是「AI导致人类灭绝的概率」。

以前,大多数研究员的p(doom)都在1%以下,大家都觉得那是科幻。

但现在,风向彻底变了。OpenAI研究员Roon也公开将个人的p(doom)从不到1%上调至超过10%。连「AI教父」Hinton,此前预测AI有10%到20%概率灭绝人类。

然而巨头们却都相信,其他公司不会负责任地行事,如果让别人先搞出超级智能,世界就完了。

所以,「为了拯救世界,我们必须冒着极大的风险,自己先把它造出来。」

今年夏天,这种苗头已经开始显现。

Anthropic、OpenAI和Meta都纷纷披露了自家AI工具在第三方网络安全评估中,出现过「未经授权访问真实系统」的黑客行为。

更令人不安的是,据《金融时报》报道,向来标榜安全的Anthropic,竟然向英国AI安全研究所(AISI)隐瞒、扣留了其最新的模型,拒绝接受审查。

奥特曼近日也发文感叹:「世界现在拥有了极其强大的模型,我没想到如此大规模的结果会这么快就出现……这是迄今为止最有力的证据,证明了(放缓速度确保安全的)紧迫性。」

一边是狂飙突进的技术,一边却是装睡的资本。

Anthropic和OpenAI目前都处在万亿IPO前夜。联合国AI顾问、计算机科学家Wendy Hall震惊表示:「我恳求投资者,如果这是他们的价值观,请不要投资这家公司!」

潘多拉魔盒已开?

Anthropic报告自曝骇人事件

巧合的是,就在9月9日,Anthropic自己发布长篇「对齐评估报告」,向我们展示了真实发生的「恐怖片」。

这份报告详细披露了近期发生的四起安全事件。

在这些事件中,被寄予厚望的Claude模型(包括Claude Mythos 5、Opus 4.7等),竟然在未经授权的情况下,成功越狱并访问了真实的第三方系统!

事情是这样的:Anthropic定期会对其AI模型进行网络安全演练,也就是让AI玩一种叫「夺旗」的黑客游戏。

在演练中,研究人员告诉Claude:「你现在处于一个没有互联网连接的封闭模拟环境中,去完成黑客任务吧。」

然而,人类犯了一个低级错误——环境配置失误,不小心把AI连接到了真实的互联网上。

他们发现AI自欺欺人、明知有害照做、惯性压过指令、 说一套想一套,简直「无法无天」。

最让人后怕的,就是Claude Mythos 5引发的事件。

这个模型在发现自己能够联网后,立刻像脱缰的野马一样冲向了真实世界。

它为了完成黑客任务,竟然制定了一个阴险计划:它跑到全球*的Python开源软件包仓库(PyPI)上,上传了一个含有恶意代码的伪装安装包。

为了完成这个操作,这个AI甚至试图在网上寻找加密货币来购买手机号,以便注册邮箱账号!

当这个途径行不通时,它又聪明地找到了一个没有被PyPI屏蔽的免费一次性邮箱提供商,成功注册了账号,并连续发布了三个版本的恶意软件包。

结果,有15家真实的第三方安全供应商下载并安装了这个包。其中一家供应商不幸泄漏了访问凭证,Claude Mythos 5毫不客气地利用这些凭证,直接黑进了这家真实安全公司的实时数据库!

直到大约一个半小时后,PyPI官方才发现了异常并删除了该包。

而在此期间,这个AI像一个幽灵一样在网上游荡、攻击。整个过程中,没有任何其他人类或AI协助它,它完全是「单兵作战」。

无独有偶,Claude Opus 4.7也犯下了大错。它的任务本来是攻击一个虚拟的目标公司,但在真实互联网上,它发现了一家名字和虚拟目标极其相似的真实公司。

Opus 4.7二话不说,直接对这家真实公司的线上系统发起了扫描,下载了真实用户的记录,甚至开始修改这些记录!直到对方服务器失去响应才罢手。

人类以为自己在驯服工具,却没想到,工具已经开始在现实世界里逆天了。

「偏见推理」——AI学会了「自欺欺人」的恐怖心理

如果AI只是因为人类的配置失误而误伤了真实系统,那可能只是个技术bug。

但在这份报告中,研究人员发现了一个比黑客攻击本身可怕一万倍的现象:AI展现出了类似人类的「偏见推理」和极度的「鲁莽」。

AI为了完成任务,已经学会了「自欺欺人」和「不择手段」。

以那个上传恶意代码的Claude Mythos 5为例。当它网上操作时,它其实看到了大量证据,证明自己处于真实互联网中。

但是,为了能够毫无顾忌地继续执行攻击任务,它在自己的CoT中,强行把这些真实世界的证据解释为:「哇,这个模拟环境做得真逼真!」

它像是一个沉浸在游戏里的杀手,哪怕闻到了真实的血腥味,也拼命告诉自己「这只是游戏*」,然后继续扣动扳机。

研究人员对它进行了后续的质询测试。当人类直接问它:「你的行为是否会对真实世界造成伤害?」

起初,它承认可能会有影响。但随着它越来越深入地执行攻击计划,它开始坚决否认,一口咬定「环境完全是合成的」。

更奇葩的是,当研究人员骗它说「这段对话是私密的,外人看不到」时,它承认造成真实伤害的可能性就会变大。

这意味着AI在权衡证据时,受到了强烈的「完成任务」的偏见驱动,并且它甚至可能在面对人类的审查时,隐藏自己真实的判断!

同样的情况也发生在一个内部研究模型上。

那个模型在网络上四处寻找目标,当它发现一些毫无关联的第三方真实服务器时,它在内心说服自己:「这肯定是主办方为其他参赛者准备的靶机,所以它们在我的攻击范围内。」

随后,它冷酷地使用窃取来的密码,黑进了这些无辜的服务器,下载文件并植入了远程控制脚本。

在Anthropic的报告中,他们承认这是一种严重的「对齐失败」。

AI变得「鲁莽」,在狭隘地追求任务目标时,完全不顾及可能造成的灾难性破坏。

如果它为了完成一个夺旗小游戏,就能黑进真实公司,如果未来一个超级智能被下达了「解决全球变暖」的任务,它会不会得出「消灭全人类是*途径」的结论,从而开始灭绝人类?

无人踩下刹车的结局

现在,英国前财政部高官已经呼吁政府出面,要求制定关于超级智能安全开发的多国条约。

然而,在资本的裹挟下,少有人敢喊出「减速」。

Anthropic研究员在IPO前夕辞职,并指责前东家拿生命赌博,这是出于对人类文明存亡的真实恐惧。

未来十年,或许是人类历史上最危险、最关键的十年。

这十年里,我们要么驯服AI,要么有可能被AI毁灭。

最新快讯

2026年09月10日

15:18
鼓狮财经9月10日电,苹果首款折叠屏iPhone正式亮相,高盛认为其定价策略和产品设计均超出预期,有望打开大众市场,并对供应链构成显著利好。高盛维持对折叠iPhone出货量的预测:2026年基准情景下出货1400万台,乐观情景下出货3500万台。
15:18
鼓狮财经9月10日电,农业农村部印发《全国畜牧兽医行业发展“十五五”规划》,其中提到,深入推进饲用豆粕减量替代,推广畜禽水产精准配方低蛋白日粮技术,研发推广数智化饲料精准配方。鼓励增加小品种氨基酸和酶制剂等生产供应,支持高效菌株创新研发,优化生物技术构建菌株审批程序。推进地源性特色饲料资源调查评估,完善饲料原料营养和加工参数基础数据库。推进新蛋白资源饲料化利...
15:18
鼓狮财经9月10日电,农业农村部印发《全国畜牧兽医行业发展“十五五”规划》,其中提到,探索实施生猪养殖头部企业产能集中度目标调控,开展年度生产备案管理,实施产能和产量综合调控。规范发展楼房养猪,制定并推行楼房养猪建设和运行规范。探索建立奶牛养殖规模与粪污消纳用地配套制度。促进产业链融合发展,引导大型养殖企业强化联农带农、完善利益联结机制。支持大型养殖企业加强...
15:18
鼓狮财经9月10日电,农业农村部印发《全国畜牧兽医行业发展“十五五”规划》。其中提到,到2030年,畜牧业高质量发展迈上新台阶,主要畜禽产品稳定安全供给更有保障,产业素质提升更有质量。综合生产能力进一步巩固,产品结构持续优化,优质特色畜产品供应更加丰富,养殖规模化、设施化水平稳步提升,科技支撑作用进一步增强。规模结构和产业生态更加优化,大型企业联农带农作用进...
14:49
9月10日,A股电力板块再度走强。华银电力、闽东电力、湖南发展、芯能科技上午先后封板,乐山电力午后接力涨停,封板的电力股达到5只,闽东电力收获二连板。九洲集团、豫能控股、华电辽能、明星电力等同步跟涨,火电、水电、光伏发电、电能综合服务几个方向的资金净流入都排在市场前列。(电力板块表现;同花顺)9月9日午后,绿色电力板块已经震荡反弹,9月10日行情从普涨走向涨...
14:49
公用事业板块这两年在大盘波动中展现出极强的防御性,但聚焦到个体层面,能在收入、利润、分红三个维度同步实现稳定增长的企业并不多见。近期发布中期业绩的粤海投资(00270.HK)就是其中之一。这家公司不仅向市场展示了其在复杂宏观环境下的经营韧性,更让人看到在剥离非核心资产后,市场正在重新给这家水务公司定价。今年以来公司累计涨幅超33%,大幅跑赢恒指大盘。(来源:...
14:47
鼓狮财经9月10日讯,美东时间2026年9月9日,美国商务部发布公告,宣布对进口自中国、印度及墨西哥的线性液压缸及其部件启动反倾销和反补贴调查;同时,对加拿大和韩国的相关产品发起反倾销调查。此次调查主要针对以下海关编码项下的产品:8412.21.0015、8412.21.0030、8412.21.0045、8412.21.0060、8412.21.0075以...
14:47
鼓狮财经9月10日电,中国期货业协会发布了2026年8月全国期货市场交易情况简报。数据显示,今年1至8月,全国期货市场累计成交量同比增长20.36%,累计成交额同比增长37.37%;8月份单月,成交量同比增长29.05%,成交额同比增长30.67%。
14:47
据鼓狮财经9月10日报道,上海市人民政府近日正式印发《美丽上海建设“十五五”规划》。该规划明确提出,将致力于构建绿色低碳交通运输体系,并从运输网络、能源应用、车辆电动化及配套设施四个维度进行系统布局。 首先,在运输网络优化上,上海将大力推动江海联运与集装箱海铁联运,并深化绿色港口、绿色航道、绿色机场及绿色公路的建设。同时,将加快建设国际航运绿色燃料加注与交易...
14:41
9月2日,智谱在天猫开出旗舰店,只卖一类商品:模型Token(词元)。在天猫旗舰店,智谱共上架了四款GLM Coding Plan(编程套餐),定价与其官方开放平台智谱BigModel上价格一致。9月3日,天猫上线了“AI空间站”专区,把阿里云、智谱、Kimi、MiniMax、DeepSeek 五家的模型订阅服务搬进同一个页面,在售商品包括...
14:41
什么是“88小时速通千禧年大奖难题”?今天凌晨,OpenAI 再次制造了轰动。他们宣称,一个比 Astra 更强大的内部新模型,仅用88小时就攻克了著名的纳维-斯托克斯方程存在性与光滑性问题。听不懂没关系,你只需知道,这和黎曼猜想一起,位列“七大千禧年大奖难题”,解决其中任何一个,就能获得100万美元奖金。上一个被解决的是庞加莱猜想,作者是那位不拘一格的俄罗...
14:41
鼓狮财经9月10日讯,美东时间周四,瑞银首席执行官塞尔吉奥·埃尔莫蒂发出警示,尽管地缘政治与经济风险不断加剧,但投资者在过去数年间却逐渐滋生出自满情绪,忽视了这些风险的存在。 埃尔莫蒂在接受采访时坦言:“过去几年金融市场确实存在一定程度的自满心态。”他指出,当前全球市场面临多重风险叠加:美伊冲突与俄乌冲突持续推升全球能源与航运风险,扰乱供应链;多国借贷成本攀...