Claude一夜变笨,全网吵翻了!

就在昨天,开发者argofowl花了整整一个下午,差点把Claude Code翻了个底朝天。

他一路排查,先是怀疑是t3 code崩了,接着又以为自己的代码出现了bug。

查到最后,他甚至开始怀疑——难道是自己把Mac搞坏了?

当argofowl最终打开API的真实请求日志时,一切真相大白,里面赫然写着一个数字「10」。

然而,在Claude Code后台,他明明选的是「high」,最高档推理程度。

谁曾想,Claude Code的更新日志,一个字都没写。

01、推理high变成10,Claude Code变笨曝光

argofowl发现,从Claude Code 2.1.237开始,模型把「high」推理程度读成了10 out of 100。

而这个数字,正是过去「low」档对应的值。

细扒发现,Anthropic把Claude Code 2.1.236及以上版本的Fable 5会话,纳入了一个「压缩effort数值刻度」的实验。

不过,老版本和Opus 5不受影响。

这大概率是个A/B测试,所以不是人人都会撞上。

对开发者来说,这才是真正的痛点。模型强一点弱一点,还能忍。

但你把我拉进了实验组,却不打算告诉我:那我这一下午到底在debug什么?是在调自己的代码,还是在调你的A/B测试?

没想到,科技博主Chubby转发之后,AI圈直接炸了——

看起来,Anthropic把模型悄悄调笨了,却没告诉任何人。

一时间,X上「Claude变笨了吗」的自测帖子刷屏。

有人贴出同一段prompt在不同版本下的输出对比,有人翻出自己两周前的会话记录做逐行diff。

02、Anthropic认错,工程师下场

面对这场风暴,Claude Code工程师Thariq Shihipar的回应来得很快。

我们有时候会在Claude Code里先测试API的服务配置,再决定要不要全量推。

现在跑的这个实验,只是把effort的数值映射方式改了。所以有些人会看到Claude说自己是「10」。

关键是,这个刻度不是0到100,那个数字单独看没有任何意义,你选的effort就是你拿到的effort。

他强调,团队做了深入的评测来确认,这不影响模型性能。

Opus 5大降智,是真的

刚解决掉Fable的问题,Chubby又直言,Opus 5现在感觉像是一次显著的降级。

它总是敷衍了事,频犯低级错误。一旦被指出没按指令执行,它就只会机械地回复那句——

你说得对,是我疏忽了。翻来覆去,没完没了。

其实,早在几天前,有人就发现了Opus 5明显「降智」的问题。

除了上面提到的问题,它还会制造bug,然后耗费大量时间修bug,同一任务中反复自我纠正…….

在被网友追着问了一圈之后,工程师Thariq公开承认——Opus 5是个「表现很不稳定」的模型,忽高忽低,不稳定。

团队内部正在为努力解决这一问题,这对我们来说是最高优先级。

02、跑分永远向上,体感一路向下

Opus 5这场风波,撕开的其实是整个行业最尴尬的一道口子:

跑分和体感,正在系统性地脱钩。

一边是亮眼到近乎无可挑剔的成绩单:综合得分82.72、SWE-bench Pro 79.2%、Terminal-Bench 86.7%。

另一边,却是用户截然相反的真实感受:「啰嗦」「偷懒」「爱抬杠」。

最荒诞的地方在于,两种评价同时出现在了Opus 5身上。

而且,「模型变笨」也并非Anthropic一家的问题。

如今,大模型的版本更新,正在变成整个AI行业最不透明的黑箱。

传统软件有语义化版本号,有更新日志,也有回滚机制。开发者可以清楚地知道,自己正在使用哪个版本,发生了哪些变化。

大模型,就不同了。

同一个模型名称之下,服务端可能随时进行A/B测试、更换量化方案、调整模型路由,甚至改变推理资源。

人们手里唯 一的仪表盘,只剩下自己的体感。

偏偏直觉,是最容易被驳回、也最难被证伪的东西。

这场风波最 大的价值,是把行业长期存在的一道暗伤,彻底摆上了台面:

当模型成为基础设施,稳定性就是一份信任契约。跑分可以用来营销,稳定性只能靠一次次兑现。

最新快讯

2026年08月24日

15:21
鼓狮财经8月24日电,英国南安普敦大学近日发布新闻公报说,该校研究人员领衔的国际团队首次在室温下实现多个微型激光器自发同步,形成一种相干且可重构的光源。这项成果可能成为迈向成本更低、可重构且更易普及的光子计算技术的第一步。公报介绍,光子计算机利用光子而非电子处理数据,具有速度快、可同时处理更多数据以及能耗较低等优势。据介绍,该系统采用成熟材料,为未来开发实用...
15:21
鼓狮财经8月24日电,国内商品期货多数收涨,集运欧线涨超5%,乙二醇涨超4%,焦炭涨近3%,沪金、铂、纯碱涨超2%,玻璃、液化气、碳酸锂、热卷、沪银、红枣、铁矿石涨超1%。跌幅方面,苹果、多晶硅跌超2%,鸡蛋、菜油、PTA跌超1%。
14:49
8月24日,北交所将迎来新股华汇智能(920289)的申购。该股发行价格为17.71元/股,发行市盈率为14.99倍,显著低于行业平均水平的45.26倍。根据测算,顶格申购预计需冻结资金约1279.55万元,若中签一手(100股),所需资金约为718万元至760万元。鉴于当前A股打新市场整体收益可观,建议投资者积极关注并参与申购。 华汇智能注册地位于广东省东...
14:49
鼓狮财经8月24日电,据农业农村部监测,8月24日“农产品批发价格200指数”为115.60,比上周五上升0.02个点,“菜篮子”产品批发价格指数为116.14,与上周五持平。截至今日14:00时,全国农产品批发市场猪肉平均价格为16.24元/公斤,比上周五上升0.4%;牛肉68.55元/公斤,比上周五下降0.2%;羊肉65.71元/公斤,比上周五上升0.2...
14:49
据鼓狮财经8月24日报道,日经225指数收盘下跌0.74%,报收65528.09点。个股表现方面,铠侠跌幅达6.24%,软银集团下跌5.33%,爱德万测试下跌3.9%,仅任天堂上涨2.26%。与此同时,韩国KOSPI指数收盘下跌3.12%,报收6696.96点。个股方面,三星电子重挫8.7%,SK海力士下跌3.4%。
14:20
英伟达再次掀起涨价潮!据彭博社报道,部分英伟达大客户已收到通知,明年初交付的AI服务器价格可能上调15%以上。此次涉及的产品包括现有的Grace Blackwell系列,以及下一代旗舰Vera Rubin。具体涨幅将根据GPU代际和内存配置有所不同。The Information指出,部分GB300和Vera Rubin 200系统预计涨价约17%。按照该报...
14:20
Anthropic 突然亮出了两张新牌,却被提前曝光了。今天,第三方开发者应用和 Discord 社区接连出现了两个陌生的模型 ID——claude-marshmallow-eap 和 claude-melon-eap。早期实测显示,Marshmallow 表现更强,对话自然度甚至反超 Opus 5,而 Melon 则稍逊一筹。不过,它们目前的综合能力并未达...
14:20
就在这两天,AI圈因为一头来历不明的牛,又炸了!8月21日,一个叫Ox Alpha的模型悄没声地出现在OpenRouter和OpenCode上。免费开放一周,支持1M上下文,文本、图片和视频都能读。Ox就是牛,再加上最近抽象电影《牛来》的梗火遍全网,于是国内网友干脆给它安排了个亲切昵称,「牛来」大模型。然后,这头牛一上来就把桌子给掀了。01...
14:16
受多重因素冲击,A股市场CPO概念股跌幅不断扩大。其中,天孚通信跌超11%,可川科技、共进股份10CM跌停,锐捷网络、唯特偶、中际旭创、沃格光电、新易盛、中京电子跌超9%,光迅科技、太辰光得超8%。消息面上,市场担忧CPO技术可能改变现有产业链格局,影响传统可插拔光模块的市场地位。近日,SK海力士与弗吉尼亚大学等机构在顶级期刊《自然·电子学》联合发表论文,系...
14:16
今日亚太股市开盘即遭遇重挫,主要市场无一幸免。韩国市场首当其冲,权重股三星电子盘中暴跌超8%,引发大盘剧烈震荡,首尔综合指数一度跌逾3%。SK海力士同样未能独善其身,日本市场的铠侠及日经225指数也随之下挫。港股恒生科技指数下挫近4%,A股的AI、CPO及机器人板块亦全线走低。究其原因,主要是四股利空力量共振所致:三星电子股东回报方案遭冷遇、港股大规模折价配...
14:16
美国对伊朗制裁细则即将公布,国际油价出现获利回吐。截至8月24日发稿,纽约原油与布伦特原油双双下跌逾1%,分别报85.65美元/桶和91.33美元/桶。美东时间24日下午2点,财政部长贝森特将公布对伊朗“史上最严厉经济制裁”的具体内容,部分投资者选择落袋为安。此前受美伊冲突升级推动,布伦特原油自8月5日以来累计涨幅已超15%。 美伊谈判窗口已于上周结束,双方...
14:13
鼓狮财经8月24日电,据市场监管总局发布的信息,近日,《车用压缩天然气》(GB18047—2026)强制性国家标准正式获批,并将于2027年8月1日起实施。 本次标准修订重点新增了甲烷值和互换性两大要求。标准明确指出,车用压缩天然气的甲烷值不得低于65,这一指标与欧洲标准保持一致。若甲烷值低于70,加气站须在经营场所显著位置向社会公示具体数值。此外,标准还要...