Fable 5.1和Mythos 5.1于凌晨突然上线。上一代Fable 5几乎成为了SOTA模型的代名词,光环未退,Anthropic便已开始自我迭代。两款模型同步发布,定位有所区分:Fable 5.1面向普通用户及企业,而Mythos 5.1则将同等的前沿能力开放给“经过验证的网络安全与生命科学机构”。在定价策略上,基础价格维持不变,Fable 5.1的输入Token仍为10美元/百万,输出Token为50美元/百万。然而,缓存读取价格大幅下调75%,从1美元/百万Token降至0.25美元/百万Token。
性能提升主要集中在长时间、多步骤的Agent任务上。Terminal-Bench-Science成绩从24.7%大幅跃升至52.6%,AutomationBench则从17.1%提升至31.4%。值得注意的是发布的时间节点——这极有可能是Anthropic公开递表前的最后一次重量级模型发布。几天后便是9月7日美国劳动节,按照The Information的披露,Anthropic可能在劳动节后正式公开招股书,并在9月中旬举行投资者日,最快于9月底至10月初上市。此外,Anthropic此前“明升实降”调整额度的余波也出现在了新模型发布的评论区中。8月29日,Anthropic宣布9月14日起将“标准周额度”提高25%,但这相对于旧标准计算,与用户当前实际使用的临时额度相比,实际反而下降了17%。Fable 5.1刚刚上线,就有用户追问Anthropic,能否给出“更透明、更慷慨”的会话和每周额度。
若仅看规格,Fable 5.1并非一次幅度巨大的升级。它延续了Fable 5的100万Token上下文窗口和128K输出长度,基础价格也保持不变:每百万输入Token 10美元,每百万输出Token 50美元。在当前的旗舰模型阵容中,Fable 5.1依然属于明显更贵的一档:按同等算力计算,其价格约为GPT-5.6 Sol的2.5倍,GLM-5.3的10倍以上。Anthropic官方甚至建议,大多数任务优先从价格只有一半的Opus 5开始,只有面对高难度推理、长时间Agent任务或Opus 5在高effort下仍显不足时,才应使用Fable 5.1。
值得关注的变化发生在Agent持续运行的成本上。Fable 5.1的5分钟和1小时缓存写入价格仍为12.5美元和20美元/百万Token,但缓存读取价格从Fable 5的1美元/百万Token大幅降至0.25美元,相当于削减了75%。缓存读取允许后续请求复用已处理的上下文,对于普通问答未必重要,但对于连续运行数小时的Agent,需反复读取系统提示词、代码库和工具定义,成本占比极高。Anthropic基于8月四周的实际使用数据测算,相同任务从Fable 5换到Fable 5.1,典型工作负载整体成本预计下降约25%,对于上下文更重、工具调用多的复杂Coding和高度Agent化任务,降幅最高可达约45%。这意味着,虽然Anthropic没有降低基础价格,但专门降低了模型“长时间工作”的成本。
此外,这种降价主要发生在API和其他按Token结算的场景。对于直接订阅Claude Code的用户,另一套“额度账”引发了争议。8月29日,Claude Developers官方账号宣布,从9月14日起,Pro、Max、Team和按席位收费的Enterprise套餐,Claude Code的“标准周额度”将提高25%。然而,问题在于,此前Anthropic已临时将额度提高了50%,且该临时额度将维持至9月14日。若将原始额度记为100,现在用户实际拿到的是150,而9月14日后则变为125。名义上相对旧标准“提高25%”,相较用户当前实际使用的额度,却减少了约17%。Anthropic随后确认了这一计算。在Fable 5.1发布后的评论区,也有用户继续追问Anthropic,能否给出“更透明、更慷慨”的会话和每周额度。
从性能变化来看,Fable 5.1确实越来越像一个专为长时间任务准备的模型。在Anthropic公布的Benchmark中,提升最显著的是Terminal-Bench-Science 0.1,从24.7%提高到了52.6%,几乎翻倍。Terminal-Bench 4.0从42.0%提高到55.8%,面向复杂商业工作流的AutomationBench则从17.1%提高到31.4%。然而,在更传统的推理和Coding Benchmark上,提升幅度则相对温和。早期企业测试也在重复这个趋势。Browserbase在其最难的浏览器Agent Benchmark中,让Fable 5.1完成了82%的任务,Opus 5为74%,Fable 5只有57%。Ramp的一次测试里,Fable 5.1在无人干预的情况下连续运行了38个小时。它先发现此前一个机器学习实验的结果其实受到了标签伪影的影响,随后自行修正问题,同时启动6组并行实验跑了一整夜,最后带着新的实验结果和下一步建议回来。在另一次开放式任务中,Ramp只让它寻找“没人负责、但最值得解决的问题”,它自己找到了一个与生产事故有关、尚未有人处理的告警,调取日志并给出了修复方案。Canva给出的反馈则更偏向生成质量。其测试认为,Fable 5.1的文字表达更容易理解,也更能遵循写作规范;在与Fable 5的盲测中,Canva更偏好5.1的输出。并且,在Canva Code里,Fable 5.1直接做出了一个节奏游戏:不仅生成了关卡和真实音乐,还让玩法节奏与音乐拍点对应。Canva称,这是他们测试过的其他模型都没有做到的。从Benchmark到企业测试,Fable 5.1这次最明显的提升在于,它开始更稳定地把复杂任务完整做完:既能在几十个小时的任务里持续判断、纠错和推进,也能在一次生成里把文字、代码、音乐和交互组织得更完整。
Claude进入实验室。Fable 5.1和Mythos 5.1看起来像两款模型,但Anthropic在官方文档里说得很明确:Mythos 5.1与Fable 5.1“identical”,区别仅为经过审核的用户提供了“更宽松的安全限制”。Fable 5.1面向普通用户和企业,涉及网络安全和生命科学中的部分高风险能力时,会受到额外限制;Mythos 5.1则通过受信任访问计划,将限制较少的同一套能力开放给经验证的网络安全和生命科学机构。两者的Benchmark成绩差异主要源于此。在测试Agent终端操作和复杂任务执行能力的Terminal-Bench 4.0上,Fable 5.1是55.8%,Mythos 5.1则达到60.9%。Anthropic的解释是,这并非因为Mythos底层能力更强,而是部分网络安全任务触发了Fable的安全限制;当这些限制减少以后,两者的差距也应随之缩小。
这次发布里,Anthropic把相当大的篇幅留给了科研能力,而这部分也主要由Mythos 5.1展示。其中最抢眼的实验,是让Mythos 5.1直接设计蛋白质binder。Anthropic将其接入开源工具,自行设计binder并送至外部机构验证。结果显示,在12个靶点上,命中率接近50%,而当前蛋白质设计常见命中率仅10%至15%。其中三个靶点的设计结合亲和力,比Adaptyv Bio蛋白质设计比赛中的方案高出约10倍。这里值得注意的并不是Claude又会了一道生物题,它真正做的是一段更完整的科研流程:调用专业工具进行分子设计,再把设计送进真实实验环境验证。类似的事情也发生在计算科学里。Fable 5.1利用NASA Magellan任务遗留的雷达数据,训练神经网络重绘了约三分之一的金星表面高程地图,分辨率从10-20公里提升至2-3公里,准确度提高约25%。这份地图随后被以Creative Commons许可公开,希望能为NASA的VERITAS和欧洲航天局的EnVision金星探测任务提供参考。此外,Mythos 5.1还做了一件更加工程化的事情。生物学研究经常需要反复运行蛋白质和基因组深度学习模型,GPU速度直接决定很多实验要花多少时间和钱。Mythos 5.1针对7个开源模型自行编写定制GPU Kernel,并缓存中间计算结果,最终在保持输出完全一致的情况下,把推理速度最高提高了2.5倍。Anthropic估算,在一些全基因组分析任务里,这些优化可以把GPU成本降低30%到60%。
把这些案例放在一起,Anthropic对Claude科研能力的定义已经发生了变化。过去谈AI for Science,很多时候还是让模型读论文、检索资料、写代码或者解释结果。到了Fable 5.1和Mythos 5.1,Claude开始进入更长的科研流程。这条路甚至已经开始从软件走向真实实验设备——就在Fable 5.1发布前一周,Anthropic开放了Model Hardware Standard的研究预览,希望让AI Agent能够直接操作显微镜、液体处理设备和机械臂等实验室硬件。随着能力往科研和高价值任务里走,Anthropic不仅需要面对“该向谁开放”的安全问题,也越来越在意另一件事:怎么防止最核心的模型能力被别人“搬走”。Fable 5.1这次加入了更强的反蒸馏机制。Anthropic在官方公告里直接点名了一种做法:过去,API用户可以修改多轮对话里的历史上下文,同时保留Claude此前生成的thinking记录。这样一来,外部模型就有机会批量收集Claude的推理轨迹,用来训练和蒸馏自己的模型。从Fable 5.1发布当天开始,新创建的API账号已经不能再这样操作。只要修改此前的对话上下文,之前保存的thinking transcript就不能继续保留。Anthropic明确表示,这项改动就是为了封堵一种“已经公开记录的蒸馏技术”;现有账号暂时不受影响,但未来模型发布时,这一变化会逐步覆盖所有用户。企业端的安全体系也在同时补齐。Anthropic同时推出的Enterprise Frontier Safeguards(EFS),就在试图解决Fable级模型过去一个很现实的矛盾:公司既希望保留足够的数据来检测模型滥用,金融、医疗、法律等企业又不愿意把敏感数据交给模型公司长期保存。EFS的办法,是把监控所需要的数据直接存在客户自己控制的云基础设施里,而并非Anthropic的服务器。默认情况下,人工审查也由客户自己完成。Anthropic称,这套机制与超过100家来自金融、医疗、制造、电信、法律等行业的客户共同开发,将从今年秋季开始分阶段上线。从蛋白质设计、金星地图到漏洞发现,再到反蒸馏和企业安全,Fable 5.1展示的不仅仅是一个模型。Anthropic正在模型之外,补上一整套让前沿能力进入科研和企业世界的权限、安全与基础设施。
Fable 5.1之后,Anthropic就要去华尔街了。如果目前的计划没有变化,再过几天,Anthropic可能就要正式把自己的账本摆到华尔街面前。The Information最新报道称,Anthropic计划在9月7日美国劳动节之后公开IPO招股书,并在9月中旬举行投资者日,最快可能在9月底至10月初上市。公司已经在6月秘密提交了IPO文件。放在这个时间窗口里,Fable 5.1很自然地成为了Anthropic公开递表前的一次能力展示。毕竟,等招股书真正公开之后,华尔街需要判断的可不是Claude能不能再在几个Benchmark里拿到高分,而是Anthropic究竟值多少钱。今年5月,Anthropic最近一轮私募估值达到9650亿美元。到了8月,《金融时报》采访的多名投资者已经预计,Anthropic上市时的估值可能达到2万亿美元以上。投资者预计其年化收入年底可能达到1000亿至1200亿美元,其中一名投资者甚至按照公司的增长速度和30倍收入倍数,算出了3万亿美元。当然,这些目前都只是投资者自己的估值模型,最终发行价格还没有确定,而且计划随时可能调整。如此高的估值,已经很难只靠Anthropic今天赚多少钱来解释。路透社8月获得的内部财务预测显示,Anthropic预计2028年收入达到1900亿到2000亿美元。而公司的年化收入run rate,也已经从2025年底的约90亿美元,增长到今年5月的470亿美元,并在7月底进一步超过650亿美元。彭博社获得的文件还显示,公司二季度初步收入超过115亿美元,是去年同期的14倍以上,并首次录得正的调整后营业利润。而华尔街已经开始按照未来几年的价值给它算钱了。路透社称,投行和投资者正在使用2028年的收入预测给Anthropic计算企业价值/收入倍数,并把Palantir、Cloudflare和SpaceX作为不同维度的参考对象。
就在即将上市的时间点上,Anthropic仍在花大量的钱买GPU、训练模型、做推理和扩张团队。Fable 5.1发布前一周,Anthropic被曝与Nscale签下一份为期六年、价值450亿美元的算力合同,租用西弗吉尼亚州约460MW的数据中心容量。几天后,路透社又披露,Anthropic与英伟达支持的Lambda签下约350亿美元云计算合同,对应得州Nueces县约350MW的数据中心。仅这两笔新近曝光的算力承诺,就已经达到800亿美元(折合人民币约5377亿元)。这也让Fable 5.1前面那些看似分散的变化,有了另一层意义。一方面,它当然需要继续证明Claude处在前沿。Terminal-Bench-Science翻倍、长时间Agent能够无人值守运行几十个小时,至少说明Anthropic还在不断把模型能力往前推。另一方面,只证明“模型更聪明”显然已经不够。蛋白质设计、科研计算、企业Agent、网络安全,以及第二部分提到的Enterprise Frontier Safeguards,都在把Claude推向一个方向:进入那些企业本来就愿意花很多钱解决的问题。Fable 5.1降低缓存读取价格也是同样的逻辑。Anthropic没有参加基础Token的低价竞争,而是针对长时间Agent,把典型工作负载的实际成本降低约25%,高度Agent化任务最高降低约45%。模型更强,Agent可以工作得更久;工作时间越长,又必须把单位任务的算力成本压下来。这可能正是Anthropic上市以后最需要证明的一道算术题。增长已经足够快,问题是,在算力承诺也以数百亿美元的速度膨胀时,收入最终能不能跑得比成本更快。Fable 5.1的价值,不只是让Anthropic在递表前再拿下一张漂亮的Benchmark成绩单。从更长时间的Agent,到科研和高价值企业任务,再到缓存降价、安全、权限和基础设施,Anthropic正在试图证明一条更完整的链路:模型能力可以变成工作,工作可以变成收入,而收入最终可以跑赢算力。几天之后,等Anthropic公开招股书,这条链路就不再只是模型公司的产品故事。它还会变成华尔街给Anthropic定价的依据。
