**Meta发布Muse Spark 1.3:1美元跑完60次智能体循环,掀起AI成本革命**
9月才过去三天,就有五个前沿模型接连发布。Anthropic的Fable 5.1、谷歌的Gemini 3.8 Flash、Meta的Muse Spark 1.3……AI领域的内卷程度可见一斑。就在昨晚,谷歌刚官宣Gemini 3.8 Flash成为轻量级霸主,Meta立马就来踢馆了。
扎克伯格在X平台上霸气官宣Muse Spark 1.3正式发布,强调其以前沿性能带来了近乎免费的使用体验。Meta超级智能实验室负责人Alexandr Wang连发三贴,揭秘了这款“王炸”的核心杀手锏。他表示,相比1.2版本,1.3版本减少了无效轮次,工具调用次数减少约20%,Token消耗减少约25%,并在长周期任务中能更好地保持需求,用户能明显感受到这次性能飞跃。
Muse Spark 1.3的发布,让昨晚刚面世的Gemini 3.8 Flash略显尴尬。跑分显示,Muse Spark 1.3的提升幅度更大。在Artificial Analysis的智力指数中,其Max推理强度下达到62分,稳稳跻身当前顶尖梯队。短短五个月,Meta已不知不觉迭代了四个版本。
面对竞争,Alexandr Wang毫不掩饰对谷歌的嘲讽:“在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。”
谷歌确实有些被动。GPT-5.6把持王座,Fable 5.1后来居上,Gemini 3.8 Flash正试图弯道超车,而Muse Spark 1.3的出现直接打乱了所有人的阵脚。在最能体现模型真实长程编程能力的DeepSWE v1.1基准测试中,Muse Spark 1.3直接超越Opus 5和GPT-5.6 Sol,把Gemini 3.8 Flash甩在身后,拿下最高分。具体成绩为:Muse Spark 1.3:75.4分,Claude Opus 5:74.0分,GPT-5.6 Sol:73.0分。
不仅如此,在其他关键开发者指标上,Muse Spark 1.3也表现不俗。在SWEAtlas CodeBase QnA中得分59.4,超越GPT-5.6 Sol和Opus 5;在Terminal-Bench 2.1中得分88.8;在MRCR 512K-1M测试中更是拿到惊人的98.1分(相比之下GPT-5.6 Sol仅73.8分)。在Agent能力上,它也基本追平了最前沿水平。在成本方面,Muse的输入成本比Fable 5低8倍,输出成本低近12倍,性价比极高。
**Less is More:1美元跑2小时的性能怪兽**
跑分高固然厉害,但好用且便宜才是开发者的兴奋点。正如Alexandr Wang所言,Muse Spark 1.3“便宜到不值一提”,它是“前沿性能,成本只是零头”。Meta走了一条与以往大模型“大力出奇迹、疯狂堆叠参数”完全不同的路——做减法。通过专门训练减少不必要的交互轮次,让输出更简洁、代码风格更干净。
开发者@SPAC89的实测案例非常震撼。使用Muse Spark 1.3 Ultra Contributor模式,配合严苛的“自我改进规则”,两个模型运行约2小时。Muse Spark 1.3不知疲倦,足足进行了20轮自我改进循环,相当于2小时内跑了60多次智能体运行,总成本竟然不到1美元!开发者惊呼这简直是一件艺术品。
在宏观定价上,Meta展现了极大诚意。新模型加量不加价,维持了每百万Token输入1.25美元、输出4.25美元的定价。贡献者版更是国外模型定价的“地板价”。Codedamn创始人Mehul Mohan直呼这是“DeepSeek定价时刻”。在同等智力水平的模型中,Muse Spark 1.3的单任务成本仅为0.55美元,是性价比的极致解。
**Alexandr Wang的狂飙与小扎的野心**
Muse Spark 1.3的横空出世离不开Alexandr Wang接手Meta超级智能实验室后的成果。他们的核心目标是什么?小扎和Alexandr Wang反复强调两个词:“智能体”和“便宜到忽略不计”。Meta看中的下一个风口是“智能体工程”。
Meta AI负责人Alexandr Wang表示,所有可用性改进都是为了服务打造7×24小时在线的个人智能体。要想让智能体24小时帮你处理邮件、写代码、分析数据,它必须具备极度聪明且稳定(长线程、不产生幻觉)以及极度便宜两个条件。Muse Spark 1.3的出现,本质上就是为这一蓝图铺路。
**狂欢背后:我们被“刷榜”骗了吗?**
不过,Muse Spark 1.3也受到了质疑。知名AI机构BridgeMind指出,这个月AI发布分数飙升,但真实体验却毫无长进,令人沮丧。有网友对Muse Spark 1.3和Gemini Flash 3.8z在后端级3D约束下做压力测试,结果两个模型的老底都被揭穿:Muse Spark 1.4并没有那么好,而Gemini Flash 3.5纯纯在刷榜。
现在的实验室已陷入“为了跑分而训练”的怪圈。Muse Spark 1.3也露出了马脚,在AA-Omniscience测试中,xhigh和max版本都有所下降,原因是“弃权率”变高了——当不确定时更倾向于不回答而非胡编乱造,这降低了幻觉率,但也说明知识储备并没有跑分提升得那么夸张。
**大模型的下半场,到底比什么?**
Muse Spark 1.3和Gemini 3.8 Flash的发布,让我们得出几个判断。首先,基座模型的“参数红利”正在见顶。单纯靠扩大参数规模提升智力的路径,边际效益越来越低。未来,谁能像Muse Spark 1.3一样,在系统架构上引入“循环深度”推理机制,在工具调用上做极致的“减法”,谁就能获得真正的体验跃升。
另外,“智能体工程”才是胜负手。大模型之争已从“谁更会说话”转向“谁更能干活”。未来的核心壁垒不是单一跑分,而是在极低成本下,长程任务的真实落地能力。像Muse Spark 1.3这样,用不到1美元跑完60次试错循环的模型,将彻底重塑商业模式。
