Meta 推出了 Muse Code 开放测试,安装仅需一条命令。与此同时,最新的大模型 Muse Spark 1.2 也完成了更新。虽然相比 1.1 版本,提升幅度看似有限,但 Meta 提供了一个“贡献者”版本,只需同意上传数据,即可享受 0.5 折优惠,立省 95%,价格甚至比 DeepSeek 更低。Meta 显然是不惜成本也要收集数据,其意图路人皆知了。
01、Muse Code 环境详解
Muse Code 旨在处理完整的工程任务,包括在大型代码库中理解需求、规划变更、跨文件修改、编写代码以及验证结果。在官方演示中,用户只需将一段房屋航拍的 MP4 视频输入终端,Muse Code 便能解析视频内容,进而生成一个度假屋的营销与预订页面,并直接在浏览器中验证成品。
在架构设计上,Muse Code 采用了一个简单的主循环配合一组异步后台智能体。与传统的“遇到子任务才临时派生智能体”不同,这些后台智能体在整个会话中保持活跃,能够自主推进下一步工作,并自主决定何时向主智能体反馈。这意味着,一个已经扫描过项目结构、依赖关系、测试配置和历史改动的后台智能体,无需在新任务中重复进行探索。
后台观察智能体围绕记忆召回、技能召回、目标追踪和验证四个维度运行。前三项默认启用,验证观察器默认关闭。需要注意的是,这些观察器自身也会发起模型调用,因此会产生额外的 Token 开销。
当任务可以拆解为相对独立的若干部分时,Muse Code 会将工作分派给多个子智能体。开发者可以通过 `muse –subagent-worktree-isolation` 启用隔离模式。此时,每个子智能体都会从主提交点创建独立的 Git Worktree,在各自的目录中进行修改和独立提交,确保主工作副本不被直接改动,最后由主智能体进行审查或合并。
运行时还包含一层本地事件日志。每一次模型调用、工具运行、审批和编辑都会被追加写入,作为唯一的事实来源。这使得系统具备精确回放和重启安全的能力。执行中断后,智能体可以从停止点继续,而非重新提示或猜测状态。这份日志还构成了可审计的时间线,记录了哪个智能体何时调用了什么工具、获得了什么结果、执行了哪些改动,以及在哪一步被批准或取消。
Muse Code 内置了几个默认技能:`/plan` 将任务转化为需审批的计划,`/grill` 反复压力测试计划,`/goal` 朝指定目标推进。兼容性方面,它支持内置、用户级和项目级三层技能管理,并扫描 `.codex/skills` 和 `.claude/skills` 目录,支持从 Claude 或 Codex 导入技能。此外,它还通过 MCP 连接外部工具,通过 hooks 接入生命周期事件。
02、Muse Spark 1.2 训练与能力
Muse Spark 1.2 是 Muse Spark 1.1 与 Harness 一起训练的产物。Meta 显著增加了编程任务上的训练算力,并扩展了训练环境的多样性。改进主要集中在代码生成、复杂调试、代码库理解和端到端开发流程上,同时保留了通用智能体能力。
Muse Spark 的训练深度结合了 Muse Code。训练素材包括经过拒绝采样的 Harness 轨迹,以及针对目标设定、上下文压缩和子智能体的配方优化。Muse Code 的工具集也被直接整合进训练中,以最大化模型与运行时的兼容性。
为了提升长时程能力,模型被应用于整仓库生成、大型端到端项目和自动研究等任务。通过规划来排序工作,利用目标条件化维持方向,并使用上下文压缩保留推进所需的知识。此外,还建立了一条自我改进回路:利用上一代 Muse Spark 1.1 生成高难度的编码环境和指令遵循模板,再由模型对候选解进行打分,形成可规模化的训练数据,从而提升 1.2 版本的复杂指令遵循能力。
Meta 还展示了一个高强度案例:在英伟达 Hopper GPU 上迭代优化 KDA 和 MLA kernel,执行了超过 1000 次工具调用,最长运行时间达 24 小时。在不得直接导入第三方 kernel 库的限制下,模型自行编写、编译、剖析并逐步改进实现,最终相比给定基线取得了显著性能提升。
