Muse Code 资料测评:输出便宜 21 倍的那一档,代价是把代码交给 Meta 训练
原创 · 约 13 分钟阅读 · 阅读 --

Muse Code 资料测评:输出便宜 21 倍的那一档,代价是把代码交给 Meta 训练

作者: Alex Xiang


古董级程序员,大厂出来后一直在创业公司,现在仍在一线做 AI 相关开发。这篇文章是终端编程 Agent 系列的最新一篇:之前写过 Codex、Claude Code 和 Cursor 的对比,这次轮到 Meta 的第一款编程 Agent。

2026 年 8 月 5 日,Meta 正式发布第一款编程 Agent:Muse Code,一个跑在终端里的 beta 工具,背后是新模型 Muse Spark 1.2。发布当天没有实测条件(网络原因),所以这篇是资料型测评:所有数字都来自 Meta 官方发布和可查的第三方公开评测,凡是厂商自报、没有独立验证的结论我都会明确标注,不编造实测结果。

先说结论,给三类读者:

  • 开源或低敏项目:贡献者档(contributor tier)的价格是全场最低,输出每百万 token 0.2 美元,值得为它花一个下午;
  • 跑长时自治任务(迁移、跨 monorepo 升级依赖):event log 和后台常驻 Agent 是这次发布最有辨识度的设计,也是唯一值得认真对待的差异化;
  • 专有代码库的团队:便宜的那一档是用代码数据换的,标准档价格并不比 Claude Code / Codex 便宜,目前没有迁移理由。

Muse Code 是什么

一句话:一个安装命令就能用的终端编程 Agent,支持 macOS 和 Linux:

curl -fsSL https://dev.meta.ai/install.sh | bash

没有 GUI,没有 IDE 插件,没有云端并行 Agent(Codex 有),发布材料里也没有提 MCP 支持。Windows 用户暂时只能走 WSL。它是 Meta Superintelligence Labs 的第一款对外产品,由 Meta 首席 AI 官 Alexandr Wang(汪滔)主导;Muse Code 与 Muse Spark 1.2 是同步开发、联合训练发布的。

Meta 给这个 Agent 预设了三个一等命令,其实是在复述老用户手工总结出的工作流:

  • /plan:先产出计划,过审批再动手;
  • /grill:拿问题攻击这份计划,找出漏洞;
  • /goal:盯住目标,推动任务走到完成。

模型与两档价格

Muse Spark 1.2 是 1,048,576 token 上下文(1M)的推理模型,通过 Meta Model API 公开预览,也可以独立于 Muse Code 调用。定价分两档,差价是这次发布最激进的部分:

计费项标准档贡献者档倍数
输入(每百万 token)$1.25$0.1012.5x
缓存输入(每百万 token)$0.15$0.00275x
输出(每百万 token)$4.25$0.2021x

差价来自数据条款:贡献者档的提示词可能被 Meta 用来改进模型,标准档不会;Meta 同时开始接受 zero-data-retention(零数据保留)的企业请求。

把价格放进一个真实的 Agent 步骤里算一算。一次典型步骤:6 万 token 仓库上下文进,3000 token 计划+补丁出:

场景单步成本每千步成本
标准档,冷启动8.8 美分$87.75
标准档,仓库上下文命中缓存2.2 美分$21.75
贡献者档,冷启动0.66 美分$6.60
贡献者档,命中缓存0.072 美分$0.72

同一个任务,最贵和最便宜相差约 120 倍。所以这本质上不是一个定价决策,而是一个数据处理决策:终端 Agent 的提示词里全是你的源码、内部 API 注释和测试夹具。侧项目选贡献者档几乎是白捡,专有代码库选哪一档,应该由能签字的人决定,而不是由看云账单的人决定。

跑分:三项基准都是第三,但差距分布很不一样

Meta 官方公布的对比(自报数据,未附方法论,以下按官方图表记录):

基准Claude Opus 5 (Claude Code)GPT-5.6 Terra (Codex)Muse Spark 1.2 (Muse Code)
Terminal-Bench 2.186.7%81.8%82.9%
DeepSWE 1.165.0%64.8%59.3%
Meta 内部编码基准(440 项任务)79.4%未公布70.6%

Terminal-Bench 2.1 上第二到第四名只差 1.3 个百分点,属于同一梯队;DeepSWE 1.1 上是 5.7 分的实打实差距。纵向对比,Muse Spark 1.2 比 1.1 提高了 6.7 分(Terminal-Bench)和 6.3 分(DeepSWE)。

这里有一个必须说破的坑:Terminal-Bench 的分数不是模型分,是 harness + model + effort 设置 的联合分数。第三方 tbench.ai 上 Muse Spark 1.1 有 80.0% 的独立记录,但按 Meta 的 +6.7 倒推,1.1 在他们内部 harness 里只有约 76%。两边都可能是真的,因为 harness 不同。所以跨厂商比跑分时,别把差距当真值,只能当方向。

另一个值得注意的细节来自第三方测量(Artificial Analysis):Muse Spark 1.2 在最高推理档的 time-to-first-token 是 26.12 秒,1.1 是 2.90 秒,智能指数只从 51 涨到 54。9 倍的首字延迟换 3 分,单独看是个奇怪的交易;但如果把 1.2 理解为“长时编程任务的引擎”而不是“聊天模型”,这个取舍就顺理成章了——没人会注意一个十二文件重构前的 26 秒规划,但每个人都会注意到聊天窗口里的 26 秒。

真正的卖点是运行时,不是分数

去掉跑分,剩下的工程主张可以概括为“别死”。两个机制撑起这个主张:

event log(事件日志)。Muse Code 把每次模型调用、每次工具执行、每次审批、每次编辑都追加到本地日志,官方说法是会话可精确回放、可安全重启:进程被杀、崩溃、机器丢失,Agent 能从上一次停止的位置继续,而不是重新推演上下文。它同时是一个完整的审计产物——自主进程对你的工作区做了什么,有一份本地记录,这正是安全评审想要、而多数 Agent CLI 给不出的东西。

async background agents(后台常驻 Agent)。和“每个子任务 spawn 一个、用完销毁”的常规 subagent 不同,后台 Agent 跨会话常驻,自己推进下一步,再决定何时向主循环汇报。省掉的是每次委托的启动成本。Meta 给出的佐证是一个 24 小时案例:超过 1000 次工具调用,自主优化 NVIDIA Hopper GPU kernel,声称比基线实现有显著提升——但没有公布提速数字,而且这是 Meta 自报。值得注意的不是结果,而是时长:1000 次调用不靠人救火,和 50 次调用的重构是完全不同的失效面。

和 Claude Code、Codex 摆在一起看

Claude CodeCodexMuse Code
模型Claude 系(Opus 5 等)GPT-5.6 系(Terra 等)Muse Spark 1.2
平台macOS / Linux / WindowsWeb + CLI(macOS / Linux)macOS / Linux(beta)
计费订阅 + API订阅/额度 + API纯 token,两档
独有能力插件与团队生态最成熟云端并行 Agentevent log 重启续跑、后台常驻 Agent、/plan /grill /goal

目前 Muse Code 明显薄的地方:

  • beta 且标得很清楚,event log 的保证没有任何第三方验证过;
  • 只有 macOS/Linux,Windows 团队要么 WSL 要么等;
  • Muse Spark 1.2 目前只有 Meta 一家渠道,单点故障是结构性的;
  • 没有 MCP 提及,没有 IDE 集成,没有云端并行;
  • Claude Code 和 Codex 已经积累了一年的习惯、插件生态和团队工作流,一个崩溃安全的日志不是搬家的理由。

结论:谁现在该装,谁再等等

适合现在装:你手上是长时自治任务——迁移、monorepo 依赖升级、任何你现在要“盯着它别跑丢”的活,拿一个 scratch 克隆给它一个下午,重点验证 event log 在真实千次调用下是否站得住。或者你是开源/低敏项目,贡献者档 0.66 美分一步的价格是当前编程 Agent 市场里最值得试的数字。

不用急:专有代码库团队(数据条款是第一位的问题)、Windows 团队、以及重度依赖 MCP/IDE 生态的人。

接下来值得盯的不是下一个跑分,而是三件事:有没有第三方真的跑完 1000 次调用验证 event log;Artificial Analysis 什么时候发布 1.2 的 agentic 细分分数(1.1 的 agentic 维度恰恰是它最弱的一项);以及 Meta 会不会补上 MCP 支持。至于想评估“模型”而不是“Agent”的人,正确做法是拿自己的 harness 去 A/B Muse Spark 1.2 和 Opus 5、GPT-5.6 Terra,官方那份 deck 当参考,别当答案。

打开原图 ↗