关于 Claude Code 是否存在浪费 Token 的现象,大家众说纷纭,究竟差距有多大?近日终于有了具体的测算数据。
Composio 团队进行了一项有趣的对比实验,他们使用同一模型 Kimi K3,分别在 Claude Code、Hermes 和 Kimi Code 三个 Agent 框架中运行了 28 个完全相同的任务。
结果显示,三个框架在任务成功率上表现相当:Kimi Code 成功 22 次,Hermes 21 次,Claude Code 20 次,差异微乎其微。然而,真正拉开差距的是 Token 消耗量。在相同任务下,不同框架的 Token 用量差异高达 30 倍。
中位数数据显示,Kimi Code 消耗约 6.1 万 Token,Hermes 约为 6.7 万,而 Claude Code 高达 34 万,几乎是 Kimi Code 的 6 倍。以 Kimi K3 每百万输入 Token 价格 3 美元计算(Agent 工作流中输入 Token 通常占比约 95%),平均每项任务的成本为:Kimi Code 约 0.22 美元,Hermes 约 0.28 美元,Claude Code 则高达 2 美元。差距十分明显。
在速度方面,Hermes 表现最快,耗时 179 秒;Kimi Code 为 297 秒;Claude Code 最慢,需 348 秒。因此,最快的是 Hermes,最省 Token 的是 Kimi Code,两者并不重合。
Composio 团队据此得出结论:若想降低 Agent 成本,应优先审视所使用的框架,而非急于更换模型。他们的数据显示,Harness 本身就能将成本拉开 9 倍,而模型的能力表现其实差不多。
Sebastian Raschka 看到这个结果后也分享了类似观察,指出 Claude Code 在成功率相近的情况下,Token 用量往往是其他框架的 2 到 3 倍。他推测原因可能是未优化、存在 Bug,或是故意设计(以应对更复杂任务)。他进一步指出,Claude Code 多消耗的 Token 主要来自输入端,而非输出端。日志显示,其框架在多轮交互中会重复累积大量上下文,导致输入 Token 激增。
这一测试结果揭示了一个不容忽视的趋势:Harness 的重要性已与模型本身并驾齐驱。
Writer 公司的最新论文对此进行了系统验证:在 22 个企业任务中,仅替换编排层,成本即可降低 41%,延迟缩短 44%,Token 消耗减少 38%,而任务完成质量基本持平。在性价比方面,每美元成本所能获得的质量提升高达 82%,同时每百万 Token 能完成的任务数从 54.9 跃升至 92.0。
既然模型已如水电般基础,Harness 便成了决定电费账单的关键因素。这或许印证了从“模型即产品”向“Harness 即产品”的转变。
Harness 如此关键,未来是否需要引入“Harness 税”的概念来衡量成本?特别是在工具调用和重试进入循环时,这种成本并非线性增长。未来的 Agent 竞赛,上半场比“能不能做”,下半场比“谁更省”,而省钱的秘密在于 Harness。
在跑 Agent 的过程中,你是否有类似体验?欢迎在评论区分享。
