Claude Code 被指浪费 Token,实验揭示 harness 对 Agent 成本影响超模型!

Claude Code 被指浪费 Token,实验揭示 harness 对 Agent 成本影响超模型! 【导语Composio 团队实验对比 Claude Code、Hermes 和 Kimi Code 等不同 agent 框架harness揭示了它们在任务成功率、token 消耗和速度方面的差异凸显了 harness 对降低 agent 成本的重要性。】Claude Code高成本的背后Composio 团队进行了一项有趣的对比实验用同一模型 Kimi K3 分别在 Claude Code、Hermes 和 Kimi Code 三个 harness 里跑 28 个相同任务。结果显示三者任务成功率差距不大Kimi Code 成功 22 个Hermes 成功 21 个Claude Code 成功 20 个。然而在 token 消耗方面Claude Code 却远远高于其他两者。中位数来看Kimi Code 约用 6.1 万 tokenHermes 约 6.7 万而 Claude Code 直接飙到 34 万约是 Kimi Code 的 6 倍。按 Kimi K3 每百万输入 token 3 美元的价格算平均每个任务成本Kimi Code 为 0.22 美元Hermes 为 0.28 美元Claude Code 则高达 2 美元。速度差异谁能拔得头筹在速度方面不同 harness 也表现出明显差异。中位数耗时上Hermes 最快为 179 秒Kimi Code 为 297 秒Claude Code 最慢为 348 秒。由此可见最快的 Hermes 和最省 token 的 Kimi Code 并不重合。Token 消耗根源输入累积之困Sebastian Raschka 分析发现Claude Code 在成功率相近的情况下token 用量往往是其他很多 harness 的 2 到 3 倍。差异主要出在输入 token而非输出 token。日志显示Claude 的 harness 在多轮交互中会反复把更多上下文塞回模型包括之前的消息、工具调用、命令输出和文件内容。例如某次 Claude 跑完用了约 57.8 万输入 token但输出只有约 4500 token跨了 25 轮。这表明 Claude 的 harness 在多步 agent 运行时会累积或计入更大的 prompt 端历史。Harness 重要性凸显成本与效率的关键Writer 公司的论文通过控制变量实验进一步证明了 harness 的重要性。在 22 个企业任务和 6 个基础模型固定不变的前提下仅替换编排层为自家 Harness实验结果显示每项任务平均成本降低 41%从 0.21 美元降至 0.12 美元中位延迟缩短 44%从 48 秒降至 27 秒Token 消耗量减少 38%从 14.2k 降至 8.8k而任务完成质量基本持平。在性价比方面每美元成本所能获得的质量提升高达 82%每百万 Token 能完成的任务数从 54.9 跃升至 92.0。编辑观点实验结果清晰表明 harness 对 Agent 成本和效率影响重大未来 Agent 竞赛中harness 将成为关键竞争点企业和开发者需重视其优化。