同一个模型、同一组任务,成功率能从 46.7% 跳到 66.7%,成本能差出 7 倍。 这不是幻觉,是 Composio 最近在 8 月 14 日发布的一项横评数据。他们选了 DeepSeek V4 Flash,让它分别跑在 8 款 AI 编程 Harness 里,结果 Pi 以 20 项通过拿下第一,Claude Code 16 项排第三,两者成本差了 7 倍。
这件事值得仔细看。过去两年,行业叙事一直是"模型为王"——谁的参数更大、谁的上限更高,谁就赢。但现在数据开始指向另一件事:决定 Agent 能不能真正干活的,可能不是模型本身,而是包裹模型的那套系统。
Harness 这个词来自赛车,指发动机外围的所有组件——变速箱、悬挂、冷却系统。搬用到 AI Agent 领域,它的含义很具体:模型只负责预测下一步,Harness 决定模型能看到什么、可以调用哪些工具、如何组织上下文、遇到错误怎么重试、以及什么时候判断任务已经完成。
Anthropic 的 Daisy Hollman 在去年 NDC 大会上给过一个比喻:工具调用原始得令人震惊。模型写一段 JSON,说想运行 bash 命令,Harness 就去执行,把输出塞回上下文窗口。整个机制就这么简单,所有复杂行为都建立在这个循环之上。
但正是这个循环里藏着一个关键变量——上下文窗口没有跟着模型能力一起增长。一年前 100 万 token 是最前沿水平,现在还是 100 万。任务越来越复杂,代码库越来越大,要把什么信息塞进这个固定大小的盒子里,正在变成一门全职的工程学科。
Daisy 的原话是:你不需要知道 LLM 权重的数学原理,只需要知道如何操控文本。 定制化就是知识,就是把模型天生所不知道的团队内部信息喂给它。
Composio 这次测试里有八个候选,结果排名分布很值得关注。
Pi 以 20/30 通过率排名第一,平均成本每任务 0.028 美元。Claude Code 和 Codex 各通过 16 项,成本分别是 Pi 的约 7 倍。Prime Agent 虽然功能最全、会话规模最大(部分会话消耗了 350 万 token),但 33 次工具调用后评分器直接超时,6 次运行未被计入成绩。
Hermes Agent 通过 15 项,OpenCode 通过 14 项。
最简单的赢了,最复杂的反而被自己的复杂度拖垮。 这个结果对"配置越多越好"的直觉提出了挑战。每增加一层抽象、每个新工具、每份庞大的指令文件,Agent 就多了一个可能迷路的地方。干净的 Harness 给模型一条从接收到完成的最短路径,臃肿的 Harness 让它四处绕路。
更具体地说,Pi 在这轮测试中几乎没有做任何自定义配置,全新安装、只接入 MCP 插件。它赢的原因不是模型更强,而是路径更短。
这也解释了为什么 Pi 搭配 DeepSeek V4 Flash 能跑出 99.93% 的缓存命中率。DeepSeek 的 API 缓存是前缀匹配——只有请求开头的 Token 序列完全一致才能命中。一套典型的 Agent 请求包含系统提示词、工具定义、对话历史和本轮新增内容。如果 Harness 每轮都在重新整理这些内容、改变工具顺序或重写摘要,缓存就会失效。Pi 的做法是在启动时注入一份稳定的环境摘要,之后只做追加不做修改,过时的工具输出在压缩前被截断。这套设计让前缀保持稳定,缓存命中率从行业平均的 94%-97% 提升到 99% 以上。
同样是 8 月中旬,DeepSeek 做了两件事:8 月 12 日深夜静默上线 V4 Pro 正式版,8 月 13 日开源了 DeepSeek Harness,采用 MIT 协议。
InfoQ 对 DeepSeek Harness 的分析指出,它的核心理念是"一切皆插件"。模型、工具、技能、会话、沙箱、存储、Agent Loop、调度和 UI,全由插件组成,可替换范围从某个搜索工具一直延伸到 Agent 如何循环、如何调度子 Agent、如何保存会话。
这和其他家的路线有明显区别。OpenAI 和 Anthropic 走的是"向下整合"——打造体验极致、深度绑定自家模型的 Harness,巩固应用层优势。DeepSeek 走的是"横向铺开"——做一个模型中立的、高度模块化的 Agent 底层标准,试图成为下一代 AI 应用的基础设施。
36氪 photon star 的分析用了一个更直白的比喻:Harness 和开源就像是免费修建的高速公路,前期用来吸引车流,当车流足够多时,顺势提高燃油价格,就是最高效的商业兑现方式。
DeepSeek 没有自己的正式 Harness 产品,第三方生态已经在围绕 DeepSeek 缓存优化做出了大量工作。开源 Reasonix 专门围绕前缀缓存设计,pi-deepseek-cache 扩展把缓存优化做到了 P0 到 P3 四个层级。输入 Token 成本从每百万 0.14 美元降至 0.003 美元,降幅 98%。
把这几件事串起来看,一个清晰的趋势正在形成。
模型能力的边际提升在减速,Harness 架构的差异在放大。 Composio 的测试数据说明:同一个模型,换个 Harness,成功率差 20 个百分点,成本差 7 倍。这说明当前 Agent 领域的瓶颈已经不在推理能力,而在工程化能力——如何让模型在有限上下文里高效工作、如何管理工具调用、如何处理错误恢复、如何优化缓存命中。
开源 Harness 正在成为基础设施竞争的新战场。 DeepSeek 选择 MIT 协议开源,Cloudflare 推出开源的 Computer 运行时,都指向同一方向:谁掌握了 Agent 的运行时标准,谁就掌握了生态入口。
提示词工程正在死亡,上下文工程正在上位。 Daisy Hollman 说得最直接:从"把信息输入模型"转向"把信息从模型输出给用户",人的注意力才是系统中最小的盒子。顶级模型不再需要详尽的提示词,简洁的目标描述反而效果更好。过度设计提示词会让模型陷入死循环。
Agent 的成功公式在重写。 过去是 Model × Tools,现在是 Model × Harness × Cache Strategy。任何一个因子为负,整体结果都会打折。Composio 的横评已经给出了初步证据——选对 Harness,同一个模型可以同时变得更可靠、更高效。
接下来的竞争,不会是谁的参数更大,而是谁的运行时更稳、谁的缓存更高效、谁的插件生态更丰富。模型是引擎,但 Harness 才是整车。
*请认真填写需求信息,我们会在24小时内与您取得联系。