Harness 还是 Agent 的壁垒吗?
过去一年,Agent 圈逐渐形成了一个共识:模型会商品化,Harness 才是壁垒。
这个判断有足够多的证据。相同模型接上不同的 context management、tool routing、memory、subagent、sandbox 和 approval,结果可以差很多。OpenAI 公布的一个例子很直接:在 ARC-AGI-3 上,保留 reasoning state 和压缩 context,把 GPT-5.6 Sol 的得分从 13.3% 提高到 38.3%,同时把 output token 降到六分之一。
既然 Harness 能制造这么大的差异,它自然应该成为 Agent 团队投入最多、最不愿交给厂商的一层。可就在大家开始谈 Harness Engineering 的时候,厂商也开始把 Harness 做成 SDK。
