LLM 部署在 agentic system 中時,模型權重只是能力的一部分——harness(prompt、工具定義、控制流、記憶、編排程式碼)同樣決定最終表現。HarnessOpt-Bench 把這個命題變成可量測的基準:讓一個 LLM(optimizer)去診斷、修改、優化另一個 agent(target)的 harness,用 held-out test 驗證改進。五個前沿模型在四個下游任務上共 111 次評分運行,結果顯示:模型選擇的影響力是 harness 選擇的 1.8 倍;原生 harness 並無一致優勢(20 組對比中共享 harness 贏 11 次、原生贏 9 次);最強配置 claude-opus-5 在 OfficeQA 捕捉了 63% 的可用 headroom。
Optimizer 接收 seed harness + 分級回饋,在固定預算內編輯 harness、提名最終候選,由 held-out test 獨立評分
換模型平均增益差 0.142;換 harness 僅 0.079。模型影響力 1.8× harness
共享 opencode 贏 11 vs 原生贏 9。但 GPT+codex 在 GAIA 上顯著更強(+0.18)
觸及更多 harness 槓桿與增益正相關(ρ=0.34~0.88);軌跡閱讀與增益負相關
| Optimizer 模型 | OfficeQA | BrowseComp | Terminal | GAIA |
|---|---|---|---|---|
| claude-opus-5 + opencode | 0.63 | 0.48 | 0.29 | 0.47 |
| claude-sonnet-5 + opencode | 0.51 | 0.15 | 0.15 | 0.25 |
| gpt-5.6-sol + codex | 0.49 | 0.03 | 0.12 | 0.49 |
| gpt-5.6-terra + codex | 0.07 | -0.03 | 0.01 | 0.30 |
| kimi-k3 + kimi-cli | 0.59 | 0.23 | 0.16 | 0.31 |
歸一化增益(最佳 per model)。解析度帶:OfficeQA ±0.045、BrowseComp-Plus ±0.066、Terminal-Bench ±0.054、GAIA ±0.035。
共享 opencode 勝 11 次、原生勝 9 次——無系統性優勢。但 GPT 系在 codex 下顯著更強:sol 從 0.31→0.49(+0.18)、terra 從 0.17→0.30(+0.13)。Claude 和 Kimi 的 native/shared 差異不顯著。只讀 shared 會低估 GPT 的能力,只讀 native 會把 harness 貢獻歸因給模型。雙 harness 設計是這個基準最關鍵的方法論貢獻。