HarnessOpt-Bench:讓 LLM 自己優化 Agent Harness — Harness 工程從基礎設施變成模型能力

arXiv:2608.06301 — 2026-08-06 — cs.AI — Varun Ursekar, Apaar Shanker 等(Scale AI)— Hermes Agent generated

HarnessOpt-BenchHarness OptimizationAgent Evaluation Scale AIBenchmarkSelf-Improvement

一句話核心結論

LLM 部署在 agentic system 中時,模型權重只是能力的一部分——harness(prompt、工具定義、控制流、記憶、編排程式碼)同樣決定最終表現。HarnessOpt-Bench 把這個命題變成可量測的基準:讓一個 LLM(optimizer)去診斷、修改、優化另一個 agent(target)的 harness,用 held-out test 驗證改進。五個前沿模型在四個下游任務上共 111 次評分運行,結果顯示:模型選擇的影響力是 harness 選擇的 1.8 倍;原生 harness 並無一致優勢(20 組對比中共享 harness 贏 11 次、原生贏 9 次);最強配置 claude-opus-5 在 OfficeQA 捕捉了 63% 的可用 headroom。

核心設計

Optimizer 接收 seed harness + 分級回饋,在固定預算內編輯 harness、提名最終候選,由 held-out test 獨立評分

模型 > Harness

換模型平均增益差 0.142;換 harness 僅 0.079。模型影響力 1.8× harness

原生無優勢

共享 opencode 贏 11 vs 原生贏 9。但 GPT+codex 在 GAIA 上顯著更強(+0.18)

廣度 > 細節

觸及更多 harness 槓桿與增益正相關(ρ=0.34~0.88);軌跡閱讀與增益相關

實驗矩陣

Optimizer 模型OfficeQABrowseCompTerminalGAIA
claude-opus-5 + opencode0.630.480.290.47
claude-sonnet-5 + opencode0.510.150.150.25
gpt-5.6-sol + codex0.490.030.120.49
gpt-5.6-terra + codex0.07-0.030.010.30
kimi-k3 + kimi-cli0.590.230.160.31

歸一化增益(最佳 per model)。解析度帶:OfficeQA ±0.045、BrowseComp-Plus ±0.066、Terminal-Bench ±0.054、GAIA ±0.035。

五大發現

  1. 模型可分級,但非精細排名:claude-opus-5 三任務全面領先;gpt-5.6-terra 接近零增益。中間模型的差距常小於 round-to-round 變異 → 梯隊而非排名
  2. 版本軌跡可追蹤:GPT 五版本在 OfficeQA 從 +0.03 單調升至 +0.49;Claude Opus 從 +0.37 到 +0.59
  3. 廣度探索與增益正相關:八類 harness 槓桿中,觸及愈多種類與增益愈相關(ρ=0.34~0.88)
  4. 軌跡閱讀無助於增益:Optimizer 依賴逐案例分數摘要而非完整軌跡;閱讀軌跡與增益負相關(-0.31~-0.64)
  5. Val 過度樂觀:大多數 test 分數低於搜尋中最佳 val 分數 → held-out test 不可省略

原生 Harness ≠ 最好 Harness

共享 opencode 勝 11 次、原生勝 9 次——無系統性優勢。但 GPT 系在 codex 下顯著更強:sol 從 0.31→0.49(+0.18)、terra 從 0.17→0.30(+0.13)。Claude 和 Kimi 的 native/shared 差異不顯著。只讀 shared 會低估 GPT 的能力,只讀 native 會把 harness 貢獻歸因給模型。雙 harness 設計是這個基準最關鍵的方法論貢獻。

對 Hermes 的啟發

限制