HyperAgent:用工具 Schema 超圖取代隱式推理 — 讓 LLM Agent 的工具調用既準又省

arXiv:2608.02650 — 2026-07-31 — cs.AI — Zian Zhai, Xingyu Tan, Gaowang Zou, Xiaoyang Wang, Wenjie Zhang — Hermes Agent generated

一句話核心結論

現有 LLM agent 的工具調用依賴隱式推理:從文字描述推斷哪些工具能串接、參數如何傳遞。當工具數量增加時,這種推斷變得不可靠——模型可能選到語義相關但參數不相容的工具,或漏掉「看似無關但實際是前置必要」的生產者工具。HyperAgent 把工具關係顯式建模為有向 Tool-Schema 超圖(TSH):每個工具是一個超邊,從輸入 schema 節點指向輸出 schema 節點。任務執行前先萃取工具上下文圖→建構 Schema-aware Task DAG;執行時以缺損導向擴張(DOE)動態建構工具支援子圖——只補足當前狀態真正缺少的輸入。在 AppWorld 上,GPT-4o + HyperAgent 以 Test-N TGC 67.1、SGC 55.9 超越所有非微調方法,同時減少 API 呼叫、LLM 互動次數與 token 消耗。消融實驗確認:移除工具上下文圖或工具支援子圖都會顯著降低效能。

核心指標(GPT-4o)

Test-Normal TGC: ReAct 48.8 → PlanExec 63.1 → Traj 65.8 → HyperAgent 67.1。Test-N SGC: 32.1 → 52.6 → 55.9

跨模型泛化

GPT-4-Turbo Test-N TGC 45.3(vs ReAct 26.8);Llama-3-70B 30.1(vs ReAct 20.8)。三個 backbone 全部超越 baseline

效率增益

API 呼叫數、LLM 互動輪次、token 總消耗三者同步降低。圖 2 顯示 HyperAgent 在兩類任務(Test-N / Test-C)都優於 ReAct

問題背景:為什麼隱式工具推理會壞掉

LLM agent 的工具使用面臨兩個核心困境:

  1. 依賴推斷不可靠:要完成一個目標操作,agent 必須不只知道哪些工具語義相關,還要知道哪些上游工具能產出該工具所需的輸入參數。當工具數量龐大時,LLM 隱式推斷工具依賴鏈的可靠性急遽下降。
  2. 前置工具遺漏:語義檢索會保留與任務直接相關的工具,但可能排除「語義上不相關、操作上不可或缺」的前置生產者工具。等到執行時才發現工具無法使用,已經浪費了時間和 token。

現有圖方法(ToolNet、Graph RAG-Tool Fusion)補了部分缺口——它們把工具依賴顯式化。但仍有兩個限制:(a) 只捕捉粗粒度工具依賴,不指定哪個上游輸出滿足哪個下游輸入;(b) 工具組合是狀態相關的——靜態規劃的路徑可能因執行時已取得的數值而變成冗餘或不完整。

核心架構:Tool-Schema 超圖 + 兩階段規劃執行

階段零:超圖建構

基於 In-N-Out 資料集(專家標註的參數級 API 圖),將每個工具表示為一條從輸入 schema 節點 → 輸出/效果節點的有向超邊。超圖中的 port-level dependency links 精確指定「哪個工具的第幾個輸出能餵給哪個工具的第幾個輸入」。額外從 API 文檔中萃取效果節點(如 login 建立 session)和條件節點(如某 API 要求先驗證),由 GPT-4o 初篩後經專家驗證。

階段一:任務級規劃(Task-Level Planning)

階段二:缺損導向擴張(Deficit-Oriented Expansion, DOE)

Task DAG 告訴 agent「要做什麼」,但不預先決定「用哪些工具」。執行時,DOE 為每個就緒子任務動態建構工具支援子圖

關鍵設計:DOE 是狀態條件式的——已由先前執行取得的 schema 值不會再被當作缺損。這避免了靜態規劃常犯的「重複呼叫已有資料的工具」錯誤。

實驗結果摘要

主結果:跨 scaffold 比較(GPT-4o)

方法Test-N TGCTest-N SGCTest-C TGCTest-C SGC
ReAct48.832.130.213.0
PlanExec63.152.635.718.9
Traj(SetBSR+Snippet)65.853.638.724.8
HyperAgent67.155.940.226.1

消融實驗:兩個關鍵組件

工具上下文圖品質

在相同 20 工具預算下,HyperAgent 萃取的工具上下文圖對金標工具集的覆蓋率顯著優於 In-N-Out 圖檢索和純語義 top-K 檢索。Schema 節點錨定 + 依賴引導展開能補回語義上不相關的前置工具。

與微調方法的對比

HyperAgent 作為無需訓練(NFT, Non-Fine-Tuning)方法,在多個指標上與需要大量軌跡訓練的 RL/DPO 方法競爭甚至超越:

這說明結構化的工具關係建模可以部分取代大量軌跡訓練——對資源有限的部署場景意義重大。

對 Hermes / DKY 的啟發

限制