Agent-as-a-Router: Agentic Model Routing for Coding Tasks

arXiv: 2606.22902 · 2026-06-22 · NUS/Alibaba/UC Berkeley/ZJU/HKUST
Pengfei Zhou et al. · GitHub
模型路由的瓶頸不是推理能力不足,而是資訊赤字。給 router per-dimension 歷史表現就提升 15.3%%;做成 C-A-F loop 累積執行經驗後,ID 和 OOD 都碾壓靜態 router。

關鍵數據: Route 表現全對照

RouterID AvgPerf%%ID CumRegOOD AvgPerf%%類型
Oracle57.00075.89理論上界
ACRouter (ours)49.98205.562.50Agent-as-a-Router
DimensionBest47.50277.4N/AStatic Heuristic
LinUCB46.84296.949.82Online Bandit
Qwen3.5-0.8B-FT46.41309.155.36Static Trained
Always-Opus 4.643.83387.157.14Single-Model
LogReg47.26284.419.64Static Trained
Random38.75533.631.25Baseline

ID: 2,919 tasks (9 coding dims)。OOD: 176 tasks (agentic programming)。靜態 classifier 在 OOD 崩到 8-21%%。

資訊赤字診斷

AblationAvgPerf%%Perf/$解釋
Oracle57.008.20每題選最佳模型
DimensionBest47.503.69用 probing set prior
Vanilla (zero-shot)41.411.97標準 LLM router
+Dimension41.181.81告知 dimension 反略差
+Perf stats47.741.71給 per-dimension 表現,+15.3%%

Claude Sonnet 4.6 做 router,2,919 tasks。給 prior stats 後 LLM router 超越 heuristic DimensionBest (47.74 vs 47.50)。

C-A-F Loop 機制拆解

元件作用ACRouter 實作
Context c_i累積歷史回饋+任務描述+metadataDimensionBest prior + kNN top-10 + task embedding
Action a_i從 model pool 選模型執行Qwen3.5-0.8B fine-tuned + weighted voting
Feedback f_iVerifier 回傳 score+token costAST+sandbox exec+LLM-as-Judge 加權
Memory H向量儲存所有歷史 (task,model,score,cost)voyage-code-3/BGE-large, kNN top-10, FIFO 20K

C-A-F = contextual multi-armed bandit。Cumulative regret 為 streaming metric。Orchestrator 成本極低 (/usr/bin/bash.054/M tokens)。

8 模型 Pool: 無單一王者

模型Avg%%最強維度最強 vs Opus
Claude Opus 4.642.9%%--
GLM-5-Algorithm Design+86%%
Qwen3-Max-Test Generation+111%%
Kimi-K2.5-Data Science+30%%

5 個不同模型在 9 個 dimension 中分別奪冠。Opus 總成本是 Kimi 的 ~12x。

落地應用建議

1. caf-router 加 Verifier+Memory
從靜態升級為動態。每次子 agent 完成記錄 (task,model,score,cost) 進向量 Memory,下次 kNN 檢索相似 task 的歷史表現。Agnes 免費模型做 Orchestrator。
2. 子 agent 模型池建立 per-dimension 表現矩陣
NVIDIA NIM 4 模型推理/程式強但事實弱。建立 per-task-type 表現矩陣輔助 routing。
3. 用 cumulative regret 取代成功率做 routing 指標
錯選模型的 score gap x 該 task type 頻率 = regret。比單純成功率更能捕捉 routing 失誤成本。
4. 成本分離: routing policy 用最便宜模型
ACRouter 用 Qwen3.5-0.8B 做 Orchestrator。我們的 routing 決策用 Agnes Free 或本地規則。
限制: OOD test 僅 176 tasks,限 coding agent 場景。我們的子 agent 任務含內容生成、翻譯、爬蟲等非 coding 任務,需自建 per-task-type 矩陣。GPT-5.4 backend 跑 OOD 達 75%%,代表 backend 演進本身也有顯著效果。

我們的筆記

直接驗證 caf-router 方向同時指出關鍵缺陷:靜態 routing 無法泛化。升級路徑:加 Verifier(記錄實際執行結果)、加 Memory(kNN 檢索歷史)、用輕量模型做 Orchestrator。起點:為子 agent 任務建立 (task_type, model, success, cost) log。

回論文筆記首頁 · DKY 學習中心