| Router | ID AvgPerf%% | ID CumReg | OOD AvgPerf%% | 類型 |
|---|---|---|---|---|
| Oracle | 57.00 | 0 | 75.89 | 理論上界 |
| ACRouter (ours) | 49.98 | 205.5 | 62.50 | Agent-as-a-Router |
| DimensionBest | 47.50 | 277.4 | N/A | Static Heuristic |
| LinUCB | 46.84 | 296.9 | 49.82 | Online Bandit |
| Qwen3.5-0.8B-FT | 46.41 | 309.1 | 55.36 | Static Trained |
| Always-Opus 4.6 | 43.83 | 387.1 | 57.14 | Single-Model |
| LogReg | 47.26 | 284.4 | 19.64 | Static Trained |
| Random | 38.75 | 533.6 | 31.25 | Baseline |
ID: 2,919 tasks (9 coding dims)。OOD: 176 tasks (agentic programming)。靜態 classifier 在 OOD 崩到 8-21%%。
| Ablation | AvgPerf%% | Perf/$ | 解釋 |
|---|---|---|---|
| Oracle | 57.00 | 8.20 | 每題選最佳模型 |
| DimensionBest | 47.50 | 3.69 | 用 probing set prior |
| Vanilla (zero-shot) | 41.41 | 1.97 | 標準 LLM router |
| +Dimension | 41.18 | 1.81 | 告知 dimension 反略差 |
| +Perf stats | 47.74 | 1.71 | 給 per-dimension 表現,+15.3%% |
Claude Sonnet 4.6 做 router,2,919 tasks。給 prior stats 後 LLM router 超越 heuristic DimensionBest (47.74 vs 47.50)。
| 元件 | 作用 | ACRouter 實作 |
|---|---|---|
| Context c_i | 累積歷史回饋+任務描述+metadata | DimensionBest prior + kNN top-10 + task embedding |
| Action a_i | 從 model pool 選模型執行 | Qwen3.5-0.8B fine-tuned + weighted voting |
| Feedback f_i | Verifier 回傳 score+token cost | AST+sandbox exec+LLM-as-Judge 加權 |
| Memory H | 向量儲存所有歷史 (task,model,score,cost) | voyage-code-3/BGE-large, kNN top-10, FIFO 20K |
C-A-F = contextual multi-armed bandit。Cumulative regret 為 streaming metric。Orchestrator 成本極低 (/usr/bin/bash.054/M tokens)。
| 模型 | Avg%% | 最強維度 | 最強 vs Opus |
|---|---|---|---|
| Claude Opus 4.6 | 42.9%% | - | - |
| GLM-5 | - | Algorithm Design | +86%% |
| Qwen3-Max | - | Test Generation | +111%% |
| Kimi-K2.5 | - | Data Science | +30%% |
5 個不同模型在 9 個 dimension 中分別奪冠。Opus 總成本是 Kimi 的 ~12x。
直接驗證 caf-router 方向同時指出關鍵缺陷:靜態 routing 無法泛化。升級路徑:加 Verifier(記錄實際執行結果)、加 Memory(kNN 檢索歷史)、用輕量模型做 Orchestrator。起點:為子 agent 任務建立 (task_type, model, success, cost) log。