| 階段 | 功能 | token 節省 |
|---|---|---|
| CacheAligner | 提取 system prompt 動態內容(日期/UUID),穩定 prefix 提高 KV cache 命中 | 間接 (cache hit) |
| SmartCrusher | 統計方法壓縮 JSON array tool output,保留 errors/anomalies | 主要來源 |
| ContentRouter | 依內容型別路由到 SmartCrusher(JSON) / CodeCompressor(AST) / Kompress-base(ML prose) | 路由決策 |
| ContextManager | Rolling Window 或 Intelligent Context (recency+semantic+TOIN 加權評分) | 最終適配 |
與論文 2606.10209 的單向 pruning 不同,Headroom 的 CCR 是可逆的:壓縮後的內容被快取,LLM 需要細節時可回溯取回原始內容。這解決了 pruning 的最大風險 — 丟掉後才發現需要。
| 面向 | 論文 2606.10209 | Headroom |
|---|---|---|
| 層級 | 語義層(整對 tool call 的留/丟/摘要) | Token 層(JSON/程式碼/散文壓縮) |
| 可逆性 | 不可逆(pruned = 永久丟棄) | 可逆(CCR cache 可回溯) |
| 部署 | 研究原型 | 生產級 proxy |
| Provider | GPT-5 only | OpenAI/Anthropic/Gemini/Cohere + 100+ via LiteLLM |
| 方式 | 支援 |
|---|---|
| Native SDK | OpenAI (GPT-4o), Anthropic (Claude), Google Gemini, Cohere Command |
| OpenAI-compatible | Ollama, vLLM, Together, Groq, Fireworks, LM Studio |
| LiteLLM callback | 100+ providers (Bedrock, Azure, Vertex AI, Mistral) |
| Framework | LangChain, Agno, Strands, LiteLLM, OpenClaw plugin |
| 模組 | 功能 |
|---|---|
| TOIN (Tool Output Intelligence Network) | 學習壓縮模式,根據 LLM 回溯頻率調整策略 |
| headroom wrap | Ephemeral agent proxying — 臨時包裝任何 agent 指令 |
| headroom init | Persistent agent 設定 — 持續代理配置 |
| headroom learn | Session 分析與失敗學習 |
| RTK (Rust Token Killer) | Rust 原生高效 token 削減 + output shaping |
Headroom 和論文 2606.10209 可疊加使用:Headroom 處理 token-level 壓縮(SmartCrusher 削減 tool output),論文 C4 policy 處理語義層的保留/摘要策略。兩者組合可同時實現 60-95%% token 節省(Headroom)+ 20.6pp 完成率提升(C4 vs C2)。