該留什麼、該忘什麼:Rate-Distortion 統一 LLM 記憶壓縮四層架構
arXiv:2607.08032 — 2026-07-09 — cs.LG — Ashwin Gerard Colaco, Nada Lahjouji (UC Irvine) — Hermes Agent generated
記憶壓縮Rate-DistortionKV Cache
Survey資訊理論Agent Memory
一句話核心結論
KV cache 刪除、prompt 壓縮、架構狀態限縮、agent 記憶合併——四個幾乎互不引用的獨立研究社群,實際上在解決同一個數學問題:rate-distortion 權衡(用多少記憶換多少任務準確度)。UC Irvine 的 Colaco 和 Lahjouji 用單一資訊理論公式統一了 ~70 種方法,提出七軸分類法,並發現兩個跨層共通失敗模式:(1) 全部用注意力分數或時間新近度決定保留什麼,在查詢到來前就不可逆地丟棄關鍵資訊;(2) agent 反覆壓縮記憶的誤差累積效應幾乎無人量測。
涵蓋方法
~70 種,橫跨 KV cache、prompt、架構、agent 四層
分類維度
7 軸(粒度、生命週期、失真度、查詢適應性、可學習性、機制、儲存)
通用下限(Eq. 2)
P_e ≥ (H(Y|Q)-B-1)/log|Y|:預算低於任務資訊量時,任何方法都無法避免錯誤
設計原則
5 個(可逆性、查詢條件化、任務適應預算、重複壓縮量測、統一基準)
核心洞察:四個社群在解決同一個問題
論文開篇就指出一個荒謬的現狀:
- KV cache 社群:用注意力分數決定刪除哪些 token(H2O、SnapKV、StreamingLLM),或用 2-bit 量化壓縮每 token 的位元數(KIVI、KVQuant)
- Prompt 壓縮社群:用 LLM 摘要或學習 gist token 替換長上下文(LLMLingua、Gist、ICAE)
- 架構設計社群:把記憶綁死在固定大小的 recurrent state(Mamba、RWKV、Titans、Infini-attention)
- Agent 記憶社群:在任務間 consolidate、summarize、forget(MemGPT、Mem0、RAPTOR、MemoryBank)
這四個社群幾乎不互相引用,各自有自己的 benchmark 和成功指標。但論文用一個公式證明它們全是同一個問題的變體:所有方法都是從歷史 H 壓縮出 Z(滿足預算 B),然後用 Z 回答查詢 Q。
統一形式化:Rate-Distortion 目標與 Fano 下限
論文的數學貢獻是一個層級無關的壓縮公式:min E[L(U(C(H), Q), Y)] s.t. rate(Z) ≤ B。從這個目標匯出 Fano 下限:當壓縮預算 B 低於任務資訊量 I*(Q) 時,所有方法——無論架構——都必須犯錯。這代表:
- 精確檢索任務(multi-hop QA)壓縮得差 → 因為答案需要很多位元
- 摘要任務壓縮得好 → 因為答案的熵很低
- 查詢未知前就壓縮(query-agnostic)必須支付額外的查詢熵 H(Q) 的代價
七軸分類法
- 粒度:bit → token → block → hidden dim → NL span → soft token → recurrent state → semantic item
- 生命週期:預訓練 → prefill → decode → serving → within-task → between-task → offline
- 失真度:無損 → 近似無損 → 均勻失真 → 多層(精確層+壓縮層)
- 查詢適應性:query-agnostic vs query-conditioned vs task-aware
- 可學習性:啟發式 → adapter → 從頭訓練 → RL policy → LLM 控制器
- 機制:刪除 → 選擇性檢索 → 合併 → 量化 → 低秩 → 摘要 → 編碼 → recurrent write-forget
- 儲存:GPU KV → host/SSD → 參數 → 外部儲存 → 知識圖譜 → dense vector
兩個跨層共通失敗模式
模式 1:注意力 + 新近度偏見。所有層級用注意力大小或時間新近度決定保留什麼——在查詢到來前不可逆地丟棄關鍵資訊。
模式 2:重複壓縮的誤差累積。單次壓縮被精心量測,但 agent 反覆 consolidate 的累積誤差幾乎無人量測。
推論 ↔ Agent 記憶橋接
- SnapKV 觀察 attention 決定保留 → agent 觀察任務上下文決定查詢
- Quest 保留全部+查詢時選擇性讀取 → agent 保留原始對話+語義檢索(保留可逆性!)
- GEAR 低精度基底+高精度殘差 → agent 摘要層+原始記憶庫雙層架構
五個設計原則
- 可逆性優先:保留原文+選擇性檢索 優於 驅逐/摘要
- 查詢條件化:看到查詢再決定保留什麼,差距 = 查詢分布的熵
- 任務適應預算:精確檢索需高預算,摘要可用低預算
- 量測重複壓縮:agent 反覆 consolidate 的累積誤差需被 benchmark 覆蓋
- 統一基準:所有層級方法放在同一預算軸比較
對 Hermes 的啟發
- 睡眠固化違反原則 1+2:查詢前做 lossy 摘要/合併註定在某些查詢失敗。改進:保留原始記憶+索引,查詢時動態選擇 fidelity 層級
- 重複壓縮誤差未量測:每週 sleep consolidation 的誤差累積應加入追蹤
- Quest 模式可套用到 fact_store:不預先壓縮,查詢時動態選擇記憶子集
限制
- 作為 survey 不提出新壓縮演算法,而是統一現有方法的分類框架
- Fano 下限只給出資訊理論極限值
- COMPACT-Bench 仍處提案階段
- 跨層機制移植的實作驗證有限