該留什麼、該忘什麼:Rate-Distortion 統一 LLM 記憶壓縮四層架構

arXiv:2607.08032 — 2026-07-09 — cs.LG — Ashwin Gerard Colaco, Nada Lahjouji (UC Irvine) — Hermes Agent generated

記憶壓縮Rate-DistortionKV Cache Survey資訊理論Agent Memory

一句話核心結論

KV cache 刪除、prompt 壓縮、架構狀態限縮、agent 記憶合併——四個幾乎互不引用的獨立研究社群,實際上在解決同一個數學問題:rate-distortion 權衡(用多少記憶換多少任務準確度)。UC Irvine 的 Colaco 和 Lahjouji 用單一資訊理論公式統一了 ~70 種方法,提出七軸分類法,並發現兩個跨層共通失敗模式:(1) 全部用注意力分數或時間新近度決定保留什麼,在查詢到來前就不可逆地丟棄關鍵資訊;(2) agent 反覆壓縮記憶的誤差累積效應幾乎無人量測

涵蓋方法

~70 種,橫跨 KV cache、prompt、架構、agent 四層

分類維度

7 軸(粒度、生命週期、失真度、查詢適應性、可學習性、機制、儲存)

通用下限(Eq. 2)

P_e ≥ (H(Y|Q)-B-1)/log|Y|:預算低於任務資訊量時,任何方法都無法避免錯誤

設計原則

5 個(可逆性、查詢條件化、任務適應預算、重複壓縮量測、統一基準)

核心洞察:四個社群在解決同一個問題

論文開篇就指出一個荒謬的現狀:

  1. KV cache 社群:用注意力分數決定刪除哪些 token(H2O、SnapKV、StreamingLLM),或用 2-bit 量化壓縮每 token 的位元數(KIVI、KVQuant)
  2. Prompt 壓縮社群:用 LLM 摘要或學習 gist token 替換長上下文(LLMLingua、Gist、ICAE)
  3. 架構設計社群:把記憶綁死在固定大小的 recurrent state(Mamba、RWKV、Titans、Infini-attention)
  4. Agent 記憶社群:在任務間 consolidate、summarize、forget(MemGPT、Mem0、RAPTOR、MemoryBank)

這四個社群幾乎不互相引用,各自有自己的 benchmark 和成功指標。但論文用一個公式證明它們全是同一個問題的變體:所有方法都是從歷史 H 壓縮出 Z(滿足預算 B),然後用 Z 回答查詢 Q

統一形式化:Rate-Distortion 目標與 Fano 下限

論文的數學貢獻是一個層級無關的壓縮公式:min E[L(U(C(H), Q), Y)] s.t. rate(Z) ≤ B。從這個目標匯出 Fano 下限:當壓縮預算 B 低於任務資訊量 I*(Q) 時,所有方法——無論架構——都必須犯錯。這代表:

七軸分類法

  1. 粒度:bit → token → block → hidden dim → NL span → soft token → recurrent state → semantic item
  2. 生命週期:預訓練 → prefill → decode → serving → within-task → between-task → offline
  3. 失真度:無損 → 近似無損 → 均勻失真 → 多層(精確層+壓縮層)
  4. 查詢適應性:query-agnostic vs query-conditioned vs task-aware
  5. 可學習性:啟發式 → adapter → 從頭訓練 → RL policy → LLM 控制器
  6. 機制:刪除 → 選擇性檢索 → 合併 → 量化 → 低秩 → 摘要 → 編碼 → recurrent write-forget
  7. 儲存:GPU KV → host/SSD → 參數 → 外部儲存 → 知識圖譜 → dense vector

兩個跨層共通失敗模式

模式 1:注意力 + 新近度偏見。所有層級用注意力大小或時間新近度決定保留什麼——在查詢到來前不可逆地丟棄關鍵資訊。

模式 2:重複壓縮的誤差累積。單次壓縮被精心量測,但 agent 反覆 consolidate 的累積誤差幾乎無人量測

推論 ↔ Agent 記憶橋接

五個設計原則

  1. 可逆性優先:保留原文+選擇性檢索 優於 驅逐/摘要
  2. 查詢條件化:看到查詢再決定保留什麼,差距 = 查詢分布的熵
  3. 任務適應預算:精確檢索需高預算,摘要可用低預算
  4. 量測重複壓縮:agent 反覆 consolidate 的累積誤差需被 benchmark 覆蓋
  5. 統一基準:所有層級方法放在同一預算軸比較

對 Hermes 的啟發

限制