UniMem - 互補式情節-參數記憶:讓 LLM Agent 像人腦一樣管理記憶

arXiv:2607.26017 - 2026-07-28 - cs.CL - Siyu Xia, Chenheng Zhang et al. (中科院自動化所/北大/美團/UCL)
agent-memorycontinual-learningparametric-memoryepisodic-memoryCLS-theoryrouting-tokens

一句話核心結論

LLM agent 在無邊界任務流中面臨穩定性-可塑性困境:外部檢索記憶靈活但無法內化重複模式,參數記憶高效但依賴明確任務邊界。UniMem 借鏡人腦互補學習系統(CLS)理論,用可學習路由 token作為記憶控制器:新任務存入情節緩衝走檢索增強執行,重複出現的模式經無監督聚類(NCD + HDBSCAN)後固化為參數記憶單元(Procedural KV Memory)。三種骨幹模型(LLaMA-3B/8B、Qwen3-8B)平均 +4.0 EM,SuperGLUE 混合流 LLaMA-3B 達 85.95%。路由 token 準確率在 100 任務規模仍維持 85%+,證明分離路由與執行的設計有效避免了知識糾纏。

核心架構

路由 token(輕量判別) + 參數記憶塊(Procedural KV Memory)分離設計。新奇哨兵 token 校準後捕獲 OOD 查詢送入情節緩衝走 RAG

記憶擴展策略

Phase I 初始化路由空間+校準新奇哨兵;Phase II NCD 壓縮距離+HDBSCAN 無監督聚類→品質閘門→固化為新參數記憶單元

SNI-100 核心數據

LLaMA-3B: 47.56% EM (TokMem 40.54%, LoRA 43.62%); LLaMA-8B: 51.93% EM (LoRA 49.39%); Qwen3-8B: 49.94% EM。平均 +4.0 EM

SuperGLUE 混合流

LLaMA-1B: 73.89% (LoRA 64.91%); LLaMA-3B: 85.95% (LoRA 77.49%, TOKMEM 78.98%)。COPA 最難任務仍維持 92%

核心架構:分離路由與執行的自路由記憶

UniMem 的核心設計原則是將任務識別(路由)與任務執行(記憶)徹底解耦,解決了先前方法(如 TokMem 用單一 token 同時做識別和記憶)的表達力瓶頸:

  1. 路由 token 矩陣 E = [e1,...,eK, e_NOVEL]:每個已知任務對應一個輕量路由 token(僅用於判別),外加一個新奇哨兵 token(e_NOVEL)捕捉不匹配任何已知任務的查詢
  2. 參數記憶單元 u_k = (e_k, P_k):每個已知任務關聯一個獨立的參數記憶塊 P_k,實作為 Procedural KV Memory -- 可學習的逐層 key-value 對,透過 cross-attention + 可學習閘門 g^(l) 注入 frozen backbone
  3. 信心閘門路由規則:只有當 top-1 已知 token 的路由機率同時超過新奇哨兵機率與閾值 tau_route 時,才啟用參數記憶;否則查詢進入情節緩衝走 RAG
  4. 解耦優化目標:路由損失 L_route 只更新路由 token(參數記憶塊不啟動),執行損失 L_exec 只更新被選中的參數記憶塊。兩者梯度不互相干擾

記憶擴展生命週期:從情節到參數的兩階段固化

UniMem 不需要預設任務數量或手動分配記憶容量,而是透過情節→參數的漸進固化實現按需擴展:

實驗結果

關鍵數據總覽

指標數值對比
SNI-100 LLaMA-3B EM47.56%TokMem 40.54% / LoRA 43.62%
SNI-100 LLaMA-8B EM51.93%LoRA 49.39% / TokMem 44.74%
SuperGLUE LLaMA-3B 平均準確率85.95%LoRA 77.49% / TOKMEM 78.98%
跨三骨幹平均 EM 提升+4.0vs 所有 baselines 平均
Test-100 路由準確率(LLaMA-8B)>85%100 任務規模無崩潰

對 Hermes / DKY 的啟發