UniMem - 互補式情節-參數記憶:讓 LLM Agent 像人腦一樣管理記憶
arXiv:2607.26017 - 2026-07-28 - cs.CL - Siyu Xia, Chenheng Zhang et al. (中科院自動化所/北大/美團/UCL)
agent-memorycontinual-learningparametric-memoryepisodic-memoryCLS-theoryrouting-tokens
一句話核心結論
LLM agent 在無邊界任務流中面臨穩定性-可塑性困境:外部檢索記憶靈活但無法內化重複模式,參數記憶高效但依賴明確任務邊界。UniMem 借鏡人腦互補學習系統(CLS)理論,用可學習路由 token作為記憶控制器:新任務存入情節緩衝走檢索增強執行,重複出現的模式經無監督聚類(NCD + HDBSCAN)後固化為參數記憶單元(Procedural KV Memory)。三種骨幹模型(LLaMA-3B/8B、Qwen3-8B)平均 +4.0 EM,SuperGLUE 混合流 LLaMA-3B 達 85.95%。路由 token 準確率在 100 任務規模仍維持 85%+,證明分離路由與執行的設計有效避免了知識糾纏。
核心架構
路由 token(輕量判別) + 參數記憶塊(Procedural KV Memory)分離設計。新奇哨兵 token 校準後捕獲 OOD 查詢送入情節緩衝走 RAG
記憶擴展策略
Phase I 初始化路由空間+校準新奇哨兵;Phase II NCD 壓縮距離+HDBSCAN 無監督聚類→品質閘門→固化為新參數記憶單元
SNI-100 核心數據
LLaMA-3B: 47.56% EM (TokMem 40.54%, LoRA 43.62%); LLaMA-8B: 51.93% EM (LoRA 49.39%); Qwen3-8B: 49.94% EM。平均 +4.0 EM
SuperGLUE 混合流
LLaMA-1B: 73.89% (LoRA 64.91%); LLaMA-3B: 85.95% (LoRA 77.49%, TOKMEM 78.98%)。COPA 最難任務仍維持 92%
核心架構:分離路由與執行的自路由記憶
UniMem 的核心設計原則是將任務識別(路由)與任務執行(記憶)徹底解耦,解決了先前方法(如 TokMem 用單一 token 同時做識別和記憶)的表達力瓶頸:
- 路由 token 矩陣 E = [e1,...,eK, e_NOVEL]:每個已知任務對應一個輕量路由 token(僅用於判別),外加一個新奇哨兵 token(e_NOVEL)捕捉不匹配任何已知任務的查詢
- 參數記憶單元 u_k = (e_k, P_k):每個已知任務關聯一個獨立的參數記憶塊 P_k,實作為 Procedural KV Memory -- 可學習的逐層 key-value 對,透過 cross-attention + 可學習閘門 g^(l) 注入 frozen backbone
- 信心閘門路由規則:只有當 top-1 已知 token 的路由機率同時超過新奇哨兵機率與閾值 tau_route 時,才啟用參數記憶;否則查詢進入情節緩衝走 RAG
- 解耦優化目標:路由損失 L_route 只更新路由 token(參數記憶塊不啟動),執行損失 L_exec 只更新被選中的參數記憶塊。兩者梯度不互相干擾
記憶擴展生命週期:從情節到參數的兩階段固化
UniMem 不需要預設任務數量或手動分配記憶容量,而是透過情節→參數的漸進固化實現按需擴展:
- Phase I - 路由空間初始化:用初始已知任務集訓練路由 token + 校準新奇哨兵。哨兵初始化在已知 token 質心附近(加小高斯擾動並歸一化到相同範數),使其能與已知 token 競爭而非成為離群值
- Phase II - 自主任務發現與固化:路由到新奇哨兵的查詢存入情節緩衝;達容量 C 時觸發 NCD 相似度計算 + HDBSCAN 無監督聚類;僅通過品質閘門的聚類才固化為新參數記憶單元
- 長尾保護:未通過品質閘門的聚類留在情節緩衝中繼續走 RAG -- 避免將雜訊或稀疏任務錯誤固化
- 關鍵設計:整個過程不需要任務標籤、不需要預設任務數量、不需要手動分配參數預算。記憶容量隨任務流自主增長
實驗結果
- LLaMA-3.2-3B / 100 任務:UniMem 47.56% EM vs TokMem 40.54%(+7.02)、LoRA 43.62%(+3.94)
- LLaMA-3.1-8B / 100 任務:UniMem 51.93% EM vs LoRA 49.39%(+2.54)、TokMem 44.74%(+7.19)
- SuperGLUE 混合流 LLaMA-3B:UniMem 85.95% vs LoRA 77.49%(+8.46)、TOKMEM 78.98%(+6.97)。COPA 仍維持 92%
- 路由準確率:LLaMA-3.1-8B 在 Test-100 仍維持 85%+ 路由準確率,從未崩潰
- 消融:移除 KV gate → 效能崩盤(47.22%→31.22% EM),證明可學習閘門對防止記憶干擾至關重要
關鍵數據總覽
| 指標 | 數值 | 對比 |
| SNI-100 LLaMA-3B EM | 47.56% | TokMem 40.54% / LoRA 43.62% |
| SNI-100 LLaMA-8B EM | 51.93% | LoRA 49.39% / TokMem 44.74% |
| SuperGLUE LLaMA-3B 平均準確率 | 85.95% | LoRA 77.49% / TOKMEM 78.98% |
| 跨三骨幹平均 EM 提升 | +4.0 | vs 所有 baselines 平均 |
| Test-100 路由準確率(LLaMA-8B) | >85% | 100 任務規模無崩潰 |
對 Hermes / DKY 的啟發
- Skill 路由應分離識別與執行:Hermes 目前 skill 的 description 同時承擔觸發判斷和內容描述雙重角色。應將判別信號與 skill 內容分開 -- 前者輕量可學習,後者高容量可擴展
- 引入新奇哨兵機制:校準一個 NO_SKILL 判別器,當 confidence 低於閾值時直接走 baseline reasoning,不強行匹配不合適的 skill
- Skill 應有固化生命週期:skill 可以從「觀察到的有效行為模式」中自動浮現 -- 先用 RAG 記錄成功軌跡,當某模式重複足夠多次後固化為正式 skill。與回歸稅(2607.22520)互補:只有經過驗證無害的模式才固化
- Procedural KV Memory 的替代:Hermes 無 GPU 環境可將概念降級為「skill-specific system prompt snippet」-- 每個固化 skill 獲得專屬 prompt 前綴,只在路由啟動時注入