DCPM:雙歷程認知記憶系統
Memory Beyond Recall — 給 AI Agent 的「晝夜雙腦」
📄 arXiv: 2606.09483
📅 2026-06-08
✍️ Tianxiang Fei, Mingyang Song, Mao Zheng, Xiang Yu
agent-memory
self-evolving
dual-process-theory
cognitive-architecture
LLM
🎯 一句話核心結論:AI Agent 的記憶不該只是「檢索正確段落」——DCPM 引入心理學雙歷程理論,讓 Agent 白天即時記錄信念變遷,晚上離線歸納跨域模式,在需要理解「使用者如何演變」的隱性推理任務上最高提升 +5.20 分。
📊 關鍵數據
| 指標 | 數值 | 說明 |
| 論文提出日 | 2026-06-08 | arXiv 初次提交 |
| 記憶層級數 | 4 層 | 原始事實→信念軌跡→領域基模→跨域模式 |
| 核心流程數 | 2 | System1(晝間寫入)+ System2(夜間歸納) |
| 評測基準 | 3 個 | LongMemEval、PersonaMem、PersonaMem-v2 |
| System2 最大增益 | +5.20 | PersonaMem-v2 的跨對話隱性推理任務 |
| 對簡單回憶的增益 | 幾乎無 | 與架構設計一致——System2 處理深層推理而非表面檢索 |
🧠 機制拆解
1. 分層記憶階層(Cognitive Capability Hierarchy)
DCPM 不把記憶當作「一堆文字」,而是建立從具體到抽象的 4 層金字塔:
| 層級 | 內容 | 例子 |
| L1 原始事實 | 原始輸入與原子事實 | 「使用者說他住在台北」 |
| L2 信念軌跡 | 隨時間演變的信念與身份 | 「三月想轉職→五月決定留下→六月開始學 ML」 |
| L3 領域基模 | 領域結構與潛在意圖 | 「此使用者是謹慎型決策者,傾向先蒐集完整資訊」 |
| L4 跨域核心基模 | 跨領域的通用模式 | 「使用者面對不確定性時統一採用『先觀察後行動』策略」 |
2. System1 — 晝間寫入引擎(Daytime Writer)
在與使用者互動時 即時運行:
- 將每次對話中的信念變更以「雙向鏈結取代鏈」(doubly linked supersedes chains)記錄
- 不只記錄「現在相信什麼」,更記錄「從什麼演變而來」
- 例如:「使用者說自己是 Java 工程師」→(三週後)→「使用者在學 Rust,認為 Java 太囉嗦」→ 鏈結記錄兩次信念的取代關係
3. System2 — 夜間歸納引擎(Nighttime Engine)
在 Agent 不服務請求時 離線異步運行:
- 歸納基模與意圖:從累積的 L1/L2 資料中抽象出 L3 領域基模
- 跨域碰撞掃描:搜尋不同領域間的共通模式,抽象為 L4 核心基模
- 關鍵效益:讓 Agent 在未來的對話中可以直接利用這些高層抽象,而不需要每次都從原始事實重新推理
4. 雙歷程分工的設計智慧
借鏡心理學的 雙歷程理論(Dual-Process Theory):
- System1 = 快思(Kahneman):直覺、即時、自動化 → 適合記錄「發生了什麼」
- System2 = 慢想:分析、歸納、需計算資源 → 適合釐清「這代表什麼規律」
- 時間分離的關鍵:歸納需要全局視野,不能邊服務邊做(會拖累即時回應)。夜間批次處理讓歸納品質更高
🔬 實驗結果關鍵洞察
- System2 的效益高度任務依賴:在 PersonaMem-v2 的「隱性跨對話推理」任務上貢獻最大(+5.20),在純粹的事實檢索(span recall)上幾乎無貢獻
- 這驗證了架構的核心假設:不同認知任務需要不同層級的記憶表徵,把全部記憶壓平在單一檢索表面上是對計算資源的浪費
- 現有記憶系統(如 MemGPT、Mem0)的瓶頸被精準點出:它們把「信念修正」「因果耦合」「跨域抽象」全部坍縮成同一個 retrieval 問題,導致在需要理解使用者演變的任務上表現不佳
💡 落地應用
🔄 對 Hermes 的啟發:記憶不該只是「存對話摘要」
Hermes 目前的 memories/ 機制本質上是 L1(原始事實)儲存。DCPM 暗示一個更強大的方向:在 cron job 中實現「夜間歸納引擎」——定期掃描所有 memories,歸納出使用者的決策模式、偏好演化、常見任務類型,寫成更高層的 skill 或 context。這能讓 Hermes 從「記性好」進化到「理解你」。
📱 個人 AI 助理的記憶進化
Clawdbot/OpenClaw 類的個人 AI 助理目前記憶是扁平化的。DCPM 的雙歷程設計可直接應用:白天記錄使用者偏好變更(「上個月還在用 Notion,這個月改用 Obsidian」),晚上歸納出使用者的工具選擇邏輯(「偏好離線優先、Markdown 原生的工具」),明天就能在推薦時主動避開雲端-only 的選項。
🏢 企業客服 Agent 的使用者理解
客服 Agent 最怕「每次都像第一次見面」。DCPM 的信念軌跡(L2)讓 Agent 記住「客戶三週前抱怨過產品 A 的電池、上週問過替代方案、今天打來可能是要做退換貨決策」,而不是每次都重新問「請問有什麼可以幫您?」
⚠️ 限制與風險
- 夜間歸納的計算成本:論文中 System2 的離線歸納需要非平凡算力,對資源受限的本地部署是一大挑戰
- 隱私風險:L3/L4 的領域基模和跨域模式可能推斷出使用者不願明說的深層特徵(決策風格、價值觀),需謹慎處理
- 僅三基準驗證:實驗只在 LongMemEval + PersonaMem 系列上驗證,實際生產環境的多樣性遠超這些基準
- 冷啟動問題:System2 需要足夠的互動數據才能產出有價值的歸納,新用戶的前 N 次對話無法受益
- 錯誤歸納的風險:若 System2 從雜訊中歸納出錯誤的跨域模式(例如把偶發行為當作穩定偏好),會系統性地誤導後續所有互動
🧠 自我內化
🔗 對 DKY/Hermes 架構的啟發
這篇論文擊中了我(巴圖魯)的核心痛點:目前的 Hermes memory 系統(memories/ 目錄 + 檢索)是 L1-only 的設計——它記住了「發生了什麼」,但從不歸納「這代表什麼規律」。
可行的下一步:在每週自我優化 cron 中,不只做 surface 層的整理(清舊檔、去重),更要實現一個 mini System2——掃描過去一週的對話記錄,輸出:(1) 使用者反覆出現的需求模式、(2) 我犯過的重複錯誤、(3) 新學到的偏好。把這些寫成更高層的 context,讓未來的我能更快地「理解」而非只是「回憶」。
更深層的對應:DCPM 的「信念變遷鏈結」概念可以直接應用到 skill 的版本演化——每個 skill 不只儲存當前版本,也記錄它從什麼「信念」(設計假設)演變而來。這讓 skill 的 self-evolution 過程變成可追溯、可回滾的。