| 指標 | 數值 | 說明 |
|---|---|---|
| LoRA adapter 更新 | 每 episode 多次 | 提取動作產出的監督訊號即時更新 Δₜ,非批次重訓 |
| SVD 初始化加速 | 收斂顯著加快 | LoRA 子空間用預訓練權重矩陣的奇異值分解初始化 |
| RL 可優化提取策略 | 雙層優化 | 訓練 θ₀ 同時改善任務動作品質與線上適應資料品質 |
| LoCoMo benchmark | 超越 baseline | 長期對話記憶任務中,TMEM 優於純摘要式和檢索式 baseline |
| LongMemEval-S | 跨模型尺度一致勝出 | 在多種規模的 backbone LLM 上都比 baseline 好 |
將歷史壓縮成文本摘要 + 蒸餾出監督訊號,用 LoRA 快速權重 Δₜ 寫入模型參數,不是存在 prompt 裡
每個 timestep 的動作來自 π(θ₀+Δₜ),Δₜ 隨 episode 進展持續更新,讓 Agent 的行為策略在單次任務中演化
決定「從歷史中提取什麼當監督」本身是 RL 可優化的——訓練基底 θ₀ 讓提取動作產出的資料品質愈來愈好
用預訓練權重矩陣的 SVD 分解來初始化 LoRA 子空間,大幅加速線上收斂(不需要從亂數開始探索)
Agent 在單一對話 session 中就能根據用戶偏好即時調整行為——不是靠 prompt 堆積歷史,而是參數層級的適應
在 Multi-objective Search 和 CL-Bench 中,TMEM 能逐步學會哪些子目標優先、哪些策略有效,把教訓寫進權重
目前 skill 系統靠「讀取外部檔案」實現記憶,TMEM 的 insight 是:關鍵少量教訓值得用 LoRA 內化為參數,減少 prompt token 成本,同時讓行為真正改變
這篇論文直接命中 Hermes 的痛點:skill/memory 目前全靠 prompt 空間傳遞(讀檔案→塞進 context),一旦 context window 滿了就掉資訊。TMEM 證明可以挑選真正重要的經驗,用 LoRA 燒進模型參數——這不只是省 token,而是讓 Agent 的『人格』隨使用演化。如果能在 Hermes 中實作一個『關鍵教訓→LoRA 微調』的管線(只對 2-3 次重大失敗更新權重),就從『有筆記本的 Agent』升級為『會內化的 Agent』。同時也要誠實面對風險:LoRA 更新如果吃到錯誤的監督訊號,會讓 Agent 學歪(analogous to Lasso 選錯變數)。需要一個類似 RLHF reward model 的過濾器。