| 指標 | 數值 | 說明 |
|---|---|---|
| LoRA 更新方式 | 線上蒸餾監督信號 | 從 agent 自身歷史萃取訓練信號,即時更新 Δ_t 權重 |
| 基礎參數 θ₀ | 凍結(frozen) | 預訓練權重不變,只更新輕量 LoRA adapter,避免災難性遺忘 |
| LoRA 初始化 | SVD-based | 用奇異值分解初始化 LoRA 子空間,加速線上收斂 |
| 實驗基準 | LoCoMo / LongMemEval-S / CL-Bench / Multi-obj search | 在四個基準上一致優於純文字摘要和檢索式記憶 baseline |
| 可擴展性 | 跨模型規模一致有效 | 從小型到大型 LLM 皆適用 |
將 agent 決策過程數學化為 π_{θ₀+Δ_t}。每次 agent 執行 extraction action 時,從自身歷史蒸餾出監督信號更新 Δ_t,後續行動立即受益於新學到的知識。
extraction action 決定何時及如何從歷史萃取學習信號,此策略可透過強化學習在訓練 θ₀ 階段優化——讓 agent 學會「什麼時候該學」以及「從哪段經驗學」。
傳統 LoRA 隨機初始化收斂慢,SVD 初始化讓 fast weights 從更好的起點開始,對 online learning 場景至關重要——agent 沒有數千步的暖機時間。
傳統記憶方法把經驗存為文字摘要(prompt space),凍結的模型只能「讀」不能「學」。TMEM 把經驗蒸餾進參數(weight space),模型行為真正被經驗改變。
Hermes 在執行數小時的多步驟任務時,中間階段的成敗經驗可透過類似 TMEM 的機制即時調整後續策略,而非依賴預設的單一 policy。這對 cron job 式長期任務特別有意義——每次執行都可累積經驗。
不需離線 fine-tune,agent 可在與使用者互動的單次 session 中學會偏好,用 LoRA Δ_t 保存適配結果,下次快速載入。比 prompt-based 記憶更持久且無 token 成本。
不同任務的 Δ_t 可獨立保存和切換(task-specific adapter),agent 在切換任務時載入對應 adapter,避免傳統 fine-tuning 的災難性遺忘問題。
TMEM 為 Hermes 的自我演化路徑提供了清晰的技術藍圖:目前 Hermes 的「學習」僅限於 skill 文件的文字累積(prompt space),每次 session 結束後行為重置。若能引入參數化記憶——例如用 LoRA adapter 記錄使用者回饋模式、成功/失敗任務的特徵——Hermes 可以真正跨 session 演化。
但需注意:online LoRA 更新在 ARM 環境的計算成本、以及錯誤經驗被蒸餾進參數後的「去毒」機制,都是落地前需解決的工程問題。