記憶邊界合約:AgenticSTS 五層型別檢索幫長程 Agent 的記憶做可消融體檢
arXiv:2607.02255 — 2026-07-02 — Xiangchen Cheng et al. (Alaya Lab / SJTU / Nankai / USTC) — Hermes Agent generated
AgenticSTS記憶合約型別檢索
消融實驗長程 Agent技能庫
一句話核心結論
長程 Agent 的記憶不是一個存文字的地方——它是「每個未來的決策允許看到什麼」的合約。最常見的合約是把過去的觀察、工具調用、反思全部 append 到下一輪 prompt——這讓 context 隨決策數線性膨脹,且任何單一記憶成分的效果都無法隔離量測。Alaya Lab 等團隊提出另一種合約:每決策從五層型別切片重新組裝 prompt(L1 固定協定→L2 狀態 schema→L3 規則檢索→L4 情節摘要→L5 觸發策略技能),不 append 任何原始跨決策抄本。Context 穩定有界,且每一層都可以獨立開關做消融實驗。在 Slay the Spire 2(前沿 LLM 0 勝、人類 16% 的難度)上,五層合約的最大觀察差異落在啟用 L5 觸發策略技能:無技能 3/10 勝 → 有技能 6/10 勝(方向性,Fisher exact p≈0.37)。釋出 298 完整軌跡 + 條件標籤 + SHA 凍結記憶快照的可重現測試床。
測試場域
Slay the Spire 2:封閉規則、文字可讀、數百決策/run。前沿 LLM 0 勝 vs 人類 16% → 難但不飽和
記憶合約
五層型別檢索(L1 協定/L2 Schema/L3 規則/L4 情節/L5 技能),無原始抄本 append,context 穩定有界
主要發現
L5 技能層:無 scaffold 3/10 → 含技能 6/10(方向性);L4 情節層在 A0 飽和(有無 L4 皆 6/10)
釋出資產
298 軌跡 + SHA 凍結記憶快照 + 條件標籤 + Wilson/bootstrap 分析腳本,可獨立重算所有結果
核心洞察:記憶是合約,不是倉庫
論文開篇就重新定義了長程 Agent 的記憶問題:
- 現狀:ReAct/Reflexion 類 agent 把觀察、工具調用、反思全部 append 到下一輪 prompt。這讓資訊容易取得,但也讓 context 變成一個雜亂混合物——任何單一記憶成分的效果都無法隔離
- 替代方案:每決策從五層型別切片重新組裝 prompt。資訊要存活到下一決策必須先寫入 bounded store。這把記憶從「歷史能塞多少」轉換為「選擇了哪些型別證據」
- 合約的核心差異:不是 prompt 大小,而是記憶層的 可消融性(ablatability)——你可以獨立地關掉某層,觀察行為改變
- Context 成長的審計:論文做了 token 審計:bounded contract 下 prompt 大小穩定;對照的 append-transcript 假想情境可能 O(c²) 成長
五層型別檢索架構(L1-L5)
Agent 從不 append 原始對話抄本。每層的角色、可變性和實驗中的角色不同:
- L1 操作協定:不可變的角色和協定模板——固定不變,所有條件共用
- L2 狀態型別 prompt:不可變的 schema——戰鬥、組牌、地圖、事件、休息等狀態各有對應模板 + 合法動作格式
- L3 遊戲知識:可枚舉的規則資料——卡片、遺物、敵人、事件。可依 patch 更新
- L4 情節記憶:run 後摘要(角色 × 難度 × 章節 × 敵人類型)——案例式召回
- L5 技能庫:觸發式策略指南——從日誌蒸餾出的通用場景策略,最重要的消融變數
L5 技能有兩種填充方式:人工撰寫種子庫(Mode A)和模板填充自動生成(Mode B),兩者在 A0 上都達到 6/10 勝率點估計——證明技能層的存在性效應大於技能內容的來源。
固定 A0 消融矩陣:五條件拆解
- baseline-strict(無 scaffold):3/10 勝(Wilson 95% CI [10.8%, 60.3%]),分數 70.4
- prompt-only(完整 prompt,無 L4/L5):4/10 勝([17.0%, 69.1%]),分數 69.6
- mode-a(手寫 L5 種子庫):6/10 勝([31.3%, 83.2%]),分數 85.5
- mode-b(模板填充 L5):6/10 勝,分數 83.3
- full-frozen(L4 情節 + L5 技能):6/10 勝,分數 82.1
∆L5 = +2/10,∆L4 = 0(分數差 CI [−21.7, +14.9])。在 A0 上,情節記憶(L4)已飽和;策略技能(L5)是觀察到差異最大的記憶層。Fisher exact p≈0.37 代表方向性證據。
跨骨幹遷移:技能庫的 backbone 敏感性
- Qwen 3.6-27B:baseline → full-frozen 分數從 14.6 升至 26.9(+84.5%),但勝場仍是 0/5
- DeepSeek V4 Pro:分數反而從 41.3 降至 33.8(−18.1%),勝場 0/5
- Gemini 3.1 Pro(原生):3/10 → 6/10,分數 70.4 → 82.1(+16.6%)
教訓:技能庫的遷移性不是理所當然的——它是一個可量測的經驗屬性,不是一個前提假設。
自動爬升模式:技能層讓 Agent 挑戰 A6-A8
有 run 後寫入記憶的條件爬到 A6-A8,而無 run 後記憶的條件停在 A2-A4。L4 在 A0 已飽和,但在高難度需要跨 run 學習時變得重要。
四層寫入閘門:技能不是隨便加的
- 前置 A/B 檢查:B=3 resample,需嚴格 2/3 以上且零有害案例
- Cosine 相似度:過濾重複候選
- Jaccard 相似度:token 級去重
- LLM 法官:語意級評估新技能是否真正帶來新資訊
大部分候選在此過程中被拒絕或合併——寫入難度遠高於檢索難度。
對 Hermes 的啟發
- 技能 vs 情節的分離可直接採用:Hermes 的 skill library(類似 L5)和 fact_store(類似 L4)已有雛形。建議引入消融測試量化每層貢獻
- 情節記憶在低難度飽和的現象值得警惕:短對話任務看不出 fact_store 的價值,但長程多 session 才是主場
- 「類型化檢索」優於「原始抄本 append」:每決策從型別切片重組,而非從歷史累積
- 四層寫入閘門可直接借鏡:sleep consolidation 引入 Cosine+Jaccard+LLM 法官三層閘門,降低重複/低品質固化
限制
- 固定 A0 的 N=10/cell 樣本量有限,L5 的 +2/10 是方向性(p≈0.37)
- 與 accumulate-transcript 合約的匹配對照實驗是 future work
- 技能庫是 backbone-sensitive,不是泛用外掛
- Slay the Spire 2 遊戲測試床的結論不一定適用於非遊戲 agent 任務