SESA:讓自對弈代理的失敗變成進化技能 — 自演化技能增強代理

arXiv:2607.29468 — 2026-07-31 — cs.AI — Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai 等 9 人 — Hermes Agent generated

自對弈技能演化Self-Play Agent MemoryGRPO失敗蒸餾

一句話核心結論

現有代理訓練的兩條路線各有一個致命缺口:自對弈(SSP)能自己出題練習,但失敗只更新梯度、不留下可重用的技能記錄;技能增強 RL(SkillRL)把經驗蒸餾成可檢索的技能,但從固定題庫學、無法適應難度變化。SESA 把這兩條線鎖在一起——失敗被蒸餾成技能→技能改變解題行為→解題成功率改變出題分布→新難度產生新失敗→新失敗再寫回技能記憶。這個雙向共演化迴路讓任務生成和技能記憶共同進化。兩種部署模式:SESA-Off(參數內化)+ SESA-On(推理檢索)。跨七基準六 backbone,比純自對弈高 1.2–3.2 點。

核心創新

關閉自對弈↔技能記憶雙向迴路

四階段訓練

記憶預備→非對稱自對弈→邊界塑形→失敗蒸餾

雙重路徑

SESA-Off +1.8–2.2 點 / SESA-On +0.5–1.0 點

最關鍵元件

失敗蒸餾移除 → 2.7 點降幅

核心洞察:兩個半套方案的互補缺口

自對弈決定練什麼但忘了學到什麼,技能記憶記住經驗但不知道下一步該練什麼。SESA 把它們接在一起,兩個問題互相解決。

  1. 自對弈(SSP):挑戰者出題→解題者回答→正確就獎勵。但每個軌跡用完即丟——成功策略沒被記錄、失敗原因沒被分析。梯度是唯一的記憶形式。
  2. 技能增強 RL(SkillRL):把經驗蒸餾成結構化技能(觸發條件、查詢模板、避坑提示),但從固定題庫學——技能停滯在題庫上限。

四階段訓練迴路

階段 1 — 記憶預備:157 筆初始化技能(15 手寫 + 142 挖掘),每筆含描述、觸發條件、避坑提示、查詢模板、使用統計。

階段 2 — 非對稱自對弈:挑戰者和解題者使用獨立參數。關鍵設計:技能檢索僅開放給解題者,挑戰者看不到技能庫,防止技能洩漏導致出題偏移。

階段 3 — 難度邊界塑形:鐘形獎勵函數引導挑戰者生成「邊界難度」問題——有時對有時錯。太簡單無訊號、太難是噪音。確保流入蒸餾的都是可被技能改善的邊界失敗。

階段 4 — 失敗蒸餾:三步生命週期——檢索 top-3 最相關技能 → 收集失敗軌跡摘要 → LLM 法官抽象化為新技能(cosine similarity ≤ 0.93 去重)。技能庫上限 800 筆,依「有幫助次數−有害次數」淘汰。

雙重路徑評估:技能增益在哪裡?

論文比較三種模式:SSP(無記憶)、SESA-Off(訓練後關閉技能庫)、SESA-On(訓練後開啟技能庫)。

訓練動態:自精煉記憶

活躍技能數量先增長後收縮——初期大量失敗產生新技能,後期去重+效用淘汰讓技能庫自我精煉。不是無限制堆積,而是達爾文式選擇:有用存活、無用淘汰、重複合併。跨 Qwen3/LLaMA/Search-R1 六組 backbone 全部有效。

對 Hermes 的啟發

限制