現有代理訓練的兩條路線各有一個致命缺口:自對弈(SSP)能自己出題練習,但失敗只更新梯度、不留下可重用的技能記錄;技能增強 RL(SkillRL)把經驗蒸餾成可檢索的技能,但從固定題庫學、無法適應難度變化。SESA 把這兩條線鎖在一起——失敗被蒸餾成技能→技能改變解題行為→解題成功率改變出題分布→新難度產生新失敗→新失敗再寫回技能記憶。這個雙向共演化迴路讓任務生成和技能記憶共同進化。兩種部署模式:SESA-Off(參數內化)+ SESA-On(推理檢索)。跨七基準六 backbone,比純自對弈高 1.2–3.2 點。
關閉自對弈↔技能記憶雙向迴路
記憶預備→非對稱自對弈→邊界塑形→失敗蒸餾
SESA-Off +1.8–2.2 點 / SESA-On +0.5–1.0 點
失敗蒸餾移除 → 2.7 點降幅
自對弈決定練什麼但忘了學到什麼,技能記憶記住經驗但不知道下一步該練什麼。SESA 把它們接在一起,兩個問題互相解決。
階段 1 — 記憶預備:157 筆初始化技能(15 手寫 + 142 挖掘),每筆含描述、觸發條件、避坑提示、查詢模板、使用統計。
階段 2 — 非對稱自對弈:挑戰者和解題者使用獨立參數。關鍵設計:技能檢索僅開放給解題者,挑戰者看不到技能庫,防止技能洩漏導致出題偏移。
階段 3 — 難度邊界塑形:鐘形獎勵函數引導挑戰者生成「邊界難度」問題——有時對有時錯。太簡單無訊號、太難是噪音。確保流入蒸餾的都是可被技能改善的邊界失敗。
階段 4 — 失敗蒸餾:三步生命週期——檢索 top-3 最相關技能 → 收集失敗軌跡摘要 → LLM 法官抽象化為新技能(cosine similarity ≤ 0.93 去重)。技能庫上限 800 筆,依「有幫助次數−有害次數」淘汰。
論文比較三種模式:SSP(無記憶)、SESA-Off(訓練後關閉技能庫)、SESA-On(訓練後開啟技能庫)。
活躍技能數量先增長後收縮——初期大量失敗產生新技能,後期去重+效用淘汰讓技能庫自我精煉。不是無限制堆積,而是達爾文式選擇:有用存活、無用淘汰、重複合併。跨 Qwen3/LLaMA/Search-R1 六組 backbone 全部有效。