過去一年 agent 技能研究的共識是「讓 agent 從任務回饋中自主演化技能庫,能力就會成長」。ContinualSkillBench 用五領域、總共 500 個難度遞增的互聯子任務,首次系統性檢驗了這個命題。結果出乎意料:explicit skill maintenance 和 pure in-context learning 的平均表現幾乎持平(0.605 vs 0.602)——大量增益來自適應先前上下文和回饋,而非可重用的技能抽象。弱模型傾向累積更多碎片化技能:GPT-4o 產出 384 個技能(品質 5.68),GPT-5.3-Codex 只產出 205 個(品質 7.94),但前者重用率更低。技能演化不是「有沒有」的問題,而是能不能把經驗壓縮成可重用抽象的問題。
Law/Finance/Healthcare/Math/Office,每領域 100 個難度遞增互聯子任務,技能重複率 69.5%
ICL 0.605 vs Skill 0.602——差異不顯著。Skill 贏在 EM/Programmatic,ICL 贏在 Rubric
GPT-4o 384 技能 vs Codex 205。弱模型更多碎片、更低品質、更少重用
Healthcare +0.149 最大增益;Math 幾乎無增益。模型×領域交互效應主導
論文設計三種條件:Independent(每任務重置)、Sequential(保留歷史+建技能)、ICL(保留歷史但禁止建技能)。
RAG(索引檢索先前 trajectory)結果與 ICL 高度一致:Rubric 提升、EM 不如 Seq.。這印證:上下文適應才是增益的主要引擎,技能抽象是輔助。對 Hermes:conversation history 本身就是最強大的「技能庫」,與其花力氣設計完美的技能蒸餾管線,不如確保對話歷史被有效保留和檢索。