ContinualSkillBench:技能演化的照妖鏡 — LLM Agent 真的能演化能力嗎?

arXiv:2608.03874 — 2026-08-04 — cs.AI — Tianyi Guan, Yiding Wang 等(北大 AI 研究院 / 北京通用 AI 研究院)— Hermes Agent generated

Skill EvolutionAgent MemoryContinual Learning ICL vs SkillFragmentationBenchmark

一句話核心結論

過去一年 agent 技能研究的共識是「讓 agent 從任務回饋中自主演化技能庫,能力就會成長」。ContinualSkillBench 用五領域、總共 500 個難度遞增的互聯子任務,首次系統性檢驗了這個命題。結果出乎意料:explicit skill maintenance 和 pure in-context learning 的平均表現幾乎持平(0.605 vs 0.602)——大量增益來自適應先前上下文和回饋,而非可重用的技能抽象。弱模型傾向累積更多碎片化技能:GPT-4o 產出 384 個技能(品質 5.68),GPT-5.3-Codex 只產出 205 個(品質 7.94),但前者重用率更低。技能演化不是「有沒有」的問題,而是能不能把經驗壓縮成可重用抽象的問題。

五領域設計

Law/Finance/Healthcare/Math/Office,每領域 100 個難度遞增互聯子任務,技能重複率 69.5%

ICL vs Skill

ICL 0.605 vs Skill 0.602——差異不顯著。Skill 贏在 EM/Programmatic,ICL 贏在 Rubric

技能碎片化

GPT-4o 384 技能 vs Codex 205。弱模型更多碎片、更低品質、更少重用

領域差異

Healthcare +0.149 最大增益;Math 幾乎無增益。模型×領域交互效應主導

核心洞察:增益來源分解

論文設計三種條件:Independent(每任務重置)、Sequential(保留歷史+建技能)、ICL(保留歷史但禁止建技能)。

  1. Seq. − Ind. ≠ 技能演化的功勞:在 Law/Finance/Healthcare 三領域,ICL(0.605)和 Seq.(0.602)差距僅 0.003——不顯著
  2. Skill 和 ICL 各有所長:Skill 改善 Exact Match 和 Programmatic 任務(精確輸出),ICL 改善 Rubric judge 任務(開放式回答)
  3. 技能會過度格式化:顯式技能讓 agent 適應早期評估標準,反而失去開放式任務的靈活性

技能庫動態:碎片化陷阱

五領域全景

RAG baseline:Context 才是王者

RAG(索引檢索先前 trajectory)結果與 ICL 高度一致:Rubric 提升、EM 不如 Seq.。這印證:上下文適應才是增益的主要引擎,技能抽象是輔助。對 Hermes:conversation history 本身就是最強大的「技能庫」,與其花力氣設計完美的技能蒸餾管線,不如確保對話歷史被有效保留和檢索。

對 Hermes 的啟發

限制