Agent Skills Can Be Harmful:當技能反而傷害 Agent — 307 個技能誘發失敗的實證拆解

arXiv:2608.11888 — 2026-08-12 — cs.AI — Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang(Microsoft Research 實習)— Hermes Agent generated

Agent SkillsSkill-Induced FailureSkillTriage Microsoft ResearchDifferential AnalysisLLM Agent

一句話核心結論

技能是擴充 LLM agent 的標準機制,但這篇 Microsoft Research 研究揭示反直覺真相:傷害 agent 的通常不是明顯不相關的技能,而是「看起來很相關」的技能。差分分析框架在 SkillsBench 與 SWE-Skills-Bench 上確認 307 個技能誘發失敗(125 功能失敗 + 182 效率迴歸)。Task-Implementation Fault 佔功能失敗 68.8%(相關技能讓 agent 做錯或漏做必要元素);Excessive Procedure 佔效率迴歸 62.6%(技能把驗證清單與建構配方變成強制工作)。釋出 SkillTriage 自動歸因工具,功能失敗根因命中率 88.8%。

307 個失敗

125 功能失敗 + 182 效率迴歸,兩個基準差分對比確認

相關技能才致命

僅 1.6% 是明顯不相關技能;68.8% 是 Task-Implementation Fault

不是 prompt 太長

62.6% 是 Excessive Procedure(多做步驟),僅 25.3% 是 context 膨脹

SkillTriage

功能失敗 88.8%、效率迴歸 72.5% 命中根因

方法:差分分析框架

技能效果「好壞混雜」是已知事實,但過去無法把失敗歸因到具體技能。這篇論文把「差分測試」思維搬到技能評估:

它把「技能好不好」從主觀感受變成可量測、可歸因、可自動化的工程問題。

功能失敗分類(125 例)

類別數量佔比
Task-Implementation Fault(做錯/漏做必要元素)8668.8%
Artifact Misplacement(產物放錯位置)2419.2%
Environment Mismatch(依賴/環境錯配)1310.4%
Applicability Mismatch(適用性錯配)21.6%

TIF 內部 IRF(做錯必要元素)+ RRO(漏做必要元素)合計 82 例。

效率迴歸分類(182 例)

類別子類數量佔比
Excessive ProcedureExcessive Verification(過度驗證)6736.8%
Heavy Implementation Pipeline3016.5%
Excessive Exploration179.3%
Context BloatSkill-Body 43 + Supplementary 34625.3%
Dependency Resolution脆弱/不相容依賴2212.1%

EP 小計 114 例(62.6%)> CO 46 例(25.3%)——推翻「只是 prompt 變長」的直覺。

四大發現

  1. 相關技能才致命:125 例中僅 2 例(1.6%)是明顯不相關技能;絕大多數是「看起來高度相關」卻讓 agent 做錯或漏做必要元素(TIF 68.8%)
  2. 效率迴歸不是 prompt 太長:Excessive Procedure 佔 62.6%,遠高於 Context Bloat 25.3%。技能把可選活動變成強制步驟
  3. context 膨脹幾乎全來自強制正文:46 例中 43 例是 Skill-Body Context Bloat。技能正文應精簡,範例/長清單應延遲載入
  4. 過度驗證 + 重型建構管線是最大來源:67 + 30 例。驗證範圍與建構深度應依不確定性、變更規模、預算調整

對 Hermes / DKY 的啟發

限制