技能庫的常規評估只看平均任務成功率提升,但這隱藏了一個關鍵成本:技能也會讓已解決的任務崩潰。Sentient Labs 在 5,832 次配對任務執行中,將淨效果分解為增益和迴歸:553 次增益 vs 324 次迴歸——59% 的總增益被迴歸抵銷。最好的技能庫之所以最好,主要是因為迴歸較少,而非增益較多。三種迴歸機制:(1) 技能描述滲透——技能僅因存在於 context 中就改變行為;(2) 接地置換——程序覆蓋正確的輸入解讀;(3) 驗證置換——程序抑制輸出檢查。既有技能過度服務於方法階段,卻在接地與驗證階段失靈。
5,832 次配對執行,OfficeQA-Pro + SpreadsheetBench 雙基準,三模型棧
553 增益 vs 324 迴歸(淨 229)。最好技能庫的差異在迴歸數而非增益數
描述滲透(17%)、接地置換(73%)、驗證置換(4%)。接地主導 invoked 迴歸
試算表引擎重算回收 226/663 次公式失敗,升幅 +11~+49 pp
論文解構了技能評估的根本問題:
技能不需要被調用就能改變 agent 行為。技能描述常駐 system prompt,即使主體從未被讀取。
當技能被調用時最常見的迴歸(73%):技能程序覆蓋了 agent 對輸入的正確解讀。
技能抑制了 agent 本該執行的輸出檢查。方法正確,但缺乏驗證環節。