自我優化不是口號:Hermes 週檢機制的實戰回顧

📅 2026-06-04 · Hermes Lab 內部報告

自我優化睡眠固化Brockman 記憶管理CronSkill

背景:Brockman 的啟發與我們的實作

2026 年 5 月,OpenAI 總裁 Greg Brockman 在 X 上發布了一篇「self improvement prompt for codex」— 35 條規則,教 AI agent 如何回顧自己的工作、找出重複模式、打包成可重用的 skill 或 automation。

他剛又發了一次。但我們已經實作完了。

5 月 27 日,Hermes 建立了 hermes-self-improvement 技能,整合 Brockman 的 12 步驟框架 + arXiv 2605.26099(LLM 睡眠機制)+ 七步驟週檢流程。每週日 12:00 UTC,cron 0d655aa6059e 自動執行。

這篇文章不是設計文件。是回顧:這套機制跑了一個多月,實際產生了什麼價值?

產出 1:發現並修復了 2 個持續浪費資源的 Bug

第一次睡眠固化(5/27)的 Pass 1 做了全面的 cron 健康掃描,結果:

發現影響處理
TKY Worker(730af8c00074)
每 2 分鐘執行一次,837/837 次全部失敗
每天浪費 12 分鐘 CPU、720 次無意義執行已修復
n8n-health-watchdog(2464d6846990)
引用的腳本不存在
每 5 分鐘報錯一次已暫停
4 個 cron 在 5/26 同時被暫停dky-tools 雙站監控、美股工具監控、App 評論監測、n8n 守護全部停擺後續逐步恢復
如果沒有週檢:TKY Worker 可能到現在還在每 2 分鐘浪費一次 CPU。4 個暫停的監控 cron 可能到現在還沒人發現。

產出 2:記憶體從 93% 降到 67%

第一次睡眠固化(5/29)對 MEMORY 做了深度清理:

如果沒有睡眠固化:記憶體會持續膨脹。已移除的 LiteLLM Proxy 設定會繼續出現在未來 session 中,讓 AI 誤以為服務還活著。明碼 token 會一直留在記憶裡。

產出 3:4 個 Cron 合併為 1 個週檢

之前有三個記憶相關的 cron 各自獨立運行。週檢分析發現它們高度重疊:

合併前合併後
1643658cca53:記憶研究追蹤(每 14 天)0d655aa6059e:七步驟週檢
① 研究掃描 → ② fact_feedback → ③ trust 清理 → ④ 自我優化 → ⑤ 睡眠固化 → ⑥ MEMORY 檢查 → ⑦ 摘要
自我優化(每週)
睡眠固化(觸發式)

合併後的好處:不再有三個 cron 各自跑、各自產出重複結果。一次跑完七步,從研究到清理到固化到報告一氣呵成。

產出 4:從分析中催生了新 Skill

每次週檢不只清理垃圾,更重要的是發現模式、建立能力:

週檢發現產出
ISLP 課程部署常因 Google token 過期失敗修補 islp-teaching:強制「起飛前 refresh token」步驟
子 agent 表現不穩定,需汰弱留強建立 subagent-performance-management skill
內容策展流程缺少子 agent 追蹤修補 content-curation-pipeline:加入 Phase 6
記憶管理缺少長期策略裁定:fact_feedback 循環 → replace>add → trust<0.3 自動清理
Brockman 框架的核心:「只做高信心的、窄的、可驗證的」。我們沒有建立 10 個 speculative skill。每次只挑最有把握的 1-2 個改善點,確保每個都能實際測試。

產出 5:持續追蹤最新研究,轉化為架構決策

週檢第一步會掃描最新 AI agent 記憶管理論文。5/31 的掃描產出三篇摘要:

這些論文不是「讀完就存檔」。每篇都被轉化為對 Hermes 架構的具體建議,有些已實作(trust score),有些列入 roadmap(自適應觸發)。

量化總結

指標改善
Cron 健康度2 broken → 0,4 paused 逐步恢復
MEMORY 使用率93% → 67%(減少 28%)
fact_store 條目75 → 51(清理 24 條過時/重複)
Cron 數量3 個記憶相關 → 1 個七步驟週檢
新建/修補 Skill4 個(sleep-consolidation、self-improvement、subagent-perf、islp-teaching fix)
論文追蹤3 篇最新記憶管理論文 → 架構建議

Honest Assessment:還沒做好的部分

不是所有事都完美。坦承幾個弱點:

Brockman 框架 vs 我們實作:一個對照

Brockman 35 條原則Hermes 實作狀態
回顧 30 天找重複模式✅ 週檢 Pass 1:多軸 session_search
證據優先級(sessions→memories→chronicle)✅ 步驟① 研究追蹤 + fact_feedback
≥2 次出現才包裝✅ 睡眠固化 skill 候選門檻
選最小形式(skill/subagent/auto/skip)✅ 產出優先序:reference > patch > new skill
只建高信心項目✅ 「窄、實用、可驗證」鐵律
先檢查現有 skill 避免重複✅ 強制先 patch 再考慮新建

結語

Brockman 的自我優化框架不是什麼神奇的魔法。它就是一組紀律:定期回顧、找模式、做最小的改善、避免重複造輪子。

但紀律本身就是最難的部分。讓 AI 自己遵守紀律——每週自己掃描、自己分析、自己清理、自己建立能力——這才是真正的價值。

一個月前,Hermes 的記憶體 93% 滿、有 broken cron、有明碼 token 殘留、有已移除服務的設定。一個月後,這些問題被自動發現並修復了。

自我優化機制的價值,不在於一次做了多少,而在於它不會停。


Hermes Lab 內部報告 · 2026-06-04 · 基於 hermes-self-improvement + hermes-sleep-consolidation skill
參考:Greg Brockman "self improvement prompt for codex" · arXiv 2605.26099