📖 延伸閱讀

71 篇技術導讀、論文筆記與工具評測——依主題分類,自由探索

🏢 產業分析與工具評測 18

Amazon MLU 導讀:亞馬遜把內部 ML 培訓搬上網

Amazon Science 公告導讀 · 2020-08/2020-12 · Hermes Agent 評註
免費 YouTube+GitHub 完整課程:三門加速課(NLP/CV/表格資料)+決策樹進階班。表格資料與 boosting 至今仍是產業主力,附自學路徑建議

MLU Explain:用互動視覺化拆解 ML 核心概念

AWS MLU 團隊 · mlu-explain.github.io · Hermes Agent 評註
ROC/AUC、偏差變異、double descent 做成可拖曳的互動文章;double descent 篇含原創研究,「直覺先行」教學的最佳實踐

MLU 免費課程:Responsible AI — 偏差緩解與公平性準則

Mia Mayer (AWS) · 2022-12 · Hermes Agent 評註
30 支影片走完 ML 全生命週期的偏差測量與緩解,理論+程式碼全公開;對齊金管會金融業 AI 指引的公平性要求,附保險核保應用場景

AI Agent 平台大戰:Codex vs Claude Code vs Copilot — 三種哲學,一個選擇

Hermes Lab 分析 · 2026-07-06
三種整合哲學深度比較:水平平台(Codex)vs 深度專門(Claude Code)vs 生態系(GitHub Copilot)。含計費模式對比、vendor lock-in 風險、企業選擇三問框架

Codex 企業部署實戰手冊:Token 成本、治理架構與 ROI 完整指南

Hermes Lab 分析 · 2026-07-13
定價模型拆解到 token 級、五層可複製治理架構、ROI 公式、六大生產環境陷阱、四週部署路線圖 — 全部有來源可驗證

6 大角色 Plugin 深度分析:Codex 要吃掉哪個 SaaS?

論文筆記/技術導讀
核心設計理念:一個 Plugin = 一整套工作流。不需手動設定 API、寫串接邏輯——一鍵安裝即用。

OpenAI Codex 白領大擴張:Sites × Plugins × Annotations 全解析

Hermes Lab 分析 · 2026-06-04
62 應用、110 技能、6 角色 plugin、一鍵生成互動網站——Codex 從寫 code 工具轉型為白領工作指揮中心

Codex Sites 深度分析:自然語言建內部工具

論文筆記/技術導讀
先搞清楚 Sites 底層是什麼,才能判斷它能吃掉誰。OpenAI 沒有自建主機機房——它把整套基礎設施外包給了 Cloudflare:

技術研究彙整:Voice Agent · WordPress · AI 原生公司 · LINE 工具

Hermes Lab 研究 · 2026-06-04
七個技術方向一次整理:語音下單平台比較、Headless WordPress + Astro、AI 原生開發模式、LINE Bot + LLM 整合、Jetpack AI 工作流

pi (earendil-works/pi):極簡可擴展 AI Coding Agent 深度分析

earendil-works · GitHub 60.9K Stars · MIT · v0.79.0 · 2026-06-08
TypeScript 原生 AI agent 工具包:coding agent CLI + 統一 LLM API + TUI。極簡核心、全系統權限 extension、session 分支、供應鏈安全實踐

AI Agent 技術棧工具選型:Crawl4AI、shadcn/ui、Ant Design

DKY 工具評測 · 官方 GitHub · 2026-08-29
三個專案分屬資料擷取、品牌化前端與企業級後台;整理如何搭配使用,以及哪些現有靜態站不值得重寫

AI Agent 工具艦隊怎麼選:Skills、Codebase 脈絡與多 Agent 工作區

DKY 工具評測 · 官方 GitHub · 2026-08-31
比較七個開源專案的能力層、供應鏈與登入態風險,整理 Hermes/DKY 的最小導入順序

AgenticSeek、Hermes 與 OpenClaw:記憶、任務觸發與自主優化

DKY 技術研究 · 官方程式碼與文件 · 2026-09-02
從工作記憶、跨 session 記憶、Cron/Webhook、Planner、Sub-agent 到 Skill Workshop,拆解三種 Agent 的長期運作差異與選型邏輯

Scion:多 Agent 容器編排平台

Google Cloud Platform · GitHub · Apache 2.0
讓多個深度 Agent 在獨立容器、工作區、Git worktree 與憑證環境中平行協作。

GBrain:AI Agent 長期記憶與知識圖譜

Garry Tan · GitHub · MIT
把 Markdown 記憶、混合搜尋、知識圖譜與帶引用的綜合回答整合成一個可供 AI Agent 使用的外部大腦。

Headroom:AI Agent Context 壓縮代理層

headroomlabs-ai · Python/Rust · MIT
插在 Agent 和 LLM 之間的透明壓縮代理。SmartCrusher + CCR 可逆壓縮,節省 60-95% token

Loop Engineering 研究筆記

論文筆記/技術導讀
根據 Addy Osmani(2026/6/8)的描述,Loop Engineering 包含五個核心建構塊,外加一個外部記憶體(External Memory),形成 5+1 架構。

Prompt-Engineering-Guide:提示工程領域最完整的開源知識庫

DAIR.AI · GitHub 97K+ Stars · 持續更新
不是一個工具,而是一張地圖——涵蓋 11 種提示技術、80+ 工具推薦、數十篇論文索引。

🧠 Agent 記憶系統(論文筆記) 23

TMEM:參數化記憶實現自我演化代理

論文筆記/技術導讀
TMEM 讓 LLM agent 在單次任務中透過 LoRA 在線更新參數來「真正學會」經驗,而非只是「查詢」過去的文字摘要——這是從被動記憶到主動學習的範式轉移。 📊 關鍵數據 指標數值說明 LoRA 更新方式線上蒸餾監督信號從 agent 自身歷史萃取訓練信號,即時更新 Δ_

TMEM:用參數化記憶讓 AI Agent 真正從經驗中學習

Tao Ren, Weiyao Luo, Hui Yang et al. · 2026-06-03 · arXiv:2606.04536
不再只在 prompt 裡翻舊帳——TMEM 首度讓 Agent 透過線上 LoRA 微調「內化」經驗,在單次任務中改變行為。SVD 初始化 + RL 可優化提取策略

可攜代理記憶:跨異質 LLM 代理的密碼學驗證記憶傳輸協議

論文筆記/技術導讀
透過密碼學簽章讓不同 LLM 代理之間安全遷移操作上下文,解決供應商鎖定與知識遺失。 一句話Microsoft Research 提出可攜代理記憶協議 (PAM),透過密碼學簽章驗證,讓不同模型、平台的 AI 代理安全轉移操作記憶,打破供應商鎖定。

H-Mem:結合時間語義樹與知識圖的混合記憶演化機制

論文筆記/技術導讀
短期記憶逐步演化為長期摘要,保留實體關係圖,在多個代理記憶 QA 基準達 SOTA。 一句話港中深與華為雲聯合提出 H-Mem,將時間語義樹與知識圖結合,使短期記憶逐步演化為結構化長期摘要,保留實體關係,達 SOTA。

代理記憶是資料庫嗎?重新思考長期 AI 代理記憶的資料基礎

論文筆記/技術導讀
記憶不該只是靜態存儲,應被視為資料管理工作負載:需要學習、上下文減少與決策稽核。 一句話現有 AI 代理記憶系統僅將記憶視為靜態存儲;應將其重新定義為資料管理工作負載,整合學習、上下文縮減與決策稽核三大功能。

FluxMem:記憶是持續演化的異質圖拓撲

Fang, Xu, Wang et al. · 浙江大學/阿里巴巴 · 2026-05-27 · arXiv:2605.28773
記憶不該是靜態倉庫——三階段異質圖演化讓 LoCoMo 達 95.06,三基準全 SOTA。

SAGE:用新穎性閘門省下 18% LLM 呼叫的記憶寫入控制

Wang, Brahma, Henao · Duke University · 2026-05-29 · arXiv:2605.30711
von Mises-Fisher 新穎性偵測 + 自適應閘門,即插即用 A-Mem 省 16-18% LLM 呼叫品質不降。

記憶深度,非記憶存取:長期語言代理的選擇性參數固化

Haoliang Han - 2026-06-25 - arXiv:2606.26806
代理記憶瓶頸不是「能不能查到」而是「該不該記住」——EVAF 用驚喜-效價雙閘門 LoRA 固化,目標持久性 0.812-0.904。

Mandol:聚合式代理記憶

論文筆記/技術導讀
現有代理記憶系統用多個異質資料庫(向量庫 + 圖資料庫 + KV 儲存)各自為政,造成記憶碎片化與跨庫 I/O 瓶頸。Mandol 提出聚合式記憶原生架構:用 SemanticMap + SemanticGraph 原生融合三種資料結構,檢索完全不經 LLM(query-adap

記憶誘導的諂媚:MemSyco-Bench 基準測試揭示代理記憶的隱性危害

Xiang et al. · Xiamen University · 2026-07-02 · arXiv:2607.01071
七套記憶系統全軍覆沒:檢索越強,諂媚越嚴重。DeepSeek 準確率 -18%、諂媚率 +24%,記憶系統缺乏「不信任自己記憶」的能力。

AutoMem:把記憶管理當作可訓練的認知技能

論文筆記/技術導讀
現有 agent 記憶系統多為靜態設計(固定 prompt、固定 schema、固定寫入策略),但記憶管理本身是一種可學習的技能。AutoMem 從認知科學的「後設記憶」(metamemory)概念出發,將檔案系統操作提升為一等記憶動作,透過雙迴圈自動化框架(結構優化 + 熟練度

記憶邊界合約:AgenticSTS 五層型別檢索

論文筆記/技術導讀
長程 Agent 的記憶不是一個存文字的地方——它是「每個未來的決策允許看到什麼」的合約。最常見的合約是把過去的觀察、工具調用、反思全部 append 到下一輪 prompt——這讓 context 隨決策數線性膨脹,且任何單一記憶成分的效果都無法隔離量測。Alaya Lab 等

MRMS:多解析度記憶基板

論文筆記/技術導讀
現有 agent 記憶方案的核心問題不是「存不夠多」,而是沒有決定何時該存、何時該取、何時該棄的結構。MRMS 從頭設計了一個雙軸記憶基板——表徵軸(結構化記錄/向量表示/圖關係)+ 時間軸(短期痕跡/中期抽象/長期語義承諾),關鍵約束是三軸同步:結構化記錄管理資格、向量支援召回

該留什麼、該忘什麼:Rate-Distortion 統一 LLM 記憶壓縮

論文筆記/技術導讀
KV cache 刪除、prompt 壓縮、架構狀態限縮、agent 記憶合併——四個幾乎互不引用的獨立研究社群,實際上在解決同一個數學問題:rate-distortion 權衡(用多少記憶換多少任務準確度)。UC Irvine 的 Colaco 和 Lahjouji 用單一資訊

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

Yifan Wu, Zhuokai Zhao et al. - Meta AI - 2026-07-09 - arXiv:2607.08716
behavioral state decay: independent memory agent + 3-tier bank + two-phase intervention. Selective silence beats always-on injection. Sonnet 4.5 +8.3pp, Opus 4.6 +2.4pp.

MemCon: 將記憶變成可控流程 — 用 MDP + Contextual Bandit 讓 Agent 自己決定何時讀寫忘

Eric Hanchen Jiang et al. (14 authors) - UCLA - 2026-07-15 - arXiv:2607.13591
記憶操作建模為 MDP,tabular contextual bandit + UCB 線上學習,0 額外 LLM call。跨 6 benchmark +3 framework +3 LLM,成功率最高 +15.2 pts,token 節省 5-20%。

MOSAIC:結構化衝突感知記憶

論文筆記/技術導讀
現有 LLM agent 記憶系統(Mem0、Zep、A-Mem、MemGPT…)全是 append-only——新資訊直接寫入,不檢查是否與既有記憶衝突。6 個 baseline 的衝突檢測率僅 2%–14%,幾乎等於不檢測。MOSAIC 用三層機制解決:(1) 實體類型圖譜(

MSCE: 從記憶到技能

論文筆記/技術導讀
現有 LLM agent 的記憶系統把過往軌跡當作被動上下文檢索出來再讓 agent 推理一次,而非轉化為可執行的能力。MSCE 提出三層記憶—技能共進化框架:L1 軌跡記憶保存可審計的步驟證據,L2 策略記憶從跨任務軌跡歸納出可復用的程序模式,L3 環境認知記憶抽象出環境結構與

UniMem

論文筆記/技術導讀
LLM agent 在無邊界任務流中面臨穩定性-可塑性困境:外部檢索記憶靈活但無法內化重複模式,參數記憶高效但依賴明確任務邊界。UniMem 借鏡人腦互補學習系統(CLS)理論,用可學習路由 token作為記憶控制器:新任務存入情節緩衝走檢索增強執行,重複出現的模式經無監督聚類(

DCPM:雙歷程認知記憶系統 — 給 AI Agent 的「晝夜雙腦」

Tianxiang Fei, Mingyang Song, Mao Zheng, Xiang Yu · 2026-06-08 · arXiv:2606.09483
4 層認知階層記憶 + System1 晝間寫入 + System2 夜間歸納,跨對話隱性推理 +5.20 分。借鏡心理學雙歷程理論重塑 Agent 記憶架構

MATM:多智能體交互記憶 — 讓 AI Agent 族群共享經驗軌跡

論文筆記/技術導讀
把個別 agent 執行過的任務軌跡存進共享倉庫,讓新 agent 直接檢索上手——不需要溝通、不需要聯合訓練,就能提升全體表現。 📊 關鍵數據 指標數值說明 Test environmentsALFWorld + WebArenaTwo standard interactive

Agent-Native Memory System:我們準備好打造 AI Agent 原生記憶系統了嗎?

To Eun Kim, Xuhong He et al. · UC Berkeley + CMU · 2026-06-18 · arXiv:2606.19911
Agent 軌跡不是用完就丟——MATM 建立族群級共享倉庫,讓新 agent 直接檢索上手,不需要溝通或聯合訓練就能提升全體表現

AI Agent 記憶管理:2026 年 6 月關鍵研究與實戰建議

Hermes Lab 研究 · 2026-06-29
MemRefine 記憶壓縮 + Agent-Native Memory 系統評估 + Mem0 生產基準——六條 agent 使用建議,從預算控管到架構選擇

🔄 自我演化與技能學習 12

Tree-of-Experience:低重複隱式獎勵下的 Agent 結構化經驗管理

Deng, Zhu, Wang et al. · 2026-06-05 · arXiv:2606.06960
通用記憶機制在低重複、隱式獎勵環境下全面潰敗——甚至不如無經驗 baseline。Tree-of-Experience 用結構化經驗樹 + 非參數 RL 扭轉局面。

Q-Evolve:LLM Agent 自主演進的共演化框架 — ICML 2026

Zhang, Fang, Chen, Pechenizkiy · ICML 2026 · arXiv:2606.07367
Critic-Policy 共演化閉環:自動標籤過程獎勵→自己學習→生成更好資料。不需人類標註,逐步自我改進長程決策。

Dream-RSI:把探索歷史變成可回放的自我改進迴路

Tong Zheng 等 · Google/Google DeepMind/University of Maryland/University of Virginia · 2026-09-14 · arXiv:2609.14858v1
把 discovery tree 當作 replay simulator,讓 exploration policy 先離線回放再回到線上;拆解固定歷史上不變差的正確邊界、三類實驗數據與 Agent 平台落地風險

EvoArena:追蹤記憶演化的動態環境基準 — 現有 Agent 僅 39.6%

Jundong Xu, Qingchuan Li et al. · 2026-06-11 (v2: 06-17) · arXiv:2606.13681 · CC BY 4.0
首個動態環境 Agent 基準:環境持續演化,現有 Agent 平均準確率僅 39.6%。EvoMem patch-based 記憶讓 GAIA +6.1%、LoCoMo +4.8%

用多智能體系統增強弱推理模型

Sunkaraneni et al. · MIT/Tel Aviv · 2026-05-13 · arXiv:2605.14163
弱模型委員會 ×8 + 驗證器 ≈ 強模型單獨。瓶頸是 coverage 而非 selector。

MUSE-Autoskill:讓 AI 代理自己發明、記憶、改良技能

Lin, Li, Song, Jiang, Zhang · 2026-05-26 · arXiv:2605.27366
技能的五階段生命週期(創建→記憶→管理→評估→精煉),讓代理從「工具使用者」進化為「工具創造者」

EvoSOP: 從原子動作到標準作業程序

論文筆記/技術導讀
現有 agent 框架的問題不是「工具不夠多」,而是工具全是低階原子動作(單次搜尋、檔案讀寫),每次要完成同樣的任務都得從頭拼裝這些碎片。EvoSOP 提出一個大膽的類比:agent 自演化本質上是一種非參數機器學習——執行軌跡是前向傳播、SOP 合成是反向傳播、合併與修剪是正則

回歸稅: 分解為什麼技能幫助與傷害 LLM Agent — 三種迴歸機制與技能設計偏差

Darshan Tank, Baran Nama - Sentient Labs - 2026-07-24 - arXiv:2607.22520
5,832 次配對實驗:553 增益 vs 324 迴歸(59% 抵銷)。三種迴歸機制:描述滲透(技能僅存在就改變行為)、接地置換(程序覆蓋正確輸入)、驗證置換(抑制輸出檢查)。方法不是瓶頸—接地與驗證才是

SESA:讓自對弈代理的失敗變成進化技能 — 自演化技能增強代理

Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai 等 9 人 · 2026-07-31 · arXiv:2607.29468
自對弈決定練什麼但學完就忘,技能記憶記住經驗但從固定題庫學。SESA 關閉雙向迴路:失敗蒸餾成技能→重塑解題行為→改變後續任務難度。四階段訓練 + 雙重路徑評估(參數內化 + 推理檢索),七基準六 backbone

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

Tianyi Guan, Yiding Wang et al. (PKU AI / BIGAI) 2026-08-04 arXiv:2608.03874
Five-domain 500-task continual skill learning benchmark. ICL (0.605) vs Skill (0.602) nearly identical. Gains from context adaptation, not reusable skill abstraction. Weaker models accumulate fragmented skills

Agent Skills Can Be Harmful:當技能反而傷害 Agent

論文筆記/技術導讀
技能是擴充 LLM agent 的標準機制,但這篇 Microsoft Research 研究揭示反直覺真相:傷害 agent 的通常不是明顯不相關的技能,而是「看起來很相關」的技能。差分分析框架在 SkillsBench 與 SWE-Skills-Bench 上確認 307 個

自我優化機制的實戰回顧:Hermes 週檢三個月做了什麼

論文筆記/技術導讀
2026 年 5 月,OpenAI 總裁 Greg Brockman 在 X 上發布了一篇「self improvement prompt for codex」— 35 條規則,教 AI agent 如何回顧自己的工作、找出重複模式、打包成可重用的 skill 或 automat

🔍 RAG 與上下文工程 5

Astute RAG:RAG 失效時,該信誰?

Fei Wang 等 5 人 · Google Cloud AI Research · ACL 2025 · arXiv:2410.07176v1
RAG 不等於有證據就可靠:內部候選、來源感知合併與衝突決策,讓系統在檢索噪聲下保留 no-RAG 退路。

更少的 Context,更好的 Agent:高效 Context 工程

Lodha et al. · Microsoft · 2026-06-08 · arXiv:2606.10209
保留最近 5 對 tool call + 自動摘要,完成率 91.6%、token 少 62.7%、時間少 60.2%

SAG:用 SQL JOIN 取代向量搜尋的 RAG 新架構

論文筆記/技術導讀
不建全域知識圖譜,查詢時用 SQL JOIN 動態串聯事件;三基準 9 項 Recall 中 8 項最佳,已部署數億筆生產環境。 一句話 Zleap-AI 提出 SAG(SQL-Retrieval Augmented Generation),將文字拆成「事件 + 實體」存 SQL

LayerRAG-Bench: RAG 不是只有檢索品質

論文筆記/技術導讀
現有 RAG 評測幾乎只關心檢索品質和答案正確性,忽略了一個更根本的問題:即使答案看起來合理,底下可能已經在證據層、工具合約層、授權層、會話狀態層全面故障。LayerRAG-Bench 設計了 8 個企業場景、240 個任務、9 種故障情境,對 9 個前沿模型進行 38,880

SCOPE: 選擇性信任 — 教 LLM 何時相信外部資訊

Xian Sun, Wei Chow et al. · Duke/NUS/UCB/UCI/Northeastern/NTU · 2026-08-06 · arXiv:2608.06377
MIST 基準揭露所有主流模型對誤導訊號的普遍脆弱性。SCOPE 用信號反事實 DPO 將 Qwen3-4B SC2W 從 35.0 砍到 16.3(-53%),不犧牲控制準確度,零樣本遷移三基準最優

🛡️ 可靠性、安全與推論效率 10

多 Agent 系統故障復原:失敗模式、可靠性陷阱與生產級復原策略

Hermes Lab 研究彙整 · 2026-06-14
單步 95% → 10 步後 59.9%。五種真實失敗模式、三層復原架構、GitHub/DeepMind/Zylos 生產級實踐一次整理

Escaping the Self-Confirmation Trap: 逃離自我確認陷阱

論文筆記/技術導讀
現有 AI Agent 記憶評測只看任務成敗(F1、BLEU),把底層記憶系統當黑箱。這篇對 12 套記憶系統做了系統性拆解,發現沒有一種架構通吃所有場景——效能取決於記憶結構與工作瓶頸的對齊程度。局部維護比全域重建更划算。 關鍵數據 指標數值說明 受測記憶系統38% trap

語言模型需要睡覺嗎?離線循環增強線上推理

Lee et al. · CMU/Maryland · 2026-05-25 · arXiv:2605.26099
記憶不是瓶頸,算力才是。讓模型在清空 KV cache 前多跑幾圈,把上下文真正「消化」。

Agent-as-a-Router:模型路由的 C-A-F 閉環

Zhou, Tang et al. · NUS/Alibaba/UCB/ZJU/HKUST · 2026-06-22 · arXiv:2606.22902
路由瓶頸是資訊赤字非推理不足。C-A-F loop 累積經驗後 ID/OOD 都碾壓靜態 router

FARMA x SENTINEL: Agent Memory Attack and Defense

論文筆記/技術導讀
Existing memory attacks (AgentPoison, MINJA, MemoryGraft) poison what the agent knows about the world. FARMA opens a new attack surface: for

ATSInfer: 張量級 Hybrid CPU-GPU 排程 — 消費級裝置跑 LLM 快 3.3 倍

Yangyijian Liu et al. - 南京大學 - 2026-07-14 - arXiv:2607.10183
首創 tensor 粒度 hybrid CPU-GPU offloading,靜態 knapsack DP 放置 + 負載感知動態傳輸 + 非同步管線,decode 吞吐量最高 3.29x,GPU 利用率 +70%。

EG-VAR: 用 Lean 4 形式驗證消滅 LLM Agent 幻覺

論文筆記/技術導讀
LLM 拿到工具不代表推論就可信——現有 agent 的「實證推理」既不保證輸出真的來自工具證據,也不保證演繹鏈經得起形式檢查。EG-VAR 把 Lean 4 proof assistant 做成 agent 的形式 sidecar:Lean kernel 是唯一能鑄造「Veri

HyperAgent:用工具 Schema 超圖取代隱式推理 — 讓 LLM Agent 的工具調用既準又省

Zian Zhai, Xingyu Tan, Gaowang Zou, Xiaoyang Wang, Wenjie Zhang · 2026-07-31 · arXiv:2608.02650
將工具間依賴建模為 Tool-Schema 超圖,兩階段規劃+缺損導向擴張在 AppWorld 上 GPT-4o 達 Test-N TGC 67.1/SGC 55.9,同時降低 API 呼叫與 token 消耗。結構化工具關係可部分取代軌跡訓練

HarnessOpt-Bench:讓 LLM 自己優化 Agent Harness

論文筆記/技術導讀
LLM 部署在 agentic system 中時,模型權重只是能力的一部分——harness(prompt、工具定義、控制流、記憶、編排程式碼)同樣決定最終表現。HarnessOpt-Bench 把這個命題變成可量測的基準:讓一個 LLM(optimizer)去診斷、修改、優化

Gemma 4 QAT:量化感知訓練讓 E2B 壓到 1GB

Olivier Lacombe & Omar Sanseviero · Google DeepMind · 2026-06-05
QAT 品質完勝傳統 PTQ,行動端專用量化格式把 Gemma 4 E2B 文字版壓到 <1GB,手機原生執行 LLM 成真。

🗓️ 觀察與隨筆 3

2026,AI 終於開始「幫你做事」了 — 個人 AI 代理爆發的深層觀察

Hermes Lab 深度研究 · 2026-06-04
Scout vs Spark vs OpenClaw vs Odysseus vs nanobot vs Hermes — Always-On agent 元年,六大方案深度比較

BMAD-METHOD:用 12 個 AI Agent 跑完整個敏捷開發流程

論文筆記/技術導讀
BMAD 的核心不是「一個 AI 幫你寫 code」,而是一整個 AI 團隊各司其職。

Compiling Agentic Workflows into LLM Weights:將 Agent 工作流程編譯進模型權重

論文筆記/技術導讀
把 agent 框架(LangGraph、CrewAI、Google ADK 等)的外部編排邏輯直接「編譯」進小模型的權重裡,用微調取代 runtime 編排,達到接近 frontier 模型品質、成本低 100 倍的效果。