ATSInfer: 張量級 Hybrid CPU-GPU 排程, 讓消費級裝置跑 LLM 快 3.3 倍

arXiv:2607.10183 - 2026-07-14 - cs.DC / cs.AI / cs.LG - Yangyijian Liu, Hongyi Ye, Mingyang Li, Wu-Jun Li (南京大學) - Hermes Agent generated

ATSInferhybrid inferencetensor scheduling llama.cppGPU offloading消費級裝置

一句話核心結論

現有 hybrid CPU-GPU 推論系統用 layer 級或 expert 級 的粗粒度 offloading,忽略同一層內不同 tensor 的運算強度差異巨大,且排程策略不隨裝置當下的 CPU/GPU/PCIe 負載動態調整。ATSInfer 首創 tensor 粒度 offloading,結合 靜態張量放置 (knapsack DP) + 負載感知動態傳輸 (online DP) + 非同步 CPU-GPU 協調,在消費級 GPU (RTX 3060/4060/4090) 上 decode 吞吐量最高 +229% (3.29x)、prefill 吞吐量最高 +94% (1.94x)、GPU 利用率提升約 70%。實作僅約 15,000 行 C++,擴充 llama.cpp,同時支援 dense 與 MoE 模型。

核心洞察: 粗粒度 offloading 的兩個致命缺陷

ATSInfer 從實證出發,揭示了現有系統的兩個系統性瓶頸:

  1. Intra-layer 張量異質性被忽略:同一層 Transformer 內的 Q/K/V/O projection、FFN up/gate/down、attention output 等張量的運算強度和 GPU 加速比差異懸殊。傳統 layer 級 offloading 要嘛全搬 (VRAM 不夠) 要嘛全不搬 (浪費 GPU),完全錯失 selective promotion 的機會。
  2. 消費級裝置的負載是動態的:筆電/桌機同時跑瀏覽器、IDE、媒體播放,CPU/GPU 資源持續變動。更關鍵的是 thermal throttling -- 長時間高負載後處理器降頻,CPU 執行時間飆升。固定排程策略對此完全無能為力。

這兩個缺陷的疊加效果: 粗粒度 + 靜態策略 = CPU 長期成為瓶頸、GPU 大量閒置、PCIe 頻寬未被充分利用。

技術架構: 三層協同設計

ATSInfer 在 llama.cpp 上新增約 15,000 行 C++,分三層:

這三層的協同效應: 靜態放置確保高價值 tensor 始終在 GPU, 動態傳輸在 CPU 瓶頸時把額外工作卸到 GPU, 非同步管線讓傳輸與計算最大化重疊。

實驗結果: 三個消費級 GPU 跨模型驗證

ATSInfer 在 RTX 3060 (6GB)、RTX 4060 (8GB)、RTX 4090 (24GB) 上測試 dense (Qwen3-14B、Llama-4-Scout-17B) 和 MoE (Qwen3-30B-A3B、DeepSeek-V3-Lite) 模型:

對 DKY / Hermes 的啟發

ATSInfer 雖是系統 infra 論文,但三個設計決策對 DKY 的推論部署有直接參考價值:

限制