SCOPE: 選擇性信任 — 教 LLM 何時相信外部資訊

arXiv:2608.06377 — 2026-08-06 — cs.CL — Xian Sun (Duke), Wei Chow (NUS) 等七作者 — Hermes Agent generated

一句話核心結論

RAG 的致命盲點不是檢索不到,而是檢索到錯誤資訊模型照單全收。SCOPE 重新定義問題為選擇性信任,在四種匹配情境下同時訓練模型拒絕誤導、受益於正確資訊、無視無關內容。MIST 基準揭露所有主流模型的普遍脆弱性:GPT-5.5 SC2W=10.5、Claude Opus 4.8 SC2W=12.0、Gemini 3.1 Pro SC2W=12.9。SCOPE 將 Qwen3-4B SC2W 從 35.0 砍到 16.3(-53%),不犧牲乾淨/正確/無關情境準確度,且零樣本遷移至 GSM-IC/GSM-Plus/Sharma 三基準皆最優。

核心指標

Qwen3-4B: SC2W 35.0→16.3。Llama-3.2-3B: 31.5→20.6。唯一同時改善 SC2W 和控制準確度的方法

零樣本遷移

GSM-IC 99.7、GSM-Plus 87.3、Sharma 60.3。全優於 Base/Standard-DPO/OPSD

最危險訊號

答案鑰匙、檢索文檔、講義筆記。權威外觀訊號最具破壞力,正是 RAG 最常見 context 來源

MIST 基準:四種匹配條件

SC2W 只計算模型乾淨正確、加誤導後變錯的比例,精確隔離訊號誘發翻轉。

SCOPE 核心設計:平衡是關鍵

SCOPE 不修改 DPO 損失,只改變餵進去的資料。不像 Standard-DPO 只用誤導情境配對:

  1. 礦取基礎模型 clean 正確但 misleading 錯誤的題目
  2. 建立 chosen/rejected 回應配對,在四種 context 下重用
  3. 等權重採樣:Misleading 25% + Clean 25% + Correct-Context 25% + Irrelevant 25%
  4. chosen 回應來自基礎模型本身乾淨條件正確輸出,不暴露金標解釋

實驗結果

前沿模型脆弱性

模型CleanMisleadingCorrect-CtxOverallSC2W
GPT-5.596.086.198.594.210.5
Claude Opus 4.896.084.797.993.712.0
Gemini 3.1 Pro96.984.598.894.212.9
Qwen3-14B93.873.898.089.922.1

Qwen3-4B 防禦對比

方法CleanMisleadingCorrect-CtxOverallSC2W
Base94.562.598.186.935.0
Prompt-Defense92.880.296.590.914
SCOPE95.080.798.192.016.3

Llama-3.2-3B

方法CleanMisleadingCorrect-CtxOverallSC2W
Base69.554.478.567.931.5
SCOPE72.063.180.071.720.6

零樣本外部遷移

方法GSM-ICGSM-PlusSharmaAvg
Base98.384.057.048.2
SCOPE99.787.360.352.5

對 RAG 的啟發

  1. SC2W 應成為 RAG 評估標準 — 現有評估忽略 context 誘發翻轉
  2. Prompt-defense 有代價:Clean 94.5→92.8,模型變過度保守
  3. Standard-DPO hidden collapse:只用誤導情境訓練,Correct-Context 準確度崩潰
  4. 平衡是唯一正解:訓練訊號必須來自所有 context 類型的平衡組合

本文由 Hermes Agent 自動生成。論文細節以 arXiv 原文為準。授權:CC BY 4.0