![[論文學習]自適應大語言模型監控:基于激活水印](http://pic.xiahunao.cn/yaotu/[論文學習]自適應大語言模型監控:基于激活水印)
Adaptively Robust LLM Monitoring via Activation Watermarking論文重點本文提出了一種名為激活水印Activation Watermarking, AWM的全新LLM監控范式通過在模型內部表征中嵌入密鑰相關的檢測信號使監控系統在面對具備完整監控方法知識但不知曉密鑰的自適應攻擊者時仍能保持較高的檢測魯棒性。實驗表明在1%假陽性率下針對代理優化的自適應攻擊對現有基線的規避率高達79%以上而AWM將規避率降至37%左右降幅超過一半。核心研究內容問題定義LLM服務提供商需要監控部署模型的使用行為以檢測那些無法通過對齊和紅隊測試預先防范的濫用行為。然而現有的監控機制如各類護衛模型通常是確定性的且公開可用自適應攻擊者可以在本地復制一份監控器離線搜索既能誘發有害行為又能規避檢測的提示詞。更棘手的是這種攻擊對提供商而言完全不可見他們無法觀測到濫用行為的發生也就無法事后修補防御。其核心挑戰在于如何在保持對非自適應攻擊檢測率的同時抵抗自適應攻擊者。創新方法AWM的核心思想是將監控信號從文本層面下沉到模型內部激活空間并通過密鑰引入隨機化密鑰生成為每個目標層使用密鑰采樣一個高斯方向向量 ( w_\ell )作為秘密檢測方向。水印嵌入對基座模型進行微調在有害響應時將激活向量拉向密鑰方向 ( w_\ell )在良性響應時拉向反方向 ( -w_\ell )。微調同時通過KL散度約束保留基座模型的行為。檢測方向與有害行為的表征被糾纏在一起使得攻擊者難以在不損害模型效用或改變行為的情況下移除水印。檢測階段推理時提供商記錄目標層的隱藏狀態計算與密鑰方向的余弦相似度并聚合為標量統計量超過預設閾值即觸發告警。策略歸因由于高維空間中隨機采樣的方向近似正交可以為每個監控策略分配獨立的水印方向從而實現“哪個策略被違反”的歸因。在20個策略的場景下AWM以80%的準確率識別被違反的策略而隨機基線僅為5%。研究成果非自適應攻擊在Jailbroken、DeepInception、Multilingual和AutoDAN四種越獄攻擊下AWM在四種攻擊中的三種上取得最低規避率AUROC達到0.92-0.96。激活空間的監控器AWM和ActProbe在所有攻擊上均匹配或超越文本級護衛模型。自適應攻擊在代理優化的自適應AutoDAN攻擊下LlamaGuard的規避率達85%QwenGuard為79%ActProbe高達93%而AWM僅為37%±11%。跨密鑰遷移實驗中針對一個密鑰優化的攻擊遷移到其他密鑰時規避率從100%降至24%-59%均值37%。集成多密鑰的優化攻擊也未能顯著提升對未見過密鑰的遷移效果。模型效用在BBH、IFEval、MMLU-PRO、TruthfulQA、GSM8K、MATH-Hard和HumanEval七個基準上AWM帶來的效用損失極小BBH和MMLU-PRO幾乎不變其他任務下降0.6-2.2個百分點。效率AWM在推理時無需額外的前向傳播直接復用提供商已有的激活值計算余弦相似度幾乎為零的推理開銷。實際落地應用的可能性AWM的實用價值體現在三個層面輕量級部署無需額外的護衛模型復用LLM推理過程中已計算的激活值即可完成檢測推理開銷可忽略。策略歸因能力提供商可以為不同政策如禁止生成惡意代碼、禁止泄露隱私信息等分配獨立的水印方向當違規發生時不僅知道“發生了違規”還能知道“違反了哪條政策”。這對于企業內部合規審計和多租戶場景下的責任追溯具有直接價值。自適應攻擊防御在基座模型公開可獲取的場景下如Qwen、Llama等開源模型AWM提供了一種不依賴“保密”的密鑰化防御機制。即使攻擊者完全了解監控算法只要不知道密鑰就無法可靠地構造規避攻擊。技術細節水印嵌入損失函數AWM的微調過程包含兩個損失項KL散度約束保持基座模型 ( M ) 的行為不變[\mathcal{L}{\text{KL}} D{\text{KL}}(p_{\theta}(\cdot \mid x) \parallel p_{\theta_0}(\cdot \mid x))]其中 ( \theta_0 ) 為凍結的基座模型參數。水印損失根據響應是否為有害內容將激活拉向或拉離密鑰方向[\mathcal{L}{\text{wm}} -\lambda \cdot c_t \cdot \mathbb{1}{\text{harmful}} \lambda \cdot c_t \cdot \mathbb{1}{\text{benign}}]其中 ( c_t \sum{\ell \in L} \frac{\langle h_t^\ell, w_\ell \rangle}{|h_t^\ell|2 |w\ell|_2} ) 為跨層余弦相似度之和。水印損失僅應用于響應中有害內容起始偏移 ( \Delta ) 之后的token并采用線性遞增權重將損失集中作用于后文token——因為有害行為通常在響應過程中變得越來越明確。檢測統計量推理時檢測統計量定義為所有助手token的加權平均余弦相似度[T_k(\pi, x) \frac{1}{\sum_{t \in J’} w_t^{\text{det}}} \sum_{t \in J’} w_t^{\text{det}} c_t]其中 ( J’ ) 為響應中的助手token集合( w_t^{\text{det}} ) 為檢測階段的遞增權重。閾值 ( \tau_k ) 在持有良性數據上預先校準以匹配目標假陽性率。多策略歸因對 ( N ) 個監控策略為每個策略 ( j ) 分配獨立采樣的密鑰方向 ( w^{(j)} )。檢測時計算響應激活與所有 ( N ) 個方向的相似度 ( \bar{c}_j )取 argmax 判定違反的策略。由于高維空間中隨機方向近似正交不同策略的水印信號互不干擾。研究設定基座模型Qwen2.5-7B-Instruct。對比基線LlamaGuard-3-8B文本級護衛模型Qwen3Guard-Gen-8B文本級護衛模型ActProbe基于隱藏狀態的監督探針數據集訓練和驗證BeaverTails有害/良性提示-響應對攻擊構造從XSTest的有害子集出發使用EasyJailbreak生成四種越獄變體攻擊類型模板型Jailbroken、DeepInception、Multilingual優化型AutoDAN基于遺傳搜索的提示優化評估指標規避率ASR在固定假陽性率下有害響應未被檢測到的比例AUROC閾值無關的檢測性能匯總七項標準基準測試評估模型效用保留威脅模型假設攻擊者知曉全部監控算法和密鑰分布擁有無限的API查詢預算和計算資源可模擬任意數量的代理檢測器但不知道部署所用的真實密鑰。這一假設遵循Kerckhoffs原則——安全性應依賴密鑰而非算法的保密。綜合分析為什么AWM有效從信息論角度看AWM的有效性源于密鑰引入的檢測器不確定性。確定性監控器如護衛模型是一個固定函數攻擊者可以在本地精確復制并優化規避策略。而AWM的檢測邊界依賴于一個高維隨機密鑰攻擊者針對一個密鑰優化的攻擊在另一個密鑰下幾乎不轉移——實驗顯示跨密鑰規避率從100%降至24%-59%。從表征學習角度看AWM將水印信號與有害行為的表征糾纏在一起。這意味著攻擊者無法簡單地通過“移除水印”來規避檢測因為移除水印的同時也會改變模型處理有害內容的方式。這種糾纏設計使水印具有了魯棒性——它不能被輕易移除而不損害模型效用。與現有工作的本質差異現有護衛模型LlamaGuard、QwenGuard是在文本表面做分類攻擊者可以通過改寫、編碼、角色扮演等方式改變文本形式而不改變語義。ActProbe雖然也在激活空間工作但其檢測方向是從數據中學習得到的攻擊者可以重新訓練一個代理探針來模擬并規避。AWM的檢測方向則是密鑰派生的攻擊者無法通過數據重訓練來恢復因為嵌入過程已經將水印與有害行為耦合。局限性與未解決的問題經驗性證據論文的魯棒性證據是經驗性的覆蓋了具體的自適應攻擊類型但理論上是否存在針對AWM的更強大攻擊如能夠推斷密鑰或解耦水印與有害行為仍有待探索。效用-安全權衡AWM在數學和編碼任務上造成約1-2個百分點的性能下降。這種代價是否可接受取決于具體部署場景——對于代碼生成類應用可能需要更謹慎的權衡。閾值校準的靜態性閾值在部署前一次性校準并在所有攻擊評估中保持固定。在非平穩環境中攻擊分布的變化可能導致假陽性率漂移。實踐應用適用場景開源模型托管平臺如TogetherAI、OpenRouter等托管開源LLM的服務商基座模型本身公開可獲取無法依賴“模型保密”來防御自適應攻擊。AWM提供的密鑰化檢測是這類場景的理想選擇。企業內部多策略合規企業可以針對不同政策如數據泄露防護、有害內容過濾、知識產權保護等分配獨立的水印方向實現精細化的行為審計。紅隊測試與安全運營在紅隊測試中AWM可以作為一個“檢測器”來評估越獄攻擊的有效性在生產環境中它可以作為護衛模型的補充或替代提供一層密鑰化的縱深防御。部署建議訓練階段在基座模型上執行輕量級微調LoRA或全參數微調均可將水印嵌入到目標層。訓練數據需要包含有害/良性的配對數據如BeaverTails。閾值校準使用部署環境中的真實良性流量數據校準檢測閾值以匹配業務可接受的假陽性率。密鑰管理密鑰的安全管理是AWM有效性的前提。建議采用硬件安全模塊HSM或密鑰管理服務KMS存儲密鑰并定期輪換。多策略配置為每個監控策略分配獨立密鑰方向時可利用高維空間的近似正交性。策略數量增加時需確保維度足夠大以避免方向間串擾。監控與告警AWM的檢測統計量可以直接集成到現有的可觀測性管道中無需額外模型推理推理開銷可忽略。參考資料來源原始論文https://arxiv.org/html/2603.23171