![[論文學(xué)習(xí)]自適應(yīng)大語言模型監(jiān)控:基于激活水印](http://pic.xiahunao.cn/yaotu/[論文學(xué)習(xí)]自適應(yīng)大語言模型監(jiān)控:基于激活水印)
Adaptively Robust LLM Monitoring via Activation Watermarking論文重點(diǎn)本文提出了一種名為激活水印Activation Watermarking, AWM的全新LLM監(jiān)控范式通過在模型內(nèi)部表征中嵌入密鑰相關(guān)的檢測信號使監(jiān)控系統(tǒng)在面對具備完整監(jiān)控方法知識但不知曉密鑰的自適應(yīng)攻擊者時仍能保持較高的檢測魯棒性。實(shí)驗(yàn)表明在1%假陽性率下針對代理優(yōu)化的自適應(yīng)攻擊對現(xiàn)有基線的規(guī)避率高達(dá)79%以上而AWM將規(guī)避率降至37%左右降幅超過一半。核心研究內(nèi)容問題定義LLM服務(wù)提供商需要監(jiān)控部署模型的使用行為以檢測那些無法通過對齊和紅隊(duì)測試預(yù)先防范的濫用行為。然而現(xiàn)有的監(jiān)控機(jī)制如各類護(hù)衛(wèi)模型通常是確定性的且公開可用自適應(yīng)攻擊者可以在本地復(fù)制一份監(jiān)控器離線搜索既能誘發(fā)有害行為又能規(guī)避檢測的提示詞。更棘手的是這種攻擊對提供商而言完全不可見他們無法觀測到濫用行為的發(fā)生也就無法事后修補(bǔ)防御。其核心挑戰(zhàn)在于如何在保持對非自適應(yīng)攻擊檢測率的同時抵抗自適應(yīng)攻擊者。創(chuàng)新方法AWM的核心思想是將監(jiān)控信號從文本層面下沉到模型內(nèi)部激活空間并通過密鑰引入隨機(jī)化密鑰生成為每個目標(biāo)層使用密鑰采樣一個高斯方向向量 ( w_\ell )作為秘密檢測方向。水印嵌入對基座模型進(jìn)行微調(diào)在有害響應(yīng)時將激活向量拉向密鑰方向 ( w_\ell )在良性響應(yīng)時拉向反方向 ( -w_\ell )。微調(diào)同時通過KL散度約束保留基座模型的行為。檢測方向與有害行為的表征被糾纏在一起使得攻擊者難以在不損害模型效用或改變行為的情況下移除水印。檢測階段推理時提供商記錄目標(biāo)層的隱藏狀態(tài)計算與密鑰方向的余弦相似度并聚合為標(biāo)量統(tǒng)計量超過預(yù)設(shè)閾值即觸發(fā)告警。策略歸因由于高維空間中隨機(jī)采樣的方向近似正交可以為每個監(jiān)控策略分配獨(dú)立的水印方向從而實(shí)現(xiàn)“哪個策略被違反”的歸因。在20個策略的場景下AWM以80%的準(zhǔn)確率識別被違反的策略而隨機(jī)基線僅為5%。研究成果非自適應(yīng)攻擊在Jailbroken、DeepInception、Multilingual和AutoDAN四種越獄攻擊下AWM在四種攻擊中的三種上取得最低規(guī)避率AUROC達(dá)到0.92-0.96。激活空間的監(jiān)控器AWM和ActProbe在所有攻擊上均匹配或超越文本級護(hù)衛(wèi)模型。自適應(yīng)攻擊在代理優(yōu)化的自適應(yīng)AutoDAN攻擊下LlamaGuard的規(guī)避率達(dá)85%QwenGuard為79%ActProbe高達(dá)93%而AWM僅為37%±11%??缑荑€遷移實(shí)驗(yàn)中針對一個密鑰優(yōu)化的攻擊遷移到其他密鑰時規(guī)避率從100%降至24%-59%均值37%。集成多密鑰的優(yōu)化攻擊也未能顯著提升對未見過密鑰的遷移效果。模型效用在BBH、IFEval、MMLU-PRO、TruthfulQA、GSM8K、MATH-Hard和HumanEval七個基準(zhǔn)上AWM帶來的效用損失極小BBH和MMLU-PRO幾乎不變其他任務(wù)下降0.6-2.2個百分點(diǎn)。效率AWM在推理時無需額外的前向傳播直接復(fù)用提供商已有的激活值計算余弦相似度幾乎為零的推理開銷。實(shí)際落地應(yīng)用的可能性AWM的實(shí)用價值體現(xiàn)在三個層面輕量級部署無需額外的護(hù)衛(wèi)模型復(fù)用LLM推理過程中已計算的激活值即可完成檢測推理開銷可忽略。策略歸因能力提供商可以為不同政策如禁止生成惡意代碼、禁止泄露隱私信息等分配獨(dú)立的水印方向當(dāng)違規(guī)發(fā)生時不僅知道“發(fā)生了違規(guī)”還能知道“違反了哪條政策”。這對于企業(yè)內(nèi)部合規(guī)審計和多租戶場景下的責(zé)任追溯具有直接價值。自適應(yīng)攻擊防御在基座模型公開可獲取的場景下如Qwen、Llama等開源模型AWM提供了一種不依賴“保密”的密鑰化防御機(jī)制。即使攻擊者完全了解監(jiān)控算法只要不知道密鑰就無法可靠地構(gòu)造規(guī)避攻擊。技術(shù)細(xì)節(jié)水印嵌入損失函數(shù)AWM的微調(diào)過程包含兩個損失項(xiàng)KL散度約束保持基座模型 ( M ) 的行為不變[\mathcal{L}{\text{KL}} D{\text{KL}}(p_{\theta}(\cdot \mid x) \parallel p_{\theta_0}(\cdot \mid x))]其中 ( \theta_0 ) 為凍結(jié)的基座模型參數(shù)。水印損失根據(jù)響應(yīng)是否為有害內(nèi)容將激活拉向或拉離密鑰方向[\mathcal{L}{\text{wm}} -\lambda \cdot c_t \cdot \mathbb{1}{\text{harmful}} \lambda \cdot c_t \cdot \mathbb{1}{\text{benign}}]其中 ( c_t \sum{\ell \in L} \frac{\langle h_t^\ell, w_\ell \rangle}{|h_t^\ell|2 |w\ell|_2} ) 為跨層余弦相似度之和。水印損失僅應(yīng)用于響應(yīng)中有害內(nèi)容起始偏移 ( \Delta ) 之后的token并采用線性遞增權(quán)重將損失集中作用于后文token——因?yàn)橛泻π袨橥ǔT陧憫?yīng)過程中變得越來越明確。檢測統(tǒng)計量推理時檢測統(tǒng)計量定義為所有助手token的加權(quán)平均余弦相似度[T_k(\pi, x) \frac{1}{\sum_{t \in J’} w_t^{\text{det}}} \sum_{t \in J’} w_t^{\text{det}} c_t]其中 ( J’ ) 為響應(yīng)中的助手token集合( w_t^{\text{det}} ) 為檢測階段的遞增權(quán)重。閾值 ( \tau_k ) 在持有良性數(shù)據(jù)上預(yù)先校準(zhǔn)以匹配目標(biāo)假陽性率。多策略歸因?qū)?( N ) 個監(jiān)控策略為每個策略 ( j ) 分配獨(dú)立采樣的密鑰方向 ( w^{(j)} )。檢測時計算響應(yīng)激活與所有 ( N ) 個方向的相似度 ( \bar{c}_j )取 argmax 判定違反的策略。由于高維空間中隨機(jī)方向近似正交不同策略的水印信號互不干擾。研究設(shè)定基座模型Qwen2.5-7B-Instruct。對比基線LlamaGuard-3-8B文本級護(hù)衛(wèi)模型Qwen3Guard-Gen-8B文本級護(hù)衛(wèi)模型ActProbe基于隱藏狀態(tài)的監(jiān)督探針數(shù)據(jù)集訓(xùn)練和驗(yàn)證BeaverTails有害/良性提示-響應(yīng)對攻擊構(gòu)造從XSTest的有害子集出發(fā)使用EasyJailbreak生成四種越獄變體攻擊類型模板型Jailbroken、DeepInception、Multilingual優(yōu)化型AutoDAN基于遺傳搜索的提示優(yōu)化評估指標(biāo)規(guī)避率ASR在固定假陽性率下有害響應(yīng)未被檢測到的比例AUROC閾值無關(guān)的檢測性能匯總七項(xiàng)標(biāo)準(zhǔn)基準(zhǔn)測試評估模型效用保留威脅模型假設(shè)攻擊者知曉全部監(jiān)控算法和密鑰分布擁有無限的API查詢預(yù)算和計算資源可模擬任意數(shù)量的代理檢測器但不知道部署所用的真實(shí)密鑰。這一假設(shè)遵循Kerckhoffs原則——安全性應(yīng)依賴密鑰而非算法的保密。綜合分析為什么AWM有效從信息論角度看AWM的有效性源于密鑰引入的檢測器不確定性。確定性監(jiān)控器如護(hù)衛(wèi)模型是一個固定函數(shù)攻擊者可以在本地精確復(fù)制并優(yōu)化規(guī)避策略。而AWM的檢測邊界依賴于一個高維隨機(jī)密鑰攻擊者針對一個密鑰優(yōu)化的攻擊在另一個密鑰下幾乎不轉(zhuǎn)移——實(shí)驗(yàn)顯示跨密鑰規(guī)避率從100%降至24%-59%。從表征學(xué)習(xí)角度看AWM將水印信號與有害行為的表征糾纏在一起。這意味著攻擊者無法簡單地通過“移除水印”來規(guī)避檢測因?yàn)橐瞥〉耐瑫r也會改變模型處理有害內(nèi)容的方式。這種糾纏設(shè)計使水印具有了魯棒性——它不能被輕易移除而不損害模型效用。與現(xiàn)有工作的本質(zhì)差異現(xiàn)有護(hù)衛(wèi)模型LlamaGuard、QwenGuard是在文本表面做分類攻擊者可以通過改寫、編碼、角色扮演等方式改變文本形式而不改變語義。ActProbe雖然也在激活空間工作但其檢測方向是從數(shù)據(jù)中學(xué)習(xí)得到的攻擊者可以重新訓(xùn)練一個代理探針來模擬并規(guī)避。AWM的檢測方向則是密鑰派生的攻擊者無法通過數(shù)據(jù)重訓(xùn)練來恢復(fù)因?yàn)榍度脒^程已經(jīng)將水印與有害行為耦合。局限性與未解決的問題經(jīng)驗(yàn)性證據(jù)論文的魯棒性證據(jù)是經(jīng)驗(yàn)性的覆蓋了具體的自適應(yīng)攻擊類型但理論上是否存在針對AWM的更強(qiáng)大攻擊如能夠推斷密鑰或解耦水印與有害行為仍有待探索。效用-安全權(quán)衡AWM在數(shù)學(xué)和編碼任務(wù)上造成約1-2個百分點(diǎn)的性能下降。這種代價是否可接受取決于具體部署場景——對于代碼生成類應(yīng)用可能需要更謹(jǐn)慎的權(quán)衡。閾值校準(zhǔn)的靜態(tài)性閾值在部署前一次性校準(zhǔn)并在所有攻擊評估中保持固定。在非平穩(wěn)環(huán)境中攻擊分布的變化可能導(dǎo)致假陽性率漂移。實(shí)踐應(yīng)用適用場景開源模型托管平臺如TogetherAI、OpenRouter等托管開源LLM的服務(wù)商基座模型本身公開可獲取無法依賴“模型保密”來防御自適應(yīng)攻擊。AWM提供的密鑰化檢測是這類場景的理想選擇。企業(yè)內(nèi)部多策略合規(guī)企業(yè)可以針對不同政策如數(shù)據(jù)泄露防護(hù)、有害內(nèi)容過濾、知識產(chǎn)權(quán)保護(hù)等分配獨(dú)立的水印方向?qū)崿F(xiàn)精細(xì)化的行為審計。紅隊(duì)測試與安全運(yùn)營在紅隊(duì)測試中AWM可以作為一個“檢測器”來評估越獄攻擊的有效性在生產(chǎn)環(huán)境中它可以作為護(hù)衛(wèi)模型的補(bǔ)充或替代提供一層密鑰化的縱深防御。部署建議訓(xùn)練階段在基座模型上執(zhí)行輕量級微調(diào)LoRA或全參數(shù)微調(diào)均可將水印嵌入到目標(biāo)層。訓(xùn)練數(shù)據(jù)需要包含有害/良性的配對數(shù)據(jù)如BeaverTails。閾值校準(zhǔn)使用部署環(huán)境中的真實(shí)良性流量數(shù)據(jù)校準(zhǔn)檢測閾值以匹配業(yè)務(wù)可接受的假陽性率。密鑰管理密鑰的安全管理是AWM有效性的前提。建議采用硬件安全模塊HSM或密鑰管理服務(wù)KMS存儲密鑰并定期輪換。多策略配置為每個監(jiān)控策略分配獨(dú)立密鑰方向時可利用高維空間的近似正交性。策略數(shù)量增加時需確保維度足夠大以避免方向間串?dāng)_。監(jiān)控與告警AWM的檢測統(tǒng)計量可以直接集成到現(xiàn)有的可觀測性管道中無需額外模型推理推理開銷可忽略。參考資料來源原始論文https://arxiv.org/html/2603.23171