![[論文筆記] mixSGA HMoE BrownoutMoE](http://pic.xiahunao.cn/yaotu/[論文筆記] mixSGA HMoE BrownoutMoE)
三篇 MoE 相關(guān)論文對(duì)比梳理三篇論文分別從注意力層 KV 緩存優(yōu)化、異構(gòu)專家架構(gòu)設(shè)計(jì)、MoE 線上推理服務(wù)部署優(yōu)化三個(gè)不同維度對(duì)混合專家模型做創(chuàng)新下面分別解析核心思想、創(chuàng)新點(diǎn)、差異對(duì)比。1. Mixture of Weight?shared Heterogeneous Group Attention Experts for Dynamic Token?wise KV OptimizationEMNLP 2025mixSGA基于共享權(quán)重的異構(gòu)組注意力專家混合模型用于動(dòng)態(tài)逐令牌鍵值優(yōu)化問題背景大模型推理 KV 緩存占用內(nèi)存巨大GQA 等靜態(tài)分組 KV 方案采用固定分組粒度無法適配不同 token 的重要程度要么丟棄低優(yōu)先級(jí) token要么統(tǒng)一粗粒度分組造成性能損失。核心方案 mixSGA把 MoE 思想應(yīng)用到注意力模塊不是 FFN 專家構(gòu)建一組異構(gòu)分組注意力專家各個(gè)專家擁有不同 KV 分組大小。逐 token 專家選擇路由依據(jù)學(xué)習(xí)得到 token 重要性分?jǐn)?shù)把不同 token 路由到不同 KV 粒度的注意力專家保留全部 token不做丟棄重要 token 分配細(xì)粒度 KV普通 token 分配粗粒度 KV。專家之間權(quán)重共享注意力投影層權(quán)重共享控制參數(shù)量開銷。輔助損失函數(shù)約束路由接近 one?hot保證訓(xùn)練、推理行為一致。實(shí)驗(yàn)效果在相同 KV 緩存預(yù)算下Llama3、OPT、Gemma2 等模型上指令微調(diào)、繼續(xù)預(yù)訓(xùn)練任務(wù)獲得更低困惑度、更高 ROUGE?L降低 KV 內(nèi)存占用優(yōu)化注意力計(jì)算開銷。定位注意力層架構(gòu)創(chuàng)新解決 KV Cache 內(nèi)存瓶頸。2. HMoE: Heterogeneous Mixture of Experts for Language Modeling用于語言建模的異構(gòu)專家混合模型問題背景傳統(tǒng) MoE 全部使用同尺寸專家但輸入 token 語義復(fù)雜度差異巨大簡(jiǎn)單 token 和復(fù)雜 token 需要的模型容量不一樣同構(gòu)專家很難適配不同難度樣本參數(shù)利用效率低。核心方案 HMoEFFN 專家采用異構(gòu)尺寸專家網(wǎng)絡(luò)大小各不相同具備不同模型容量。支持 Top?K固定激活專家數(shù)量、Top?P動(dòng)態(tài)自適應(yīng)激活專家數(shù)量?jī)煞N路由復(fù)雜 token 分配到大容量專家簡(jiǎn)單 token 分配小容量專家。專門設(shè)計(jì)訓(xùn)練損失提升小專家被激活概率緩解異構(gòu)專家?guī)淼募せ钬?fù)載不均衡。實(shí)驗(yàn)效果同等激活參數(shù)量下相比傳統(tǒng)同構(gòu) MoE 獲得更好語言建模性能同等性能下降低計(jì)算 FLOPs。定位Transformer FFN 層架構(gòu)創(chuàng)新改變專家本身網(wǎng)絡(luò)大小異構(gòu)專家原生模型架構(gòu)。3. BrownoutMoE: Structure?Aware Expert Grouping for Efficient and Accurate LLM Web?based ServicesarXiv:2607.04164面向結(jié)構(gòu)感知的專家分組實(shí)現(xiàn)高效且準(zhǔn)確的基于 Web 的 LLM 服務(wù)arXiv問題背景MoE 在線 Web 服務(wù)存在專家訪問嚴(yán)重傾斜少量熱專家處理絕大多數(shù) token大量冷專家極少被調(diào)用GPU 利用率低。之前 BrownoutServe 采用按索引順序簡(jiǎn)單合并專家為聯(lián)合專家 (united expert)會(huì)把行為差異大專家合并蒸餾后精度損失大。核心方案 BrownoutMoE面向線上推理服務(wù)系統(tǒng)優(yōu)化離線對(duì)原始專家做分組合并蒸餾在線做 SLO 感知?jiǎng)討B(tài)降載brownout 降壓保供范式。將分層專家分組建模為離散策略優(yōu)化問題使用GRPO 強(qiáng)化學(xué)習(xí)搜索最優(yōu)分組初始化依靠專家輸出相似度層次聚類優(yōu)先把行為相似專家劃分同一組。兩階段流水線GRPO 搜索分組策略 → 分組一致知識(shí)蒸餾得到可部署聯(lián)合專家模型。控制平面 SLO 感知延遲控制器線上根據(jù) P90 延遲動(dòng)態(tài)調(diào)整閾值冷專家 token 可路由到蒸餾后的聯(lián)合專家犧牲少量精度保障響應(yīng)時(shí)延 SLO。實(shí)驗(yàn)效果對(duì)比順序分組基線精度退化最高減少 71.4%吞吐最高提升 2.24×基于 Qwen1.5?MoE?A2.7B 驗(yàn)證。定位MoE 推理服務(wù)系統(tǒng)優(yōu)化不修改原生 MoE 網(wǎng)絡(luò)結(jié)構(gòu)后處理方式對(duì)已有訓(xùn)練完成 MoE 模型做專家合并蒸餾面向 Web 線上部署。三篇論文關(guān)鍵差異總表表格論文優(yōu)化對(duì)象創(chuàng)新層面是否修改原生模型架構(gòu)核心技術(shù)目標(biāo)收益mixSGAAttention 注意力層 KV 緩存模型架構(gòu)?修改注意力模塊異構(gòu)分組注意力專家、token?wise 路由、權(quán)重共享降低 KV Cache 內(nèi)存開銷HMoEFFN 專家網(wǎng)絡(luò)模型架構(gòu)?修改 FFN 專家尺寸大小異構(gòu) FFN 專家、異構(gòu)路由損失提升參數(shù)利用率、降低 FLOPsBrownoutMoEMoE 推理部署服務(wù)系統(tǒng) 后訓(xùn)練蒸餾?不改動(dòng)原生模型離線做專家合并蒸餾GRPO 專家分組搜索、聯(lián)合專家蒸餾、SLO?aware brownout 控制提升線上推理吞吐保障服務(wù)時(shí)延 SLO控制精度損失補(bǔ)充區(qū)分要點(diǎn)mixSGA 把 MoE 思想遷移到注意力HMoE、BrownoutMoE 聚焦傳統(tǒng) FFN MoEHMoE 是訓(xùn)練階段原生異構(gòu)專家架構(gòu)BrownoutMoE 是對(duì)已經(jīng)訓(xùn)練好的 MoE 做后處理屬于服務(wù)側(cè)優(yōu)化BrownoutMoE 繼承 BrownoutServe 的聯(lián)合專家與 brownout 降載思想解決它順序分組帶來精度損失的短板。