環(huán)境「套個(gè)殼」就 +9 分:Google 讓 Agent 訓(xùn)練場(chǎng)自己會(huì)進(jìn)化)
EnvHarness 把靜態(tài)環(huán)境「套個(gè)殼」就 9 分Google 讓 Agent 訓(xùn)練場(chǎng)自己會(huì)進(jìn)化Hugging Face 每日論文2026-08-21 精選AI 智能體在游戲與網(wǎng)頁(yè)里點(diǎn)來(lái)點(diǎn)去看似熱鬧背后其實(shí)一直被一個(gè)老問(wèn)題卡住——訓(xùn)練用的那些環(huán)境是「一次寫(xiě)死、永遠(yuǎn)不動(dòng)」的做完一道題就再也教不會(huì)新東西了。Google Research 聯(lián)合圣路易斯華盛頓大學(xué)、北卡羅來(lái)納大學(xué)教堂山分校的團(tuán)隊(duì) 8 月 21 日公開(kāi)的 EnvHarness論文 arXiv:2608.19880做了一件反直覺(jué)的事不動(dòng)環(huán)境內(nèi)核、只在外層「套一個(gè)可編程殼」就把 Agent 在五個(gè) benchmark 上的成績(jī)往上推了一截。同一天這篇論文登上了 Hugging Face 每日論文榜首社區(qū) 246 次點(diǎn)贊比排名第二的論文高一截。靜態(tài)環(huán)境的痛點(diǎn)一個(gè)只能交一份作業(yè)的練習(xí)冊(cè)LLM Agent 是靠「和環(huán)境反復(fù)交互」學(xué)會(huì)做事的環(huán)境對(duì)它的意義等同于練習(xí)冊(cè)。可是傳統(tǒng)的訓(xùn)練環(huán)境——不管是 ALFWorld 里的家庭機(jī)器人任務(wù)、WebArena 里的網(wǎng)頁(yè)操作、還是 SWE-bench Verified 里的真實(shí) GitHub Issue——一旦發(fā)布就再也不會(huì)變。研究團(tuán)隊(duì)在論文里點(diǎn)出了一個(gè)很多人忽略的事實(shí)環(huán)境是「看不見(jiàn) Agent 弱點(diǎn)的」而且 Agent 一旦把題做完環(huán)境就再也不能提供新的訓(xùn)練信號(hào)了。過(guò)去的補(bǔ)救辦法是「環(huán)境生成」讓另一個(gè) LLM 重新寫(xiě)一整套新環(huán)境。但這條路要么依賴只能用在某一類(lèi)任務(wù)的流水線要么需要昂貴又不可靠的驗(yàn)證器而且生成出來(lái)的環(huán)境往往是「另一個(gè)靜態(tài)環(huán)境」等于又寫(xiě)了一份新練習(xí)冊(cè)。EnvHarness 的作者們決定換一種問(wèn)法既然環(huán)境本身沒(méi)法改能不能在外層把它「包」起來(lái)設(shè)計(jì)哲學(xué)把「重塑環(huán)境」變成「組合外殼」EnvHarness 的核心思路是把 Agent harnessAnthropic、OpenAI 都在用的概念的邏輯搬到環(huán)境那一側(cè)。所謂 Agent harness就是給 LLM 套上外部記憶、工具、技能這些插件而不用動(dòng)它的權(quán)重EnvHarness 同樣給環(huán)境套一個(gè)殼、卻不動(dòng)環(huán)境的代碼。所有改動(dòng)都通過(guò)標(biāo)準(zhǔn)的 reset / step 接口生效作者把這叫「wrapping, not authoring」。這個(gè)殼由三種可組合的組件構(gòu)成每一種都對(duì)應(yīng)一種常見(jiàn)訓(xùn)練難題。組件名作用解決的具體訓(xùn)練難題Setup改寫(xiě)環(huán)境的初始狀態(tài)讓 Agent 在不同起點(diǎn)訓(xùn)練避免只會(huì)做某一種開(kāi)局Rule改寫(xiě) Agent 能做的動(dòng)作、能看到的觀察把動(dòng)作空間收窄到 Agent 當(dāng)前掌握不好的那一片Link把另一個(gè)環(huán)境的任務(wù)嵌入進(jìn)來(lái)跨任務(wù)組合延長(zhǎng)訓(xùn)練 horizon因?yàn)橹辉?reset / step 接口上動(dòng)手原環(huán)境那份「人來(lái)寫(xiě)、人來(lái)評(píng)」的驗(yàn)證器被原樣保留——成績(jī)的可信度沒(méi)有讓步。這就是為什么論文敢同時(shí)跨五個(gè)完全不同的 benchmark 用同一套代碼。EnvRigger讓一個(gè) Agent 來(lái)給另一個(gè) Agent 寫(xiě)練習(xí)冊(cè)把殼搭好是一回事知道「該往哪一層套、套什么」是另一回事。EnvHarness 團(tuán)隊(duì)又做了一個(gè)配套組件 EnvRigger它把目標(biāo)策略當(dāng)作一個(gè)黑盒從三個(gè)維度自動(dòng)判斷「該往哪加殼」。第一步觀察策略在原環(huán)境里跑出來(lái)的成功軌跡和失敗軌跡定位 Agent 卡在什么類(lèi)型的問(wèn)題上。第二步根據(jù)診斷結(jié)論生成候選的 EnvHarness 組件寫(xiě)的是真實(shí) Python 代碼不是從模板菜單里挑。第三步用更新后的環(huán)境跑一輪新的 rollout看看 Agent 真的能學(xué)會(huì)嗎只有當(dāng) Agent 在新環(huán)境里既能學(xué)到新東西、又還能解得開(kāi)時(shí)新環(huán)境才被采用否則就回到第二步再改一輪。反復(fù)執(zhí)行這個(gè)診斷—合成—驗(yàn)證的循環(huán)就形成了論文里強(qiáng)調(diào)的「policy 與 environment 共同進(jìn)化co-evolution」Agent 進(jìn)步一點(diǎn)EnvRigger 就把殼再調(diào)一點(diǎn)讓訓(xùn)練場(chǎng)一直能出新的有信息量的信號(hào)。實(shí)驗(yàn)數(shù)據(jù)5 個(gè) benchmark 4 個(gè)領(lǐng)域跨任務(wù)都好使論文評(píng)測(cè)覆蓋 5 個(gè) benchmark、4 個(gè)領(lǐng)域把訓(xùn)練模式拆成技能學(xué)習(xí)skill-based learning, SL和強(qiáng)化學(xué)習(xí)reinforcement learning, RL兩條線分別跑。底子用的是 GPT-4.1、Claude Sonnet 4-6、o4-mini 這一檔主力模型。Benchmark領(lǐng)域EnvHarness 在 SL 設(shè)置上的提升在 RL 設(shè)置上的提升步數(shù)變化ALFWorld家庭具身任務(wù)最高 9.0 分held-out最高 6.5 分減少 9.8%WebArena網(wǎng)頁(yè)瀏覽一致提升一致提升減少 9.8%SWE-bench Verified軟件工程一致提升一致提升減少 9.8%OfficeQA辦公問(wèn)答一致提升一致提升減少 9.8%SpreadsheetBench電子表格操作一致提升一致提升減少 9.8%值得拆開(kāi)來(lái)看的幾個(gè)關(guān)鍵數(shù)字。held-out 實(shí)例上最高 9.0 分這是對(duì)照基線跑同款 benchmark 訓(xùn)練后、到?jīng)]見(jiàn)過(guò)的題目上去測(cè)的絕對(duì)分差意思是學(xué)到的能力真的遷移了不是過(guò)擬合。9.8% 的步數(shù)減少也很反直覺(jué)——明明環(huán)境變難了怎么 Agent 反而步數(shù)變少了論文給出的解釋是EnvRigger 把殼調(diào)成了「剛好讓 Agent 卡在它薄弱環(huán)節(jié)」的難度所以每一步都有信息量不再有「在原地打轉(zhuǎn)」的無(wú)效步。RL 設(shè)置下最高 6.5 分的提升同樣重要。它說(shuō)明 EnvHarness 給出的訓(xùn)練信號(hào)更穩(wěn)定更適合策略-環(huán)境共同進(jìn)化的循環(huán)——RL 訓(xùn)練最怕 reward signal 噪聲大EnvRigger 的診斷-合成循環(huán)正好把噪聲壓在最低。為什么這套思路比「換更大模型」更值得做很多團(tuán)隊(duì)遇到 Agent 訓(xùn)練效果不好的第一反應(yīng)是「再訓(xùn)一個(gè)更大的底?!沟?EnvHarness 的結(jié)果說(shuō)明環(huán)境側(cè)的改造也能拿到穩(wěn)定提升而且不依賴新模型。把殼放在外層還有三個(gè)隱性收益。第一復(fù)用已有 benchmark 不再是負(fù)擔(dān)。每個(gè) benchmark 自帶的人類(lèi)專家驗(yàn)證器都被原樣保留研究團(tuán)隊(duì)不需要為 EnvHarness 重寫(xiě)一套評(píng)估——這就是為啥同一套代碼能在 5 個(gè)完全不同的領(lǐng)域同時(shí)跑。第二調(diào)試和審計(jì)更容易。當(dāng)殼是獨(dú)立的一層 Python 代碼時(shí)調(diào)試時(shí)只要把殼打開(kāi)看 Agent 在原環(huán)境里到底發(fā)生了什么。第三共同進(jìn)化讓「數(shù)據(jù)不夠」不再卡脖子。在 ALFWorld 這種環(huán)境里原題做完就沒(méi)了EnvRigger 會(huì)自動(dòng)出「和原題同分布、但能針對(duì) Agent 弱點(diǎn)」的新題等于把一個(gè)固定練習(xí)冊(cè)變成了自適應(yīng)教輔。局限與待驗(yàn)證殼能不能穩(wěn)、好不好抄論文自己也承認(rèn)了幾條邊界。第一EnvHarness 的具體配置必須針對(duì)目標(biāo)策略和任務(wù)裁剪雖然 EnvRigger 把這件事自動(dòng)化了但「自動(dòng)化到什么程度、需不需要人審」取決于環(huán)境本身的復(fù)雜程度——對(duì) OfficeQA 這類(lèi)扁平文本任務(wù)一鍵就能跑通對(duì) ALFWorld 這類(lèi)具身任務(wù)還是要寫(xiě)點(diǎn)領(lǐng)域先驗(yàn)。第二獨(dú)立復(fù)現(xiàn)還很早期。論文結(jié)論目前主要來(lái)自團(tuán)隊(duì)自己在 Google Cloud AI Research 上的實(shí)驗(yàn)其他實(shí)驗(yàn)室和工業(yè)團(tuán)隊(duì)的端到端復(fù)現(xiàn)報(bào)告還不充分。要把 EnvHarness 真正落地到自家 Agent 流水線里仍然需要先做一次小規(guī)模對(duì)照。第三「共同進(jìn)化」這條曲線目前看到的是「重復(fù)循環(huán)越多、增益越大」但何時(shí)收斂、是否會(huì)出現(xiàn)殼越來(lái)越復(fù)雜但 Agent 不再進(jìn)步的情況論文里還沒(méi)有給出系統(tǒng)性的消融。這跟 RL 訓(xùn)練里 reward hacking 的老問(wèn)題是一類(lèi)的下一步工作大概率會(huì)沿著這條線展開(kāi)。為什么這篇值得讀者現(xiàn)在就去看從研究角度看EnvHarness 給「環(huán)境端改造」這條路線補(bǔ)了一塊關(guān)鍵拼圖——過(guò)去要么花重金重建環(huán)境、要么訓(xùn)練 LLM 寫(xiě)環(huán)境前者貴、后者不穩(wěn)。EnvHarness 證明了「不動(dòng)環(huán)境、用可編程殼層」是第三條可行路徑而且同一天登上 Hugging Face 每日論文榜首說(shuō)明社區(qū)也認(rèn)可這個(gè)方向。從工程角度看代碼已經(jīng)在 GitHub 上開(kāi)源google-research/envharness網(wǎng)頁(yè) envharness.com 同步上線。如果你的團(tuán)隊(duì)正在訓(xùn)練 web Agent、辦公 Agent 或具身 Agent這一套接口標(biāo)準(zhǔn)化的殼層可能比再訓(xùn)一遍底模更劃算。讀完論文最值得記住的一點(diǎn)是決定 Agent 訓(xùn)練效率的往往不是模型大小或訓(xùn)練步數(shù)而是「環(huán)境能不能持續(xù)提供新信號(hào)」。EnvHarness 把這個(gè)被忽視的因素?cái)[到了臺(tái)面上并用一種相對(duì)輕量的方式給出了解法。對(duì)于想入門(mén) Agent 訓(xùn)練的讀者這篇論文是 2026 年 8 月必讀的那一份。