超越人類的 GUI 智能體:Agent-S3 的完整部署與調(diào)優(yōu)路徑)
跑通一個(gè)超越人類的 GUI 智能體Agent-S3 的完整部署與調(diào)優(yōu)路徑【免費(fèi)下載鏈接】Agent-SAgent S: an open agentic framework that uses computers like a human項(xiàng)目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S你大概也被問過這事為什么不讓程序自己干比如把散落在收件箱里的三百個(gè)附件按項(xiàng)目歸檔或者把 Word 里所有表格統(tǒng)一改成公司模板樣式。手動做費(fèi)時(shí)專門寫腳本更煩——因?yàn)楹芏嗖僮鞯娜肟谥皇瞧聊簧夏莻€(gè)窗口而不是 API。這就是 GUI 智能體框架 Agent-S3 要解決的問題讓模型像人一樣看屏幕、點(diǎn)鼠標(biāo)、敲鍵盤把復(fù)雜任務(wù)一步步做完。它在 OSWorld 基準(zhǔn)上的最新成績是 72.6%剛好越過人類參考線約 72%。GUI 智能體能接住什么樣的任務(wù)先用兩個(gè)具體場景說清楚它和什么有關(guān)。場景一表格類辦公任務(wù)。打開 sales_data.xlsx算出各產(chǎn)品線的季度環(huán)比增長再畫一張趨勢圖。在 Agent-S3 的內(nèi)部規(guī)則里電子表格的計(jì)算走代碼 agent直接寫 Python 執(zhí)行畫圖走 GUI點(diǎn)菜單、選圖表類型。這個(gè)分工不是你去配置的而是內(nèi)置在框架的程序性記憶里你讀一眼 程序性記憶源碼 就能看到它是怎么寫進(jìn)提示詞的。場景二跨應(yīng)用流程。把這周的會議記錄從日歷里導(dǎo)出整理成一份 Markdown 存到共享盤。這類任務(wù)沒有現(xiàn)成 API 可調(diào)最穩(wěn)的自動化路線就是操作 GUI——人怎么點(diǎn)它怎么點(diǎn)。Agent-S3 支持 Linux、macOS、Windows單顯示器如果打開本地代碼執(zhí)行環(huán)境它還能直接在你機(jī)器上跑 Python/Bash把一部分GUI 活變成程序活這是它區(qū)別于純多模態(tài)智能體方案的關(guān)鍵點(diǎn)。內(nèi)部怎么運(yùn)轉(zhuǎn)從一張截圖到一次點(diǎn)擊 用餐廳后廚的分工來理解最直觀Worker 是頭灶它拿到指令和最新截圖輸出一條描述性動作比如點(diǎn)擊右上角的保存按鈕。它只說點(diǎn)什么不管點(diǎn)在哪。Grounding 是傳菜員兼刀工把點(diǎn)保存按鈕翻譯成可執(zhí)行的 Python 代碼——先由 Grounding 模型如 UI-TARS在截圖上定位按鈕的像素坐標(biāo)再由 pyautogui 真正執(zhí)行點(diǎn)擊。執(zhí)行完截一張新圖送回給頭灶循環(huán)往復(fù)直到任務(wù)完成。在這個(gè)閉環(huán)外面還有兩樣?xùn)|西。記憶是灶臺筆記每次任務(wù)結(jié)束都會沉淀經(jīng)驗(yàn)——哪類任務(wù)該走代碼 agent、哪類必須走 GUI、完成后怎么驗(yàn)證這些會作為程序性記憶注入下一輪。Reflection 是試味員默認(rèn)開啟在 Worker 跑偏時(shí)拉一把。值得一提的是 S3 相對 S2 最大的變化砍掉了上層 Manager 分層Worker 一個(gè)環(huán)節(jié)直接完成規(guī)劃 執(zhí)行推理步驟更少、對環(huán)境變化反應(yīng)更快。翻 AgentS3 核心源碼類注釋就一句話——no hierarchy for less inference time。圖中展示了 GUI 智能體一次任務(wù)執(zhí)行的完整閉環(huán)計(jì)劃流向 Worker描述性動作經(jīng) Grounding 變成代碼執(zhí)行經(jīng)驗(yàn)寫回 Memory十分鐘跑起來三個(gè)前置條件一臺單屏機(jī)器、主模型的 API Key、一個(gè)能部署 Grounding 模型的推理端點(diǎn)官方推薦把 UI-TARS-1.5-7B 掛在 Hugging Face Inference Endpoints 上自己用 vLLM 起也完全可以。安裝部分只有三行pip install gui-agents brew install tesseract # OCR 依賴必須裝 export OPENAI_API_KEY你的key # 用其他廠商則換對應(yīng) key裝好后用自帶 CLI 直接跑這就是最常見的 Agent-S3 部署姿勢agent_s \ --provider openai \ --model gpt-5-2025-08-07 \ --ground_provider huggingface \ --ground_url http://localhost:8080 \ --ground_model ui-tars-1.5-7b \ --grounding_width 1920 \ --grounding_height 1080想改源碼的話clone 倉庫https://gitcode.com/GitHub_Trending/ag/Agent-S后pip install -e .進(jìn)入開發(fā)模式即可。不用 CLI 時(shí)SDK 的用法是實(shí)例化AgentS3OSWorldACI然后在循環(huán)里調(diào)agent.predict(instruction, obs)、執(zhí)行返回的 action 代碼官方 CLI 源碼里就有完整的推理循環(huán)可以參考。主模型與 Grounding 模型怎么配GUI 智能體的配置其實(shí)只圍繞兩個(gè)大腦展開配置項(xiàng)推薦值說明主模型gpt-5-2025-08-07負(fù)責(zé)規(guī)劃與決策OpenAI、Anthropic、Gemini、Azure、Open Router、本地 vLLM 都支持Grounding 模型UI-TARS-1.5-7B自己部署在推理端點(diǎn)上負(fù)責(zé)在截圖中定位 UI 元素Grounding 分辨率1920×1080必須與模型輸出坐標(biāo)系一致?lián)Q UI-TARS-72B 則用 1000×1000物理屏幕單屏1920×1080不支持多屏本地代碼執(zhí)行默認(rèn)關(guān)--enable_local_env開啟后以你的用戶權(quán)限跑任意代碼僅可信環(huán)境使用軌跡長度8--max_trajectory_length歷史保留的截圖輪數(shù)越大上下文越長踩過的坑提前說grounding_width/grounding_height如果和 Grounding 模型的輸出坐標(biāo)系對不上點(diǎn)擊坐標(biāo)會整體錯(cuò)位表現(xiàn)就是智能體到處亂點(diǎn)。這是部署階段排障的第一嫌疑官方文檔里對兩種 UI-TARS 模型都有明確的坐標(biāo)對照。GUI 智能體的強(qiáng)項(xiàng)與短板看數(shù)據(jù)先說強(qiáng)的。OSWorld 基準(zhǔn)100 步設(shè)置上Agent-S3 單次運(yùn)行 66.0%已經(jīng)比前 SOTAGTA1 w/ GPT-563.4%高 2.6 個(gè)百分點(diǎn)再疊加 Behavior Best-of-N跑三次、用裁判挑最優(yōu)軌跡到 72.6%越過 OSWorld 人類參考線約 72%。方法OSWorld 成功率提升幅度 vs 第二名Agent S3bBoN72.6%9.2 ppAgent S3 單次運(yùn)行66.0%2.6 ppGTA1 w/ GPT-5前 SOTA63.4%—人類參考~72%—圖中展示了各 GUI 智能體在 OSWorld 基準(zhǔn)上的成功率以及 Agent-S3 與約 72% 人類參考線的相對位置泛化性也值得一提沒有做任何平臺專項(xiàng)適配WindowsAgentArena 上從單次的 50.2% 提升到 3 次采樣擇優(yōu)后的 56.6%AndroidWorld 從 68.1% 到 71.6%。再說不好聽的部署前得知道72.6% 是擇優(yōu)分?jǐn)?shù)。單次運(yùn)行是 66%如果你的推理預(yù)算只夠跑一遍評估和排期都應(yīng)該按 66% 算別按 72.6% 算。Grounding 模型要自己部署。7B 不算大但仍然意味著一塊推理端點(diǎn)的顯存和運(yùn)維成本不像純 API 方案那樣零部署。本地代碼執(zhí)行是雙刃劍。它用運(yùn)行 agent 的同一用戶權(quán)限執(zhí)行 Python/Bash官方警告寫得很大僅限可信環(huán)境。生產(chǎn)環(huán)境請放進(jìn)沙箱并給 bash 設(shè)超時(shí)框架內(nèi)建 30 秒限制但別依賴它。另外一個(gè)隱性成本長序列設(shè)置下成功率更高但模型調(diào)用次數(shù)和 token 消耗也同步上漲性能換算力的賬要自己算。圖中展示了允許步數(shù)從 15 步增加到 50 步時(shí)各智能體成功率的變化序列越長 Agent-S3 的領(lǐng)先越明顯三種可以復(fù)用的任務(wù)套路跑一段時(shí)間之后你會發(fā)現(xiàn)真正值得沉淀的不是某個(gè)具體任務(wù)而是三種套路。GUI 與代碼分工視覺活給 GUI畫圖、透視表、打印設(shè)置、一切必須點(diǎn)菜單的操作。數(shù)據(jù)活給代碼 agent求和、批量填充、篩選排序、批量改格式。Agent-S3 內(nèi)部就是按這條線切分的而且明確規(guī)定圖表類操作永遠(yuǎn)不走代碼 agent——你自己設(shè)計(jì)自動化流水線時(shí)可以直接照抄這條邊界。異常回退與驗(yàn)證代碼 agent 的返回只有三種狀態(tài)DONE、FAIL、BUDGET_EXHAUSTED??蚣軆?nèi)建的規(guī)則是代碼 agent 改完文件后必須回到 GUI 里打開應(yīng)用驗(yàn)證結(jié)果而且當(dāng)前打開著的應(yīng)用可能不反映磁盤上的變化——要整個(gè)關(guān)掉重開刷新頁面不夠。這套代碼干活、GUI 驗(yàn)收、失敗回退到 GUI 手動收尾的組合是這篇文檔里我認(rèn)為最值得抄走的一段工程實(shí)踐。關(guān)鍵任務(wù)跑多次擇優(yōu)失敗代價(jià)高的任務(wù)上 bBoN 路線同一任務(wù)跑 3 次為每條軌跡的截圖變化生成事實(shí)描述再用裁判模型挑出最優(yōu)的一條。倉庫里帶完整工具鏈osworld_setup/s3/bbon/下的 generate_facts 和 run_judge 就是干這個(gè)的。66% 到 72.6%、50.2% 到 56.6%都是這一招抬上去的。下一步值得關(guān)注S3 論文The Unreasonable Effectiveness of Scaling Agents for Computer Use已公開S2 被 COLM 2025 接收S1 被 ICLR 2025 接收這條 GUI 智能體路線在學(xué)術(shù)側(cè)是持續(xù)出活的。值得盯的兩個(gè)方向一是 bBoN 裁判的工程化——目前它更多是評測工具離自動重試到成功的生產(chǎn)組件還有一段距離二是單次運(yùn)行的成本——性能上探的空間和推理成本下探的空間目前是反向的誰先解決誰就贏。速查卡項(xiàng)內(nèi)容安裝pip install gui-agents 單獨(dú)裝 tesseract開發(fā)模式clone https://gitcode.com/GitHub_Trending/ag/Agent-S 后pip install -e .推薦主模型gpt-5-2025-08-07OpenAI推薦 GroundingUI-TARS-1.5-7B自部署端點(diǎn)坐標(biāo) 1920×1080常用開關(guān)--enable_local_env/--max_trajectory_length 8/--enable_reflection坑一Grounding 分辨率與模型坐標(biāo)系不匹配 → 點(diǎn)擊全錯(cuò)位坑二多屏或非 1080p → 坐標(biāo)偏移框架只支持單屏安全紅線本地代碼環(huán)境執(zhí)行任意代碼默認(rèn)關(guān)閉生產(chǎn)上沙箱運(yùn)行評測資產(chǎn)osworld_setup/s3/ 內(nèi)含完整運(yùn)行腳本與 bBoN 裁判工具【免費(fèi)下載鏈接】Agent-SAgent S: an open agentic framework that uses computers like a human項(xiàng)目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考