證 AI 技能好不好用:一套評估系統(tǒng)完整實(shí)戰(zhàn)指南)
如何驗(yàn)證 AI 技能好不好用一套評估系統(tǒng)完整實(shí)戰(zhàn)指南【免費(fèi)下載鏈接】skillsPublic repository for Agent Skills項(xiàng)目地址: https://gitcode.com/GitHub_Trending/skills3/skills你剛寫完一組 MCP 工具讓大模型去調(diào)用看起來能跑——但到底能答對多少這不能靠感覺。skills 倉庫里的 mcp-builder 模塊內(nèi)置了 AI 技能評估能力它把一批測試題交給模型讓模型用你的工具作答再逐題對照標(biāo)準(zhǔn)答案輸出一份量化報(bào)告。從出題到讀結(jié)果下面走一遍完整流程。先把話說清楚這套評估器在哪它藏在倉庫的skills/mcp-builder/目錄下核心就是一個(gè)腳本skills/mcp-builder/scripts/evaluation.py。工作方式一句話概括連上你的 MCP 服務(wù)列出全部工具逐題喂入問題跑完模型的完整調(diào)用循環(huán)記錄每題的答案、耗時(shí)和工具調(diào)用次數(shù)。連接方式支持 STDIO、SSE、HTTP 三種本地進(jìn)程和遠(yuǎn)程部署的服務(wù)都能測。同目錄下的example_evaluation.xml是一個(gè)現(xiàn)成的測試文件樣例照著寫即可。 三步跑通評估第一步裝依賴。只有兩個(gè)包anthropic SDK 和 mcp都在skills/mcp-builder/scripts/requirements.txt里。pip install -r skills/mcp-builder/scripts/requirements.txt第二步準(zhǔn)備測試文件。格式是 XML根節(jié)點(diǎn)evaluation每個(gè)qa_pair里放一個(gè)question和一個(gè)answer答案就是標(biāo)準(zhǔn)答案原文。第三步執(zhí)行。本地 STDIO 服務(wù)最典型python skills/mcp-builder/scripts/evaluation.py \ -t stdio -c python -a my_server.py my_eval.xml其中-t指定連接方式-c是啟動服務(wù)的命令-a是傳給服務(wù)的參數(shù)。如果服務(wù)部署在遠(yuǎn)端把-t換成 sse 或 http改傳 URL并可以附帶自定義請求頭做鑒權(quán)。測試集怎么出題10 道能驗(yàn)真的題配套的出題指南在skills/mcp-builder/reference/evaluation.md核心要求四條建議一次出 10 道題只讀且無害答題只靠查詢不修改任何數(shù)據(jù)。這樣評估可以反復(fù)跑結(jié)果可比。相互獨(dú)立題目之間無依賴調(diào)換順序不影響答案方便單獨(dú)復(fù)測。答案可精確核對單個(gè)數(shù)字、ID 或一段確定文本。比如本金 1 萬、月息復(fù)利 3 年最終金額保留兩位小數(shù)答案就是一個(gè)數(shù)字對就是對。答案穩(wěn)定不隨時(shí)間變化。別用當(dāng)前有幾條未讀消息這種題下次跑結(jié)果就飄了。另外兩點(diǎn)決定這套測試是否有含金量。一是題目要多跳一道題逼著模型連續(xù)調(diào)用多個(gè)工具才能湊出答案單步查詢測不出工具配合的問題。二是避免在題面里寫工具字段名用同義詞或口語化表述——真實(shí)用戶往往不知道你的字段叫channel_id只說那個(gè)頻道。 報(bào)告里的四個(gè)關(guān)鍵指標(biāo)怎么讀跑完后會生成一份 Markdown 報(bào)告用-o參數(shù)可以存成文件。頂部是四個(gè)匯總值準(zhǔn)確率答對的題數(shù)除以總題數(shù)。注意判分是字符串精確比對所以出題時(shí)必須在題面里寫死輸出格式保留幾位小數(shù)、只要數(shù)字等否則 11614.72 和 $11,614.72 會被判錯(cuò)。平均任務(wù)耗時(shí)從提問到出答案的總時(shí)長。個(gè)別題目明顯偏慢時(shí)翻到該題的工具調(diào)用明細(xì)看是哪個(gè)工具拖了后腿。平均工具調(diào)用次數(shù)偏少可能說明模型跳步偏多則大概率是工具描述不清晰模型在反復(fù)試錯(cuò)。每題的 Summary 與 Feedback這是模型被要求寫下的復(fù)盤Feedback 部分常直接點(diǎn)名某個(gè)工具命名含糊、參數(shù)沒文檔、報(bào)錯(cuò)看不懂。整份報(bào)告里它最有價(jià)值往往直接就是改進(jìn)清單。模型解不出的題會返回 NOT_FOUND 計(jì)為失敗失敗案例同樣值得細(xì)看。發(fā)現(xiàn)瓶頸、改進(jìn)、復(fù)測的循環(huán)評估的價(jià)值不在一次分?jǐn)?shù)而在讓你能證明改動有效。循環(huán)這么做先看失敗題模型答錯(cuò)前調(diào)用了哪些工具、工具返回了什么瓶頸通常就藏在返回內(nèi)容里。再看 Feedback 的共性問題如果多道題都在抱怨工具 X 的參數(shù)描述不清楚這就是明確信號。一次只改一處比如只重寫一個(gè)工具的描述然后用同一份測試文件重跑。對比兩份報(bào)告準(zhǔn)確率是否上升、耗時(shí)是否下降、工具調(diào)用次數(shù)是否收斂三項(xiàng)一起看比單看準(zhǔn)確率更可靠。測試文件不用動改動的只是你的服務(wù)本身。這樣每一輪復(fù)測的差異才能真正歸因到那次修改上?!久赓M(fèi)下載鏈接】skillsPublic repository for Agent Skills項(xiàng)目地址: https://gitcode.com/GitHub_Trending/skills3/skills創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考