態(tài)與策略評(píng)估)
1. 項(xiàng)目概述當(dāng)AI研究代理開始“思考”如何搜索最近在AI研究圈子里一個(gè)名為FML-bench的項(xiàng)目引起了我的注意。這名字乍一看有點(diǎn)抽象但它的核心目標(biāo)卻非常接地氣它想搞清楚那些號(hào)稱能自動(dòng)做研究的AI代理AI Research Agent到底是怎么“想問題”和“找答案”的。說得更直白點(diǎn)它就像一個(gè)站在AI背后的觀察者專門研究不同AI代理在完成復(fù)雜研究任務(wù)時(shí)其內(nèi)部的“搜索動(dòng)態(tài)”有何不同。這里的“搜索動(dòng)態(tài)”是個(gè)關(guān)鍵它指的不僅僅是AI在數(shù)據(jù)庫里翻找資料那么簡單而是涵蓋了從理解問題、制定策略、執(zhí)行探索到最終整合答案的完整思維鏈條。對(duì)于任何想深入理解或構(gòu)建AI研究代理的開發(fā)者、研究員乃至產(chǎn)品經(jīng)理來說FML-bench提供的視角和工具都極具價(jià)值。為什么我們需要這樣一個(gè)基準(zhǔn)測試因?yàn)楫?dāng)前的AI研究代理領(lǐng)域有點(diǎn)像早期的搜索引擎市場百花齊放但良莠不齊。有的代理擅長快速抓取信息但深度不夠有的邏輯嚴(yán)謹(jǐn)?shù)实拖逻€有的可能會(huì)在復(fù)雜的任務(wù)中迷失方向陷入“幻覺”或循環(huán)論證。FML-bench的出現(xiàn)就是為了給這些策略提供一個(gè)可控的“比武場”。它通過設(shè)計(jì)一系列標(biāo)準(zhǔn)化的研究任務(wù)并精細(xì)地記錄下代理在解決任務(wù)過程中的每一步“思考”和“行動(dòng)”從而讓我們能夠像看心電圖一樣分析不同策略的“生命體征”——比如它的探索效率、決策質(zhì)量、抗干擾能力等等。這對(duì)于我們優(yōu)化現(xiàn)有代理、設(shè)計(jì)新策略乃至理解AI輔助研究的邊界都至關(guān)重要。2. FML-bench的核心設(shè)計(jì)思路與架構(gòu)拆解2.1 基準(zhǔn)測試的構(gòu)建哲學(xué)超越結(jié)果關(guān)注過程大多數(shù)AI性能評(píng)測基準(zhǔn)Benchmark關(guān)注的是最終答案的對(duì)錯(cuò)比如在某個(gè)測試集上取得了多少分。但FML-bench的設(shè)計(jì)哲學(xué)截然不同它認(rèn)為對(duì)于研究型任務(wù)過程比結(jié)果更重要。一個(gè)代理可能最終蒙對(duì)了答案但它的搜索路徑混亂、浪費(fèi)了大量計(jì)算資源另一個(gè)代理可能得出了略有瑕疵的結(jié)論但其推理鏈條清晰、引證可靠。后者在實(shí)際研究輔助中可能更有價(jià)值。因此FML-bench的核心是構(gòu)建一個(gè)能夠全過程、多維度記錄搜索動(dòng)態(tài)的評(píng)估框架。這個(gè)框架通常包含幾個(gè)關(guān)鍵組件任務(wù)集Task Suite一系列模擬真實(shí)研究場景的問題例如“綜述某個(gè)新興技術(shù)領(lǐng)域的發(fā)展現(xiàn)狀”、“為某個(gè)科學(xué)問題設(shè)計(jì)實(shí)驗(yàn)方案”、“查找并對(duì)比三篇特定主題論文的核心結(jié)論”。這些任務(wù)具有開放性、多步驟和需要綜合判斷的特點(diǎn)。環(huán)境模擬器Environment Simulator為AI代理提供一個(gè)可控的“研究環(huán)境”。這可能是一個(gè)包含海量學(xué)術(shù)論文摘要和元數(shù)據(jù)的本地知識(shí)庫也可能是一個(gè)模擬的學(xué)術(shù)搜索引擎API。環(huán)境會(huì)記錄代理的每一次查詢、每一次點(diǎn)擊、每一次對(duì)文檔的閱讀或摘要提取行為。代理策略接口Agent Strategy Interface定義AI代理必須遵守的交互協(xié)議。代理接收任務(wù)描述然后可以執(zhí)行諸如search(keywords),retrieve(doc_id),analyze(content),synthesize(notes)等動(dòng)作。FML-bench不關(guān)心代理內(nèi)部是用GPT-4還是Claude是思維鏈Chain-of-Thought還是思維樹Tree of Thoughts它只通過這個(gè)接口觀察代理的“外顯行為”。動(dòng)態(tài)記錄與度量體系Dynamic Logger Metrics這是項(xiàng)目的靈魂。它會(huì)實(shí)時(shí)記錄并生成一系列時(shí)序數(shù)據(jù)例如搜索查詢序列代理隨時(shí)間變化提交了哪些關(guān)鍵詞這些關(guān)鍵詞是如何演變的信息獲取路徑代理瀏覽了哪些文檔瀏覽的順序是怎樣的是否出現(xiàn)了回溯內(nèi)部狀態(tài)快照如果代理暴露代理的當(dāng)前目標(biāo)、待辦列表、已有筆記或假設(shè)是什么資源消耗進(jìn)行了多少次搜索/檢索調(diào)用總共處理了多少文本token最終產(chǎn)出生成的報(bào)告、答案或方案?;谶@些原始數(shù)據(jù)FML-bench可以計(jì)算出一系列深層指標(biāo)例如探索廣度與深度、查詢效率用更少的搜索獲得關(guān)鍵信息、路徑最優(yōu)性、抗干擾能力避免陷入無關(guān)信息以及結(jié)論的穩(wěn)健性。2.2 策略對(duì)比的典型場景設(shè)計(jì)為了進(jìn)行“受控研究”FML-bench需要精心設(shè)計(jì)對(duì)比實(shí)驗(yàn)。通常它會(huì)固定任務(wù)和環(huán)境然后讓搭載不同核心策略的代理去執(zhí)行。這些策略可能包括廣度優(yōu)先搜索BFS式代理傾向于先廣泛收集各個(gè)子方向的信息建立全景圖后再深入。深度優(yōu)先搜索DFS式代理鎖定一個(gè)看似最有希望的路徑后一直深入挖掘到底再?zèng)Q定是否回溯。迭代式查詢優(yōu)化代理根據(jù)每次搜索結(jié)果的反饋動(dòng)態(tài)調(diào)整和細(xì)化搜索關(guān)鍵詞?;谝?guī)劃的代理先顯式地制定一個(gè)多步驟研究計(jì)劃如1. 理解核心概念2. 查找開創(chuàng)性論文3. 追蹤最新進(jìn)展4. 歸納爭議點(diǎn)然后按部就班執(zhí)行。反應(yīng)式代理沒有長期計(jì)劃根據(jù)當(dāng)前看到的最相關(guān)信息即時(shí)決定下一步動(dòng)作。通過讓這些策略在相同的起跑線上競賽FML-bench能夠清晰地揭示出在文獻(xiàn)綜述類任務(wù)中廣度優(yōu)先策略是否在初期信息收集上占優(yōu)在解答具體科學(xué)問題時(shí)深度優(yōu)先策略是否更容易快速定位關(guān)鍵證據(jù)迭代優(yōu)化策略在面對(duì)模糊初始查詢時(shí)其自我修正能力有多強(qiáng)注意設(shè)計(jì)任務(wù)時(shí)一個(gè)常見的陷阱是任務(wù)本身帶有對(duì)某種策略的隱性偏好。例如一個(gè)定義極其清晰的任務(wù)可能讓基于規(guī)劃的代理輕松獲勝而一個(gè)高度開放、探索性的任務(wù)可能更適合反應(yīng)式或廣度優(yōu)先代理。因此FML-bench的任務(wù)集必須足夠多樣和平衡以全面評(píng)估策略的通用性和適應(yīng)性。3. 從數(shù)據(jù)到洞察如何解讀搜索動(dòng)態(tài)3.1 關(guān)鍵動(dòng)態(tài)指標(biāo)的計(jì)算與含義收集到原始的搜索行為日志后我們需要將其轉(zhuǎn)化為可量化的洞察。以下是一些核心的動(dòng)態(tài)指標(biāo)及其計(jì)算方法查詢演化熵Query Evolution Entropy計(jì)算將代理提交的搜索關(guān)鍵詞序列視為一個(gè)狀態(tài)轉(zhuǎn)移過程。分析相鄰查詢之間的語義變化程度可以通過關(guān)鍵詞的重疊度、或嵌入向量的余弦距離來衡量。熵值高說明代理的搜索方向跳躍、發(fā)散熵值低說明搜索方向集中、漸進(jìn)。洞察低熵可能代表策略專注但也可能意味著陷入思維定式高熵可能代表探索性強(qiáng)但也可能是迷失方向。一個(gè)優(yōu)秀的代理可能在任務(wù)初期熵值較高廣泛探索中后期熵值降低并穩(wěn)定聚焦深入。信息收益曲線Information Gain Curve計(jì)算定義每個(gè)檢索到的文檔對(duì)最終答案的“貢獻(xiàn)度”可以通過事后評(píng)估如文檔中的關(guān)鍵句子是否被最終報(bào)告引用。然后繪制隨時(shí)間或搜索步驟累積的信息收益圖。洞察曲線陡峭上升的代理說明其“淘金”效率高能快速定位高價(jià)值信息。曲線平緩的代理可能花費(fèi)了大量時(shí)間在低相關(guān)度內(nèi)容上。我們追求的是早期收益增長快的曲線?;厮荼嚷逝c深度Backtracking Ratio Depth計(jì)算統(tǒng)計(jì)代理在明確放棄當(dāng)前路徑返回到更早的決策點(diǎn)重新選擇的次數(shù)回溯?;厮荼嚷? 回溯次數(shù) / 總決策次數(shù)?;厮萆疃群饬科骄看位厮萏亓硕嗌俨健6床爝m度的回溯是靈活性的體現(xiàn)說明代理能意識(shí)到當(dāng)前路徑不佳并主動(dòng)調(diào)整。但過高的回溯比率特別是深度的回溯可能意味著策略缺乏前瞻性在不斷試錯(cuò)中浪費(fèi)資源。探索-利用平衡Exploration-Exploitation Balance計(jì)算將代理的每次行動(dòng)分類為“探索”如搜索新關(guān)鍵詞、點(diǎn)擊未讀的相關(guān)文獻(xiàn)或“利用”如深入閱讀已定位的關(guān)鍵文獻(xiàn)、基于已有信息進(jìn)行綜合。繪制兩者隨時(shí)間變化的比例。洞察理想的動(dòng)態(tài)模式可能是“探索 - 利用 - 再探索基于新發(fā)現(xiàn)- 再利用”的循環(huán)。全程都在探索的代理無法形成深刻見解全程都在利用的代理可能基于片面信息得出錯(cuò)誤結(jié)論。3.2 可視化分析讓動(dòng)態(tài)“看得見”數(shù)字指標(biāo)是冰冷的結(jié)合可視化能讓我們更直觀地理解代理的“思考”過程。FML-bench可以生成諸如搜索路徑圖一個(gè)二維或網(wǎng)絡(luò)圖節(jié)點(diǎn)代表查詢或關(guān)鍵文檔邊代表代理的轉(zhuǎn)移路徑。用顏色或大小區(qū)分節(jié)點(diǎn)的重要性如信息收益用邊的粗細(xì)表示轉(zhuǎn)移頻率。一眼就能看出代理是“星型輻射”還是“線性深入”。查詢語義空間投影將所有查詢的文本嵌入降維如用t-SNE降到2維并按時(shí)序連線??梢钥吹酱淼乃阉髦黝}在語義空間中的“漫步軌跡”是圍繞一個(gè)區(qū)域密集探索還是在多個(gè)區(qū)域間跳躍。關(guān)鍵信息獲取時(shí)間線在一條時(shí)間軸上標(biāo)記出代理首次接觸到各個(gè)最終被引用的關(guān)鍵證據(jù)的時(shí)刻。這能清晰展示代理的信息發(fā)現(xiàn)效率。這些可視化不僅是分析工具也是向非技術(shù)背景的團(tuán)隊(duì)成員如產(chǎn)品經(jīng)理、領(lǐng)域?qū)<医忉孉I代理行為模式的絕佳媒介。4. 實(shí)操基于FML-bench理念構(gòu)建自己的評(píng)估環(huán)境4.1 最小可行評(píng)估環(huán)境搭建你可能沒有精力完全復(fù)現(xiàn)一個(gè)完整的FML-bench但完全可以借鑒其思想為你正在開發(fā)的AI研究代理構(gòu)建一個(gè)輕量級(jí)的評(píng)估環(huán)境。以下是具體步驟定義你的核心任務(wù)選擇一個(gè)你最關(guān)心的具體研究場景。例如“為‘對(duì)比學(xué)習(xí)在推薦系統(tǒng)中的應(yīng)用’這個(gè)主題找出過去三年內(nèi)最重要的三篇突破性論文并簡述其貢獻(xiàn)”。構(gòu)建模擬知識(shí)庫使用開放學(xué)術(shù)數(shù)據(jù)集如Semantic Scholar或arXiv的元數(shù)據(jù)建立一個(gè)本地向量數(shù)據(jù)庫用Chroma、Weaviate或FAISS。確保數(shù)據(jù)范圍與你的任務(wù)匹配。實(shí)現(xiàn)代理接口為你代理的“大腦”大語言模型封裝一個(gè)統(tǒng)一的類。這個(gè)類至少要有reset(task_description)、step(environment_feedback)和get_action()方法。action就是搜索、檢索等。實(shí)現(xiàn)環(huán)境模擬器編寫一個(gè)類它持有向量數(shù)據(jù)庫并能處理代理的動(dòng)作。例如收到search(“contrastive learning recommendation”)后它從向量庫返回top-k篇最相關(guān)的論文ID和摘要。實(shí)現(xiàn)記錄器在環(huán)境模擬器中詳細(xì)記錄每一步的時(shí)間戳、代理動(dòng)作、環(huán)境返回結(jié)果。同時(shí)你需要一個(gè)“標(biāo)準(zhǔn)答案”或“關(guān)鍵證據(jù)集”作為評(píng)估基準(zhǔn)可以手動(dòng)標(biāo)注。運(yùn)行與記錄讓你的代理在任務(wù)上運(yùn)行記錄完整日志。計(jì)算你的指標(biāo)根據(jù)日志計(jì)算針對(duì)你這個(gè)特定任務(wù)的簡化版指標(biāo)例如找到所有關(guān)鍵證據(jù)所需的步驟數(shù)。在找到第一個(gè)關(guān)鍵證據(jù)前發(fā)出了多少條“無效”查詢。最終報(bào)告引用非關(guān)鍵證據(jù)的比例衡量了專注度。4.2 一個(gè)簡單的策略對(duì)比實(shí)驗(yàn)示例假設(shè)你想比較“規(guī)劃式”和“反應(yīng)式”兩種策略。規(guī)劃式代理實(shí)現(xiàn)在reset后先讓大模型生成一個(gè)研究計(jì)劃大綱如1. 理解對(duì)比學(xué)習(xí)基礎(chǔ)2. 查找其在推薦系統(tǒng)的綜述3. 定位近期SOTA論文4. 對(duì)比方法差異。然后在每個(gè)step根據(jù)當(dāng)前計(jì)劃階段決定搜索詞。反應(yīng)式代理實(shí)現(xiàn)在reset后直接根據(jù)初始任務(wù)描述生成第一個(gè)搜索詞。在后續(xù)每個(gè)step將當(dāng)前看到的所有摘要文本和歷史動(dòng)作一起喂給大模型讓它直接生成下一個(gè)動(dòng)作。你讓兩個(gè)代理在同一個(gè)任務(wù)和知識(shí)庫上各跑10次由于大模型的隨機(jī)性需要多次實(shí)驗(yàn)。然后對(duì)比它們的平均步驟數(shù)、關(guān)鍵證據(jù)發(fā)現(xiàn)率、以及搜索路徑圖的差異。你可能會(huì)發(fā)現(xiàn)規(guī)劃式代理在復(fù)雜任務(wù)上更穩(wěn)定路徑更可預(yù)測而反應(yīng)式代理有時(shí)能有意外的發(fā)現(xiàn)但表現(xiàn)波動(dòng)大。實(shí)操心得在搭建這種測試環(huán)境時(shí)最大的坑在于“模擬環(huán)境與真實(shí)環(huán)境的差距”。你的本地向量庫可能無法完全模擬真實(shí)搜索引擎的豐富性和動(dòng)態(tài)性如缺少全文、引用網(wǎng)絡(luò)信息。為了緩解這個(gè)問題可以在構(gòu)建知識(shí)庫時(shí)不僅包含摘要還嘗試抽取引言和結(jié)論的關(guān)鍵句并人工構(gòu)建一些簡單的文檔引用關(guān)系如A論文引用了B論文讓環(huán)境更具挑戰(zhàn)性。5. 策略優(yōu)化啟示與常見問題排查5.1 從動(dòng)態(tài)分析中獲得的優(yōu)化方向通過對(duì)FML-bench類評(píng)估結(jié)果的分析我們可以得到許多優(yōu)化AI研究代理的具體方向針對(duì)查詢效率低下如果代理的查詢演化熵過高且信息收益曲線平緩說明它“東一榔頭西一棒子”。優(yōu)化方向可以是引入查詢重寫模塊基于歷史搜索結(jié)果和當(dāng)前任務(wù)目標(biāo)對(duì)用戶初始查詢或代理自己生成的查詢進(jìn)行優(yōu)化和聚焦。也可以讓代理在每次搜索前先明確本次搜索的具體意圖是找定義、找方法、找數(shù)據(jù)還是找批判。針對(duì)過早收斂或陷入局部最優(yōu)如果代理幾乎不回溯深度優(yōu)先地扎進(jìn)一個(gè)可能并不最優(yōu)的路徑??梢砸攵ㄆ谠u(píng)估機(jī)制讓代理每進(jìn)行N步就暫停一下評(píng)估當(dāng)前收集信息的充分性和方向正確性并有機(jī)會(huì)進(jìn)行“戰(zhàn)略回顧”和調(diào)整。這相當(dāng)于在深度優(yōu)先搜索中加入了“參謀部會(huì)議”。針對(duì)探索與利用失衡如果代理全程都在利用已知的幾篇文獻(xiàn)可以強(qiáng)制加入探索機(jī)制例如要求代理在報(bào)告中必須包含至少一個(gè)與當(dāng)前主流結(jié)論不同的“爭議觀點(diǎn)”或“替代方法”這會(huì)驅(qū)動(dòng)它主動(dòng)去搜索對(duì)立信息。反之如果探索過多可以增加對(duì)信息綜合和答案生成的“壓力”設(shè)定更緊迫的“時(shí)間”步驟限制。針對(duì)幻覺與事實(shí)錯(cuò)誤這在動(dòng)態(tài)中表現(xiàn)為代理引用了知識(shí)庫中不存在或與庫中內(nèi)容矛盾的“信息”。除了加強(qiáng)檢索增強(qiáng)生成RAG中的引用 grounding 外可以在代理架構(gòu)中增加一個(gè)事實(shí)核查子循環(huán)當(dāng)代理準(zhǔn)備引用某個(gè)“事實(shí)”時(shí)強(qiáng)制其再次檢索該事實(shí)的最原始來源進(jìn)行確認(rèn)。5.2 常見問題與調(diào)試清單在實(shí)際開發(fā)和評(píng)估中你可能會(huì)遇到以下典型問題問題現(xiàn)象可能原因排查與解決思路代理完全偏離主題搜索詞與任務(wù)無關(guān)。1. 任務(wù)提示詞Prompt描述不清或歧義。2. 大語言模型對(duì)任務(wù)理解出現(xiàn)嚴(yán)重偏差幻覺。3. 初始搜索返回了強(qiáng)噪聲結(jié)果帶偏了后續(xù)方向。1.優(yōu)化提示詞使用更清晰、分步驟的指令甚至提供少量示例Few-shot。明確任務(wù)邊界。2.增加驗(yàn)證步驟在代理開始行動(dòng)前讓其先復(fù)述一遍任務(wù)目標(biāo)確保理解正確。3.改進(jìn)檢索提升向量檢索的準(zhǔn)確性或?qū)Τ跏冀Y(jié)果進(jìn)行重排序、過濾。代理在幾個(gè)相似查詢間無限循環(huán)。陷入了“局部搜索循環(huán)”。代理的下一步?jīng)Q策過于依賴近期歷史缺乏跳出循環(huán)的機(jī)制。1.引入隨機(jī)性以一定概率如10%讓代理執(zhí)行一個(gè)與近期歷史無關(guān)的探索性搜索。2.擴(kuò)大決策上下文讓代理在決策時(shí)不僅看最近幾步也回顧更早的探索結(jié)果獲得全局視角。3.設(shè)置循環(huán)檢測當(dāng)檢測到連續(xù)N步的查詢語義高度相似時(shí)強(qiáng)制觸發(fā)一個(gè)回溯或重新規(guī)劃。代理能找到資料但生成的報(bào)告質(zhì)量差只是羅列。代理缺乏有效的信息綜合與抽象能力。其“利用”階段過于薄弱。1.強(qiáng)化綜合指令在最終生成階段使用更強(qiáng)的提示詞要求對(duì)比、歸納、批判性分析而非總結(jié)。2.分階段生成先讓代理生成一個(gè)包含關(guān)鍵點(diǎn)和引用的“筆記”再基于筆記撰寫連貫報(bào)告。3.迭代式潤色生成初稿后讓代理以“審稿人”視角對(duì)其進(jìn)行批評(píng)和修改。評(píng)估結(jié)果波動(dòng)巨大同一策略每次運(yùn)行差異大。大語言模型生成固有的隨機(jī)性被任務(wù)和策略放大。1.多次運(yùn)行取統(tǒng)計(jì)值任何結(jié)論都應(yīng)基于足夠多次如20-50次的運(yùn)行計(jì)算平均性能和方差。2.控制隨機(jī)種子在實(shí)驗(yàn)對(duì)比時(shí)固定隨機(jī)種子以確保不同策略在“運(yùn)氣”上是公平的。3.降低溫度Temperature在代理決策的關(guān)鍵環(huán)節(jié)如生成搜索詞、制定計(jì)劃使用更低的溫度參數(shù)如0.2以減少隨機(jī)性。6. 超越基準(zhǔn)搜索動(dòng)態(tài)研究對(duì)AI產(chǎn)品設(shè)計(jì)的啟發(fā)FML-bench的價(jià)值不僅在于評(píng)估更在于它為我們設(shè)計(jì)更人性化、更高效的AI輔助工具提供了深層啟發(fā)。首先它揭示了**“可解釋性”** 的新維度。傳統(tǒng)的AI可解釋性可能關(guān)注模型內(nèi)部的注意力權(quán)重。而對(duì)于AI研究代理其“思考過程”的可解釋性就體現(xiàn)在搜索動(dòng)態(tài)上。一個(gè)優(yōu)秀的產(chǎn)品應(yīng)該能向用戶展示代理的“探索地圖”——它查了哪些詞看了哪些文章為什么認(rèn)為這幾篇是關(guān)鍵。這不僅能建立用戶信任還能讓用戶更有效地介入和引導(dǎo)研究過程。想象一下一個(gè)邊思考邊為你高亮顯示其搜索路徑和關(guān)鍵節(jié)點(diǎn)的研究助手。其次它指向了**“人機(jī)協(xié)同”** 的優(yōu)化點(diǎn)。通過分析代理的典型失敗模式如過早收斂、循環(huán)我們可以在產(chǎn)品中預(yù)設(shè)一些“協(xié)同接口”。例如當(dāng)系統(tǒng)檢測到代理可能陷入局部最優(yōu)時(shí)可以主動(dòng)彈出提示詢問用戶“當(dāng)前方向是否聚焦是否需要我拓寬搜索范圍”。或者系統(tǒng)可以定期生成一個(gè)“中期進(jìn)展報(bào)告”列出已找到的核心論點(diǎn)和待探索的開放問題請用戶確認(rèn)或提供進(jìn)一步指導(dǎo)。這種動(dòng)態(tài)的、基于過程的人機(jī)交互遠(yuǎn)比提供一個(gè)最終答案后再修改要高效。最后它促進(jìn)了**“自適應(yīng)策略”** 的發(fā)展。沒有一種搜索策略是萬能的。FML-bench的研究可以幫助我們構(gòu)建一個(gè)“元策略”控制器它能夠根據(jù)當(dāng)前任務(wù)的類型、難度以及初期幾步的動(dòng)態(tài)表現(xiàn)自動(dòng)為代理選擇或融合最合適的底層搜索策略。例如對(duì)于定義清晰的文獻(xiàn)收集任務(wù)啟用更高效的深度優(yōu)先策略對(duì)于開放式的創(chuàng)新探索任務(wù)則切換到探索性更強(qiáng)的廣度優(yōu)先或隨機(jī)探索策略。這使得AI研究代理從一個(gè)靜態(tài)的工具進(jìn)化成為一個(gè)具備初步“情境感知”能力的智能伙伴。在我自己嘗試構(gòu)建類似評(píng)估環(huán)境的過程中最深的一點(diǎn)體會(huì)是設(shè)計(jì)一個(gè)能真實(shí)反映AI代理“思考”難度的任務(wù)其本身就需要對(duì)研究過程有深刻的理解。很多時(shí)候我們抱怨AI代理表現(xiàn)不佳可能不是因?yàn)槟P筒粔蚵斆鞫且驗(yàn)槲覀優(yōu)樗O(shè)定的任務(wù)場景過于理想化或模糊。FML-bench這類工作的重要性就在于它把我們拉回到一個(gè)更現(xiàn)實(shí)、更嚴(yán)謹(jǐn)?shù)膶用嫫仁刮覀內(nèi)リP(guān)注智能體在解決問題時(shí)那些笨拙、曲折但真實(shí)的動(dòng)態(tài)過程。而這恰恰是邁向更強(qiáng)大、更可靠AI研究助手的關(guān)鍵一步。