)
1. 項目概述當大語言模型學會“看”圖修圖最近在AI圖像處理領域一個名為“RetouchIQ”的項目引起了我的注意。這個項目標題直譯為“基于指令的圖像修飾的MLLM智能體與通用獎勵”聽起來有點繞口但它的核心目標非常明確讓一個能同時理解語言和視覺的AI模型MLLM像人類修圖師一樣根據(jù)你的一句文字指令自動完成復雜的圖片精修工作。比如你上傳一張人像照片然后告訴它“把皮膚瑕疵去掉但保留自然的紋理感同時把背景稍微虛化一下”它就能理解并執(zhí)行這一系列復合操作。這和我們之前接觸的單一功能AI修圖工具比如只能美顏或只能調(diào)色有本質(zhì)區(qū)別。RetouchIQ的核心在于“智能體Agent”和“基于指令Instruction-Based”。這里的智能體不是一個簡單的濾鏡應用器而是一個具備規(guī)劃、決策和執(zhí)行能力的“虛擬修圖師”。它需要先“看懂”圖片內(nèi)容視覺理解再“聽懂”你的文字要求語言理解然后拆解任務、選擇合適的修圖工具如局部修復、曲線調(diào)整、模糊濾鏡等并按合理順序執(zhí)行最后還要評估修出來的效果是否符合要求。整個過程完全模擬了一個專業(yè)修圖師的工作流。為什么這件事有挑戰(zhàn)性傳統(tǒng)的圖像處理模型往往是“一錘子買賣”輸入圖片和參數(shù)輸出結(jié)果。但真實的修圖需求是復雜、分層且主觀的。用戶的一句指令可能包含多個隱含的子任務如“提亮、去噪、增強色彩”且這些子任務之間存在依賴關系通常先降噪再銳化效果更好。此外如何評價修圖效果的好壞是越清晰越好還是越符合某種審美風格RetouchIQ引入的“通用獎勵Generalist Reward”機制就是為了解決這個評價難題試圖用一個統(tǒng)一的模型來量化不同修圖任務下的“好”與“壞”從而指導智能體學習更優(yōu)的修圖策略。簡單來說RetouchIQ試圖打造的是一個通才型的AI修圖助手。它不局限于某類特定的圖片如人像、風景或某幾種固定的修圖動作而是希望建立一個通用的框架讓AI能夠靈活應對用戶通過自然語言提出的、各式各樣的圖像優(yōu)化需求。這對于內(nèi)容創(chuàng)作者、電商從業(yè)者、甚至普通用戶來說意味著修圖門檻的大幅降低和效率的質(zhì)變。2. 核心架構拆解MLLM智能體如何協(xié)同工作要理解RetouchIQ是如何運作的我們需要把它拆解成幾個核心組件并看看它們是如何像齒輪一樣咬合在一起的。整個系統(tǒng)的基石是MLLM大型多模態(tài)模型它負責“感知”和“思考”而“智能體”框架則負責“規(guī)劃”和“行動”。2.1 MLLM系統(tǒng)的“大腦”與“眼睛”首先MLLM在這里扮演著雙重角色。一方面它是視覺理解器。模型需要將輸入的圖片編碼成一個富含語義信息的向量表示。這不僅僅是識別物體如人、樹、建筑更要理解圖像的全局構圖、光影分布、色彩基調(diào)、甚至細微的紋理和瑕疵。例如它要能分辨出照片是逆光還是順光皮膚上的點是雀斑還是噪點背景是雜亂還是簡潔。另一方面它更是指令解析與任務規(guī)劃器。當用戶輸入“讓這張風景照更有電影感”時MLLM需要解析這個模糊的指令。它可能會結(jié)合對圖片的理解比如這是一張黃昏的城市街景將“電影感”拆解為一系列可執(zhí)行的操作子目標1. 將畫面比例調(diào)整為寬銀幕如2.35:12. 應用一個帶有青色和橙色色調(diào)的LUT查找表以模仿電影調(diào)色3. 適當增加暗角效果4. 微調(diào)對比度和飽和度營造戲劇化光影。這個拆解過程就是智能體進行任務規(guī)劃的關鍵第一步。注意MLLM的規(guī)劃能力高度依賴于其預訓練階段見過的海量圖文對數(shù)據(jù)。如果它在訓練數(shù)據(jù)中很少見到“電影感”與具體修圖操作的關聯(lián)描述那么它生成的計劃就可能不準確。因此項目的效果很大程度上受限于底層MLLM的多模態(tài)理解與推理能力。2.2 智能體框架從思考到行動的循環(huán)有了任務計劃智能體框架就開始運轉(zhuǎn)了。我們可以將其理解為一個經(jīng)典的“感知-思考-行動”循環(huán)Perception-Thinking-Action Loop。狀態(tài)感知Perception智能體獲取當前環(huán)境狀態(tài)即原始圖片和用戶的文字指令。MLLM將這兩者融合形成一個初始的“心智狀態(tài)”。規(guī)劃與決策Thinking基于當前心智狀態(tài)MLLM生成一個具體的、可執(zhí)行的動作序列。這個動作不是抽象的“調(diào)色”而是調(diào)用某個具體修圖工具API的指令例如[調(diào)用工具’crop‘ 參數(shù)’aspect_ratio2.35‘], [調(diào)用工具’apply_lut‘ 參數(shù)’lut_nameteal_orange‘], ...。這個過程可能不是一步到位的智能體可能會規(guī)劃多個步驟。行動執(zhí)行Action智能體將規(guī)劃好的動作通過預定義的接口發(fā)送給后端的圖像處理工具集。這個工具集可以包含開源庫如OpenCV, Pillow、專業(yè)軟件的命令行接口如ImageMagick甚至是另一個專用的AI模型如用于人臉修復的GFPGAN用于超分辨率的Real-ESRGAN。智能體負責按順序調(diào)用這些工具。狀態(tài)更新與評估執(zhí)行一個動作后圖片狀態(tài)發(fā)生變化。智能體再次“觀察”修改后的圖片將其與指令對比判斷當前結(jié)果是否滿意或者是否需要繼續(xù)執(zhí)行下一個動作。這個“是否滿意”的判斷就引出了下一個核心組件——獎勵模型。2.3 通用獎勵模型好壞的“標尺”這是RetouchIQ項目中非常關鍵且具有挑戰(zhàn)性的一環(huán)。在強化學習中獎勵Reward是引導智能體學習的“指揮棒”。對于修圖任務我們需要一個模型能自動給出一個分數(shù)評價當前修圖結(jié)果相對于用戶指令的完成質(zhì)量。這就是“通用獎勵模型”要干的事。這個獎勵模型本身也是一個訓練好的神經(jīng)網(wǎng)絡。它的輸入是原始指令、修改后的圖片、以及可選的原始圖片。輸出是一個標量分數(shù)分數(shù)越高代表修圖效果越符合指令要求。訓練這樣一個模型是困難的因為“好”的標準非常主觀且多樣。項目可能需要收集大量的人類偏好數(shù)據(jù)——即對于同一張圖和同一條指令展示多個不同的修圖結(jié)果讓人來排序哪個更好——然后用這些數(shù)據(jù)來訓練獎勵模型讓它學會模仿人類的審美判斷。所謂“通用”是指這個獎勵模型要能適應各種各樣的修圖指令和圖片類型而不是針對“人像美白”或“風景增艷”這種單一任務專門訓練一個。這就對模型的泛化能力提出了極高要求。一個訓練良好的通用獎勵模型能讓智能體在探索各種修圖動作時獲得即時的、方向正確的反饋從而快速學習到高效的修圖策略。2.4 工具集智能體的“雙手”智能體再聰明也需要具體的工具來操作像素。RetouchIQ需要集成一個豐富、可靠且可編程的圖像處理工具庫。這些工具應該覆蓋修圖的主要方面基礎調(diào)整亮度、對比度、飽和度、色溫、色調(diào)。色彩處理曲線、色階、色彩平衡、LUT應用。局部修復修復畫筆、克隆圖章、內(nèi)容識別填充可能需要接入Inpainting模型。濾鏡與效果模糊高斯、鏡頭、銳化、降噪、風格化。構圖調(diào)整裁剪、旋轉(zhuǎn)、透視校正。高級增強超分辨率、去模糊、HDR合成通常調(diào)用專用AI模型。這些工具需要被封裝成具有統(tǒng)一API的函數(shù)方便智能體以代碼調(diào)用的方式去執(zhí)行。工具的質(zhì)量和多樣性直接決定了智能體能力的天花板。3. 實現(xiàn)流程與關鍵技術細節(jié)理解了架構我們來看看如何一步步實現(xiàn)這樣一個系統(tǒng)。這里我會結(jié)合常見的開源工具和可行的技術路徑勾勒出一個實操框架。3.1 環(huán)境搭建與核心模型選型首先需要搭建基礎環(huán)境。推薦使用Python作為主要開發(fā)語言并利用PyTorch或TensorFlow深度學習框架。第一步選擇并部署MLLM。這是整個系統(tǒng)的核心。目前開源社區(qū)有一些強大的MLLM可供選擇例如LLaVA一個將視覺編碼器如CLIP的ViT與大型語言模型如Vicuna連接起來的流行方案。它通過投影層將視覺特征對齊到語言模型的詞嵌入空間實現(xiàn)圖文對話。它的優(yōu)點是架構相對清晰社區(qū)活躍易于微調(diào)。Qwen-VL或InternLM-XComposer國內(nèi)團隊推出的優(yōu)秀多模態(tài)模型在中文理解和細節(jié)感知上可能有優(yōu)勢?;陂_源大語言模型自行構建如果你有更強的定制需求可以選用像Mistral、Gemma或Qwen這樣的純語言模型作為基座然后接入一個視覺編碼器如OpenAI CLIP的ViT-L/14自己訓練連接層。這種方式靈活性最高但訓練成本和數(shù)據(jù)要求也最大。在項目中你需要將選定的MLLM部署為一個服務它能夠接收圖片和文本輸出對圖片的描述、對指令的解析以及初步的任務規(guī)劃文本。第二步構建圖像處理工具庫。你可以創(chuàng)建一個Python類將各種圖像處理操作封裝起來。例如class ImageEditingToolkit: def __init__(self): pass def adjust_brightness(self, image_pil, delta): 調(diào)整亮度delta范圍通常為[-100, 100] # 使用PIL或OpenCV實現(xiàn) enhancer ImageEnhance.Brightness(image_pil) return enhancer.enhance(1.0 delta/100.0) def apply_gaussian_blur(self, image_pil, radius, maskNone): 應用高斯模糊radius為半徑 if mask: # 實現(xiàn)蒙版模糊更復雜但更精準 blurred image_pil.filter(ImageFilter.GaussianBlur(radius)) # 將原圖與模糊圖根據(jù)mask合成 return Image.composite(blurred, image_pil, mask) else: return image_pil.filter(ImageFilter.GaussianBlur(radius)) def crop_with_aspect_ratio(self, image_pil, target_ratio): 按目標寬高比裁剪如2.35 width, height image_pil.size target_width height * target_ratio # 計算裁剪區(qū)域保持居中 left (width - target_width) / 2 top 0 right left target_width bottom height return image_pil.crop((left, top, right, bottom)) # 更多工具方法...第三步設計智能體執(zhí)行循環(huán)。這是將大腦MLLM和雙手工具庫連接起來的邏輯。一個簡化的循環(huán)代碼如下def agent_editing_loop(original_image, user_instruction, mllm_client, toolkit, max_steps10): current_image original_image history [] # 記錄動作歷史用于調(diào)試和后續(xù)學習 for step in range(max_steps): # 1. 感知與思考詢問MLLM下一步該做什么 prompt f 你是一個AI修圖師。當前圖片狀態(tài)如下。用戶指令是{user_instruction}。 你已經(jīng)完成的操作歷史{history}。 請分析當前圖片與目標之間的差距并決定下一步最適合的一個修圖動作。 只輸出一個JSON格式的動作例如{{tool: crop, params: {{aspect_ratio: 2.35}}}} 或 {{tool: adjust_brightness, params: {{delta: 15}}}}。 如果認為已經(jīng)滿足用戶指令則輸出{{tool: stop, params: {{}}}}。 # 將current_image轉(zhuǎn)換為base64或路徑與prompt一起發(fā)送給MLLM服務 mllm_response mllm_client.query(imagecurrent_image, textprompt) # 解析MLLM的響應提取出動作JSON action parse_json_from_response(mllm_response) if action[tool] stop: print(智能體認為修圖完成。) break # 2. 行動調(diào)用工具 tool_name action[tool] params action[params] if hasattr(toolkit, tool_name): try: current_image getattr(toolkit, tool_name)(current_image, **params) history.append(action) # 記錄成功動作 print(f步驟{step1}: 成功執(zhí)行 {tool_name} with {params}) except Exception as e: print(f步驟{step1}: 執(zhí)行 {tool_name} 失敗錯誤{e}) # 可以將錯誤信息反饋給MLLM讓其重新規(guī)劃 else: print(f步驟{step1}: 未知工具 {tool_name}) # 3. 可選評估使用獎勵模型對current_image打分如果分數(shù)足夠高也可以提前停止 # reward reward_model.predict(original_image, current_image, user_instruction) # if reward threshold: break return current_image, history3.2 通用獎勵模型的訓練策略訓練一個通用的獎勵模型是項目中最具研究性質(zhì)的部分。一個實用的方法是采用對比學習。數(shù)據(jù)收集這是最關鍵的步驟。你需要構建一個包含三元組的數(shù)據(jù)集(原始圖片 修改后圖片A 修改后圖片B 用戶指令 人類偏好標簽)。其中標簽指示對于該指令圖片A和圖片B哪個更好??梢酝ㄟ^以下方式收集合成數(shù)據(jù)對同一張原圖用不同的參數(shù)或工具鏈自動生成多個修改版本并讓一個“規(guī)則裁判”生成偏好例如對于“提亮”指令亮度更高的版本獲勝。但這只能模擬簡單指令。眾包數(shù)據(jù)在平臺上發(fā)布任務給定原圖和指令展示兩個由不同方法或不同參數(shù)生成的修圖結(jié)果讓標注者選擇更優(yōu)的一個。這是獲取高質(zhì)量人類偏好的主要途徑但成本高昂。利用現(xiàn)有模型生成使用不同的圖像編輯模型如SDEdit, InstructPix2Pix對同一指令生成多個結(jié)果再用一個較強的評價模型如HPSv2 一個用于評估文本-圖像對齊度的模型進行初篩獲得初步的偏好對再進行人工校驗可以降低成本。模型架構通常選擇一個強大的視覺-語言模型作為基礎例如CLIP的變體或BLIP-2。模型需要同時編碼指令文本和圖片。一種常見的做法是將指令文本和圖片分別通過文本編碼器和圖像編碼器得到特征向量。將兩個特征向量融合如拼接或相加。通過一個多層感知機MLP將融合后的特征映射到一個標量分數(shù)。模型結(jié)構相對簡單關鍵在于基礎編碼器的能力和高質(zhì)量的訓練數(shù)據(jù)。訓練目標使用Bradley-Terry模型等成對比較學習目標。對于一對結(jié)果(A, B)假設人類認為A優(yōu)于B的概率與兩者獎勵分數(shù)之差有關P(A B) σ(r(A) - r(B))其中σ是sigmoid函數(shù)r(·)是獎勵模型預測的分數(shù)。訓練時我們最大化觀測到的偏好順序的似然概率。損失函數(shù)通常為二元交叉熵損失。迭代精煉可以先訓練一個初始的獎勵模型然后用它來輔助篩選眾包數(shù)據(jù)或評估智能體生成的結(jié)果再用新數(shù)據(jù)繼續(xù)訓練模型形成一個數(shù)據(jù)飛輪逐步提升獎勵模型的準確性和泛化能力。實操心得獎勵模型的訓練數(shù)據(jù)質(zhì)量遠大于數(shù)量。1000個高質(zhì)量、標注一致的人類偏好對可能比10萬個噪聲大的合成數(shù)據(jù)對更有用。在標注時一定要給標注者清晰的評判標準例如優(yōu)先滿足指令的哪些方面審美和指令忠實度如何權衡并設置質(zhì)量控制問題。3.3 智能體的訓練與優(yōu)化有了MLLM、工具集和獎勵模型就可以訓練智能體了。這里通常采用強化學習Reinforcement Learning, RL框架特別是近端策略優(yōu)化PPO這類算法因為動作空間調(diào)用不同工具和參數(shù)是離散且高維的。狀態(tài)State當前圖片的視覺特征由MLLM的視覺編碼器提取和指令的文本嵌入的融合表示。也可以包含最近幾步的動作歷史。動作Action智能體可執(zhí)行的操作是一個離散集合。例如{‘crop_2.35‘, ‘crop_1.85‘, ‘brightness_up_10‘, ‘brightness_down_10‘, ‘a(chǎn)pply_lut_teal‘, ‘a(chǎn)pply_lut_warm‘, ..., ‘stop‘}。為了處理連續(xù)參數(shù)如亮度調(diào)整的具體數(shù)值可以將其離散化為幾個檔位或者使用動作參數(shù)化的Actor-Critic架構。策略網(wǎng)絡Policy Network通常就是MLLM本身或者是在MLLM的頂層接一個輕量級的策略頭。它接收狀態(tài)輸出每個動作的概率分布。獎勵Reward每一步動作后將修改后的圖片和原始指令輸入通用獎勵模型得到一個獎勵分數(shù)。此外可以設計一些塑形獎勵Shaped Reward來加速學習例如如果動作是‘stop‘則給予一個基于最終圖片得分的額外獎勵如果執(zhí)行了無效或破壞性的動作如將圖片全黑則給予負獎勵。訓練循環(huán)智能體在大量不同的圖片 指令對上與環(huán)境即工具集交互生成許多軌跡狀態(tài)-動作-獎勵序列。利用PPO算法根據(jù)這些軌跡計算優(yōu)勢函數(shù)更新策略網(wǎng)絡的參數(shù)目標是最大化累積獎勵的期望。為了防止智能體學到“捷徑”或奇怪的行為比如對所有圖片都執(zhí)行同樣的幾個動作來獲得一個平均不錯的獎勵需要確保訓練指令的多樣性并在獎勵函數(shù)中考慮結(jié)果的多樣性。一個更高效的訓練范式是離線強化學習或模仿學習。我們可以先收集一些專家演示數(shù)據(jù)例如記錄人類修圖師在給定指令下操作軟件的過程并將其轉(zhuǎn)化為工具調(diào)用序列用這些數(shù)據(jù)對智能體進行預訓練行為克隆然后再用在線RL進行微調(diào)優(yōu)化。這比完全從零開始的RL要穩(wěn)定和快速得多。4. 潛在挑戰(zhàn)與實戰(zhàn)避坑指南在實際構建RetouchIQ這類系統(tǒng)的過程中你會遇到許多預料之中和預料之外的挑戰(zhàn)。以下是我根據(jù)經(jīng)驗總結(jié)的幾個關鍵難點和應對策略。4.1 MLLM的“幻覺”與規(guī)劃錯誤MLLM在解析復雜、模糊的指令時很容易產(chǎn)生“幻覺”即生成看似合理但實際錯誤或無法執(zhí)行的計劃。例如指令是“讓這個人看起來更開心”MLLM可能會規(guī)劃“調(diào)整嘴角曲線的控制點”這種在現(xiàn)有工具集中根本不存在的超精細操作。應對策略工具描述規(guī)范化在給MLLM的提示詞Prompt中清晰、嚴格地定義可用的工具列表、每個工具的功能、輸入?yún)?shù)格式和取值范圍。讓MLLM只在“工具箱”里選擇。分步驗證與回退不要一次性讓MLLM生成冗長的計劃。采用單步?jīng)Q策循環(huán)每執(zhí)行一步都將當前結(jié)果和狀態(tài)反饋給MLLM讓它決定下一步。當它提出一個無效動作時系統(tǒng)可以捕獲異常并將錯誤信息如“工具‘reshape_mouth’不存在”反饋給MLLM要求它重新規(guī)劃。這增加了系統(tǒng)的魯棒性。思維鏈Chain-of-Thought提示在Prompt中要求MLLM“先描述你對圖片和指令的理解再逐步推理需要哪些修改最后輸出具體動作”。這有助于將它的思考過程外化方便調(diào)試有時也能減少錯誤。后處理與過濾對MLLM輸出的動作進行規(guī)則檢查。例如檢查參數(shù)是否在合理范圍內(nèi)檢查連續(xù)動作是否矛盾如先裁剪掉某個區(qū)域又試圖對該區(qū)域進行局部修復。4.2 獎勵模型的“對齊”難題獎勵模型是智能體的“老師”如果老師的評判標準有問題學生就會學歪。常見問題有獎勵黑客Reward Hacking智能體發(fā)現(xiàn)獎勵模型的漏洞通過一些與指令無關但能取悅獎勵模型的方式獲得高分。例如獎勵模型可能偏愛高飽和度圖片那么無論什么指令智能體都瘋狂拉高飽和度。分布外泛化差對于訓練數(shù)據(jù)中未出現(xiàn)過的指令類型或圖片風格獎勵模型的打分可能完全不可靠。應對策略多樣化且高質(zhì)量的訓練數(shù)據(jù)這是根本。確保數(shù)據(jù)覆蓋盡可能多的指令類型全局調(diào)整、局部修改、風格遷移、對象移除等和圖片類別。標注時對于模糊指令要明確標注側(cè)重點。集成多個獎勵信號不要只依賴一個通用獎勵模型。可以結(jié)合多個專項獎勵例如指令遵循度獎勵使用一個文本-圖像匹配模型如CLIP計算修圖后圖片與指令的相似度。圖像質(zhì)量獎勵使用一個無參考圖像質(zhì)量評估模型如NIQE, BRISQUE或基于學習的模型確保輸出圖片沒有嚴重失真、噪聲或偽影。保真度獎勵計算修圖前后圖片在關鍵區(qū)域如人臉的感知相似度如LPIPS防止智能體做出過度、扭曲的修改。 最終的獎勵可以是這些獎勵的加權和R_total w1 * R_instruction w2 * R_quality w3 * R_fidelity w4 * R_generalist。這能更全面地引導智能體。對抗性數(shù)據(jù)挖掘在RL訓練過程中主動尋找那些能獲得高獎勵但人類認為不好的樣例將其加入獎勵模型的訓練集進行再訓練逐步修補漏洞。4.3 工具集的完備性與可靠性智能體的能力受限于工具集。如果工具集無法實現(xiàn)“讓天空更藍”中的“選擇天空”這一局部調(diào)整智能體再聰明也無能為力。應對策略分層工具設計提供不同粒度的工具。既有全局調(diào)整工具亮度、對比度也有基于語義分割的局部工具。例如集成一個強大的分割模型如SAM先調(diào)用segment(‘sky‘)工具獲取天空蒙版再調(diào)用adjust_hsv(mask, hue_shift, saturation_delta)工具對蒙版區(qū)域進行調(diào)整。擁抱AI子模型將最新的圖像生成/編輯模型作為“超級工具”集成進來。例如對于“把圖中的椅子換成沙發(fā)”這種涉及內(nèi)容生成的復雜指令可以直接調(diào)用如InstructPix2Pix或Diffusion-based的編輯模型。智能體的角色退化為“路由決策者”判斷當前指令是否需要、以及何時調(diào)用這些重型生成模型。工具執(zhí)行穩(wěn)定性圖像處理庫的函數(shù)對輸入非常敏感如圖片模式、尺寸、數(shù)值范圍。必須對每個工具函數(shù)進行嚴格的輸入驗證和異常處理確保在任何情況下都不會導致整個系統(tǒng)崩潰而是返回一個友好的錯誤信息供智能體或上層系統(tǒng)處理。4.4 計算成本與延遲一個完整的RetouchIQ系統(tǒng)涉及多個大型模型MLLM、獎勵模型、可能還有分割/生成模型的推理每一步交互都可能需要數(shù)秒甚至更長時間無法滿足實時交互的需求。應對策略模型輕量化與優(yōu)化對MLLM和獎勵模型進行量化INT8、剪枝或知識蒸餾在精度損失可接受的前提下大幅提升推理速度??梢钥紤]使用更小的、專門為任務微調(diào)過的模型而非最大的通用模型。異步執(zhí)行與緩存對于非實時的批量修圖任務可以采用異步隊列處理。對于常見指令和相似圖片可以緩存最終的修圖動作序列或結(jié)果下次直接調(diào)用。邊緣計算與云協(xié)同將輕量級的決策模型如一個小型策略網(wǎng)絡部署在本地或邊緣設備負責處理簡單指令和常用操作。只有遇到復雜指令時才請求云端的大型MLLM和生成模型。這需要在智能體架構設計時就考慮分層決策機制。構建RetouchIQ這樣的系統(tǒng)是一個典型的“系統(tǒng)工程”它考驗的不僅是對單個AI模型的理解更是對多個組件協(xié)同工作、以及如何將抽象研究問題落地為穩(wěn)定可靠應用的全局把控能力。從MLLM的提示工程到獎勵模型的數(shù)據(jù)構建再到強化學習智能體的調(diào)參每一步都有無數(shù)的細節(jié)需要打磨。但它的前景是激動人心的——一個真正能聽懂人話、看懂圖片、并幫你完成復雜后期工作的AI伙伴正在從研究論文走向現(xiàn)實。