騰訊機(jī)器人X團(tuán)隊(duì)打造“會(huì)思考也會(huì)想象“的機(jī)器人大腦——RxBrain
這項(xiàng)由騰訊機(jī)器人X團(tuán)隊(duì)、富田實(shí)驗(yàn)室與騰訊混元團(tuán)隊(duì)聯(lián)合發(fā)布的研究于2026年7月15日以預(yù)印本形式公開論文編號(hào)為arXiv:2607.14187。感興趣的讀者可以通過該編號(hào)在arXiv平臺(tái)查閱完整論文。**研究概要**教一個(gè)機(jī)器人完成任務(wù)遠(yuǎn)比教一個(gè)孩子學(xué)騎自行車難得多。孩子看幾次示范就能理解要向前踏、要保持平衡而機(jī)器人往往需要被明確告知每一個(gè)步驟甚至需要提前想象自己完成任務(wù)之后周圍世界會(huì)變成什么樣子。這種既能規(guī)劃步驟、又能在腦海中預(yù)見結(jié)果的能力正是人類與目前大多數(shù)機(jī)器人之間最本質(zhì)的差距之一。騰訊這支聯(lián)合團(tuán)隊(duì)提出了一個(gè)名為**Hy-Embodied-RxBrain**簡(jiǎn)稱RxBrain的具身認(rèn)知基礎(chǔ)模型目標(biāo)是讓機(jī)器人在制定行動(dòng)計(jì)劃時(shí)不僅能用語言描述第一步做什么、第二步做什么還能同時(shí)在腦海中生成每一步執(zhí)行完成后世界應(yīng)該是什么樣子的畫面——就像一個(gè)有經(jīng)驗(yàn)的廚師不僅知道菜譜上寫著先把洋蔥炒軟還能在動(dòng)手之前就清晰地預(yù)見到鍋里金黃透明的洋蔥應(yīng)該呈現(xiàn)出什么狀態(tài)。這項(xiàng)研究的核心突破在于它是業(yè)界首次將語言推理與視覺想象真正耦合在同一個(gè)規(guī)劃序列中的具身認(rèn)知模型而非讓兩者分別工作后再拼合結(jié)果。---**一、為什么機(jī)器人既要說也要想**現(xiàn)有的機(jī)器人智能系統(tǒng)大致分成兩個(gè)陣營。一類是視覺語言模型它們擅長理解眼前的畫面、聽懂人類指令、分解任務(wù)步驟能用語言告訴機(jī)器人先拿起杯子再把杯子放到托盤上。這類模型的短板是它們描述計(jì)劃時(shí)完全停留在語言層面對(duì)于拿起杯子之后世界應(yīng)該長什么樣缺乏明確的視覺預(yù)見就像一個(gè)從未下過廚房的人照著菜譜念步驟卻沒見過食物完成時(shí)應(yīng)有的樣子。另一類是生成式世界模型它們善于預(yù)測(cè)動(dòng)作執(zhí)行后的畫面能生成機(jī)器手臂伸過去抓住杯子后的視頻片段。但這類模型通常不擅長進(jìn)行因果推理、理解約束條件或進(jìn)行長程的邏輯規(guī)劃更像是一臺(tái)擅長渲染畫面的攝影機(jī)卻沒有導(dǎo)演的腳本意識(shí)。RxBrain的思路是讓語言和視覺像樂隊(duì)里的指揮和樂手一樣配合工作。語言負(fù)責(zé)告訴機(jī)器人整首曲子的結(jié)構(gòu)——哪一段先演奏、哪里要停頓、整體節(jié)奏是什么視覺想象則負(fù)責(zé)把每一段旋律奏出來讓抽象的樂譜變成實(shí)實(shí)在在的聲音。在RxBrain的規(guī)劃序列中語言描述行動(dòng)步驟、約束條件和決策邏輯而視覺想象則為每一個(gè)步驟生成對(duì)應(yīng)的世界狀態(tài)圖——執(zhí)行完這步之后眼前的場(chǎng)景應(yīng)該是什么樣子。兩者互為補(bǔ)充缺一不可。---**二、RxBrain的大腦結(jié)構(gòu)是怎么搭建的**RxBrain建立在一種叫做**混合變換器架構(gòu)**Mixture-of-Transformers簡(jiǎn)稱MoT的技術(shù)框架上。普通讀者可以把這個(gè)架構(gòu)理解為一座分工明確的大型辦公樓樓里有專門處理文字的部門、專門理解圖片的部門、專門生成圖片的部門但這三個(gè)部門共享同一套會(huì)議室——也就是說不同部門之間可以充分交流信息但各自的專業(yè)工作又不會(huì)相互干擾。具體來說RxBrain包含三類主要工作單元。語言變換器負(fù)責(zé)處理所有文字包括理解人類指令和生成規(guī)劃步驟的文字描述視覺變換器負(fù)責(zé)理解輸入的圖像和視頻理解和生成的視覺內(nèi)容共享同一套注意力機(jī)制可以理解為它們看同一套信息但用不同的方式處理同時(shí)各自有獨(dú)立的前饋網(wǎng)絡(luò)相當(dāng)于各自的專屬處理流水線此外還有一個(gè)專門負(fù)責(zé)視覺生成的模塊它的處理容量特意做得更大——中間層寬度從6144擴(kuò)展到12288——因?yàn)閼{空生成一張有意義的畫面比理解一張已有的畫面更具挑戰(zhàn)性。整個(gè)模型共有62億個(gè)參數(shù)其中語言理解和視覺理解各約15億視覺生成模塊約24億其余分布在共享模塊和外圍組件中。視覺內(nèi)容的生成采用了來自FLUX模型的凍結(jié)VAE變分自動(dòng)編碼器作為圖像的編碼和解碼工具可以理解為一個(gè)專業(yè)的圖像壓縮與還原機(jī)器負(fù)責(zé)在模型內(nèi)部表示和最終輸出圖像之間架橋。為了讓模型在生成規(guī)劃序列時(shí)既能保持因果邏輯先發(fā)生的影響后發(fā)生的又能讓同一張圖片內(nèi)部的信息充分交流RxBrain設(shè)計(jì)了一套混合注意力機(jī)制處理文字時(shí)用因果注意力只看之前的內(nèi)容處理圖片時(shí)在每張圖片內(nèi)部用雙向注意力圖片內(nèi)所有位置互相參考跨圖片之間仍保持因果順序。這就像一本故事書同一頁內(nèi)的插圖細(xì)節(jié)可以互相對(duì)照但后面的頁面不能劇透前面的內(nèi)容。---**三、RxBrain如何生成文字畫面交織的計(jì)劃**RxBrain支持三種輸出模式對(duì)應(yīng)具身任務(wù)中的不同需求。第一種是純文字生成模式用于回答關(guān)于當(dāng)前場(chǎng)景的問題或輸出語言形式的規(guī)劃步驟。機(jī)器人看到眼前的場(chǎng)景后通過標(biāo)準(zhǔn)的逐詞生成方式輸出文字答案或行動(dòng)指令。第二種是多幀視頻預(yù)測(cè)模式用于預(yù)測(cè)執(zhí)行某個(gè)動(dòng)作后接下來四幀畫面會(huì)是什么樣子。這四幀畫面并行生成而非一幀一幀串行大幅提升效率同時(shí)幀間保持因果順序也就是越后面的幀可以參考越早的幀但不能看到未來。這就像同時(shí)制作四格漫畫的四個(gè)格子每個(gè)格子的畫師都能看到前面格子已經(jīng)畫好的內(nèi)容但不能偷看后面格子。第三種是交錯(cuò)生成模式這也是RxBrain最核心的能力所在。在這種模式下模型輸出的是一個(gè)語言與圖像交替出現(xiàn)的完整規(guī)劃序列先生成第一步的文字描述再生成對(duì)應(yīng)的目標(biāo)狀態(tài)圖像然后把這張生成的圖像重新看一遍作為上下文輸入再生成第二步的文字再生成第二步的畫面……如此循環(huán)直到任務(wù)完成。關(guān)鍵的設(shè)計(jì)細(xì)節(jié)在于在訓(xùn)練時(shí)模型看到的上一步生成的圖像不是直接拿來的原圖而是經(jīng)過了生成→解碼→重新編碼這一完整流程處理過的圖像。這么做是為了讓訓(xùn)練時(shí)和真正推理時(shí)的體驗(yàn)盡量一致——因?yàn)樵趯?shí)際使用時(shí)上一步的圖像確實(shí)是模型自己生成的而不是來自真實(shí)世界的照片。這個(gè)細(xì)節(jié)減少了訓(xùn)練和推理之間的期望差距讓交錯(cuò)生成的質(zhì)量更加穩(wěn)定。---**四、用五萬小時(shí)視頻訓(xùn)練出計(jì)劃感**要讓RxBrain學(xué)會(huì)這種語言加視覺的聯(lián)合規(guī)劃能力需要大量帶有每一步動(dòng)作配對(duì)對(duì)應(yīng)狀態(tài)變化畫面的訓(xùn)練數(shù)據(jù)。然而現(xiàn)有的數(shù)據(jù)集幾乎沒有這種格式——大多數(shù)機(jī)器人數(shù)據(jù)只有動(dòng)作指令或只有連續(xù)視頻沒有把兩者精確對(duì)齊起來。為此研究團(tuán)隊(duì)設(shè)計(jì)了一套全自動(dòng)的數(shù)據(jù)構(gòu)建流水線把原始具身任務(wù)視頻轉(zhuǎn)化為文字畫面配對(duì)的聯(lián)合規(guī)劃訓(xùn)練樣本。原始視頻數(shù)據(jù)來自四大類來源真實(shí)機(jī)器人操作數(shù)據(jù)約17292小時(shí)、UMI手持夾持器采集數(shù)據(jù)約17506小時(shí)、仿真環(huán)境數(shù)據(jù)約1317小時(shí)、以及第一人稱人類日常操作視頻約14062小時(shí)。總計(jì)超過5萬小時(shí)包含約2150萬個(gè)可用片段通過約2861萬個(gè)候選片段篩選而來通過率約75%。這條流水線分三個(gè)階段。第一階段是時(shí)序片段標(biāo)注系統(tǒng)先對(duì)視頻進(jìn)行關(guān)鍵幀采樣——不是均勻采樣而是優(yōu)先選取畫面變化最明顯的時(shí)刻就像一本菜譜只需要在每道工序最關(guān)鍵的時(shí)刻拍一張照片而不是每秒都拍。采樣完成后用一個(gè)多模態(tài)大語言模型對(duì)視頻進(jìn)行整體理解提出候選動(dòng)作步驟列表每個(gè)步驟包含一個(gè)簡(jiǎn)短名稱、詳細(xì)描述以及在關(guān)鍵幀序列中對(duì)應(yīng)的粗略起止位置。隨后系統(tǒng)在粗略范圍附近密集采樣用模型精確定位每個(gè)步驟的真實(shí)開始幀和結(jié)束幀。第二階段是質(zhì)量驗(yàn)證對(duì)每一個(gè)標(biāo)注出來的片段系統(tǒng)自動(dòng)檢查它是否符合高質(zhì)量訓(xùn)練樣本的標(biāo)準(zhǔn)。檢查項(xiàng)涵蓋三大類語義質(zhì)量這個(gè)片段是否只包含一個(gè)清晰的原子動(dòng)作操作目標(biāo)是否清晰可見畫面是否有水印遮擋文字描述是否準(zhǔn)確匹配畫面動(dòng)作是否真實(shí)發(fā)生兩幀錨點(diǎn)是否都可讀、視覺接地性手或夾持器是否可見機(jī)器手臂是否可見目標(biāo)物體是否有意外消失、以及一致性兩幀是否在同一場(chǎng)景相機(jī)視角是否穩(wěn)定畫面朝向是否正常描述與視覺變化是否一致手的變化是否在文字中有所體現(xiàn)。如果畫面變化有效但文字描述有誤系統(tǒng)會(huì)自動(dòng)修正文字而不是直接丟棄這個(gè)片段。最終約75%的候選片段通過了質(zhì)量驗(yàn)證。第三階段是片段結(jié)構(gòu)化把通過質(zhì)量驗(yàn)證的片段組織成四個(gè)層級(jí)的訓(xùn)練任務(wù)。最基礎(chǔ)的L0層是單步預(yù)測(cè)輸入一步的起始畫面和動(dòng)作描述預(yù)測(cè)這步結(jié)束時(shí)的畫面L1層是步驟級(jí)聯(lián)合規(guī)劃給定視覺上下文和目標(biāo)條件模型輸出一系列步驟文字及其對(duì)應(yīng)的結(jié)束畫面L2層是子目標(biāo)規(guī)劃把若干步驟合并為更高層次的子目標(biāo)每個(gè)子目標(biāo)配有邊界畫面L3層是最終狀態(tài)想象只給初始畫面和任務(wù)描述讓模型直接預(yù)測(cè)整個(gè)任務(wù)完成時(shí)的最終畫面。這四個(gè)層級(jí)從局部到全局讓模型學(xué)會(huì)在不同粒度上進(jìn)行聯(lián)合規(guī)劃。---**五、分兩階段訓(xùn)練先打基礎(chǔ)再專攻具身**RxBrain的訓(xùn)練采用兩階段課程式策略可以類比為先上通識(shí)課、再上專業(yè)課。第一階段是聯(lián)合視覺語言預(yù)訓(xùn)練訓(xùn)練數(shù)據(jù)由兩大部分混合而成60%是大規(guī)模圖文對(duì)來自LAION和COYO數(shù)據(jù)集共約2億條40%是多模態(tài)指令跟隨數(shù)據(jù)來自LLaVA-OneVision和MAmmoTH共約1.13億條。這一階段的核心目標(biāo)是讓模型同時(shí)學(xué)會(huì)理解圖像和生成圖像在一個(gè)共享的表示空間中把語言、視覺感知和視覺生成統(tǒng)一起來同時(shí)保留大語言模型原有的語言能力。圖像生成目標(biāo)損失權(quán)重設(shè)置相對(duì)更高λ1.0語言生成權(quán)重相對(duì)較低λ0.25這是因?yàn)橐曈X生成能力需要從頭建立而語言能力已有良好基礎(chǔ)。第二階段是具身監(jiān)督微調(diào)從第一階段的檢查點(diǎn)繼續(xù)訓(xùn)練訓(xùn)練數(shù)據(jù)混合了六類內(nèi)容總計(jì)約422份的混合比例一般圖文對(duì)T2I基礎(chǔ)數(shù)據(jù)和高質(zhì)量圖文對(duì)合計(jì)約25.9%、通用多模態(tài)理解數(shù)據(jù)34.6%、具身多幀世界模型數(shù)據(jù)16.2%、具身交錯(cuò)規(guī)劃數(shù)據(jù)20.8%。這一階段兩類損失權(quán)重相等均為1.0讓語言推理和視覺生成在具身任務(wù)上協(xié)同提升。訓(xùn)練時(shí)使用了最高368塊GPU即46個(gè)8卡節(jié)點(diǎn)全局批量大小7360第二階段使用312塊GPU39個(gè)節(jié)點(diǎn)全局批量3120。兩階段均使用AdamW優(yōu)化器、余弦學(xué)習(xí)率調(diào)度和bf16精度圖像生成分辨率上限256像素通過16倍下采樣的VAE進(jìn)行潛變量操作。---**六、RxBrain-Bench專門評(píng)測(cè)聯(lián)合規(guī)劃能力的新基準(zhǔn)**為了衡量模型是否真正掌握了語言視覺聯(lián)合規(guī)劃的能力研究團(tuán)隊(duì)專門構(gòu)建了一個(gè)新的評(píng)測(cè)基準(zhǔn)**RxBrain-Bench**。這個(gè)基準(zhǔn)分三個(gè)評(píng)測(cè)賽道。第一個(gè)賽道叫具身視覺問答EVQA評(píng)測(cè)模型能否從視覺觀察中理解具身場(chǎng)景并作出任務(wù)相關(guān)的決策。題目來自工業(yè)、零售和服務(wù)等真實(shí)商業(yè)場(chǎng)景涵蓋高層規(guī)劃把任務(wù)分解為可執(zhí)行步驟、模擬推進(jìn)規(guī)劃在多輪交互中根據(jù)中間狀態(tài)更新后續(xù)決策、細(xì)粒度步驟推理抓取點(diǎn)、運(yùn)動(dòng)軌跡、動(dòng)作選擇、時(shí)序判斷、多視角觀察、錯(cuò)誤恢復(fù)識(shí)別異常狀態(tài)并選擇正確應(yīng)對(duì)方式、以及任務(wù)完成判斷判斷當(dāng)前狀態(tài)是否滿足目標(biāo)。共1123道多選題加258道模擬規(guī)劃題總計(jì)1381個(gè)評(píng)測(cè)項(xiàng)目。第二個(gè)賽道叫世界狀態(tài)預(yù)測(cè)WorldPred評(píng)測(cè)模型在給定當(dāng)前觀察和自然語言動(dòng)作指令后能否生成描述動(dòng)作結(jié)果的短時(shí)序畫面4幀。評(píng)測(cè)標(biāo)準(zhǔn)包含五個(gè)維度觀察連續(xù)性生成的第一幀是否自然延續(xù)當(dāng)前觀察、動(dòng)作正確性生成的幀序列是否執(zhí)行了正確的動(dòng)作、目標(biāo)完成度最終幀是否達(dá)到了任務(wù)暗示的目標(biāo)狀態(tài)、時(shí)序物理合理性幀間運(yùn)動(dòng)是否流暢且物理上合理、以及與真實(shí)軌跡的匹配度最終加權(quán)得分為這五項(xiàng)的線性組合。第三個(gè)賽道叫聯(lián)合規(guī)劃JointPlan也是RxBrain-Bench最核心的部分評(píng)測(cè)模型能否在完全自回歸的閉環(huán)推演中進(jìn)行語言加視覺的聯(lián)合規(guī)劃。模型在每一步都必須輸出自然語言子步驟描述和對(duì)應(yīng)的目標(biāo)畫面然后以自己生成的畫面作為下一步的輸入繼續(xù)規(guī)劃直到任務(wù)完成。評(píng)測(cè)標(biāo)準(zhǔn)包含六個(gè)維度觀察理解、子任務(wù)規(guī)劃、目標(biāo)圖像正確性、子任務(wù)與目標(biāo)的一致性、完整鏈條的完成度、以及圖像相似度用DINO特征的余弦相似度衡量生成畫面與真實(shí)目標(biāo)畫面的接近程度加權(quán)得分覆蓋這六個(gè)方面。---**七、評(píng)測(cè)結(jié)果在多個(gè)維度上表現(xiàn)出色**在通用圖像生成能力方面RxBrain在GenEval基準(zhǔn)上獲得82.4分與專門針對(duì)圖像生成優(yōu)化的BAGEL模型82分基本持平明顯高于同樣具備生成能力的Cosmos-3-Nano模型71.68分。這說明RxBrain在擴(kuò)展到具身任務(wù)的同時(shí)并沒有犧牲其通用圖像生成能力。在具身與空間理解方面RxBrain在多個(gè)公開基準(zhǔn)上處于前列。在CV-Bench上以88.59分排名第一在EmbSpatial上以82.3分緊追Cosmos-3-Nano82.1分的第二位在DA-2k深度感知理解上以83.4分排名第一。特別在多視角和三維理解領(lǐng)域RxBrain的優(yōu)勢(shì)最為突出在3DRSBench上以54.1分排名第一在MMSI-Bench多圖空間智能上以35.8分領(lǐng)先在MindCube空間心理建模上以47.5分名列前茅在SITE-Bench圖像空間理解上以54.9分居首。在機(jī)器人軌跡預(yù)測(cè)上Share-Robot-TrajectoryRxBrain以51.13分排名第一比此前最佳模型Cosmos-3-Nano的39.02分高出約12個(gè)百分點(diǎn)。在RoboSpatial-Home配置理解上以86.28分排名第一。不過在需要精確指點(diǎn)定位Pointing和機(jī)器人抓取位置預(yù)測(cè)Share-Robot-Affordance方面專門針對(duì)空間指向優(yōu)化的RoboBrain2.5模型仍然更強(qiáng)。在RxBrain-Bench-EVQA的自建評(píng)測(cè)中RxBrain綜合得分為72.7分低于Qwen3.5-4B的78.1分和Cosmos-3-Nano的76.7分但在成功檢測(cè)Success Detection85.1分和模擬規(guī)劃Simulation Planning51.6分兩個(gè)維度上表現(xiàn)最佳說明模型在判斷任務(wù)是否完成以及在多輪模擬中更新決策方面有獨(dú)特優(yōu)勢(shì)。主要差距集中在精細(xì)空間定位、軌跡與時(shí)序推理以及錯(cuò)誤恢復(fù)方面。在世界狀態(tài)預(yù)測(cè)WorldPred評(píng)測(cè)中RxBrain以0.62的綜合得分超越Cosmos-3-Nano0.591和Wan2.2-TI2V-5B0.429。觀察連續(xù)性得分0.67和動(dòng)作正確性得分0.65是最強(qiáng)項(xiàng)時(shí)序物理合理性0.53是最弱項(xiàng)說明生成畫面的物理連貫性仍有提升空間。在不同子數(shù)據(jù)集上的表現(xiàn)從UMI的0.73到arctic的0.35不等兩幀條件輸入的整體效果最佳。值得關(guān)注的是RxBrain雖然并非專門的視頻生成模型卻超過了專為具身世界建模設(shè)計(jì)且在大量視頻數(shù)據(jù)上預(yù)訓(xùn)練的Cosmos-3-Nano體現(xiàn)了統(tǒng)一模型架構(gòu)的優(yōu)勢(shì)。在聯(lián)合規(guī)劃JointPlan評(píng)測(cè)中RxBrain以0.68的綜合得分大幅領(lǐng)先所有基線Cosmos-3-Nano智能體得分0.521統(tǒng)一多模態(tài)模型BAGEL-7B-MoT得分0.503模塊化的Qwen-Agent得分0.431。具體來看觀察理解得分0.83和子任務(wù)規(guī)劃得分0.78是最強(qiáng)項(xiàng)目標(biāo)圖像正確性0.52是最弱項(xiàng)再次印證了語言推理能力強(qiáng)于視覺想象能力的規(guī)律。在不同規(guī)劃深度上兩步規(guī)劃得分0.69八步規(guī)劃得分降至0.55體現(xiàn)了長程推演中誤差累積的挑戰(zhàn)。RxBrain在子任務(wù)規(guī)劃和鏈條完成度上的領(lǐng)先優(yōu)勢(shì)最大說明它在保持整體計(jì)劃一致性方面具有明顯優(yōu)勢(shì)。---**八、從大腦到手臂擴(kuò)展到真實(shí)機(jī)器人動(dòng)作生成**RxBrain不只是一個(gè)能規(guī)劃的大腦研究團(tuán)隊(duì)還把它擴(kuò)展成能控制機(jī)器人手臂實(shí)際運(yùn)動(dòng)的系統(tǒng)。擴(kuò)展的方式是在原有的MoT架構(gòu)基礎(chǔ)上新增一個(gè)動(dòng)作專屬分支包含獨(dú)立的注意力投影層、前饋網(wǎng)絡(luò)和層歸一化但仍與語言、視覺和狀態(tài)的全局注意力共享信息交流。這個(gè)動(dòng)作分支的初始參數(shù)復(fù)制自視覺理解分支相當(dāng)于讓它從理解畫面的能力出發(fā)重新學(xué)習(xí)如何把理解轉(zhuǎn)化為動(dòng)作。一個(gè)特別設(shè)計(jì)的門控專家融合機(jī)制讓動(dòng)作分支能夠借用視覺生成分支中已經(jīng)學(xué)到的預(yù)測(cè)性和規(guī)劃性知識(shí)。具體來說動(dòng)作模塊的前饋網(wǎng)絡(luò)輸出等于動(dòng)作專屬前饋網(wǎng)絡(luò)的結(jié)果加上一個(gè)可學(xué)習(xí)的通道門控權(quán)重乘以視覺生成前饋網(wǎng)絡(luò)的結(jié)果。這個(gè)門控權(quán)重初始為零意味著訓(xùn)練開始時(shí)動(dòng)作模塊完全依靠自身隨著訓(xùn)練推進(jìn)門控權(quán)重逐漸學(xué)習(xí)到哪些視覺生成知識(shí)對(duì)動(dòng)作預(yù)測(cè)有幫助并選擇性地引入。這種設(shè)計(jì)讓動(dòng)作模塊不需要從零開始學(xué)習(xí)規(guī)劃性知識(shí)而是站在視覺生成模塊已有積累的肩膀上。動(dòng)作的表示方式是對(duì)于雙臂機(jī)器人每個(gè)機(jī)械手臂的末端執(zhí)行器狀態(tài)包含三維位置、四元數(shù)姿態(tài)和夾持器開合量共16維。本體感知狀態(tài)通過輕量級(jí)編碼器映射為單一狀態(tài)令牌未來H步的動(dòng)作塊通過流匹配Flow Matching在歸一化動(dòng)作空間中生成訓(xùn)練目標(biāo)是讓模型預(yù)測(cè)的速度場(chǎng)在去噪過程中準(zhǔn)確指向真實(shí)動(dòng)作方向。在真實(shí)機(jī)器人實(shí)驗(yàn)中研究團(tuán)隊(duì)選取了三個(gè)多階段家務(wù)操作任務(wù)進(jìn)行評(píng)測(cè)每個(gè)任務(wù)各進(jìn)行100次真機(jī)試驗(yàn)。在擺設(shè)餐桌任務(wù)中需要從架子上取出盤子、叉子和刀并按正確位置擺放RxBrain成功率97%超過π0的82%和π0.5的90%。在折疊收納眼鏡任務(wù)中需要折疊眼鏡腿并放入眼鏡盒RxBrain成功率95%超過π0的76%和π0.5的82%。在撿拾垃圾任務(wù)中需要先開垃圾桶蓋再將廢紙放入RxBrain成功率68%超過π0的46%但略低于π0.5的74%。三個(gè)任務(wù)的平均成功率為87%π0為68%π0.5為82%。需要特別指出的是這些結(jié)果是在沒有大規(guī)模動(dòng)作數(shù)據(jù)預(yù)訓(xùn)練的情況下取得的說明具身規(guī)劃預(yù)訓(xùn)練產(chǎn)生的世界知識(shí)確實(shí)能夠遷移到真實(shí)動(dòng)作控制中。---**九、讓推理速度跟上機(jī)器人的手速**在實(shí)驗(yàn)室里表現(xiàn)優(yōu)秀的模型在真正控制機(jī)器人時(shí)還面臨一個(gè)重要挑戰(zhàn)速度。如果模型每次預(yù)測(cè)動(dòng)作都需要很長時(shí)間機(jī)器人就會(huì)動(dòng)得磕磕絆絆就像一個(gè)總是猶豫半天才邁腿的人走路一樣。研究團(tuán)隊(duì)對(duì)實(shí)時(shí)部署進(jìn)行了專項(xiàng)加速優(yōu)化并堅(jiān)守一個(gè)底線所有優(yōu)化必須在數(shù)值上等價(jià)于原始模型也就是說機(jī)器人的軌跡不能因?yàn)榧铀俣l(fā)生任何可測(cè)量的變化。原始模型每幀推理需要210毫秒主要瓶頸出乎意料地不是矩陣乘法而是混合變換器架構(gòu)中的模態(tài)分發(fā)邏輯每一層都要重新計(jì)算哪些令牌屬于語言、哪些屬于視覺、哪些屬于動(dòng)作這個(gè)操作在一次前向傳播中觸發(fā)了約1091次nonzero調(diào)用累計(jì)占據(jù)174毫秒CPU時(shí)間再加上索引操作的48毫秒和拷貝操作的21毫秒。針對(duì)這個(gè)瓶頸研究團(tuán)隊(duì)實(shí)施了三項(xiàng)優(yōu)化預(yù)計(jì)算前綴鍵值緩存觀察幀和指令文字的上下文在動(dòng)作流匹配的多步去噪過程中是固定不變的可以只計(jì)算一次并復(fù)用僅對(duì)動(dòng)作令牌進(jìn)行快速解碼有了緩存之后每步去噪只需要處理16個(gè)動(dòng)作令牌而非989個(gè)前綴令牌加16個(gè)動(dòng)作令牌去同步化模態(tài)分發(fā)加CUDA圖捕獲把每層的令牌路由索引預(yù)計(jì)算好用gather和scatter替換布爾索引消除GPU與CPU之間的反復(fù)同步最后用CUDA圖固定整個(gè)解碼步驟以消除內(nèi)核啟動(dòng)開銷。三項(xiàng)優(yōu)化組合后推理延遲從210毫秒降至143毫秒提速約1.47倍同時(shí)位置誤差小于0.65毫米、姿態(tài)誤差小于0.73度完全處于bf16精度的舍入誤差范圍內(nèi)。---**研究的局限與未來方向**研究團(tuán)隊(duì)坦誠地指出了RxBrain目前存在的三個(gè)主要局限。第一模型規(guī)模相對(duì)較小62億參數(shù)可能限制了它處理高度復(fù)雜推理、精細(xì)視覺想象和長程規(guī)劃的能力擴(kuò)大模型和數(shù)據(jù)規(guī)模是顯然的改進(jìn)方向。第二雖然RxBrain能跨多種具身場(chǎng)景泛化但對(duì)于完全陌生的環(huán)境、機(jī)器人形態(tài)或任務(wù)領(lǐng)域仍然需要額外的微調(diào)才能達(dá)到理想性能。第三交錯(cuò)生成涉及兩種不同的生成范式文字的自回歸生成和圖像的流匹配生成訓(xùn)練和推理之間仍然存在一些差異盡管通過VAE重建傳遞的視覺狀態(tài)構(gòu)建策略已經(jīng)有所緩解但尚未引入強(qiáng)化學(xué)習(xí)或其他序列級(jí)優(yōu)化方法來進(jìn)一步對(duì)齊兩種模態(tài)的生成過程。未來團(tuán)隊(duì)計(jì)劃向兩個(gè)方向發(fā)力一是擴(kuò)大模型規(guī)模預(yù)期更大的模型將在聯(lián)合規(guī)劃的連貫性、世界狀態(tài)預(yù)測(cè)的準(zhǔn)確性和整體規(guī)劃能力上帶來系統(tǒng)性提升二是增強(qiáng)自主性讓模型更好地分解開放性任務(wù)、監(jiān)控執(zhí)行進(jìn)度、修正規(guī)劃并以更自主的方式與環(huán)境交互。---說到底R(shí)xBrain這項(xiàng)工作的意義在于它清晰地回答了一個(gè)問題一個(gè)能真正勝任復(fù)雜任務(wù)的機(jī)器人大腦需要的不僅僅是會(huì)說第一步做什么也需要能在腦海中看見每一步完成后世界應(yīng)該是什么樣子這兩種能力必須緊密耦合而不是各自為政。RxBrain給出了一套初步但系統(tǒng)的實(shí)現(xiàn)方案——從模型架構(gòu)、數(shù)據(jù)構(gòu)建、訓(xùn)練策略到評(píng)測(cè)體系——為具身認(rèn)知基礎(chǔ)模型的研究開辟了一條有價(jià)值的路徑。對(duì)這項(xiàng)研究感興趣的讀者可以通過arXiv編號(hào)2607.14187找到完整論文也可以在Hugging Face上查找Tencent/Hy-Embodied-RxBrain-1.0獲取模型在GitHub上查找Tencent-Hunyuan/Hy-Embodied-RxBrain-1.0獲取代碼。---**QA**Q1RxBrain和普通機(jī)器人規(guī)劃模型有什么區(qū)別A普通機(jī)器人規(guī)劃模型要么只用語言描述步驟要么只生成畫面兩者分開工作。RxBrain的特點(diǎn)是把語言步驟規(guī)劃和視覺狀態(tài)想象放在同一個(gè)序列里同時(shí)完成——每說出一個(gè)動(dòng)作步驟就同時(shí)生成那步執(zhí)行后世界應(yīng)該是什么樣子的畫面兩者互相驗(yàn)證、互相依賴。Q2RxBrain真實(shí)機(jī)器人測(cè)試的成功率是多少A在三個(gè)家務(wù)操作任務(wù)上RxBrain平均成功率為87%擺設(shè)餐桌97%折疊收納眼鏡95%撿拾垃圾68%。對(duì)比基線π0平均68%和π0.5平均82%RxBrain整體更優(yōu)且是在沒有大規(guī)模動(dòng)作數(shù)據(jù)預(yù)訓(xùn)練的條件下取得的。Q3RxBrain的訓(xùn)練數(shù)據(jù)有多大規(guī)模A研究團(tuán)隊(duì)從真實(shí)機(jī)器人操作、手持夾持器采集、仿真環(huán)境和人類第一視角視頻四類來源收集了超過5萬小時(shí)的具身任務(wù)視頻通過自動(dòng)化流水線篩選出約2150萬個(gè)高質(zhì)量訓(xùn)練片段通過率約75%。

相關(guān)新聞

從零構(gòu)建智能移動(dòng)機(jī)器人:四輪差速底盤與ROS 2導(dǎo)航實(shí)戰(zhàn)

從零構(gòu)建智能移動(dòng)機(jī)器人:四輪差速底盤與ROS 2導(dǎo)航實(shí)戰(zhàn)

1. 項(xiàng)目概述:當(dāng)“智能”遇上“馬車”,一場(chǎng)關(guān)于移動(dòng)與陪伴的跨界實(shí)驗(yàn)“真能拔腿撒歡的智能馬車”,這個(gè)標(biāo)題聽起來像是一個(gè)充滿奇思妙想的玩笑,或者某個(gè)科幻電影里的道具。但如果你把它拆開來看,會(huì)發(fā)現(xiàn)它精準(zhǔn)地指向了兩個(gè)…

2026/7/29 2:05:59 閱讀更多
【LLM面試專題】11.2 面試實(shí)戰(zhàn):場(chǎng)景設(shè)計(jì)題

【LLM面試專題】11.2 面試實(shí)戰(zhàn):場(chǎng)景設(shè)計(jì)題

大廠面試中拉開差距的核心題型。面試官給一個(gè)開放場(chǎng)景,讓你設(shè)計(jì)解決方案。 評(píng)分標(biāo)準(zhǔn)不在"答案正確",而在:結(jié)構(gòu)化思考、權(quán)衡取舍、知識(shí)廣度。 本章提供9個(gè)完整系統(tǒng)設(shè)計(jì)方案,每題包含:問題界定→架構(gòu)→權(quán)衡→故…

2026/7/29 2:05:59 閱讀更多
基于Raft分布式Kv存儲(chǔ):sendAppendEntries

基于Raft分布式Kv存儲(chǔ):sendAppendEntries

sendAppendEntries() 可以理解為: 針對(duì)某一個(gè) Follower,執(zhí)行一次 AppendEntries RPC,然后把回復(fù)合并回 Leader 的 Raft 狀態(tài)。 它不負(fù)責(zé)構(gòu)造請(qǐng)求。請(qǐng)求由 doHeartBeat() 提前構(gòu)造,它只負(fù)責(zé): 發(fā)送 RPC↓ 等待結(jié)果↓ 檢…

2026/7/29 2:05:59 閱讀更多
MicroPython模塊1.2.6解析:從核心機(jī)制到硬件驅(qū)動(dòng)實(shí)戰(zhàn)

MicroPython模塊1.2.6解析:從核心機(jī)制到硬件驅(qū)動(dòng)實(shí)戰(zhàn)

1. 項(xiàng)目概述:從“模塊”到“生態(tài)”的認(rèn)知升級(jí)當(dāng)你第一次在MicroPython的官方文檔或GitHub倉庫里看到“MicroPython模塊 1.2.6”這個(gè)標(biāo)題時(shí),可能會(huì)覺得這只是一個(gè)普通的版本更新日志。但如果你像我一樣,在嵌入式開發(fā)和物聯(lián)網(wǎng)領(lǐng)域摸爬滾打了十幾…

2026/7/29 3:46:02 閱讀更多
AE、VAE、CVAE

AE、VAE、CVAE

簡(jiǎn)單講解一下三個(gè)主要的自動(dòng)編碼器 主要思路都是采用一個(gè)編碼器和一個(gè)解碼器。輸入內(nèi)容經(jīng)過編碼器編碼為潛變量zzz,潛變量zzz經(jīng)過解碼器解碼為輸出內(nèi)容。 AE(Auto Encoder),這是最簡(jiǎn)單的自動(dòng)編碼器,其潛變量是一種低維編碼&#x…

2026/7/29 3:46:02 閱讀更多
AI芯片混戰(zhàn):OpenAI用AMD、DeepSeek用昇騰、英偉達(dá)5000億鎖HBM——誰在挑戰(zhàn)芯片王座?

AI芯片混戰(zhàn):OpenAI用AMD、DeepSeek用昇騰、英偉達(dá)5000億鎖HBM——誰在挑戰(zhàn)芯片王座?

英偉達(dá)的王座到底穩(wěn)不穩(wěn)?這可能是2026年AI行業(yè)最難回答的問題之一。過去十幾天,市場(chǎng)給出了兩個(gè)看起來有些矛盾的信號(hào):AMD簽下Anthropic和OpenAI的大單,股價(jià)年內(nèi)漲了142%;英偉達(dá)數(shù)據(jù)中心收入依然是AMD的11倍以上&#x…

2026/7/29 3:46:02 閱讀更多
C++實(shí)戰(zhàn)指南:從核心價(jià)值到現(xiàn)代工具鏈,探索高性能編程的未來

C++實(shí)戰(zhàn)指南:從核心價(jià)值到現(xiàn)代工具鏈,探索高性能編程的未來

1. 從“老兵”視角看C的當(dāng)下與未來最近在社區(qū)里,看到不少關(guān)于“C是否過時(shí)”、“學(xué)C還有沒有前途”的討論。作為一個(gè)從大學(xué)就開始摸C,在工業(yè)界用它寫過嵌入式驅(qū)動(dòng)、游戲引擎、高頻交易系統(tǒng),也用它調(diào)過無數(shù)“段錯(cuò)誤”和“內(nèi)存泄漏”的老兵&…

2026/7/29 3:46:02 閱讀更多
Python中文文本分析實(shí)戰(zhàn):從酒店評(píng)價(jià)挖掘商業(yè)洞察

Python中文文本分析實(shí)戰(zhàn):從酒店評(píng)價(jià)挖掘商業(yè)洞察

1. 項(xiàng)目概述:從酒店評(píng)價(jià)中挖掘商業(yè)洞察最近在復(fù)盤一個(gè)挺有意思的數(shù)據(jù)分析小項(xiàng)目,核心任務(wù)是對(duì)一堆酒店評(píng)價(jià)文本進(jìn)行挖掘。這活兒聽起來簡(jiǎn)單,不就是看看用戶說了啥嘛,但真做起來,從數(shù)據(jù)清洗到得出有商業(yè)價(jià)值的結(jié)論&…

2026/7/29 3:36:01 閱讀更多
面試官大笑:“一個(gè)任務(wù)拆給 5 個(gè) Subagent 并行跑,不比 1 個(gè)快 5 倍?“我搖頭:“快不了,還可能更慢“

面試官大笑:“一個(gè)任務(wù)拆給 5 個(gè) Subagent 并行跑,不比 1 個(gè)快 5 倍?“我搖頭:“快不了,還可能更慢“

前兩個(gè)月,我在重構(gòu) AlgoMooc 網(wǎng)站過程中,發(fā)現(xiàn)一個(gè)問題:在 Claude Code 里把一個(gè)任務(wù)拆給 5 個(gè) Subagent 并行跑,結(jié)果可能比 1 個(gè) agent 從頭干到尾還慢? 大多數(shù)人的第一反應(yīng)是反過來的:活是并行干的&#…

2026/7/29 0:15:24 閱讀更多
# 鴻蒙 HarmonyOS 應(yīng)用開發(fā)實(shí)戰(zhàn)(第25期)|骰子(Dice Roller)— Unicode 符號(hào)與動(dòng)畫渲染精講

# 鴻蒙 HarmonyOS 應(yīng)用開發(fā)實(shí)戰(zhàn)(第25期)|骰子(Dice Roller)— Unicode 符號(hào)與動(dòng)畫渲染精講

一、應(yīng)用概述 骰子(Dice Roller) 是一款經(jīng)典的休閑娛樂應(yīng)用,模擬了真實(shí)擲骰子的過程。應(yīng)用投擲兩個(gè)骰子(六面標(biāo)準(zhǔn)骰),使用 Unicode 骰面符號(hào)直觀展示每個(gè)骰子的點(diǎn)數(shù),并伴有快速滾動(dòng)的動(dòng)畫效果?!?/p>

2026/7/29 0:15:24 閱讀更多