
文章核心總結與創(chuàng)新點主要內(nèi)容該研究聚焦思維感知型多模態(tài)生成的核心問題——現(xiàn)有序列自回歸模型因誤差傳播導致性能下降,提出ParaBench基準用于評估文本-圖像對齊質(zhì)量,進而設計MMaDA-Parallel并行多模態(tài)擴散框架,通過雙向跨模態(tài)交互和軌跡級強化學習(ParaRL),解決推理與生成的對齊問題,在復雜圖像編輯和生成任務中實現(xiàn)性能提升。核心創(chuàng)新點ParaBench基準:首個同時評估文本推理質(zhì)量、圖像生成質(zhì)量及跨模態(tài)對齊的基準,含300個挑戰(zhàn)性提示(200個編輯任務、100個生成任務),覆蓋空間、時間、因果等多類推理場景。并行多模態(tài)擴散框架:突破序列生成限制,文本與圖像在整個去噪過程中同步生成,通過雙向注意力實現(xiàn)實時交互,避免誤差累積。ParaRL強化學習:軌跡級優(yōu)化策略,在去噪每一步施加語義獎勵,而非僅優(yōu)化最終輸出,強化跨模態(tài)一致性。數(shù)據(jù)構建方案:通過VLM為圖像編輯/生成數(shù)據(jù)生成推理軌跡,構建含15萬樣本的四元組訓練集(輸入圖像、指令、推理軌跡、輸出圖像),支撐監(jiān)督微調(diào)。翻譯部分(Markdown格式)Abstract思維感知型生成旨在提升復雜任務性能,但我們發(fā)現(xiàn)現(xiàn)有序列自回歸方法存在一個關鍵失效模