
文章主要內容與創(chuàng)新點總結一、主要內容本文針對大型視覺語言模型(LVLMs)在實例級任務(如目標跟蹤)中性能不足的問題,提出了一種統(tǒng)一的行人跟蹤框架OmniPT。該框架能夠同時完成傳統(tǒng)多目標跟蹤(MOT)、指代多目標跟蹤(RMOT)、跨視角指代多目標跟蹤(CRMOT)和語義多目標跟蹤(SMOT)四大任務,核心是通過語義理解增強跟蹤穩(wěn)定性,同時實現(xiàn)指令交互下的跟蹤與語義分析。為適配LVLMs的能力特性,設計了四階段訓練策略:第一階段RL:采用GRPO算法,規(guī)范模型輸出固定格式的邊界框(x,y,w,h);中期訓練(Mid Training):基于行人相關數(shù)據(jù)集,通過圖像文本對齊、目標檢測、位置預測、行人重識別等代理任務,增強模型對行人語義描述的敏感性;監(jiān)督微調(SFT):將跟蹤任務解耦為VQA形式,針對四大核心任務設計訓練樣本與查詢格式;第二階段RL:進一步提升模型跟蹤性能與指令遵循能力。在DanceTrack、BenSMOT、Refer-KITTI-V2、CRTrack等數(shù)據(jù)集上的實驗表明,OmniPT在跟蹤精度(HOTA、MOTA等指標)和語義理解(BLEU、CIDEr等指標)上均達到當前最優(yōu)水平,例如在BenSMOT上HOTA得分75.04,較此前最佳結果提升3.06。二、創(chuàng)新點統(tǒng)一范式設計:首次提出"一體化"行人跟蹤框架,兼容傳統(tǒng)跟蹤與語義導向型跟蹤任務,實現(xiàn)跟蹤與語義理解的交互式統(tǒng)一;任務轉化方案:將實例級跟蹤