
文章主要內(nèi)容與創(chuàng)新點(diǎn)總結(jié)一、主要內(nèi)容本文針對大型視覺語言模型(LVLMs)在實(shí)例級任務(wù)(如目標(biāo)跟蹤)中性能不足的問題,提出了一種統(tǒng)一的行人跟蹤框架OmniPT。該框架能夠同時(shí)完成傳統(tǒng)多目標(biāo)跟蹤(MOT)、指代多目標(biāo)跟蹤(RMOT)、跨視角指代多目標(biāo)跟蹤(CRMOT)和語義多目標(biāo)跟蹤(SMOT)四大任務(wù),核心是通過語義理解增強(qiáng)跟蹤穩(wěn)定性,同時(shí)實(shí)現(xiàn)指令交互下的跟蹤與語義分析。為適配LVLMs的能力特性,設(shè)計(jì)了四階段訓(xùn)練策略:第一階段RL:采用GRPO算法,規(guī)范模型輸出固定格式的邊界框(x,y,w,h);中期訓(xùn)練(Mid Training):基于行人相關(guān)數(shù)據(jù)集,通過圖像文本對齊、目標(biāo)檢測、位置預(yù)測、行人重識別等代理任務(wù),增強(qiáng)模型對行人語義描述的敏感性;監(jiān)督微調(diào)(SFT):將跟蹤任務(wù)解耦為VQA形式,針對四大核心任務(wù)設(shè)計(jì)訓(xùn)練樣本與查詢格式;第二階段RL:進(jìn)一步提升模型跟蹤性能與指令遵循能力。在DanceTrack、BenSMOT、Refer-KITTI-V2、CRTrack等數(shù)據(jù)集上的實(shí)驗(yàn)表明,OmniPT在跟蹤精度(HOTA、MOTA等指標(biāo))和語義理解(BLEU、CIDEr等指標(biāo))上均達(dá)到當(dāng)前最優(yōu)水平,例如在BenSMOT上HOTA得分75.04,較此前最佳結(jié)果提升3.06。二、創(chuàng)新點(diǎn)統(tǒng)一范式設(shè)計(jì):首次提出"一體化"行人跟蹤框架,兼容傳統(tǒng)跟蹤與語義導(dǎo)向型跟蹤任務(wù),實(shí)現(xiàn)跟蹤與語義理解的交互式統(tǒng)一;任務(wù)轉(zhuǎn)化方案:將實(shí)例級跟蹤