檢測論文整理:小目標(biāo)、多模態(tài)與YOLO實(shí)操指南)
每周日晚上我都會固定做一件事把 arXiv 上目標(biāo)檢測方向的最近投稿過一遍分類整理挑出值得精讀的收藏起來。這個習(xí)慣堅(jiān)持了好幾年已經(jīng)成了我追蹤技術(shù)與找選題的主要方式。這周8月30日到9月5日的更新量不算少方向也很密小目標(biāo)檢測、多模態(tài)檢測、三維目標(biāo)檢測、特定場景檢測都有一些值得記一筆的工作。這篇文章就是我這周的論文整理筆記順手把大家常問的評價指標(biāo)、YOLO配置文件、arXiv 投稿和查論文的實(shí)操問題也寫進(jìn)來了。適合剛?cè)腴T目標(biāo)檢測的研究生、做算法落地的工程師以及所有想快速跟上最新進(jìn)展的人。內(nèi)容不堆術(shù)語能看懂能照著用是主要目的。1. 本周目標(biāo)檢測論文的幾個集中方向1.1 小目標(biāo)檢測依然是繞不開的坎這周關(guān)于小目標(biāo)檢測的投稿至少有七八篇比例比上個月還高。原因不復(fù)雜常規(guī)檢測器在大中物體上已經(jīng)刷得很高COCO 的 mAP_s小物體卻一直偏低而實(shí)際場景里無人機(jī)航拍、遙感圖像、自動駕駛遠(yuǎn)景、監(jiān)控視頻全都依賴小目標(biāo)檢測。這不是一個會過時的方向每個做檢測的人遲早都要面對它。這周看到的方法大致分幾派。一派在特征金字塔上做文章把淺層高分辨率特征和深層語義特征做更細(xì)的融合或者干脆新增檢測層來保留小目標(biāo)的梯度和位置信息。另一派在標(biāo)簽分配上找問題小目標(biāo)與 anchor 的 IoU 天然偏低用靜態(tài) IoU 閾值很容易丟掉正樣本所以有人提了動態(tài)分配策略讓網(wǎng)絡(luò)自己學(xué)哪些位置該被當(dāng)作正樣本。還有一派直接改損失函數(shù)針對小目標(biāo)位置偏差敏感的特點(diǎn)在回歸分支上加重懲罰。我的習(xí)慣是看到這類文章先翻實(shí)驗(yàn)表格看有沒有單獨(dú)的 mAP_s 結(jié)果。很多論文通篇只報一個 mAP 50.7 這種總指標(biāo)但拆分后小目標(biāo)幾乎沒動過。如果一篇論文能在 mAP_s 上顯著漲 1.5 個點(diǎn)以上同時總 mAP 不掉我才會把正文收藏下來仔細(xì)讀。1.2 多模態(tài)與視覺大模型正在往檢測滲透熱詞里出現(xiàn)了 qwen3.8 目標(biāo)檢測加上這周幾篇開放詞匯和視覺語言模型做檢測的投稿多模態(tài)檢測明顯是目前最活躍的方向之一。這類工作的核心思路已經(jīng)變了不再把檢測當(dāng)作“框加類名”的封閉任務(wù)而是讓模型基于文本描述或上下文語義來定位物體有點(diǎn)像是從“背答案”變成了“讀題答題”。具體到這周值得關(guān)注的有三類。第一類是開放詞匯檢測用 CLIP 類的文本編碼器替代固定分類頭模型可以檢測訓(xùn)練時沒見過的類名第二類是多模態(tài)大模型直接輸出 box 坐標(biāo)把區(qū)域定位能力嵌進(jìn) LLM 的解碼過程讓模型能根據(jù)用戶的一句話圈出對應(yīng)物體第三類是用大模型做數(shù)據(jù)增強(qiáng)或標(biāo)簽生成用文本引導(dǎo)生成帶標(biāo)注框的訓(xùn)練圖解決長尾類別數(shù)據(jù)不足的問題。我個人覺得這類文章最大的價值不是馬上刷榜而是重新定義了檢測任務(wù)的邊界。做工程的同學(xué)可以重點(diǎn)關(guān)注開放詞匯那一支因?yàn)楹芏囗?xiàng)目里“類別列表經(jīng)常變”是剛需每換一個場景就重新標(biāo)注一批數(shù)據(jù)成本實(shí)在太高了。1.3 三維目標(biāo)檢測BEV 和點(diǎn)云仍是主線三維目標(biāo)檢測這周也有幾篇扎實(shí)的工作主要集中在自動駕駛和機(jī)器人場景。主流路線依舊是兩大類一類是純點(diǎn)云方法比如對 PointPillars 這類結(jié)構(gòu)做改進(jìn)希望在稀疏點(diǎn)云上把特征提得更好另一類是 BEV 方法把多相機(jī)圖像統(tǒng)一投影到鳥瞰視角再在 BEV 空間里做檢測更適合依賴純視覺方案的系統(tǒng)。這周有個讓我印象比較深的方向是把時序信息做進(jìn) BEV 特征讓檢測器不只看單幀而是用相鄰幾幀的運(yùn)動線索推斷被遮擋物體的位置。另一個工作在做點(diǎn)云和圖像的跨模態(tài)對齊不是簡單把兩個模態(tài)的特征拼接起來而是學(xué)習(xí)模態(tài)間的關(guān)聯(lián)權(quán)重看下來比直接 concat 穩(wěn)定不少。如果你在自動駕駛或者機(jī)器人方向做落地這周的三維檢測文章挑兩篇精讀就夠了不用每篇都看。原因很現(xiàn)實(shí)很多方法對傳感器配置、標(biāo)定精度、點(diǎn)云密度極其敏感項(xiàng)目里不一定能用上讀多了反而容易亂。1.4 特定場景檢測無人機(jī)、水下與鳥類特定場景檢測這周也冒出一批新工作。無人機(jī)目標(biāo)檢測主要難在小目標(biāo)和背景復(fù)雜這周好幾篇都圍繞密集小目標(biāo)或旋轉(zhuǎn)框展開水下目標(biāo)檢測因?yàn)閳D像顏色偏綠、對比度低很多人開始把圖像增強(qiáng)網(wǎng)絡(luò)和檢測網(wǎng)絡(luò)聯(lián)合起來訓(xùn)練鳥類檢測的熱度來源于生態(tài)觀測這周有人發(fā)布了新的鳥類檢測數(shù)據(jù)集覆蓋幾百種鳥的檢測框標(biāo)注。這類特定場景的工作通用性固然不如 COCO 刷榜方法但對做行業(yè)應(yīng)用、接項(xiàng)目的工程師來說非常實(shí)用。我一般會把它們的 backbone 和 trick 記下來當(dāng)作自己數(shù)據(jù)集上調(diào)試的備選方案。尤其是鳥類數(shù)據(jù)集這種“類別多但單類樣本少”的數(shù)據(jù)結(jié)構(gòu)天然適合驗(yàn)證長尾學(xué)習(xí)和小樣本方法做研究的人也可以留意。2. 訓(xùn)練目標(biāo)檢測模型繞不開的評價指標(biāo)熱搜詞里并列出現(xiàn)“目標(biāo)檢測訓(xùn)練過程中評價標(biāo)準(zhǔn)”和“目標(biāo)檢測評價指標(biāo)”說明很多人卡在訓(xùn)練完之后不知道怎么評估模型好壞。這一段我盡量講透從 mAP 怎么算到小目標(biāo)指標(biāo)再到工程上還要看什么。2.1 mAP 到底是怎么算出來的mAP 是目標(biāo)檢測里最核心的指標(biāo)但很多人只是知道它叫“均值平均精度”并不知道底層的計(jì)算邏輯。先看兩個基礎(chǔ)概念Precision查準(zhǔn)率和 Recall查全率。假設(shè)一張圖里有 10 個真實(shí)目標(biāo)模型檢測出 8 個框其中 6 個是對的那么 Precision6/80.75Recall6/100.6。問題來了怎么定義“對的框”目標(biāo)檢測里的標(biāo)準(zhǔn)是預(yù)測框和真實(shí)框之間的 IoU 是否大于某個閾值。IoU 就是兩個框交集面積除以并集面積越接近 1說明框越準(zhǔn)。如果閾值設(shè)為 0.5那 IoU 大于等于 0.5 的預(yù)測框就算正確。AP 就是在某個 IoU 閾值下把置信度閾值從高到低掃描得到一系列 Precision 和 Recall 點(diǎn)畫出 PR 曲線再算曲線下的面積。mAP 就是所有類別 AP 的均值。現(xiàn)在論文里最??吹絻蓚€口徑mAP0.5IoU 閾值固定 0.5比較寬容接近早期 VOC 時代的 mAP 含義。mAP0.5:0.95從 0.5 到 0.95每隔 0.05 取一個 IoU 閾值算 10 個 AP 再取平均非常嚴(yán)格是 COCO 以來論文的主流指標(biāo)。mAP0.5:0.95 對定位精度異常敏感因?yàn)?IoU 閾值越高邊界框稍微偏一點(diǎn)就會從 TP 變成 FP。這也是為什么很多初學(xué)者發(fā)現(xiàn) mAP0.5 看起來還不錯但 mAP0.5:0.95 慘不忍睹——本質(zhì)上是框不夠準(zhǔn)不是目標(biāo)沒找到。2.2 COCO 數(shù)據(jù)集里的小目標(biāo)為什么難漲COCO 評估里按物體像素面積把目標(biāo)分成三檔小目標(biāo)面積小于 32×32、中目標(biāo)32×32 到 96×96、大目標(biāo)大于 96×96。對應(yīng)的指標(biāo)是 mAP_s、mAP_m、mAP_l。小目標(biāo)對檢測器來說是雙重打擊。首先是特征層面一個 8×8 的小目標(biāo)經(jīng)過 32 倍下采樣之后在深層特征圖上可能只剩一兩個像素的信息跟噪聲沒什么區(qū)別。其次是標(biāo)簽分配層面小目標(biāo)和 anchor 的 IoU 很難沖到 0.5 以上靜態(tài) IoU 閾值會把大部分小目標(biāo)候選直接歸為負(fù)樣本所以訓(xùn)練階段就丟了。很多論文故意把 mAP_s 單獨(dú)列出來一方面是為了證明方法不是只在容易的大目標(biāo)上刷分另一方面也是告訴審稿人小目標(biāo)提升是真實(shí)貢獻(xiàn)。如果你在調(diào)自己的數(shù)據(jù)集我強(qiáng)烈建議除了總 mAP把 mAP_s、mAP_m、mAP_l 都打印出來看看。否則你根本分不清模型是“根本沒檢測到”還是“定位不夠準(zhǔn)”調(diào)優(yōu)方向很容易走偏。2.3 除了 mAP工程落地還要看什么論文里只看 mAP但做工程不能只看 mAP。至少要從三個維度一起考察精度、速度、資源占用。很多模型在論文里很漂亮一到實(shí)際設(shè)備上就露餡。指標(biāo)作用說明F1 分?jǐn)?shù)精度與召回的平衡類別不均衡時比 mAP 更直觀單類 AP細(xì)粒度分析一眼找出拖后腿的類別FPS / 延遲實(shí)時性車載、監(jiān)控、端側(cè)都極其敏感FLOPs / 參數(shù)量資源占用決定能否部署到目標(biāo)硬件推理內(nèi)存占用工程約束有時比 FLOPs 更關(guān)鍵量化后精度部署適配很多端側(cè)芯片必須做 INT8這里要特別提醒論文里報的 FPS你未必比得了。不同 GPU、不同 TensorRT 版本、是否開 FP16跑出來的速度差距非常大。我自己的做法是固定一臺設(shè)備和同一個推理框架把要對比的模型都重測一遍再決定用哪個直接抄論文里的數(shù)字容易踩坑。2.4 訓(xùn)練過程中哪些曲線值得盯“目標(biāo)檢測訓(xùn)練過程中評價標(biāo)準(zhǔn)”這個熱詞我理解不光是最終評測還包括訓(xùn)練過程中的實(shí)時監(jiān)控。用 YOLOv8 舉例訓(xùn)練時終端會打印 box_loss、cls_loss、dfl_loss同時輸出的 results.png 里包含了 P、R、mAP50、mAP50-95 四條曲線。我一般重點(diǎn)看兩條一條是驗(yàn)證集上的 mAP50-95 是否還在穩(wěn)定上升如果連續(xù) 20 個 epoch 不漲基本就到了平臺期可以考慮早停另一條是訓(xùn)練 loss 和驗(yàn)證 loss 的差距如果訓(xùn)練 loss 一直降、驗(yàn)證 loss 反而回升那就是過擬合信號該加正則化或數(shù)據(jù)增強(qiáng)。這里的核心原則是訓(xùn)練 loss 只是一個過程指標(biāo)模型好壞最終以驗(yàn)證集指標(biāo)為準(zhǔn)。3. YOLO 系列實(shí)操配置文件、檢測頭和 GPU 選型熱搜詞里“yolov8 目標(biāo)檢測”“yolo目標(biāo)檢測 yaml 配置文件”“yolov8 小目標(biāo)檢測頭”熱度很高說明很多人已經(jīng)在跑 YOLO 系列了。這一節(jié)我把三個高頻問題一次性說清楚。3.1 yaml 配置文件到底改哪幾處YOLOv8 把數(shù)據(jù)集路徑、模型結(jié)構(gòu)、訓(xùn)練超參拆成了多個 yaml 和命令行參數(shù)第一次接觸的人很容易懵。其實(shí)核心不用管太多記住三個文件概念就行。第一個是數(shù)據(jù) yaml它告訴模型去哪找圖片和標(biāo)簽。示例path: /data/project/dataset # 數(shù)據(jù)集根目錄 train: images/train # 訓(xùn)練集相對路徑 val: images/val # 驗(yàn)證集相對路徑 nc: 3 # 類別數(shù) names: [cat, dog, bird]第二個是模型 yaml定義 backbone 和 head 結(jié)構(gòu)。如果你直接用官方 yolov8n.yaml默認(rèn) nc 是 80要改成自己的類別數(shù)。實(shí)際上訓(xùn)練時 YOLOv8 會從數(shù)據(jù) yaml 強(qiáng)制讀取 nc但兩邊保持一致永遠(yuǎn)是最穩(wěn)妥的。第三個是訓(xùn)練參數(shù)一般通過命令行傳。示例yolo detect train datamy_data.yaml modelyolov8n.pt epochs100 imgsz640 batch8 device0這里 model 參數(shù)可以傳 .pt 預(yù)訓(xùn)練權(quán)重也可以傳 .yaml 從頭訓(xùn)練。新手最容易踩的坑是數(shù)據(jù)集路徑寫錯、nc 不對、圖片和標(biāo)簽名對不上。數(shù)據(jù) yaml 里的 path 建議寫絕對路徑少用相對路徑能省掉很多詭異的報錯。3.2 給 YOLOv8 加小目標(biāo)檢測頭的常見做法YOLOv8 默認(rèn)檢測頭在 P3、P4、P5 三層特征圖對應(yīng) 8 倍、16 倍、32 倍下采樣。小目標(biāo)經(jīng)過 32 倍下采樣后信息幾乎丟失所以社區(qū)最常見的改法是新增一個 P2 層也就是 4 倍下采樣的高分辨率特征圖讓模型在更大的特征圖上單獨(dú)檢測小目標(biāo)。做法上通常是在模型 yaml 的 head 部分增加一個來自淺層特征的分支把這個分支和后面若干層做特征拼接或融合再接到 detect 層。需要注意P2 層分辨率高計(jì)算量和顯存會明顯上漲同時對中大型數(shù)據(jù)集反而容易過擬合。我的建議是動手之前先統(tǒng)計(jì)自己數(shù)據(jù)集的目標(biāo)尺寸分布。如果大量目標(biāo)面積小于 32×32加 P2 是值得的如果你的目標(biāo)本來就不小強(qiáng)行加 P2 只會拖慢訓(xùn)練速度還可能掉點(diǎn)。數(shù)據(jù)分布決定方案而不是方案決定數(shù)據(jù)。3.3 訓(xùn)練 YOLO 真的需要 GPU 嗎熱詞里有人直接問“需要用到 gpu嗎?”我直接給結(jié)論正式訓(xùn)練目標(biāo)檢測模型強(qiáng)烈建議用 GPUCPU 只適合調(diào)試小數(shù)據(jù)和跑通流程。以 YOLOv8n 為例在 CPU 上訓(xùn)練一個很小的數(shù)據(jù)集一個 epoch 都可能要幾十分鐘換主流 GPU幾十秒到幾分鐘就能跑完一個 epoch。顯存需求大致參考模型輸入尺寸推薦顯存YOLOv8n6404GB 以上YOLOv8s6406GB 以上YOLOv8m6408GB 以上YOLOv8l64012GB 以上YOLOv8x64016GB 以上這只是單卡單 batch 的保守估算實(shí)際還受 batch size 和是否開啟 AMP 混合精度影響。顯存不夠時優(yōu)先降 batch size配合梯度累積功能可以模擬更大的 batch 效果。如果本地確實(shí)沒有 GPU可以先在免費(fèi) notebook 上用 T4 級別的卡做小數(shù)據(jù)驗(yàn)證確認(rèn)方案可行再上完整訓(xùn)練。4. arXiv 投稿與刷論文的那些實(shí)際問題既然是論文整理就繞不開 arXiv 本身。熱詞里“arxiv提交全流程”“arxiv提交的文章onhold”“arxiv鏡像網(wǎng)站”指向同一個需求大家不只是想看論文還想自己提交、自己查。這一節(jié)我把自己踩過的坑和整理論文的經(jīng)驗(yàn)一并寫出來。4.1 從注冊到提交成功的完整流程第一次提交 arXiv 論文流程不算復(fù)雜但細(xì)節(jié)很磨人。你需要先在官網(wǎng)注冊賬號然后進(jìn)入提交頁面上傳源文件或編譯好的 PDF填寫標(biāo)題、作者、摘要、分類再完成聲明。需要注意幾個關(guān)鍵點(diǎn)。源文件格式方面最穩(wěn)妥的是用 LaTeX 編譯后上傳 .tex 源碼系統(tǒng)會自動生成 PDF如果你用 Word 或 Pages要先想好怎么轉(zhuǎn)成符合 arXiv 要求的排版不然 metadata 審核階段容易被卡。分類選擇方面目標(biāo)檢測相關(guān)的文章一般投 cs.CV涉及機(jī)器人可以勾選 cs.RO涉及多媒體可以加 cs.MM。分類選得準(zhǔn)同行才更容易刷到你的文章。提交之后系統(tǒng)會進(jìn)入編譯和審核隊(duì)列。通常幾分鐘內(nèi)狀態(tài)會變成 Submitted之后可能出現(xiàn) Announced也可能出現(xiàn) On hold。這個過程不復(fù)雜但每一條狀態(tài)變化背后都有具體原因很多人就是在這里慌了神。4.2 提交狀態(tài)變成 onhold 怎么辦onhold 不是被拒而是文章被 arXiv 審核團(tuán)隊(duì)暫時 hold 住等進(jìn)一步確認(rèn)。常見原因有幾個metadata 信息不完整比如作者姓名大小寫、摘要里有特殊字符。作者列表和注釋不一致比如標(biāo)記了“同等貢獻(xiàn)”但沒說明清楚。系統(tǒng)生成的 PDF 和作者本地上傳的 PDF 差異較大觸發(fā)人工復(fù)核。新賬號第一次提交或者內(nèi)容涉及多個學(xué)科人工審核概率會更高。遇到 onhold 的第一反應(yīng)不應(yīng)該是焦慮而是去看郵箱。arXiv 會發(fā)來一封說明郵件里面會寫清楚具體原因。按郵件要求修改信息、補(bǔ)充確認(rèn)再重新提交即可。只要內(nèi)容本身沒有問題onhold 通常一兩天內(nèi)就會解除。千萬不要重復(fù)提交多個版本那樣只會讓審核更慢。4.3 刷 arXiv 更新最有效率的幾個辦法每天手動刷新網(wǎng)頁是效率最低的方式。我現(xiàn)在主要用兩種方法第一種是 RSS 訂閱把目標(biāo)檢測方向的 feed 地址加進(jìn)閱讀器每天定時更新標(biāo)題和摘要第二種是 arXiv 的郵件訂閱服務(wù)按分類和頻率設(shè)置每周或每天收到新論文列表。鏡像站這個話題很多做學(xué)術(shù)的人都會提到。我的態(tài)度是優(yōu)先用官方網(wǎng)站和它提供的訂閱能力如果你的網(wǎng)絡(luò)環(huán)境確實(shí)存在訪問不穩(wěn)定的問題再考慮第三方聚合站或鏡像但使用時要特別留意論文展示的完整性和時效性別因?yàn)殓R像同步延遲錯過最新更新。另外不少第三方站點(diǎn)會順帶展示評論數(shù)、下載量和相關(guān)論文這些信息在篩選的時候其實(shí)很有用。除了訂閱我還會定期去幾個人氣比較高的論文討論社區(qū)逛逛看大家在聊哪些方向。很多論文不是自己刷到的而是從別人的討論串里發(fā)現(xiàn)的這種“被動接收”有時候比主動刷更高效。4.4 怎么識別“編號火起來的論文”熱詞里出現(xiàn)了 arxiv:2406.09246 這種編號。出現(xiàn)這種編號通常是因?yàn)槟称撐脑谏鐓^(qū)里被討論了大家直接報編號傳播。這里我要提醒一點(diǎn)同一個編號可能有 v1、v2、v3 多個版本社區(qū)討論的結(jié)論對應(yīng)的可能是 v1而最新版本可能已經(jīng)修改了實(shí)驗(yàn)甚至作者列表。拿到一個編號后一定要去官網(wǎng)確認(rèn)最新版本號和更新時間再決定要不要引用。另外可以順帶看看該論文的提交歷史里每個版本改動大不大如果 v2 和 v1 的實(shí)驗(yàn)結(jié)果差異明顯說明作者還在快速迭代這種情況引用時要格外謹(jǐn)慎。5. 每周讀論文我自己的篩選方法前面講的都是“怎么找”這章講講“怎么篩”。每周目標(biāo)檢測方向更新幾十篇不可能全部精讀我給自己定了一套篩選流程分享出來供參考。5.1 三分鐘快速判斷值不值得精讀我的方法是三分鐘過三關(guān)。第一關(guān)看標(biāo)題標(biāo)題是不是新問題或者新角度。懂行的人掃一眼標(biāo)題就能排除掉一半以上的水稿比如遇到《A New Approach for Object Detection》這種除了空泛沒有任何信息的標(biāo)題直接跳過第一關(guān)就淘汰了。第二關(guān)看摘要摘要里有沒有明確的技術(shù)貢獻(xiàn)和主要數(shù)字。如果整段摘要都在描述問題多么重要、挑戰(zhàn)多么巨大卻不說自己的方法是什么、效果提升多少不值得花時間。第三關(guān)看方法和實(shí)驗(yàn)表格。一個清晰的方法結(jié)構(gòu)圖勝過千字描述實(shí)驗(yàn)部分如果只有自己的方法數(shù)字沒有和多個主流基線對比說明作者不太敢比這種工作可信度要打折扣。三關(guān)都過了我才會下載全文精讀。5.2 什么樣的論文我會收藏我會收藏三種類型的論文。第一種是能直接改造到自己項(xiàng)目里的方法哪怕提升只有 0.5 個點(diǎn)能夠穩(wěn)定落地就是價值。第二種是數(shù)據(jù)集或 benchmark 類工作這類論文短期熱度不高但因?yàn)楹罄m(xù)很多人會引用和使用收藏起來長期有用。第三種是代碼質(zhì)量很高、README 齊全、預(yù)訓(xùn)練權(quán)重已經(jīng)放出來的工作復(fù)現(xiàn)時能省掉大量時間。反過來那種只在模擬數(shù)據(jù)集上刷分、明明篇幅不短卻不開源代碼、連檢測框可視化示例圖都畫不圓的論文我一般看個摘要就跳過。畢竟論文讀多了好方法和壞工作之間往往隔著一眼就能聞出來的差距。5.3 復(fù)現(xiàn)一篇論文前必查的四個問題決定復(fù)現(xiàn)一篇 arXiv 論文之前我會先回答四個問題。第一官方代碼是否開源語言和框架是不是我熟悉的第二依賴的 PyTorch/CUDA 版本和本地環(huán)境是否兼容很多報錯其實(shí)都出在環(huán)境上第三訓(xùn)練數(shù)據(jù)集是否公開下載和標(biāo)注轉(zhuǎn)換的成本是否可控第四論文聲稱的效果是不是在單卡上就能復(fù)現(xiàn)如果非要幾十張 GPU 堆出來的結(jié)果要慎重評估時間成本。如果四個問題里有三個還不確定我就先跑推理 demo不直接訓(xùn)練。很多作者放出預(yù)訓(xùn)練權(quán)重就是為了讓大家先看到效果先確認(rèn) demo 和論文描述一致再決定要不要投入訓(xùn)練。跳過這一步直接訓(xùn)練等于把判斷權(quán)交給作者風(fēng)險很大。最后說一段我自己的體會堅(jiān)持做每周 arXiv 整理最大的收益不是“追了新論文”而是逼著自己每周都去思考這個領(lǐng)域現(xiàn)在缺什么、有什么問題值得做。目標(biāo)檢測看起來很卷但每周依然會冒出讓人眼前一亮的思路這就是這個方向的魅力。希望這篇整理能幫你少走點(diǎn)彎路。