開發(fā)實戰(zhàn))
各位做視覺開發(fā)、深度學(xué)習(xí)落地或者桌面應(yīng)用集成的朋友應(yīng)該都有類似的體會模型訓(xùn)練出來只是第一步真正要交付給客戶或業(yè)務(wù)方使用還得給模型套上一個能看得見、摸得著的“外殼”。如果你正在做安全監(jiān)管、消防預(yù)警或室內(nèi)違規(guī)行為檢測相關(guān)的項目那么“吸煙檢測”大概率是需求清單里繞不開的一項。這篇文章我打算圍繞YOLOv8 PyQt5做一套完整的抽煙吸煙檢測識別系統(tǒng)從數(shù)據(jù)集準(zhǔn)備、模型訓(xùn)練、模型導(dǎo)出到 PyQt5 界面開發(fā)、攝像頭實時推理、多線程防卡頓再到常見報錯排查一次性講清楚。代碼我會盡量給全方便你直接復(fù)制、修改、跑通。新手可以照著做一遍理解整個視覺檢測項目的完整鏈路有基礎(chǔ)的開發(fā)者可以直接跳到第四節(jié)看核心代碼和工程化細(xì)節(jié)。需要先說明的是本文不涉及任何環(huán)境代理相關(guān)配置只關(guān)注模型訓(xùn)練和桌面應(yīng)用集成本身安全合規(guī)的內(nèi)容也會在文末做一個提醒。1. 背景與核心概念1.1 什么是吸煙檢測識別系統(tǒng)吸煙檢測識別系統(tǒng)本質(zhì)上是“目標(biāo)檢測Object Detection”在特定場景下的應(yīng)用。它的任務(wù)是給定一張圖片或一段視頻流算法自動找出畫面中是否存在“正在吸煙的人”并框出吸煙目標(biāo)的位置。與我們熟悉的通用目標(biāo)檢測比如檢測行人、車輛、貓狗不同吸煙檢測有兩個難點目標(biāo)小。香煙、打火機在畫面中占比很小尤其是監(jiān)控攝像頭距離較遠時模型很容易漏檢。語義歧義。手指夾著的白色細(xì)長物體、嘴邊的白色物體與香煙有一定相似性如果不結(jié)合手部姿態(tài)、臉部區(qū)域、煙霧特征很容易誤檢。所以在實際項目中很多人會把“吸煙檢測”拆分成多個子任務(wù)先做人臉檢測、再做人手檢測、然后再判斷手部區(qū)域是否有香煙特征也可以用端到端的目標(biāo)檢測模型直接標(biāo)注“smoking”這個類別。前者準(zhǔn)確率高但流程復(fù)雜后者簡單直接適合快速落地。本文采用第二種方案也就是用 YOLOv8 訓(xùn)練一個端到端的吸煙檢測模型。1.2 為什么選擇 YOLOv8YOLOYou Only Look Once系列是目前工業(yè)界應(yīng)用最廣的目標(biāo)檢測算法之一。它把目標(biāo)檢測當(dāng)作回歸問題一次前向推理就能同時輸出目標(biāo)類別和邊界框位置所以速度非???。YOLOv8 是 Ultralytics 公司在 2023 年初推出的版本相比之前的 YOLOv5主要改進點包括C2f 模塊在 C3 模塊基礎(chǔ)上引入更多分支連接讓梯度流動更豐富特征提取能力更強。Anchor-Free 檢測頭不再依賴預(yù)設(shè)的 anchor 框簡化了后處理邏輯對小目標(biāo)更友好。解耦檢測頭Decoupled Head分類分支和回歸分支分開收斂更快精度更高。更豐富的模型規(guī)格YOLOv8n / YOLOv8s / YOLOv8m / YOLOv8l / YOLOv8x從輕量級到高精度全覆蓋。對于吸煙檢測這種小目標(biāo)場景我一般建議先用 YOLOv8s 或 YOLOv8m 起步如果推理設(shè)備性能有限比如只有 CPU再考慮 YOLOv8n。本文示例默認(rèn)使用 YOLOv8s。1.3 為什么用 PyQt5 做界面PyQt5 是 Qt5 應(yīng)用框架的 Python 綁定常被用來開發(fā) Windows / Linux 桌面軟件。對于視覺檢測項目PyQt5 的優(yōu)勢在于控件豐富按鈕、標(biāo)簽、下拉框、表格、畫布等都很成熟能快速搭出專業(yè)界面。信號槽機制界面交互點擊按鈕、選擇文件和業(yè)務(wù)邏輯之間通過信號槽解耦代碼結(jié)構(gòu)清晰。與 OpenCV 配合方便OpenCV 讀到的圖像是numpy.ndarrayPyQt5 中可以很方便地轉(zhuǎn)換成QImage/QPixmap顯示在界面上。打包部署成熟配合 PyInstaller 可以打成 exe方便交付給沒有 Python 環(huán)境的客戶。簡單來說YOLOv8 負(fù)責(zé)“看得見”PyQt5 負(fù)責(zé)“讓人看得見”。模型負(fù)責(zé)輸出坐標(biāo)和類別界面負(fù)責(zé)把結(jié)果呈現(xiàn)給用戶并提供交互入口。1.4 應(yīng)用場景工廠車間、倉庫、加油站等禁煙區(qū)域的安全監(jiān)控網(wǎng)吧、餐廳、候車室等公共場所的違規(guī)吸煙提醒家庭、宿舍場景的吸煙行為監(jiān)測森林防火中的人員吸煙行為識別配合紅外攝像頭2. 環(huán)境準(zhǔn)備與版本說明2.1 運行環(huán)境本文以 Windows 10/11 為例代碼同樣適用于 Linux。硬件方面建議優(yōu)先使用 NVIDIA 顯卡GTX 1660Ti 及以上級別都能跑 YOLOv8s 訓(xùn)練顯存 6GB 以上比較從容。如果沒有獨立顯卡可以先用 CPU 訓(xùn)練小型模型做功能驗證速度會慢很多但不影響理解流程。版本方面下面的組合是我目前穩(wěn)定使用的但版本更新較快你需要根據(jù)實際情況調(diào)整依賴庫參考版本說明Python3.8 - 3.11建議 3.9 或 3.10兼容性最好ultralytics8.x 最新穩(wěn)定版已集成 YOLOv8PyQt55.15.x穩(wěn)定版本opencv-python4.8 以上圖像處理torch2.x cu118 / cu121根據(jù) CUDA 版本選擇torchvision與 torch 對應(yīng)不要單獨亂裝numpy1.24.x左右避免與 torch 沖突2.2 安裝依賴建議新建一個虛擬環(huán)境避免把系統(tǒng) Python 環(huán)境搞亂。# 創(chuàng)建虛擬環(huán)境 conda create -n smoke_detect python3.9 -y conda activate smoke_detect # 安裝 PyTorch以 CUDA 11.8 為例CPU 版本請去 PyTorch 官網(wǎng)選對應(yīng)命令 pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118 # 安裝 YOLOv8 及視覺相關(guān)庫 pip install ultralytics opencv-python # 安裝 PyQt5 pip install pyqt5 pyqt5-tools如果你在國內(nèi)網(wǎng)絡(luò)環(huán)境下安裝速度慢可以臨時切換為國內(nèi)鏡像源pip install ultralytics opencv-python -i https://pypi.tuna.tsinghua.edu.cn/simple2.3 驗證安裝在 Python 交互環(huán)境或腳本中執(zhí)行import torch import ultralytics import cv2 from PyQt5.QtWidgets import QApplication print(torch:, torch.__version__) print(cuda available:, torch.cuda.is_available()) print(ultralytics:, ultralytics.__version__) print(opencv:, cv2.__version__)如果torch.cuda.is_available()返回False說明 PyTorch 沒有裝到 GPU 版本或者 CUDA 驅(qū)動不對。后面第三節(jié)會單獨講怎么排查。3. 核心原理拆解YOLOv8 網(wǎng)絡(luò)與 PyQt5 架構(gòu)3.1 YOLOv8 網(wǎng)絡(luò)結(jié)構(gòu)速覽YOLOv8 的整體結(jié)構(gòu)可以分成三部分Backbone骨干網(wǎng)絡(luò)負(fù)責(zé)提取圖像特征。YOLOv8s 使用的是改進版 CSPDarknet核心模塊是 C2f。相比 YOLOv5 的 C3C2f 把輸入特征圖分成兩支經(jīng)過多個 Bottleneck 后再拼接最后經(jīng)過卷積調(diào)整通道數(shù)。這樣做的目的是增加梯度流的分支數(shù)量讓淺層特征和深層特征融合得更好對小目標(biāo)檢測有幫助。Neck頸部網(wǎng)絡(luò)負(fù)責(zé)多尺度特征融合。YOLOv8 使用 PAN-FPN 結(jié)構(gòu)簡單理解就是把 Backbone 輸出的三個不同尺寸特征圖大特征圖保留細(xì)節(jié)適合檢測小目標(biāo)小特征圖語義強適合檢測大目標(biāo)反復(fù)做上采樣、下采樣和橫向拼接讓每一層都具備多尺度語義信息。吸煙檢測中香煙目標(biāo)偏向小目標(biāo)所以我們需要特別關(guān)注 P3 層也就是較大尺寸的特征圖的輸出是否被充分利用。Head檢測頭YOLOv8 采用 Anchor-Free 解耦頭。每個檢測位置直接預(yù)測“中心點是否為目標(biāo)”和“邊界框的四邊距離”然后通過 NMS非極大值抑制過濾掉重疊框。由于沒有 anchor 數(shù)量、尺寸這些超參數(shù)訓(xùn)練時對數(shù)據(jù)集的適應(yīng)能力更強。如果你打開 Ultralytics 的源碼會發(fā)現(xiàn)網(wǎng)絡(luò)結(jié)構(gòu)是在ultralytics/nn/modules/head.py中定義的但實際使用時我們通常不需要手動搭建網(wǎng)絡(luò)直接調(diào)用 YOLO 類即可。3.2 訓(xùn)練流程與關(guān)鍵參數(shù)說明YOLOv8 訓(xùn)練最核心的代碼只有幾行from ultralytics import YOLO model YOLO(yolov8s.pt) # 加載預(yù)訓(xùn)練權(quán)重 model.train(datasmoke.yaml, epochs100, imgsz640, batch16)但這里有幾個參數(shù)值得展開說明epochs完整遍歷數(shù)據(jù)集的次數(shù)。抽煙檢測數(shù)據(jù)集如果比較小幾百張到兩千張100 到 150 輪足夠如果數(shù)據(jù)集很大可以適當(dāng)減少。觀察訓(xùn)練日志當(dāng)驗證集的 mAP 不再明顯上漲時就可以提前停止。imgsz輸入圖片尺寸。默認(rèn) 640如果香煙目標(biāo)非常小可以嘗試 960 甚至 1280但顯存占用會成倍增加。batch批大小。訓(xùn)練時受顯存限制YOLOv8s 640 輸入 batch16大概需要 8GB 左右顯存。如果顯存不足優(yōu)先把 batch 降到 8 或 4而不是直接換小模型。device指定訓(xùn)練設(shè)備例如device0表示第一張顯卡devicecpu用 CPU。YOLOv8 會自動保存訓(xùn)練過程中的損失曲線、驗證集檢測結(jié)果、混淆矩陣等輸出路徑在runs/detect/train/目錄下。3.3 PyQt5 界面架構(gòu)與多線程必要性PyQt5 的界面開發(fā)遵循三個基本概念信號Signal與槽Slot控件發(fā)生事件如按鈕點擊時發(fā)出信號槽函數(shù)響應(yīng)信號。比如button.clicked.connect(self.on_click)點擊按鈕后自動調(diào)用on_click方法。事件循環(huán)app.exec_()啟動 Qt 事件循環(huán)程序在這里持續(xù)監(jiān)聽用戶操作。線程模型PyQt5 中UI 更新只能在主線程進行。如果你的推理過程直接寫在主線程一旦模型推理耗時較長界面就會“卡死”窗口無法拖動、按鈕無法點擊用戶體驗很差。所以對于攝像頭實時檢測和視頻文件檢測我們通常把“讀取幀 模型推理”放到QThread子線程中完成然后通過信號把處理結(jié)果傳回主線程更新界面。Danger不要在子線程中直接調(diào)用QLabel.setText()、QLabel.setPixmap()等 UI 更新操作會導(dǎo)致崩潰或顯示異常。3.4 數(shù)據(jù)集準(zhǔn)備工作訓(xùn)練一個端到端的吸煙檢測模型最少需要幾百張到兩三千張標(biāo)注圖片。數(shù)據(jù)來源有兩個方向公開數(shù)據(jù)集GitHub、Kaggle 上可以找到 SMOKE 相關(guān)的目標(biāo)檢測數(shù)據(jù)集比如“Smoke Detection Dataset”。有些數(shù)據(jù)集包含 bounding box 標(biāo)注格式可能是 PASCAL VOCxml或 YOLOtxt。自行采集標(biāo)注從監(jiān)控視頻中抽幀篩選出包含吸煙行為的圖片使用 LabelImg 或 Label Studio 標(biāo)注標(biāo)注類別名統(tǒng)一為smoking。數(shù)據(jù)集的目錄結(jié)構(gòu)建議如下smoke_dataset/ ├── images/ │ ├── train/ # 訓(xùn)練集圖片 │ └── val/ # 驗證集圖片 ├── labels/ │ ├── train/ # 對應(yīng)的 yolo 格式 txt 標(biāo)注 │ └── val/ └── smoke.yaml # 數(shù)據(jù)集配置文件其中smoke.yaml內(nèi)容如下# 文件路徑smoke_dataset/smoke.yaml path: D:/projects/smoke_dataset # 數(shù)據(jù)集根目錄Windows 注意斜杠方向 train: images/train val: images/val nc: 1 # 類別數(shù)量 names: [smoking] # 類別名稱YOLO 格式的標(biāo)注 txt 每一行代表一個目標(biāo)類別id 中心點x 中心點y 寬度 高度坐標(biāo)值都做了歸一化范圍在 0 到 1 之間。例如0 0.512345 0.432101 0.123456 0.234567表示這幅圖中有一個“smoking”目標(biāo)中心點在圖片的相對位置 (0.512, 0.432)寬高相對尺寸為 (0.123, 0.235)。4. 完整實戰(zhàn)案例YOLOv8PyQt5 抽煙吸煙檢測系統(tǒng)接下來進入到文章最核心的部分。我會先帶你完成 YOLOv8 模型訓(xùn)練與導(dǎo)出再寫一個完整的 PyQt5 可視化檢測界面支持圖片檢測、視頻文件檢測和攝像頭實時檢測。4.1 創(chuàng)建項目結(jié)構(gòu)先新建一個項目文件夾名字可以叫smoke_detector。目錄結(jié)構(gòu)如下smoke_detector/ ├── train.py # 訓(xùn)練腳本 ├── detect.py # PyQt5 可視化檢測主程序 ├── smoke_dataset/ │ ├── images/ │ ├── labels/ │ └── smoke.yaml └── runs/ └── detect/ └── train/ # 訓(xùn)練輸出模型 └── weights/ └── best.pt4.2 訓(xùn)練 YOLOv8 模型在train.py中寫入# 文件路徑smoke_detector/train.py from ultralytics import YOLO def main(): # 加載預(yù)訓(xùn)練權(quán)重基于 COCO 數(shù)據(jù)集預(yù)訓(xùn)練 model YOLO(yolov8s.pt) # 開始訓(xùn)練 model.train( datasmoke_dataset/smoke.yaml, epochs150, imgsz640, batch16, device0, workers4, patience30, # 30輪沒有提升則提前停止 projectruns/detect, nametrain_smoke, exist_okTrue, ) if __name__ __main__: main()運行python train.py訓(xùn)練結(jié)束后在runs/detect/train_smoke/weights/下會生成兩個文件best.pt驗證集上效果最好的權(quán)重部署時優(yōu)先使用這個last.pt最后一輪的權(quán)重適合斷點續(xù)訓(xùn)你還可以在訓(xùn)練過程中打開runs/detect/train_smoke/val_batch0_pred.jpg這類圖片直觀查看模型在驗證集上的檢測效果。4.3 導(dǎo)出模型為 ONNX可選如果后續(xù)需要做 C 部署、RK3588 等邊緣設(shè)備部署或者其他框架集成可以先把 PyTorch 權(quán)重導(dǎo)出為 ONNX 格式。from ultralytics import YOLO model YOLO(runs/detect/train_smoke/weights/best.pt) model.export(formatonnx, imgsz640, opset12)導(dǎo)出后在相同目錄下會生成best.onnx。這里提醒一下ONNX 導(dǎo)出后建議用onnxruntime測試一遍輸出形狀確保與 PyTorch 模型的輸出一致。不過本文的 PyQt5 系統(tǒng)直接使用.pt權(quán)重不需要導(dǎo)出。4.4 編寫 PyQt5 檢測界面下面給出一個完整可運行的detect.py功能包括選擇圖片文件在界面上顯示檢測結(jié)果選擇視頻文件逐幀檢測并實時顯示打開攝像頭實時檢測顯示當(dāng)前檢測到的吸煙目標(biāo)數(shù)量支持調(diào)整置信度閾值先導(dǎo)入依賴# 文件路徑smoke_detector/detect.py import sys import cv2 import numpy as np from PyQt5.QtWidgets import (QApplication, QMainWindow, QWidget, QLabel, QPushButton, QVBoxLayout, QHBoxLayout, QFileDialog, QSlider, QSpinBox, QComboBox, QMessageBox) from PyQt5.QtCore import Qt, QThread, pyqtSignal, QTimer from PyQt5.QtGui import QImage, QPixmap from ultralytics import YOLO4.4.1 推理線程類視頻和攝像頭檢測需要單獨開線程避免界面卡頓。定義如下class VideoThread(QThread): frame_signal pyqtSignal(np.ndarray, int) # 傳遞圖像和檢測數(shù)量 error_signal pyqtSignal(str) def __init__(self, model, source, conf_thres0.25): super().__init__() self.model model self.source source self.conf_thres conf_thres self.running True def run(self): cap cv2.VideoCapture(self.source) if not cap.isOpened(): self.error_signal.emit(無法打開視頻或攝像頭源: {}.format(self.source)) return while self.running: ret, frame cap.read() if not ret: break # 模型推理 results self.model.predict(sourceframe, confself.conf_thres, verboseFalse) # 在圖像上繪制檢測框 annotated results[0].plot() # 返回標(biāo)注后的 BGR 圖像 # 統(tǒng)計檢測數(shù)量 count len(results[0].boxes) # 發(fā)送到主線程 self.frame_signal.emit(annotated, count) cap.release() def stop(self): self.running False這里有幾個要點需要說明results[0].plot()會直接在原圖上繪制檢測框、類別名和置信度返回 BGR 格式的 numpy 數(shù)組。frame_signal攜帶了圖像和當(dāng)前幀的檢測數(shù)量因為 PyQt 信號可以攜帶多個參數(shù)。線程通過running標(biāo)志位控制循環(huán)退出關(guān)閉窗口或切換檢測源時記得調(diào)用stop()。4.4.2 主窗口類接著定義主界面class SmokeDetectorWindow(QMainWindow): def __init__(self): super().__init__() self.setWindowTitle(YOLOv8 PyQt5 抽煙吸煙檢測識別系統(tǒng)) self.resize(960, 640) # 加載模型 try: self.model YOLO(runs/detect/train_smoke/weights/best.pt) except Exception as e: QMessageBox.critical(self, 模型加載失敗, str(e)) sys.exit(1) self.video_thread None self.conf_thres 0.25 self.init_ui() def init_ui(self): # 中央控件 central_widget QWidget() self.setCentralWidget(central_widget) # 主布局左側(cè)控制區(qū) 右側(cè)顯示區(qū) main_layout QHBoxLayout(central_widget) # 左側(cè)控制面板 control_panel QVBoxLayout() self.btn_image QPushButton(選擇圖片檢測) self.btn_video QPushButton(選擇視頻檢測) self.btn_camera QPushButton(打開攝像頭) self.btn_stop QPushButton(停止) self.btn_stop.setEnabled(False) # 置信度設(shè)置 conf_label QLabel(置信度閾值) self.conf_slider QSlider(Qt.Horizontal) self.conf_slider.setRange(10, 90) self.conf_slider.setValue(25) self.conf_value QLabel(0.25) self.conf_slider.valueChanged.connect(self.on_conf_changed) control_panel.addWidget(self.btn_image) control_panel.addWidget(self.btn_video) control_panel.addWidget(self.btn_camera) control_panel.addWidget(self.btn_stop) control_panel.addWidget(conf_label) control_panel.addWidget(self.conf_slider) control_panel.addWidget(self.conf_value) control_panel.addStretch() # 右側(cè)顯示區(qū) self.label_image QLabel(請選擇圖片、視頻或打開攝像頭) self.label_image.setAlignment(Qt.AlignCenter) self.label_image.setMinimumSize(800, 600) self.label_image.setStyleSheet(border: 1px solid #cccccc; background-color: #f8f8f8;) main_layout.addLayout(control_panel, 1) main_layout.addWidget(self.label_image, 4) # 頂部狀態(tài)欄顯示檢測數(shù)量 self.statusBar().showMessage(就緒) # 綁定按鈕事件 self.btn_image.clicked.connect(self.open_image) self.btn_video.clicked.connect(self.open_video) self.btn_camera.clicked.connect(self.open_camera) self.btn_stop.clicked.connect(self.stop_detection) def on_conf_changed(self, value): self.conf_thres value / 100.0 self.conf_value.setText({:.2f}.format(self.conf_thres))4.4.3 圖片檢測邏輯圖片檢測不需要多線程直接在按鈕回調(diào)里處理即可def open_image(self): file_path, _ QFileDialog.getOpenFileName( self, 選擇圖片, , 圖片文件 (*.jpg *.jpeg *.png *.bmp);;所有文件 (*) ) if not file_path: return # 停止視頻/攝像頭線程 self.stop_detection() image cv2.imread(file_path) if image is None: QMessageBox.warning(self, 提示, 圖片讀取失敗: {}.format(file_path)) return results self.model.predict(sourceimage, confself.conf_thres, verboseFalse) annotated results[0].plot() count len(results[0].boxes) self.show_image(annotated) self.statusBar().showMessage(檢測到吸煙目標(biāo)數(shù)量: {}置信度閾值: {:.2f}.format(count, self.conf_thres)) def show_image(self, img_bgr): # BGR - RGB - QImage rgb_image cv2.cvtColor(img_bgr, cv2.COLOR_BGR2RGB) h, w, ch rgb_image.shape bytes_per_line ch * w q_image QImage(rgb_image.data, w, h, bytes_per_line, QImage.Format_RGB888) # 縮放顯示保持長寬比 pixmap QPixmap.fromImage(q_image) pixmap pixmap.scaled(self.label_image.size(), Qt.KeepAspectRatio, Qt.SmoothTransformation) self.label_image.setPixmap(pixmap)4.4.4 視頻和攝像頭檢測邏輯視頻和攝像頭都是使用VideoThread區(qū)別只是source的值def open_video(self): file_path, _ QFileDialog.getOpenFileName( self, 選擇視頻, , 視頻文件 (*.mp4 *.avi *.mov *.mkv);;所有文件 (*) ) if not file_path: return self.start_video_thread(sourcefile_path) def open_camera(self): # 0 表示默認(rèn)攝像頭如果有多個攝像頭可以修改索引 self.start_video_thread(source0) def start_video_thread(self, source): self.stop_detection() self.video_thread VideoThread(self.model, source, self.conf_thres) self.video_thread.frame_signal.connect(self.on_frame_received) self.video_thread.error_signal.connect(self.on_thread_error) self.video_thread.start() self.btn_stop.setEnabled(True) self.statusBar().showMessage(檢測中...) def on_frame_received(self, frame, count): self.show_image(frame) self.statusBar().showMessage(實時吸煙檢測中當(dāng)前檢測數(shù)量: {}.format(count)) def on_thread_error(self, msg): self.btn_stop.setEnabled(False) QMessageBox.warning(self, 錯誤, msg) def stop_detection(self): if self.video_thread is not None: self.video_thread.stop() self.video_thread.wait() self.video_thread None self.btn_stop.setEnabled(False)4.4.5 程序入口最后是主函數(shù)def main(): app QApplication(sys.argv) window SmokeDetectorWindow() window.show() sys.exit(app.exec_()) if __name__ __main__: main()4.5 運行與驗證在項目根目錄執(zhí)行python detect.py預(yù)期效果點擊“選擇圖片檢測”選擇一張包含吸煙行為的圖片右側(cè)區(qū)域顯示帶檢測框的結(jié)果狀態(tài)欄顯示檢測數(shù)量。點擊“選擇視頻檢測”選擇一段監(jiān)控視頻視頻畫面逐幀顯示檢測框?qū)崟r繪制窗口不卡頓。點擊“打開攝像頭”攝像頭畫面實時顯示移動攝像頭對準(zhǔn)吸煙行為能實時框出目標(biāo)。拖動“置信度閾值”滑塊檢測框的敏感度會變化閾值越高漏檢越多誤檢越少。如果你在圖片檢測時看到結(jié)果說明整個流程已經(jīng)跑通。5. 常見問題與排查思路以下是我在實際運行中遇到較多的問題按“現(xiàn)象 → 原因 → 解決方案”整理成表格方便你快速定位。問題現(xiàn)象常見原因解決思路訓(xùn)練時報錯 CUDA out of memory顯存不足降低 batch 到 4 或 2降低 imgsz 到 640 以下或換 YOLOv8n 模型torch.cuda.is_available() 返回 FalsePyTorch 裝成了 CPU 版本或顯卡驅(qū)動過舊使用nvidia-smi查看 CUDA 版本卸載后重裝對應(yīng)版本的 PyTorchPyQt5 窗口閃退或卡死推理放在主線程或子線程直接更新 UI把推理放到 QThread用信號槽傳回主線程更新 UI無法打開視頻或攝像頭源攝像頭被其他程序占用視頻路徑包含中文且 OpenCV 無法識別關(guān)閉其他攝像頭占用程序路徑盡量不要包含中文檢測效果不好漏檢多數(shù)據(jù)集太小、標(biāo)注質(zhì)量差、置信度閾值太高增加數(shù)據(jù)量檢查標(biāo)注框是否貼合目標(biāo)適當(dāng)降低置信度閾值檢測框抖動明顯閾值過低導(dǎo)致誤檢或模型未收斂提高置信度閾值訓(xùn)練更多 epoch或使用 NMS 參數(shù)調(diào)節(jié)PyQt5 界面顯示圖片顏色異常OpenCV 是 BGR 格式QLabel 顯示需要 RGB使用cv2.cvtColor(img, cv2.COLOR_BGR2RGB)轉(zhuǎn)換模型加載后推理速度很慢使用了 CPU 推理檢查torch.cuda.is_available()確保模型在 GPU 上運行best.onnx導(dǎo)出后推理結(jié)果不一致導(dǎo)出時 opset 版本或動態(tài)軸設(shè)置問題使用 YOLO 官方model.export()默認(rèn)參數(shù)或指定dynamicTrue驗證再補充一個比較隱蔽的問題在 PyQt5 中使用 OpenCV 讀取視頻時如果視頻文件路徑包含中文字符在某些版本的 OpenCV 中會直接返回False。推薦的做法是先把文件復(fù)制到英文路徑或者使用imdecode方式讀取。import cv2 import numpy as np def read_image_unicode(path): data np.fromfile(path, dtypenp.uint8) img cv2.imdecode(data, cv2.IMREAD_COLOR) return img6. 最佳實踐與工程建議6.1 數(shù)據(jù)集層面樣本平衡負(fù)樣本沒有人吸煙、沒有人出現(xiàn)的空場景也要加入訓(xùn)練集讓模型知道“沒有目標(biāo)時不應(yīng)該輸出框”。一般建議正負(fù)樣本比例在 3:1 到 5:1 之間。數(shù)據(jù)增強YOLOv8 默認(rèn)開啟了 mosaic、隨機翻轉(zhuǎn)、色彩擾動等增強策略對提升模型泛化能力很有幫助。如果訓(xùn)練數(shù)據(jù)較少可以手動增加亮度變化、模糊、雨霧等模擬監(jiān)控場景。標(biāo)注邊界標(biāo)注時不要只畫香煙本體最好把“手持香煙的手部區(qū)域”和“嘴部區(qū)域”整體框進去目標(biāo)上下文信息對檢測更有利。對于正在點煙、拿著煙、抽煙、彈煙灰等不同姿態(tài)都要覆蓋。6.2 訓(xùn)練與推理層面多尺度訓(xùn)練如果香煙是小目標(biāo)可以在訓(xùn)練時開啟multi_scaleTrue讓模型接觸多種輸入尺寸增強尺度魯棒性。置信度閾值選擇在工廠場景中誤報代價較高建議閾值設(shè)置在 0.35 到 0.5在消防預(yù)警場景中漏報代價更高建議閾值設(shè)置在 0.15 到 0.25。模型量化如果部署到邊緣設(shè)備如 RK3588、Jetson Nano可以考慮將模型導(dǎo)出為 ONNX 并做 INT8 量化推理速度會有明顯提升但精度會有一定損失需要在實際數(shù)據(jù)上驗證。6.3 PyQt5 工程層面UI 更新統(tǒng)一走信號槽主線程之外的任何線程都不要直接操作控件。攝像頭資源釋放關(guān)閉窗口時一定要調(diào)用video_thread.stop()和cap.release()否則攝像頭會被占用下次打開失敗。使用 QTimer 做定時刷新如果你的業(yè)務(wù)需要輪詢推理結(jié)果比如每 200ms 檢測一次可以用QTimer配合單幀檢測而不是開一個無限循環(huán)線程編寫更容易退出更安全。打包 exe使用 PyInstaller 打包時需要把best.pt和依賴的動態(tài)庫一起打進去建議用--add-data參數(shù)指定模型路徑。打包前先在一個干凈環(huán)境測試避免漏掉動態(tài)庫導(dǎo)致 exe 在其他電腦上無法運行。6.4 合規(guī)提醒吸煙檢測系統(tǒng)通常用于公共場所安全監(jiān)管。在實際部署前請確認(rèn)你的項目符合當(dāng)?shù)仉[私合規(guī)要求包括但不限于在監(jiān)控區(qū)域設(shè)置必要的提示標(biāo)識視頻數(shù)據(jù)存儲和訪問權(quán)限管理只保留業(yè)務(wù)必要的檢測結(jié)果日志避免過度采集作為技術(shù)開發(fā)者我們有責(zé)任確保系統(tǒng)只在合法授權(quán)的場景下使用。7. 總結(jié)與學(xué)習(xí)路線到這里你已經(jīng)完成了一套從訓(xùn)練到桌面落地的吸煙檢測識別系統(tǒng)?;仡櫼幌挛覀冏隽耸裁磾?shù)據(jù)處理整理數(shù)據(jù)集目錄編寫 YOLOv8 訓(xùn)練配置模型訓(xùn)練使用 YOLOv8s 訓(xùn)練自己的吸煙檢測權(quán)重并導(dǎo)出 best.pt界面開發(fā)用 PyQt5 搭建了圖片 / 視頻 / 攝像頭三種檢測入口多線程處理通過 QThread 避免界面卡頓信號槽傳遞檢測結(jié)果異常排查整理了顯存不足、路徑中文、UI 卡死等常見問題的解決辦法如果接下來你想繼續(xù)深入可以從這幾個方向選一個提升檢測精度收集更多真實監(jiān)控場景數(shù)據(jù)或加入注意力機制如 MHSA改進 YOLOv8 的 Neck專門強化小目標(biāo)特征。換用 YOLO11Ultralytics 后續(xù)版本中也有 YOLO11和 YOLOv8 相比在網(wǎng)絡(luò)結(jié)構(gòu)上又做了調(diào)整你可以用同樣的數(shù)據(jù)集對比一下兩者精度和速度。部署到邊緣設(shè)備把導(dǎo)出的 ONNX 模型部署到 RK3588 或其他嵌入式平臺走攝像頭 RTSP 拉流實現(xiàn)更低成本的節(jié)點部署。完善業(yè)務(wù)功能在 PyQt5 中加入檢測記錄查詢、截圖保存、告警彈窗、微信/短信通知等讓系統(tǒng)更接近可交付的產(chǎn)品。這篇文章提供的代碼是一個可運行的最小閉環(huán)實際項目中你還需要根據(jù)自己的數(shù)據(jù)、設(shè)備和業(yè)務(wù)需求去調(diào)整。建議先跑通整套流程再針對薄弱環(huán)節(jié)優(yōu)化。如果你在復(fù)現(xiàn)過程中遇到文章里沒覆蓋到的問題歡迎在評論區(qū)描述你的報錯信息、環(huán)境版本和操作步驟一起交流排查思路。也可以把文章收藏起來等用到的時候直接對照配置。