鍵點(diǎn)的十字眼實(shí)時(shí)檢測(cè)方案)
你如果常做視頻相關(guān)的視覺項(xiàng)目應(yīng)該已經(jīng)發(fā)現(xiàn)了一個(gè)規(guī)律看人的姿態(tài)、動(dòng)作大家都有成熟方案唯獨(dú)“看眼睛在往哪看”這件事做起來總差口氣。這幾年和“用眼行為監(jiān)護(hù)”“疲勞駕駛檢測(cè)”“網(wǎng)課注意力分析”相關(guān)的需求越來越多很多開發(fā)者一上來就想直接訓(xùn)練一個(gè)深度學(xué)習(xí)模型去判斷眼球狀態(tài)結(jié)果被數(shù)據(jù)標(biāo)注折磨到懷疑人生。這篇文章要聊的“十字眼”其實(shí)就是這一類需求里最典型的一個(gè)場(chǎng)景檢測(cè)畫面中的人是否出現(xiàn)了明顯的內(nèi)聚注視狀態(tài)通俗說就是俗稱的對(duì)眼、斗雞眼。我先給一個(gè)明確判斷這類任務(wù)真正值得做、也容易穩(wěn)定落地的方案不是一上來就用神經(jīng)網(wǎng)絡(luò)做端到端分類而是先用輕量級(jí)人臉關(guān)鍵點(diǎn)抽取幾何特征再配合閾值校準(zhǔn)和時(shí)間序列過濾。這并不意味著深度學(xué)習(xí)方案沒有價(jià)值而是它更適合在幾何方案驗(yàn)證之后、樣本積累到一定規(guī)模時(shí)再引入。下面從概念、指標(biāo)、代碼、驗(yàn)證到工程邊界把這條路線完整拆一遍。1. “十字眼”到底是什么先把這個(gè)概念說清楚1.1 先別把它當(dāng)成醫(yī)學(xué)診斷工具很多人看到“十字眼”三個(gè)字第一反應(yīng)是醫(yī)學(xué)上的斜視、內(nèi)斜視。這里要非??酥频卣f明本文討論的不是醫(yī)學(xué)診斷?!笆盅邸痹谶@篇文章里就是一個(gè)視覺演示項(xiàng)目的代號(hào)目標(biāo)是用普通攝像頭盡可能穩(wěn)定地判斷“兩個(gè)眼球是否在明顯地向中間聚攏”。這種狀態(tài)在醫(yī)學(xué)上屬于眼位問題真實(shí)的斜視判斷需要專業(yè)眼科檢查包括遮蓋試驗(yàn)、棱鏡度數(shù)測(cè)量、眼球運(yùn)動(dòng)評(píng)估這些絕不是普通 RGB 攝像頭能替代的。所以如果你的真實(shí)需求是判斷兒童是否斜視請(qǐng)不要使用這篇文章的方案更不要把模型的輸出直接告訴家長(zhǎng)。技術(shù)邊界必須在項(xiàng)目一開始就劃清楚。放到計(jì)算機(jī)視覺領(lǐng)域看這個(gè)問題本質(zhì)上屬于“注視方向估計(jì)”的簡(jiǎn)化版本。它不要求估計(jì)出精確的三維注視向量只需要度量出一個(gè)相對(duì)的、可以前后對(duì)比的內(nèi)聚程度然后輸出一個(gè)提醒信號(hào)。這個(gè)定位非常重要因?yàn)樗鼪Q定了技術(shù)選型、數(shù)據(jù)要求和評(píng)價(jià)標(biāo)準(zhǔn)。1.2 為什么實(shí)時(shí)眼動(dòng)檢測(cè)需求越來越多從場(chǎng)景上看“檢測(cè)眼珠是否明顯內(nèi)聚”至少分布在三個(gè)方向。第一是兒童用眼行為分析。很多家長(zhǎng)關(guān)注孩子近距離用眼但比距離更隱蔽的是眼睛的緊張狀態(tài)。如果孩子長(zhǎng)期湊近屏幕、雙眼高度內(nèi)聚這種不良用眼習(xí)慣比單純的距離遠(yuǎn)近更容易被忽略。第二是網(wǎng)課和在線面試場(chǎng)景的注意力判斷。雖然真正判斷注意力不能只看眼睛但瞳孔方向的連續(xù)變化是一個(gè)很基礎(chǔ)的特征信號(hào)。第三是疲勞駕駛、VR 瞳距提示、多模態(tài)人機(jī)交互。這些場(chǎng)景都需要一個(gè)穩(wěn)定的實(shí)時(shí)眼睛狀態(tài)接口。過去這些需求大多靠數(shù)據(jù)標(biāo)注 深度模型實(shí)現(xiàn)。開發(fā)者的普遍反應(yīng)是標(biāo)注成本高、場(chǎng)景遷移差、很難解釋為什么判斷。而人臉網(wǎng)格關(guān)鍵點(diǎn)技術(shù)成熟之后很多東西可以直接在幾何層面算出來完全沒必要一開始就上重模型。1.3 三種技術(shù)路線對(duì)比做實(shí)時(shí)內(nèi)聚檢測(cè)市場(chǎng)上大體可分成三種路線技術(shù)路線核心思路優(yōu)點(diǎn)缺點(diǎn)建議階段人臉關(guān)鍵點(diǎn) 幾何特征先定位瞳孔和眼角再計(jì)算距離比值無需標(biāo)注、運(yùn)行快、可解釋受角度和光照影響第一階段優(yōu)先做圖像分類模型把眼睛狀態(tài)整體分成“正常/內(nèi)聚”端到端、無需手工特征需要大量數(shù)據(jù)、難解釋數(shù)據(jù)積累后做視線估計(jì)模型回歸注視方向或屏幕坐標(biāo)信息最豐富需要專用數(shù)據(jù)集和標(biāo)定需要確定注視目標(biāo)時(shí)做論文里常遇到的那種“直接輸出一個(gè)視線角度”的研究方案在真實(shí)攝像頭場(chǎng)景下很難復(fù)現(xiàn)原因是普通網(wǎng)絡(luò)攝像頭角度、距離、光線都不受控而幾何方案因?yàn)橛?jì)算的是相對(duì)比例天然對(duì)某些變量不敏感。這里要提醒一個(gè)常見誤區(qū)很多人以為判斷“眼球是否內(nèi)聚”需要知道臉和攝像頭之間的距離。實(shí)際上不需要。我們用的是同一張臉內(nèi)部的長(zhǎng)度比例相當(dāng)于以人臉自身作為尺度單位。理解了這一點(diǎn)后面的代碼思路就順了。2. 核心方案用 MediaPipe FaceMesh 做內(nèi)聚度估計(jì)2.1 為什么使用 MediaPipe 而不是重新訓(xùn)練關(guān)鍵點(diǎn)模型人臉關(guān)鍵點(diǎn)檢測(cè)已經(jīng)是很成熟的方向從早期的 68 點(diǎn) Dlib到后來基于深度學(xué)習(xí)的 106 點(diǎn)、240 點(diǎn)再到現(xiàn)在能輸出 468 點(diǎn)甚至 478 點(diǎn)的 MediaPipe FaceMesh。選擇 MediaPipe 有幾個(gè)實(shí)際優(yōu)勢(shì)。第一它在 CPU 上就能達(dá)到實(shí)時(shí)幀率。Dlib 的 68 點(diǎn)檢測(cè)在普通筆記本上雖然也能跑但內(nèi)存占用和初始化速度不夠友好MediaPipe 移動(dòng)端和桌面端都優(yōu)化得不錯(cuò)。第二FaceMesh 的 refine_landmarks 模式會(huì)額外輸出 10 個(gè)虹膜關(guān)鍵點(diǎn)。這非常關(guān)鍵因?yàn)閭鹘y(tǒng)關(guān)鍵點(diǎn)模型只給你眼眶周圍輪廓很難直接得到瞳孔中心。沒有瞳孔中心位置就只能通過眼眶輪廓猜眼球位置誤差會(huì)非常大。第三它的安裝接入非常簡(jiǎn)單Python 環(huán)境下通過 pip 就能安裝而且自帶跨平臺(tái)的人臉檢測(cè)。我們不必先寫一個(gè)人臉檢測(cè)器再?gòu)慕Y(jié)果里切眼睛MediaPipe 把這一步合并進(jìn)了整個(gè) FaceMesh 推理過程。當(dāng)然也可以用 OpenCV 里的深度學(xué)習(xí)人臉檢測(cè)器再配合高精度瞳孔定位但這需要自己處理很多前后處理邏輯。對(duì)于一個(gè)技術(shù)演示項(xiàng)目來說先用 MediaPipe 把端到端流程跑通再把某個(gè)模塊替換成更合適的模型這是工程師更喜歡的推進(jìn)方式。2.2 FaceMesh 提供的關(guān)鍵點(diǎn)能力FaceMesh 默認(rèn)情況下會(huì)輸出 468 個(gè)人臉關(guān)鍵點(diǎn)。當(dāng)開啟refine_landmarksTrue后輸出點(diǎn)會(huì)擴(kuò)展到 478 個(gè)其中多出來的 10 個(gè)點(diǎn)就是虹膜關(guān)鍵點(diǎn)左右眼各 5 個(gè)點(diǎn)。這 5 個(gè)點(diǎn)里通常中心點(diǎn)表示瞳孔中心另一個(gè)點(diǎn)則分布在虹膜邊緣。本文演示主要用的是 468 和 473 這兩個(gè)索引對(duì)應(yīng)的虹膜中心點(diǎn)。如果你后續(xù)想做更精確的注視方向估計(jì)還可以進(jìn)一步擴(kuò)展。比如計(jì)算瞳孔中心相對(duì)于眼眶中心的位置偏移或者把手上的關(guān)鍵點(diǎn)序列交給一個(gè)輕量級(jí) MLP 去回歸“左/右/中”三個(gè)方向。這里需要補(bǔ)充一個(gè)容易踩坑的細(xì)節(jié)FaceMesh 的關(guān)鍵點(diǎn)索引并不是按照人臉的左右對(duì)稱排列的比如索引 33 和 263 分別對(duì)應(yīng)兩只眼睛的某個(gè)眼角位置。如果讀者需要把“人的左眼”和“人的右眼”區(qū)分開來最好先在正面人臉圖上逐一打印關(guān)鍵點(diǎn)做核對(duì)不要直接照抄網(wǎng)上代碼里的左右眼索引。尤其是攝像頭鏡像開啟之后畫面中的“左”和人的“左”經(jīng)常是反的。2.3 內(nèi)聚度指標(biāo)怎樣設(shè)計(jì)才穩(wěn)定我們需要一個(gè)數(shù)值來度量“兩個(gè)眼球往中間靠了多少”。最直接的想法是計(jì)算兩個(gè)瞳孔中心之間的距離。當(dāng)人看向正前方時(shí)這個(gè)距離是正常瞳距當(dāng)人做斗雞眼動(dòng)作時(shí)兩個(gè)瞳孔都會(huì)向鼻梁方向移動(dòng)瞳距會(huì)變小。所以瞳孔距離本身就是一個(gè)可用特征。但瞳孔距離受到人臉離攝像頭遠(yuǎn)近的影響。人往前走一步瞳孔間的像素距離就會(huì)變大。所以不能只用像素距離必須引入一個(gè)尺度歸一化。本文的方案是用兩只眼睛的外眼角距離作為尺度基準(zhǔn)。外眼角不會(huì)因?yàn)檠壑檗D(zhuǎn)動(dòng)而移動(dòng)它就像一個(gè)“固定在眼眶上的尺子”。這樣無論臉離攝像頭是遠(yuǎn)還是近內(nèi)聚度指標(biāo)都會(huì)穩(wěn)定在一個(gè)區(qū)間里。指標(biāo)定義如下pupil_distance兩個(gè)瞳孔中心之間的歐氏距離。corner_distance兩只眼睛外側(cè)眼角之間的歐氏距離。cross_ratio pupil_distance / corner_distance。正常放松狀態(tài)下corner_distance基本不變。瞳孔向中間移動(dòng)時(shí)pupil_distance會(huì)下降于是cross_ratio變小。判斷是否處于“十字眼”狀態(tài)可以和用戶自己校準(zhǔn)得到的正常狀態(tài)基線做對(duì)比。我更推薦“相對(duì)變化率”思路而不是設(shè)定一個(gè)全球通用的絕對(duì)閾值。因?yàn)椴煌说耐?、臉型、眼睛大小差異很大絕對(duì)閾值幾乎必然誤判。這里解釋一下為什么“相對(duì)變化”比“絕對(duì)閾值”更符合工程直覺。假設(shè)你需要判斷一個(gè)用戶是否長(zhǎng)時(shí)間保持緊張內(nèi)聚狀態(tài)。你沒辦法預(yù)先知道這個(gè)用戶正常狀態(tài)下的瞳孔距離到底是多少但你可以在程序啟動(dòng)后讓他先正視攝像頭幾秒鐘采集 30 幀左右的基準(zhǔn)比例。后續(xù)每一幀計(jì)算出的比例都和這個(gè)基準(zhǔn)相比。一旦比例持續(xù)下降到基準(zhǔn)的某個(gè)百分比以下就認(rèn)為發(fā)生了明顯內(nèi)聚。這本質(zhì)上是一種“個(gè)人化標(biāo)定”。在實(shí)際代碼里還有一個(gè)問題必須處理單幀的瞳孔檢測(cè)噪聲很大。MediaPipe 的虹膜關(guān)鍵點(diǎn)雖然穩(wěn)定但受眨眼、角度、光線的影響偶爾會(huì)抖動(dòng)。避免誤報(bào)的方法是增加時(shí)間窗口判斷比如連續(xù) 8 幀中有 6 幀滿足條件才輸出一次報(bào)警信號(hào)。這會(huì)犧牲一點(diǎn)實(shí)時(shí)性但換來的是體驗(yàn)上的穩(wěn)定感。3. 環(huán)境準(zhǔn)備需要安裝哪些依賴本文演示代碼基于 Python 3推薦使用 3.9 到 3.12 之間的版本。具體版本請(qǐng)以實(shí)際安裝環(huán)境為準(zhǔn)重點(diǎn)是先創(chuàng)建虛擬環(huán)境再把以下依賴裝進(jìn)去。python -m venv cross_env source cross_env/bin/activate pip install opencv-python pip install mediapipe pip install numpy如果你是 Windows 環(huán)境激活虛擬環(huán)境的命令是cross_env\Scripts\activate這里需要提醒幾點(diǎn)MediaPipe 包較大安裝時(shí)需要耐心等待如果安裝失敗優(yōu)先檢查 Python 版本兼容性。OpenCV 在某些 Linux 環(huán)境下可能需要額外安裝 libgl1 之類的系統(tǒng)依賴。如果安裝過程中出現(xiàn)網(wǎng)絡(luò)問題導(dǎo)致模型文件下載失敗處理思路是檢查網(wǎng)絡(luò)和依賴源不要選擇繞路方式。后面運(yùn)行演示時(shí)如果下載人臉模型失敗也是同樣的處理思路。4. 核心代碼演示實(shí)時(shí)“十字眼”檢測(cè)程序很多教程喜歡把代碼拆成一堆函數(shù)然后分開講但讀者復(fù)制起來很容易漏掉上下文。這里我給出一份完整的單文件演示腳本文件路徑建議為cross_eye_demo.py。# 文件路徑cross_eye_demo.py import math import statistics import cv2 import mediapipe as mp import numpy as np mp_face_mesh mp.solutions.face_mesh # FACEMESH_LEFT_EYE / FACEMESH_RIGHT_EYE 只包含眼眶的連線邊 # 我們從這些邊里取出所有用到的點(diǎn)索引。 left_eye_indices list({p for edge in mp_face_mesh.FACEMESH_LEFT_EYE for p in edge}) right_eye_indices list({p for edge in mp_face_mesh.FACEMESH_RIGHT_EYE for p in edge}) def get_outer_corner(landmarks, indices, frame_w, frame_h): 返回一只眼睛最外側(cè)的那個(gè)眼角點(diǎn)坐標(biāo) points [ (landmarks[i].x * frame_w, landmarks[i].y * frame_h) for i in indices ] # 對(duì)左眼最外側(cè)即 x 坐標(biāo)最小的點(diǎn) # 對(duì)右眼最外側(cè)即 x 坐標(biāo)最大的點(diǎn) if indices left_eye_indices: return min(points, keylambda p: p[0]) return max(points, keylambda p: p[0]) def distance(p1, p2): return math.sqrt((p1[0] - p2[0]) ** 2 (p1[1] - p2[1]) ** 2) def process_frame(frame, face_landmarks, baseline_ratio): frame_h, frame_w frame.shape[:2] landmarks face_landmarks.landmark # 當(dāng) refine_landmarksTrue 時(shí)索引 468 和 473 是兩個(gè)瞳孔中心點(diǎn) if len(landmarks) 474: return frame, None pupil_a (landmarks[468].x * frame_w, landmarks[468].y * frame_h) pupil_b (landmarks[473].x * frame_w, landmarks[473].y * frame_h) left_corner get_outer_corner(landmarks, left_eye_indices, frame_w, frame_h) right_corner get_outer_corner(landmarks, right_eye_indices, frame_w, frame_h) pupil_dist distance(pupil_a, pupil_b) corner_dist distance(left_corner, right_corner) if corner_dist 1e-6: return frame, None ratio pupil_dist / corner_dist status normal if baseline_ratio is not None: change (ratio - baseline_ratio) / baseline_ratio if change -0.12: status cross # 畫兩個(gè)瞳孔中心點(diǎn) cv2.circle(frame, (int(pupil_a[0]), int(pupil_a[1])), 5, (0, 255, 0), -1) cv2.circle(frame, (int(pupil_b[0]), int(pupil_b[1])), 5, (0, 255, 0), -1) # 在兩眼中間位置畫一個(gè)十字這就是“十字眼”提醒標(biāo)記 mid_x int((pupil_a[0] pupil_b[0]) / 2) mid_y int((pupil_a[1] pupil_b[1]) / 2) color (0, 255, 255) label_text cross ratio: {:.3f}.format(ratio) if status cross: color (0, 0, 255) label_text CROSS EYE! ratio: {:.3f}.format(ratio) cv2.line(frame, (mid_x - 30, mid_y), (mid_x 30, mid_y), color, 2) cv2.line(frame, (mid_x, mid_y - 30), (mid_x, mid_y 30), color, 2) cv2.putText(frame, label_text, (30, 50), cv2.FONT_HERSHEY_SIMPLEX, 0.9, color, 2) return frame, status def main(): cap cv2.VideoCapture(0) if not cap.isOpened(): print(無法打開攝像頭請(qǐng)檢查設(shè)備號(hào) 0 是否正確。) return baseline_ratio None calibrate_frames [] recent_status [] face_mesh mp_face_mesh.FaceMesh( static_image_modeFalse, max_num_faces1, refine_landmarksTrue, min_detection_confidence0.5, min_tracking_confidence0.5, ) print(按鍵說明) print( c - 采集當(dāng)前 30 幀作為正常的十字比例基線) print( q - 退出程序) while True: ok, frame cap.read() if not ok: print(讀取攝像頭畫面失敗。) break frame cv2.flip(frame, 1) rgb_frame cv2.cvtColor(frame, cv2.COLOR_BGR2RGB) results face_mesh.process(rgb_frame) if results.multi_face_landmarks: face_landmarks results.multi_face_landmarks[0] frame, status process_frame(frame, face_landmarks, baseline_ratio) # 用一個(gè)長(zhǎng)度為 8 的隊(duì)列減少單幀誤檢 if status is not None: recent_status.append(status) if len(recent_status) 8: recent_status.pop(0) if baseline_ratio is not None: cross_count recent_status.count(cross) if cross_count 5: cv2.putText(frame, REMINDER: eyes are crossing, (30, 100), cv2.FONT_HERSHEY_SIMPLEX, 0.9, (0, 0, 255), 2) cv2.imshow(Cross Eye Demo, frame) key cv2.waitKey(1) 0xFF if key ord(c) and results.multi_face_landmarks: face_landmarks results.multi_face_landmarks[0] frame_h, frame_w frame.shape[:2] landmarks face_landmarks.landmark if len(landmarks) 474: pupil_a (landmarks[468].x * frame_w, landmarks[468].y * frame_h) pupil_b (landmarks[473].x * frame_w, landmarks[473].y * frame_h) left_corner get_outer_corner(landmarks, left_eye_indices, frame_w, frame_h) right_corner get_outer_corner(landmarks, right_eye_indices, frame_w, frame_h) corner_dist distance(left_corner, right_corner) if corner_dist 1e-6: calibrate_frames.append(distance(pupil_a, pupil_b) / corner_dist) if len(calibrate_frames) 30: baseline_ratio statistics.mean(calibrate_frames[-30:]) calibrate_frames.clear() print(校準(zhǔn)完成baseline_ratio {:.4f}.format(baseline_ratio)) if key ord(q): break cap.release() cv2.destroyAllWindows() if __name__ __main__: main()這份代碼的核心邏輯分成三個(gè)部分。第一部分是從 FaceMesh 結(jié)果中取出眼睛周邊的關(guān)鍵點(diǎn)索引。FACEMESH_LEFT_EYE和FACEMESH_RIGHT_EYE是 MediaPipe 預(yù)置的常量表示左右眼的輪廓連線。通過集合去重得到眼角區(qū)域的點(diǎn)集合再做 min / max 操作找到左右兩只眼睛各自的外眼角。第二部分是計(jì)算內(nèi)聚度。代碼使用兩個(gè)瞳孔中心點(diǎn) 468 和 473再和外眼角距離做比例運(yùn)算。這里沒有預(yù)先設(shè)定判斷閾值而是按 c 鍵校準(zhǔn)用戶正常狀態(tài)基線。這是為了適應(yīng)不同人臉。第三部分是滑窗過濾。recent_status保留最近 8 幀的狀態(tài)只有 “cross” 出現(xiàn) 5 次以上才在畫面上輸出提醒文字。這樣一來偶爾閃光、眨眼、頭部快速轉(zhuǎn)動(dòng)造成的瞬間誤檢都不會(huì)輕易觸發(fā)報(bào)警。還有兩個(gè)實(shí)現(xiàn)細(xì)節(jié)需要說明。關(guān)于代碼中的cv2.flip(frame, 1)這是為了讓畫面看起來更像鏡子效果。如果不想翻轉(zhuǎn)可以去掉但要注意瞳孔關(guān)鍵點(diǎn)的位置相對(duì)關(guān)系會(huì)變化對(duì)外眼角判斷沒有本質(zhì)影響所以不必過于擔(dān)心。關(guān)于 468 和 473 這兩個(gè)索引它們只在refine_landmarksTrue時(shí)可靠輸出。如果讀者運(yùn)行后發(fā)現(xiàn)程序提示關(guān)鍵點(diǎn)不足 474 個(gè)首要檢查的是 FaceMesh 構(gòu)造參數(shù)是否開啟了refine_landmarks其次再檢查 MediaPipe 的版本是否過舊。5. 運(yùn)行結(jié)果與效果驗(yàn)證運(yùn)行前先確認(rèn)攝像頭可用。python cross_eye_demo.py程序啟動(dòng)后會(huì)彈出一個(gè)名為Cross Eye Demo的窗口。正常情況下你會(huì)在窗口里看到自己的臉部畫面兩個(gè)瞳孔中心被畫成綠色小圓點(diǎn)兩眼中間會(huì)顯示一條黃色或紅色的十字線。這時(shí)候先不要急著做斗雞眼動(dòng)作第一步是先校準(zhǔn)。保持頭部正直眼睛看向攝像頭方向保持自然放松然后按下 c 鍵。程序采集 30 幀正常狀態(tài)的比例值并打印校準(zhǔn)完成baseline_ratio 0.6834如果你按 c 時(shí)沒有打印校準(zhǔn)完成很可能是因?yàn)楫?dāng)前畫面沒有人臉或者按下 c 的那一幀沒有檢測(cè)到 478 個(gè)關(guān)鍵點(diǎn)。重新調(diào)整人臉位置確保人臉完整出現(xiàn)在畫面內(nèi)再試。校準(zhǔn)完成后再做一次“對(duì)眼”動(dòng)作。正常情況下你能看到狀態(tài)文字從綠色變成紅色同時(shí)顯示CROSS EYE!提醒。如果連續(xù)多幀保持這個(gè)狀態(tài)畫面左上角會(huì)出現(xiàn)第二行紅色提醒文字REMINDER: eyes are crossing驗(yàn)證是否真正有效的另一個(gè)方法是用基線比例的變化觀察。不按 c 直接把程序默認(rèn)邏輯跑起來也能看到每個(gè)人的數(shù)字有差異。但這種絕對(duì)數(shù)值無法直接判斷是否對(duì)人眼進(jìn)行了過度內(nèi)聚動(dòng)作所以建議還是先校準(zhǔn)再測(cè)試。如果畫面中的十字線位置和瞳孔中心位置嚴(yán)重偏離需要檢查是不是開啟了 0 號(hào)攝像頭外的另一個(gè)設(shè)備??梢試L試把VideoCapture(0)改成VideoCapture(1)。6. 離線圖片檢測(cè)適合快速聯(lián)調(diào)與回歸測(cè)試攝像頭實(shí)時(shí)檢測(cè)有一個(gè)麻煩每次測(cè)試都需要人坐在攝像頭前不方便批量驗(yàn)證代碼修改。開發(fā)過程中更推薦準(zhǔn)備一批圖片樣本跑離線腳本快速檢查輸出指標(biāo)。下面這個(gè)腳本可以直接用在單張圖片上# 文件路徑cross_eye_offline.py import sys import math import cv2 import mediapipe as mp mp_face_mesh mp.solutions.face_mesh left_eye_indices list({p for edge in mp_face_mesh.FACEMESH_LEFT_EYE for p in edge}) right_eye_indices list({p for edge in mp_face_mesh.FACEMESH_RIGHT_EYE for p in edge}) def outer_corner(landmarks, indices, w, h): points [(landmarks[i].x * w, landmarks[i].y * h) for i in indices] if indices left_eye_indices: return min(points, keylambda p: p[0]) return max(points, keylambda p: p[0]) def main(image_path): image cv2.imread(image_path) if image is None: print(圖片讀取失敗:, image_path) return h, w image.shape[:2] with mp_face_mesh.FaceMesh( static_image_modeTrue, max_num_faces1, refine_landmarksTrue, min_detection_confidence0.5, ) as face_mesh: rgb cv2.cvtColor(image, cv2.COLOR_BGR2RGB) results face_mesh.process(rgb) if not results.multi_face_landmarks: print(沒有檢測(cè)到人臉) return landmarks results.multi_face_landmarks[0].landmark if len(landmarks) 474: print(關(guān)鍵點(diǎn)數(shù)量不足請(qǐng)檢查 refine_landmarks 參數(shù)) return pupil_a (landmarks[468].x * w, landmarks[468].y * h) pupil_b (landmarks[473].x * w, landmarks[473].y * h) left_corner outer_corner(landmarks, left_eye_indices, w, h) right_corner outer_corner(landmarks, right_eye_indices, w, h) pupil_dist math.dist(pupil_a, pupil_b) corner_dist math.dist(left_corner, right_corner) ratio pupil_dist / corner_dist cv2.circle(image, (int(pupil_a[0]), int(pupil_a[1])), 5, (0, 255, 0), -1) cv2.circle(image, (int(pupil_b[0]), int(pupil_b[1])), 5, (0, 255, 0), -1) mid_x int((pupil_a[0] pupil_b[0]) / 2) mid_y int((pupil_a[1] pupil_b[1]) / 2) cv2.line(image, (mid_x - 30, mid_y), (mid_x 30, mid_y), (0, 0, 255), 2) cv2.line(image, (mid_x, mid_y - 30), (mid_x, mid_y 30), (0, 0, 255), 2) print(cross_ratio {:.4f}.format(ratio)) cv2.imshow(Offline Result, image) cv2.waitKey(0) if __name__ __main__: if len(sys.argv) 2: print(用法: python cross_eye_offline.py 圖片路徑) else: main(sys.argv[1])運(yùn)行方式python cross_eye_offline.py demo.jpg使用離線腳本時(shí)建議準(zhǔn)備三類圖片正常平視狀態(tài)、明顯內(nèi)聚狀態(tài)、不存在人臉的背景圖。用它們作為最小回歸樣本集每次改動(dòng)指標(biāo)計(jì)算邏輯后都跑一遍觀察cross_ratio是否符合預(yù)期。這套圖片回歸流程非常值得在項(xiàng)目早期就建立起來。因?yàn)閹缀翁卣魉惴ㄐ薷钠饋砗芸斓庋塾^察攝像頭畫面很難發(fā)現(xiàn)細(xì)微的指標(biāo)變化圖片腳本可以讓你把每個(gè)測(cè)試用例的變化輸出到命令行方便對(duì)比。7. 如果要做深度學(xué)習(xí)分類模型需要準(zhǔn)備哪些東西幾何方案的局限在于它只能做一個(gè)相對(duì)粗略的狀態(tài)判斷。如果場(chǎng)景里有強(qiáng)烈的人臉角度變化、遮擋、暗光或者用戶是兒童、老人等差異很大的群體幾何比例可能不夠穩(wěn)定。此時(shí)可以考慮在積累一批數(shù)據(jù)后訓(xùn)練一個(gè)輕量級(jí)的圖像分類器但不要一上來就重復(fù)造數(shù)據(jù)。推薦的流程是用第 6 節(jié)的離線腳本先采集一批帶有cross_ratio的圖片把明顯低于個(gè)人基線的圖片篩出來再經(jīng)過人工確認(rèn)形成兩個(gè)類別的訓(xùn)練集。使用 MobileNet 這樣的輕量網(wǎng)絡(luò)訓(xùn)練二分類任務(wù)即可。它的優(yōu)勢(shì)是容易部署在 CPU 上也能達(dá)到較高幀率。準(zhǔn)備數(shù)據(jù)集的目錄結(jié)構(gòu)可以這樣設(shè)計(jì)dataset/ normal/ 0001.jpg 0002.jpg cross/ 0001.jpg 0002.jpg訓(xùn)練腳本可以直接使用 PyTorch 編寫核心結(jié)構(gòu)如下。這個(gè)示例不做數(shù)據(jù)增強(qiáng)方面的展開重點(diǎn)是讓讀者理解模型的輸入輸出邊界。# 文件路徑train_classifier.py import torch import torch.nn as nn from torch.utils.data import DataLoader, Dataset from torchvision import datasets, transforms, models device torch.device(cpu) transform transforms.Compose([ transforms.Resize((224, 224)), transforms.ToTensor(), transforms.Normalize(mean[0.485, 0.456, 0.406], std[0.229, 0.224, 0.225]), ]) train_data datasets.ImageFolder(dataset, transformtransform) train_loader DataLoader(train_data, batch_size16, shuffleTrue) model models.mobilenet_v2(weightsNone, num_classes2) optimizer torch.optim.Adam(model.parameters(), lr1e-4) loss_fn nn.CrossEntropyLoss() model.train() for epoch in range(10): total_loss 0.0 for images, labels in train_loader: optimizer.zero_grad() outputs model(images) loss loss_fn(outputs, labels) loss.backward() optimizer.step() total_loss loss.item() print(epoch {} loss: {:.4f}.format(epoch 1, total_loss)) torch.save(model.state_dict(), cross_eye_model.pth)這個(gè)訓(xùn)練腳本只作為演示框架真正的工程應(yīng)用中必須加入驗(yàn)證集、早停、數(shù)據(jù)增強(qiáng)和類別權(quán)重調(diào)整。通常來說“cross”類別出現(xiàn)的頻率遠(yuǎn)低于“normal”類別所以訓(xùn)練時(shí)如果不做正負(fù)樣本平衡模型會(huì)很快收斂到“永遠(yuǎn)輸出 normal”這種沒用的狀態(tài)。更合理的實(shí)踐是幾何算法承擔(dān)實(shí)時(shí)預(yù)篩選只有檢測(cè)到持續(xù)可疑狀態(tài)時(shí)才記錄短視頻片段再人工篩選出高質(zhì)量樣本。用這種主動(dòng)學(xué)習(xí)方式采集數(shù)據(jù)比讓標(biāo)注員對(duì)著普通視頻打標(biāo)簽要高效得多。8. 常見問題、排查思路與方案邊界在實(shí)際運(yùn)行中讀者遇到的大部分問題不是模型不準(zhǔn)確而是環(huán)境、關(guān)鍵點(diǎn)索引和判斷邏輯帶來的誤差。問題現(xiàn)象可能原因排查方式解決方案運(yùn)行時(shí)提示關(guān)鍵點(diǎn)不足 474沒有開啟 refine_landmarks 參數(shù)查看 FaceMesh 構(gòu)造參數(shù)設(shè)置 refine_landmarksTrue攝像頭打不開設(shè)備號(hào)錯(cuò)誤或設(shè)備被占用檢查 task manager 相機(jī)占用更換 VideoCapture 設(shè)備號(hào)檢測(cè)不到人臉光線過暗、側(cè)臉角度過大觀察原始畫面亮度增加補(bǔ)光保持正臉cross_ratio 一直波動(dòng)很大單幀瞳孔中心跳動(dòng)輸出連續(xù) 50 幀數(shù)值增加中值濾波或滑窗判斷做斗雞眼動(dòng)作不觸發(fā)報(bào)警閾值變化設(shè)定太嚴(yán)格打印 ratio 和 baseline調(diào)整變化率閾值如 -0.12 改 -0.08正常狀態(tài)下誤報(bào)校準(zhǔn)不準(zhǔn)確或面部角度變化觀察校準(zhǔn)期間頭部是否移動(dòng)清空校準(zhǔn)數(shù)據(jù)后重新按 c圖片結(jié)果和視頻結(jié)果不一致圖片分辨率問題比較兩張圖人臉寬度按人臉框比例統(tǒng)一裁剪需要特別指出的是方案本身有明確的邊界。如果人臉左右旋轉(zhuǎn)超過 30 度外眼角坐標(biāo)可能有遮擋比例會(huì)不可靠。如果佩戴眼鏡或墨鏡虹膜關(guān)鍵點(diǎn)的質(zhì)量也會(huì)明顯下降。FaceMesh 的虹膜關(guān)鍵點(diǎn)本質(zhì)上是在二維圖像上估計(jì)的只要光線和角度不合適瞳孔中心點(diǎn)就會(huì)偏移。所以這類觸發(fā)的判斷更適合做成“提醒”而不是“結(jié)論”。9. 工程化建議從演示到可以長(zhǎng)期跑的最小系統(tǒng)把演示代碼變成可以長(zhǎng)期運(yùn)行的系統(tǒng)還需要考慮幾個(gè)問題。第一是校準(zhǔn)策略。無論多完美的幾何指標(biāo)都不能在沒有個(gè)人校準(zhǔn)的情況下貿(mào)然報(bào)警。程序第一次運(yùn)行時(shí)可以引導(dǎo)用戶正視攝像頭 2 到 3 秒完成自動(dòng)采集。如果用戶姿勢(shì)不對(duì)需要給出清晰的重新校準(zhǔn)提示。更完整的產(chǎn)品還可以記住不同用戶的校準(zhǔn)結(jié)果以用戶 ID 為維度存儲(chǔ)基線數(shù)據(jù)。第二是報(bào)警策略。連續(xù)多幀觸發(fā)才提醒這個(gè)邏輯非常必要。單純看一幀很容易被眨眼干擾建議判斷窗口不少于 8 幀同時(shí)把提醒狀態(tài)恢復(fù)的滯后也做進(jìn)去。比如從cross恢復(fù)到normal需要連續(xù) 5 幀正常不然用戶稍微動(dòng)作調(diào)整一下提醒就會(huì)閃爍不停。第三是隱私保護(hù)。實(shí)時(shí)攝像頭畫面屬于敏感視覺數(shù)據(jù)如果程序要部署到兒童用眼行為分析的使用場(chǎng)景里視頻流不能隨便上傳到公共服務(wù)器更不能長(zhǎng)時(shí)間保存原始幀。建議只在設(shè)備本地完成推理按需保存“觸發(fā)提醒時(shí)間點(diǎn)前后 1 秒的匿名化特征數(shù)據(jù)”而不是保存完整視頻。第四是記錄與回看。當(dāng)檢測(cè)到提醒時(shí)程序應(yīng)同時(shí)記錄當(dāng)前時(shí)間、cross_ratio、baseline_ratio和一段時(shí)間內(nèi)的趨勢(shì)變化。這類日志比單張告警截圖更有價(jià)值。后續(xù)如果要訓(xùn)練分類模型這些帶連續(xù)指標(biāo)的日志可以輔助生成更高質(zhì)量的訓(xùn)練集。第五也是很重要的一點(diǎn)不要把提醒話說成疾病判斷。產(chǎn)品界面上應(yīng)顯示“眼睛距離屏幕可能過近建議休息”這類行為提醒而不是“疑似斜視”這類醫(yī)療判斷。技術(shù)演示可以做得很快但產(chǎn)品化時(shí)必須考慮輸出內(nèi)容的場(chǎng)景和受眾避免引起不必要的焦慮和錯(cuò)誤解讀。如果你只是想快速驗(yàn)證這套思路建議從第 4 節(jié)的視頻代碼開始跑通再補(bǔ)充一批離線測(cè)試圖片觀察數(shù)值。真正要做長(zhǎng)期注視行為分析時(shí)再考慮加入視線估計(jì)模型或者深度學(xué)習(xí)分類器。用幾何特征守住基礎(chǔ)判斷用深度學(xué)習(xí)提升復(fù)雜場(chǎng)景的泛化能力是目前做眼動(dòng)類小成本項(xiàng)目比較務(wù)實(shí)的路線。這一步走完后續(xù)再做疲勞檢測(cè)、注意力分析、視線落點(diǎn)估計(jì)就有了統(tǒng)一的基礎(chǔ)特征層可供復(fù)用。