習(xí)的交警手勢(shì)識(shí)別:從關(guān)鍵點(diǎn)提取到時(shí)序分類實(shí)戰(zhàn))
簡(jiǎn)介基于Python與深度學(xué)習(xí)實(shí)現(xiàn)的中國(guó)交通警察指揮手勢(shì)識(shí)別項(xiàng)目面向畢業(yè)設(shè)計(jì)、課程設(shè)計(jì)及項(xiàng)目開(kāi)發(fā)場(chǎng)景提供完整源碼與配套數(shù)據(jù)集幫助學(xué)習(xí)者快速掌握?qǐng)D像分類、手勢(shì)識(shí)別等計(jì)算機(jī)視覺(jué)任務(wù)的工程實(shí)現(xiàn)流程。壓縮包共37個(gè)文件核心為31個(gè)Python腳本涵蓋模型定義、訓(xùn)練、測(cè)試及基礎(chǔ)功能測(cè)試另含2個(gè)Markdown說(shuō)明文檔和1個(gè)TXT文件用于指導(dǎo)環(huán)境配置與項(xiàng)目運(yùn)行附帶GIF演示、gitignore及l(fā)icense文件整體僅4.43MB輕量易獲取。目前已有499人學(xué)習(xí)參考適合計(jì)算機(jī)視覺(jué)、深度學(xué)習(xí)方向的學(xué)生作為課設(shè)或畢設(shè)的起步模板。資源內(nèi)目錄結(jié)構(gòu)清晰主模塊與訓(xùn)練、預(yù)測(cè)代碼分離模型文件和文檔一目了然項(xiàng)目源碼經(jīng)過(guò)嚴(yán)格測(cè)試可直接運(yùn)行并在此基礎(chǔ)上擴(kuò)展功能。無(wú)論用于課堂展示、課程報(bào)告還是個(gè)人項(xiàng)目都能幫助理解交警手勢(shì)識(shí)別從數(shù)據(jù)準(zhǔn)備到模型部署的完整鏈路是兼顧實(shí)用性與學(xué)習(xí)價(jià)值的參考資料。1. 把“基于Python和深度學(xué)習(xí)開(kāi)發(fā)的中國(guó)交通警察指揮手勢(shì)識(shí)別”當(dāng)普通圖像分類來(lái)做大概率會(huì)翻車把“基于Python和深度學(xué)習(xí)開(kāi)發(fā)中國(guó)交通警察指揮手勢(shì)識(shí)別”這類題目當(dāng)普通圖像分類來(lái)做大概率會(huì)在答辯現(xiàn)場(chǎng)翻車。交警手勢(shì)識(shí)別的核心難點(diǎn)不在“認(rèn)出畫(huà)面里有個(gè)人”而在把連續(xù)骨架動(dòng)作切分成有語(yǔ)義的手勢(shì)片段再判定是哪一種指揮動(dòng)作。網(wǎng)上躺著很多相關(guān)源碼但能從頭訓(xùn)練到實(shí)時(shí)演示的完整方案很少數(shù)據(jù)集也大多是零散視頻或未清洗的圖片。這篇文章面向畢業(yè)設(shè)計(jì)、課程設(shè)計(jì)和想快速落地這個(gè)方向的開(kāi)發(fā)者我會(huì)把數(shù)據(jù)標(biāo)注、關(guān)鍵點(diǎn)訓(xùn)練、時(shí)序分類、界面打包四塊依次講清楚參數(shù)怎么設(shè)、坑在哪一次說(shuō)透。2. 數(shù)據(jù)集與標(biāo)注流程評(píng)分點(diǎn)的第一塊拼圖2.1 公開(kāi)數(shù)據(jù)很難直接復(fù)用自建為主官方視頻為輔交警手勢(shì)識(shí)別沒(méi)有像COCO那樣標(biāo)準(zhǔn)的公開(kāi)數(shù)據(jù)集網(wǎng)上能搜到的一些“yolo手勢(shì)識(shí)別數(shù)據(jù)集”普遍存在三類問(wèn)題樣本量太小、標(biāo)簽體系不統(tǒng)一有人標(biāo)8類有人標(biāo)6類還有人把左轉(zhuǎn)彎待轉(zhuǎn)信號(hào)和左轉(zhuǎn)彎信號(hào)混在一起、視頻拍攝視角都是正面固定機(jī)位。如果你帶著這些數(shù)據(jù)去做課程設(shè)計(jì)訓(xùn)練出來(lái)的模型一拿到實(shí)驗(yàn)室攝像頭前就廢因?yàn)榻嵌?、距離、光照全變了。所以我一般建議用“自建為主、官方宣傳視頻為輔”的路子。自建數(shù)據(jù)具體分兩步找?guī)锥谓痪謩?shì)教學(xué)視頻或者自己比劃著錄用手機(jī)三腳架固定機(jī)位分別拍正面、左側(cè)面、右側(cè)面三個(gè)角度然后按《道路交通安全法實(shí)施條例》規(guī)定的8種手勢(shì)來(lái)建標(biāo)簽——停止信號(hào)、直行信號(hào)、左轉(zhuǎn)彎信號(hào)、左轉(zhuǎn)彎待轉(zhuǎn)信號(hào)、右轉(zhuǎn)彎信號(hào)、變道信號(hào)、減速慢行信號(hào)、示意車輛靠邊停車信號(hào)。數(shù)據(jù)量的底線是每類150到300張有效單幀8類合計(jì)1500到2500張這足夠訓(xùn)練一個(gè)能交差的小模型。如果條件允許每類做到500張配合數(shù)據(jù)增強(qiáng)泛化能力會(huì)明顯上一個(gè)臺(tái)階。注意采集時(shí)人的身高、服裝、距離要有點(diǎn)變化否則后面推理階段一換環(huán)境就崩這個(gè)問(wèn)題我在第五章展開(kāi)講。2.2 從視頻里切出訓(xùn)練圖片半小時(shí)做出一批干凈樣本拿到視頻后第一步是切幀。這里有個(gè)關(guān)鍵細(xì)節(jié)不要每幀都存連續(xù)幀之間相似度太高訓(xùn)練時(shí)會(huì)讓模型過(guò)擬合到背景上。我習(xí)慣每隔2到3幀抽一張這樣同樣的動(dòng)作量下樣本多樣性會(huì)好很多。還要按標(biāo)注好的時(shí)間段切只保留“手勢(shì)開(kāi)始到手勢(shì)結(jié)束”這一段。切幀代碼非常簡(jiǎn)單核心是一個(gè)循環(huán)加一個(gè)區(qū)間判斷import os import csv import cv2 def load_annotations(csv_path): 讀取人工標(biāo)注的手勢(shì)時(shí)間區(qū)間表 items [] with open(csv_path, newline, encodingutf-8) as f: reader csv.DictReader(f) for row in reader: items.append({ start: int(row[start_frame]), end: int(row[end_frame]), label: row[label] }) return items def cut_frames(video_path, csv_path, save_dir, interval2): 按標(biāo)注區(qū)間抽樣出單幀圖片 interval: 每隔幾幀取一張, 建議2或3 cap cv2.VideoCapture(video_path) annotations load_annotations(csv_path) frame_idx 0 saved_count 0 while True: ret, frame cap.read() if not ret: break # 判斷當(dāng)前幀落在哪個(gè)手勢(shì)區(qū)間 label None for ann in annotations: if ann[start] frame_idx ann[end]: label ann[label] break if label and frame_idx % interval 0: label_dir os.path.join(save_dir, label) os.makedirs(label_dir, exist_okTrue) cv2.imwrite(os.path.join(label_dir, f{saved_count:05d}.jpg), frame) saved_count 1 frame_idx 1 cap.release()這個(gè)腳本的參數(shù)就三個(gè)值得調(diào)interval控制抽樣密度動(dòng)作慢的手勢(shì)比如“減速慢行信號(hào)”建議設(shè)成2動(dòng)作快的“直行信號(hào)”設(shè)成3問(wèn)題也不大save_dir下按標(biāo)簽自動(dòng)建子目錄后面做數(shù)據(jù)集劃分時(shí)直接按目錄操作start_frame和end_frame在做標(biāo)注表時(shí)按視頻幀號(hào)填千萬(wàn)不要填時(shí)間秒數(shù)OpenCV的read()是按幀走不按時(shí)間走。標(biāo)注表CSV用Excel就能做三列就夠了start_frame,end_frame,label。如果視頻太長(zhǎng)不好人工數(shù)幀號(hào)可以先用OpenCV把視頻逐幀預(yù)覽找到動(dòng)作開(kāi)始幀和結(jié)束幀的幀號(hào)再填表。這個(gè)過(guò)程很枯燥但值得耐心做因?yàn)闃?biāo)簽邊界錯(cuò)10幀切出來(lái)的圖里就有大量“半動(dòng)作”樣本后面訓(xùn)練出來(lái)的模型會(huì)在動(dòng)作過(guò)渡處反復(fù)誤判。2.3 關(guān)鍵點(diǎn)標(biāo)注Labelme標(biāo)注后轉(zhuǎn)成YOLO-pose格式有了單幀圖片后下一步是標(biāo)注人的骨架關(guān)鍵點(diǎn)。這里我建議直接用Labelme做多邊形/點(diǎn)標(biāo)注把交警的上半身關(guān)鍵點(diǎn)標(biāo)出來(lái)。標(biāo)注點(diǎn)數(shù)的選擇有講究做手勢(shì)識(shí)別時(shí)雙腿和腳踝基本用不上交警手勢(shì)的動(dòng)作語(yǔ)義集中在大臂、小臂、肩膀和頭部所以標(biāo)13個(gè)點(diǎn)或17個(gè)點(diǎn)都可以。我習(xí)慣用17個(gè)點(diǎn)順序?qū)RCOCO格式這樣后面能直接套用YOLOv8-pose的預(yù)訓(xùn)練權(quán)重不用改網(wǎng)絡(luò)輸出頭。Labelme導(dǎo)出的JSON格式里shapes數(shù)組每一項(xiàng)記錄一個(gè)關(guān)鍵點(diǎn)的label和points坐標(biāo)。轉(zhuǎn)換到Y(jié)OLO-pose格式時(shí)需要把每個(gè)點(diǎn)的像素坐標(biāo)除以圖片寬高歸一化并且把所有點(diǎn)寫在一行里行首是類別編號(hào)。import json import glob import os def labelme_to_yolo_pose(labelme_dir, out_txt_dir): 把Labelme標(biāo)注的JSON轉(zhuǎn)成YOLO-pose需要的txt格式 關(guān)鍵點(diǎn)順序保持COCO 17點(diǎn)順序, 類別編號(hào)0代表person os.makedirs(out_txt_dir, exist_okTrue) for json_path in glob.glob(os.path.join(labelme_dir, *.json)): with open(json_path, r, encodingutf-8) as f: data json.load(f) img_w data[imageWidth] img_h data[imageHeight] shapes data[shapes] if not shapes: continue points shapes[0][points] # shapes[0]是person norm_points [] for x, y in points: norm_x round(x / img_w, 6) norm_y round(y / img_h, 6) norm_points.append(str(norm_x)) norm_points.append(str(norm_y)) out_name os.path.basename(json_path).replace(.json, .txt) out_path os.path.join(out_txt_dir, out_name) with open(out_path, w, encodingutf-8) as f: f.write(0 .join(norm_points) \n)轉(zhuǎn)換腳本里最容易被忽略的就是坐標(biāo)歸一化。YOLO訓(xùn)練時(shí)會(huì)把圖片自動(dòng)縮放到imgsz指定的尺寸如果標(biāo)注坐標(biāo)還是原始像素值而非歸一化值縮放后關(guān)鍵點(diǎn)位置全錯(cuò)模型根本收斂不了。另外Labelme里points的坐標(biāo)順序要和COCO約定一致比如第0個(gè)點(diǎn)是鼻子、第1個(gè)點(diǎn)是左眼、第2個(gè)點(diǎn)是右眼。如果標(biāo)注時(shí)點(diǎn)亂了訓(xùn)練出來(lái)的模型關(guān)鍵點(diǎn)全是錯(cuò)位的這個(gè)錯(cuò)誤在圖上肉眼都看不出來(lái)只能靠畫(huà)關(guān)鍵點(diǎn)連線檢查。3. 關(guān)鍵點(diǎn)提取與訓(xùn)練用YOLOv8-pose跑通骨架識(shí)別3.1 三個(gè)主流方案對(duì)比YOLOv8-pose、MediaPipe、OpenPose怎么選關(guān)鍵點(diǎn)提取是這個(gè)項(xiàng)目的地基選型直接決定了后面時(shí)序分類的輸入質(zhì)量。目前做姿態(tài)估計(jì)有三個(gè)常用選擇MediaPipe、OpenPose、YOLOv8-pose。很多人在網(wǎng)上搜“mediapipe手勢(shì)識(shí)別”教程拿MediaPipe直接跑確實(shí)開(kāi)箱即用但它的33個(gè)手部關(guān)鍵點(diǎn)做的是“手指級(jí)”識(shí)別交警手勢(shì)需要的是“整條手臂和軀干”的骨架信息MediaPipe的人體姿態(tài)模式只有上半身貼合度還不錯(cuò)一旦動(dòng)作幅度大比如左轉(zhuǎn)彎信號(hào)手臂完全伸展關(guān)鍵點(diǎn)會(huì)抖動(dòng)得很厲害。OpenPose是老牌方案但配置環(huán)境比較痛苦CPU推理幀率只有個(gè)位數(shù)答辯現(xiàn)場(chǎng)的電腦不一定扛得住。我最后的選型是YOLOv8-pose原因有三檢測(cè)和姿態(tài)估計(jì)在同一個(gè)模型里完成不需要先跑一個(gè)行人檢測(cè)器再跑姿態(tài)模型訓(xùn)練和推理接口統(tǒng)一換數(shù)據(jù)集只需改一個(gè)YAML文件平時(shí)大家搜“yolov8訓(xùn)練自己的數(shù)據(jù)集”時(shí)找到的部署資料也最多出了問(wèn)題好查。3.2 基于YOLOv8-pose訓(xùn)練自己的關(guān)鍵點(diǎn)模型YAML和數(shù)據(jù)準(zhǔn)備訓(xùn)練前要把數(shù)據(jù)集整理成YOLO格式的目錄結(jié)構(gòu)images/train放訓(xùn)練圖片images/val放驗(yàn)證圖片labels/train和labels/val放對(duì)應(yīng)的txt標(biāo)注文件。建議按8:2劃分每一類的圖片都要均勻分到兩邊不能按整個(gè)文件夾亂切。模型配置文件是我調(diào)試時(shí)改動(dòng)最多的地方核心是kpt_shape和names# hand_pose.yaml path: ./dataset train: images/train val: images/val # COCO 17點(diǎn), 每點(diǎn)包含(x, y, visible) kpt_shape: [17, 3] names: 0: person這里有個(gè)坑很多人會(huì)把[17, 2]當(dāng)成默認(rèn)配置但如果你的標(biāo)注txt里只有歸一化坐標(biāo)沒(méi)有visible標(biāo)志訓(xùn)練時(shí)不報(bào)錯(cuò)模型輸出的keypoints.data最后一維變成2后面提取關(guān)鍵點(diǎn)坐標(biāo)的代碼就要改。我建議標(biāo)注時(shí)統(tǒng)一寫17點(diǎn)沒(méi)有的點(diǎn)用0或-1占位換到推理階段再按置信度過(guò)濾。訓(xùn)練命令用Ultralytics的標(biāo)準(zhǔn)入口參數(shù)對(duì)新手友好yolo pose train \ datahand_pose.yaml \ modelyolov8n-pose.pt \ epochs120 \ imgsz640 \ batch16 \ device0幾個(gè)參數(shù)值得解釋一下。modelyolov8n-pose.pt是預(yù)訓(xùn)練權(quán)重它會(huì)把你標(biāo)注的17點(diǎn)和COCO的17點(diǎn)對(duì)應(yīng)起來(lái)千萬(wàn)不要用yolov8n.pt檢測(cè)權(quán)重或者yolov8n-cls.pt分類權(quán)重它們沒(méi)有姿態(tài)輸出頭。imgsz640是訓(xùn)練分辨率交警手勢(shì)視頻里人通常占畫(huà)面比例不大直接降到640會(huì)丟細(xì)節(jié)如果顯存夠可以上imgsz896我實(shí)測(cè)能提升5到8個(gè)點(diǎn)的AP。batch16在6G顯存以下要降到8否則會(huì)OOM。訓(xùn)練完成后看兩個(gè)指標(biāo)keypoints P和keypoints mAP。P到0.9以上、mAP50到0.85以上基本夠用。如果P一直卡在0.7上不去回頭查標(biāo)注大概率是有幾張圖的點(diǎn)順序錯(cuò)了。3.3 推理階段的關(guān)鍵點(diǎn)預(yù)處理歸一化、置信度過(guò)濾與可視點(diǎn)判斷訓(xùn)練完模型進(jìn)入推理階段。推理不只是把模型跑的keypoints拿過(guò)來(lái)用還要做兩步預(yù)處理過(guò)濾低置信度點(diǎn)然后把坐標(biāo)從像素值轉(zhuǎn)成相對(duì)位置特征。這一步做得不好后面LSTM學(xué)到的就是“某個(gè)像素位置的手勢(shì)”換個(gè)人站遠(yuǎn)一點(diǎn)全廢。from ultralytics import YOLO import numpy as np model YOLO(runs/pose/train/weights/best.pt) def extract_keypoints(frame, conf_threshold0.5): 從單幀提取17個(gè)關(guān)鍵點(diǎn)坐標(biāo) 返回: (17, 3) 每行是(x, y, visible) results model(frame, verboseFalse) if not results or results[0].keypoints is None: return None kpts results[0].keypoints.data[0].cpu().numpy() # (17, 3) # 低置信度點(diǎn)直接置為不可見(jiàn), 坐標(biāo)置0, 避免把噪聲喂給LSTM visible kpts[:, 2] kpts[visible conf_threshold, 0] 0 kpts[visible conf_threshold, 1] 0 kpts[visible conf_threshold, 2] 0 # 至少要有6個(gè)可見(jiàn)點(diǎn), 否則認(rèn)為這一幀沒(méi)有有效的人 if (kpts[:, 2] 0).sum() 6: return None return kpts關(guān)鍵點(diǎn)歸一化的方式是整個(gè)預(yù)處理里最影響效果的一步。常見(jiàn)做法是選兩個(gè)穩(wěn)定點(diǎn)做基準(zhǔn)——我一般用左肩和右肩的中心點(diǎn)作為原點(diǎn)再除以肩寬這樣能把不同身高、不同畫(huà)面距離的人拉到同一個(gè)坐標(biāo)系里。注意不要用圖片寬度做歸一化因?yàn)槿苏窘具h(yuǎn)會(huì)直接影響坐標(biāo)尺度LSTM學(xué)出來(lái)的特征就不穩(wěn)定。手肘和手腕的坐標(biāo)要根據(jù)肩膀中心做平移而不是直接減圖像中心點(diǎn)。4. 從關(guān)鍵點(diǎn)序列到指揮動(dòng)作LSTM與滑窗投票的時(shí)序分類4.1 手勢(shì)是時(shí)序動(dòng)作為什么逐幀分類不可行拿單幀關(guān)鍵點(diǎn)直接分類十個(gè)里有九個(gè)會(huì)在“停止信號(hào)”和“左轉(zhuǎn)彎待轉(zhuǎn)信號(hào)”之間反復(fù)橫跳。原因很簡(jiǎn)單這兩個(gè)手勢(shì)在某個(gè)瞬間的骨架形態(tài)幾乎一樣區(qū)別在于手臂是從“舉起到放下”還是“保持不動(dòng)”。也就是說(shuō)交警手勢(shì)的語(yǔ)義信息藏在“動(dòng)作過(guò)程”里不在“某一幀的快照”里。所以這個(gè)項(xiàng)目的第二層模型要處理序列數(shù)據(jù)。一段手勢(shì)從開(kāi)始到結(jié)束通常持續(xù)0.5到2秒在30fps的攝像頭下就是15到60幀。我采用的方案是固定30幀的滑窗每30幀關(guān)鍵點(diǎn)序列作為一條輸入模型判斷這30幀對(duì)應(yīng)哪個(gè)手勢(shì)。選LSTM而不是Transformer不是LSTM更好而是這個(gè)任務(wù)數(shù)據(jù)量只有幾千條序列LSTM更容易收斂訓(xùn)練時(shí)間短答辯現(xiàn)場(chǎng)改參數(shù)重訓(xùn)也來(lái)得及。你要是用Transformer序列長(zhǎng)度短根本發(fā)揮不出注意力優(yōu)勢(shì)還容易過(guò)擬合。4.2 34維輸入、8類輸出一個(gè)能跑通的LSTM模型輸入維度17個(gè)關(guān)鍵點(diǎn)×2維坐標(biāo)x和y共34維輸出8類手勢(shì)。我把網(wǎng)絡(luò)定義和訓(xùn)練循環(huán)寫在一起方便直接復(fù)用import torch import torch.nn as nn class GestureClassifier(nn.Module): 輸入 (batch, seq_len30, input_dim34), 輸出8類手勢(shì) def __init__(self, input_dim34, hidden_dim128, num_layers2, num_classes8): super().__init__() self.lstm nn.LSTM( input_dim, hidden_dim, num_layers, batch_firstTrue, dropout0.3 ) self.head nn.Sequential( nn.Linear(hidden_dim, 64), nn.ReLU(), nn.Dropout(0.5), nn.Linear(64, num_classes) ) def forward(self, x): out, _ self.lstm(x) last_hidden out[:, -1, :] # 取最后一個(gè)時(shí)間步 return self.head(last_hidden)這個(gè)模型有兩個(gè)參數(shù)直接影響效果。hidden_dim128對(duì)8類手勢(shì)足夠加到256收益很小但訓(xùn)練時(shí)間翻倍。num_layers2是平衡點(diǎn)1層學(xué)不到復(fù)雜時(shí)序關(guān)系3層在這個(gè)數(shù)據(jù)量下容易過(guò)擬合。注意nn.LSTM里的dropout0.3只在層數(shù)大于1時(shí)生效所以至少用2層。訓(xùn)練循環(huán)用交叉熵?fù)p失加Adam優(yōu)化器學(xué)習(xí)率調(diào)度用StepLR# train_loader返回 (batch, 30, 34) 的關(guān)鍵點(diǎn)序列和對(duì)應(yīng)標(biāo)簽 optimizer torch.optim.Adam(model.parameters(), lr1e-3) criterion nn.CrossEntropyLoss() scheduler torch.optim.lr_scheduler.StepLR(optimizer, step_size30, gamma0.5) for epoch in range(80): model.train() total_loss 0 for seqs, labels in train_loader: optimizer.zero_grad() logits model(seqs) loss criterion(logits, labels) loss.backward() optimizer.step() total_loss loss.item() scheduler.step() print(fepoch {epoch:03d} loss {total_loss / len(train_loader):.4f})step_size30, gamma0.5的意思是每30個(gè)epoch學(xué)習(xí)率減半我試過(guò)不調(diào)學(xué)習(xí)率訓(xùn)練后期loss會(huì)上下波動(dòng)。如果數(shù)據(jù)量少于2000條序列建議把epochs降到50防止過(guò)擬合。4.3 滑窗投票與置信度閾值不讓識(shí)別結(jié)果來(lái)回跳LSTM輸出的分類概率在單幀級(jí)別是不穩(wěn)定的連續(xù)幾幀可能一會(huì)兒判斷成“停止信號(hào)”一會(huì)兒又跳成“變道信號(hào)”。這是因?yàn)橄噜彆r(shí)間窗的內(nèi)容幾乎一樣模型在邊界處搖擺。解決辦法是加一個(gè)投票器把過(guò)去15次預(yù)測(cè)結(jié)果放在一個(gè)隊(duì)列里少數(shù)服從多數(shù)并且要求得票率超過(guò)60%才輸出。from collections import Counter class GestureVoter: def __init__(self, window_size15, min_ratio0.6): self.window_size window_size self.min_ratio min_ratio self.history [] def update(self, gesture_id): self.history.append(gesture_id) if len(self.history) self.window_size: self.history.pop(0) def get_vote(self): if len(self.history) self.window_size // 2: return None counter Counter(self.history) best_id, count counter.most_common(1)[0] if count / len(self.history) self.min_ratio: return None return best_idwindow_size15在30fps下代表0.5秒的投票窗口這個(gè)長(zhǎng)度對(duì)手勢(shì)識(shí)別剛剛好太短濾不掉抖動(dòng)太長(zhǎng)會(huì)讓動(dòng)作切換的響應(yīng)慢半拍。min_ratio0.6是經(jīng)驗(yàn)值想更穩(wěn)定就調(diào)到0.7但動(dòng)作切換時(shí)的延遲會(huì)明顯增加。實(shí)際使用中我還會(huì)在投票器前面加一道置信度門檻只有LSTM輸出的最大概率超過(guò)0.4才進(jìn)投票隊(duì)列否則直接丟棄這一幀能濾掉很多背景噪聲造成的誤判。5. 避坑與常見(jiàn)問(wèn)題5個(gè)讓新手翻車的典型坑5.1 訓(xùn)練loss不降精度停留在20%上下現(xiàn)象LSTM訓(xùn)練跑了幾十個(gè)epochloss穩(wěn)定在2.0左右不下降準(zhǔn)確率跟隨機(jī)猜差不多。原因最常見(jiàn)的是關(guān)鍵點(diǎn)序列沒(méi)有歸一化。像素坐標(biāo)直接喂給LSTM模型要去擬合“這個(gè)人站在畫(huà)面左邊還是右邊”這種無(wú)關(guān)信息。其次是把不可見(jiàn)點(diǎn)的坐標(biāo)填了0但可見(jiàn)點(diǎn)坐標(biāo)是幾百的像素值0和幾百之間的數(shù)值差距讓梯度更新失衡。解決把關(guān)鍵點(diǎn)坐標(biāo)以肩部中心為原點(diǎn)做平移并除以肩寬。不可見(jiàn)點(diǎn)全部置0同時(shí)把可見(jiàn)點(diǎn)的x、y都做同樣的平移和縮放變換。做好這一步loss通常在10個(gè)epoch內(nèi)就能降到1以下。5.2 左右手鏡像反轉(zhuǎn)識(shí)別結(jié)果跟實(shí)際動(dòng)作左右互換現(xiàn)象訓(xùn)練集和測(cè)試集都是正面拍的準(zhǔn)確率很高一到答辯現(xiàn)場(chǎng)用攝像頭實(shí)時(shí)演示左手動(dòng)作被識(shí)別成右手動(dòng)作。原因手機(jī)前置攝像頭拍出來(lái)的畫(huà)面是鏡像的后置攝像頭和電腦攝像頭不是。如果你采集數(shù)據(jù)時(shí)用的是手機(jī)前置錄像推理時(shí)用的是電腦攝像頭左右手天然是反的。這是個(gè)很隱蔽的坑因?yàn)槿搜劭床怀霾町惸P蛯?duì)左右手非常敏感。解決訓(xùn)練和推理統(tǒng)一攝像頭類型。如果確實(shí)無(wú)法統(tǒng)一就在預(yù)處理階段做一次水平翻轉(zhuǎn)用cv2.flip(frame, 1)把畫(huà)面鏡像回來(lái)再做關(guān)鍵點(diǎn)提取。注意翻轉(zhuǎn)后關(guān)鍵點(diǎn)的左右標(biāo)簽也要交換否則語(yǔ)義就亂了。5.3 顯存溢出或內(nèi)存持續(xù)上漲現(xiàn)象訓(xùn)練時(shí)CUDA out of memory或者推理時(shí)程序跑幾分鐘后內(nèi)存占用一路飆升直到卡死。原因顯存溢出通常是batch太大或者imgsz太高但我見(jiàn)過(guò)最奇葩的原因是有人在推理循環(huán)里不斷調(diào)用模型而不釋放中間變量。內(nèi)存持續(xù)上漲多是被視頻幀引用沒(méi)釋放cap.read()讀的frame如果沒(méi)有被后續(xù)處理替換舊幀一直留在內(nèi)存里。解決訓(xùn)練時(shí)6G顯存用batch8, imgsz64012G顯存可以batch16, imgsz896。推理時(shí)把extract_keypoints里模型推理的結(jié)果及時(shí)轉(zhuǎn)成numpy數(shù)組然后用del和gc.collect()清掉不再用的中間量。視頻循環(huán)里每處理完一幀就把frame重新賦值不要保留引用。5.4 測(cè)試集準(zhǔn)確率95%現(xiàn)場(chǎng)一換環(huán)境就全亂現(xiàn)象自己錄的數(shù)據(jù)測(cè)出來(lái)接近滿分換個(gè)教室、換個(gè)攝像頭角度識(shí)別準(zhǔn)確率掉到50%以下甚至某個(gè)手勢(shì)永遠(yuǎn)識(shí)別不出來(lái)。原因這是數(shù)據(jù)集單一視角、單一背景導(dǎo)致的過(guò)擬合。我見(jiàn)過(guò)最快的翻車方式是訓(xùn)練數(shù)據(jù)全是在同一面白墻前錄的模型表面在學(xué)手勢(shì)實(shí)際在學(xué)“白墻固定機(jī)位下的人形輪廓”。換到實(shí)驗(yàn)室各種雜物背景、不同距離下骨架提取本身沒(méi)問(wèn)題但LSTM學(xué)到的關(guān)鍵點(diǎn)相對(duì)位置分布和現(xiàn)場(chǎng)不一樣。解決采集數(shù)據(jù)時(shí)至少覆蓋三個(gè)距離近、中、遠(yuǎn)、兩種背景、兩種光照。如果來(lái)不及補(bǔ)數(shù)據(jù)可以做數(shù)據(jù)增強(qiáng)對(duì)關(guān)鍵點(diǎn)序列加高斯噪聲、隨機(jī)縮放、隨機(jī)偏移模擬不同距離和畫(huà)面抖動(dòng)。注意不要在序列維度上做時(shí)間反轉(zhuǎn)那會(huì)讓手勢(shì)語(yǔ)義顛倒。5.5 答辯演示時(shí)環(huán)境崩潰模型加載失敗現(xiàn)象在本地跑得好好的代碼拿到答辯用的電腦上要么導(dǎo)入包報(bào)錯(cuò)要么模型權(quán)重路徑找不到要么攝像頭打不開(kāi)。原因把項(xiàng)目從一臺(tái)機(jī)器搬到另一臺(tái)機(jī)器最常出問(wèn)題的是相對(duì)路徑缺失和Python環(huán)境不一致。很多人把權(quán)重文件放在runs/pose/train/weights/這種嵌套目錄里一旦復(fù)制項(xiàng)目時(shí)漏掉一層代碼就找不到文件。另外答辯機(jī)器沒(méi)裝GPU版本的PyTorch或者裝的是另一個(gè)Python版本導(dǎo)入torch直接報(bào)錯(cuò)。解決交付前把項(xiàng)目做成“一個(gè)文件夾拖走就能跑”的形態(tài)權(quán)重文件和代碼放同一級(jí)目錄代碼里用os.path.join(os.path.dirname(__file__), best.pt)定位。用Anaconda導(dǎo)出一個(gè)environment.yaml答辯前先在一臺(tái)干凈電腦上按這個(gè)文件重建環(huán)境跑一遍demo把缺失的包補(bǔ)齊再帶去現(xiàn)場(chǎng)。6. 把模型包裝成可演示的桌面工具攝像頭實(shí)時(shí)識(shí)別與準(zhǔn)確率驗(yàn)證6.1 PyQt5實(shí)時(shí)識(shí)別界面從攝像頭取流到輸出八種手勢(shì)模型訓(xùn)練好了最后一步是封裝成能現(xiàn)場(chǎng)演示的工具。我習(xí)慣用PyQt5做界面邏輯簡(jiǎn)單清晰OpenCV負(fù)責(zé)取流YOLO模型抽骨架LSTM分類結(jié)果用標(biāo)簽控件顯示比寫終端版demo的觀感好很多。import cv2 import torch import numpy as np from PyQt5 import QtWidgets, QtGui # 初始化模型 keypoint_model YOLO(best_pose.pt) gesture_model GestureClassifier() gesture_model.load_state_dict(torch.load(gesture_lstm.pth, map_locationcpu)) gesture_model.eval() voter GestureVoter() seq_buffer [] def process_frame(frame): kpts extract_keypoints(frame) if kpts is not None: seq_buffer.append(normalize_keypoints(kpts).flatten()) else: seq_buffer.append(np.zeros(34, dtypenp.float32)) if len(seq_buffer) 30: seq_buffer.pop(0) if len(seq_buffer) 30: seq torch.tensor(np.array(seq_buffer), dtypetorch.float32).unsqueeze(0) with torch.no_grad(): probs torch.softmax(gesture_model(seq), dim1) gesture_id int(torch.argmax(probs[0])) conf float(torch.max(probs[0])) if conf 0.4: voter.update(gesture_id) result voter.get_vote() if result is not None: cv2.putText(frame, CLASS_NAMES[result], (50, 50), cv2.FONT_HERSHEY_SIMPLEX, 1, (0, 255, 0), 2)這段代碼里有三個(gè)交付要點(diǎn)map_locationcpu確保目標(biāo)機(jī)器沒(méi)有GPU也能加載權(quán)重seq_buffer只保留最近30幀避免內(nèi)存膨脹投票器輸出前必須經(jīng)過(guò)conf 0.4過(guò)濾否則背景狀態(tài)下模型也會(huì)強(qiáng)行輸出一個(gè)手勢(shì)界面上會(huì)一直跳字。6.2 驗(yàn)收方法建議每個(gè)手勢(shì)錄30段測(cè)試視頻最后別急著交差先自己驗(yàn)收一輪。我建議每種手勢(shì)錄30段不同角度、不同距離的測(cè)試視頻每段2秒左右。跑一遍完整流程統(tǒng)計(jì)兩類指標(biāo)一是單段視頻內(nèi)投票器輸出的正確率二是動(dòng)作切換延遲——也就是從停止信號(hào)切到直行信號(hào)界面需要多久才跟著變。正確率90%以上、延遲不超過(guò)1秒這個(gè)項(xiàng)目拿去答辯就有底氣了。這整套流程我前后帶過(guò)幾屆學(xué)生走最大的體會(huì)是這個(gè)題目拿到一個(gè)“能跑出結(jié)果”的模型不難難的是現(xiàn)場(chǎng)演示穩(wěn)定不翻車。數(shù)據(jù)集采集和預(yù)處理階段多花的每一小時(shí)最后都會(huì)在答辯現(xiàn)場(chǎng)還給你。希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取